Methoden
Forschungsfragen
Der Review ist eine qualitative Literaturanalyse. Seine Hauptfrage lautet: „Wie können Fachkräfte der Sozialen Arbeit verantwortlich mit LLMs arbeiten, und welche Bias-Formen und welchen Umgang damit zeigt die Literatur?“ Fünf Unterfragen gliedern die Antwort.
| Unterfrage | Wortlaut |
|---|---|
| UF1 Nutzung | Für welche Aufgaben und Felder der Sozialen Arbeit beschreibt die Literatur den Einsatz von LLMs, und welchen Nutzen berichtet sie? |
| UF2 Bias-Formen | Welche Bias-Formen thematisiert die ausgewählte Literatur, mit welchen Schadensarten, für welche Gruppen, und welche Formen fehlen? |
| UF3 Umgang mit Bias | Wie geht die Literatur mit den benannten Bias-Formen um, auf welcher Stufe, mit welchen Techniken und mit welchem Evidenzstatus? |
| UF4 Begriffliche Fundierung | Definiert die Literatur Gender und Bias, welches Verständnis von Gender liegt ihr zugrunde, und auf welche Theorien stützt sie sich? |
| UF5 Kompetenzen | Welche Kompetenzen und organisationalen Voraussetzungen nennt die Literatur für einen verantwortlichen Einsatz, und wo greifen allgemeine Prompting-Anleitungen für die Soziale Arbeit zu kurz? |
Die Fragen wurden am 1. Oktober 2026 aus den Fragen des Förderantrags, dem Raster einer Teambesprechung und einer inhaltlichen Neufassung zusammengeführt. Der Review liefert die Evidenzbasis und keine eigenen Praxisempfehlungen. Empfehlungen der Literatur werden als Empfehlungen ihrer Quelle berichtet. Die zweite Frage des geplanten Papers ist methodisch. Sie fragt, wie sich LLMs und KI-Agenten so in einen qualitativen Literaturreview einbinden lassen, dass ihre Beiträge nachvollziehbar, die Verarbeitung erneut ausführbar und die abschließende wissenschaftliche Autorität bei den Fachexpert:innen bleibt.
Identifikation und Auswahl
Die Literatur wurde ohne Recherche in bibliographischen Datenbanken identifiziert. In der ersten Runde im Oktober 2025 erhielten vier Deep-Research-Systeme (ChatGPT, Claude, Gemini, Perplexity) denselben parametrisierten Prompt, ergänzt durch eine begrenzte manuelle Suche. Die Ergebnisse wurden in eine Zotero-Gruppenbibliothek übernommen und dort kuratiert. Die zweite Runde begann am 17. Juli 2026 mit Deep-Research-Läufen in ChatGPT, Claude, Gemini und Claude Code für das Publikationsfenster Juli 2025 bis Juni 2026. Perplexity entfiel in dieser Runde, weil der Zugang endete. Am 24. August 2026 folgte eine kontextgestützte Ergänzung in drei getrennten Codex-Agentenläufen, ab demselben Tag eine vertiefte Codex-Websuche, die nur Fassungen aus 2026 aufnahm, und am 5. September 2026 eine gezielte Nachsuche nach Lücken. In den Codex-Läufen ordneten KI-Agenten jeden Fund einer Übernahmestufe zu oder schlossen ihn als ungeeignet aus. Dubletten wurden regelbasiert über DOI, arXiv-Kennung und normalisierten Titel erkannt.
Gegenüber PRISMA 2020 (Page et al. 2021) ist dies eine erklärte Abweichung bei den Informationsquellen und der Suchstrategie (Items 6 und 7). Eine Suchstrategie existiert nur als Prompt in natürlicher Sprache, den ein Deep-Research-System in Suchanfragen übersetzt, die es nicht offenlegt. Die Suchen selbst sind deshalb nicht reproduzierbar. Berichtet werden je System das Ausführungsdatum und der Prompt oder das Laufprotokoll. Der Review berichtet Identifikation, Auswahl und Screening nach PRISMA 2020 und der vorgeschlagenen Erweiterung PRISMA-trAIce (Holst et al. 2025) für den Einsatz von KI im Reviewprozess. Die beschreibende Kartierung wird zusätzlich nach PRISMA-ScR (Tricco et al. 2018) berichtet. Eine ergänzende Suche nach Literatur zum LLM-Einsatz in Aufgaben der Sozialen Arbeit ohne Bias-Schwerpunkt findet nicht statt. Die Antwort bleibt auf das vorhandene Korpus beschränkt, und diese Grenze wird benannt.
Funde je Identifikationsquelle
| Quelle | Identifiziert | Dubletten | Nicht übernommen (Stufe B oder von KI-Agenten ausgeschlossen) | Neu übernommen |
|---|---|---|---|---|
| Runde 2, Deep Research mit vier Systemen (ab 17. Juli 2026) | 29 | 6 | 0 | 23 |
| Kontextgestützte Ergänzung (24. August 2026) | 85 | 11 | 52 | 22 |
| Codex-Websuche 2026 | 148 | 38 | 66 | 44 |
| Gezielte Nachsuche (5. September 2026) | 3 | 0 | 0 | 3 |
Die erste Runde umfasst 326 Datensätze der Zotero-Bibliothek, von denen 100 als Dubletten markiert sind. Die konsolidierte Expert:innen-Bewertung entschied über 303 Datensätze, schloss 142 ein und 161 aus. Nur ein kleiner Teil dieser Datensätze lässt sich einem einzelnen Deep-Research-System zuordnen, die Zahlen je System sind daher Untergrenzen. Die Tabelle zählt Datensätze. Dubletten innerhalb eines Laufs, zwischen den Läufen und gegenüber früheren Quellen sind zusammengefasst.
Stand je Werk
Das Flussdiagramm zählt Werke. Eine Publikation, die in mehreren Zotero-Datensätzen oder in mehreren Fassungen vorliegt, zählt einmal. Die folgende Tabelle gibt den Stand der generierten Flussdaten vom 1. Oktober 2026 wieder.
| Stand | Werke |
|---|---|
| Werke insgesamt | 361 |
| Eingeschlossen nach konsolidierter Expert:innen-Entscheidung | 138 |
| Ausgeschlossen nach konsolidierter Expert:innen-Entscheidung | 90 |
| Expert:innen-Entscheidung nicht aufgelöst | 1 |
| Einschluss nach KI-Agenten-Review, fachliche Verifikation ausstehend | 16 |
| Ausschluss nach KI-Agenten-Review, fachliche Verifikation ausstehend | 8 |
| Offen, geprüfter Volltext liegt vor | 57 |
| Offen, Volltext nicht beschafft | 44 |
| Offen, noch nicht zum Screening eingereiht | 7 |
Die Flussdaten erzeugt ein Skript im Projektbuild aus den Bibliotheks- und Bewertungsdaten. Eine eigene Ansicht des Flussdiagramms gibt es in dieser Arbeitsumgebung nicht. Den laufenden Stand je Werk zeigt der Korpus mit seinen Stufen Identifiziert, mit Text, bewertet und eingeschlossen.
Screening
Jedes Werk wird nach zehn Kategorien in zwei Gruppen bewertet. Die Definitionen stammen aus dem Kategorienschema in Version 1.4, dessen Inhalt für die Eignungsprüfung seit Version 1.2 unverändert ist.
| Kategorie | Gruppe | Definition |
|---|---|---|
| AI Literacies | Gegenstand | Das Paper behandelt Kompetenzen, Fähigkeiten oder Wissen im Umgang mit KI-Systemen. Umfasst kritische Reflexion, technisches Verständnis oder praktische Anwendungskompetenz. |
| Generative KI | Gegenstand | Fokus auf generative KI-Modelle wie Large Language Models, Bildgeneratoren oder andere generative Systeme. |
| Prompting | Gegenstand | Behandelt Prompt-Engineering, Prompt-Strategien oder die Gestaltung von Eingaben für KI-Systeme. |
| KI Sonstige | Gegenstand | Andere KI/ML-Themen wie klassisches Machine Learning, algorithmische Entscheidungssysteme, Predictive Analytics, Robotik und Computer Vision. Algorithmische Systeme im Sozialbereich, etwa Risikobewertung in der Jugendhilfe, zählen hierzu. |
| Soziale Arbeit | Perspektive | Direkter Bezug zu sozialarbeiterischer Praxis, Theorie, Ausbildung oder den Zielgruppen Sozialer Arbeit. |
| Bias & Ungleichheit | Perspektive | Thematisiert Diskriminierung, algorithmischen Bias, soziale Ungleichheit oder strukturelle Benachteiligung im KI-Kontext. |
| Gender | Perspektive | Expliziter Gender-Fokus, Geschlechterperspektive oder Analyse von Gender-Bias. |
| Diversität | Perspektive | Thematisiert Diversität, Inklusion oder Repräsentation verschiedener Gruppen. |
| Feministisch | Perspektive | Verwendet feministische Theorie, Methodik oder Perspektive. Auch implizit feministische Ansätze zählen, etwa intersektionale Analysen, die kritische Betrachtung von Machtstrukturen oder ein Fokus auf marginalisierte Gruppen aus Geschlechterperspektive. |
| Fairness | Perspektive | Thematisiert algorithmische Fairness, faire ML-Systeme oder Fairness-Metriken. |
Im Screening-Werkzeug PRISM wird jede Kategorie dreistufig mit nein, teilweise oder ja bewertet, und die Entscheidung wird abgeleitet. Ein Einschluss verlangt in jeder der beiden Gruppen mindestens eine Kategorie mit ja. Unklar ist ein Werk, das in jeder Gruppe mindestens teilweise erfüllt, ohne die Einschlussregel zu erreichen. Bleibt eine Gruppe vollständig bei nein, wird das Werk ausgeschlossen. Ausschlussgründe sind kontrolliert (Duplikat, Thema nicht einschlägig, Falscher Publikationstyp, Kein Volltext, Sprache). Eine übernommene Expert:innen-Entscheidung zum Ausschluss lässt sich ohne eigenen inhaltlichen Grund bestätigen. Jede Kategorie, die eine Person neu setzt oder verändert, braucht einen Beleg aus dem Text des Werks.
Erste Runde
In der ersten Runde liefen zwei Bewertungen getrennt nebeneinander, beide binär nach denselben zehn Kategorien. Forschende aus Sozialer Arbeit, Gender- und Diversitätsforschung und Technikforschung bewerteten die Werke in einer Tabelle. Diese konsolidierte Expert:innen-Bewertung ist für die erste Runde verbindlich, sie enthält keine Zuordnung einzelner Entscheidungen zu Personen und erlaubt deshalb keine Schätzung der Übereinstimmung zwischen Expert:innen. Unabhängig davon bewertete ein LLM (Claude Haiku 4.5) die Werke ohne Zugang zu den Expert:innen-Urteilen. Ein ergänzender Vergleich variierte die Eingabe (Titel und Abstract gegenüber dem Wissensdokument) und das Modell (Haiku 4.5 gegenüber Sonnet 4.6). Die LLM-Bewertung ist ein beratender Vergleichsbestand und begründet keinen Einschluss.
Zweite Runde
Die noch offenen Werke screenen zwei Fachexpert:innen in PRISM. Eine feste, nur erweiterbare Zuteilung verteilt die offenen Werke im Wechsel auf beide. PRISM zeigt in einer menschlichen Sitzung keine KI-Vorbewertung, weder die LLM-Bewertung der ersten Runde noch die Kodierung der KI-Agenten. Das LLM-Wissensdestillat eines Werks öffnet sich erst, wenn der eigene Datensatz gespeichert ist. Ausgangspunkt einer Bearbeitung ist der eigene gespeicherte Datensatz, sonst die konsolidierte Expert:innen-Entscheidung als vorausgefüllter Entwurf, sonst ein leerer Entwurf. Ein Datensatz, der aus der Expert:innen-Entscheidung hervorgeht, bestätigt oder korrigiert diese Entscheidung. Er gilt nicht als zweite unabhängige Bewertung und wird nicht für Übereinstimmungsanalysen gegen sie verwendet. Bearbeiten lässt sich nur in einer lokalen Kopie des Projekts.
Unabhängig davon bewerten KI-Agenten Werke mit geprüftem Volltext in zwei getrennten Spuren, und ein weiterer KI-Agent prüft beide Spuren gegen den Text. Diese Agentenbewertung bleibt ein eigener Bestand. Sie wird den Fachexpert:innen nicht angezeigt und erst nachträglich mit ihren Entscheidungen verglichen.
Analyse
Eingeschlossene Werke erhalten Analysefelder nach dem Codebuch 1.4, das seit dem 1. Oktober 2026 gilt. Die Felder ordnen sich den Unterfragen zu.
- UF1, Aufgabe der beruflichen Praxis (Pilotfeld) und adressierte Zielgruppe oder Handlungsfeld
- UF2, analysierte Bias-Achsen, nachgewiesene Schadensarten und Zielgruppen
- UF3, Prompt-Techniken, Stufe und Evidenzstatus der Bias-Minderung
- UF4, Bestimmung von Gender und von Bias, zugrunde liegendes Gender-Verständnis und Theoriebezug
- UF5, Prompting als Lerninhalt, organisationale Maßnahmen und die Kategorie AI Literacies
Die Rolle des Promptings im Werk dient UF1, UF3 und UF5. Bias-Achsen zählen nur, wenn ein Werk Bias entlang dieser Achse analysiert. Eine bloße Aufzählung geschützter Merkmale genügt nicht.
Die Analysefelder kodieren ausschließlich KI-Agenten. Zwei Spuren erhalten dieselben Kriterien und Texte in getrennten Arbeitsumgebungen und lesen die Ergebnisse der jeweils anderen nicht. Ein separat beauftragter KI-Agent vergleicht beide Spuren mit dem Text und prüft Quellenidentität, Zitattreue, Kategorienbelege und die Feldregeln. Ein Lauf hält Modell, Prompt, Codebuchversion und Quellen-Hashes fest. Die Übereinstimmung der beiden Spuren dient als Prozessdiagnose und ist keine Schätzung von Genauigkeit oder Reliabilität. Werke, die unter dem Codebuch 1.3 kodiert wurden, werden für die geänderten und die neuen Felder erneut kodiert. Ein Pilotlauf vom 1. Oktober 2026 erprobte das Codebuch an zehn Werken, ohne produktive Daten zu schreiben.
Eine menschliche Validierung der Analysefelder liegt bisher nicht vor. Das Protokoll sieht je Lauf eine Stichprobe vor, die Fachexpert:innen zuerst ohne Einsicht in die KI-Kodierung aus dem Volltext kodieren und danach mit dem KI-Ergebnis abgleichen. Diese Stichprobenprüfung steht aus.
Synthese
Die Analyse arbeitet in zwei Schichten. Die beschreibende Kartierung folgt der JBI-Methodik für Scoping Reviews (Peters et al. 2020) und stellt kodierte Werke in Evidenz- und Lückenkarten dar. Eine Zelle zählt Werke, in denen zwei Codes gemeinsam vorkommen, und behauptet keinen Zusammenhang zwischen ihnen. Ein nicht kodiertes Feld gilt nie als Lücke in der Literatur.
Die interpretierende Synthese arbeitet mit Aussagen, quellengebundenen Einzelaussagen, die auf belegte Stellen in den Destillaten der Werke verweisen. Mehrere Quellen können eine Aussage stützen, einschränken oder ihr widersprechen, und Widersprüche werden ausdrücklich festgehalten. Primäres Verfahren ist die Best-Fit-Framework-Synthese (Carroll et al. 2011, 2013) mit den Kategorien und Analysevokabularen als vorab festgelegtem Rahmen. Für konzeptuelle Fragen dient die Critical Interpretive Synthesis (Dixon-Woods et al. 2006) als interpretierende Schicht. UF5 wird als Rahmensynthese gegen die Arbeitsdefinition feministischer AI Literacies und gegen einen benannten externen Rahmen allgemeiner Prompting-Anleitungen beantwortet. Als Rahmen dient die Taxonomie von The Prompt Report (Schulhoff et al. 2024). Die Synthese vergleicht berichtete Befunde, Studienbedingungen, Widersprüche und Grenzen. Praxisempfehlungen des Projekts würden eine eigene Entscheidung und eine Bewertung der Studienqualität voraussetzen.
Prüfstufen
Jeder KI-gestützte Arbeitsschritt hat eine benannte Kontrollinstanz, und die erreichte Stufe gilt nur für das geprüfte Artefakt. Sie überträgt sich nicht automatisch auf eine abgeleitete Aussage, Abbildung oder Textstelle.
- Deterministische Validierung prüft Form und Regeln eines Datensatzes und verleiht keine inhaltliche Autorität.
- KI-quellengeprüft heißt, dass ein KI-Agent Aussage und Belege gegen die zugewiesene Quelle geprüft hat.
- Fachlich verifiziert heißt, dass eine Fachexpertin oder ein Fachexperte Belege und Interpretation bestätigt hat.
- Freigegeben heißt, dass eine berechtigte Person ein verifiziertes Artefakt für eine bestimmte Veröffentlichung freigegeben hat.
Die öffentliche Ergebnisseite zeigt nur freigegebenes Material, mit einer Ausnahme, deren Behandlung noch offen ist. Sie nennt zusammengefasste Kodierungszahlen auch über nicht freigegebene eingeschlossene Werke, ohne deren Inhalt. Seit dem 5. September 2026 ist eine vorläufige Veröffentlichung KI-quellengeprüfter Ergebnisse erlaubt, wenn ein aktueller, an Artefakt und Quelle gebundener Prüfnachweis vorliegt. Die Seite kennzeichnet solche Werke mit ◆ KI-quellengeprüft und verifizierte mit ● fachlich verifiziert. Eine KI-Quellenprüfung erscheint nie als fachliche Verifikation. Das abschließende Manuskript braucht die fachliche Verifikation und eine personengebundene Freigabe. Wie viele Werke fachlich verifiziert sind, nennt die Statuszeile der Startansicht.
Übereinstimmung von Expert:innen und LLM
Der Vergleich der ersten Runde misst die Abweichung zwischen zwei dokumentierten Bewertungen und keine Fehlerrate, weil ein Referenzstandard aus mehreren unabhängigen Expert:innen fehlt. Er dient als Begründung für die getrennte Erfassung von Mensch und Maschine und ist kein eigener Befund des Reviews.
Bei der Einschlussentscheidung schloss das LLM mehr Werke ein als die Expert:innen. Ein großer Teil dieser Abweichung geht auf Ausschlüsse wegen Dubletten, fehlenden Volltexts oder falschen Publikationstyps zurück, die ein Werk für Werk arbeitendes LLM nicht treffen kann. Ohne diese Fälle nähern sich die Einschlussraten an und die Übereinstimmung steigt. Eingaben über das Wissensdokument führten auch danach zu einer einschließenderen Bewertung.
Bei der Kategorie Gender liegt die Abweichung umgekehrt. Die Expert:innen vergaben Gender deutlich häufiger als das LLM. Eine KI-gestützte Prüfung vom 1. Oktober 2026 ordnete die 72 Datensätze, die Gender nur auf Seite der Expert:innen tragen, nach der Rolle von Gender in ihrem verfügbaren Text ein, mit wörtlichem Beleg je Datensatz und einer Nachprüfung eines Teils der Fälle am Text. In 55 davon erfüllt der Text die Definition nicht, häufig ist Gender dort nur in einer Aufzählung wie „race, gender“ genannt. Hier lasen die Expert:innen breiter als die Definition. Ein kleinerer Teil betrifft Werke, die Gender als eine von mehreren Bias-Dimensionen messen und die das LLM übersah. Ob solche Werke als Analyse von Gender-Bias gelten, lässt die Definition offen. Die Gender-Zahlen der Kategorien-Ansicht folgen der breiten Lesart der Expert:innen. Das Codebuch 1.4 kodiert Bias-Achsen dagegen nach der engen Lesart.
Primäre Kennzahlen sind die Konfusionsmatrix und die Basisraten. Cohen's Kappa dient nur als Vergleichsanker, weil es bei ungleichen Basisraten sinkt, ohne dass sich das Muster der Übereinstimmung ändert (Byrt et al. 1993). Auch die um die Prävalenz bereinigte Kennzahl bleibt für die Einschlussentscheidung schwach, die ungleichen Basisraten erklären die Abweichung also nicht allein. Die Linse Übereinstimmung der Ansicht Kategorien rechnet nur über Werke, die beide Seiten bewertet haben. Sie zeigt je Kategorie und Kategorienpaar den Anteil der Werke, denen beide Seiten die Kategorie zuwiesen, an den Werken, denen mindestens eine Seite sie zuwies, und erfasst damit Abweichungen in beide Richtungen. Werke mit abweichender Einschlussentscheidung listet der Korpus mit dem Filter „Divergenz zum LLM“.
Zur Fallbetrachtung dienen drei beschreibende Muster, die keine Richtigkeit zuweisen. Semantische Expansion bezeichnet eine Kategorie, die das LLM breiter anwendet als ihre Definition. Implizite Feldzugehörigkeit bezeichnet Fälle, in denen Expert:innen die Feldrelevanz an disziplinären Hinweisen erkennen, die der Prompt nicht sichtbar macht. Keyword-Inklusion bezeichnet eine Zuordnung aufgrund eines Stichworts ohne ausreichenden Kontext. Eine Zuordnung einzelner Werke zu diesen Mustern liegt derzeit nicht vor.
Grenzen
- Deep-Research-Systeme legen ihre Suchanfragen nicht offen. Die genau ausgeführten Prompts der ersten Runde sind verloren, die Umwandlung ihrer Ergebnisse in RIS ist nicht reproduzierbar, und für die erste Runde lag kein vorab festgelegtes Protokoll vor.
- Das Korpus ist keine Zufallsstichprobe. Weil die Identifikation auf Bias und Gender zielte, ist Literatur zum LLM-Einsatz in Aufgaben der Sozialen Arbeit ohne diesen Schwerpunkt vermutlich unterrepräsentiert, was besonders UF1 begrenzt.
- Die beiden KI-Spuren der Analysekodierung laufen in der Regel in derselben Modellumgebung, im Pilotlauf auf demselben LLM. Ihre Übereinstimmung ist deshalb kein unabhängiger Befund.
- Die Analysefelder sind bisher von keiner Fachexpertin und keinem Fachexperten validiert.
- Die Gender-Kodierung der ersten Runde folgt einer Lesart, die breiter ist als die Definition.
- Dieselbe Publikation kann als mehrere Datensätze mit voneinander abweichenden Expert:innen-Entscheidungen vorliegen. Das Flussdiagramm zählt deshalb auf Werkebene, die Zusammenführung solcher Werke ist teilweise offen.
- Ein erheblicher Teil der Literatur liegt hinter Zugangsschranken. Beschaffung, Umwandlung und Destillation verlieren auf jeder Stufe Material, und Werke ohne beschafften Volltext bleiben offen.
- Die Wissensdokumente sind LLM-Destillate ohne gemeinsame Prüfung. Das Konzeptnetz, aus dem die Kategorien-Ansicht häufige Konzepte nennt, stammt aus einer früheren LLM-Extraktion und ist ungeprüft.
Nachnutzung
Die Wissensdokumente lassen sich als Kontext für eigene Arbeit nutzen. Ein Wissensdokument ist ein LLM-Destillat eines Werks mit Metadaten, Abstract, Kernbefund, Forschungsfrage, Methodik, Hauptargumenten und Belegstellen zu den Kategorien. Es ersetzt nicht das Werk selbst und hat in der Regel keine fachliche Prüfung durchlaufen. Volltexte sind nicht Teil der Downloads.
Obsidian
Paper-Wissenssammlung herunterladen und entpacken. Die Sammlung enthält die verknüpften Wissensdokumente als Markdown und einen Datensatzindex, der jedes Dokument den Zotero-Datensätzen und der verwendeten Fassung des Werks zuordnet. Wissensdokumente noch nicht bewerteter Werke fehlen, weil sie eine LLM-Einschätzung enthalten. Sie ist eine vorläufige Arbeitssammlung.
Auswahl aus dem Korpus
Im Korpus eine Auswahl filtern und exportieren. CSV liefert eine Tabelle mit dem Stand je Werk. Markdown fasst die Wissensdokumente der Auswahl in einer Datei zusammen, jedes mit Datensatz- und Werkkennung. Vault packt die Wissensdokumente der Auswahl mit ihrem Datensatzindex als ZIP-Archiv. Beide lassen die Wissensdokumente noch nicht bewerteter Werke aus. Die Markdown-Datei lässt sich als Quelle in NotebookLM, in Claude Code oder als Kontext in einem anderen LLM verwenden.
Beispiel-Prompts:
- „Welche Werke behandeln Gender Bias in Large Language Models?“
- „Vergleiche die Methodik von Werk X und Werk Y.“
- „Fasse die Hauptargumente zum Thema Algorithmic Fairness zusammen.“
System-Prompt (Vorlage)
Du bist ein Forschungsassistent für einen Literaturreview zum verantwortlichen Einsatz von LLMs in der Sozialen Arbeit. Dir liegen Wissensdokumente vor, die ein LLM aus wissenschaftlichen Werken destilliert hat und die in der Regel nicht fachlich geprüft sind. Jedes Dokument enthält Kernbefund, Forschungsfrage, Methodik, Hauptargumente und Belegstellen. Beantworte Fragen nur auf Basis dieser Dokumente. Nenne zu jeder Aussage die Quelle mit Autor, Jahr und Werkkennung. Wenn eine Information nicht in den Dokumenten steht, sage das ausdrücklich.
Code und Daten
Code, Prompts mit Versionsgeschichte, Laufprotokolle und Forschungsdaten liegen in einem privaten Forschungsrepository des Projektteams. Volltexte bleiben dort und werden nicht veröffentlicht.