LangChain, Deep

LangChain Deep Agents: Skills-Update koppelt Werkzeuge gezielt an Fähigkeiten

Veröffentlicht am: 10.10.2026 um 04:48 Uhr | Redaktion boerse-global.de

Mehrstufige KI-Recherche verbessert Benchmark-Ergebnisse, benötigt jedoch Zeit und gezieltes Token-Management.

Deep Research: KI-Agenten verbinden Recherche, Prüfung und Berichte
Abstrakte, mehrschichtige Architektur aus Glas und Metall in einem ruhigen Raum, die Komplexität und Struktur symbolisiert. Illustration mit AI erstellt.

Die automatisierte Informationsbeschaffung vollzieht einen deutlichen Wandel hin zu strukturierten Systemen. Unter dem Begriff Deep Research etabliert sich ein mehrstufiger Agenten-Workflow, der weit über einfache Frage-Antwort-Muster hinausgeht.

Die Prozesse gliedern sich typischerweise in iterative Phasen aus Planung, gezielter Suche, Prüfung und abschließender Berichtserstellung. Mehrere spezialisierte Systeme verdeutlichen diesen Ansatz, darunter OpenAI Deep Research, SurfSence, MindSearch, morphik sowie Firesearch.

Während SurfSence nach vorliegenden Berichten mehr als 50 Dateiformate, über 100 Sprachmodelle und mehr als 6.000 Einbettungsmodelle unterstützt und aus drei Minuten Inhalt in 20 Sekunden einen Podcast erstellen kann, setzt Firesearch bei der Überprüfung von Quellen auf einen Schwellenwert mit einer Konfidenz von über 0,7. Zur Messung solcher Fähigkeiten umfasst der Benchmark DeepResearch Bench insgesamt 100 Aufgaben aus 22 Fachgebieten, aufgeteilt in jeweils 50 Aufgaben auf Chinesisch und Englisch.

Methodische Grundlagen und Architekturkonzepte

Fachberichte und systematische Übersichten gliedern die Entwicklung von Deep-Research-Systemen in drei aufeinanderfolgende Stufen: die rein agentische Suche, die integrierte Forschung und künftige Full-Stack-KI-Wissenschaftler. Im Mittelpunkt stehen vier funktionale Kernkomponenten: Anfrageplanung, Informationsbeschaffung, Gedächtnisverwaltung und Antwortgenerierung.

Zur Optimierung kommen Prompting-Verfahren, überwachtes Fine-Tuning und Reinforcement Learning zum Einsatz. Zu den zentralen Herausforderungen zählen dabei der optimale Suchzeitpunkt, die kontinuierliche Gedächtnisentwicklung, instabiles RL-Training sowie verlässliche Bewertungsmaßstäbe.

Die technische Entwicklung bewegt sich weg von isolierten ReAct-Agenten hin zur Kooperation mehrerer Agenten sowie von einfachen Ergebnisbelohnungen zu einer fein abgestuften Zuweisung von Verdienst. Bei den Trainingsdaten geht der Trend von einfachen Frage-Antwort-Sätzen zu mehrstufigen Recherche-Trajektorien.

Anzeige

Welche KI-Systeme gelten als Hochrisiko – und was müssen Unternehmen jetzt konkret tun? Die EU-KI-Verordnung stellt neue Regeln auf, die viele noch nicht kennen – dieser kostenlose Report klärt auf. Jetzt kostenloses E-Book zum EU AI Act sichern

Um Kontextgrenzen handhabbar zu machen, komprimiert das System ReSum den bisherigen Verlauf über ein separat trainiertes Zusammenfassungsmodell. Für die Datengenerierung nutzt WebDancer Web-Crawling und schrittweise komplexere Fragestellungen, während WebResearcher einen dreistufigen Prozess aus Erzeugung, iterativer Erweiterung und Validierung von Aufgaben einsetzt.

Auf architektonischer Ebene etabliert sich die Kombination modularer Bausteine: DeepAgents für die Aufgabenzerlegung, standardisierte Schnittstellen wie MCP für Werkzeugaufrufe, A2A für die Kommunikation zwischen Agenten und modulare Skills.

Praxishinweise empfehlen hierbei, Teilaufgaben auf Zeitfenster von 30 Sekunden bis 2 Minuten zu begrenzen, Kontexte auf 20 bis 30 Prozent des Ausgangsmaterials zu verdichten, Budget- und Tiefenlimits zu setzen und Fehlversuche auf maximal drei Wiederholungen zu beschränken.

Anzeige

Der EU AI Act in 5 Schritten verstehen: Fristen, Pflichten und Risikoklassen kompakt erklärt. Dieser kostenlose Download verschafft Ihnen den Überblick, den Ihre Rechts- und IT-Abteilung jetzt dringend braucht. Kompakten Umsetzungsleitfaden gratis herunterladen

Zudem stellte LangChain Deep Agents am 7. Oktober 2026 eine Überarbeitung der Skills-Unterstützung bereit, bei der Werkzeuge gezielt an Fähigkeiten gekoppelt und erst nach dem Laden bereitgestellt werden.

Entwickler können Skills vorab fixieren und Listen innerhalb laufender Ausführungen neu laden. In kollaborativen Umgebungen bindet etwa der samarbeid-Skill Agenten wie ClaudeWork oder Open Claw an bestehende Dossiers an. Ergänzend wird TaoToken als einheitlicher Modellkanal angeführt.

Effizienzpotenziale und praktische Grenzen

In Benchmark-Tests zeigen autonome Recherchewerkzeuge bereits deutliche Leistungsunterschiede: Bei Human’s Last Exam erzielte OpenAI Deep Research eine Genauigkeit von 26,6 Prozent, verglichen mit 3,3 Prozent beim Basismodell GPT-4o. Praktische Tests verdeutlichen jedoch auch den zeitlichen Aufwand.

Ein Briefing zur Speicherbranche dauerte rund 18 Minuten und identifizierte 14 Finanzierungsfälle, 5 politische Maßnahmen sowie 6 Unternehmensmeldungen. Eine SaaS-Recherche nahm etwa 11 Minuten in Anspruch, während eine historische Literaturrecherche über das Jahr 2020 hinaus über 20 Minuten benötigte und teils nicht verifizierbare Angaben enthielt, weshalb vor ungeprüften Daten gewarnt wird.

Gleichzeitig verlangt der Einsatz tiefgreifender Workflows ein genaues Token-Management. Am Beispiel von TRAE Deep Flow zeigte sich bei einem Refactoring über sechs Dateien, dass ein dauerhaft aktivierter Modus rund 18 Prozent mehr Eingabe-Token verbrauchte als eine gezielte manuelle Aktivierung.

Bei einer einfachen Aufgabe stieg der Verbrauch mit aktivem Skill von etwa 1,2k auf rund 3,8k Token, während das komplexe Refactoring mit Skill von circa 28k auf etwa 19k Token sank. Entsprechend raten Praxisberichte dazu, tiefgehende Agentenmodi gezielt für anspruchsvolle Aufgaben zu aktivieren, statt sie permanent im Hintergrund laufen zu lassen.

Disclaimer...

de | wissenschaft | 70285325 |