Sustain

← Zurück zu Lernen
Anleitung

5. August 2026

· 7 Min. Lesezeit

Verschachtelte KI-Agenten: warum unser Album-Chat einen eigenen Such-Agenten hat

Diagramm eines verschachtelten Agenten: der Album-Chat-Agent macht einen einzigen Tool-Aufruf an einen Grabe-Agenten, der in seinem eigenen Kontext durch Bildbeschreibungen pflügt und nur die geprüfte Fotoliste zurückgibt

Im Editor von Sustain steckt der KI-Album-Designer — ein Chat-Assistent, der Seiten anordnet, Bildunterschriften schreibt und auf Wunsch Fotos findet. Das meiste davon ist ein einziger Schritt: du fragst, er handelt. Doch hinter manchen Anfragen steckt viel Arbeit. „Füge die Fotos hinzu, auf denen Omri am Strand lacht“ ist nicht eine Aktion — das ist eine Suche, ein Durchlesen von Fotobeschreibungen, eine Ermessensentscheidung darüber, welche Aufnahmen wirklich passen, und erst dann eine Platzierung.

Wir haben vor Kurzem neu gebaut, wie der Assistent mit solchen Anfragen umgeht — mit einem Muster namens verschachtelte Agenten: ein KI-Agent ruft einen zweiten, vollwertigen KI-Agenten auf, als wäre der ein simples Werkzeug. Dieser Beitrag erklärt das Muster, warum sein größter Vorteil — kleinere Kontextfenster — mehr zählt, als es klingt, und führt durch das echte System, das wir ausgeliefert haben.

Das Problem: ein Assistent, der sich alles merkt, zahlt für alles

Ein Chat-Assistent baut auf einem Kontextfenster auf — dem laufenden Protokoll von allem, was im Gespräch gesagt und getan wurde. Bei jedem weiteren Zug wird das gesamte Fenster erneut ans Modell geschickt. Das hat eine hinterhältige Folge: alles Sperrige, das ins Gespräch gerät, wird bei jeder späteren Nachricht noch einmal bezahlt.

Die Fotosuche ist genau so ein Schwergewicht. In unserem früheren Design zog der Chat rohe Fotolisten direkt ins Gespräch: bei einem Album mit 219 Fotos bedeutete das 219 Blöcke aus Bildunterschriften, Daten, Qualitätswerten und Tags mitten im Protokoll. Wir haben einen einzigen Zug dieses Gesprächs mit Hunderttausenden Eingabe-Tokens gemessen — größtenteils Foto-Metadaten, die kein Mensch je zu Gesicht bekäme, erneut geschickt bei jeder weiteren Anfrage.

Große Kontexte sind aber nicht nur teuer. Modelle werden messbar schlechter darin, Anweisungen zu befolgen, wenn der wichtige Satz unter einem Berg von Listen begraben liegt — das „lost in the middle“-Problem. Unser Assistent brauchte kein größeres Gedächtnis. Er brauchte einen Weg, sperrige Arbeit zu erledigen, ohne sie sich zu merken.

Das Muster: ein Agent als Werkzeug

KI-Assistenten handeln über Werkzeuge — kleine Funktionen wie platziere dieses Foto oder wende dieses Thema an. Ein Werkzeug nimmt eine Eingabe, gibt ein Ergebnis zurück, und das Gespräch geht weiter. Die Einsicht hinter verschachtelten Agenten: ein Werkzeug muss keine simple Funktion sein. Ein Werkzeug kann ein ganzer weiterer Agent sein.

In Sustain hat der Album-Chat jetzt ein Werkzeug, das wir dig_photos nennen. Wenn deine Anfrage echtes Graben verlangt, reicht der Chat deine Worte — wörtlich, in welcher Sprache du sie auch geschrieben hast — an einen zweiten Agenten weiter: den Grabe-Agenten, dasselbe Suchhirn, das auch die Fotosuche in unserer iOS-App antreibt. Der Grabe-Agent läuft in seiner eigenen, privaten Schleife:

  • Suchen — kombiniert das, was tatsächlich auf jedem Bild zu sehen ist (jedes Foto wird bei der Analyse ausführlich beschrieben, sodass „Strand“ auch ein Foto findet, das nie jemand beschriftet hat), mit markierten Personen, Daten und Qualitätsfiltern. Er kann mehrfach suchen und dabei nachschärfen, während er lernt, was da ist.
  • Prüfen — liest die KI-geschriebenen Beschreibungen der Kandidaten, um die Beinahe-Treffer auszusortieren: das Strandfoto, auf dem niemand lacht.
  • Verfeinern — eingrenzen oder neu sortieren und aus Serienaufnahmen die beste behalten.
  • Abschließen — eine geordnete, geprüfte Liste zurückgeben, mit einer Zusammenfassung in einer Zeile.

All dieses Lesen und Nachfassen passiert im eigenen Wegwerf-Kontext des Grabe-Agenten. Ist er fertig, wird sein Arbeitsbereich verworfen. Das Einzige, was ins Gespräch des Album-Chats gelangt, ist die fertige Liste — ein paar hundert Tokens statt Zehntausende.

Die Kurzfassung

Ein verschachtelter Agent macht aus „kipp die ganze Bibliothek ins Gespräch und denk scharf nach“ ein „frag eine Fachkraft und hefte nur ihr Fazit ab“.

Vorteil 1: kleinere Kontextfenster (der große)

Daran hängt das ganze Muster. Das Protokoll des Chats bleibt schlank — deine Nachrichten, seine Antworten und kompakte Ergebnisse. Die schwere Lektüre bleibt im Unter-Agenten eingesperrt und wird danach weggeworfen.

Daraus folgen direkt drei Dinge:

  • Die Kosten summieren sich nicht mehr auf. Was nie ins Protokoll gerät, wird auch nie erneut geschickt. Wider Erwarten ist ein zweiter KI-Agent oft günstiger als das flache Design, denn das flache Design zahlte diese Fotolisten in jedem Zug aufs Neue.
  • Die Qualität steigt. Jeder Agent liest einen kurzen, fokussierten Prompt über seine eigene Aufgabe statt einen Mega-Prompt über alles. Der Sucher sucht besser, der Designer designt besser.
  • Lange Gespräche bleiben scharf. Eine Sitzung mit fünf Suchen baut nicht ab, weil keine dieser Suchen Rückstände im Fenster hinterlassen hat.

Vorteil 2: ein Hirn, viele Oberflächen

Weil der Grabe-Agent eine in sich geschlossene Einheit mit einem klaren Vertrag ist — Anfrage rein, geprüfte Liste raus —, richten wir mehr als eine Produktoberfläche darauf aus. Die Fotosuche auf unserem iOS-Startbildschirm und der Album-Chat im Web teilen sich jetzt dasselbe Suchhirn. Bringen wir ihm einen neuen Trick bei, lernt ihn jede Oberfläche auf einmal.

Das spiegelt ein Prinzip, das wir in ganz Sustain anwenden: eine Engine pro Aufgabe. In derselben Woche, in der wir die verschachtelte Suche ausgeliefert haben, haben wir auch das Fotos-Platzieren vereinheitlicht — „bau mein Album neu auf“ im Chat treibt jetzt exakt dieselbe Pipeline an wie der Button für die KI-Verbesserung, samt aller Parameter, statt eines Doppelgängers. Zwei Engines, die auseinanderdriften, werden sich irgendwann widersprechen; eine Engine kann das nicht.

Vorteil 3: begrenztes, vorhersagbares Verhalten

Ein verschachtelter Agent hat einen eingegrenzten Wirkungsradius. Unserer läuft höchstens eine Handvoll Denkrunden, auf einem kleinen, schnellen Modell, das zum Suchen passt, und seine Ausgabe wird geprüft, bevor ihr vertraut wird — jede zurückgegebene Foto-ID wird gegen die Fotos abgeglichen, die dir tatsächlich gehören, und wenn er vom Skript abkommt, fällt das System auf eine einfache gefilterte Suche zurück, statt deine Nachricht scheitern zu lassen.

Genau diese Eingrenzung macht das Muster auch sicher erweiterbar. Der Grabe-Agent darf intern klüger, gesprächiger oder gründlicher werden, ohne je das Album-Gespräch zu fluten — die Schnittstelle zwischen den beiden Agenten ändert sich dabei nicht.

Wann man nicht verschachteln sollte

Verschachteln ist nicht umsonst — ein Unter-Agent fügt eine Denkrunde hinzu, und das heißt einen Moment Wartezeit. Der Album-Chat nutzt deshalb eine einfache Eskalationsregel:

  • Eindeutige Abfragen bleiben flach. „Fotos aus 2023“, „Fotos von Omri“, „nicht platzierte Hochformataufnahmen“ — das sind sofortige Datenbankfilter. Sie in einen Agenten zu verpacken, würde sie nur langsamer machen.
  • Unscharfe Anfragen mit mehreren Bedingungen eskalieren. „Omri lacht am Strand“, „die besten 20 von der Rom-Reise“ — alles, was visuelle Suche plus Urteilsvermögen braucht, geht an den Grabe-Agenten.

Die Orchestrierungsebene sollte zur Komplexität der Frage passen. Eine gute Faustregel aus unserer Erfahrung: wenn ein menschlicher Assistent erst Dateien öffnen und lesen müsste, um zu antworten, dann verschachtle. Würde er einfach eine Abfrage laufen lassen, dann nicht.

Das Schaustück: eine echte Anfrage, von Anfang bis Ende

Hier ist ein tatsächlicher Austausch aus einem Reisealbum. Die Anfrage ist bewusst unhandlich — sie beschreibt eine Szene, kein Stichwort:

„finde Fotos mit Bergblick“

Ein paar Sekunden später kam die Antwort als Bilder: ein wischbarer Streifen mit den sieben passenden Fotos, jedes mit seiner Nummer. Blätter ans Ende und eines ist golden umrandet und mit neu markiert — das einzige der sieben, das noch auf keiner Seite ist, also genau das eine, mit dem du vielleicht wirklich etwas anfangen willst. Nichts zu entziffern, nichts abzugleichen.

Unter diesem Streifen hatte der Grabe-Agent seine eigene Schleife gedreht: erst das Album durchsuchen, dann die Beschreibungen der Kandidaten lesen, um die echten Bergblicke zu behalten und die Beinahe-Treffer zu verwerfen. All dieses Lesen passierte im Kontext des Unter-Agenten und wurde weggeworfen. Das Protokoll des Album-Chats bekam einen kurzen Eintrag dazu.

Dann eine zweite, engere Frage im selben Atemzug:

„und die Fotos von Leuten am Strand im Sonnenuntergang?“

Diesmal drei Treffer — wenige genug, dass jeder eine ganze Zeile bekommt: das Miniaturbild, was darauf zu sehen ist, und ein Anwenden-Button zum Platzieren. Derselbe Agent, dieselbe Suche, andere Darstellung — denn drei Ergebnisse und dreißig Ergebnisse sind nicht dieselbe Art von Antwort.

Der Unterschied, den der Agent hier macht — ein Strand im Sonnenuntergang mit Leuten darauf gegenüber einem leeren Sonnenuntergang überm Meer — steckt in keinem Tag und keinem Filter. Er entsteht daraus, dass ein zweiter Agent tatsächlich gelesen hat, was auf den Bildern ist, in einem Kontext, für den du nie wieder bezahlen musst.

Was das für dich bedeutet

All das ändert nichts daran, wie du Sustain benutzt — das ist ja gerade der Punkt. Der Assistent wird einfach flotter im Gespräch, besser bei schwierigen Suchen und auf allen Geräten identisch, weil die Arbeit an der richtigen Stelle passiert. Wenn er das nächste Mal eine Nadel-im-Heuhaufen-Anfrage in ein paar Sekunden mit einer sauberen Auswahl beantwortet, weißt du: da war ein zweiter Agent im Raum — und er ist längst wieder weg.

Häufige Fragen

Bereit zum Ausprobieren?

Probier den KI-Album-Designer aus

Wir nutzen Cookies, um die Nutzung der Seite zu analysieren und dein Erlebnis zu verbessern. Mehr erfahren