Kontext-Engineering-Strategien für KI-Agenten: Ein Leitfaden für Entwickler
Der Aufbau zuverlässiger KI-Agenten ist schwieriger, als es aussieht. Sie starten oft stark, aber wenn Aufgaben komplexer werden, zeigen sich Risse. Agenten verlieren häufig den Überblick über vorherige Schritte, widersprechen ihrer eigenen Argumentation oder werden von der Komplexität zu vieler Kontextinformationen überwältigt.
Diese Herausforderung hat in der gesamten Branche eine lebhafte Debatte ausgelöst. Kürzlich standen sich Anthropic (Claude) und Cognition (Devin) gegenüber, um zu klären, ob Multi-Agenten-Kollaboration oder Single-Agent-Design der bessere Weg nach vorn ist. Anthropic verwies auf Experimente, die zeigen, dass Multi-Agenten-Setups 90,2 % höhere Erfolgsraten erreichen, während Cognition entgegnete, dass einzelne Agenten mit Long-Context-Komprimierung größere Stabilität und niedrigere Kosten liefern.
Beide Seiten haben gute Argumente und diskutieren tatsächlich dasselbe Kernproblem: wie Agentenkontext effektiv verwaltet werden kann.
Stellen Sie sich LLMs als CPUs und ihre Kontextfenster als RAM vor. Doch hier gibt es einen Haken: Bei Hardware kann man immer mehr RAM hinzufügen. Bei LLMs ist die Kontextlänge jedoch konstruktionsbedingt begrenzt, und ihre weitere Erweiterung geht mit hohen Kosten in Bezug auf Geschwindigkeit und Genauigkeit einher. Agenten erzeugen unterdessen während mehrstufiger Workflows enorme Informationsmengen und stoßen schnell an diese Grenzen. Dadurch entstehen kritische Probleme:
Informationsüberlastung: Kontext überschreitet die Kapazität → Agent stürzt ab
Steigende Kosten: mehr verarbeitete Tokens bedeuten höhere Ausgaben und Latenz
Leistungsbremse: zusätzliche Informationen machen Agenten nicht intelligenter – sie machen sie langsamer und ungenauer
Deshalb ist Context Engineering zu einer zentralen Designherausforderung für Agenten der nächsten Generation geworden. Branchenführer haben bereits verschiedene Wege ausprobiert, um diese Herausforderung anzugehen, von denen viele tatsächlich sehr gut funktionieren.
In diesem Blog untersuchen wir, wie LangChain, Lossfunk und Manus das Problem aus unterschiedlichen Blickwinkeln angehen – und ergänzende Strategien dafür anbieten, Agenten sowohl leistungsfähig als auch kosteneffizient zu halten.
LangChains 4 Strategien zur Lösung von Herausforderungen beim Agentenkontext
LangChain ordnet die Herausforderungen des Agentenkontexts vier häufigen Fehlermodi zu:
Context Poisoning: irrelevante oder falsche Details schleichen sich ein und führen zu unsinnigen Ausgaben.
Context Distraction: kritische Informationen gehen im Rauschen unter.
Context Confusion: zu viele zusammenhanglose Daten lassen den Agenten den Fokus verlieren.
Context Clash: widersprüchliche Eingaben führen zu inkonsistentem Verhalten.
Um diese Herausforderungen zu bewältigen, führte LangChain ein Vier-Strategien-Framework für das Context Engineering von Agenten ein: Write, Select, Compress und Isolate.
#1 Write Context: Agenten externes Gedächtnis geben
Menschen lösen Probleme, indem sie sich Notizen machen und Wissen weitertragen. Agenten lernen, dasselbe zu tun. Ein verbreiteter Ansatz ist das „Scratchpad“, bei dem Zwischenschritte des Reasonings und Entdeckungen außerhalb des Kontextfensters gespeichert werden. Bei Code-Reviews kann ein Agent beispielsweise, statt die gesamte Codebasis erneut zu durchsuchen, Probleme und Korrekturen pro Datei protokollieren. Im Laufe der Zeit entsteht so ein persistentes, abfragbares Gedächtnis, das mit der Erfahrung wächst.
#2 Select Context: Nach Relevanz filtern
Nicht jede Information verdient Aufmerksamkeit. Das Windsurf-Team zeigte, dass das Navigieren in großen Codebasen eine Kombination aus Syntaxanalyse und Knowledge-Graph-Retrieval erfordert, damit Agenten nur die relevanten Snippets an die Oberfläche bringen, anstatt in irrelevanten Zeilen zu versinken.
#3 Compress Context: Zusammenfassung nach Bedarf
Claude Code demonstriert diesen Ansatz gut mit seiner „auto-compact“-Funktion. Wenn sich eine Unterhaltung dem Kontextlimit nähert, komprimiert das System Hunderte von Turns zu einer prägnanten Zusammenfassung, wobei aufgabenkritische Details erhalten bleiben und gleichzeitig Platz für neues Reasoning geschaffen wird.
#4 Kontext isolieren: Modulares Kontextmanagement
LangGraph wendet dieses Prinzip durch eine Multi-Agenten-Architektur an. Komplexe Aufgaben werden in Module unterteilt, wobei jeder Sub-Agent in seinem eigenen Kontextraum arbeitet. Diese Trennung verhindert Interferenzen: Ein Agent kann Alternativen untersuchen, ohne den Reasoning-Pfad eines anderen zu verunreinigen.
Weitere Details finden Sie in LangChains Blog über Context Engineering.
Lossfunks 6 praktische Tipps zum Context Engineering
Eine weitere Perspektive stammt von Lossfunk, das Kontextmanagement als eine Engineering-Disziplin betrachtet, die auf realen Deployments basiert. Ihr Ansatz betont das Ausbalancieren von drei Einschränkungen, mit denen jedes Produktionsteam konfrontiert ist: Performance, Zuverlässigkeit und Kosten. Paras Chopra, Gründer von Lossfunk, hat sechs praktische Tipps für den Aufbau effektiver LLM-Agenten mit Kontext skizziert.
#1 Kleinere Aufgaben, höhere Erfolgsquote
Komplexe Aufgaben können Agenten genauso überfordern wie Menschen. Forschung von METR zeigt, dass LLMs ihre höchsten Erfolgsquoten — etwa 90% — erreichen, wenn Aufgaben auf 10–15 Minuten Arbeit begrenzt sind. Anstatt einen Agenten zu bitten, eine gesamte Anwendung in einem Durchlauf zu refaktorieren, teilen Sie das Projekt in kleinere, atomare Schritte auf: Analysieren Sie das Authentifizierungsmodul, identifizieren Sie potenzielle Sicherheitsprobleme und schlagen Sie anschließend gezielte Korrekturen vor. Dies spiegelt wider, wie erfahrene Entwickler arbeiten: ein fokussierter Schritt nach dem anderen, wobei sich der Fortschritt inkrementell aufbaut.
Quelle: Messung der Fähigkeit von KI, lange Aufgaben zu erledigen
#2 Ganze Dateien > Fragmentierter Abruf
Im Gegensatz zu LangChains Betonung von Filterung und Kompression argumentiert Paras, dass mehr Kontext in der Regel besser ist. Seiner Ansicht nach fragmentieren RAG-Systeme Informationen häufig in kleine, unvollständige Chunks, was Agenten verwirren oder verunsichern kann. Stattdessen schlägt er vor, vollständige Dateien oder Datensätze direkt in das Kontextfenster zu laden, um dem Modell das Gesamtbild zu geben.
Lossfunk untermauert diese Perspektive mit Benchmark-Nachweisen. Auf SWE-bench-Verified erreichten Ansätze, die Full-File-Kontext verwendeten, eine Genauigkeit von etwa 95%, verglichen mit etwa 80% bei fragmentiertem Abruf. Der Unterschied ergibt sich aus der Kohärenz: Mit vollständigen Dateien sieht das Modell Beziehungen über das gesamte Dokument hinweg, anstatt zusammenhanglose Teile zusammenzufügen.
Natürlich bringt dies Kompromisse mit sich. Mehr Kontext für LLM-Agenten bereitzustellen erhöht sowohl Kosten als auch Latenz. Teams müssen die Vorteile der Vollständigkeit gegen die Kosten längerer Prompts abwägen — ein Gleichgewicht, das von der Aufgabe und den Produktionsanforderungen abhängt.
#3 Nach jeder Aufgabe einen Verifizierungsschritt hinzufügen
Fehler neigen dazu, sich über lange Reasoning-Ketten hinweg zu verstärken. Um dieses Risiko zu verringern, empfiehlt Lossfunk, jeden Schritt als zustandslose Funktion mit expliziten Erfolgs-/Fehlerprüfungen zu gestalten. Nach jedem Tool-Aufruf oder jeder Reasoning-Aktion sollte der Agent bestätigen, ob die Operation erfolgreich war, und den nächsten Schritt klar benennen.
Dieses Muster ähnelt Unit-Tests in der Softwareentwicklung: kleine Fehler früh erkennen, bevor sie sich zu größeren Ausfällen ausweiten. Durch den Einbau von Verifikation schaffen Entwickler natürliche Wiederherstellungspunkte, die Agenten in Produktions-Workflows widerstandsfähiger machen.
#4 Das Modell häufig erinnern
Modelle vergessen in langen Unterhaltungen oft frühe Anweisungen, daher ist es entscheidend, Aufgaben objectives und den aktuellen Zustand kontinuierlich zu bekräftigen. Fügen Sie regelmäßig Aufgabenzusammenfassungen und aktuelle Ziele in Ihre Prompts ein. Gehen Sie nicht davon aus, dass sich das Modell daran erinnert, was es vor 50 Austauschen tun sollte. Das ist keine Einschränkung — so funktioniert menschliche Kognition einfach. Wir nutzen externe Gedächtnishilfen wie Notizen und Erinnerungen, um bei komplexen Aufgaben auf Kurs zu bleiben.
#5 Agenten mit Lese-/Schreibwerkzeugen ausstatten, um Kontext nach Bedarf aufzubauen
Jede Information in das Kontextfenster zu quetschen, führt schnell zu Überlastung. Ein besserer Ansatz besteht darin, Agenten Lese-/Schreibwerkzeuge zu geben, damit sie Informationen bei Bedarf abrufen oder aufzeichnen können. Statt ganze Dokumentationssätze vorab zu laden, statten Sie Ihren Agenten mit Dateilesern oder Datenbank-Connectors aus und lassen Sie ihn die relevanten Details bei Bedarf abrufen.
Dies spiegelt wider, wie erfahrene Entwickler arbeiten: Sie merken sich nicht eine gesamte Codebasis, aber sie wissen, wie sie die richtige Funktion oder Datei finden, wenn Bedarf besteht. Indem Agenten um die Fähigkeit erweitert werden, externe Quellen abzufragen und zu aktualisieren, können Entwickler den Kontext schlank halten und gleichzeitig sicherstellen, dass der Agent Zugriff auf das benötigte Wissen hat.
#6 Kontext unveränderlich halten, um KV Cache zu nutzen
Jeder Gesprächsschritt mit einem sich stark ändernden Kontext kann extrem teuer werden — manchmal mehr als 100 $ pro Antwort. Um KV-Cache-Optimierungen zu nutzen, halten Sie so viel Kontext wie möglich unveränderlich. Anstatt den Kontext bei jedem Schritt zu ersetzen, hängen Sie neue Informationen an und behalten Sie über Interaktionen hinweg konsistente, strukturierte Formate bei.
Diese scheinbar kleine technische Anpassung kann überproportionale Vorteile bringen: Sie reduziert Kosten um eine Größenordnung und verbessert zugleich die Antwortzeiten. Für Produktionsbereitstellungen ist dies eine der wirkungsvollsten Low-Level-Optimierungen, die Entwickler anwenden können.
Weitere Details finden Sie in diesem Blog von Paras.
Manus: 7 Lektionen aus dem Aufbau von Agenten
Manus ist ein vollständig autonomes Multi-Agenten-KI-System, das darauf ausgelegt ist, komplexe Aufgaben mit minimaler menschlicher Anleitung zu bewältigen — von der Recherche bis zum Projektmanagement. Im Rahmen ihrer Arbeit hat das Manus-Team praktische Lektionen zum Context Engineering geteilt, die aus dem Betrieb ihres Systems in der Produktion stammen.
#1 Rund um KV-Cache für Kosteneffizienz entwerfen
Für produktionsreife Agenten ist eine der kritischsten Leistungskennzahlen die KV-Cache-Trefferquote, die direkte Auswirkungen sowohl auf Kosten als auch auf Antwortzeit hat. Eingaben für moderne Agenten werden immer länger — mit umfangreichem Kontext und detaillierten Tool-Call-Aufzeichnungen —, während Ausgaben knapp bleiben und oft Funktionsaufrufen ähneln. Diese Diskrepanz führt zu unverhältnismäßig hohen Prefill-Kosten.
Der empfohlene Ansatz besteht darin, Prompt-Präfixe stabil zu halten und cache-störende Elemente wie Zeitstempel zu vermeiden, die sich bei jeder Anfrage ändern. Verwenden Sie eine Append-only-Kontextstrategie, anstatt bestehende Inhalte neu zu schreiben, und erzwingen Sie eine deterministische Reihenfolge für die JSON-Serialisierung. Einige Modell-Frameworks erfordern außerdem, Cache-Breakpoints explizit zu markieren, um die Wiederverwendung des KV-Cache zu maximieren. Die Befolgung dieser Praktiken kann einen erheblichen Unterschied bei der Kosteneffizienz in der Produktion machen.
#2 Tool Masking statt dynamischem Laden verwenden
Wenn die Anzahl der Tools in die Hunderte steigt, einschließlich benutzerdefinierter Tools, werden Modelle anfälliger für Fehler oder dafür, während des Tool-Auswahlprozesses stecken zu bleiben. Das Problem verschärft sich, weil das dynamische Einfügen oder Entfernen von Tools den KV-Cache ungültig macht und Referenzfehler für undefinierte Tools verursacht.
Anstatt Tools zu löschen, verwenden Sie Maskierung. Token-Maskierungstechniken ermöglichen es Ihnen, aufrufbare Tool-Sets dynamisch anzupassen, ohne den Cache zu beschädigen. Verwenden Sie einheitliche Präfixe wie browser_, für einfache Gruppierung und Begrenzung, und nutzen Sie das Hermes-Format oder API-unterstütztes Function-Calling-Prefill, um den Auswahlraum zu steuern.
#3 Das Dateisystem als Kontext verwenden
Während ein 128K-Kontext ausreichend erscheint, wird er knapp, wenn große Webseiten, PDFs und andere unstrukturierte Daten auftreten. Der typische Komprimierungsansatz, Informationen frühzeitig zu verwerfen, kann dazu führen, dass zukünftige Schritte kritischen Kontext verlieren.
Manus' Ansatz ermöglicht es Agenten, Lese-/Schreiboperationen im Dateisystem zu nutzen, um Daten zu externalisieren. Löschen Sie Webseiteninhalte, aber behalten Sie URLs bei, leeren Sie Dokumente, aber bewahren Sie Dateipfade auf, damit Informationen wiederherstellbar bleiben. Dies implementiert ein „Langzeitgedächtnis“-System und legt gleichzeitig die Grundlage für zukünftige, leichtere Architekturen wie SSM.
#4 Aufmerksamkeit durch Rezitation manipulieren
Manus aktualisiert kontinuierlich todo.md , indem unvollständige Ziele am Ende des Kontexts rezitiert werden. Diese Technik vermeidet „Lost-in-the-Middle“-Probleme und verbessert die Fähigkeit des Modells, während langer Prozesse Zielkonsistenz aufrechtzuerhalten. Natürlichsprachliches „Sich-selbst-Erinnern“ hat sich als eine der effektivsten Methoden erwiesen, um Aufmerksamkeit zu erfassen und aufrechtzuerhalten.
#5 Fehlerspuren für das Lernen bewahren
Sprachmodelle erleben unweigerlich Halluzinationen, Umgebungsabstürze und Aufruffehler. Die meisten Systeme löschen gewohnheitsmäßig Fehlerspuren, versuchen es erneut oder setzen zurück, aber dies verhindert, dass Lernen stattfindet. Der richtige Ansatz bewahrt Fehleraufzeichnungen, einschließlich Stack-Traces und Beobachtungsergebnissen, und hilft Modellen, ihre Überzeugungen anzupassen und die Wiederholung identischer Fehler zu vermeiden. Die Fähigkeit zur Fehlerbehebung stellt das genaue Maß für Agentenintelligenz dar.
#6 Few-Shot-Fallen vermeiden
Few-Shot-Prompting ist eine bekannte Technik zur Verbesserung von LLM-Ausgaben, aber Manus warnt, dass sie in Agentensystemen subtile Probleme einführen kann. Da Modelle Kontextmuster natürlich nachahmen, kann das Laden zu vieler repetitiver Few-Shot-Beispiele sie in starre Verhaltensweisen einsperren. Als Manus beispielsweise Batch-Prompting verwendete, um Lebensläufe zu prüfen, begann das Modell, dieselben Aktionen mechanisch zu wiederholen, statt sich an die Besonderheiten jedes Falls anzupassen.
Die Abhilfe besteht darin, Variation und Vielfalt in die Beispiele einzuführen. Passen Sie Aktions-Beobachtungs-Vorlagen leicht an, indem Sie Formate, Reihenfolge oder Wortlaut ändern. Das Hinzufügen strukturierten „Rauschens“ verhindert, dass Agenten spröde werden, und hilft ihnen, anpassungsfähig zu bleiben. Dies erhält Flexibilität und gibt dem Modell dennoch nützliche Orientierung.
#7 Context Engineering gegenüber Fine-Tuning priorisieren
In seiner frühen Arbeit mit Modellen wie BERT verließ sich Manus stark auf Fine-Tuning — ein Prozess, der oft Wochen der Iteration dauerte und schnell ineffizient und kostspielig wurde. Basierend auf dieser Erfahrung verlagerte das Team seinen Fokus weg vom End-to-End-Training und hin zu Context Engineering als primärem Hebel zur Leistungsverbesserung.
Die Auswirkungen waren erheblich: Produktaktualisierungszyklen schrumpften von Wochen auf Stunden. Modell-Upgrades konnten nahtlos integriert werden, ohne erneutes Training oder erneute Anpassung. Manus beschreibt den Unterschied als den Bau von Produkten wie Schiffen, die den Kurs ändern können, statt wie Pfosten, die in den Meeresboden genagelt sind und sich nicht mit veränderten Bedingungen bewegen können. Context Engineering gab ihnen Flexibilität, ohne Fähigkeiten zu opfern.
Weitere Details finden Sie in diesem Manus-Blog.
Wie Vektordatenbanken Context Engineering unterstützen
Eine der größten Herausforderungen für KI-Agenten ist das Ausschöpfen des Kontextfensters. Wenn Agenten riesige externe Wissensdatenbanken, lange Gesprächsverläufe oder multimodale Daten verarbeiten müssen, wird die Fähigkeit, Informationen dynamisch zu speichern, abzurufen und wiederzuverwenden, für die Zuverlässigkeit unerlässlich.
Vektordatenbanken bieten eine praktische Lösung. Milvus zum Beispiel ist ein quelloffenes, leistungsstarkes System, das für die Verarbeitung multimodaler Daten im Milliardenmaßstab entwickelt wurde — Text, Bilder, Video und mehr. Indem diese Informationen als Vektoren dargestellt werden, ermöglicht Milvus Agenten, die relevantesten Wissensausschnitte und früheren Interaktionen sofort in ihren Schlussfolgerungsprozess einzubeziehen. Integriert in Frameworks wie LangChain oder LlamaIndex treibt Milvus retrieval-augmented generation (RAG)-Systeme an, die die Wissensbasis eines Agenten erweitern und die Genauigkeit der Inferenz verbessern. Sein Managed Service, Zilliz Cloud, bietet noch fortschrittlichere Funktionen und höhere Leistung, wie Abfragen in natürlicher Sprache, Zuverlässigkeit & Sicherheit auf Enterprise-Niveau sowie globale Verfügbarkeit über AWS, GCP und Azure hinweg.
Die Entwicklererfahrung ist ebenso wichtig. Milvus bietet ein gut dokumentiertes Python SDK, mit dem sich Vektoren mit nur wenigen Codezeilen einfach speichern und abfragen lassen. Das senkt die technische Hürde und ermöglicht Teams, schnell einen geschlossenen Kreislauf für das Kontextmanagement aufzubauen und robuste Speicherfunktionen direkt in ihre Agenten einzubetten.
from pymilvus import MilvusClient
# Create local Milvus instance
client = MilvusClient("demo.db")
# Create vector collection
client.create_collection(collection_name="knowledge_base", dimension=768)
# Batch insert vectorized data into knowledge base
client.insert(collection_name="knowledge_base", data=embedding_vectors)
# Retrieve most relevant context information
query_vector = embedding_fn.encode_queries(["What is Context Engineering?"])
results = client.search(
collection_name="knowledge_base",
data=query_vector,
limit=3,
output_fields=["text", "source"]
)
Weitere Informationen finden Sie in den folgenden Ressourcen:
Milvus + Loon: Zweckentwickelte Infrastruktur für KI-Agenten
Vektordatenbanken sind zentral für Context Engineering, aber sie sind nur ein Teil des Stacks. Agenten benötigen außerdem eine Möglichkeit, unordentliche, multimodale Daten vorgelagert zu verarbeiten und sie dann zur Laufzeit mit hoher Geschwindigkeit abzurufen. Deshalb haben wir Milvus und Loon so konzipiert, dass sie zusammenarbeiten — das eine übernimmt den Abruf, das andere bereitet Daten im großen Maßstab auf.
Milvus: Milvus ist die am weitesten verbreitete quelloffene Vektordatenbank, optimiert für Workloads im Milliardenmaßstab über Text, Bilder, Audio und Video hinweg. Sie wurde von Grund auf für die Vektorsuche entwickelt und liefert selbst in massivem Maßstab Abrufe unter 10 ms. Für Agenten bedeutet das direkt Reaktionsfähigkeit: Ob sie sich unmittelbar und zuverlässig oder langsam und fehleranfällig anfühlen, hängt von der Abrufgeschwindigkeit ab.
Loon (Demnächst verfügbar): Loon ist unser kommender cloud-nativer multimodaler Data-Lake-Service, der für multimodale Vorverarbeitung entwickelt wurde. Datensätze aus der Praxis sind unordentlich — dupliziert, inkonsistent und über verschiedene Formate verstreut. Loon nutzt verteilte Frameworks wie Ray und Daft, um diese Daten zu bereinigen, zu deduplizieren und zu clustern, bevor sie in Milvus gestreamt werden. Das Ergebnis: Agenten verschwenden keine Rechenzyklen mit Rauschen; sie nutzen vom ersten Tag an strukturierten, hochwertigen Kontext.
Cloud-native Elastizität: Beide Systeme skalieren Speicher und Rechenleistung unabhängig voneinander, sodass Teams Echtzeitbereitstellung und Offline-Analysen ausbalancieren können, während Workloads von Gigabytes auf Petabytes wachsen. Keine Überprovisionierung, keine Engpässe — nur die Elastizität, die moderne KI-Pipelines erfordern.
Zukunftssichere Grundlage: Die heutige Priorität liegt auf semantischer Suche und RAG-Pipelines; morgen werden es multimodales Reasoning und agentengesteuerte Workflows sein. Mit Milvus und Loon unterstützt derselbe Stack beides. Sie gewinnen die Flexibilität, sich weiterzuentwickeln, ohne Infrastruktur herauszureißen — und senken so Kosten, Risiken und Komplexität.
Kontext ist die eigentliche Grenze für KI-Agenten
Wie die Debatte über Single-Agent- versus Multi-Agent-Design zeigt, liegt der eigentliche Engpass heutiger KI-Agenten nicht allein in der Kreativität — sondern im Kontext. Ob LangChains Vier-Säulen-Framework, Lossfunks produktionsorientiertes Playbook oder Manus’ hart erarbeitete Erkenntnisse aus dem Aufbau vollständig autonomer Systeme: Die Branche gelangt zur gleichen Einsicht: Agenten sind erfolgreich oder scheitern daran, wie gut sie Kontext gestalten.
Die Strategien unterscheiden sich — einige betonen Schreiben und Filtern, andere plädieren für Voll-Datei-Kontext oder cache-bewusstes Design —, aber das Ziel ist dasselbe, insbesondere für produktionsreife Agenten: Agenten sowohl leistungsfähig als auch kosteneffizient halten. Und auch wenn keine einzelne Technik alles löst, bilden sie zusammen ein wachsendes Repertoire an Praktiken, das Entwickler an ihre eigenen Systeme anpassen können.
Bei Zilliz sehen wir Vektordatenbanken wie Milvus als Eckpfeiler dieses Toolkits. Indem sie Agenten skalierbares und genaueres Gedächtnis jenseits des Kontextfensters bieten, können Entwickler Context Engineering praktikabel, flexibel und produktionsreif machen. Die Zukunft von KI-Agenten wird nicht allein durch größere Modelle definiert, sondern durch intelligentere Wege, Kontext zu gestalten — und genau dort werden die echten Durchbrüche stattfinden.
Weiterlesen

Why We Built Vector Lakebase: Rethinking Unstructured Data Architecture for AI
Vector Lakebase: a unified, lake-native data foundation for AI workloads — and an answer to what happens after vector databases succeed.

Our Journey to 35K+ GitHub Stars: The Real Story of Building Milvus from Scratch
Join us in celebrating Milvus, the vector database that hit 35.5K stars on GitHub. Discover our story and how we’re making AI solutions easier for developers.

Democratizing AI: Making Vector Search Powerful and Affordable
Zilliz democratizes AI vector search with Milvus 2.6 and Zilliz Cloud for powerful, affordable scalability, cutting costs in infrastructure, operations, and development.



