DeepSeek-OCR erklärt: Optische Kompression für skalierbare Long-Context- und RAG-Systeme
Large Language Models (LLMs) haben weiterhin Schwierigkeiten bei der Verarbeitung langer Kontexte. Die Verarbeitung langer Texte verbraucht viel Rechenleistung, erhöht die Latenz und verringert oft die Ausgabequalität. Trotz vieler Optimierungsbemühungen sind die Ergebnisse unbefriedigend geblieben.
Um dieses Problem anzugehen, stellte DeepSeek DeepSeek-OCR vor, ein Open-Source-Modell, das lange Kontexte mithilfe von optical 2D mapping komprimiert. Anstatt Rohtext in das Modell einzuspeisen, wandelt es Textseiten in Bilder um und behandelt diese Bilder als visuelle Tokens. Ein Bild kann so viele Informationen enthalten wie Tausende von Text-Tokens, sodass das Modell lange Dokumente mit deutlich weniger Ressourcen verarbeiten kann.
Die Idee ist sowohl clever als auch unkompliziert. Durch die Verwendung visueller Darstellungen behält DeepSeek-OCR eine hohe Genauigkeit bei und reduziert gleichzeitig den Rechenaufwand. Dies könnte ein Wendepunkt sein – nicht nur für die Verarbeitung langer Kontexte durch LLMs, sondern auch für RAG-Systeme, die lange mit hohen Kosten und begrenzten Kontextfenstern zu kämpfen hatten.
In den folgenden Abschnitten erkläre ich, wie DeepSeek-OCR funktioniert, und untersuche, wie dieser Ansatz der „optischen Kompression“ die nächste Generation von LLMs und RAG-Systemen prägen könnte.
Die traditionelle Art, wie LLMs Text verarbeiten — und ihre zentralen Einschränkungen
Um zu verstehen, warum DeepSeek-OCR so bedeutsam ist, hilft es, zunächst zu verstehen, wie Large Language Models (LLMs) traditionell Text verarbeiten und welche Einschränkungen damit verbunden sind. LLMs lesen Wörter oder Sätze nicht so, wie Menschen es tun – sie verarbeiten Tokens, also kleine Texteinheiten wie Wörter, Teilwörter oder sogar Zeichen. Wenn ein Modell eine Eingabe erhält, wandelt es den Text in eine lange Sequenz dieser Tokens um. Der Self-Attention-Mechanismus vergleicht dann jedes Token mit jedem anderen Token, um Kontext und Bedeutung zu verstehen. Diese Methode funktioniert gut für kurze Passagen, wird jedoch schnell ineffizient, wenn die Sequenz länger wird.
Quadratische Rechenkosten
Diese Ineffizienz liegt in der Mathematik begründet: Die Rechenkosten von Self-Attention steigen quadratisch (O(n²)) mit der Anzahl der Tokens. Wenn eine Eingabe von 1.000 auf 10.000 Tokens wächst, erhöht sich die Anzahl der Attention-Operationen um den Faktor 100. Selbst Spitzen-GPUs können bei solchen Arbeitslasten an Speichergrenzen stoßen oder Inferenz-Timeouts erreichen.
Abgeflachte Attention: Fokusverlust in langen Kontexten
Das Problem endet damit nicht. Wenn Sequenzen länger werden, neigen die Attention-Gewichte des Modells dazu, abzuflachen – sie verteilen sich zu gleichmäßig über den Text oder konzentrieren sich nur auf Anfang und Ende. Dieser Fokusverlust beeinträchtigt Genauigkeit und Relevanz, ganz gleich, wie viel Rechenleistung man einsetzt.
Ineffizienz bei multimodalem und strukturiertem Text
Text-Tokens stoßen auch bei multimodalen oder strukturierten Dokumentaufgaben wie PDFs, Folien oder Tabellenkalkulationen an ihre Grenzen. Sobald Text tokenisiert wird, gehen Layout, Tabellen und visuelle Struktur verloren, obwohl sie entscheidende Bedeutung tragen. Mehrsprachiger Text fügt eine weitere Komplexitätsebene hinzu: Jede Sprache benötigt ihren eigenen Tokenizer mit einzigartigen Segmentierungsregeln. Und selbst danach geht die aggressivste textbasierte Kompression selten über eine bescheidene Reduzierung der Token-Anzahl um das 1- bis 2-Fache hinaus – bei weitem nicht genug für echte Long-Context-Anwendungen.
DeepSeek-OCR: Long-Context-Verarbeitung mit optischer Kontextkompression
Wie zuvor besprochen, stößt der traditionelle tokenbasierte Ansatz auf drei harte Grenzen: hohe Rechenkosten, Fokusverlust und Verlust der Dokumentstruktur bei der Verarbeitung multimodalen Textes. DeepSeek-OCR überwindet diese Herausforderungen, indem es Text in visuelle Tokens umwandelt – und so deutlich mehr Informationen in weniger Elemente komprimiert, während Bedeutung und Struktur erhalten bleiben.
Wie funktioniert es also? Der Schlüssel liegt in einem neuen Paradigma namens Contexts Optical Compression. Anstatt lange Ströme von Text-Tokens in das Modell einzuspeisen, wandelt DeepSeek-OCR den Text zunächst in Bilder um und kodiert diese Bilder dann in kompakte visuelle Tokens. Dieser Prozess adressiert direkt die zwei größten Schwachpunkte von LLMs: die hohen Rechenkosten langer Kontexte und den Verlust der Dokumentstruktur während der Tokenisierung.
So funktioniert es in drei Schritten:
Text in strukturierte Dokumentbilder rendern. Der ursprüngliche Text—zusammen mit Diagrammen, Tabellen und Gleichungen—wird in Bilder gerendert, die das visuelle Layout und semantische Hinweise bewahren.
Bilder in visuelle Tokens komprimieren. Ein visueller Encoder wandelt jedes Bild in eine kompakte Repräsentation um, wodurch die Token-Anzahl um das 7–20-Fache reduziert wird, und auf Benchmarks wie OmniDocBench sogar um bis zu 60×.
Text aus visuellen Tokens rekonstruieren. Ein Sprach-Decoder wandelt diese visuellen Tokens mit mehr als 97% Erkennungsgenauigkeit zurück in Text um und bewahrt dabei sowohl Bedeutung als auch Formatierung.
Dieser Ansatz funktioniert, weil Dokumentbilder gleichwertige semantische Informationen mit drastisch weniger Tokens enthalten können. Gleichzeitig bewahren sie von Natur aus Layout, Symbole und andere Nicht-Text-Elemente, die bei gewöhnlicher Tokenisierung verworfen werden. Im Ergebnis umgeht DeepSeek-OCR die grundlegenden Einschränkungen textbasierter LLMs—und erhält Struktur, Semantik und Effizienz auf einmal.
Unter der Haube wird Contexts Optical Compression von zwei Kernkomponenten angetrieben: einem DeepEncoder, der eine hochgradige Kompression von Dokumentbildern durchführt, und einem MoE (Mixture-of-Experts) Decoder, der den ursprünglichen Inhalt aus den visuellen Tokens rekonstruiert. Zusammen ermöglichen sie DeepSeek-OCR, Long-Context-Informationen mit hoher Genauigkeit und bemerkenswerter Effizienz zu verarbeiten.
DeepEncoder: Kompression trifft Präzision
Der DeepEncoder ist das Herzstück der Architektur von DeepSeek-OCR—die Komponente, die für das Extrahieren visueller Merkmale und deren Komprimierung in kompakte, informationsreiche visuelle Tokens verantwortlich ist. Er kombiniert Präzision mit Effizienz durch eine dreiteilige Architektur:
SAM-base (800M Parameter): Verwendet windowed attention, um hochauflösende Dokumentbilder zu verarbeiten. Dieses Design erfasst feine Details wie Zeichen und Satzzeichen, während der Aktivierungsspeicher unter Kontrolle bleibt.
16× Convolutional Compressor (2 Schichten): Reduziert die Anzahl der Bild-Tokens um den Faktor 16. Beispielsweise schrumpft ein 1024×1024-Bild, das anfänglich 4.096 Tokens erzeugt, auf nur 256—wodurch 16× Kompression bei minimalem Qualitätsverlust erreicht wird.
CLIP-large (300M Parameter): Wendet dense global attention an, um die semantische Konsistenz über das gesamte Dokument hinweg aufrechtzuerhalten. Es bewahrt Beziehungen wie die Ausrichtung von Tabellenzeilen und -spalten sowie die Formelstruktur, selbst bei aggressiver Kompression.
Der DeepEncoder unterstützt sechs Auflösungsmodi — Tiny, Small, Base, Large, Gundam und Gundam-M — und erzeugt je nach Aufgabenanforderungen zwischen 64 und 1.853 visuellen Tokens. Diese Flexibilität ermöglicht adaptives Kontextmanagement: niedrigauflösende Kompression für ältere oder weniger wichtige Inhalte und hochauflösende Kodierung für aktuelle, kritische Segmente.
MoE Decoder: Effiziente und genaue Rekonstruktion
Sobald die Kompression abgeschlossen ist, rekonstruiert der MoE (Mixture of Experts) Decoder den Text effizient und genau. DeepSeek-OCR verwendet das DeepSeek-3B-MoE-A570M-Modell, das die Genauigkeit großer Modelle mit einem Bruchteil des Rechenaufwands erreicht. Es werden jeweils nur 570M Parameter aktiviert (durch Auswahl von 6 von 64 Experten plus 2 gemeinsamen), wodurch innerhalb eines 3-Milliarden-Parameter-Frameworks eine Verarbeitungsgenauigkeit erreicht wird, die mit großskaligen Modellen vergleichbar ist.
Der Decoder unterstützt außerdem nichtlineares Mapping von visuellen Tokens zu Text-Tokens und ermöglicht so strukturierte und semantisch reichhaltige Ausgaben. Beispielsweise kann er Diagramme in HTML-Tabellen umwandeln oder chemische Formeln in SMILES-Strings übersetzen, wodurch sichergestellt wird, dass komplexe visuelle Daten originalgetreu in Text dargestellt werden.
In Bezug auf Performance ist der MoE Decoder sowohl schnell als auch skalierbar:
Verarbeitet bis zu 90 Milliarden Tokens/Tag auf reinen Textdaten
Bewältigt 70 Milliarden Tokens/Tag auf multimodalen Datensätzen
Erreicht einen Durchsatz von 2.500 Tokens pro Sekunde auf einer einzelnen A100-40G GPU
Diese Kombination aus Kompressionseffizienz, Strukturerhaltung und Decodierungsgeschwindigkeit senkt die Kosten der Verarbeitung langer Kontexte drastisch und behält zugleich nahezu die Präzision großer Modelle bei.
Was DeepSeek-OCR erreicht hat und warum es wichtig ist
Die Wirkung von DeepSeek-OCR geht weit über die Steigerung der OCR-Genauigkeit hinaus. Durch Cross-Modal-Kompression führt es eine neue Grundlage für Long-Context-LLMs, multimodales Reasoning und mehrsprachiges Dokumentverständnis ein. Indem Text in eine universelle visuelle Repräsentation umgewandelt wird, ermöglicht DeepSeek-OCR drei bedeutende Fortschritte, die die Grenzen der Effizienz und Vielseitigkeit großer Modelle erweitern.
1. End-to-End-Verarbeitung von Dokumenten mit gemischtem Text- und Bildinhalt
Traditionelle Pipelines haben Schwierigkeiten mit Dokumenten, die Diagramme, Formeln oder andere visuelle Elemente enthalten. Typischerweise verlassen sie sich auf einen separaten OCR-Schritt, um Bilder in Text umzuwandeln—wobei oft Formatierung verloren geht, Strukturen aufgebrochen werden oder Erkennungsfehler entstehen—bevor der Text zur weiteren Verarbeitung an einen Tokenizer übergeben wird.
DeepSeek-OCR eliminiert diesen fragilen Zwischenschritt. Es wandelt gemischte Text- und Grafikinhalte direkt in vereinheitlichte visuelle Tokens um und bewahrt Struktur und visuelle Integrität in einem einzigen, kontinuierlichen Workflow. Wenn beispielsweise ein Finanzbericht mit eingebetteten Liniendiagrammen analysiert wird, behalten die visuellen Tokens des Modells die Trends selbst bei. Der Decoder kann anschließend strukturierte Ausgaben erzeugen—etwa bearbeitbare HTML-Tabellen oder formatierten Text—statt flacher Strings.
2. Größere Universalität in der mehrsprachigen Verarbeitung
Tokenbasierte Systeme benötigen separate Tokenizer für jede Sprache, die jeweils unterschiedlichen Segmentierungsregeln folgen—zum Beispiel chinesische Zeichenzusammensetzung, englische Subword-Einheiten oder arabische Schriftverbindungen. Die Verwaltung dieser Komplexität macht das Training und die Wartung mehrsprachiger Modelle sowohl teuer als auch fehleranfällig.
DeepSeek-OCR löst dies, indem es Bilder als Zwischenrepräsentation verwendet und dadurch über 100 Sprachen verarbeiten kann, ohne zwischen Sprachfamilien zu unterscheiden. Dies senkt die Hürde für mehrsprachiges Dokumentverständnis und ermöglicht es einer einzigen Modellarchitektur, unterschiedliche Schriftsysteme nahtlos zu verarbeiten.
3. Niedrigere Kosten und intelligenteres Kontextmanagement für lange Dokumente
Konventionelle Lösungen für die Verarbeitung langer Kontexte—wie Sliding Windows oder Sparse Attention—optimieren die Effizienz auf der Ebene von Text-Tokens, arbeiten jedoch weiterhin innerhalb des rechnerischen O(n²)-Flaschenhalses der Attention. Im Gegensatz dazu ersetzt DeepSeek-OCR durch die Transformation Text → Bild → visuelle Tokens textbasierte Berechnung durch einen visuellen Träger geringerer Komplexität und reduziert so die hohe Rechenlast, die mit langen Textsequenzen einhergeht.
Dieses Design bringt einen weiteren wichtigen Vorteil mit sich: adaptives Kontextmanagement. Das Modell kann neueren, detailreichen Inhalten eine höhere Auflösung (mehr visuelle Tokens) zuweisen, während älteren oder weniger wichtigen Informationen eine niedrigere Auflösung (weniger visuelle Tokens) zugeordnet wird. Dadurch ist DeepSeek-OCR besonders effektiv für Multi-Turn-Dialoge, Analyse langer Dokumente und Retrieval-Augmented Generation (RAG)-Szenarien, in denen sowohl Gedächtnis als auch Präzision entscheidend sind.
Ausblick: Wie DeepSeek-OCR auf die Zukunft von RAG hinweist
DeepSeek-OCR bietet wertvolle Einblicke darin, wohin sich RAG als Nächstes entwickeln könnte. Sein Kernprinzip – Informationen in visuelle Tokens zu komprimieren – spiegelt die Logik hinter Modellen wie Sentence-BERT wider, die Text in dichte Embeddings umwandeln. Beide Ansätze verfolgen dasselbe Ziel: reichhaltige, komplexe Informationen in einer kompakten und recheneffizienten Form darzustellen.
Mit Blick nach vorn könnte diese Idee multimodales RAG grundlegend verändern. Bei der Verarbeitung von Dokumenten, die Diagramme, Tabellen oder Abbildungen enthalten, kann DeepSeek-OCR den Dekodierungsschritt vollständig überspringen und seine komprimierten visuellen Tokens direkt in ein multimodales großes Modell für Schlussfolgerungen oder Generierung einspeisen. Zukünftige RAG-Systeme könnten einem ähnlichen Weg folgen – und sich vom heutigen mehrstufigen Prozess (Embedding-Ähnlichkeitssuche → Textrekonstruktion → LLM-Eingabe) zu einer stärker optimierten Pipeline entwickeln: Embedding-Retrieval → direkte LLM-Eingabe.
Dieser Paradigmenwechsel adressiert mehrere der seit Langem bestehenden Ineffizienzen von RAG. Aktuelle Systeme tokenisieren Text wiederholt und generieren für jede Anfrage Embeddings neu – was Rechenleistung verschwendet und Informationsverlust einführt. Diese Kosten summieren sich bei längeren Dokumenten, bei denen Attention-Mechanismen quadratisch mit der Token-Anzahl skalieren. Im Gegensatz dazu gilt: Wenn Embeddings oder visuelle Tokens direkt abgerufen und dem LLM bereitgestellt werden können, wird Tokenisierungsverlust eliminiert, und der Rechenaufwand sinkt drastisch.
Dies ermöglicht außerdem einen effizienteren Offline–Online-Workflow. Embeddings können einmal generiert, in einer Vektordatenbank wie Milvus gespeichert und unbegrenzt wiederverwendet werden. Zum Anfragezeitpunkt müssen nur die Top-K-Embeddings – oft weniger als 20 – abgerufen werden, um dem Modell eine präzise kontextuelle Grundlage zu bieten.
Weiterlesen

Introducing Zilliz CLI and Agent Skills for Zilliz Cloud
Manage your vector database from your terminal or AI coding agent. Zilliz CLI and Agent Skills work with Claude Code, Cursor, Codex, and Copilot.

Zilliz Cloud Update: Tiered Storage, Business Critical Plan, Cross-Region Backup, and Pricing Changes
This release offers a rebuilt tiered storage with lower costs, a new Business Critical plan for enhanced security, and pricing updates, among other features.

Zilliz Cloud Update: Smarter Autoscaling for Cost Savings, Stronger Compliance with Audit Logs, and More
What's new in Zilliz Cloud? Smarter autoscaling with scale-down, audit logs GA, enhanced SSO, and Milvus 2.6 in Private Preview.



