DeepSeek-OCR spiegato: compressione ottica per sistemi a contesto lungo scalabili e RAG
I modelli linguistici di grandi dimensioni (LLM) hanno ancora difficoltà nell’elaborazione di contesti lunghi. Gestire testi lunghi consuma molta potenza di calcolo, aumenta la latenza e spesso riduce la qualità dell’output. Nonostante molti sforzi di ottimizzazione, i risultati sono rimasti insoddisfacenti.
Per affrontare questo problema, DeepSeek ha introdotto DeepSeek-OCR, un modello open-source che comprime i contesti lunghi utilizzando la mappatura ottica 2D. Invece di fornire testo grezzo al modello, converte pagine di testo in immagini e tratta quelle immagini come token visivi. Un’immagine può contenere tante informazioni quanto migliaia di token testuali, consentendo al modello di gestire documenti lunghi con molte meno risorse.
L’idea è al tempo stesso ingegnosa e semplice. Utilizzando rappresentazioni visive, DeepSeek-OCR mantiene un’elevata accuratezza riducendo al contempo il calcolo. Questo potrebbe rappresentare un punto di svolta, non solo per la gestione dei contesti lunghi per gli LLM, ma anche per i sistemi RAG, che da tempo fanno i conti con costi elevati e finestre di contesto limitate.
Nelle sezioni seguenti, spiegherò come funziona DeepSeek-OCR ed esplorerò come questo approccio di “compressione ottica” potrebbe plasmare la prossima generazione di LLM e sistemi RAG.
Il modo tradizionale in cui gli LLM gestiscono il testo — e i suoi limiti fondamentali
Per capire perché DeepSeek-OCR sia così importante, è utile comprendere prima come i modelli linguistici di grandi dimensioni (LLM) gestiscono tradizionalmente il testo e quali siano i loro limiti. Gli LLM non leggono parole o frasi come fanno gli esseri umani: elaborano token, ovvero piccole unità di testo, come parole, sottoparole o persino caratteri. Quando un modello riceve un input, converte il testo in una lunga sequenza di questi token. Il meccanismo di self-attention confronta quindi ogni token con ogni altro token per comprendere contesto e significato. Questo metodo funziona bene per passaggi brevi, ma diventa rapidamente inefficiente man mano che la sequenza si allunga.
Costi di calcolo quadratici
Questa inefficienza è radicata nella matematica: il costo computazionale della self-attention aumenta quadraticamente (O(n²)) con il numero di token. Se un input passa da 1.000 a 10.000 token, il numero di operazioni di attenzione aumenta di un fattore 100. Anche le GPU di fascia alta possono raggiungere limiti di memoria o timeout di inferenza quando si trovano davanti a carichi di lavoro simili.
Attenzione appiattita: perdere il focus nei contesti lunghi
Il problema non finisce qui. Man mano che le sequenze si estendono, i pesi di attenzione del modello tendono ad appiattirsi, distribuendosi in modo troppo uniforme sul testo o concentrandosi solo sull’inizio e sulla fine. Questa perdita di focus danneggia accuratezza e pertinenza, indipendentemente da quanta potenza di calcolo si utilizzi.
Inefficienza nel testo multimodale e strutturato
I token testuali risultano insufficienti anche nei compiti su documenti multimodali o strutturati, come PDF, slide o fogli di calcolo. Una volta tokenizzato il testo, il layout, le tabelle e la struttura visiva vengono persi, anche se veicolano un significato cruciale. Il testo multilingue aggiunge un ulteriore livello di complessità: ogni lingua richiede il proprio tokenizer con regole di segmentazione specifiche. E dopo tutto questo, anche la compressione basata sul testo più aggressiva raramente supera una modesta riduzione di 1–2× nel conteggio dei token, ben lontana da quanto necessario per applicazioni reali con contesti lunghi.
DeepSeek-OCR: potenziare l’elaborazione di contesti lunghi con la compressione ottica dei contesti
Come discusso in precedenza, l’approccio tradizionale basato sui token affronta tre limiti rigidi: alto costo computazionale, perdita di focus e perdita della struttura del documento nella gestione di testo multimodale. DeepSeek-OCR supera queste sfide trasformando il testo in token visivi, comprimendo molte più informazioni in un numero minore di elementi pur preservando significato e struttura.
Quindi come funziona? La chiave sta in un nuovo paradigma chiamato Contexts Optical Compression. Invece di fornire al modello lunghi flussi di token testuali, DeepSeek-OCR converte prima il testo in immagini e poi codifica quelle immagini in token visivi compatti. Questo processo affronta direttamente i due maggiori punti critici degli LLM: l’elevato costo computazionale dei contesti lunghi e la perdita della struttura del documento durante la tokenizzazione.
Ecco come funziona in tre passaggi:
Renderizzare il testo in immagini di documenti strutturati. Il testo originale—insieme a grafici, tabelle ed equazioni—viene renderizzato in immagini che preservano il layout visivo e gli indizi semantici.
Comprimere le immagini in token visivi. Un encoder visivo trasforma ogni immagine in una rappresentazione compatta, riducendo il conteggio dei token di 7–20×, e fino a 60× su benchmark come OmniDocBench.
Ricostruire il testo dai token visivi. Un decoder linguistico converte questi token visivi di nuovo in testo con un’accuratezza di riconoscimento superiore al 97%, mantenendo sia il significato sia la formattazione.
Questo approccio funziona perché le immagini dei documenti possono contenere informazioni semantiche equivalenti con un numero di token drasticamente inferiore. Allo stesso tempo, preservano intrinsecamente layout, simboli e altri elementi non testuali che la tokenizzazione ordinaria scarta. In effetti, DeepSeek-OCR aggira le limitazioni fondamentali degli LLM basati sul testo—mantenendo struttura, semantica ed efficienza tutte insieme.
Sotto il cofano, Contexts Optical Compression è alimentata da due componenti principali: un DeepEncoder, che esegue una compressione ad alto rapporto delle immagini dei documenti, e un MoE (Mixture-of-Experts) Decoder, che ricostruisce il contenuto originale dai token visivi. Insieme, consentono a DeepSeek-OCR di elaborare informazioni a contesto lungo con elevata accuratezza e notevole efficienza.
DeepEncoder: La compressione incontra la precisione
Il DeepEncoder è il nucleo dell’architettura di DeepSeek-OCR—il componente responsabile dell’estrazione delle caratteristiche visive e della loro compressione in token visivi compatti e ricchi di informazioni. Combina precisione ed efficienza attraverso un’architettura in tre parti:
SAM-base (800M parametri): Utilizza windowed attention per elaborare immagini di documenti ad alta risoluzione. Questo design cattura dettagli fini come caratteri e punteggiatura mantenendo al contempo sotto controllo la memoria di attivazione.
Compressore convoluzionale 16× (2 livelli): Riduce il numero di token immagine di un fattore 16. Per esempio, un’immagine 1024×1024 che inizialmente genera 4.096 token si riduce a soli 256—ottenendo una compressione 16× con una perdita minima di qualità.
CLIP-large (300M parametri): Applica dense global attention per mantenere la coerenza semantica nell’intero documento. Preserva relazioni come l’allineamento riga–colonna delle tabelle e la struttura delle formule, anche con una compressione aggressiva.
Il DeepEncoder supporta sei modalità di risoluzione — Tiny, Small, Base, Large, Gundam e Gundam-M — generando tra 64 e 1.853 token visivi a seconda dei requisiti del compito. Questa flessibilità consente una gestione adattiva del contesto: compressione a bassa risoluzione per contenuti più vecchi o meno importanti, e codifica ad alta risoluzione per segmenti recenti e critici.
MoE Decoder: Ricostruzione efficiente e accurata
Una volta completata la compressione, il MoE (Mixture of Experts) Decoder ricostruisce il testo in modo efficiente e accurato. DeepSeek-OCR impiega il modello DeepSeek-3B-MoE-A570M, che raggiunge l’accuratezza dei modelli di grandi dimensioni con una frazione del calcolo. Vengono attivati solo 570M parametri alla volta (selezionando 6 esperti su 64 più 2 condivisi), ottenendo un’accuratezza di elaborazione paragonabile a modelli su larga scala all’interno di un framework da 3 miliardi di parametri.
Il decoder supporta anche la mappatura non lineare dai token visivi ai token testuali, consentendo output strutturati e semanticamente ricchi. Ad esempio, può convertire grafici in tabelle HTML o tradurre formule chimiche in stringhe SMILES, garantendo che dati visivi complessi siano rappresentati fedelmente nel testo.
In termini di prestazioni, il Decoder MoE è sia veloce sia scalabile:
Elabora fino a 90 miliardi di token/giorno su dati di puro testo
Gestisce 70 miliardi di token/giorno su dataset multimodali
Raggiunge un throughput di 2.500 token al secondo su una singola GPU A100-40G
Questa combinazione di efficienza di compressione, conservazione strutturale e velocità di decodifica riduce drasticamente il costo dell’elaborazione a lungo contesto mantenendo una precisione prossima a quella dei modelli di grandi dimensioni.
Cosa ha realizzato DeepSeek-OCR e perché è importante
L’impatto di DeepSeek-OCR va ben oltre il miglioramento dell’accuratezza dell’OCR. Attraverso la compressione cross-modale, introduce una nuova base per LLM a lungo contesto, ragionamento multimodale e comprensione di documenti multilingue. Trasformando il testo in una rappresentazione visiva universale, DeepSeek-OCR sblocca tre progressi significativi che spingono oltre i limiti dell’efficienza e della versatilità dei modelli di grandi dimensioni.
1. Elaborazione end-to-end di documenti misti testo-immagine
Le pipeline tradizionali faticano con documenti che contengono grafici, formule o altri elementi visivi. In genere, si affidano a un passaggio OCR separato per convertire le immagini in testo—spesso perdendo la formattazione, rompendo la struttura o introducendo errori di riconoscimento—prima che il testo venga passato a un tokenizer per ulteriori elaborazioni.
DeepSeek-OCR elimina questo fragile passaggio intermedio. Converte direttamente contenuti misti di testo e grafica in token visivi unificati, preservando struttura e integrità visiva in un unico flusso di lavoro continuo. Ad esempio, quando analizza un report finanziario con grafici a linee incorporati, i token visivi del modello conservano le tendenze stesse. Il decoder può quindi generare output strutturati—come tabelle HTML modificabili o testo formattato—anziché stringhe piatte.
2. Maggiore universalità nell’elaborazione multilingue
I sistemi basati su token richiedono tokenizer separati per ogni lingua, ciascuno con regole di segmentazione diverse—for example, composizione dei caratteri cinesi, unità di sottoparole inglesi o connessioni della scrittura araba. Gestire questa complessità rende l’addestramento e la manutenzione dei modelli multilingue sia costosi sia soggetti a errori.
DeepSeek-OCR risolve questo problema utilizzando le immagini come rappresentazione intermedia, consentendogli di elaborare oltre 100 lingue senza distinguere tra famiglie linguistiche. Ciò abbassa la barriera alla comprensione dei documenti multilingue, consentendo a un’unica architettura di modello di gestire senza soluzione di continuità sistemi di scrittura diversi.
3. Costi inferiori e gestione del contesto più intelligente per documenti lunghi
Le soluzioni convenzionali per l’elaborazione a lungo contesto—come finestre scorrevoli o attenzione sparsa—ottimizzano l’efficienza a livello dei token testuali, ma operano comunque entro il collo di bottiglia computazionale O(n²) dell’attenzione. Al contrario, trasformando testo → immagine → token visivi, DeepSeek-OCR sostituisce il calcolo basato sul testo con un vettore visivo a complessità inferiore, riducendo il pesante carico computazionale associato alle lunghe sequenze testuali.
Questo design offre un altro vantaggio importante: la gestione adattiva del contesto. Il modello può allocare una risoluzione più elevata (più token visivi) ai contenuti recenti e ricchi di dettagli, assegnando al contempo una risoluzione più bassa (meno token visivi) alle informazioni più vecchie o meno importanti. Questo rende DeepSeek-OCR particolarmente efficace per scenari di dialogo multi-turno, analisi di documenti lunghi e generazione aumentata dal recupero (RAG), in cui memoria e precisione sono entrambe fondamentali.
Guardando avanti: come DeepSeek-OCR indica il futuro della RAG
DeepSeek-OCR offre una preziosa indicazione su dove potrebbe dirigersi la RAG in futuro. Il suo principio fondamentale—comprimere le informazioni in token visivi—richiama la logica alla base di modelli come Sentence-BERT, che trasformano il testo in embedding densi. Entrambi gli approcci condividono lo stesso obiettivo: rappresentare informazioni ricche e complesse in una forma compatta ed efficiente dal punto di vista computazionale.
Guardando al futuro, questa idea potrebbe rimodellare radicalmente la RAG multimodale. Quando elabora documenti che includono grafici, tabelle o figure, DeepSeek-OCR può saltare completamente il passaggio di decodifica e fornire i suoi token visivi compressi direttamente a un grande modello multimodale per il ragionamento o la generazione. I futuri sistemi RAG potrebbero seguire un percorso simile—evolvendo dall’attuale processo a più passaggi (ricerca per similarità degli embedding → ricostruzione del testo → input dell’LLM) verso una pipeline più snella: recupero degli embedding → input diretto dell’LLM.
Questo cambio di paradigma affronta diverse inefficienze di lunga data della RAG. I sistemi attuali tokenizzano ripetutamente il testo e rigenerano embedding per ogni query—sprecando risorse di calcolo e introducendo perdita di informazioni. Questi costi si accumulano con documenti più lunghi, in cui i meccanismi di attenzione scalano quadraticamente con il numero di token. Al contrario, se embedding o token visivi possono essere recuperati e forniti direttamente all’LLM, la perdita dovuta alla tokenizzazione viene eliminata, e il sovraccarico computazionale cala drasticamente.
Questo consente anche un flusso di lavoro offline–online più efficiente. Gli embedding possono essere generati una sola volta, archiviati in un database vettoriale come Milvus, e riutilizzati indefinitamente. Al momento della query, è necessario recuperare solo i Top-K embedding—spesso meno di 20—per fornire al modello un ancoraggio contestuale preciso.
Continua a leggere

We spent 8 years making vector databases faster. Then we stopped.
Rarely queried embeddings still need to stay searchable. See how Vector Lakebase enables on-demand vector search without always-on compute costs.

How to Build RAG with Milvus, QwQ-32B and Ollama
Hands-on tutorial on how to create a streamlined, powerful RAG pipeline that balances efficiency, accuracy, and scalability using the QwQ-32B and Milvus.

Bringing AI to Legal Tech: The Role of Vector Databases in Enhancing LLM Guardrails
Discover how vector databases enhance AI reliability in legal tech, ensuring accurate, compliant, and trustworthy AI-powered legal solutions.



