DeepSeek-OCR explicado: compresión óptica para sistemas RAG y de contexto largo escalables
Los modelos de lenguaje grandes (LLMs) aún tienen dificultades al procesar contextos largos. Manejar texto extenso consume mucha potencia de cómputo, aumenta la latencia y a menudo reduce la calidad de la salida. A pesar de muchos esfuerzos de optimización, los resultados han seguido siendo insatisfactorios.
Para abordar este problema, DeepSeek presentó DeepSeek-OCR, un modelo de código abierto que comprime contextos largos mediante mapeo óptico 2D. En lugar de introducir texto sin procesar en el modelo, convierte páginas de texto en imágenes y trata esas imágenes como tokens visuales. Una imagen puede contener tanta información como miles de tokens de texto, lo que permite al modelo manejar documentos largos con muchos menos recursos.
La idea es a la vez ingeniosa y sencilla. Al usar representaciones visuales, DeepSeek-OCR mantiene una alta precisión mientras reduce el cómputo. Esto podría ser un punto de inflexión, no solo para manejar contextos largos en los LLMs, sino también para los sistemas RAG, que durante mucho tiempo han tenido dificultades con altos costos y ventanas de contexto limitadas.
En las secciones siguientes, explicaré cómo funciona DeepSeek-OCR y exploraré cómo este enfoque de “compresión óptica” podría dar forma a la próxima generación de LLMs y sistemas RAG.
La forma tradicional en que los LLMs manejan el texto — y sus limitaciones fundamentales
Para entender por qué DeepSeek-OCR es tan importante, conviene comprender primero cómo los modelos de lenguaje grandes (LLMs) manejan tradicionalmente el texto y sus limitaciones. Los LLMs no leen palabras ni oraciones como lo hacen los humanos: procesan tokens, que son pequeñas unidades de texto, como palabras, subpalabras o incluso caracteres. Cuando un modelo recibe una entrada, convierte el texto en una larga secuencia de estos tokens. Luego, el mecanismo de autoatención compara cada token con todos los demás tokens para comprender el contexto y el significado. Este método funciona bien para pasajes cortos, pero rápidamente se vuelve ineficiente a medida que la secuencia se hace más larga.
Costos de cómputo cuadráticos
Esa ineficiencia tiene su raíz en las matemáticas: el costo computacional de la autoatención aumenta cuadráticamente (O(n²)) con el número de tokens. Si una entrada crece de 1.000 a 10.000 tokens, el número de operaciones de atención aumenta por un factor de 100. Incluso las GPUs de primer nivel pueden alcanzar límites de memoria o tiempos de espera de inferencia cuando se enfrentan a tales cargas de trabajo.
Atención aplanada: pérdida de enfoque en contextos largos
El problema no termina ahí. A medida que las secuencias se alargan, los pesos de atención del modelo tienden a aplanarse, distribuyéndose de manera demasiado uniforme por el texto o enfocándose solo en el principio y el final. Esta pérdida de enfoque perjudica la precisión y la relevancia, sin importar cuánto cómputo se le dedique.
Ineficiencia en texto multimodal y estructurado
Los tokens de texto también se quedan cortos en tareas con documentos multimodales o estructurados, como PDFs, diapositivas u hojas de cálculo. Una vez que el texto se tokeniza, se pierden el diseño, las tablas y la estructura visual, aunque transmitan un significado crucial. El texto multilingüe añade otra capa de complejidad: cada idioma requiere su propio tokenizador con reglas de segmentación únicas. Y después de todo eso, incluso la compresión basada en texto más agresiva rara vez supera una modesta reducción de 1–2× en el recuento de tokens, muy lejos de ser suficiente para aplicaciones reales de contexto largo.
DeepSeek-OCR: impulsando el procesamiento de contextos largos con compresión óptica de contextos
Como se comentó anteriormente, el enfoque tradicional basado en tokens enfrenta tres límites difíciles: alto costo computacional, pérdida de enfoque y pérdida de estructura del documento al manejar texto multimodal. DeepSeek-OCR supera estos desafíos convirtiendo el texto en tokens visuales: comprime mucha más información en menos elementos mientras preserva el significado y la estructura.
Entonces, ¿cómo funciona? La clave reside en un nuevo paradigma llamado Compresión Óptica de Contextos. En lugar de introducir largas secuencias de tokens de texto en el modelo, DeepSeek-OCR primero convierte el texto en imágenes y luego codifica esas imágenes en tokens visuales compactos. Este proceso aborda directamente los dos mayores puntos críticos de los LLM: el alto coste computacional de los contextos largos y la pérdida de la estructura del documento durante la tokenización.
Así es como funciona en tres pasos:
Renderizar texto en imágenes de documentos estructuradas. El texto original —junto con gráficos, tablas y ecuaciones— se renderiza en imágenes que preservan el diseño visual y las pistas semánticas.
Comprimir imágenes en tokens visuales. Un codificador visual transforma cada imagen en una representación compacta, reduciendo el recuento de tokens entre 7 y 20 veces, y hasta 60 veces en benchmarks como OmniDocBench.
Reconstruir texto a partir de tokens visuales. Un decodificador de lenguaje convierte estos tokens visuales de nuevo en texto con más de un 97% de precisión de reconocimiento, conservando tanto el significado como el formato.
Este enfoque funciona porque las imágenes de documentos pueden contener información semántica equivalente con una cantidad drásticamente menor de tokens. Al mismo tiempo, preservan de forma inherente el diseño, los símbolos y otros elementos no textuales que la tokenización ordinaria descarta. En la práctica, DeepSeek-OCR elude las limitaciones centrales de los LLM basados en texto: mantener la estructura, la semántica y la eficiencia al mismo tiempo.
Bajo el capó, la Compresión Óptica de Contextos está impulsada por dos componentes principales: un DeepEncoder, que realiza una compresión de alta relación de imágenes de documentos, y un Decodificador MoE (Mixture-of-Experts), que reconstruye el contenido original a partir de los tokens visuales. Juntos, permiten que DeepSeek-OCR procese información de contexto largo con gran precisión y una eficiencia notable.
DeepEncoder: La compresión se une a la precisión
El DeepEncoder es el núcleo de la arquitectura de DeepSeek-OCR: el componente responsable de extraer características visuales y comprimirlas en tokens visuales compactos y ricos en información. Combina precisión con eficiencia mediante una arquitectura de tres partes:
SAM-base (800M parámetros): Usa atención por ventanas para procesar imágenes de documentos de alta resolución. Este diseño captura detalles finos como caracteres y signos de puntuación, manteniendo bajo control la memoria de activación.
Compresor convolucional 16× (2 capas): Reduce el número de tokens de imagen por un factor de 16. Por ejemplo, una imagen de 1024×1024 que inicialmente genera 4096 tokens se reduce a solo 256, logrando una compresión 16× con una pérdida mínima de calidad.
CLIP-large (300M parámetros): Aplica atención global densa para mantener la coherencia semántica en todo el documento. Preserva relaciones como la alineación fila-columna de las tablas y la estructura de las fórmulas, incluso bajo una compresión agresiva.
El DeepEncoder admite seis modos de resolución — Tiny, Small, Base, Large, Gundam y Gundam-M — generando entre 64 y 1853 tokens visuales según los requisitos de la tarea. Esta flexibilidad permite una gestión adaptativa del contexto: compresión de baja resolución para contenido antiguo o menos importante, y codificación de alta resolución para segmentos recientes y críticos.
Decodificador MoE: Reconstrucción eficiente y precisa
Una vez completada la compresión, el Decodificador MoE (Mixture of Experts) reconstruye el texto de forma eficiente y precisa. DeepSeek-OCR emplea el modelo DeepSeek-3B-MoE-A570M, que logra precisión de modelo grande con una fracción del cómputo. Solo se activan 570M parámetros a la vez (seleccionando 6 de 64 expertos más 2 compartidos), logrando una precisión de procesamiento comparable a la de modelos a gran escala dentro de un marco de 3 mil millones de parámetros.
El decodificador también admite el mapeo no lineal de tokens visuales a tokens de texto, lo que permite salidas estructuradas y semánticamente ricas. Por ejemplo, puede convertir gráficos en tablas HTML o traducir fórmulas químicas a cadenas SMILES, asegurando que los datos visuales complejos se representen fielmente en texto.
En términos de rendimiento, el MoE Decoder es rápido y escalable:
Procesa hasta 90 mil millones de tokens/día en datos de texto puro
Maneja 70 mil millones de tokens/día en conjuntos de datos multimodales
Alcanza un rendimiento de 2.500 tokens por segundo en una sola GPU A100-40G
Esta combinación de eficiencia de compresión, preservación estructural y velocidad de decodificación reduce drásticamente el coste del procesamiento de contexto largo, manteniendo al mismo tiempo una precisión cercana a la de los modelos grandes.
Lo que DeepSeek-OCR ha logrado y por qué importa
El impacto de DeepSeek-OCR va mucho más allá de mejorar la precisión del OCR. Mediante la compresión multimodal, introduce una nueva base para los LLMs de contexto largo, el razonamiento multimodal y la comprensión de documentos multilingües. Al convertir el texto en una representación visual universal, DeepSeek-OCR desbloquea tres avances significativos que amplían los límites de la eficiencia y la versatilidad de los modelos grandes.
1. Procesamiento de extremo a extremo de documentos mixtos de texto e imagen
Los flujos de trabajo tradicionales tienen dificultades con documentos que contienen gráficos, fórmulas u otros elementos visuales. Normalmente, dependen de un paso de OCR separado para convertir imágenes en texto —a menudo perdiendo formato, rompiendo la estructura o introduciendo errores de reconocimiento— antes de que el texto se pase a un tokenizador para su procesamiento posterior.
DeepSeek-OCR elimina este frágil paso intermedio. Convierte directamente el contenido mixto de texto y gráficos en tokens visuales unificados, preservando la estructura y la integridad visual en un único flujo de trabajo continuo. Por ejemplo, al analizar un informe financiero con gráficos de líneas incrustados, los tokens visuales del modelo conservan las propias tendencias. Luego, el decodificador puede generar salidas estructuradas —como tablas HTML editables o texto formateado— en lugar de cadenas planas.
2. Mayor universalidad en el procesamiento multilingüe
Los sistemas basados en tokens requieren tokenizadores separados para cada idioma, cada uno con reglas de segmentación diferentes; por ejemplo, la composición de caracteres chinos, las unidades de subpalabras en inglés o las conexiones de la escritura árabe. Gestionar esta complejidad hace que el entrenamiento y el mantenimiento de modelos multilingües sean costosos y propensos a errores.
DeepSeek-OCR resuelve esto utilizando imágenes como representación intermedia, lo que le permite procesar más de 100 idiomas sin distinguir entre familias lingüísticas. Esto reduce la barrera para la comprensión de documentos multilingües, permitiendo que una sola arquitectura de modelo maneje diversos sistemas de escritura sin problemas.
3. Menores costes y gestión de contexto más inteligente para documentos largos
Las soluciones convencionales de procesamiento de contexto largo —como las ventanas deslizantes o la atención dispersa— optimizan la eficiencia a nivel de tokens de texto, pero siguen operando dentro del cuello de botella computacional O(n²) de la atención. En cambio, al transformar texto → imagen → tokens visuales, DeepSeek-OCR reemplaza el cálculo basado en texto por un portador visual de menor complejidad, reduciendo la pesada carga computacional que acompaña a las secuencias de texto largas.
Este diseño aporta otra ventaja importante: la gestión adaptativa del contexto. El modelo puede asignar mayor resolución (más tokens visuales) al contenido reciente y rico en detalles, mientras asigna menor resolución (menos tokens visuales) a información antigua o menos importante. Esto hace que DeepSeek-OCR sea especialmente eficaz para escenarios de diálogo de múltiples turnos, análisis de documentos largos y generación aumentada por recuperación (RAG), donde tanto la memoria como la precisión son críticas.
Mirando hacia el futuro: cómo DeepSeek-OCR apunta al futuro de RAG
DeepSeek-OCR ofrece una valiosa perspectiva sobre hacia dónde podría avanzar RAG. Su principio central —comprimir información en tokens visuales— refleja la lógica detrás de modelos como Sentence-BERT, que transforman texto en embeddings densos. Ambos enfoques comparten el mismo objetivo: representar información rica y compleja en una forma compacta y computacionalmente eficiente.
De cara al futuro, esta idea podría remodelar fundamentalmente el RAG multimodal. Al procesar documentos que incluyen gráficos, tablas o figuras, DeepSeek-OCR puede omitir por completo el paso de decodificación y alimentar sus tokens visuales comprimidos directamente a un modelo grande multimodal para razonamiento o generación. Los futuros sistemas RAG podrían seguir un camino similar: evolucionar desde el proceso actual de varios pasos (búsqueda de similitud de embeddings → reconstrucción de texto → entrada al LLM) hacia una canalización más optimizada: recuperación de embeddings → entrada directa al LLM.
Este cambio de paradigma aborda varias de las ineficiencias de larga data de RAG. Los sistemas actuales tokenizan repetidamente el texto y regeneran embeddings para cada consulta, lo que desperdicia cómputo e introduce pérdida de información. Estos costos se acumulan con documentos más largos, donde los mecanismos de atención escalan cuadráticamente con el número de tokens. En contraste, si los embeddings o los tokens visuales pueden recuperarse y suministrarse directamente al LLM, se elimina la pérdida por tokenización, y la sobrecarga computacional disminuye drásticamente.
Esto también permite un flujo de trabajo offline–online más eficiente. Los embeddings pueden generarse una sola vez, almacenarse en una base de datos vectorial como Milvus, y reutilizarse indefinidamente. En el momento de la consulta, solo los embeddings Top-K —a menudo menos de 20— necesitan recuperarse para proporcionar una base contextual precisa al modelo.
Sigue leyendo

Introducing Zilliz CLI and Agent Skills for Zilliz Cloud
Manage your vector database from your terminal or AI coding agent. Zilliz CLI and Agent Skills work with Claude Code, Cursor, Codex, and Copilot.

How to Build RAG with Milvus, QwQ-32B and Ollama
Hands-on tutorial on how to create a streamlined, powerful RAG pipeline that balances efficiency, accuracy, and scalability using the QwQ-32B and Milvus.

Proactive Monitoring for Vector Database: Zilliz Cloud Integrates with Datadog
we're excited to announce Zilliz Cloud's integration with Datadog, enabling comprehensive monitoring and observability for your vectorDB deployments.



