DeepSeek-OCR: объяснение оптического сжатия для масштабируемых систем с длинным контекстом и RAG
Большие языковые модели (LLM) всё ещё испытывают трудности при обработке длинных контекстов. Работа с длинным текстом потребляет много вычислительных ресурсов, увеличивает задержку и часто снижает качество вывода. Несмотря на множество усилий по оптимизации, результаты остаются неудовлетворительными.
Чтобы решить эту проблему, DeepSeek представила DeepSeek-OCR, модель с открытым исходным кодом, которая сжимает длинные контексты с помощью оптического 2D-отображения. Вместо того чтобы подавать в модель необработанный текст, она преобразует страницы текста в изображения и рассматривает эти изображения как визуальные токены. Одно изображение может содержать столько же информации, сколько тысячи текстовых токенов, позволяя модели обрабатывать длинные документы с гораздо меньшими ресурсами.
Идея одновременно умная и простая. Используя визуальные представления, DeepSeek-OCR сохраняет высокую точность, одновременно снижая вычислительные затраты. Это может стать поворотным моментом — не только для обработки длинных контекстов в LLM, но и для RAG-систем, которые давно сталкиваются с высокими затратами и ограниченными контекстными окнами.
В следующих разделах я объясню, как работает DeepSeek-OCR, и рассмотрю, как этот подход «оптического сжатия» может сформировать следующее поколение LLM и RAG-систем.
Традиционный способ обработки текста в LLM — и его ключевые ограничения
Чтобы понять, почему DeepSeek-OCR имеет такое большое значение, полезно сначала разобраться, как большие языковые модели (LLM) традиционно обрабатывают текст и каковы их ограничения. LLM не читают слова или предложения так, как это делают люди, — они обрабатывают токены, то есть небольшие единицы текста, такие как слова, подслова или даже символы. Когда модель получает входные данные, она преобразует текст в длинную последовательность таких токенов. Затем механизм self-attention сравнивает каждый токен с каждым другим токеном, чтобы понять контекст и смысл. Этот метод хорошо работает для коротких фрагментов, но быстро становится неэффективным по мере увеличения длины последовательности.
Квадратичные вычислительные затраты
Эта неэффективность обусловлена математикой: вычислительная стоимость self-attention растёт квадратично (O(n²)) с числом токенов. Если входные данные увеличиваются с 1 000 до 10 000 токенов, количество операций attention возрастает в 100 раз. Даже высококлассные GPU могут упираться в ограничения памяти или тайм-ауты инференса при таких нагрузках.
Уплощённое внимание: потеря фокуса в длинных контекстах
На этом проблема не заканчивается. По мере растягивания последовательностей веса внимания модели склонны уплощаться — распределяться слишком равномерно по тексту или фокусироваться только на начале и конце. Эта потеря фокуса ухудшает точность и релевантность, сколько бы вычислительных ресурсов вы ни добавляли.
Неэффективность в мультимодальном и структурированном тексте
Текстовые токены также оказываются недостаточными в задачах с мультимодальными или структурированными документами, такими как PDF, слайды или электронные таблицы. После токенизации текста макет, таблицы и визуальная структура теряются, хотя они несут важный смысл. Многоязычный текст добавляет ещё один уровень сложности: каждому языку требуется собственный токенизатор с уникальными правилами сегментации. И после всего этого даже самое агрессивное текстовое сжатие редко даёт больше чем скромное сокращение числа токенов в 1–2 раза — что далеко не достаточно для реальных приложений с длинным контекстом.
DeepSeek-OCR: поддержка обработки длинных контекстов с помощью оптического сжатия контекстов
Как обсуждалось ранее, традиционный подход на основе токенов сталкивается с тремя жёсткими ограничениями: высокой вычислительной стоимостью, потерей фокуса и потерей структуры документа при обработке мультимодального текста. DeepSeek-OCR преодолевает эти трудности, превращая текст в визуальные токены — сжимая гораздо больше информации в меньшее число элементов и при этом сохраняя смысл и структуру.
Так как же это работает? Ключ заключается в новой парадигме под названием Contexts Optical Compression. Вместо того чтобы подавать в модель длинные потоки текстовых токенов, DeepSeek-OCR сначала преобразует текст в изображения, а затем кодирует эти изображения в компактные визуальные токены. Этот процесс напрямую решает две самые большие болевые точки LLM: высокую вычислительную стоимость длинных контекстов и потерю структуры документа при токенизации.
Вот как это работает в три шага:
Преобразование текста в структурированные изображения документов. Исходный текст — вместе с диаграммами, таблицами и уравнениями — преобразуется в изображения, которые сохраняют визуальную компоновку и семантические подсказки.
Сжатие изображений в визуальные токены. Визуальный энкодер преобразует каждое изображение в компактное представление, сокращая количество токенов в 7–20 раз, а на бенчмарках, таких как OmniDocBench, — до 60 раз.
Восстановление текста из визуальных токенов. Языковой декодер преобразует эти визуальные токены обратно в текст с точностью распознавания более 97%, сохраняя как смысл, так и форматирование.
Этот подход работает потому, что изображения документов могут содержать эквивалентную семантическую информацию при значительно меньшем числе токенов. В то же время они по своей природе сохраняют компоновку, символы и другие нетекстовые элементы, которые обычная токенизация отбрасывает. По сути, DeepSeek-OCR обходит ключевые ограничения текстовых LLM — одновременно сохраняя структуру, семантику и эффективность.
Под капотом Contexts Optical Compression работает на основе двух ключевых компонентов: DeepEncoder, который выполняет сжатие изображений документов с высоким коэффициентом, и MoE (Mixture-of-Experts) Decoder, который восстанавливает исходное содержимое из визуальных токенов. Вместе они позволяют DeepSeek-OCR обрабатывать информацию с длинным контекстом с высокой точностью и выдающейся эффективностью.
DeepEncoder: сжатие в сочетании с точностью
DeepEncoder — это ядро архитектуры DeepSeek-OCR, компонент, отвечающий за извлечение визуальных признаков и их сжатие в компактные, насыщенные информацией визуальные токены. Он сочетает точность с эффективностью благодаря трехчастной архитектуре:
SAM-base (800M параметров): Использует windowed attention для обработки изображений документов высокого разрешения. Такая конструкция захватывает мелкие детали, такие как символы и пунктуация, при этом удерживая память активаций под контролем.
16× Convolutional Compressor (2 слоя): Сокращает количество токенов изображения в 16 раз. Например, изображение 1024×1024, которое изначально генерирует 4 096 токенов, сжимается всего до 256 — достигая 16-кратного сжатия с минимальной потерей качества.
CLIP-large (300M параметров): Применяет dense global attention для поддержания семантической согласованности по всему документу. Он сохраняет взаимосвязи, такие как выравнивание строк и столбцов таблицы и структура формул, даже при агрессивном сжатии.
DeepEncoder поддерживает шесть режимов разрешения — Tiny, Small, Base, Large, Gundam и Gundam-M — генерируя от 64 до 1 853 визуальных токенов в зависимости от требований задачи. Эта гибкость обеспечивает адаптивное управление контекстом: низкоразрешающее сжатие для более старого или менее важного содержимого и высокоразрешающее кодирование для недавних, критически важных сегментов.
MoE Decoder: эффективное и точное восстановление
После завершения сжатия MoE (Mixture of Experts) Decoder эффективно и точно восстанавливает текст. DeepSeek-OCR использует модель DeepSeek-3B-MoE-A570M, которая достигает точности большой модели при доле вычислительных затрат. Одновременно активируются только 570M параметров (выбираются 6 из 64 экспертов плюс 2 общих), что обеспечивает точность обработки, сопоставимую с крупномасштабными моделями, в рамках архитектуры с 3 миллиардами параметров.
Декодер также поддерживает нелинейное отображение визуальных токенов в текстовые токены, обеспечивая структурированные и семантически насыщенные выходные данные. Например, он может преобразовывать диаграммы в HTML-таблицы или переводить химические формулы в строки SMILES, гарантируя точное представление сложных визуальных данных в текстовом виде.
С точки зрения производительности, MoE Decoder является одновременно быстрым и масштабируемым:
Обрабатывает до 90 миллиардов токенов/день на чисто текстовых данных
Обрабатывает 70 миллиардов токенов/день на мультимодальных наборах данных
Достигает пропускной способности 2 500 токенов в секунду на одном GPU A100-40G
Это сочетание эффективности сжатия, сохранения структуры и скорости декодирования значительно снижает стоимость обработки длинного контекста, сохраняя точность, близкую к точности крупных моделей.
Чего достиг DeepSeek-OCR и почему это важно
Влияние DeepSeek-OCR выходит далеко за рамки повышения точности OCR. Благодаря кросс-модальному сжатию он закладывает новую основу для LLM с длинным контекстом, мультимодального рассуждения и понимания многоязычных документов. Превращая текст в универсальное визуальное представление, DeepSeek-OCR открывает три значимых достижения, расширяющих границы эффективности и универсальности крупных моделей.
1. Сквозная обработка документов со смешанным текстово-изобразительным содержимым
Традиционные конвейеры с трудом справляются с документами, содержащими диаграммы, формулы или другие визуальные элементы. Обычно они полагаются на отдельный этап OCR для преобразования изображений в текст — часто с потерей форматирования, нарушением структуры или появлением ошибок распознавания, — прежде чем текст передается токенизатору для дальнейшей обработки.
DeepSeek-OCR устраняет этот хрупкий промежуточный этап. Он напрямую преобразует смешанное текстово-графическое содержимое в унифицированные визуальные токены, сохраняя структуру и визуальную целостность в едином непрерывном рабочем процессе. Например, при анализе финансового отчета со встроенными линейными графиками визуальные токены модели сохраняют сами тренды. Затем декодер может генерировать структурированные выходные данные — такие как редактируемые HTML-таблицы или форматированный текст, — а не плоские строки.
2. Более высокая универсальность в многоязычной обработке
Системам на основе токенов требуются отдельные токенизаторы для каждого языка, каждый из которых следует разным правилам сегментации — например, составу китайских иероглифов, английским субсловным единицам или соединениям арабского письма. Управление этой сложностью делает обучение и сопровождение многоязычных моделей как дорогими, так и подверженными ошибкам.
DeepSeek-OCR решает эту проблему, используя изображения как промежуточное представление, что позволяет ему обрабатывать более 100 языков без различения языковых семей. Это снижает барьер для понимания многоязычных документов, позволяя одной архитектуре модели бесшовно работать с разнообразными письменными системами.
3. Более низкие затраты и более умное управление контекстом для длинных документов
Традиционные решения для обработки длинного контекста — такие как скользящие окна или разреженное внимание — оптимизируют эффективность на уровне текстовых токенов, но всё еще работают в рамках вычислительного узкого места внимания O(n²). В отличие от них, преобразуя текст → изображение → визуальные токены, DeepSeek-OCR заменяет текстовые вычисления визуальным носителем более низкой сложности, снижая тяжелую вычислительную нагрузку, связанную с длинными текстовыми последовательностями.
Эта конструкция дает еще одно важное преимущество: адаптивное управление контекстом. Модель может выделять более высокое разрешение (больше визуальных токенов) недавнему, насыщенному деталями содержимому, назначая при этом более низкое разрешение (меньше визуальных токенов) более старой или менее важной информации. Это делает DeepSeek-OCR особенно эффективным для сценариев многоходового диалога, анализа длинных документов и генерации с дополнением извлечением (RAG), где критически важны и память, и точность.
Взгляд вперед: как DeepSeek-OCR указывает на будущее RAG
DeepSeek-OCR дает ценное представление о том, куда RAG может двигаться дальше. Его ключевой принцип — сжатие информации в визуальные токены — перекликается с логикой моделей вроде Sentence-BERT, которые преобразуют текст в плотные эмбеддинги. Оба подхода преследуют одну и ту же цель: представлять насыщенную, сложную информацию в компактной и вычислительно эффективной форме.
В перспективе эта идея может фундаментально изменить мультимодальный RAG. При обработке документов, содержащих диаграммы, таблицы или иллюстрации, DeepSeek-OCR может полностью пропустить этап декодирования и передавать свои сжатые визуальные токены напрямую в мультимодальную большую модель для рассуждения или генерации. Будущие системы RAG могут пойти похожим путем — эволюционировав от сегодняшнего многоэтапного процесса (поиск по сходству эмбеддингов → реконструкция текста → ввод в LLM) к более оптимизированному конвейеру: извлечение эмбеддингов → прямой ввод в LLM.
Этот сдвиг парадигмы решает несколько давних неэффективностей RAG. Современные системы многократно токенизируют текст и заново генерируют эмбеддинги для каждого запроса, расходуя вычислительные ресурсы и внося потери информации. Эти затраты накапливаются при работе с более длинными документами, где механизмы внимания масштабируются квадратично относительно числа токенов. Напротив, если эмбеддинги или визуальные токены можно извлекать и передавать напрямую в LLM, потери при токенизации устраняются, а вычислительные накладные расходы резко снижаются.
Это также обеспечивает более эффективный офлайн–онлайн рабочий процесс. Эмбеддинги можно сгенерировать один раз, сохранить в векторной базе данных, такой как Milvus, и использовать повторно неограниченное время. Во время запроса нужно извлечь только Top-K эмбеддингов — часто меньше 20, — чтобы обеспечить модели точную контекстную привязку.
Читать далее

Zilliz Skills Breakdown: How AI Agents Master Vector Databases
Zilliz's Milvus Skill (pymilvus, 7 files) and Zilliz Cloud Skill (zilliz-cli, 14 modules) bring vector-DB dev and ops into one Claude Code session.

How to Build an Enterprise-Ready RAG Pipeline on AWS with Bedrock, Zilliz Cloud, and LangChain
Build production-ready enterprise RAG with AWS Bedrock, Nova models, Zilliz Cloud, and LangChain. Complete tutorial with deployable code.

Selecting the Right ETL Tools for Unstructured Data to Prepare for AI
Learn the right ETL tools for unstructured data to power AI. Explore key challenges, tool comparisons, and integrations with Milvus for vector search.



