Вышла новая модель для оцифровки изображений OvisOCR2
Предложена новая компактная (0.8B) сквозная (end-to-end) модель OvisOCR2 (https://huggingface.co/ATH-MaaS/OvisOCR2) на базе Qwen3.5-0.8B для парсинга документов, преобразующая изображения страниц в Markdown с сохранением текста, формул, таблиц, визуальных областей и порядка чтения.
Реальные данные размечали специализированными OCR-парсерами (PaddleOCR-VL-1.5, MinerU2.5-Pro), унифицируя в Markdown через правила, жёстко фильтруя и выборочно проверяя вручную. Синтетические данные включали порождённые из трудных примеров HTML-шаблоны, агентное разнообразие контента и структуры, рендеринг страниц и извлечение точной Markdown-разметки из того же HTML-источника, дополненные циклическим контролем качества.
Обучение проводилось с применением SFT на смеси реальных и синтетических данных для получения базовой политики, а далее использовался RL (GRPO) на 4B-ветке с многокомпонентной наградой (текст оценивали по расстоянию редактирования, формулы по CDM, таблицы по TEDS) на основе текущей стратегии и отфильтрованных сложных примеров. С помощью дистилляции на основе текущей стратегии (обратной KL Top-k) поведение стабильно перенесли с 4B RL-учителя на 0.8B студента. Под конец объединили модели, усредняя веса нескольких кандидатов.
В результате первая сквозная модель SOTA, обогнавшая пайплайновые методы, продемонстрировала общий балл 96.58 на OmniDocBench v1.6 и лучший показатель Avg3 75.06 на PureDocBench в категориях чистых и цифровых документов, заняв первое место. Внутренний бенчмарк присвоил ей наивысший общий балл и лидерство на всех уровнях сложности, особенно на подвыборках рукописных документов и сложных таблиц (минимальный процент пропущенных таблиц).
















