Нейролюб
НовостьНейросетиHugging FaceOCR

Hugging Face и EleutherAI запустили FineBooks — старые книги станут чище для обучения AI

Проект FineBooks сравнил 14 открытых OCR-моделей на исторических книгах: лучшие дают точность до 97,6% и обрабатывают тысячу страниц дешевле двух долларов.

Кирилл Киреев

10.08.2026 · 3 минут чтения · Нейросети

Исторические страницы из набора FineBooks для проверки OCR-моделей

Содержание

FineBooks улучшит качество открытых книжных датасетов для AI

Hugging Face и EleutherAI представили FineBooks — открытый проект для повторного распознавания исторических книг современными OCR-моделями. Команда хочет заменить старые тексты с ошибками на более точные версии и публиковать результат как открытые датасеты для обучения нейросетей.

14 моделей проверили на 2165 страницах

Для первого рейтинга FineBooks взяли 2165 страниц книг XVIII–XIX веков на английском, французском, немецком и латыни. Все страницы ранее вручную расшифровали специалисты, поэтому результат моделей можно было сравнить с качественным эталоном. Лидером стала открытая dots.mocr на 3 млрд параметров: точность распознавания достигла 97,6%, а расчётная стоимость составила $1,94 за тысячу страниц.

Размер модели при этом не гарантировал лучший результат. Компактная OvisOCR2 на 0,9 млрд параметров заняла второе место с точностью 96,9% и стоимостью около $0,46 за тысячу страниц, обойдя некоторые более крупные решения.

Почему плохой OCR мешает нейросетям

Многие открытые книжные корпуса собраны из старых библиотечных сканов. Ошибки распознавания превращают слова в шум и снижают эффективность обучения языковых моделей. По данным связанного исследования Talkie, модель на старом OCR-тексте усваивала знания лишь примерно с 30% эффективности по сравнению с моделью, обученной на ручных расшифровках тех же книг.

Что будет дальше

FineBooks планирует повторно обработать около 200 тысяч документов из Biodiversity Heritage Library и выпустить улучшенный текст в открытом доступе. Для разработчиков это означает более чистые данные для обучения и поиска, а для библиотек и исследователей — шанс дешевле оцифровать крупные архивы. Пока система не заменяет научную расшифровку: модели могут незаметно осовременивать старые символы и ещё не возвращают координаты каждого слова, необходимые библиотечным системам.

Хочешь узнавать первым о таких новостях?

Переходи в наш телеграм канал где мы ежедневно публикуем самые свежие и интересные новости

Перейти в Телеграм

Хочешь узнавать первым о таких новостях?

Переходи в наш телеграм канал где мы ежедневно публикуем самые свежие и интересные новости

Чиби Новости