Обнаружение текста с помощью OCR и аннотирование транскрипции
Как компания Shaip разработала набор данных для оптического распознавания текста и анализа документов, включающий аннотации на уровне слов и символов, на основе различных текстовых источников — печатных документов, рукописного текста, вывесок, номерных знаков, квитанций — и создала систему, обеспечивающую точность 99% при использовании OCR и интеллектуального анализа документов.
Обзор проекта
Поскольку технология оптического распознавания текста (OCR) выходит за рамки чистых печатных документов и охватывает текст реальных сцен, а также интеллектуальные функции распознавания документов, клиенту потребовался конвейер аннотирования, способный обрабатывать различные типы текста, шрифты, ориентации, языки и условия поверхности с точностью как на пространственном, так и на символьном уровне.
Компания Shaip разработала комплексный конвейер аннотирования, охватывающий размещение ограничивающих рамок на уровне слов, точную транскрипцию символов, многоатрибутную разметку и двойной контроль качества пространственного и транскрипционного анализа, в результате чего были получены готовые к использованию наборы данных OCR для более чем 10 типов текстовых источников.
Основная статистика
Аннотация к каждому изображению
Сотни слов
Порог точности
99%
Текстовые источники
10+
Слои атрибутов
5
Задачи
- Аннотирование каждый видимый экземпляр текста на уровне слов — сотни на плотное изображение.
- Объединяя точность пространственной ограничивающей рамки с точная транскрипция на уровне символов параллельно
- Управляемость изогнутый, искаженный с точки зрения перспективы и повернутый текст на вывесках и этикетках продукции
- Конвертирующий бледный, низкоконтрастный и частично закрытый слова, не пытаясь угадать неразборчивые символы
- Управление текст на разных языках и с использованием нескольких письменностей в пределах одного изображения
Решение
Пространственная аннотация на уровне слов
Каждый видимый фрагмент текста на каждом изображении был индивидуально аннотирован с помощью точно подобранной ограничивающей рамки на уровне слова, что позволяло зафиксировать точное пространственное положение каждого текстового элемента. Для изображений с высокой плотностью текста, таких как чеки или бланки, это означало сотни отдельных аннотаций на изображение, каждая из которых сохраняла базовую точность выравнивания.
Транскрипция на уровне символов
Наряду с ограничивающей рамкой, аннотаторы точно переписывали текстовое содержимое каждого слова, включая цифры, специальные символы, знаки препинания и буквенно-цифровые комбинации. Этот двойной рабочий процесс — пространственная транскрипция + транскрипция — выполнялся параллельно с соблюдением правил согласованности на обоих уровнях.
Многоисточниковое покрытие
Исследование охватывало широкий спектр источников: печатные документы, рукописные заметки, уличные указатели, этикетки товаров, номерные знаки, витрины магазинов, рекламные щиты, квитанции, счета-фактуры, меню и поля форм. Для каждого типа источника были разработаны собственные правила аннотирования, адаптированные к его визуальным характеристикам.
5-уровневая атрибутная разметка
Каждый аннотированный текстовый регион был дополнен атрибутами, охватывающими ориентацию текста (горизонтальная, вертикальная, диагональная), язык и тип письма, четкость текста (четко читаемый, частично разборчивый, полностью неразборчивый), стиль шрифта (печатный или рукописный) и тип фона текста (простой, с узором, сложный). Этот богатый слой атрибутов позволяет обученной модели обрабатывать разнообразные реальные текстовые условия, выходящие далеко за рамки стандартного распознавания текста в документах.
Порог видимости и двойной контроль качества
Строгие правила регулировали минимальные пороговые значения видимости — неразборчивый текст помечался, а не угадывался, что обеспечивало целостность набора данных. Каждое аннотированное изображение проходило двухэтапный процесс контроля качества, сочетающий проверку точности ограничивающих рамок и проверку точности транскрипции, с порогом точности в 99% на обоих уровнях.
Объем проекта
| Тип набора данных | Уровень аннотации | Источники | Атрибуты | QA | Точность подачи |
|---|---|---|---|---|---|
| Обнаружение текста с помощью OCR + транскрипция | Текстовые блоки + транскрипция символов | 10+ типов источников | 5 слоев атрибутов | Двойной пространственный контроль качества + транскрипция | 99% |
Результаты
- Создал двухэтапный конвейер пространственной транскрипции на уровне слов и на уровне символов для ИИ распознавания текста
- Стандартизированный Более 10 источников текста охвачено. охватывая документы, текст сцены и почерк
- Сдан 5 слоев атрибутов для ориентации, языка, четкости, шрифта и фона
- Поддерживается 99% точность ворот на уровнях пространственного контроля качества и контроля качества транскрипции.
- Включено для клиента оцифровка документов, оптическое распознавание символов в розничной торговле, навигация, банковское дело и юриспруденция. AI приложения
В целом, компания Shaip помогла преобразовать требования к аннотированию текста из нескольких источников в структурированный, готовый к производству конвейер оптического распознавания текста (OCR), способный поддерживать оцифровку документов, обнаружение текста на изображениях, аналитику розничной торговли, автоматизацию банковских процессов и искусственный интеллект для обеспечения соответствия законодательству с двойной точностью — пространственной и транскрипционной.
Компания Shaip справилась с теми сложными случаями распознавания текста, с которыми большинство поставщиков не могут справиться — изогнутый текст на вывесках, смешанные шрифты, выцветшие чеки, рукописные заметки. Их двойной контроль качества как ограничивающих рамок, так и транскрипций предоставил нам обучающие данные, которые мы могли использовать.
— Директор по искусственному интеллекту в работе с документами