Обнаружение текста с помощью OCR и аннотирование транскрипции

Как компания Shaip разработала набор данных для оптического распознавания текста и анализа документов, включающий аннотации на уровне слов и символов, на основе различных текстовых источников — печатных документов, рукописного текста, вывесок, номерных знаков, квитанций — и создала систему, обеспечивающую точность 99% при использовании OCR и интеллектуального анализа документов.

Обнаружение текста с помощью OCR и аннотирование транскрипции

Обзор проекта

Поскольку технология оптического распознавания текста (OCR) выходит за рамки чистых печатных документов и охватывает текст реальных сцен, а также интеллектуальные функции распознавания документов, клиенту потребовался конвейер аннотирования, способный обрабатывать различные типы текста, шрифты, ориентации, языки и условия поверхности с точностью как на пространственном, так и на символьном уровне.

Компания Shaip разработала комплексный конвейер аннотирования, охватывающий размещение ограничивающих рамок на уровне слов, точную транскрипцию символов, многоатрибутную разметку и двойной контроль качества пространственного и транскрипционного анализа, в результате чего были получены готовые к использованию наборы данных OCR для более чем 10 типов текстовых источников.

Основная статистика

Аннотация к каждому изображению

Сотни слов

Порог точности

99%

Текстовые источники

10+

Слои атрибутов

5

Задачи

  • Аннотирование каждый видимый экземпляр текста на уровне слов — сотни на плотное изображение.
  • Объединяя точность пространственной ограничивающей рамки с точная транскрипция на уровне символов параллельно
  • Управляемость изогнутый, искаженный с точки зрения перспективы и повернутый текст на вывесках и этикетках продукции
  • Конвертирующий бледный, низкоконтрастный и частично закрытый слова, не пытаясь угадать неразборчивые символы
  • Управление текст на разных языках и с использованием нескольких письменностей в пределах одного изображения

Решение

Пространственная аннотация на уровне слов

Каждый видимый фрагмент текста на каждом изображении был индивидуально аннотирован с помощью точно подобранной ограничивающей рамки на уровне слова, что позволяло зафиксировать точное пространственное положение каждого текстового элемента. Для изображений с высокой плотностью текста, таких как чеки или бланки, это означало сотни отдельных аннотаций на изображение, каждая из которых сохраняла базовую точность выравнивания.

Транскрипция на уровне символов

Наряду с ограничивающей рамкой, аннотаторы точно переписывали текстовое содержимое каждого слова, включая цифры, специальные символы, знаки препинания и буквенно-цифровые комбинации. Этот двойной рабочий процесс — пространственная транскрипция + транскрипция — выполнялся параллельно с соблюдением правил согласованности на обоих уровнях.

Многоисточниковое покрытие

Исследование охватывало широкий спектр источников: печатные документы, рукописные заметки, уличные указатели, этикетки товаров, номерные знаки, витрины магазинов, рекламные щиты, квитанции, счета-фактуры, меню и поля форм. Для каждого типа источника были разработаны собственные правила аннотирования, адаптированные к его визуальным характеристикам.

5-уровневая атрибутная разметка

Каждый аннотированный текстовый регион был дополнен атрибутами, охватывающими ориентацию текста (горизонтальная, вертикальная, диагональная), язык и тип письма, четкость текста (четко читаемый, частично разборчивый, полностью неразборчивый), стиль шрифта (печатный или рукописный) и тип фона текста (простой, с узором, сложный). Этот богатый слой атрибутов позволяет обученной модели обрабатывать разнообразные реальные текстовые условия, выходящие далеко за рамки стандартного распознавания текста в документах.

Порог видимости и двойной контроль качества

Строгие правила регулировали минимальные пороговые значения видимости — неразборчивый текст помечался, а не угадывался, что обеспечивало целостность набора данных. Каждое аннотированное изображение проходило двухэтапный процесс контроля качества, сочетающий проверку точности ограничивающих рамок и проверку точности транскрипции, с порогом точности в 99% на обоих уровнях.

Объем проекта

Тип набора данных Уровень аннотации Источники Атрибуты QA Точность подачи
Обнаружение текста с помощью OCR + транскрипция Текстовые блоки + транскрипция символов 10+ типов источников 5 слоев атрибутов Двойной пространственный контроль качества + транскрипция 99%

Результаты

  • Создал двухэтапный конвейер пространственной транскрипции на уровне слов и на уровне символов для ИИ распознавания текста
  • Стандартизированный Более 10 источников текста охвачено. охватывая документы, текст сцены и почерк
  • Сдан 5 слоев атрибутов для ориентации, языка, четкости, шрифта и фона
  • Поддерживается 99% точность ворот на уровнях пространственного контроля качества и контроля качества транскрипции.
  • Включено для клиента оцифровка документов, оптическое распознавание символов в розничной торговле, навигация, банковское дело и юриспруденция. AI приложения

В целом, компания Shaip помогла преобразовать требования к аннотированию текста из нескольких источников в структурированный, готовый к производству конвейер оптического распознавания текста (OCR), способный поддерживать оцифровку документов, обнаружение текста на изображениях, аналитику розничной торговли, автоматизацию банковских процессов и искусственный интеллект для обеспечения соответствия законодательству с двойной точностью — пространственной и транскрипционной.

Цитата значок

Компания Shaip справилась с теми сложными случаями распознавания текста, с которыми большинство поставщиков не могут справиться — изогнутый текст на вывесках, смешанные шрифты, выцветшие чеки, рукописные заметки. Их двойной контроль качества как ограничивающих рамок, так и транскрипций предоставил нам обучающие данные, которые мы могли использовать.

— Директор по искусственному интеллекту в работе с документами

★ ★ ★ ★ ★
Цитата значок