- Регистрация
- 16.12.2020
- Сообщения
- 1 499
- Реакции
- 92
- Баллы
- 48
Добавьте действие распознавания текста OCR
копия из gemini по запросу "родной встроенный движок OCR от Windows 10/11. подробнее пожалуйста"
Встроенный в Windows движок распознавания текста называются Windows Media OCR API (он находится в пространстве имён <span>Windows.Media.Ocr</span>).
Microsoft добавила его начиная с Windows 10 для системы Universal Windows Platform (UWP). Главная фишка в том, что движок уже встроен в операционную систему, работает полностью офлайн и использует оптимизированные C++ алгоритмы библиотеки Windows.
[ Изображение ] ➔ [ SoftwareBitmap ] ➔ [ OcrEngine.RecognizeAsync ] ➔ [ OcrResult ]<br>
вопросы:
будет ли он распознавать язык текста?
будет ли он распознавать язык текста написанный в транслитом? дважды или трижды?
Windows.Media.Ocr Пространство имен - Windows UWP applications
Предоставляет API оптического распознавания символов (OCR) для чтения текста из изображений.
learn.microsoft.com
копия из gemini по запросу "родной встроенный движок OCR от Windows 10/11. подробнее пожалуйста"
Встроенный в Windows движок распознавания текста называются Windows Media OCR API (он находится в пространстве имён <span>Windows.Media.Ocr</span>).
Microsoft добавила его начиная с Windows 10 для системы Universal Windows Platform (UWP). Главная фишка в том, что движок уже встроен в операционную систему, работает полностью офлайн и использует оптимизированные C++ алгоритмы библиотеки Windows.
Key Features и Преимущества
- Не нужно ничего скачивать:
В отличие от сторонних библиотек вроде Tesseract (который весит сотни мегабайт и требует скачивания моделей), Windows.Media.Ocr поставляется вместе с Windows. - Точные координаты каждого слова:
Движок возвращает не просто полотно текста, а иерархическую структуру: <span>Строки</span> → <span>Слова</span>. Для каждого отдельного слова вы получаете его рамку — BoundingRect (координаты X, Y, ширину и высоту). Это как раз то, благодаря чему мы смогли вычислить центр текста и кликнуть по нему! - Поддержка языков (Language Packs):
Он использует языковые пакеты, установленные у вас в Windows. Если в системе включён русский или английский язык ввода, соответствующие языковые OCR-модели загружаются автоматически. - Высокая скорость:
Так как это нативный компонент ОС (WinRT/C++), скриншот FullHD распознаётся буквально за 100–300 миллисекунд.
Как это устроено "под капотом"?
Процесс распознавания в коде состоит из 4 базовых шагов:[ Изображение ] ➔ [ SoftwareBitmap ] ➔ [ OcrEngine.RecognizeAsync ] ➔ [ OcrResult ]<br>
- Загрузка в формат SoftwareBitmap: Картинка (или скриншот экрана) конвертируется в специальные пиксельные данные, понятные для Windows Runtime APIs.
- Инициализация OcrEngine: Движок создается под нужный язык ([Windows.Media.Ocr.OcrEngine]::TryCreateFromLanguage($lang)).
- Запуск распознавания: Метод RecognizeAsync() анализирует изображение.
- Разбор OcrResult: На выходе получается объект, содержащий collection строк (Lines) и слов (Words).
Где еще этот движок используется?
Вы наверняка пересекались с ним в повсеместной работе Windows, даже не подозревая об этом:- "Ножницы" (Snipping Tool) в Windows 11 — функция Text Actions (копирование текста со скриншота) работает именно на базе этого API.
- Поиск в Windows: Индексация текста внутри картинках и PDF-файлах.
- Приложение "Связь с телефоном" (Phone Link) — выбор и копирование текста из фото на телефоне.
вопросы:
будет ли он распознавать язык текста?
будет ли он распознавать язык текста написанный в транслитом? дважды или трижды?


