Компьютерное зрение: что это и где применяется в бизнесе?
Компьютерное зрение (computer vision) — раздел искусственного интеллекта, который учит программу понимать содержимое фотографий и видео. Система берёт кадр с камеры, прогоняет его через модель и находит в нём объект, лицо, текст или событие. Результат — автоматическая, непрерывная и документируемая версия работы, которую сейчас глазами делает человек: кто вошёл, сколько товара прошло, на какой детали брак, какой номер написан в документе. Ниже разобрано, как технология работает, где она действительно приносит пользу, какое оборудование требует и чего она не может.

Содержание статьи:
Что такое компьютерное зрение и часть какого ИИ это?
Компьютерное зрение — это раздел искусственного интеллекта, работающий с изображением и видео. Его задача одна: извлечь из набора пикселей осмысленную информацию. Как языковые модели обрабатывают текст, а речевые системы — звук, так компьютерное зрение определяет в кадре объекты, лица, текст и движение и превращает их в цифровой результат, которым дальше пользуются обычные программы.
Важный момент: для компьютера изображение — просто таблица чисел. Каждый пиксель имеет числовое значение цвета, а модель обучена выделять из этих чисел повторяющиеся закономерности. Поэтому система «не видит человека» в человеческом смысле — она находит паттерн, похожий на тысячи виденных ранее примеров, и присваивает ему метку с некоторой вероятностью. Понимание этой разницы нужно, чтобы правильно ставить ожидания от проекта: там, где паттерн нестабилен, нестабильным будет и результат.
На практике под словами «распознавание изображений» понимаются три разных типа задач: классификация (что изображено в кадре?), детекция (где именно это находится и сколько их?) и идентификация (это конкретно кто или какой именно объект?). Большинство бизнес-проектов — комбинация этих трёх.
Классификация
Одна метка на весь кадр: «годный / бракованный», «пусто / занято». Самый простой и самый устойчивый тип задачи — поэтому пилотные проекты чаще всего начинают именно с него.
Детекция
Вокруг каждого объекта в кадре рисуется рамка, объекты считаются: человек, автомобиль, коробка, каска. На этом результате строятся подсчёт, трекинг и зональные правила.
Идентификация
Не «есть человек», а «это Алишер». Сюда относятся технология распознавания лиц и чтение госномера; здесь самые жёсткие требования к качеству кадра и приватности.
Одна мысль из нашей практики
Разговор с клиентом часто начинается фразой «нам нужен искусственный интеллект». На деле вопрос звучит иначе: «можно ли фиксировать автоматически то событие, которое и так видно на камере?». Именно вторая формулировка — правильный вход в проект компьютерного зрения, потому что в ней есть измеримый результат. Мы в Innosoft всегда переводим обсуждение в эту форму до того, как начинаем говорить про модели и оборудование.
Отличие от обычного видеонаблюдения: классическая камера просто пишет архив, который потом кто-то должен пересматривать. Компьютерное зрение превращает камеру в датчик, реагирующий в момент события. Это же отличает видеоаналитику от видеозаписи: аналитика отдаёт не часы видео, а строки данных — время, событие, объект, зона.
Как работает компьютерное зрение?
Система компьютерного зрения работает как последовательный конвейер (pipeline): камера отдаёт кадр, кадр очищается и приводится к стандартному размеру, нейросетевая модель находит в нём объект, поверх результата применяется бизнес-правило, и итоговое решение уходит в другую систему. Каждый этап настраивается отдельно — и, по нашему опыту, проблема обычно не в модели, а в начале или в конце этого конвейера.
Захват кадра (capture)
RTSP-поток IP-камеры, USB-камера, фотография с телефона или файл сканера. Здесь задаются частота кадров (FPS) и разрешение: для охранного сценария в реальном времени нужно несколько кадров в секунду, а для контроля качества иногда достаточно одного чёткого снимка на изделие. Лишний FPS — это лишняя нагрузка на сервер, а слишком низкий — пропущенное событие.
Предобработка (preprocessing)
Кадр приводится к входному размеру модели, цвета нормализуются, шум убирается, при необходимости исправляется перспектива и вырезается зона интереса (ROI). Именно на этом шаге в основном работает библиотека OpenCV. Хорошая предобработка нередко даёт больше прироста, чем замена модели на более тяжёлую.
Прогон через модель (inference)
Подготовленный кадр подаётся в нейросеть. Основа работы с изображением — свёрточные нейронные сети (CNN): они сканируют кадр небольшими окнами и слой за слоем выделяют сначала линии и углы, затем формы, и только потом целый объект. Современные детекторы семейства YOLO делают это за один проход — поэтому и подходят для реального времени.
Детекция и классификация
На выходе модель отдаёт список рамок: для каждой — координаты, имя класса и уверенность (confidence). Здесь же выставляется порог: низкий порог даёт много ложных срабатываний, высокий — пропуски реальных событий. Этот параметр подбирается отдельно для каждого типа объекта и каждой камеры.
Трекинг и агрегация
Одному и тому же объекту на последовательных кадрах присваивается единый ID. Без этого один человек будет посчитан тридцать раз. Трекинг нужен для подсчёта, фиксации пересечения линии, измерения времени пребывания в зоне и подавления повторных сигналов об одном и том же событии.
Бизнес-правило и решение
Модель говорит только «что в кадре»; решение принимается на слое правил. Например: «человек без каски находится в опасной зоне дольше 5 секунд → тревога», «сотрудник опознан и уверенность выше порога → запись в табель». Этот слой пишется под процесс клиента и со временем меняется чаще всего остального.
Интеграция и хранение
Результат пишется в базу данных, показывается в панели управления и уходит по REST API в CRM, HR или ERP; уведомления отправляются в Telegram. Именно этот шаг создаёт ценность проекта — детекция, которую никто не видит и которая ни во что не превращается, бизнесу не приносит ничего.
Схема конвейера
Камера
RTSP / снимок
Предобработка
OpenCV
Модель
CNN / YOLO
Правило
Логика решения
Интеграция
API / панель
Почему свёрточные сети (CNN) — основа распознавания
Свёрточная сеть не смотрит на кадр целиком. Она проходит по нему небольшим окном и на первом слое выделяет простейшие признаки: перепады яркости, линии, углы. Второй слой собирает из них фрагменты форм, третий — узнаваемые части объекта, и только последние слои дают ответ «это человек» или «это коробка». Именно поэтому такая модель устойчива к сдвигу объекта в кадре: она ищет признаки, а не запоминает координаты.
Детекторы семейства YOLO ускорили этот подход тем, что делают предсказание рамок и классов за один проход по кадру, вместо перебора сотен областей-кандидатов. Практическое следствие простое: обработка нескольких потоков в реальном времени становится возможной на одном сервере, а не на стойке оборудования.
Теоретическая база здесь открыта: операции обработки изображений подробно описаны в официальной документации OpenCV, границы возможностей готовых облачных API можно оценить по документации Google Cloud Vision, а исходная работа по свёрточным сетям для распознавания изображений — статья про архитектуру ResNet (arXiv). Сложность проекта не в теории — она в том, чтобы система работала на реальной камере клиента, при реальном освещении и внутри реального процесса.
Где применяется компьютерное зрение?
Компьютерное зрение чаще всего применяется в шести направлениях: распознавание лиц (учёт посещаемости и контроль доступа), детекция объектов (безопасность, транспорт, склад), контроль качества на производстве, подсчёт людей и товара в ритейле, OCR для документов и чеков, а также детекция событий и движения. Таблица ниже собирает для каждого направления задачу, реальный пример и сложность внедрения.
| Направление | Задача | Реальный пример | Сложность |
|---|---|---|---|
| Распознавание лиц — учёт посещаемости | Идентифицировать сотрудника на проходной и автоматически фиксировать рабочее время | Работающая у корпоративного клиента система: камеры распознавания лиц + терминалы на входах, мониторинг в реальном времени | Средняя |
| Распознавание лиц — безопасность | Отделять разрешённых людей от посторонних и связывать это с контролем доступа | Дверь офиса или склада открывается только сотруднику из списка, остальные попадают в журнал событий | Средняя-высокая |
| Детекция объектов | Находить и считать в кадре людей, транспорт, упаковку, инвентарь и технику | Фиксация въезжающего на территорию автомобиля, подсчёт паллет на складе по камере | Низкая-средняя |
| Контроль качества (производство) | Выявлять брак, отсутствующую деталь или неверно наклеенную этикетку на линии | Камера над конвейером: перекошенная этикетка обнаруживается, партия помечается для проверки | Высокая |
| Подсчёт людей и товара (ритейл) | Считать входящий поток, длину очереди, время у полки и загрузку зала по часам | Отчёт по динамике посещений торговой точки и по самым загруженным часам смены | Низкая-средняя |
| OCR — распознавание документов | Превращать текст, номера, серии и поля таблиц со снимка в редактируемые данные | Поля паспорта или договора заполняются автоматически вместо ручного ввода оператором | Низкая (печатный текст) / Высокая (рукопись) |
| Детекция событий и движения | Фиксировать вход в запретную зону, долгое пребывание, падение человека, задымление | Мгновенное уведомление в Telegram о сотруднике без каски в опасной зоне цеха | Высокая |
Почему «подсчёт» — самая удобная точка старта
При подсчёте людей или товара цена ошибки низкая: если система ошиблась на одном кадре, дневная статистика почти не изменится. Поэтому первый проект компьютерного зрения логично начинать именно с этой задачи — команда получает доверие к системе, а вы измеряете реальные возможности своих камер и сервера без больших вложений.
OCR — единственное направление без камеры
Для распознавания документов видеопоток не нужен: достаточно фотографии с телефона или файла сканера. Поток не непрерывный, поэтому требования к серверу заметно ниже. По этой причине OCR-проекты запускаются быстрее и дешевле остальных задач компьютерного зрения.
Распознавание лиц — самое востребованное направление в Узбекистане
По нашим обращениям чаще всего спрашивают именно про учёт рабочего времени и контроль доступа: у компании уже есть проходная и камеры, а журнал прихода ведётся вручную. Это понятная задача с измеримым эффектом, поэтому она и внедряется первой.
Контроль качества — самое требовательное
Здесь модель должна отличать не «человека от машины», а годное изделие от почти такого же, но бракованного. Нужны собственный размеченный датасет, жёстко закреплённая камера и стабильный свет. Зато и эффект прямой: брак ловится на линии, а не у клиента.
Ваша задача похожа на одну из строк таблицы?
Innosoft разрабатывает решения на базе компьютерного зрения: от 15 млн сум, срок обычно 30–60 дней. Тарифы, этапы работ и то, что входит в стоимость, открыто расписаны на странице услуги.
На консультации мы сначала оцениваем саму задачу: нужно ли здесь компьютерное зрение или есть более дешёвое решение.
На каких технологиях строится компьютерное зрение?
Типичный стек состоит из четырёх слоёв: библиотека обработки изображений (OpenCV), модель детекции объектов (семейство YOLO или похожие детекторы), специализированные модели под задачу (эмбеддинги лиц, OCR-движок) и слой интеграции (API, база данных, панель). Таблица ниже показывает, зачем нужен каждый компонент и когда его выбирают.
| Технология | Зачем нужна | Когда выбирается | На что обратить внимание |
|---|---|---|---|
| OpenCV | Захват кадра, изменение размера и цвета, фильтры, геометрические преобразования, отрисовка результата | Практически в каждом проекте — это не модель, а фундамент всего конвейера | Сама по себе ничего не «узнаёт»; классические методы (пороги, контуры) работают только в стабильных условиях |
| YOLO (детекторы объектов) | Находить объекты рамками и классифицировать их со скоростью, пригодной для реального времени | Подсчёт людей, транспорта и товара, зональный контроль, охранные события | Готовый список классов общий; под ваш специфичный объект нужен размеченный датасет и дообучение |
| Модели распознавания лиц (эмбеддинги) | Найти лицо, превратить его в числовой вектор и сравнить с векторами в базе | Учёт посещаемости, контроль доступа, идентификация зарегистрированного человека | Ракурс, маска и освещение сильно влияют на результат; обязателен режим работы с персональными данными |
| OCR-движки (например, Tesseract) | Разобрать текст на изображении по символам и вернуть его в редактируемом виде | Документы, чеки, серийные номера, автозаполнение полей форм | Силён на ровном печатном тексте; при перекосе, рукописи или плохом снимке решает этап предобработки |
| Облачные vision API | Использовать готовые функции распознавания, не обучая собственную модель | Быстрый прототип, небольшой объём запросов, стандартные задачи | Видео уходит наружу, оплата зависит от объёма — приватность и себестоимость нужно считать заранее |
| Python + PostgreSQL + Docker | Код модели, хранение результатов и стабильное развёртывание системы | В любом проекте, который выходит за пределы демонстрации | Разница между прототипом и рабочей системой именно здесь: логи, резервные копии, мониторинг |
| REST API + Telegram Bot API | Передать результат в CRM/HR-систему и отправить уведомление ответственному | Везде, где результат должен увидеть человек или использовать другая система | Если сигналов слишком много, внимание к ним пропадает — пороги и агрегацию продумывают сразу |
Готовая модель или собственная?
Это главный вопрос, разделяющий бюджеты и сроки. Готовые модели хорошо узнают общие классы (человек, автомобиль, сумка) и запускаются за несколько дней. Специфический дефект вашей продукции или нестандартный объект в этих списках классов отсутствуют — под них придётся собирать фотографии, размечать их (аннотация) и обучать модель.
Готовой модели достаточно
Подсчёт людей, фиксация транспорта, общая детекция объектов, OCR печатного текста.
Нужно обучение
Дефект именно вашей продукции, спецодежда и оснастка предприятия, специфические типы событий.
Как распознавание лиц устроено внутри
Отдельно стоит понимать, что технология распознавания лиц не хранит фотографии. На кадре находится область лица, изображение выравнивается по опорным точкам и превращается моделью в вектор чисел — эмбеддинг. Сравнение сводится к расстоянию между векторами: чем оно меньше, тем выше вероятность, что это один и тот же человек. Практическое следствие — базу можно хранить компактно, а при утечке вектора восстановить из него исходное фото напрямую нельзя, хотя это и не отменяет требований к защите персональных данных.
Любой слой стека заменяем, но логика остаётся той же. Какой вариант окажется дешевле в вашем случае, зависит от числа камер и режима работы потока — на странице услуги компьютерного зрения приведены тарифы и этапы работ.
Какое оборудование и условия нужны для компьютерного зрения?
Требования к оборудованию зависят от задачи и обычно оказываются скромнее, чем ожидают: в большинстве проектов существующие IP-камеры подключаются по RTSP-потоку и докупать ничего не нужно. Реальные требования сводятся к трём вещам: куда и под каким углом смотрит камера, стабильно ли освещена сцена и где выполняется расчёт — на локальном сервере, на edge-устройстве или в облаке.
| Задача | Требования к камере | Где считается |
|---|---|---|
| Распознавание лиц | Близко к точке прохода, на высоте лица, без встречного света; лицо должно занимать достаточно пикселей в кадре | Постоянный поток — локальный сервер; при большом числе камер нужен GPU |
| Подсчёт людей и объектов | Сверху или под широким углом; такое расположение, при котором объекты меньше перекрывают друг друга | Хватает низкого FPS — справляется и средний сервер без GPU |
| Контроль качества | Жёстко закреплённая камера + стабильное искусственное освещение; расстояние и угол не должны меняться | Если нужен мгновенный отклик — edge-устройство рядом с линией |
| Детекция событий и движения | Камера, полностью покрывающая контролируемую зону; в ночном режиме — ИК-подсветка | Непрерывные множественные потоки — сервер с GPU |
| OCR / документы | Камера не обязательна — достаточно фотографии с телефона или файла сканера | Обычный сервер или облако; поток не непрерывный |
1. Тип камеры и её расположение
Решает не разрешение, а размер объекта в кадре. Камера 4K не поможет распознать лицо в тридцати метрах лучше, чем 720p, если угол выбран неправильно. Перед стартом проекта мы берём несколько тестовых кадров с каждой камеры — и только после этого говорим, выполнима ли задача на текущем оборудовании.
2. Освещение — самое дешёвое «улучшение модели»
Меняющийся свет — самая частая причина проблем в проектах компьютерного зрения: система, работавшая утром, начинает ошибаться днём, когда в кадр попадает солнце. Часто один дополнительный светильник или разворот камеры от окна дают больше, чем замена модели на более тяжёлую.
3. Разрешение и персональные данные
В любой системе с распознаванием лиц нужно уведомить сотрудников, определить срок хранения данных и задокументировать, у кого есть доступ. Практический совет: хранить эмбеддинги вместо фотографий, держать видеоархив ограниченный срок и включить ролевой доступ к панели.
4. Сервер: локальный, edge или облако
Локальный сервер — видео не покидает объект, зависимости от интернета нет. Edge-устройство считает рядом с камерой, задержка минимальна. Облако дешевле на старте, но добавляет расходы на канал и трафик. В сценарии «много камер в реальном времени» именно необходимость GPU формирует основную часть бюджета.
Практическое правило: одна камера в реальном времени — это постоянная нагрузка, а не разовая операция. Поэтому вопрос «сколько камер должны обрабатываться одновременно и с какой частотой» задаётся раньше, чем вопрос «какую модель возьмём». Ответ на первый определяет железо, а железо — большую часть стоимости проекта.
Что влияет на точность распознавания?
Точность зависит больше от условий съёмки, чем от самой модели: угол камеры, освещение, размер объекта в кадре, перекрытия, скорость движения и выбранный порог уверенности. Поэтому обещать конкретную цифру точности заранее некорректно — она становится известна только после измерения на ваших собственных кадрах.
Размер объекта в кадре
Модель не увидит слишком мелкий объект. Для лица нужно достаточное количество пикселей; с ростом расстояния точность падает резко. Решение — приблизить камеру или сменить оптику, а не менять модель.
Освещение и контраст
Встречный свет (камера смотрит на окно), тени, ночной режим — всё это ломает распознавание. Стабильное искусственное освещение в контроле качества — практически обязательное условие.
Перекрытия (occlusion)
Если объект виден частично, уверенность детекции падает: люди закрывают друг друга, коробка прячется в паллете, лицо закрывает маска или головной убор.
Скорость движения и FPS
Быстро движущийся объект смазывается в кадре или вообще не попадает между двумя кадрами. Скорость конвейера и FPS камеры считаются в самом начале проекта, а не после запуска.
Порог уверенности (threshold)
Одна настройка меняет местами два типа ошибок: понизите порог — вырастет число ложных сигналов, повысите — начнёте пропускать реальные события. Правильное значение выбирается из стоимости ошибки для бизнеса.
Качество обучающих данных
Модель узнаёт только то, что видела. Если в датасете нет ночных кадров или нового типа упаковки, на них система будет ошибаться — поэтому сбор данных выделяется в отдельный этап работ.
Дрейф со временем (drift)
Изменился дизайн упаковки, сдвинулась камера, ввели новую форму одежды — результат медленно ухудшается. Поэтому в работающей системе планируются периодические проверки и дообучение.
Честно о цифрах точности
На рынке часто встречаются обещания вроде «99% точности». Такие цифры обычно измерены на открытых тестовых наборах в идеальных условиях и не имеют отношения к вашему складу или проходной. Правильный подход — измерить показатель на пилоте, на кадрах именно ваших камер, и показывать два типа ошибок отдельно: пропущенные события и ложные срабатывания. Мы фиксируем методику этого измерения в договоре ещё до старта работ.
Пропуск или ложная тревога: что дешевле для вас?
Этот вопрос стоит обсудить до внедрения. В охране опаснее пропустить событие, поэтому порог опускают ниже и мирятся с ложными сигналами. В учёте посещаемости наоборот: ложная отметка чужого человека в табеле хуже, чем повторная попытка распознавания, — порог поднимают. Одна и та же технология настраивается по-разному в зависимости от того, какая ошибка обходится компании дороже.
Чего компьютерное зрение НЕ может?
Компьютерное зрение может говорить только о том, что видно в кадре. Оно не «дорисует» объект за препятствием, деталь в тёмном кадре или зону, которую камера не охватывает. Оно также не оценивает намерение, причину и подлинность документа — эти решения остаются за человеком или за другой системой. Об этом почти не пишут в рекламных материалах, но именно здесь ломается большинство ожиданий.
Не восстановит то, чего не видно
Неверный угол камеры, объект за препятствием или слишком тёмный кадр — ни одна модель это не компенсирует. В такой ситуации решение лежит не в модели, а в монтаже и освещении.
Не читает намерения
Система скажет «человек стоял у полки 40 секунд», но не скажет «он собирался украсть». Любая трактовка намерения — это работа правил и решения человека, а не нейросети.
Не проверяет содержание документа
OCR прочитает текст, но не определит подлинность подписи и достоверность данных. Для этого нужен отдельный слой проверки — сверка с реестром, контрольные суммы, ручная валидация.
Не даёт нулевой ошибки
В любой системе есть два вида ошибок: пропуск события и ложное срабатывание. В грамотном проекте их не «убирают», а смещают в ту сторону, которая дешевле для бизнеса.
Сама не подстраивается под изменения
Новая упаковка, новая спецодежда, смещение камеры — качество падает. Систему нужно наблюдать и время от времени перенастраивать; это статья расходов, а не разовая покупка.
Не всегда самое дешёвое решение
Если задачу закрывает датчик, штрих-код или обычный счётчик — они дешевле и стабильнее. Компьютерное зрение оправдано там, где этих средств не хватает или их некуда поставить.
Вывод: компьютерное зрение — мощный, но чувствительный к условиям инструмент. Проект нужно начинать не с выбора модели, а с вопроса «видно ли это событие на камере на самом деле?». На консультациях мы проверяем именно это в первую очередь и иногда прямо говорим клиенту, что компьютерное зрение ему не нужно — задачу закроет более простое и дешёвое решение.
Реальный кейс: распознавание лиц на проходной
Для нас компьютерное зрение — не теория: для корпоративного клиента мы разработали систему учёта посещаемости на камерах распознавания лиц и специальных терминалах. Система автоматически идентифицирует сотрудника на проходной, фиксирует рабочее время и даёт руководству отчёты по опозданиям и ранним уходам. Проект выполнен в 2024 году, длительность — 3 месяца.

Задача
На крупном предприятии фиксировать приход и уход сотрудников автоматически, а не вручную, и давать руководству достоверную отчётность о рабочем времени.
Часть с компьютерным зрением
Камеры распознавания лиц на базе ИИ идентифицируют сотрудника на входе; на проходных установлены специальные терминалы, мониторинг ведётся в реальном времени.
Технологии
Python, OpenCV, React, PostgreSQL, Docker — модель и конвейер обработки изображений, панель управления и инфраструктура развёртывания в одном проекте.
Результат
Подробные отчёты и панель управления: рабочее время, опоздания и ранние уходы видны автоматически. Срок реализации — 3 месяца.
Практический урок из этого проекта
В проекте с распознаванием лиц больше всего времени уходит не на модель, а на правильную организацию точки прохода: высота камеры, направление потока людей и освещение. Когда сотрудники привыкают к системе, процесс распознавания становится для них незаметным — это и есть критерий успеха. Как выбирать между лицом, отпечатком и картой, мы разбираем в статье про систему учёта посещаемости.
С чего начать проект компьютерного зрения?
Точка старта — не технология, а одна конкретная и измеримая задача. Сначала опишите событие (что именно должно фиксироваться), затем проверьте, видно ли его на камере, и посчитайте текущую стоимость ручной работы. Только после этого имеет смысл говорить о моделях и оборудовании.
Выберите одно событие
Не «автоматизируем весь процесс», а «фиксируем сотрудника на входе» или «считаем дневной поток посетителей». Узкая задача быстро запускается, и её результат видно в цифрах уже на пилоте.
Соберите примеры кадров
Несколько десятков кадров с существующих камер в разное время суток — утром, днём, вечером. Без этого материала никто честно не скажет, выполнима ли задача на вашем объекте.
Измерьте текущую стоимость
Сколько человеко-часов уходит на эту работу сейчас и сколько стоит ошибка? Выгода проекта считается относительно этой цифры, а не относительно слов «современная технология».
Начните с пилота
Одна-две камеры, ограниченная зона, заранее согласованный критерий успеха. Результат пилота уточняет и объём следующего этапа, и бюджет на оборудование.
Спланируйте интеграцию сразу
Куда попадает результат — в HR-систему, в Telegram-канал, в панель отчётов? Если отложить этот вопрос, даже работающая детекция останется бесполезной.
Компьютерное зрение редко работает в одиночку — ценность появляется вместе с решениями на базе искусственного интеллекта и CRM и системами отчётности: камера фиксирует событие, а система встраивает его в рабочий процесс. Если нужен диалоговый слой поверх данных, посмотрите разбор про ИИ-агентов для бизнеса.
Частые вопросы
Что такое компьютерное зрение простыми словами?
Компьютерное зрение (computer vision) — это направление искусственного интеллекта, которое учит программу понимать содержимое фотографий и видео. Система получает кадр как набор пикселей, прогоняет его через модель и определяет, что на нём: объект, лицо, текст или событие. Результат превращается в данные, с которыми работают другие программы: кто вошёл, сколько товара прошло, на какой детали брак.
Чем компьютерное зрение отличается от искусственного интеллекта?
Искусственный интеллект — общая область, компьютерное зрение — её раздел, работающий с изображением и видео. Языковые модели обрабатывают текст, речевые системы — звук, а компьютерное зрение — картинку. На практике в одном проекте они соединяются: камера фиксирует событие, а языковая модель или ИИ-агент формулирует отчёт и ставит задачу в CRM.
Где применяется компьютерное зрение в бизнесе?
Шесть самых распространённых направлений: распознавание лиц (учёт посещаемости и контроль доступа), детекция объектов (безопасность, транспорт, склад), контроль качества на производственной линии, подсчёт людей и товара в ритейле, OCR — распознавание текста в документах и чеках, а также детекция событий (вход в запретную зону, падение, задымление). В Узбекистане первыми внедряются учёт посещаемости и безопасность.
Как работает технология распознавания лиц?
Сначала на кадре находится область лица (face detection), затем изображение выравнивается и прогоняется через модель, которая превращает лицо в числовой вектор — эмбеддинг. Этот вектор сравнивается с векторами зарегистрированных сотрудников в базе: если расстояние меньше заданного порога, система считает человека опознанным. То есть база хранит не фотографию, а математическое описание лица.
Какая камера нужна для компьютерного зрения?
Зависит от задачи. Для распознавания лиц нужна IP-камера рядом с точкой прохода, на высоте лица и без встречного света. Для подсчёта объектов удобнее камера сверху с широким охватом. Для OCR камера вообще не обязательна — достаточно фотографии с телефона или скана. В большинстве проектов существующие IP-камеры подключаются напрямую по RTSP-потоку, докупать оборудование не требуется.
Работает ли система компьютерного зрения без интернета?
Да, если она построена на локальном (on-premise) сервере. В этом случае видео не покидает объект, модель считает на месте, и при обрыве связи распознавание продолжается — задержатся только внешние уведомления. Облачный вариант снижает стартовые затраты, но зависит от стабильного канала и скорости отдачи потока наружу.
Чего компьютерное зрение не может?
Оно не расскажет о том, чего не видно в кадре: объект за препятствием, тёмный кадр, неверный угол камеры — модель это не «дорисует». Оно также не оценивает намерение, причину и подлинность документа: OCR прочитает текст, но не решит, правда в нём или ложь. В любой пограничной ситуации финальное решение должен подтверждать человек.
Сколько стоит проект компьютерного зрения?
В Innosoft решения на базе компьютерного зрения начинаются от 15 млн сум, сложная видеоаналитика с обучением собственной модели стоит выше, срок обычно 30–60 дней. Точная цена зависит от количества камер, нужна ли обработка в реальном времени и берётся готовая модель или обучается своя. Тарифы и этапы работ подробно описаны на странице услуги компьютерного зрения.
Читайте также

Команда Innosoft
Innosoft — IT-компания из Узбекистана. Мы занимаемся компьютерным зрением, искусственным интеллектом, веб-сайтами и мобильными приложениями. Технические выводы в этой статье взяты из нашего опыта внедрения системы учёта посещаемости с распознаванием лиц на Python и OpenCV у корпоративного клиента.
Обновлено: 2026-07-07
Нужно решение на базе компьютерного зрения?
Innosoft разрабатывает системы, которые извлекают данные из камер и изображений: распознавание лиц, детекция объектов, контроль качества, подсчёт и OCR. Цена — от 15 млн сум, срок 30–60 дней. На консультации мы сначала вместе проверим, видно ли вашу задачу на камере.
Или позвоните: +998 77 016 87 88


