Описание
Vision-based ИИ-агент, который видит экран и взаимодействует с интерфейсом любого приложения (десктоп, мобильные) по скриншоту. Распознает кликабельные области и семантику элементов, выполняет действия без доступа к коду приложения. Может работать как на десктопе, так и на телефонах.
Проблема
Для автоматизации работы с приложениями обычно требуется API или доступ к исходному коду. Многие корпоративные и внешние системы не предоставляют таких возможностей. Ручная работа с интерфейсами остается трудоемкой, а традиционные RPA-решения не могут адаптироваться к изменениям интерфейса.
Решение
OMNI использует компьютерное зрение для анализа скриншотов экрана. Он распознает элементы интерфейса (кнопки, поля ввода, списки), понимает их семантику и выполняет действия (клики, ввод текста) так же, как человек. Агент не требует доступа к коду приложения и может работать на любых устройствах, в том числе мобильных.