МодулиModules

Модули Screph и границы их ответственностиScreph modules and their boundaries

Screph — среда создания задач для AI на визуальных данных. Она состоит из модулей для получения источников, разметки, применения методов компьютерного зрения, сохранения проекта, работы с кодом и исполнения сценариев. Для каждого модуля указаны входные данные, результаты и текущие ограничения.Screph is an environment for creating AI tasks on visual data. It consists of modules for source acquisition, markup, computer-vision methods, project storage, work with code and scenario execution. Inputs, outputs and current limitations are listed for each module.

ImplementedExperimentalPlanned
Input

Capture

Implemented

Получает и индексирует визуальные источники, но не создаёт разметку сам по себе.Acquires and indexes visual sources but does not create markup by itself.

ВходыInputsОбласть/окно/монитор, камера, URL-поток или проверенный набор файлов и папок.Region/window/monitor, camera, URL stream or a validated set of files and folders.
ОперацииOperationsЗапись через равные интервалы или вокруг действий, воспроизведение, редактирование шкалы времени, хранение в памяти или на диске, проверка источника и предварительный просмотр.Timed or action-sequence recording, playback, timeline editing, memory or disk storage, source validation and preview.
РезультатOutputКадры, ссылки на источник, положение на шкале времени, экспорт PNG и файлы, связанные с действиями и кадрами.Frames, source references, timeline positions, PNG exports and files associated with actions and frames.
ОграничениеBoundaryМедиафайлы воспроизводятся, но не записываются; источник с высокой нагрузкой может снижать отзывчивость интерфейса.Media files are played back, not recorded; a high-load live source may reduce interface responsiveness.
Authoring

Selector

Implemented

Владеет основным редактируемым проектом и связывает визуальный источник с предметной разметкой.Owns the main editable project and connects the visual source with domain markup.

  • Элементы, типизированные визуальные признаки и области выделения с автоматическим или ручным составом. Группы разметки входят в основной формат проекта, но отдельного свободного редактора групп в Selector пока нет.Elements, typed visual features and selection areas with automatic or manual membership. Markup groups are part of the main project format, but Selector does not yet have a separate free-form group editor.
  • Работа с признаками: копирование с отдельными файлами изображений, создание шаблонов, сеток и производных признаков, целевая точка, связь с владельцем и источником, проверка обрезки, маски и предварительного просмотра.Feature operations: copies use separate image files; patterns, grids and derived features can be created; target points, owner and source links, crop, mask and preview are checked.
  • Граф связей показывает иерархию, связь владельца с признаком, связи элементов и признаков, видимость и свойства выбранной связи.The relation graph shows hierarchy, owner-to-feature links, element and feature relations, visibility and properties of the selected relation.
  • Раскладки холста A/B/C/D показывают разные материалы одного проекта. Масштаб, прокрутка и курсор можно связать; раскладка хранится локально и не входит в пакет проекта.Canvas layouts A/B/C/D show different materials from one project. Zoom, pan and cursor can be linked; the layout is stored locally and is not part of the project package.
  • Для активного изображения доступны просмотр пикселей, лупа, гистограмма, профиль линии, слои, навигатор и сравнение результатов между версиями.The active image provides pixel inspection, a magnifier, histogram, line profile, layers, a navigator and result comparison between revisions.
  • Текстовые и голосовые описания связываются с элементами, признаками, совпадениями, отношениями и сериями изображений. Смысловая обработка настраивается отдельно и может автоматически применить типизированное правило с высокой уверенностью.Text and voice descriptions can be linked to elements, features, matches, relations and image series. Semantic processing is configured separately and may automatically apply a high-confidence typed rule.
  • Модули дерева сохраняют выбранную ветку в отдельный компактный JSON и проверяют, соответствует ли он текущему состоянию проекта.Tree modules store the selected branch in a separate compact JSON file and check whether it matches the current project state.
Analysis

Computer vision

Implemented

Методы компьютерного зрения создают результаты и могут предложить изменения разметки. Основная разметка изменяется только после отдельного применения такого изменения.Computer-vision methods create results and may propose markup changes. The main markup changes only when such a change is applied separately.

28 методов панели28 panel methods

Границы, HSV/K-Means, GrabCut, Watershed, суперпиксели, контуры и компоненты, MSER/Hough, пороговая обработка, сопоставление, сравнение и выравнивание, KLT, OCR, анализ структуры и сегментация с моделями.Edges, HSV/K-Means, GrabCut, Watershed, superpixels, contours and components, MSER/Hough, thresholding, matching, comparison and alignment, KLT, OCR, layout analysis and model-backed segmentation.

14 узлов последовательности14 sequence nodes

Оттенки серого, тон и контраст, размытие, CLAHE, изменение размера, обрезка, поворот и выравнивание, объединение масок, инверсия, морфология и извлечение контуров.Grayscale, tone and contrast, blur, CLAHE, resize, crop, rotate and deskew, mask composition, inversion, morphology and contour extraction.

Исполнение и зависимостиExecution and dependencies

Один метод, линейная последовательность или граф методов. Для OCR нужен компонент ocr.runtime; для YOLO, SAM и OmniParser — ml.runtime и файлы моделей.A single method, a linear sequence or a method graph. OCR requires ocr.runtime; YOLO, SAM and OmniParser require ml.runtime and model files.

Полный каталог и границы режимов →Full catalog and mode boundaries →

Data

Проекты и экспортProjects and exports

Implemented

Основной пакет проекта использует JSON с версией формата и хранит ссылки на файлы результатов.The main project package uses versioned JSON and retains references to result files.

  • gui_elements, image_features, feature_matches, markup_groups, edges и regions.
  • Исходные изображения, описания результатов методов, маски, контуры, метрики и данные проверки сохранения.Source images, computer-vision result manifests, masks, contours, metrics and save diagnostics.
  • Автоматически создаваемый отдельный файл for_ai_agent; поддерживаемый способ автоматизации отдельно готовит main.py.An automatically generated for_ai_agent file; a supported automation target separately prepares main.py.
  • Проверка схемы и целостности файлов при загрузке и сохранении.Schema and file-integrity validation during load and save.
Execution

GUI Automation

Implemented

Automation Runtime читает основной проект и исполняет отдельный сценарий Python. Файл for_ai_agent не является его прямым входом, а исполнение не запускается автоматически после разметки.Automation Runtime reads the main project and executes a separate Python scenario. The for_ai_agent file is not its direct input, and execution does not start automatically after markup.

Поиск и ожиданиеFind and wait

Сопоставление изображений и текста, ожидание условий и записанный захват для повторяемой отладки.Image and text matching, condition waits and recorded capture for repeatable debugging.

ВводInput

Щелчок, перемещение, ввод текста, сочетание клавиш, перетаскивание и прокрутка через Arduino HID, устаревший последовательный интерфейс или FakerInput Virtual HID.Click, move, text input, hotkey, drag and scroll through Arduino HID, legacy serial or FakerInput Virtual HID.

Automation Manager

Запуск сценариев, телеметрия EVT, предварительный просмотр экрана и совпадений, ход выполнения и журнал.Scenario launch, EVT telemetry, screen and match preview, progress and logs.

Assistance

AI Assistant

Experimental

Помощник выключен по умолчанию. Он формирует контекст со скрытием ограниченных данных и вызывает только разрешённые типизированные действия. Передача изображений и файлов требует явного разрешения; изменения сначала показываются для проверки и требуют подтверждения.The assistant is off by default. It builds context with restricted data redacted and invokes only allowed typed actions. Images and files require explicit permission; changes are previewed and require confirmation.

Открыть руководство Assistant →Open the Assistant guide →
Recorded actions

Action CV

Experimental

Связывает кадры до и после действия, само действие, план LLM, локальный запуск методов компьютерного зрения, предлагаемые цели, решения проверки и экспорт. Исходная запись действий остаётся неизменяемым материалом для проверки.Connects frames before and after an action, the action itself, an LLM plan, a local computer-vision run, proposed targets, review decisions and export. The original action trace remains unchanged for verification.

Code and speech

Screph Code и голосовые функцииScreph Code and voice

Implemented
  • Screph Code использует редактор Monaco, среду выполнения OpenHands и отдельный процесс Pro Agent с версией протокола JSON-RPC.Screph Code uses the Monaco editor, the OpenHands runtime and a separate Pro Agent process with a versioned JSON-RPC protocol.
  • Builder может сразу изменять файлы в выбранной папке с кодом. Раздел Changes и команда Undo не охватывают все изменения агента, поэтому для проверки требуется сравнение файлов средствами Git или другого внешнего инструмента; до запуска нужна отдельная копия или ветка.Builder can modify files in the selected code folder immediately. Changes and Undo do not cover every agent edit, so file changes require inspection with Git or another external tool; use a separate copy or branch before running it.
  • Передача в IDE поддерживает связку VS Code/Codex, Trae, PearAI и Window Commander. Остальные пакеты расширений IDE пока существуют только как внутренние заготовки.IDE transfer supports the VS Code/Codex bridge, Trae, PearAI, and Window Commander. Other IDE extension packages remain internal scaffolds.
  • Для распознавания речи используются Vosk, Yandex, Google и OpenAI. Доступные режимы зависят от выбранной службы; голосовые описания сохраняются в проекте.Speech recognition uses Vosk, Yandex, Google and OpenAI. Available modes depend on the selected service; voice descriptions are stored in the project.
  • Voice2Text — отдельная программа в системном трее с окном редактируемой диктовки, вставкой текста в окна Windows, привязками и необязательным преобразованием снимка экрана через LLM. Основная программа реализована; текущий устаревший ZIP требует замены после проверки публикации.Voice2Text is a separate system-tray application for editable dictation, text insertion into Windows applications, bindings and optional screenshot transformation through an LLM. The main application is implemented; the current legacy ZIP requires replacement after publication review.
Статус модулейModule status

Доступный режим не всегда означает завершённый процессAn available mode does not always mean a complete process

Статус и ограниченияStatus and limitations