AI-native engineering lead

Алексей Николаев

AI-native engineering lead · агентные системы для прода · финтех-бэкенд

Агенты пишут код. Призрак решает, что правда.

Строю системы на LLM, которым можно доверять деньги и юридические ответы: каждая цитата, каждая цифра в ответе проверяется кодом до того, как её увидит человек. И строю процесс, в котором основной объём кода пишут оркестрируемые агенты — под архитектурой, тестами и аудитом второй модели.

арт: winecrow
арт: winecrow
  • 12публичных стендов
  • 3 562теста в их репозиториях
  • $0.001средняя цена ответа
  • 2005первый коммерческий код

01

Призрак и оболочка

Метафора из «Призрака в доспехах» описывает метод буквально. Оболочка — исполнительный слой: агенты, инструменты, стенды, CI. Призрак — суждение: что строить, какие инварианты держать, что считать правдой.

Призрак

  • Архитектура и границы: что делить, где sync, где async, где деньги
  • Инварианты в коде: идемпотентность, двойная запись, уравнение сверки
  • Критерии приёмки до первой строки — и приёмка по ним, не «тесты зелёные»
  • Ответственность за результат: что ушло в прод, то и подписано

Оболочка

  • Оркестрируемые агенты пишут основной объём кода и тестов
  • Вторая модель — противник: независимый аудит каждого стенда
  • Валидаторы: цитаты, числа, хеши, адреса — сверка с данными кодом
  • Экономика видна: токены, кэш, цена — под каждым ответом
Вопрос Агент Инструменты Валидатор Ответ отказ
Вопрос → агент → инструменты → валидатор → ответ. Не сошлось с данными — отказ, а не правдоподобная выдумка.

02

Стенды

Публичная лаборатория: каждый стенд — реальная бизнес-задача, доведённая до прода со своим набором тестов, ценником и границами. Открывайте и задавайте вопросы — это живые сервисы, а не видео.

Скриншот стенда «Custody Reconciliation Copilot»
Деньги и сверкаEN

Custody Reconciliation Copilot

Задача

Блокчейн говорит одно, внутренний ledger — другое. Кто прав, нужно понять до конца смены.

Как

Сверка — детерминированный код: матчинг on-chain событий с двойной записью и снапшотами, 7 классов расхождений, уравнение баланса сходится по каждому активу. LLM только объясняет, и каждая цифра, хеш и адрес в её ответе проверены против данных до показа.

Доказательство
  • 621 тест
  • precision/recall 1.0 на 7 seed'ах
  • ответ ≈ $0.001
  • суммы — целые в минорных единицах, без float
собран 2026-08-23 · за 1 чОткрыть
Скриншот стенда «Crypto Compliance Consultant — MiCA и EU Travel Rule»
Регуляторика и правоEN

Crypto Compliance Consultant — MiCA и EU Travel Rule

Задача

Комплаенс-вопрос по регламенту ЕС: ответ нужен с точной ссылкой на статью, а не «по-моему».

Как

Агент ходит по структуре актов (статья → параграф → пункт, перекрёстные ссылки), а не по «похожим чанкам». Каждая ссылка проверяется кодом против базы; не сошлось — честный отказ вместо выдумки. Под ответом — его цена.

Доказательство
  • 2 регламента, 2 554 адресуемых единицы
  • 455 тестов
  • валидатор цитат — код, не промпт
собран 2026-08-23 · за 1 чОткрыть
Скриншот стенда «RAG-стенд с eval-контуром: что искать лучше?»
Регуляторика и правоRU

RAG-стенд с eval-контуром: что искать лучше?

Задача

«У нас RAG» ничего не значит, пока не измерено, какой retrieval работает на ваших данных.

Как

Пять стратегий на одном корпусе (лексика, dense с двумя схемами чанкинга, гибрид, гибрид + кросс-энкодер), 47 размеченных вопросов, отчёт Recall/MRR/nDCG, faithfulness по судье, стоимость и латентность — воспроизводимо, с версией промпта. Результаты как есть, включая неудобные.

Доказательство
  • Recall@10: 0.61 наивное окно → 0.91 гибрид+реранкер
  • 363 теста
  • первый гибрид проигрывал — причина найдена и описана
собран 2026-08-25 · за 7 чОткрыть
Скриншот стенда «Cert-Ops copilot — инвентарь TLS/PKI на 25 000 хостов»
ИнфраструктураRU

Cert-Ops copilot — инвентарь TLS/PKI на 25 000 хостов

Задача

«Что истекает за 14 дней в DMZ и где ещё живёт этот CA?» — ops-вопросы, на которые нельзя отвечать приблизительно.

Как

Go, один статический бинарь. Агент пишет SQL под гардом, строит план ротации детерминированным ранжировщиком, сканирует реальные хосты по whitelist. Каждое число, имя хоста и CA в ответе сверяется с результатом запроса; неизвестная форма числа — блокирует ответ. ADR и C4 в репо.

Доказательство
  • 135 тестов, аудит второй моделью: 7 находок закрыты в тот же день
  • ответ ≈ $0.0007
  • от постановки до публичного стенда — 5 часов
собран 2026-08-25 · за 5 чОткрыть
Скриншот стенда «AI-консультант по федеральным законам»
Регуляторика и правоRU

AI-консультант по федеральным законам

Задача

Юридический ответ без проверяемой ссылки на норму — это риск, а не помощь.

Как

Структурный retrieval по статьям/частям/пунктам трёх законов; каждая ссылка в ответе валидируется кодом и кликабельна — открывает настоящий текст нормы. Под ответом — себестоимость в токенах и рублях.

Доказательство
  • 588 тестов
  • цитаты — только из узлов, реально открытых агентом
  • витрина стоимости за день
собран 2026-08-06 · за 6 чОткрыть
Скриншот стенда «Сверка квартир из двух грязных источников»
ДокументыRU

Сверка квартир из двух грязных источников

Задача

Шахматка застройщика (картинка) и выгрузка реестра (PDF) описывают одни и те же квартиры по-разному. Нужен один достоверный список.

Как

Четыре видимые стадии: OCR → LLM-экстракция структуры → grounding-проверка каждой записи против исходника → детерминированное сопоставление. Ошибка модели видна на своей стадии, а не в итоговой таблице.

Доказательство
  • 321 тест
  • локальный OCR (Qwen-VL на своём GPU) — документы не уходят в облако
  • каждая запись помечена: подтверждена / нет
собран 2026-08-05 · за 8 чОткрыть
Скриншот стенда «AI Analyst: бизнес-вопрос → проверенный SQL»
АналитикаRU

AI Analyst: бизнес-вопрос → проверенный SQL

Задача

Аналитик занят, а бизнесу нужен ответ «какая категория просела на промо» сейчас — и без уверенной ерунды.

Как

Агент читает semantic layer, пишет SQL под AST-гардом, задаёт уточняющий вопрос при неоднозначности, отказывает вне домена. Каждое число в ответе обязано быть в результате запроса. Трассировка: шаги, SQL, токены, цена.

Доказательство
  • 120 тестов
  • eval-набор с ловушками: неоднозначное → уточнение, чужое → отказ
  • реальный каталог + синтетические продажи, честно помечено
собран 2026-08-11 · за 8 чОткрыть
Скриншот стенда «Консультант по каталогу цифровых товаров»
Каталоги и продажиRU

Консультант по каталогу цифровых товаров

Задача

Покупатель спрашивает «какой номинал подписки подойдёт» — а ответ должен быть только из реального каталога, с реальной ценой.

Как

Function calling поверх структурированного индекса (~300 позиций, все номиналы) вместо свободной генерации: агент не может назвать товар или цену, которых нет. Квоты и токен-бюджет встроены.

Доказательство
  • от идеи до публичного прода — один день
  • 211 тестов
  • 0 выдуманных товаров по дизайну
собран 2026-08-13 · за 1 чОткрыть
Скриншот стенда «AI-разбор первичных документов»
ДокументыRU

AI-разбор первичных документов

Задача

Счета, акты, накладные приходят картинками. Их надо превратить в проверенные реквизиты, а не в «примерно так».

Как

OCR → структура → проверки реквизитов кодом (ИНН, суммы, даты, контрольные соотношения) → вердикт; каждая стадия показывает свой результат.

Доказательство
  • 282 теста
  • локальная vision-модель, без облака
  • видно, где именно ошиблась модель
собран 2026-08-03 · за 8 чОткрыть
Скриншот стенда «Консультант по строительным нормативам (СП/СНиП)»
Регуляторика и правоRU

Консультант по строительным нормативам (СП/СНиП)

Задача

Инженеру нужен пункт норматива, а не пересказ.

Как

Тот же принцип, что в правовых стендах: агентный retrieval по структуре документов, детерминированная проверка каждой ссылки, клик открывает исходный пункт.

Доказательство
  • 313 тестов
  • ссылка без подтверждения в базе — ответ не показывается
собран 2026-08-03 · за 6 чОткрыть
Скриншот стенда «Консультант по каталогу строймаркета»
Каталоги и продажиRU

Консультант по каталогу строймаркета

Задача

15 тысяч товаров, покупатель формулирует задачу словами («чем покрасить OSB на улице»), а не артикулом.

Как

Агент с инструментами поиска по локальному индексу каталога и FAQ, handoff менеджеру для лидов; вежливый харвест публичных данных с учётом robots.txt.

Доказательство
  • 15 562 товара, 738 категорий
  • 153 теста
  • первый стенд линейки
собран 2026-07-28 · за 16 чОткрыть
Скриншот стенда «2.5D-платформер: персонажи и анимация с помощью агентов»
ИграEN

2.5D-платформер: персонажи и анимация с помощью агентов

Задача

Проверка на другом материале: конвейер персонажей (паспорт, волосы, физика, MToon-экспорт) и сцена — можно ли вести такое агентами.

Как

Three.js, ассеты и анимации собраны конвейером агентов под ревью; для лаборатории — площадка для экспериментов с генерацией.

Доказательство
  • играбельно в браузере
  • в письмах игровым компаниям — мостик к домену
собран 2026-08-12Открыть

03

Как это сделано

Пять правил, которые повторяются в каждом стенде и в рабочем коде биржи.

01

Контракт первым

Дизайн-документ с критериями приёмки пишется до кода. Агент получает контракт, а не «сделай красиво». Приёмка — по критериям, диффом и запуском.

DESIGN → критерии → код → приёмка

02

LLM — не источник фактов

Модель ищет, рассуждает и объясняет. Правду устанавливает код: валидатор цитат, grounding чисел, детерминированный движок сверки. Не подтвердилось — честный отказ.

demo10: цитата на несуществующий параграф не доходит до пользователя

03

Качество — число

Evals с размеченным набором, precision/recall против ground truth, мутационные тесты, чтобы зелёный сьют что-то значил.

demo12: пять retrieval-стратегий, Recall@10 от 0.61 до 0.91

04

Вторая модель — противник

Перед публикацией стенд аудирует независимая модель с брифом «найди, как обойти». Находки закрываются тестами, не обещаниями.

demo13: 7 находок за час — обход квот, числа мимо валидатора, DNS rebinding — закрыты в тот же день

05

Экономика видна

Под каждым ответом — токены, доля кэша, цена. Бюджет на день, квоты на сессию. Стоимость AI — часть продукта, а не сюрприз в конце месяца.

ответ на demo11 ≈ $0.001; сутки работы стенда дешевле чашки кофе

Один день, один стенд

Как выглядит темп: demo13 от вакансии до публичного сервиса, 25 августа 2026.

  1. 12:47Дизайн-документ: задача, данные, инварианты, критерии приёмки
  2. 13:30Агент: генератор парка 25 000 хостов, SQL-гард, grounding-валидатор
  3. 16:49103 теста зелёные, статический бинарь, smoke живьём
  4. 17:00Аудит второй моделью: 7 находок
  5. 17:35Находки закрыты, 135 тестов, редеплой
  6. 17:45Ссылка на стенд — в письме работодателю

04

Опыт

Не список должностей, а четыре эпизода, за которые отвечаю лично.

Кастодиальный контур биржи

Заменил стороннего custody-провайдера собственным контуром: полная TRON-нода, подписант, ledger с двойной записью, реконсиляция on-chain ↔ учёт, антифрод-лимиты. Переход — без остановки бизнеса. Java 21/25, Micronaut, Kafka, PostgreSQL.

AML-граф на полной ноде

Chainalysis стоил как отдел. Построил свой граф транзакций поверх ноды: кластеризация адресов, трассировка потоков, риск-скоринг — как внутренний комплаенс-сервис.

AI-native процесс в команде

Перевёл разработку на оркестрируемых агентов: документация как граф контекста, AI-ревью в CI, evals в пайплайне. После сокращения команды вдвое темп релизов удержан.

Лаборатория 2025–2026

12 публичных стендов, «Артель» — агентная команда, собирающая софт по контракту, и claim-store — семантическая память для агентов. Всё — на собственной инфраструктуре, под собственные гипотезы.

арт: winecrow
арт: winecrow

Хронология

  • 2023 — н.в.AWX, криптобиржа — Lead Backend / AI Lead
  • 2011 — 2026SimSite — основатель, principal engineer; интеграции для бизнеса и университета
  • 2018 — 2021University of KwaZulu-Natal, ЮАР — постдок, теоретическая физика
  • 2016PhD, теоретическая физика (РУДН)
  • 2014Heidelberg University, ZAH — стажировка, стипендия Президента РФ
  • 2011Дипломы: физика и информатика; экономика (финансовый менеджмент)

Стек

Java (Micronaut, GraalVM native) · Kotlin · Python (FastAPI) · Go · TypeScript · Dart/Flutter · Perl · PostgreSQL · Kafka/Redpanda · Docker/Swarm · GitLab CI · Linux · LLM-агенты и оркестрация · RAG с grounding · MCP · evals · локальный inference (Ollama, Qwen, Whisper)

Языки

русский — родной · английский — рабочий (3 года в ЮАР, год в Германии) · немецкий — базовый

05

Наука

Та же дисциплина, что и в коде: утверждение без проверки не публикуется.

  • 01Universal cosmological solutions in Lovelock gravity — Eur. Phys. J. C 85, 25 (2025), единственный автор
  • 02Embedding with Vaidya geometry — Eur. Phys. J. C (2020), с S. D. Maharaj
  • 03Kinetic scalar curvature extended f(R) gravity — Nucl. Phys. B (2018)

ORCID 0000-0003-2730-8470≈15 публикаций, доклады на GR22 (Валенсия), BRICS AGAC, конгрессах SAMS

06

Связаться

Удалённо из России, готов к командировкам и релокации при подходящих условиях. Отвечаю в течение дня.