Ideas v3 — Стрим 1 · Software for Agents (moat-first инверсия)

Дата: 2026-07-15 · Метод: инверсия [moat-паттерн]×[seed], 5 web-поисков · Сырьё: exhaust_scan_v3 (#8–11, зона B) Отстройка от AgentActuary (занято в др. стриме): он = post-incident бюро + $/task-индекс (страховая логика). Здесь — другие клетки: pre-deploy, supply-chain, handoff, build-time, conformity.


1. Seismo — нейтральная обсерватория тихих апдейтов моделей

Формула: We build continuous behavioral-fingerprint monitoring of model endpoints for AI-продуктовых команд solving «провайдер молча подменил чекпоинт, агент деградировал, узнали через 2 недели» via cross-company сенсорная сеть golden-задач + лонгитюдная БД отпечатков поведения at $500–2k/mo per endpoint + data-union скидка за вклад своих eval-стримов. Moat (P4+P2): каждый подключённый клиент = новые task-классы в сенсорной сетке → точнее сепарация «модель изменилась» vs «твои данные изменились» → быстрее алерты → больше клиентов отдают eval-стримы. Один клиент не соберёт: нужна кросс-компанейская диверсность задач. Foundation-лаб не соберёт структурно: он — объект аудита, self-audit не продаётся (конфликт интересов = моат против G4). Seed: S2 — 24 продукта Workhold × ежедневные eval-раны по нескольким моделям = готовая мультимодельная сенсорная сетка с дня 0, нулевой cold start. Right-to-win: конвейер студии генерит фингерпринты бесплатно как exhaust; собственные инциденты «модель поплыла» = первые кейс-стади. Analogy-чек: ThousandEyes (нейтральный мониторинг чужой инфраструктуры → Cisco, ~$1B); Downdetector. Занято? Per-customer drift-фичи есть (Traceloop, InsightFinder, Agenta); нейтрального cross-provider индекса «что изменилось у OpenAI в 03:00 UTC» — нет. Catchpoint блогает про проблему = спрос виден. G4: лабы не могут аудировать сами себя — нейтральность третьей стороны остаётся ценностью при любых нативных фичах. K1: ежедневно (каждый eval-ран/пробы).

2. ToolFax — бюро поломок tool-supply-chain (MCP/API)

Формула: We build cross-company реестр breakage-сигнатур MCP/API-интеграций for команд с прод-агентами (5 800+ публичных MCP-серверов) solving «tool молча сменил схему/поведение — агент тихо врёт» via сенсор-краулер публичных серверов + корпус инцидент→сигнатура→known-good pin at Snyk-модель: сканер дёшево, advisory-фид $1–3k/mo. Moat (P4+P8+P2): каждый инцидент любого клиента → сигнатура в БД → все клиенты получают превентивный pin/patch → больше интеграций под мониторингом → больше инцидентов захвачено. Vercel/Anthropic шипят локальные утилиты диффинга (fingerprintTools), но локальный дифф ≠ кросс-компанейская история поломок; реестр Anthropic листит серверы, не владеет runtime-историей. Seed: S3 (ничейный корпус: публичные MCP-серверы краулятся легально) + S4 (инцидент-репорты клиентов). НЕ-S2 ✓. Right-to-win: интеграции 24 продуктов Workhold = стартовый сенсор + первый поток инцидентов; краулер публичного реестра не требует чьего-либо разрешения. Analogy-чек: Snyk vuln-DB / Socket.dev (npm supply chain — доказано, что БД сигнатур > фичи сканера). Занято? Частично: FlareCanary, Bellwether — мониторинг-алерты per-endpoint; Vercel AI SDK 7.0.19 добавил detectToolDrift нативно (G4 частично случился). Корпус-бюро свободно, но окно узкое — честно. G4: нативные утилиты = локальный дифф; остаётся сетевой эффект БД сигнатур + advisory (Snyk пережил встроенный npm audit). K1: ежедневно (дрейф на тысячах серверов).

3. ResolveLoop — эскалационный деск, чей exhaust = размеченный корпус фиксов

Формула: We build agent→human handoff-инфраструктуру (роутинг, очередь, SLA) for вертикальных agent-first компаний solving «эскалации размазаны по Slack, момент провала агента — самые ценные данные — испаряется» via захват триплета (контекст, провал агента, фикс человека) → авто-генерация регресс-evals и auto-resolve предложений per vertical at seat + per-resolution, upsell % авто-резолва. Moat (P5+P1): каждая эскалация = экспертно-размеченный пример провал→фикс → регресс-щит и auto-resolve растут → меньше эскалаций у клиента (видимый ROI) → больше workflow заводят в деск. Лабы никогда не видят человеческое решение — оно происходит в ops-слое клиента после API-вызова. Seed: S4 (exhaust продукта с первого клиента). НЕ-S2 ✓. Bootstrap: HITL-моменты собственных 24 продуктов студии. Right-to-win: студия — сама себе первый клиент (эскалации портфеля); AI Factory ставит деск в каждый новый билд по умолчанию. Analogy-чек: Cresta/Observe.AI — выучились на handoff-моментах контакт-центров, паттерн доказан. Занято? SDK-слой частично: HumanLayer (YC F24, ~$500K pre-seed — pivot в coding-IDE), gotoHuman. Позиционирование «корпус резолюций → авто-улучшение» свободно. G4: лабы добавят approval-примитивы (уже есть в Claude Code) — остаётся вертикальный корпус человеческих резолюций, недоступный на уровне API. K1: ежедневно (каждая эскалация).

4. FactoryBench — should-cost/should-architecture бенчмарк агентных билдов

Формула: We build калиброванную БД «спека → архитектура → усилия → прод-исход → kill/scale» for энтерпрайзов (build-vs-buy DD), AI-агентств и студий solving «никто не знает, сколько реально стоит построить агента и какие архитектуры доживают до прода» via give-to-get бенчмарк: сдай свои build-данные — получи калиброванные оценки at подписка на бенчмарк + per-estimate отчёт для DD. Moat (P3+P2+P5): каждый билд/валидация → строка (оценка vs факт, архитектура vs надёжность) → ошибка эстимации падает → оценки становятся sales-артефактом → клиенты сдают свои данные ради калибровки. Лабы видят inference-токены, никогда — инженерные усилия, сроки и kill-решения. Отстройка от AgentActuary: build-time эстимация ДО прода vs его post-incident прод-индекс; кооперация — его $/task-фид как input. Seed: S2 — конвейер Workhold: ~24 параллельных билда + еженедельные kill/scale решения + cost-логи = стартовый корпус, которого нет ни у кого (agency видит билды, но не владеет исходами). Right-to-win: validation graveyard (#11 exhaust-скана) + AI Factory = обе стороны пары «решение→исход» в одних руках. Analogy-чек: RSMeans/Gordian — БД строительных смет, data-монополия десятилетиями; ISBSG в софт-эстимации. Занято? Разовые блог-индексы (Build & Run Cost Index 2026, Ivern 200 задач) — живого корпуса нет. G4: вне поля зрения лаб полностью — им недоступны effort/outcome данные. K1: еженедельно (каждое kill/scale решение + запросы оценок) — на нижней границе, честно.

5. EvidenceOS — конвейер EU AI Act evidence-паков + корпус auditor-acceptance

Формула: We build runtime evidence-pipeline (Art. 12 логи → регулятор-презентабельные паки) for деплойеров high-risk агентов solving «Datadog/Vanta не производят формат, который примет AI Office; enforcement 2 авг 2026» via hash-chained журнал решений агента + БД «какой формат какой аудитор принял/отклонил» at €1–3k/mo per agent-system (Vanta-бенчмарк $10–30k/yr). Moat (P7+P3): каждый пройденный аудит → пара (формат доказательства, вердикт аудитора) → acceptance-приоры per notified body → паки пре-валидированы → аудиты быстрее → больше аудитов через нас. Код это не соберёт: корпус требует отношений с аудиторской стороной. Кооперация с AgentActuary: его таксономия инцидентов = классы evidence. Seed: S2+S1: продукты Workhold сами обязаны комплаиться к августу (dogfood) + reg-heavy BU холдинга (психиатрия, финансы, каннабис) = captive first high-risk деплойеры. Right-to-win: 24 продукта = 24 evidence-пака до первого внешнего клиента; AmA даёт high-risk вертикали, куда чистые dev-тулы не дотягиваются. Analogy-чек: Vanta/Drata (compliance-automation ~$4B паттерн; сами публично не покрывают runtime AI-records). Занято? Рано-занято: Agent Audit (UK) уже продаёт evidence-паки; LangChain issue #35357 по Art.12-логированию открыт = G4-давление. Выживает только acceptance-корпус, не фича логирования — честно. G4: LangChain/лабы дадут structured logging — останется корпус вердиктов аудиторов + вертикальные шаблоны. K1: ежедневно (логи непрерывно, паки еженедельно).


Отброшено (одной строкой)

Топ-1: Seismo

Единственная карточка, где G4 закрыт структурно, а не тактически: лаба не может быть аудитором самой себя — нейтральность не копируется фичей. Плюс нулевой cold start: 24 продукта × ежедневные eval-раны = сенсорная сетка уже работает, петля компаундит с первого дня без единого внешнего клиента.