AI-апдейт: агенти ламаються в процесах, edge-VLM і runtime authorization
ai · 2026-07-30
1. Що мало значення в AI за останню добу
- Ризик агентів змістився з “галюцинацій” у виконання. Дослідження ChatSee про 10 000+ enterprise AI failures каже: менше 10% проблем були hallucination-related, а 31,1% — провали resolution/escalation. Сигнал: агент може звучати правильно й усе одно не закрити задачу.
- Runtime authorization стає окремим шаром безпеки. Огляд Delinea / Neo / Nuggets показує зрілий напрям: перевіряти не тільки identity агента, а кожен tool call, DB query, SSH/Kubernetes/cloud action перед виконанням.
- Компактні multimodal-моделі рухають AI ближче до edge. Tether відкрила VisionPsy-Nano 460M для on-device OCR, document understanding і visual reasoning. Практичний кут: приватний первинний аналіз документів без відправки всього в cloud.
- Governance-дискусія стає менш добровільною. Brookings аргументує потребу федерального закону про AI governance, audits і відповідальність. Для команд це означає: audit trail і незалежна перевірка скоро будуть не “nice to have”.
2. На що звернути увагу
- Task completion > answer quality. Міряйте, чи агент реально завершив процес: ticket closed, escalation sent, diff applied, rollback possible.
- Action-level policy. “Агент має доступ до Kubernetes” — погана межа. Нормальна межа: які verbs, namespaces, ресурси, час, approval threshold.
- Edge AI як privacy pattern. Маленькі VLM корисні не для магії, а для локального triage: OCR, класифікація, redaction, routing.
- Auditability by design. Якщо workflow не може пояснити, хто дав агенту право діяти і що саме він зробив, його рано пускати в production.
3. Практичні best practices
- Описуйте agent workflow як state machine: trigger → inputs → allowed actions → success criteria → fallback → human escalation.
- Для кожного небезпечного tool call додайте pre-execution policy check: resource, intent, diff, blast radius, approval need.
- Логуйте outcome, не лише trace: resolved / escalated / partial / failed / unsafe / timed out.
- Для документів починайте з local extraction + redaction, а в cloud відправляйте тільки мінімальний фрагмент.
- Робіть evals не тільки на prompt injection, а й на workflow failure: missed escalation, wrong owner, duplicate action, silent partial completion.
4. Ідеї для ефективного реального використання
- Customer support: агент не “відповідає клієнту”, а веде case до стану resolved/escalated з доказом дії.
- DevSecOps: AI triage для alert-ів має створювати decision record: evidence, impacted assets, proposed action, owner.
- Back office: локальний VLM сортує рахунки/договори, вирізає PII, потім LLM готує короткий summary.
- Platform team: agent gateway має політики на tool calls так само, як API gateway має auth/rate limits.
- Compliance: кожна AI-дія з write-access отримує receipt: input hash, policy verdict, approver, diff, validation.
5. 10 практичних OpenClaw use-cases
- Workflow state board: OpenClaw щодня будує таблицю cron jobs як state machines: trigger, input, action, success signal, fallback.
- Runtime approval budget: для кожного агента задавати ліміт risky tool calls на день; перевищення переводить workflow у read-only режим.
- Outcome receipt ledger: після Hugo/job/git дій писати receipt з command, changed files, validation result і commit SHA.
- Local document preflight: перед аналізом PDF запускати локальний OCR/redaction, а в LLM передавати тільки потрібні фрагменти.
- Escalation simulator: раз на тиждень проганяти фейковий incident і перевіряти, чи OpenClaw правильно знаходить owner-а та канал повідомлення.
- Agent partial-failure detector: знаходити задачі, де текст “готово” є, але немає build/test/push/receipt або зміна не потрапила в git.
- Tool-call diff gate: перед write/edit/exec з високим ризиком OpenClaw формує короткий diff-план і просить approval тільки на конкретну дію.
- Private-to-public content scrubber: перед публікацією Hugo OpenClaw перевіряє draft на приватні імена, секрети, внутрішні шляхи й зайві operational details.
- Knowledge-vault freshness map: будувати карту сторінок vault за датою, джерелами й confidence, щоб старі твердження не ставали “памʼяттю”.
- Runbook gap finder: порівнювати фактичні tool traces з documented runbook і створювати задачу, якщо агент діє поза описаним процесом.