AI update: 23 липня 2026
ai · 2026-07-23
1. Що мало значення в AI за останню добу
- Production-агенти отримують packaged operating model. OpenAI представила Presence: voice/chat агенти з policy, approved actions, evals, simulations, escalation rules і Codex-powered improvement loop. Сигнал: enterprise купує не “розумну відповідь”, а керовану зміну поведінки агента після запуску.
- AI-ризик уже має фінансову ціну. WitnessAI пише: 70% enterprise-респондентів використовують або пілотують autonomous agents, але лише 18% мають повний security-approved inventory; 43% повідомили $2M+ витрат від AI-related інцидентів за рік (PRNewswire).
- Agent control plane заходить у великі regulated компанії. Manulife розширює пʼятирічну угоду з Microsoft, розгортає Copilot для 30k+ працівників і Microsoft Agent 365 як шар governance, monitoring і security для агентів (PRNewswire). Це вже не лабораторний пілот.
- Mobile agents мають небезпечний host bridge. Дослідники показали атаки на AppAgent, AppAgentX, Mobile-Agent-v3, Open-AutoGLM і MobA: invisible screen text може змусити агента набрати shell payload і виконати команду на PC, який керує телефоном (The Hacker News, arXiv).
- Physical-world agents потребують окремих evals. Hy-Embodied-VLM-1.0 пропонує taxonomy для action-relevant state understanding, action-transition reasoning і sequential/adaptive reasoning на 38 benchmarks (arXiv). Для robotics/simulation це корисніше за загальні multimodal leaderboard-и.
2. На що звернути увагу
- Inventory агентів стає базовим security control: без owner, identity, tools, permissions і audit trail немає керованого ризику.
- “Approved actions” важливіші за красивий prompt: дія має проходити policy, authorization, logging і rollback-план.
- Mobile/desktop automation — це не UI convenience, а privileged automation bridge; screenshot paths, shell escaping і ADB/CLI wrappers треба threat-modelити.
- Evals мають покривати recovery, escalation і degraded modes, а не лише happy-path task completion.
3. Практичні best practices
- Ведіть agent registry: owner, бізнес-задача, модель, tools, data scope, identity, environments, approvals, останній eval.
- Для кожної дії агента задайте рівень: read-only, reversible write, external side effect, destructive/high-risk. Останні два — тільки через approval gate.
- Забороніть shell interpolation із model output. Будь-який CLI/ADB/browser automation wrapper має мати escaping, allowlist команд і structured arguments.
- Міряйте cost per accepted outcome: успішні задачі, ескалації, latency, tool calls, повторні спроби, human review час, incident cost.
- Після production запуску тримайте changelog поведінки агента: що змінилось, через яку evidence, хто затвердив, як відкотити.
4. Ідеї для ефективного реального використання
- Customer-support agent: почати з вузького workflow, наприклад billing dispute, з чіткими approved actions і escalation triggers.
- Finance assistant: не “сам платить рахунки”, а готує evidence pack, перевіряє policy exceptions і просить approval для платежу.
- Mobile QA agent: тестує Android flows, але всі ADB/host команди йдуть через безпечний wrapper без shell passthrough.
- Security governance bot: щодня порівнює agent registry із реальною telemetry і знаходить тіньові агенти або drift permissions.
5. 10 практичних ідей використання OpenClaw як references/use-cases
- Agent registry maintainer — OpenClaw щодня збирає список локальних/cron/subagent workflows, owner, tools і permissions у markdown inventory.
- Approved-action gate — перед зовнішньою дією OpenClaw формує короткий risk card: що буде зроблено, blast radius, rollback, потрібне approval.
- Automation wrapper reviewer — сканує scripts, які передають model output у shell/ADB/browser automation, і відкриває patch із structured arguments.
- Cost-per-outcome ledger — рахує для Hugo/DevSecOps задач не tokens, а accepted output, час, retries, failures і вартість помилки.
- Escalation rule tester — генерує test cases, де агент має не діяти, а передати людині: гроші, prod, secrets, legal, destructive ops.
- Policy drift diff — порівнює SOUL/USER/AGENTS/cron payloads і показує, де живі job-и вже не відповідають поточним правилам.
- Mobile-agent lab notebook — для Android/iOS automation зберігає commands, screenshots, permissions і findings як reproducible security notes.
- Hugo freshness auditor — перед публікацією шукає повторені URLs, headlines і теми, потім пропонує нові кути без дублювання.
- Incident evidence packer — при збої агента збирає timeline, prompts, tool calls, changed files, git diff і короткий RCA draft.
- Real-world eval harness — OpenClaw запускає маленькі сценарії для власних workflows: publish post, update memory, schedule reminder, reject unsafe action, recover after failed build.