[2026-09-02] eagle: personal/projects/personal-os/ai-agent-landscape-2026.md
This commit is contained in:
@@ -0,0 +1,91 @@
|
||||
---
|
||||
tags:
|
||||
- research
|
||||
- agents
|
||||
- landscape
|
||||
- ai
|
||||
- trends
|
||||
created: '2026-09-02'
|
||||
updated: '2026-09-02'
|
||||
related:
|
||||
- personal-os-architecture
|
||||
- hermes-agent-improvements
|
||||
- agent-memory-architecture
|
||||
---
|
||||
# AI Agent Landscape — прогресс и тренды (сентябрь 2026)
|
||||
|
||||
> Запрос Whale: «какой сейчас прогресс и что трендится в ИИ-агентских системах как замена текущему Hermes-конфигу».
|
||||
> Дата обзора: 2026-09-02. Ниша Whale = self-hosted, always-on персонал-агент (Hermes + Obsidian-MCP + cron + webhook + Zulip).
|
||||
|
||||
## Главный вывод
|
||||
|
||||
**Hermes Agent — не «устаревший конфиг», а один из двух доминирующих open-source рантаймов в своей нише** (личный self-hosted агент с memory/skills). Поле «замен» в этой категории очень узкое, и ближайший конкурент OpenClaw не является функциональной заменой, а скорее дополнением (или сценарием «полного переезда», невыгодным после вложенных кастомизаций). Плюс есть движок «пилотирования» / оркестратора сверху.
|
||||
|
||||
## Тренды отрасли (2026)
|
||||
|
||||
- **От демо к инфраструктуре**: 2026 = год, когда агенты перестали быть демо и стали инфраструктурой. Автономность измеряется «как долго агент работает до вмешательства человека» (Prosus State of AI Agents).
|
||||
- **Adoption gap 4–8×**: 88% orgs используют AI в ≥1 функции, но только 17–23% разворачивают агентов; ≤10% в каждой отдельной функции. Gartner: 40% агент-проектов отменят к 2027 (неясный ROI).
|
||||
- **Фреймворк-использование ≠ звёзды GitHub**: OpenClaw 345–373K★, Hermes ~110–160K★. Но по фактическому объёму токенов Hermes берёт верх (8.14 трлн cumulative, #1 на OpenRouter с ~апреля-мая 2026). Kейс «звёзды измеряют любопытство, токены — работу».
|
||||
- **Модельная универсальность = стандарт**: маршрутизация (дорогая модель на сложный reasoning, дешёвая — на фон) едва ли не главный рычаг экономии. Спред 100×+ (open-weight $0.07–0.12/1M против фронтира $15/1M).
|
||||
- **Память стала конкурентным преимуществом**: gap «есть/нет памяти» важнее gap между backbone-моделями. Три уровня (episodic/semantic/procedural) + proc-memory (навыки как процедурная память) — распространённая зрелая архитектура (ваша уже так построена).
|
||||
- **Governance/ROI/security — блокер масштабирования**: лучшие практики — least-privilege creds, approval на destructive-действия, аудит скиллов до установки.
|
||||
- **Регулирование**: EU AI Act high-risk требования вступают в силу с 2026-08-02. Прозрачность фондовых моделей падает (Stanford Transparency Index 40 vs 58 в 2025) → риск для procurement.
|
||||
|
||||
## Матрица «замен» применительно к Whale-конфигу
|
||||
|
||||
### 1. OpenClaw — НЕ замена, конкурент/гибрид
|
||||
- Gateway «control plane», первая-class интеграции с мессенджерами, 13.7K+ community-скиллов.
|
||||
- Слабее Hermes по: self-improving learning loop (у OpenClaw скиллы статичны/человеко-писаны), память кросс-сессионная слабее, нет checkpoint/rollback.
|
||||
- **Security-инциденты**: CVE-2026-25253 (RCE, CVSS 8.8, 40K+ инстансов раскрыты, 63% уязвимы на момент), 341 вредоносных скилла в ClawHub (supply-chain poisoning).
|
||||
- Миграция: у Hermes есть `hermes claw migrate`.
|
||||
- *Паттерн комьюнити* (~25% Reddit): **OpenClaw как оркестратор + Hermes как исполнитель** (через ACP/profiles).
|
||||
|
||||
### 2. Кодинг-агенты (Claude Code, Cursor, OpenHands, Swarm…) — НЕ в этой нише
|
||||
- Если работа — в основном кодинг → релевантны, но способности OpenHands (72% SWE-Bench) к персональному always-on агенту отношения не имеют. Whale этим заниматься не должен.
|
||||
|
||||
### 3. Узкие фреймворки (LangGraph, CrewAI, Microsoft Agent Framework, Google ADK, OpenAI Agents SDK, Mastra, AutoGen)
|
||||
- Это **продукт-ориентированные SDK для building apps**, НЕ self-hosted персональные рантаймы. Для Whale-сценария — не конкуренты. Полезны как справочник паттернов (оракестрация, human-in-the-loop, observability), но переписывать на них личную систему незачем.
|
||||
- LangGraph: state control / durable execution лидирует (38M PyPI downloads/mo, v1.0).
|
||||
- CrewAI: ~44–49K★, role-based teams, 82% task success, но pain points (async, отладка, память).
|
||||
- Microsoft Agent Framework: наследник AutoGen+Semantic Kernel.
|
||||
- OpenAI Agents SDK: «opinionated handoff», простые multi-agent.
|
||||
- AutoGen/AG2: Microsoft перевёл в maintenance (заменён Agent Framework).
|
||||
|
||||
## Куда движется поле — тренды, релевантные Whale
|
||||
|
||||
### a) Длительный автономный ран (суверенность)
|
||||
- «Deep Agents»/harness для long-running задач (research/coding): планирование + context management. Прямой аналог широты ваших cron-agent'ов.
|
||||
- Валюта рынка = **continuous-time autonomy**; ставит вопрос о функциях типа pause/resume, отмена mid-flight у Whale агентов.
|
||||
|
||||
### b) Пилотирование/проактивность
|
||||
- Трендовые личные агенты (rho «checks in on its own», Gaia с расписаниями) — эксперимент: агент сам инициирует. У вас уже есть cron-слой (по расписанию) и watchdogs; рынок двигается в сторону **условно-событийной** проактивности (не только по таймеру).
|
||||
- Дуальность «timer-driven vs event-driven automation» — зрелая тема в memory stacks (event-driven triggers: new source→ingest etc.). Частично покрыто вашей архитектурой, но выраженно event-driven (на изменения в vault, новые MCP-инструменты) — точка роста.
|
||||
|
||||
### c) Память и контекст
|
||||
- **Summarization drift** и overflow правила (это у вас уже есть).
|
||||
- Confidence scoring + temporal decay (smart-aвторы памяти: Mem0/Letta/LangMem pattern) — ваш MEMORY.md overflow и curation похожи, но «система без явного scoring» может добавить confidence + decay для SEMANTIC.
|
||||
- Сторонние движки памяти (Letta/Mem0/Agno memory) — кандидаты на «апгрейд» semantic-tier позже, но сегодня у вас связка собственный MEMORY + SQLite already.
|
||||
|
||||
### d) Observability / отладка агентов
|
||||
- LangSmith/её аналоги + «action trace против фактического исполнения» — известная боль CrewAI (traces не отражают реальное исполнение). У вас подход «facts over self-reports», verify handles — уже в правильную сторону. Формальный лог «намерение→факт» — вещь, которую рынок догоняет.
|
||||
|
||||
### e) Физический/десктопный контур
|
||||
- Desktop app (Hermes v0.16 native desktop, June 2026) и iMessage-support (Photón/Agents, v0.17 June 2026) — движение к «агент в каждом приложении». Вы on macOS + webhook/Zulip — десктопный/локальный контур для вас опционален (Apple-скиллы уже есть: Notes/Reminders/FindMy).
|
||||
|
||||
## Рекомендации (кратко)
|
||||
|
||||
1. **Гонку «сменить фреймворк» не выигрывает никто из альтернатив** — текущий Hermes-конфиг уже implemented лучшие практики (3-tier memory, skills как proc-memory, SOUL.md, Observable vault-as-truth). Switching = решение проблем, которых у вас нет, ценой переписывания кастомизаций.
|
||||
2. **Присмотреться к OpenClaw** исключительно как к оркестратору на *дополнительных* каналах/аппах, если появится потребность «один агент во всех чатах» шире текущих (webhook/Zulip + локальные скиллы). Не как замена.
|
||||
3. **Усилить event-driven проактивность** (триггеры на изменение vault/новые файлы/сигналы) поверх timer-driven cron.
|
||||
4. **Security posture как у фронтира**: least-privilege, approval на деструктив, аудит любых устанавливаемых скиллов (урок из ClawHub poisoning + собственный CVE-опыт Hermes v0.16).
|
||||
5. **Модельная маршрутизация** — самый дешёвый рычаг снижения токен-расхода в личной системе в 2026.
|
||||
6. **Не полагаться на звёзды как на критерий** при сравнении — смотреть на устойчивый объём работы (у Hermes он вверху — #1 OpenRouter).
|
||||
|
||||
## Источники
|
||||
- DEV: 10 Best Open-Source AI Agents 2026
|
||||
- Turing Post: Hermes Agent vs OpenClaw (2026-06-13)
|
||||
- HundredTabs: Hermes vs OpenClaw honest comparison (2026-05-10) — 1,300+ Reddit comments
|
||||
- Context Studios: OpenClaw vs Hermes 2026 (2026-06-22)
|
||||
- LangChain: best AI agent frameworks 2026 (2026-06-06)
|
||||
- DigitalApplied: State of AI Agents 2026 (220+ data points, 2026-05-22) — McKinsey/Stanford HAI/Gartner/IDC
|
||||
- openclaw/hermes GitHub (статистика на дату обзора)
|
||||
Reference in New Issue
Block a user