Files
obsidian-vault/personal/projects/personal-os/ai-agent-landscape-2026.md
T

11 KiB
Raw Blame History

tags, created, updated, related
tags created updated related
research
agents
landscape
ai
trends
2026-09-02 2026-09-02
personal-os-architecture
hermes-agent-improvements
agent-memory-architecture

AI Agent Landscape — прогресс и тренды (сентябрь 2026)

Запрос Whale: «какой сейчас прогресс и что трендится в ИИ-агентских системах как замена текущему Hermes-конфигу». Дата обзора: 2026-09-02. Ниша Whale = self-hosted, always-on персонал-агент (Hermes + Obsidian-MCP + cron + webhook + Zulip).

Главный вывод

Hermes Agent — не «устаревший конфиг», а один из двух доминирующих open-source рантаймов в своей нише (личный self-hosted агент с memory/skills). Поле «замен» в этой категории очень узкое, и ближайший конкурент OpenClaw не является функциональной заменой, а скорее дополнением (или сценарием «полного переезда», невыгодным после вложенных кастомизаций). Плюс есть движок «пилотирования» / оркестратора сверху.

Тренды отрасли (2026)

  • От демо к инфраструктуре: 2026 = год, когда агенты перестали быть демо и стали инфраструктурой. Автономность измеряется «как долго агент работает до вмешательства человека» (Prosus State of AI Agents).
  • Adoption gap 48×: 88% orgs используют AI в ≥1 функции, но только 17–23% разворачивают агентов; ≤10% в каждой отдельной функции. Gartner: 40% агент-проектов отменят к 2027 (неясный ROI).
  • Фреймворк-использование ≠ звёзды GitHub: OpenClaw 345373K★, Hermes ~110160K★. Но по фактическому объёму токенов Hermes берёт верх (8.14 трлн cumulative, #1 на OpenRouter с ~апреля-мая 2026). Kейс «звёзды измеряют любопытство, токены — работу».
  • Модельная универсальность = стандарт: маршрутизация (дорогая модель на сложный reasoning, дешёвая — на фон) едва ли не главный рычаг экономии. Спред 100×+ (open-weight $0.070.12/1M против фронтира $15/1M).
  • Память стала конкурентным преимуществом: gap «есть/нет памяти» важнее gap между backbone-моделями. Три уровня (episodic/semantic/procedural) + proc-memory (навыки как процедурная память) — распространённая зрелая архитектура (ваша уже так построена).
  • Governance/ROI/security — блокер масштабирования: лучшие практики — least-privilege creds, approval на destructive-действия, аудит скиллов до установки.
  • Регулирование: EU AI Act high-risk требования вступают в силу с 2026-08-02. Прозрачность фондовых моделей падает (Stanford Transparency Index 40 vs 58 в 2025) → риск для procurement.

Матрица «замен» применительно к Whale-конфигу

1. OpenClaw — НЕ замена, конкурент/гибрид

  • Gateway «control plane», первая-class интеграции с мессенджерами, 13.7K+ community-скиллов.
  • Слабее Hermes по: self-improving learning loop (у OpenClaw скиллы статичны/человеко-писаны), память кросс-сессионная слабее, нет checkpoint/rollback.
  • Security-инциденты: CVE-2026-25253 (RCE, CVSS 8.8, 40K+ инстансов раскрыты, 63% уязвимы на момент), 341 вредоносных скилла в ClawHub (supply-chain poisoning).
  • Миграция: у Hermes есть hermes claw migrate.
  • Паттерн комьюнити (~25% Reddit): OpenClaw как оркестратор + Hermes как исполнитель (через ACP/profiles).

2. Кодинг-агенты (Claude Code, Cursor, OpenHands, Swarm…) — НЕ в этой нише

  • Если работа — в основном кодинг → релевантны, но способности OpenHands (72% SWE-Bench) к персональному always-on агенту отношения не имеют. Whale этим заниматься не должен.

3. Узкие фреймворки (LangGraph, CrewAI, Microsoft Agent Framework, Google ADK, OpenAI Agents SDK, Mastra, AutoGen)

  • Это продукт-ориентированные SDK для building apps, НЕ self-hosted персональные рантаймы. Для Whale-сценария — не конкуренты. Полезны как справочник паттернов (оракестрация, human-in-the-loop, observability), но переписывать на них личную систему незачем.
    • LangGraph: state control / durable execution лидирует (38M PyPI downloads/mo, v1.0).
    • CrewAI: ~4449K★, role-based teams, 82% task success, но pain points (async, отладка, память).
    • Microsoft Agent Framework: наследник AutoGen+Semantic Kernel.
    • OpenAI Agents SDK: «opinionated handoff», простые multi-agent.
    • AutoGen/AG2: Microsoft перевёл в maintenance (заменён Agent Framework).

Куда движется поле — тренды, релевантные Whale

a) Длительный автономный ран (суверенность)

  • «Deep Agents»/harness для long-running задач (research/coding): планирование + context management. Прямой аналог широты ваших cron-agent'ов.
  • Валюта рынка = continuous-time autonomy; ставит вопрос о функциях типа pause/resume, отмена mid-flight у Whale агентов.

b) Пилотирование/проактивность

  • Трендовые личные агенты (rho «checks in on its own», Gaia с расписаниями) — эксперимент: агент сам инициирует. У вас уже есть cron-слой (по расписанию) и watchdogs; рынок двигается в сторону условно-событийной проактивности (не только по таймеру).
  • Дуальность «timer-driven vs event-driven automation» — зрелая тема в memory stacks (event-driven triggers: new source→ingest etc.). Частично покрыто вашей архитектурой, но выраженно event-driven (на изменения в vault, новые MCP-инструменты) — точка роста.

c) Память и контекст

  • Summarization drift и overflow правила (это у вас уже есть).
  • Confidence scoring + temporal decay (smart-aвторы памяти: Mem0/Letta/LangMem pattern) — ваш MEMORY.md overflow и curation похожи, но «система без явного scoring» может добавить confidence + decay для SEMANTIC.
  • Сторонние движки памяти (Letta/Mem0/Agno memory) — кандидаты на «апгрейд» semantic-tier позже, но сегодня у вас связка собственный MEMORY + SQLite already.

d) Observability / отладка агентов

  • LangSmith/её аналоги + «action trace против фактического исполнения» — известная боль CrewAI (traces не отражают реальное исполнение). У вас подход «facts over self-reports», verify handles — уже в правильную сторону. Формальный лог «намерение→факт» — вещь, которую рынок догоняет.

e) Физический/десктопный контур

  • Desktop app (Hermes v0.16 native desktop, June 2026) и iMessage-support (Photón/Agents, v0.17 June 2026) — движение к «агент в каждом приложении». Вы on macOS + webhook/Zulip — десктопный/локальный контур для вас опционален (Apple-скиллы уже есть: Notes/Reminders/FindMy).

Рекомендации (кратко)

  1. Гонку «сменить фреймворк» не выигрывает никто из альтернатив — текущий Hermes-конфиг уже implemented лучшие практики (3-tier memory, skills как proc-memory, SOUL.md, Observable vault-as-truth). Switching = решение проблем, которых у вас нет, ценой переписывания кастомизаций.
  2. Присмотреться к OpenClaw исключительно как к оркестратору на дополнительных каналах/аппах, если появится потребность «один агент во всех чатах» шире текущих (webhook/Zulip + локальные скиллы). Не как замена.
  3. Усилить event-driven проактивность (триггеры на изменение vault/новые файлы/сигналы) поверх timer-driven cron.
  4. Security posture как у фронтира: least-privilege, approval на деструктив, аудит любых устанавливаемых скиллов (урок из ClawHub poisoning + собственный CVE-опыт Hermes v0.16).
  5. Модельная маршрутизация — самый дешёвый рычаг снижения токен-расхода в личной системе в 2026.
  6. Не полагаться на звёзды как на критерий при сравнении — смотреть на устойчивый объём работы (у Hermes он вверху — #1 OpenRouter).

Источники

  • DEV: 10 Best Open-Source AI Agents 2026
  • Turing Post: Hermes Agent vs OpenClaw (2026-06-13)
  • HundredTabs: Hermes vs OpenClaw honest comparison (2026-05-10) — 1,300+ Reddit comments
  • Context Studios: OpenClaw vs Hermes 2026 (2026-06-22)
  • LangChain: best AI agent frameworks 2026 (2026-06-06)
  • DigitalApplied: State of AI Agents 2026 (220+ data points, 2026-05-22) — McKinsey/Stanford HAI/Gartner/IDC
  • openclaw/hermes GitHub (статистика на дату обзора)