← все посты

AI Ops

Эксплуатация AI-систем в production

Память AI-агента: sessions, long-term state и retrieval

Туториалы AI Ops

Как спроектировать память AI-агента без data swamp: session state, durable facts, retrieval, provenance, conflicts, privacy, deletion и evaluation.

Безопасность MCP: OAuth, права tools и prompt injection

Туториалы AI Ops

Практический гайд по безопасности MCP: OAuth и audience binding, least privilege для tools, защита от prompt injection, sandbox, audit logs и тесты.

Production LLM Stack: роутинг, evals и надежность

Туториалы AI Ops

Практическая архитектура production LLM: контракты, роутинг моделей, инструменты, валидация, наблюдаемость, evals, бюджеты и безопасные релизы.

Тестирование AI агентов: как убедиться что агент работает

AI Ops

Практическое руководство по тестированию AI агентов: unit/integration/e2e тесты, eval frameworks (DeepEval 4.0, RAGAS, Promptfoo, Braintrust), метрики, CI/CD pipeline. С примерами кода.

Context Engineering vs RAG: когда что использовать

AI Ops

Глубокое сравнение context engineering и RAG: когда long context заменяет retrieval, когда нужен RAG, decision framework и современный стек 2026.

AI агенты: полный гайд - что это, как создать, где использовать

AI Ops

Исчерпывающее руководство по AI агентам: архитектура, фреймворки (LangGraph, CrewAI, OpenAI Agents SDK, Google ADK, Pydantic AI, MCP), практические use cases и пошаговый туториал.

Библиотека промптов: шаблон из 5 частей

Туториалы AI Ops

5-компонентный шаблон промптов для переиспользуемой библиотеки. Структура, примеры для разных задач, организация и версионирование prompt library.

Оптимизация LLM-расходов: стоимость успешной задачи

Кейсы и практика AI Ops

Снижаем LLM spend без скрытой потери качества: cost attribution, output budgets, проверка smaller models, безопасный cache, batch и контроль retries.

Kronos Agent OS: self-hosted runtime для AI-агентов

Инженерия AI Ops

Проверяемый разбор KAOS v0.3.0: durable turns, память, MCP tools, governance, поведенческие evals, перенос состояния и безопасные defaults.

Human-in-the-Loop для AI: как строить approval gates

Туториалы AI Ops

Проектируем human oversight для AI: risk tiers, state machine согласования, routing signals, reviewer UX, queue SLA, audit logs и метрики релиза.

Prompt A/B Testing: как научно улучшать качество ответов AI

Туториалы AI Ops

Методология A/B тестирования промптов: метрики качества, статистическая значимость, инструменты (Langfuse, DeepEval). Пошаговое руководство от гипотезы до production-решения.

Промпт-инженерия в production: версии, evals и rollback

Туториалы AI Ops

Практическая система управления промптами: версии, eval-датасеты, canary rollout, метрики по версиям, кеширование и безопасный rollback в Langfuse.

Мультиагентная система: архитектура и паттерны оркестрации AI-агентов

Туториалы AI Ops

Как построить мультиагентную систему: паттерны оркестрации (Sequential, Parallel, Classifier+Router), маршрутизация задач, специализация агентов, примеры кода.

LLM-as-Judge: как построить calibrated quality gate

Туториалы AI Ops

Проектируем LLM judge: узкие rubrics, human calibration, deterministic checks, bias tests, CI gates, production sampling и защита от untrusted output.