НЕДЕЛЯ · 31 АВГУСТА–7 СЕНТЯБРЯ 2026

AI-статьи недели
с Хабра

Девять практических материалов о проверках агентов, границах экспериментов и пилотах, которые можно повторить в своей команде.

9 карточек4 на заметку289 исходных статей226 ранжировано15 решений211 ожидают решения36 полных текстов сохранено
📝 О чём пишут

Главная тема недели — не выбор модели, а проверяемость её работы. Авторы предлагают отделять завершённость от качества, результат от уверенного ответа, а траекторию команды агентов — от финального статуса. Практика начинается с маленького пилота, ясного ограничения и измеримой проверки.

01

Стоит попробовать

Воронка: 289 исходных статей → 226 ранжированных → 15 индивидуальных решений: 9 карточек, 6 заметок, 0 отказов. Ещё 211 ранжированных материалов ожидают решения. Ограничения указаны прямо в карточках.

01

Независимый гейт не даёт агенту принять собственную работу

✍ Андрей ИльинХабр⏱ ≈12 минИскусственный интеллектУправление разработкой
О чём

Отделите исполнителя от проверяющего: второй проход получает только артефакты и пишет вердикт в отдельный файл.

🔑 Главное
  • Отдельный verifier и файл вердикта; автор описывает этот порядок как самостоятельную процедуру.
  • Ограничение: выводы и цифры относятся к условиям автора; перенимайте проверяемый приём, а не обещанный результат.
⚡ Попробовать за вечер
  • Создайте work.md и review.md; запустите verifier без истории чата; блокируйте выпуск без PASS.
  • Метрика: доля FAIL и время до независимого вердикта за 10 задач.
02

Поставьте лимит сессии агента и измеряйте её рост

✍ Дмитрий КаргинХабр⏱ ≈8 минИскусственный интеллектМашинное обучение
О чём

Автор показывает диагностику контекста Claude Code: журнал, пороги и перенос задачи в новую сессию.

🔑 Главное
  • В статье есть пороги 120 запросов и 150 для жёсткой остановки, а также разбор истории сессии.
  • Ограничение: выводы и цифры относятся к условиям автора; перенимайте проверяемый приём, а не обещанный результат.
⚡ Попробовать за вечер
  • Снимите число запросов и размер контекста; добавьте Stop-hook; при пороге перенесите задачу через /carry.
  • Метрика: запросы и токены на завершённую задачу до и после ограничения.
03

Проверяйте стиль текста скриптом, а не впечатлением

✍ Вячеслав СтарцевХабр⏱ ≈8 минИскусственный интеллектМашинное обучение
О чём

Навыки строят профиль по корпусу и сверяют черновик с формальными признаками до публикации.

🔑 Главное
  • Есть установка навыка, команды зависимостей и проверка style.py check; отклонения сократились с 14/31 до 2/31 в авторском корпусе.
  • Ограничение: выводы и цифры относятся к условиям автора; перенимайте проверяемый приём, а не обещанный результат.
⚡ Попробовать за вечер
  • Установите навык и зависимости; соберите свой корпус; запустите проверку на черновике.
  • Метрика: число отклонений по собственному стилевому профилю.
04

Гейты для детектора prompt injection важнее одной точности

✍ nepryakhinХабр⏱ ≈19 минБлог компании AGIMAИнформационная безопасность
О чём

Прод-кейс дообучения guard-модели показывает, как не обменять пропущенные атаки на красивую метрику.

🔑 Главное
  • Автор разделяет данные по инициаторам, проверяет базовую модель без адаптера и держит гейт слепых зон с перефразировками.
  • Ограничение: выводы и цифры относятся к условиям автора; перенимайте проверяемый приём, а не обещанный результат.
⚡ Попробовать за вечер
  • Соберите отложенный набор по авторам; добавьте гейт известных атак; сравните адаптер с базовой моделью перед rollout.
  • Метрика: полнота по гейту слепых зон и ложные блокировки на рабочих текстах.
05

Тестируйте артефакт агента по журналу вызовов

✍ Чичев МаксимХабр⏱ ≈8 минБлог компании Петрович-ТехИскусственный интеллект
О чём

Личный стенд сравнивает модели на цепочках из 2, 3 и 15 шагов и предлагает сверять не ответ, а созданный результат.

🔑 Главное
  • На 15 шагах ни один из девяти прогонов не прошёл целиком; переносится метод заморозить всё кроме модели и сверять файл с журналом инструментов.
  • Ограничение: выводы и цифры относятся к условиям автора; перенимайте проверяемый приём, а не обещанный результат.
⚡ Попробовать за вечер
  • Зафиксируйте промпт, инструменты и данные; запустите несколько прогонов; сравните артефакт с журналом вызовов.
  • Метрика: доля корректных артефактов отдельно от доли правдоподобных ответов.
06

Сначала проверьте, что результат целый, потом оценивайте качество

✍ innokentyBoХабр⏱ ≈9 минМашинное обучениеИскусственный интеллект
О чём

Completion gate отделяет валидный и законченный артефакт от содержательной оценки и не смешивает их в один процент.

🔑 Главное
  • После повторной проверки из 21 исторической записи только четыре оказались целыми для дальнейшей оценки; у каждой метрики свой знаменатель.
  • Ограничение: выводы и цифры относятся к условиям автора; перенимайте проверяемый приём, а не обещанный результат.
⚡ Попробовать за вечер
  • Опишите обязательные документы и ссылки; проверьте JSON и заглушки кодом; отправляйте дальше только целые результаты.
  • Метрика: completion rate и quality pass rate с разными знаменателями.
07

Проверяйте траекторию мультиагентной работы инвариантами

✍ Дима КосаревскийХабр⏱ ≈11 минPythonИскусственный интеллект
О чём

CoCoBench показывает, почему зелёный финальный тест не доказывает корректный порядок действий агентов.

🔑 Главное
  • Для трассы предлагаются детерминированные проверки: один writer на ветку и запуск тестов после изменения кода; опубликованы код и 897 сценариев.
  • Ограничение: выводы и цифры относятся к условиям автора; перенимайте проверяемый приём, а не обещанный результат.
⚡ Попробовать за вечер
  • Сохраняйте события и захваты ресурсов; добавьте инварианты порядка; проверьте их обычным кодом.
  • Метрика: нарушения порядка, дубли работы и одновременные владельцы ресурса.
08

Начинайте микроавтоматизацию с одной повторяемой боли

✍ ШухратХабр⏱ ≈7 минУправление разработкойDevOps
О чём

Кейс показывает, как небольшой внутренний сервис снимает ручные действия вокруг релиза и командных ритуалов.

🔑 Главное
  • Автор предлагает сначала выбрать узкую повторяемую задачу, проверить её на одном-двух людях и только затем расширять на команду.
  • Ограничение: выводы и цифры относятся к условиям автора; перенимайте проверяемый приём, а не обещанный результат.
⚡ Попробовать за вечер
  • Выберите одну ручную операцию; сделайте минимальный сценарий; проверьте его на двух пользователях.
  • Метрика: число ручных шагов и время цикла до и после пилота.
09

Начинайте AI-пилот с узкой повторяемой встречи

✍ Чернов Михаил ИвановичХабр⏱ ≈11 минБлог компании Альфа-БанкБлог компании Конференции Олега Бунина (Онтико)
О чём

Прод-кейс перестройки PDLC начинается с оценки задач: агент использует уже известные описания и историю оценок, а человек остаётся в контуре.

🔑 Главное
  • После 1,5 месяца пилота сходимость оценок с ручными достигла 95%; авторы оставили валидацию за техлидами.
  • Ограничение: выводы и цифры относятся к условиям автора; перенимайте проверяемый приём, а не обещанный результат.
⚡ Попробовать за вечер
  • Выберите повторяемую встречу; соберите доступные входы; запустите пилот с обязательной человеческой валидацией.
  • Метрика: сходимость с ручным решением и часы, снятые с регулярной встречи.
02

На что обратить внимание

Опубликованы 4 из 6 материалов с решением «на заметку»; ещё два остаются в локальном рабочем отборе и не показаны публично.

RAG без неполного рецепта

Гибридный поиск интересен, но в статье не хватает реализаций ключевых функций. Берите идею RRF в собственный стенд.

1074156 · Хабр ↗

Сравнение AI-ревью

Мутационное тестирование полезно как подход, но набор и скрипты автора не опубликованы.

1077470 · Хабр ↗

Токены дизайн-системы

Семь шагов зависят от закрытых шаблонов и плагина Pixso; полноценного самостоятельного пути в статье нет.

1078626 · Хабр ↗

RAG в медицинском домене

Разделение стадий и JSON-схема полезны, но семантическая проверка ещё не завершена.

1078858 · Хабр ↗
03

Мой план на неделю

Добавить независимый verifier и completion gate в один агентный поток.до среды
Собрать десять трасс и проверить порядок операций инвариантами.до пятницы
Выбрать одну повторяемую встречу для AI-пилота с человеческой валидацией.до воскресенья
04

Данные выпуска

ОКНО31 августа — 7 сентября 2026, Europe/Moscow
ВОРОНКА289 исходных → 226 ранжированных → 15 индивидуальных решений: 9 карточек, 6 заметок, 0 отказов → 211 ожидают решения
ТЕКСТЫ36 полных текстов сохранено в рабочем кэше
ПОКРЫТИЕВсе профильные ленты покрывают окно; top_weekly — штатный top-100
МЕДИА0 использовано: ведущие изображения не несли данных для карточек
РЕШЕНИЯПубличная страница показывает итог отбора; рабочий журнал не публикуется.