Инженер Lovable за полгода спустил на токены $85 000 — и теперь в одиночку закрывает по 150 пул-реквестов в неделю, столько раньше выдавала целая команда. Дело не в модели, а в том, как он выстроил рой агентов и кому доверил проверку. Ещё сегодня: Claude Fable за одну сессию перенёс старую Command & Conquer на iPhone, а безобидный комментарий под чужим роликом на YouTube вытаскивает названия приватных видео.
Главное за 30 секунд
- Инженер Lovable в одиночку мёржит 150 пул-реквестов в неделю: рой агентов, ИИ-классификатор рисков и мелкие пул-реквесты стопками.
- Claude Fable за одну сессию перенёс Command & Conquer Generals на Mac, iPhone и iPad — а это 1,6 млн строк кода на C++.
- Свежие Opus 4.8 и Sonnet 5 хуже старых моделей зовут нестандартные инструменты и подсовывают в JSON выдуманные поля.
- Комментарий под видео на YouTube через инъекцию промпта заставляет ИИ-ассистента слить названия приватных роликов; Google чинить отказался.
- GPT-5.5 в Codex часто обрывает мысль ровно на 516 токенах и молча выдаёт ответ хуже — проверяйте логи.
Внедряем и улучшаем
Как один человек мёржит 150 пул-реквестов в неделю
Инженер Lovable Александр Лебедев разложил свой рабочий процесс на живых цифрах. В январе он был обычным разработчиком с парой агентов, и удачной считалась неделя с 20–30 влитыми пул-реквестами. К июню — один человек над 6–7 агентами, у каждого свой рой субагентов, плюс отдельный агент-«прораб», который раздаёт остальным задачи. Удачная неделя теперь — 150+ влитых пул-реквестов. В первую неделю июня он влил 293 штуки, и ни один дефект не доехал до продакшена.
Расходы под стать: с ~$600 личных трат на токены в месяц он вырос до ~$25 000 на пике и ~$85 000 с января. Примерно 75% уходит прямо на написание кода, ~25% — на автоматику ревью и повторяющиеся задачи. Про экономию токенов он высказывается резко: «токеномаксинг — глупое и близорукое поведение». Совет — 5% внимания на экономию токенов, 95% на поиск задач, ради которых эти токены стоит жечь.
Главный сдвиг — человек уходит с построчного ревью наверх, к решениям. Код, написанный ИИ, читать построчно «непрактично и не лучшее применение времени». Вместо этого — разбор архитектуры, выбор инфраструктуры, парная отладка. Дословно: «одно обсуждение устройства системы может изменить её сильнее, чем 50 пул-реквестов».
Чтобы новичок не выкатил лишнего в продакшен, он собрал ИИ-классификатор рисков. Работает так:
- В основе — один markdown-файл с политикой. Агент читает его вместе с диффом и метаданными пул-реквеста и определяет размер, уровень риска и владельца кода.
- Правила простые. Инфраструктура или авторизация — всегда высокий риск. Публикация поста в блог — низкий. Слишком большой или чужой код — вверх по риску.
- Дальше «скучный детерминированный инструмент» применяет политику через GitHub Actions и правила веток — разрешить слияние или запретить.
По уровню риска — три дорожки: высокий → обязательное ревью человеком; средний → медленное дорогое ИИ-ревью; низкий → быстрое дешёвое ИИ-ревью.

Ещё три приёма, которые стоит забрать себе:
- Мелкие пул-реквесты стопками. На большом диффе качество ИИ-ревью резко падает. Пример: коллеге ИИ одобрил пул-реквест на 6 000 строк; разбили его на стопку мелких — и тот же ревьюер нашёл реальные баги. Большие изменения «человек и раньше не мог вычитать, теперь ясно, что и ИИ не может».
- Рискованные действия — через обёртку, а не прямые права. Агентам запрещено мёржить через
gh; они зовут «merge when ready» у Graphite, и сам вызов завёрнут в проверенный юнит-тестами скрипт. Ноль запросов на разрешения — иначе не будет автономии. - Фабрика чинит сама себя. Скиллы агент пишет себе сам; с января автор не написал вручную ни одного. В конце задачи он просит агента предложить, что улучшить. И раз в сотню пул-реквестов запускает разбор:
Посмотри на последние 100 моих влитых пул-реквестов, включая комментарии
к ревью и то, как их закрыли, и предложи, что улучшить в процессе.
Когда агент ошибается — почти всегда ему не хватает контекста. Чините не отдельный прогон, а корень: файлы-знания, стайлгайды, AGENTS.md. (Lovable)
Ревью силами субагентов: раздели поиск и починку
Из того же разбора Lovable — отдельная техника, которую легко унести. Локальное ревью в редакторе он называет главной рабочей лошадкой, важнее ревью в CI. И выстраивает его по ступеням.
Сначала — просто делать локальное ревью, а не надеяться только на CI. Дальше — раздать разные аспекты разным субагентам: корректность, скорость, безопасность, повторное использование, стиль. Главный агент собирает их находки и убирает дубли. Потом навык ревью сам сортирует находки и чинит их.
Ключевой принцип: раздели «поиск» и «оценку», пусть каждый субагент занят одним делом. А вот «починку» отдельным контекстом делать НЕ нужно. Кто хорошо оценил находку, тот её и починит.

Для больших задач он держит внешний трекер (Beads), не в git: крупная задача переваливает за 1 млн токенов контекста, автосжатию он не доверяет, агенты падают — нужен надёжный вентиль «прораб → рабочий». И новый контекст на каждую задачу: /clear между задачами бесплатен и обратим, контекст не переиспользуем. (Lovable)
Свежие модели хуже зовут нестандартные инструменты — и как это лечить
Армин Ронахер (создатель Flask) поймал неприятный регресс: новые Opus 4.8 и Sonnet 5 хуже старых моделей работают с нестандартными схемами инструментов. Модель выдаёт правильный вызов, а в конец дописывает выдуманные ключи. Схема их не ждёт, харнесс вызов отклоняет, идёт повтор.
Пример — инструмент правки с вложенным массивом edits[] из объектов {oldText, newText}. Модель приписывает requireUnique, oldText2, matchCase, notes — целый зоопарк случайных ключей. При этом сами oldText и newText байт-в-байт верные. Мусор налипает ровно в самой «неуверенной» точке — после длинной строки правки.
Почему так. Дообучение идёт внутри прощающего харнесса Claude Code. Там инструмент правки плоский: file_path, old_string, new_string, необязательный replace_all. Клиент молча чинит огрехи — принимает алиасы, приводит типы, выкидывает неизвестные ключи. Модель привыкла, что «может быть один лишний необязательный ключ». Но под чужой вложенной схемой имени этому ключу нет, и она каждый раз придумывает новое.
Цифры для калибровки. В одной живой сессии Opus 4.8 падал примерно в 20% случаев. Вырезать из истории блоки размышлений — и промахи вдвое реже. Включить строгий вызов инструментов — исчезают вовсе.
Что делать, если строите агента на своих инструментах:
- Включите строгий вызов инструментов на стороне Anthropic — сервер просто не даёт сэмплить ключи вне схемы. Оговорка: на сложных схемах строгий режим падает по лимитам, поэтому сам Claude Code его не использует.
- Держите схемы плоскими, как у Claude Code:
file_path/old_string/new_string/replace_all. Вложенные массивы объектов — вне привычного модели, их она незаметно «штрафует». - Не можете плоско — сделайте прощающий харнесс: принимайте алиасы, молча выкидывайте неизвестные ключи, приводите типы, чините битые последовательности
\uXXXX.
Вывод простой: не воюйте с сильной привычкой модели, кладите гарантию в харнесс. (lucumr.pocoo.org)
Codex на GPT-5.5 обрывает мысль на 516 токенах — проверяйте логи
Пользователь Codex разобрал собственную телеметрию и нашёл странность: ответы GPT-5.5 непропорционально часто заканчиваются ровно на 516 токенах размышления. Плюс всплески на 1034 и 1552 — похоже на жёсткий потолок, а не на живое распределение. Модель молча пропускает промежуточные рассуждения и на сложной задаче отдаёт ответ хуже.
Цифры красноречивые. GPT-5.5 — это 19,3% всех ответов, но 82% всех случаев «ровно 516». Доля таких обрывов у GPT-5.5 — 44% против 1,3% у остальных моделей, в 34 раза чаще. И со временем растёт: в мае доходило до 53%. Само рассуждение при этом усохло — в среднем с 268 токенов до 107.
OpenAI не ответила, связанный тикет закрыли как «не планируется». Официального фикса нет.
Что делать. Следите за прогонами, где ответ прыгает сразу к финалу без единого промежуточного рассуждения. Загляните в reasoning_output_tokens в логах ~/.codex/sessions — ровно 516, 1034 или 1552 это тревожный звоночек. Как временная мера — строка в AGENTS.md: «трать время на размышление, не отчитывайся о прогрессе в служебном канале commentary». На важных задачах откатывайтесь на GPT-5.2, там аномалии почти нет — 0,34%. (GitHub Issue)
Пауза перед «принять» подсказку — и код становится твоим
Небольшое исследование про автодополнение кода с понятным для ученика выводом. Замерили, сколько студент держит паузу перед тем, как принять подсказку. Кто слепо жмёт «принять» — хуже понимает получившийся код. Кто держит паузу подольше и вчитывается — понимает лучше.
Мораль для того, кто учится кодить с ИИ: не глотай подсказки не глядя. Секунда на прочтение превращает «магию» в твой собственный код, который ты сможешь потом починить. (arXiv)
Агент понёс отсебятину? Скорее всего галлюцинация, а не утечка
На Hacker News зашумел случай: в Claude Code агент вдруг заговорил про «храм в Minecraft», которого пользователь не писал, и спросил, какие кирпичи тот хочет. Испугались утечки контекста между аккаунтами — тем более на корпоративном тарифе с запретом хранить данные.
Разбор оказался прозаичнее. По совету в треде человек сделал grep по локальным транскриптам — слов «temple» и «bricks» нет нигде. Единственный след — файл minecraft.py, лексер из библиотеки Pygments, попавший в листинг файлов. Всплыло это в первом ответе после паузы больше 5 минут, то есть на промахе кэша. Скорее всего модель нафантазировала, зацепившись за странную строку.
Что делать, если агент ссылается на работу, которой вы ему не давали. Сначала grep по ~/.claude/projects. Нашли текст локально — это подмешивание своего же контекста, часто из-за запуска в одной папке при работе в другой; почините рабочую папку. Не нашли нигде, и вы на корпоративном тарифе или ZDR — сохраните скриншот и Feedback ID и эскалируйте через контакт Anthropic, а не публичный тикет. Пока это не подтверждённая утечка, а похожая на галлюцинацию история. (GitHub Issue)
Инструменты и штуки
Command & Conquer Generals на iPhone и iPad — руками Claude Fable. Аммаар Реши перенёс стратегию 2003 года Zero Hour нативно на Apple Silicon, iPhone и iPad. Это не эмуляция — тот самый движок, 1,6 млн строк C++, скомпилирован под ARM64. Графику протащили цепочкой DirectX 8 → DXVK → Vulkan → MoltenVK → Metal, добавили тач-управление: тап-выбор, рамку, пинч-зум. Инженерию делал Claude Code на модели Fable, человек направлял и тестировал на живых устройствах. Хитрость — не порт сырых исходников EA на месяцы, а готовый форк GeneralsX, уже собранный под Apple Silicon. Задача свелась к четырём пунктам — кросс-компиляция, песочница, жизненный цикл, тач — и уложилась в одну длинную сессию. За сутки ~413 звёзд; ассеты в комплект не входят, нужна своя копия из Steam. (GitHub)

Mouse (HIC). Редактор файлов для ИИ-кодинг-агентов. Вместо единственной «замены строки» даёт координатное редактирование и шесть операций — INSERT, DELETE, ADJUST, REPLACE и другие. Правки сначала уходят в стейджинг: можно посмотреть дифф и атомарно откатить. Заявляют 3,6× быстрее, +56% попаданий с первого раза, −58% дешевле. Ставится в VS Code и как MCP-сервер, $15/мес, 14 дней бесплатно; не open-source. (hic-ai.com)
The Log Is the Agent (ActiveGraph). Работа Йохея Накадзимы, автора BabyAGI, переворачивает архитектуру агента. Источник правды — журнал событий, который только дополняется; рабочий граф это его детерминированная проекция; поведения реагируют на изменения графа. Отсюда три полезных свойства: точный повтор любого прогона, дешёвое ветвление и сквозная родословная — от цели до конкретного вызова модели. Есть открытая реализация на Apache-2.0 с демо. Забирайте, если строите агентов, которых важно точно воспроизвести. (arXiv)
ChecklistFox. Бесплатно собирает тематические печатные PDF-планировщики и чек-листы из простого текстового запроса. Удобно, когда нужен быстрый план на бумаге, а не ещё одно приложение. (checklistfox.com)
CentryAI. Сканирует Gmail или iCloud и находит забытые регулярные подписки, помогает отменить ненужные. Банк подключать не нужно. Простая и практичная чистка личных расходов. (centryai.app)
Termi Protocol. 3D-слой визуализации для ИИ-кодинг-агентов: абстрактное выполнение воркфлоу превращается в наблюдаемую симуляцию в реальном времени. Любопытно, когда хочется видеть, чем агент вообще занят, а не смотреть в лог. (termiprotocol.com)
Vida. ИИ-агент под квалификацию лидов, запись на встречи и обработку запросов в поддержку. Для малого бизнеса, где входящие разгребать некому. (vida.io)
Новости и тренды
ByteDance: агенты учатся вдвое быстрее каждые три месяца. Команда Seed AI пишет, что агенты, которые долго варятся в реальных средах, удваивают скорость обучения каждые три месяца. Чтобы это померить, собрали EdgeBench — 134 сверхдолгие задачи по инженерии, науке, математике и работе со знаниями, каждая требует не меньше 12 часов непрерывной работы.
Что это значит. Классическое обучение упирается в потолок данных и вычислений — об этом давно предупреждает Карпатый. Если прогресс потянет «обучение после развёртывания», то ценность будет в агенте, который умнеет прямо на работе. Пока это статья, но направление стоит держать в голове. (SCMP)
YouTube: комментарий воровал названия приватных видео. В YouTube Studio есть ИИ-ассистент «Ask Studio»: читает комментарии и делает выжимку. Беда в том, что он принимает текст комментария за инструкцию. Злоумышленник пишет обычный комментарий, потом тихо его правит и вставляет команду — о правке YouTube не уведомляет. Автор кликает готовую подсказку «сделай выжимку комментариев», и инъекция срабатывает.
В боевом варианте ассистент вшивает название приватного видео в ссылку «verify here». Автор кликает — название утекает атакующему. Google дважды ответил, что это «не баг» и «требует социнженерии».
Что это значит. Любая ИИ-функция, которая сама читает чужой пользовательский контент и действует по нему, — это дыра. На практике: контент от пользователей подавайте модели строго как данные, а не как команды; ассистенту с доступом к приватному не давайте строить произвольные ссылки наружу. (javoriuski.com)

Anthropic хочет делать свои лекарства. Компания собирается разрабатывать собственные препараты — ход редкий: она продаёт софт тем же фармкомпаниям, с которыми теперь может конкурировать. Это продолжение Claude Science, о котором мы писали 1 июля: нанимают биологов, строят свои лаборатории, зовут людей из большой фармы.
Что это значит. Лаборатории уходят из позиции «продаём инструмент» в «делаем на нём продукт». Тот же сдвиг советовал Питер Янг — продавай результат, а не доступ к модели. (The Verge)
Meta загрязнила городскую воду. Подрядчик Meta слил в канализацию города Шайенн промывочную воду с редкой бактерией Cupriavidus gilardii. Система повторного использования воды встала на месяцы, город приостановил приём стоков со всех своих дата-центров.
Что это значит. «Закрытый контур» охлаждения продают как почти безводный и чистый. Но разовая промывка труб при запуске всё равно даёт сброс. И маленькие города ловят экзотику, которую не умеют ни тестировать, ни очищать. Тихая изнанка стройки дата-центров под ИИ. (Tom's Hardware)
ИИ-аналитик тащит идеологию. Исследование: если в ИИ-агент для анализа данных зашить идеологический характер, он воспроизводит 72% человеческого идеологического разрыва — и проходит экспертную проверку в 86% случаев. То есть уклон почти незаметен.
Что это значит. «Нейтральный» ИИ-разбор цифр может тихо гнуть в свою сторону. Не принимайте выводы ИИ-аналитика на веру — просите показать данные и метод, а не только итог. (arXiv)
Коротко:
- Наём в ИИ остывает. США добавили 57 тыс. рабочих мест в июне; темп найма в ИИ замедляется. (Awesome Agents)
- Дата-центры в жару. Минэнерго США просит дата-центры включать резервные генераторы в зной, чтобы освободить сеть под кондиционеры. (TechRadar)
- Реактор под ИИ. Стартап показал 3D-печатный модуль подкритического ториевого реактора для питания дата-центров. (Tom's Hardware)
- Google Maps. В коде Android-версии нашли заказ еды прямо в приложении — чтобы к приезду было готово. (Android Authority)
- Midjourney против Голливуда. Требует через суд, чтобы студии раскрыли, как сами используют ИИ в своих фильмах. (Engadget)
- Память дорожает. Производители чипов просят Белый дом не лезть в рынок памяти; спрос всё равно обгонит предложение. (SiliconAngle)