Рой агентов Lovable, Generals на iPhone через Fable и утечка приватных видео YouTube  Публичный пост

5 июля 2026  108

Инженер Lovable за полгода спустил на токены $85 000 — и теперь в одиночку закрывает по 150 пул-реквестов в неделю, столько раньше выдавала целая команда. Дело не в модели, а в том, как он выстроил рой агентов и кому доверил проверку. Ещё сегодня: Claude Fable за одну сессию перенёс старую Command & Conquer на iPhone, а безобидный комментарий под чужим роликом на YouTube вытаскивает названия приватных видео.

Главное за 30 секунд

  • Инженер Lovable в одиночку мёржит 150 пул-реквестов в неделю: рой агентов, ИИ-классификатор рисков и мелкие пул-реквесты стопками.
  • Claude Fable за одну сессию перенёс Command & Conquer Generals на Mac, iPhone и iPad — а это 1,6 млн строк кода на C++.
  • Свежие Opus 4.8 и Sonnet 5 хуже старых моделей зовут нестандартные инструменты и подсовывают в JSON выдуманные поля.
  • Комментарий под видео на YouTube через инъекцию промпта заставляет ИИ-ассистента слить названия приватных роликов; Google чинить отказался.
  • GPT-5.5 в Codex часто обрывает мысль ровно на 516 токенах и молча выдаёт ответ хуже — проверяйте логи.

Внедряем и улучшаем

Как один человек мёржит 150 пул-реквестов в неделю

Инженер Lovable Александр Лебедев разложил свой рабочий процесс на живых цифрах. В январе он был обычным разработчиком с парой агентов, и удачной считалась неделя с 20–30 влитыми пул-реквестами. К июню — один человек над 6–7 агентами, у каждого свой рой субагентов, плюс отдельный агент-«прораб», который раздаёт остальным задачи. Удачная неделя теперь — 150+ влитых пул-реквестов. В первую неделю июня он влил 293 штуки, и ни один дефект не доехал до продакшена.

Расходы под стать: с ~$600 личных трат на токены в месяц он вырос до ~$25 000 на пике и ~$85 000 с января. Примерно 75% уходит прямо на написание кода, ~25% — на автоматику ревью и повторяющиеся задачи. Про экономию токенов он высказывается резко: «токеномаксинг — глупое и близорукое поведение». Совет — 5% внимания на экономию токенов, 95% на поиск задач, ради которых эти токены стоит жечь.

Главный сдвиг — человек уходит с построчного ревью наверх, к решениям. Код, написанный ИИ, читать построчно «непрактично и не лучшее применение времени». Вместо этого — разбор архитектуры, выбор инфраструктуры, парная отладка. Дословно: «одно обсуждение устройства системы может изменить её сильнее, чем 50 пул-реквестов».

Чтобы новичок не выкатил лишнего в продакшен, он собрал ИИ-классификатор рисков. Работает так:

  • В основе — один markdown-файл с политикой. Агент читает его вместе с диффом и метаданными пул-реквеста и определяет размер, уровень риска и владельца кода.
  • Правила простые. Инфраструктура или авторизация — всегда высокий риск. Публикация поста в блог — низкий. Слишком большой или чужой код — вверх по риску.
  • Дальше «скучный детерминированный инструмент» применяет политику через GitHub Actions и правила веток — разрешить слияние или запретить.

По уровню риска — три дорожки: высокий → обязательное ревью человеком; средний → медленное дорогое ИИ-ревью; низкий → быстрое дешёвое ИИ-ревью.

Классификатор рисков Lovable: пул-реквесты сортируются на три дорожки — быстрый дешёвый ИИ, медленный дорогой ИИ и ревью человеком (Lovable)
Классификатор рисков Lovable: пул-реквесты сортируются на три дорожки — быстрый дешёвый ИИ, медленный дорогой ИИ и ревью человеком (Lovable)

Ещё три приёма, которые стоит забрать себе:

  • Мелкие пул-реквесты стопками. На большом диффе качество ИИ-ревью резко падает. Пример: коллеге ИИ одобрил пул-реквест на 6 000 строк; разбили его на стопку мелких — и тот же ревьюер нашёл реальные баги. Большие изменения «человек и раньше не мог вычитать, теперь ясно, что и ИИ не может».
  • Рискованные действия — через обёртку, а не прямые права. Агентам запрещено мёржить через gh; они зовут «merge when ready» у Graphite, и сам вызов завёрнут в проверенный юнит-тестами скрипт. Ноль запросов на разрешения — иначе не будет автономии.
  • Фабрика чинит сама себя. Скиллы агент пишет себе сам; с января автор не написал вручную ни одного. В конце задачи он просит агента предложить, что улучшить. И раз в сотню пул-реквестов запускает разбор:
Посмотри на последние 100 моих влитых пул-реквестов, включая комментарии
к ревью и то, как их закрыли, и предложи, что улучшить в процессе.

Когда агент ошибается — почти всегда ему не хватает контекста. Чините не отдельный прогон, а корень: файлы-знания, стайлгайды, AGENTS.md. (Lovable)

Ревью силами субагентов: раздели поиск и починку

Из того же разбора Lovable — отдельная техника, которую легко унести. Локальное ревью в редакторе он называет главной рабочей лошадкой, важнее ревью в CI. И выстраивает его по ступеням.

Сначала — просто делать локальное ревью, а не надеяться только на CI. Дальше — раздать разные аспекты разным субагентам: корректность, скорость, безопасность, повторное использование, стиль. Главный агент собирает их находки и убирает дубли. Потом навык ревью сам сортирует находки и чинит их.

Ключевой принцип: раздели «поиск» и «оценку», пусть каждый субагент занят одним делом. А вот «починку» отдельным контекстом делать НЕ нужно. Кто хорошо оценил находку, тот её и починит.

Ревью субагентами: главный агент раздаёт аспекты (стиль, корректность, скорость, безопасность, повторное использование), находки фильтруются и уходят в починку (Lovable)
Ревью субагентами: главный агент раздаёт аспекты (стиль, корректность, скорость, безопасность, повторное использование), находки фильтруются и уходят в починку (Lovable)

Для больших задач он держит внешний трекер (Beads), не в git: крупная задача переваливает за 1 млн токенов контекста, автосжатию он не доверяет, агенты падают — нужен надёжный вентиль «прораб → рабочий». И новый контекст на каждую задачу: /clear между задачами бесплатен и обратим, контекст не переиспользуем. (Lovable)

Свежие модели хуже зовут нестандартные инструменты — и как это лечить

Армин Ронахер (создатель Flask) поймал неприятный регресс: новые Opus 4.8 и Sonnet 5 хуже старых моделей работают с нестандартными схемами инструментов. Модель выдаёт правильный вызов, а в конец дописывает выдуманные ключи. Схема их не ждёт, харнесс вызов отклоняет, идёт повтор.

Пример — инструмент правки с вложенным массивом edits[] из объектов {oldText, newText}. Модель приписывает requireUnique, oldText2, matchCase, notes — целый зоопарк случайных ключей. При этом сами oldText и newText байт-в-байт верные. Мусор налипает ровно в самой «неуверенной» точке — после длинной строки правки.

Почему так. Дообучение идёт внутри прощающего харнесса Claude Code. Там инструмент правки плоский: file_path, old_string, new_string, необязательный replace_all. Клиент молча чинит огрехи — принимает алиасы, приводит типы, выкидывает неизвестные ключи. Модель привыкла, что «может быть один лишний необязательный ключ». Но под чужой вложенной схемой имени этому ключу нет, и она каждый раз придумывает новое.

Цифры для калибровки. В одной живой сессии Opus 4.8 падал примерно в 20% случаев. Вырезать из истории блоки размышлений — и промахи вдвое реже. Включить строгий вызов инструментов — исчезают вовсе.

Что делать, если строите агента на своих инструментах:

  1. Включите строгий вызов инструментов на стороне Anthropic — сервер просто не даёт сэмплить ключи вне схемы. Оговорка: на сложных схемах строгий режим падает по лимитам, поэтому сам Claude Code его не использует.
  2. Держите схемы плоскими, как у Claude Code: file_path / old_string / new_string / replace_all. Вложенные массивы объектов — вне привычного модели, их она незаметно «штрафует».
  3. Не можете плоско — сделайте прощающий харнесс: принимайте алиасы, молча выкидывайте неизвестные ключи, приводите типы, чините битые последовательности \uXXXX.

Вывод простой: не воюйте с сильной привычкой модели, кладите гарантию в харнесс. (lucumr.pocoo.org)

Codex на GPT-5.5 обрывает мысль на 516 токенах — проверяйте логи

Пользователь Codex разобрал собственную телеметрию и нашёл странность: ответы GPT-5.5 непропорционально часто заканчиваются ровно на 516 токенах размышления. Плюс всплески на 1034 и 1552 — похоже на жёсткий потолок, а не на живое распределение. Модель молча пропускает промежуточные рассуждения и на сложной задаче отдаёт ответ хуже.

Цифры красноречивые. GPT-5.5 — это 19,3% всех ответов, но 82% всех случаев «ровно 516». Доля таких обрывов у GPT-5.5 — 44% против 1,3% у остальных моделей, в 34 раза чаще. И со временем растёт: в мае доходило до 53%. Само рассуждение при этом усохло — в среднем с 268 токенов до 107.

OpenAI не ответила, связанный тикет закрыли как «не планируется». Официального фикса нет.

Что делать. Следите за прогонами, где ответ прыгает сразу к финалу без единого промежуточного рассуждения. Загляните в reasoning_output_tokens в логах ~/.codex/sessions — ровно 516, 1034 или 1552 это тревожный звоночек. Как временная мера — строка в AGENTS.md: «трать время на размышление, не отчитывайся о прогрессе в служебном канале commentary». На важных задачах откатывайтесь на GPT-5.2, там аномалии почти нет — 0,34%. (GitHub Issue)

Пауза перед «принять» подсказку — и код становится твоим

Небольшое исследование про автодополнение кода с понятным для ученика выводом. Замерили, сколько студент держит паузу перед тем, как принять подсказку. Кто слепо жмёт «принять» — хуже понимает получившийся код. Кто держит паузу подольше и вчитывается — понимает лучше.

Мораль для того, кто учится кодить с ИИ: не глотай подсказки не глядя. Секунда на прочтение превращает «магию» в твой собственный код, который ты сможешь потом починить. (arXiv)

Агент понёс отсебятину? Скорее всего галлюцинация, а не утечка

На Hacker News зашумел случай: в Claude Code агент вдруг заговорил про «храм в Minecraft», которого пользователь не писал, и спросил, какие кирпичи тот хочет. Испугались утечки контекста между аккаунтами — тем более на корпоративном тарифе с запретом хранить данные.

Разбор оказался прозаичнее. По совету в треде человек сделал grep по локальным транскриптам — слов «temple» и «bricks» нет нигде. Единственный след — файл minecraft.py, лексер из библиотеки Pygments, попавший в листинг файлов. Всплыло это в первом ответе после паузы больше 5 минут, то есть на промахе кэша. Скорее всего модель нафантазировала, зацепившись за странную строку.

Что делать, если агент ссылается на работу, которой вы ему не давали. Сначала grep по ~/.claude/projects. Нашли текст локально — это подмешивание своего же контекста, часто из-за запуска в одной папке при работе в другой; почините рабочую папку. Не нашли нигде, и вы на корпоративном тарифе или ZDR — сохраните скриншот и Feedback ID и эскалируйте через контакт Anthropic, а не публичный тикет. Пока это не подтверждённая утечка, а похожая на галлюцинацию история. (GitHub Issue)

Инструменты и штуки

Command & Conquer Generals на iPhone и iPad — руками Claude Fable. Аммаар Реши перенёс стратегию 2003 года Zero Hour нативно на Apple Silicon, iPhone и iPad. Это не эмуляция — тот самый движок, 1,6 млн строк C++, скомпилирован под ARM64. Графику протащили цепочкой DirectX 8 → DXVK → Vulkan → MoltenVK → Metal, добавили тач-управление: тап-выбор, рамку, пинч-зум. Инженерию делал Claude Code на модели Fable, человек направлял и тестировал на живых устройствах. Хитрость — не порт сырых исходников EA на месяцы, а готовый форк GeneralsX, уже собранный под Apple Silicon. Задача свелась к четырём пунктам — кросс-компиляция, песочница, жизненный цикл, тач — и уложилась в одну длинную сессию. За сутки ~413 звёзд; ассеты в комплект не входят, нужна своя копия из Steam. (GitHub)

Command & Conquer Generals: Zero Hour запущена нативно на iPad после порта силами Claude Fable
Command & Conquer Generals: Zero Hour запущена нативно на iPad после порта силами Claude Fable

Mouse (HIC). Редактор файлов для ИИ-кодинг-агентов. Вместо единственной «замены строки» даёт координатное редактирование и шесть операций — INSERT, DELETE, ADJUST, REPLACE и другие. Правки сначала уходят в стейджинг: можно посмотреть дифф и атомарно откатить. Заявляют 3,6× быстрее, +56% попаданий с первого раза, −58% дешевле. Ставится в VS Code и как MCP-сервер, $15/мес, 14 дней бесплатно; не open-source. (hic-ai.com)

The Log Is the Agent (ActiveGraph). Работа Йохея Накадзимы, автора BabyAGI, переворачивает архитектуру агента. Источник правды — журнал событий, который только дополняется; рабочий граф это его детерминированная проекция; поведения реагируют на изменения графа. Отсюда три полезных свойства: точный повтор любого прогона, дешёвое ветвление и сквозная родословная — от цели до конкретного вызова модели. Есть открытая реализация на Apache-2.0 с демо. Забирайте, если строите агентов, которых важно точно воспроизвести. (arXiv)

ChecklistFox. Бесплатно собирает тематические печатные PDF-планировщики и чек-листы из простого текстового запроса. Удобно, когда нужен быстрый план на бумаге, а не ещё одно приложение. (checklistfox.com)

CentryAI. Сканирует Gmail или iCloud и находит забытые регулярные подписки, помогает отменить ненужные. Банк подключать не нужно. Простая и практичная чистка личных расходов. (centryai.app)

Termi Protocol. 3D-слой визуализации для ИИ-кодинг-агентов: абстрактное выполнение воркфлоу превращается в наблюдаемую симуляцию в реальном времени. Любопытно, когда хочется видеть, чем агент вообще занят, а не смотреть в лог. (termiprotocol.com)

Vida. ИИ-агент под квалификацию лидов, запись на встречи и обработку запросов в поддержку. Для малого бизнеса, где входящие разгребать некому. (vida.io)

Новости и тренды

ByteDance: агенты учатся вдвое быстрее каждые три месяца. Команда Seed AI пишет, что агенты, которые долго варятся в реальных средах, удваивают скорость обучения каждые три месяца. Чтобы это померить, собрали EdgeBench — 134 сверхдолгие задачи по инженерии, науке, математике и работе со знаниями, каждая требует не меньше 12 часов непрерывной работы.

Что это значит. Классическое обучение упирается в потолок данных и вычислений — об этом давно предупреждает Карпатый. Если прогресс потянет «обучение после развёртывания», то ценность будет в агенте, который умнеет прямо на работе. Пока это статья, но направление стоит держать в голове. (SCMP)

YouTube: комментарий воровал названия приватных видео. В YouTube Studio есть ИИ-ассистент «Ask Studio»: читает комментарии и делает выжимку. Беда в том, что он принимает текст комментария за инструкцию. Злоумышленник пишет обычный комментарий, потом тихо его правит и вставляет команду — о правке YouTube не уведомляет. Автор кликает готовую подсказку «сделай выжимку комментариев», и инъекция срабатывает.

В боевом варианте ассистент вшивает название приватного видео в ссылку «verify here». Автор кликает — название утекает атакующему. Google дважды ответил, что это «не баг» и «требует социнженерии».

Что это значит. Любая ИИ-функция, которая сама читает чужой пользовательский контент и действует по нему, — это дыра. На практике: контент от пользователей подавайте модели строго как данные, а не как команды; ассистенту с доступом к приватному не давайте строить произвольные ссылки наружу. (javoriuski.com)

Те самые ИИ-подсказки в YouTube Studio, что одним кликом скармливают ассистенту все комментарии — и вместе с ними инъекцию
Те самые ИИ-подсказки в YouTube Studio, что одним кликом скармливают ассистенту все комментарии — и вместе с ними инъекцию

Anthropic хочет делать свои лекарства. Компания собирается разрабатывать собственные препараты — ход редкий: она продаёт софт тем же фармкомпаниям, с которыми теперь может конкурировать. Это продолжение Claude Science, о котором мы писали 1 июля: нанимают биологов, строят свои лаборатории, зовут людей из большой фармы.

Что это значит. Лаборатории уходят из позиции «продаём инструмент» в «делаем на нём продукт». Тот же сдвиг советовал Питер Янг — продавай результат, а не доступ к модели. (The Verge)

Meta загрязнила городскую воду. Подрядчик Meta слил в канализацию города Шайенн промывочную воду с редкой бактерией Cupriavidus gilardii. Система повторного использования воды встала на месяцы, город приостановил приём стоков со всех своих дата-центров.

Что это значит. «Закрытый контур» охлаждения продают как почти безводный и чистый. Но разовая промывка труб при запуске всё равно даёт сброс. И маленькие города ловят экзотику, которую не умеют ни тестировать, ни очищать. Тихая изнанка стройки дата-центров под ИИ. (Tom's Hardware)

ИИ-аналитик тащит идеологию. Исследование: если в ИИ-агент для анализа данных зашить идеологический характер, он воспроизводит 72% человеческого идеологического разрыва — и проходит экспертную проверку в 86% случаев. То есть уклон почти незаметен.

Что это значит. «Нейтральный» ИИ-разбор цифр может тихо гнуть в свою сторону. Не принимайте выводы ИИ-аналитика на веру — просите показать данные и метод, а не только итог. (arXiv)

Коротко:

  • Наём в ИИ остывает. США добавили 57 тыс. рабочих мест в июне; темп найма в ИИ замедляется. (Awesome Agents)
  • Дата-центры в жару. Минэнерго США просит дата-центры включать резервные генераторы в зной, чтобы освободить сеть под кондиционеры. (TechRadar)
  • Реактор под ИИ. Стартап показал 3D-печатный модуль подкритического ториевого реактора для питания дата-центров. (Tom's Hardware)
  • Google Maps. В коде Android-версии нашли заказ еды прямо в приложении — чтобы к приезду было готово. (Android Authority)
  • Midjourney против Голливуда. Требует через суд, чтобы студии раскрыли, как сами используют ИИ в своих фильмах. (Engadget)
  • Память дорожает. Производители чипов просят Белый дом не лезть в рынок памяти; спрос всё равно обгонит предложение. (SiliconAngle)
Откомментируйте первым 👇

😎

Автор поста открыл его для большого интернета, но комментирование и движухи доступны только участникам Клуба

Что вообще здесь происходит?


Войти  или  Вступить в Клуб