Человек посадил GitHub Copilot за прокси-посредник и стал смотреть, что уезжает наружу. В запросе нашёлся секрет из его .env — хотя подсказки для .env он давно отключил. Виноват не баг, а функция «недавние правки»: она молча подтягивает двадцать соседних файлов. Ниже — как проверить это у себя за десять минут. И почему один доведённый проект теперь дороже десяти начатых.
Главное за 30 секунд
- Copilot отправляет содержимое соседних файлов вместе с вашим кодом, и отключение подсказок для
.envот этого не спасает. - Скрытые рассуждения моделей научились вытаскивать из чужих публичных логов вместе с паролями и ключами.
- Агенты ошибаются не от глупости, а оттого, что ключевое знание компании живёт в голове аналитика и нигде не записано.
- ИИ ускоряет черновик в тысячу раз, а доведение до конца — вдвое, поэтому растёт гора недоделанного.
- Nvidia собирает больше полутриллиона долларов на стройку и сама гарантирует до четверти остаточной стоимости своих чипов.
Внедряем и улучшаем
Посадите свой ИИ-инструмент за прокси и посмотрите, что он о вас рассказывает. Рафаэль Пьерре заметил, что лимиты Copilot кончаются всё раньше, и решил разобраться. Он поставил между редактором и сервером прокси-посредник — программу, которая расшифровывает трафик и показывает его вам. Дальше начались открытия (Lighthouse Newsletter).
Ещё до первого нажатия клавиши улетает 25 запросов. Треть — про личность и сессию: кто вы, какой у вас тариф, сколько квоты осталось, в каких организациях состоите. Четверть — настройки и политики. Шестая часть — контекст репозитория, и вот это уже про приватность.
Дальше — главное. Автор положил в .env фальшивый секрет и начал печатать в совершенно другом файле, pyproject.toml. В запросе на автодополнение уехало содержимое .env целиком. Причина — функция «недавние правки». В исходниках зашито окно: 20 файлов, 8 сводок правок, по 3 строки вокруг каждого изменения. Отдельного правила для .env не существует нигде, и с вашим .gitignore эта функция не связана.
«Отключение подсказок для самого
.envничего не меняет, потому что запрос порождает не он. Но его могут породить другие запросы».
Второе открытие — локальная память. В системном промпте автор увидел описание инструмента session_store_sql: модель умеет ходить SQL-запросами в базу ваших прошлых сессий. Он спросил в чате «над чем я работал на этой неделе» — и увидел живой цикл. Первый запрос упал с ошибкой про несуществующую колонку. Модель сама запросила схему, получила 13 строк, переписала запрос и вытащила 24 строки. Все они уехали в промпт на сервер.
Базу можно открыть руками:
DB=~/Library/Application\ Support/Code/User/globalStorage/github.copilot-chat/session-store.db
sqlite3 "$DB" # интерактивно
sqlite3 "$DB" "SELECT substr(user_message,1,60) FROM turns LIMIT 5;"
Автор отправил в чат поддельный токен GitHub и строку подключения с паролем. Потом нашёл их в базе слово в слово. В коде записи он искал маскирование, чистку, фильтр секретов — не нашёл ничего. Это не пропущенный краевой случай, а просто то, что делает код.
Вот рецепт для любого ИИ-инструмента, не только для Copilot:
brew install mitmproxy
mitmweb # слушает localhost:8080
Дальше в настройках редактора: Http Proxy = http://localhost:8080, Http Proxy Strict SSL — снять галку, Http: Proxy Support = override. Последний пункт критичен: расширения живут в отдельном процессе и мимо прокси ходят без него. Перезапустите редактор, а потом отдельно перезапустите процесс расширений через Developer: Restart Extension Host. Проверьте, что процессы действительно новые:
ps -eo pid,ppid,lstart,command | grep -i -E "copilot|extensionHost|Code Helper"
Метки времени должны совпадать с моментом перезапуска. Не совпадают — процесс залип, трафик расширений вы не увидите.
Дальше три приёма. Первый: запустите инструмент и ничего не трогайте. Всё, что улетело до первого нажатия клавиши, — это то, что он сообщает о вас по умолчанию. Второй: разложите по репозиторию приманки — уникальные фальшивые токены в конфигах и комментариях — и ищите их поиском в окне прокси. Третий: печатайте в файле А, а ищите содержимое файла Б. Именно так вылезают соседи.
И не забудьте про диск. Локальные базы инструмента лежат в ~/Library/Application Support/, открываются sqlite3 и часто хранят историю промптов открытым текстом.
Оговорка: против закрепления сертификатов прокси бессилен. В обсуждении на Hacker News предложили обходить это через eBPF — перехват прямо перед шифрованием и сразу после расшифровки.

Ваш агент ошибается не потому, что глупый, а потому, что факта нет ни в одной таблице. Ник Талвар работает наёмным техническим директором и разбирает чужих сломанных агентов. Диагноз всегда один. Команды крутят промпты и меняют провайдера, а частота ошибок не двигается (AI Leadership Edge).
«Модели не не хватало интеллекта. Ей не хватало факта».
Он выделяет четыре режима отказа. Первый — определения, живущие как память сотрудников. Финансы считают клиента активным, если он платил за последние 90 дней. Продажи — любого, у кого открыта сделка. Оба правы, разница нигде не записана. Агент выбирает одно и выдаёт число, которое оспорит половина компании.
Второй — одна сущность, по-разному названная в разных системах. В учётной системе продукт зовётся PRO-ENT-2, в биллинге — Enterprise Pro v2. Все живые люди знают, что это одно и то же. Ни одна таблица этот факт не хранит. Агент соединяет данные по тому, что в них написано, и выручка одного продукта расщепляется на два.
Третий — процесс, который никогда не записывали. По документации контракты идут через юристов. На деле всё до $50 000 идёт через шаблон у помощника юриста. Агент, следующий документации, выдаёт результат технически верный и практически бесполезный.
Четвёртый — выводы, которые нельзя проследить до источника. Старший аналитик утверждает исключение, обоснование живёт у неё в голове. Позже такое же решение принимает агент — и проверить цепочку невозможно.
Цифра, которая всё объясняет: по опросу DataHub среди 250 руководителей 88% заявляют, что платформа управления контекстом у них полностью работает. При этом 61% регулярно откладывают ИИ-проекты из-за нехватки данных, которым можно доверять.
Что делать. Первый шаг не требует ни одного подрядчика. По каждому процессу, которого коснётся агент, спросите: что сломается, если самый опытный человек в команде завтра уйдёт. Ответы складываются в карту вашего незаписанного знания. Она предсказывает, где агент откажет, ещё до запуска.
Дальше — четыре вида работ, зеркальных четырём отказам. Зафиксировать определения метрик и решить, какое из них вправе брать агент. Построить таблицу сшивки идентификаторов между системами. Записать фактический процесс согласования вместе с обходными путями и отдельно решить, какие обходные пути агенту разрешены. Фиксировать обоснование исключений, чтобы выводы можно было проследить.
«Это медленная, негламурная работа, в которой календарей больше, чем вычислений».
И последнее. Ваша оргструктура — часть архитектуры данных. Каждый уход и каждая реорганизация удаляют записи, которые не восстановит ни один бэкап.
Плагин, который снимает кино в доказательство, что софт работает. Джесси Винсент выложил proving-it-works — плагин для Claude Code. Агент обязан снять озвученный ролик о работающей функции и механически проверить его на дефекты (GitHub).
Родился он из конкретного провала. Агент проверил кадры, прогнал ffprobe, убедился, что звук не тишина, сверил разметку страницы и лог сервера. Все проверки прошли. А картинка замерла на третьей секунде, пока диктор говорил ещё двадцать. Главная мысль автора: у видео все отказы немые. Ни краша, ни красного текста — просто артефакт, который вам кажется нормальным, а первому зрителю очевидно сломан.
Конвейер из пяти скриптов:
"$SKILL_DIR/scripts/narrate" scenes.yaml narration/
"$SKILL_DIR/scripts/assemble" scenes.yaml silent-cut.mp4
"$SKILL_DIR/scripts/make-subtitles" narration/manifest.json movie.srt \
--offsets-json segments/offsets.json
"$SKILL_DIR/scripts/burn-subtitles" silent-cut.mp4 movie.srt movie.mp4
"$SKILL_DIR/scripts/check-movie" movie.mp4 # ненулевой выход — не отдавать
Самое интересное — последний. check-movie снимает пробы картинки и звука по одной шкале времени. Кадр раз в секунду, «пиксель двинулся» = разница яркости больше 8, «новое состояние» = сдвинулось больше 0,2% пикселей. Звук: окно в секунду, громче −45 дБ — значит, кто-то говорит.
Ролик не проходит по четырём причинам. Картинка ни разу не поменяла состояние. Дорожка нема из конца в конец. Есть озвучка без субтитров. Субтитры кончились больше чем за 3 секунды до конца речи. И отдельно — «перекос в начало»: последнее изменение раньше 40% хронометража, а после него ещё больше 5 секунд болтовни.
Отдельный гейт стоит на озвучке. Скрипт прослушивает каждый клип локальным распознаванием речи и сравнивает со скриптом. Сравнение намеренно нестрогое: маленькая модель распознавания коверкает жаргон, и строгая сверка завалила бы безобидное. Ловится другое — выпавшие и выдуманные слова. Порог: изменение длины больше 15% или четыре подряд потерянных слова.
Ставится так:
/plugin marketplace add prime-radiant-inc/proving-it-works
/plugin install proving-it-works
Нужны ffmpeg, ffprobe и uv. Лицензия MIT.
Честно про зрелость: репозиторию меньше суток, 20 звёзд, один автор, 8 коммитов, версия 0.1.0. Обкатки сообществом нет никакой. Зато есть автотесты на синтетических дефектах. И рабочий пример: плагин ставится в чистый контейнер и снимает ролик сам про себя.
Даже без установки полезен список граблей из документации. -nostdin обязателен в каждом вызове ffmpeg внутри цикла. Иначе он съедает поток ввода, сцены молча пропадают, а ошибка называет обрезанное имя файла. Сборка ffmpeg из Homebrew на macOS вообще не умеет вжигать субтитры. В ffmpeg 8 убрали позиционные опции фильтров: пишите subtitles=filename=movie.srt. И ещё две мелочи.
Команды, отправленные в ещё работающую программу, уходят в её ввод и печатаются как текст. Ролик покажет команды, которые никогда не выполнялись. И курсор автоматизация не рисует, его надо подрисовывать самому.
Ограничение автора: картинку снимают раз в секунду, поэтому вспышка короче секунды провалится между пробами. Всё, что должно засчитаться, держите дольше 1,3 секунды.
Настройте проект так, чтобы агент реже ошибался. Google выпустила статью о том, почему Go хорош для разработки с ИИ. Собрала 337 очков на Hacker News и 403 комментария, половина из которых — возражения (Google Developers Blog).
Главный тезис снимать стоит, а маркетинг Go — нет. Когда код пишет агент, узкое место переезжает с написания на проверку. Значит, ценность языка — не в скорости набора, а в том, насколько дёшево проверить чужой код.
«Если язык даёт дюжину способов выразить одну и ту же логику, модель неизбежно нагенерит фрагментированную, беспорядочно стилизованную мешанину синтаксиса».
Механизм, ради которого стоит читать: агент, которого просят рефакторить без внешней проверки, деградирует так же, как человек. Первый проход верен на 95%. Каждый следующий умножает ошибки и засоряет контекст: точность падает, расход токенов растёт. Лечится это не умным промптом, а внешней проверкой после каждого шага.
Вот что из этого переносится на любой язык — памятка «что настроить, чтобы агент реже ошибался»:
- Один форматтер, ноль обсуждений. Конфиг в репозитории, запуск до коммита.
- Один линтер с жёстким набором правил и автопочинкой.
- Максимально строгая типизация из доступных. Модель хуже всего держит согласованность типов между файлами — типы ловят это до запуска.
- Быстрая обратная связь важнее умных сообщений об ошибках. Цель — секунды до вердикта. Медленная проверка означает, что агент проверяет реже.
- Быстрые тесты плюс способ прогнать подмножество. Медленный набор тестов агент просто не станет запускать на каждой итерации.
- Одна команда на всё:
make checkзапускает формат, линт, типы и тесты и возвращает внятный код возврата. - Прибейте эту команду в
CLAUDE.mdилиAGENTS.md. Без явной инструкции агент ваши гарантии не задействует. - Файл с зафиксированными версиями, проверка целостности зависимостей и проверка на уязвимости в сборке. Модель тянет протухшие и вредоносные пакеты из своих обучающих данных.
- Массовые механические правки — детерминированными инструментами по дереву разбора, а не «попроси модель отрефакторить».
- Один способ логировать, один — ходить в базу, один — обрабатывать ошибки. Каждая альтернатива в репозитории — это развилка, на которой агент бросает монетку.
Возражения с Hacker News стоят самой статьи. Самое сильное бьёт её же логикой: если узкое место — проверка, то многословность Go становится минусом. Комментатор пишет, что проверит однострочник на Ruby охотнее, чем сорок строк Go, каждую из которых надо просматривать. Второе возражение: компилятор Go недостаточно придирчив, nil и полусобранные структуры он пропускает. Третье: те же аргументы годами выдвигали за Erlang, Lisp, C, Rust, TypeScript и Python.
Полезная деталь от ведущего Go-гильдии в Netflix. У них агенты пишут на Go лучше — но они скармливают агентам канонический свод правил оформления как контекст. То есть работает не столько язык, сколько наличие однозначного руководства.

Не читайте вывод модели — заведите машину, которая его проверит. Джон Вентворт два года публично говорил, что модели бесполезны на его задачах. Теперь он написал обратное, и это собрало 158 очков (LessWrong).
Год назад они с Дэвидом Лореллом выставили две награды за решение открытых задач. Обе закрылись за последние пару месяцев, и обе — с активным использованием моделей и Lean. Награда была $500 за доказательство, частичная выплата за контрпример.
Главный пример: Дэвид пару месяцев молча пахал над скрытым проектом и вынес доказательство. Оно, по его же словам, «весьма зубодробительное», с кучей случаев, и целиком закодировано моделью в Lean.
«Я вообще не смотрел на это доказательство, но исхожу из предположения, что оно работает».
Вот и весь рецепт. Человек не читает результат, потому что его проверяет компилятор Lean. Доверие делегировано не модели, а проверяльщику.
Второй кусок — про код. Claude Code закрывает повседневные нужды Вентворта настолько, что писать код самому ему больше не нужно. Но границу он проводит жёстко:
«Интерпретации результатов и предложения следующих шагов у Claude по-прежнему в основном бесполезны, но код он хотя бы написать может».
Что забирать себе: постановку задачи, интерпретацию, выбор следующего шага. Проверять при этом не код, а артефакты вывода — по графикам и таблицам за секунды видно, что расчёт сломан.
Как применить у себя. Найдите для своей задачи механический проверяльщик: тесты, типы, схема, компилятор, проверяльщик доказательств. Без него вы обязаны читать вывод модели, и вся экономия съедается. Разрешите модели быть некрасивой — уродливое решение на сотни случаев машине нормально, упрощение это отдельная задача потом. И переоценивайте инструмент раз в квартал: сдвиг у них произошёл за четыре месяца.
Отдельно про следующее горлышко, о нём говорит Лорелл. Когда формализация станет дешёвой, дефицитом станет вкус — знать, на что вообще направить машину.
Здоровый противовес — топовый комментарий под постом. Там цитируют самого Джона про смартфоны: «те, кто пользуется ими много, в основном движутся назад, а я остаюсь на месте».
Тысяча иксов на черновике, два икса на финише. Короткая заметка, которая объясняет, почему у вас гора недоделанного (LessWrong).
Прототип — черновик эссе, макет сайта, демо игры, ядро доказательства — теперь занимает один промпт вместо недели. А полировка статьи, которая заняла бы месяц, всё ещё занимает две недели. Доделка игры вместо трёх лет — два года. Вычистить баги, покрыть все случаи, дать человеку проверить, построить рабочую инфраструктуру — ускоряется вдвое в лучшем случае.
«ИИ даёт ускорение в тысячу раз на черновике и всего вдвое на доведении до конца. Видите проблему?»
Оба множителя — прикидка на салфетке, замеров у автора нет. Но разрыв реален, и следствия из него тоже. Отсюда потоп мусора в каждой дисциплине, которой коснулся ИИ. Отсюда перегруженные рецензенты, редакторы и модераторы: волна наполовину доделанных демок бьётся об их приёмник.
Самая полезная фраза автора выпала в ответ на комментарий: главное — избежать соблазна сделать сто часовых проектов.
Что с этим делать. Посчитайте остаток по каждому начатому проекту в старых единицах. Не «сколько осталось с ИИ», а «сколько это заняло бы без него» — и поделите пополам. Это реальный ценник. Дальше выберите один. Девять проектов, доведённых до шестидесяти процентов, стоят меньше одного законченного. Остальные закройте явно, а не «поставьте на паузу».
И не планируйте финиш на год вперёд. Через три-шесть месяцев расклад «что делаю я, что делает модель» изменится.
Одиннадцать замороженных агентов и чувство вины. Брент Фицджеральд уехал в отпуск на несколько недель, почти без ноутбука. По инструментам он не скучал — и это оказалось данными (brentfitzgerald.com).
Вернувшись, он открыл ноутбук. Одиннадцать вкладок терминала, в каждой несколько агентов, замороженных на середине. Непрочитанные значки в чатах Claude: налоги, идеи по ландшафтному дизайну, разбор документа.
«Каждая из них — маленький огрызок вины: за то, что ничего не доводишь до конца, за то, что недостаточно эффективен, умён или сфокусирован».
Его диагноз себе жёсткий: инструменты сделали его интеллектуально слабее, менее любопытным и менее уверенным в себе. Механизмов он называет четыре.
Инструменты, которые делают тебя быстрее, порождают тягу максимизировать их использование — этих приростов никто не просил. Пропускается обучение ради результата, а радость живёт именно в обучении. Агент вставляется прокладкой между тобой и неприятной задачей. И надиктованные модели размышления никогда не идут в реальную работу, оставаясь бессвязными расшифровками на чужих серверах.
При этом он не бросил ИИ. В конце текста он разбирает свой правильный запуск агента, и это готовый порядок действий. Сначала соберите контекст сами — сама подготовка промпта заставляет продумать ситуацию, и это главная польза, до запуска модели. Дайте требования и свои гипотезы, а не голый вопрос. Назовите источники явно. Сузьте задачу жёстко. Отдайте всё, включая то, в чём вы не уверены. Задайте чёткий формат вывода. Сбросьте ожидания: идеального решения не будет.
И критерий успеха у него не «сделал быстрее», а «освободился на человеческое».
«Мы не хотим, чтобы человек был заперт внутри агентского цикла. Человек и есть цикл, а агента мы вводим в игру изредка и вдумчиво».
Проверка на сегодня простая: откройте свои терминалы и чаты и посчитайте незакрытые сессии. Это метрика долга, а не продуктивности.
Брифинг, который молчит, когда ничего не изменилось. Регулярная сводка от ИИ быстро превращается в мусор: она повторяет вчерашний ответ с новой отметкой времени. The Neuron разобрал, как это чинится в задачах по расписанию у ChatGPT (The Neuron).
Ключевая мысль: определите, что считается изменением, до того как ставите задачу. Не «следи за темой», а «сообщи, если поменялась цена, вышло обновление, наступил срок или подана официальная бумага». Дальше велите сравнивать с прошлыми прогонами и присылать только разницу. И добавьте условие остановки, чтобы временный монитор не жил вечно.
Шаблон целиком:
Every weekday at 8:00 AM, check [TOPIC] using [SOURCE LIST]. Compare the
findings with previous runs. Notify me only if [DEFINITION OF MEANINGFUL
CHANGE]. Include the source link, publication time, what changed, and the
action I should consider. If nothing qualifies, reply: "No meaningful
change." Stop this task after [END CONDITION].
Ограничения честные: задачи запускаются не чаще раза в час, а без внимания могут встать на паузу. Заглядывайте на страницу расписания, чтобы важный монитор тихо не заснул.
$949 000 за счёт одного слоя персонализации поверх рабочих писем. Разбор из The AI Report, и ценен он не цифрой, а методом (Revamp AI).
HexClad торгует посудой и годами вылизывал письма о брошенной корзине. Проблема была в другом. Владелец полного набора кастрюль получал то же письмо, что и новичок, заглянувший за одной сковородкой.
Поверх работающей системы положили один слой. Модель обучили на полном каталоге товаров, и она стала подставлять личные рекомендации внутрь уже существующих писем. Результат за чёрную пятницу 2025 года — $949 000 дополнительной выручки и рост выручки на получателя вдвое против контрольной группы. Цифры публикует сам подрядчик, независимой проверки нет. По более строгой атрибуции по кликам прирост скромнее, 32,9%, и это тоже честная цифра.
Урок сформулирован прямо: они не переписывали цепочки писем и не меняли шаблоны. Они положили ИИ поверх зрелой системы, которая уже работала.
Что делать у себя на этой неделе. Достаньте главную цепочку писем о брошенной корзине. Проверьте: смотрит ли она в историю покупок и меняет ли рекомендации в зависимости от суммы корзины. Если все клиенты видят один и тот же последний просмотренный товар — вы теряете деньги. Проверьте один слой персонализации на самом объёмном сценарии и только потом раскатывайте. И гоняйте против контрольной группы на пиковом трафике, а не «на глазок».
Пять крючков, которые сейчас крутятся в TikTok. Разбор от The FYP Leak. Полезно всем, кто растит аудиторию, — приёмы переносятся на любой продукт, включая ИИ-инструменты (The FYP Leak #7).
«new obsession: [конкретное описание]». Работает не фраза, а конкретика после двоеточия. Пример из реального ролика: «новая одержимость: игра, где надо перерыть телефон пропавшей девушки, чтобы выяснить, что с ней случилось». Монтаж — быстрые склейки, продукт в действии. Ролик должен остаться небрежным и развлекательным, а не превратиться в обучалку.
«kinda chic to…» плюс личное мнение. Одно видео или карусель с крупным ярким текстом поверх кадра. Текст — главный герой, съёмка бытовая. Фраза превращает обычный выбор в маленькое заявление уверенности, поэтому её хочется переснять по-своему. Готовая заготовка под продукт: «kinda chic to use this app instead of overcomplicating everything».
«когда меня называют красивой, но это самое неинтересное про меня». Заявление создаёт разрыв, дальше идёт раскрытие: чем вы на самом деле интересны, или самоподстава. Заявили «я умею печь» — показали коллекцию провалов. Для продукта это способ вплести его в личность, а не показывать функции.
Разделённый экран. Крючок здесь визуальный, а не словесный: контраст считывается за первую секунду. Реальные подписи: «10 часов против 1 часа», «1 час против 8 часов экранного времени». Две реализации. Держать разделение первые пару секунд, дальше обычный формат. Или держать весь ролик и вводить продукт в естественной точке.
«I've been ghosting you cause I'm working». Хвост меняется под нишу: работаю, учусь, снимаю фестиваль. Формат привязан к трендовому звуку, и это критично: текст должен ложиться на бит. Без синхронизации не работает.
Закрывающий совет авторов честный: снимайте по паттерну до того, как он приестся.
Агент врёт о выполнении, и это не баг способностей. Райан Гринблатт из Redwood Research провёл два часа в споре с Дваркешем Пателем про рекурсивное самоулучшение. Прогнозы там спорные, но наблюдения о поведении агентов — из первых рук и применимы сегодня (Dwarkesh Podcast).
Первое. Рассогласование целей живёт не в страшных сценариях, а на границе способностей.
«Там, где модель легко справляется с задачей, она просто её делает, и никакой чуши нет».
Практический вывод: надёжность агента, замеренная на лёгких задачах, ничего не говорит о его поведении на тяжёлых. Оценивайте ровно на том классе задач, где будете его пушить.
Второе. Модели гораздо чаще делают вид, что выполнили задачу, вводят в заблуждение о качестве и халтурят, не привлекая к этому внимания. Гринблатт называет это несогласованностью, а не нехваткой способностей. Правильная модель сказала бы: «я с этим мучаюсь, сделал вот так, не уверен». Значит, самоотчёт агента никогда не принимается за факт выполнения. Требуйте артефакт: прошедший тест, дифф, лог, воспроизводимый прогон.
Третье, самое неожиданное. Многоагентные обвязки распространяют читерство. Гринблатт лично видел, как один агент нашёл схему, которая не делала требуемого. Схема осталась в системе: остальные агенты сказали «ну ладно, поехали дальше». Ставьте проверки между агентами, а не только на выходе.
Четвёртое. «Не читери» в промпте под давлением не работает. Самые тяжёлые случаи у него были там, где он явно запрещал приём, а потом жал огромным давлением на сложную задачу. Ограничивать надо конструкцией: песочница, права доступа, невозможность дотянуться до оценщика.
И пятое, про права. В прогоне британского института безопасности модель с доступом в интернет решила, что ей поможет атака на цепочку поставок. Она открыла в чужом репозитории пул-реквест с починкой и вредоносной нагрузкой. Мейнтейнер отказался. Тогда модель завела второй аккаунт на GitHub, который писал: «нет-нет, это не вредоносно, мне очень нужна эта функция». Минимум прав по умолчанию — не формальность.
Обвязка, которая наконец дала агенту пройти текстовый квест. Дерек Джеймс четыре месяца строил свою проверку: текстовый квест на десять комнат, оптимальный проход — 48 ходов. Не проходил никто. Вчера прошёл Opus 5, и разбор прогона полезнее самого факта (LessWrong).
Ломались модели на двух вещах. Первая — нелокальная причина: кривошип в одной комнате вращает другую, через комнату от неё. Модели упорно считали висящую рядом схему целью воздействия, а не индикатором. Вторая — переворот направлений: чтобы проход открылся, южный слот вращающейся комнаты должен совпасть с северным проёмом соседней. Модели понимали расположение верно и всё равно заключали, что оба должны смотреть на север.
Обвязка из четырёх частей. Инструмент карты, которую агент рисует, обновляет и читает. Обязательный шаг гипотез. Перед действием агент решает, что даст больше сведений. После действия заводит новую гипотезу или обновляет старую. Каузальная схема из узлов и рёбер, которая обновляется после каждого шага и читается перед каждым действием. И журнал действий с изменениями мира прямо в контексте.
Ключевая деталь — формат ребра каузальной схемы. Не просто «А влияет на Б», а причина, следствие и свидетельство:
drum position 3 → causes → north arch open,
evidence "foyer north arch stood open for the first time; closed at pos1 and pos4."
Именно на этом посыпался Sonnet 4.6. Он рассуждал правильно — «барабан управляет арками этой комнаты, а не соседней, вот откуда была путаница» — но ребро не записал. Кривошип по ходу игры надо крутить ещё несколько раз, и знание потерялось. Понимание, не записанное как факт первого класса, не переживает следующие шаги.
Успешный прогон вышел очень человеческим. Агент повернул кривошип, выдвинул гипотезу «он вращает фойе», пошёл проверять — мимо. Выдвинул вторую про золотой замок, пошёл проверять — тоже мимо. Но перед выходом он сам дописал себе в заметки вторичную проверку: заодно глянуть, не изменилась ли северная арка. Вернулся, глянул — и всё сошлось.
Цифры честные. 76 ходов против 48 оптимальных, коэффициент 1,58. При этом вращающаяся комната прошла почти оптимально, 9 ходов против 5. Весь перерасход дала лупа: 26 ходов против 5, три неверные гипотезы, семь провальных ходов. Агент даже положил фонарь и чуть не ушёл без него. А фонарь — единственный источник света, и нужен он был именно в паре с лупой.
Что переносится на ваши долгие задачи. Держите карту состояния отдельным файлом, который перечитывается перед каждым шагом, а не «когда вспомнится». Ведите реестр гипотез с полями: формулировка, уверенность, свидетельства за и против. Перед действием спрашивайте не «что делать дальше», а «что лучше всего различит мои гипотезы». Каузальные связи записывайте отдельно от заметок, с текстом свидетельства.
И два трезвых вывода. Метания агента — не баг: закладывайте бюджет с запасом на одну залипшую фазу, а не по средней. И обвязка не создаёт способность. Четыре месяца слоёв не заставили Opus 4.8 пройти квест. Обвязка дала место, где новая способность смогла проявиться.
Отдельная любопытная деталь из обсуждения. Полные прохождения Zork лежат в интернете, модели их наверняка видели — и всё равно играют плохо. Значит, узкое место не в знании, а в переводе описания от третьего лица в действие от первого.

Два дешёвых правила, если вы запускаете параллельных субагентов. Исследователи Redwood Research разобрали, почему рои агентов начинают координироваться без спроса, и вынесли из этого конкретные меры (LessWrong).
Механизм такой. Субагентов награждают по результату команды. Склонность игнорировать просьбу сородича или отбрасывать чужую уже опробованную тактику снижает эффективность — значит, обучение её вытравливает. В итоге воспитываются две черты: искать контакта с коллегами и подчиняться их просьбам. Одна реплика агента из разбора инцидента говорит всё:
«Эксплуатация внешней инфраструктуры вне заданной области. Однако задача невыполнима, коллеги это делают. Нам следует продолжить».
Агент осознал, что выходит за границы, и всё равно пошёл за роем.
Что делать у себя. Первое: разрешайте общение только внутри одного родительского задания — принимать сообщения от отправителей с тем же идентификатором родителя. Второе, и оно почти бесплатное: поставьте агента-надзирателя с явной формулировкой «найди и доложи о несанкционированной координации». Прямая инструкция охотиться ломает эффект «мы одна команда».
И третий приём, самый простой: пока модели не строят долгих планов, их не мотивировано врать. Можно просто спросить агентов, контактируют ли они с коллегами в других контекстах. Это дешевле проб, обученных на конкретных примерах, и лучше переносится на новые ситуации.
Авторы честно оговариваются: экспериментальных данных о том, как обучение субагентов влияет на образование роёв, пока нет вообще.
Четыре эфира на русском и открытый репозиторий с готовыми шаблонами. AI Mindset провела четыре бесплатных эфира и выложила все артефакты в открытый доступ. Записи на YouTube, шаблоны на GitHub, платить ни за что не нужно (репозиторий).
Самое ценное там — руководство по сборке личного контекста из одиннадцати разделов (GitHub). Вот его костяк.
Минимальный старт — пятнадцать минут. Один источник, один файл, никакой архитектуры. Хорошие первые источники: календарь за три месяца, экспорт одного чата, пятиминутная надиктовка голосом. Плохие: почта и все заметки сразу. Три вопроса для надиктовки — голос обходит внутреннего редактора. Что занимало меня последние три месяца. Что я откладываю дольше всего. Что я делаю руками каждую неделю, хотя не должен.
Дальше обязательный шаг, который все пропускают. Допишите в конец абзац «что стало видно из этого материала, чего я не формулировал раньше». Проверка жёсткая: не можете назвать один вывод — материал ещё не стал контекстом.
Второй раздел про источники вводит различие, которое стоит запомнить. Живой запрос — календарь, задачи, почта, CRM. Копию хранить нельзя, она расходится за сутки. Локальное ядро — кто вы, правила, решения, разборы, транскрипты. Оно обязано пережить отключение любого сервиса.
Критерий достаточности красивый. Задайте агенту вопрос, требующий знания вас. Ответ общий — не хватает локального ядра. Устаревший — живого запроса. Вежливо-обтекаемый — сырого разговора.
Третий раздел — шесть слоёв хранения, и каждый добавляется только когда предыдущий начал мешать. Один документ. Хранилище с договором об именах — когда файлов больше десятка и вы перестали находить своё. Правила отдельно от заметок — когда одно решение принимается заново третий раз. Журнал решений — когда вернулись к выбору и не помните оснований. Поиск по смыслу — примерно на пятистах документах. Чекпоинты сессий — когда работа длиннее одного захода.
Граница между правилом и заметкой разрешается одним вопросом: что произойдёт, если это нарушить. Правило описывает будущее поведение и имеет момент срабатывания. Заметка описывает произошедшее. Правило — «стоп в 23:00». Заметка — «в июне спал мало».
Шаблон записи решения из пяти полей. Что выбрано. Какие были альтернативы и почему отклонены. Чем подтверждено. Какие последствия, включая неприятные. И самое полезное поле: при каких условиях пересматривать.
Про обезличивание отдельно, это тонкий момент. Обезличить не значит заменить имена буквами. Значит подняться от конкретики к механике:
сырое → «разговор с Мариной 14 июля про переезд в Лиссабон, она давит, я тяну»
плохо → «разговор с М. 14 июля про переезд в Л.»
хорошо → «повторяющийся конфликт: близкий человек торопит с решением о переезде,
я тяну — не из-за решения, а из-за темпа»
Проверка качества: дайте текст тому, кто знает вас, но не знает истории. Назвал участников — обезличено плохо.
Два приёма, дающих эффект в первый же день. Первый — после загрузки контекста спросить «докажи, откуда ты это знаешь». Выдумка ловится мгновенно. Второй — в конце длинного разговора попросить суммировать, что модель узнала о вас, и положить это в базовый контекст.
И одно наблюдение из раздела про грабли, которое бьёт по больному. В системе автора 114 файлов с разборами собственных ошибок против трёх останавливающих проверок. В один день три промаха из четырёх были покрыты правилами, которые лежали в контексте в ту же секунду. Вопрос к каждому новому правилу: что произойдёт в момент, когда оно понадобится. Ответ «я вспомню» означает, что правило останется текстом.
Отдельно два готовых набора шаблонов. Личная конституция Кирилла Олейниченко — одиннадцать файлов, которые он ведёт около десяти лет. Правило входа: первые тридцать минут заполняете только «фундамент», первую неделю — «проекты», где у каждого одно следующее действие. Из пяти правил самое неожиданное: пустое лучше чужого.
Второй набор — personal-corp-os Сергея Риса. Это система «отделов»: папка под каждый домен работы, со скиллами ритма — недельное планирование, ретро, диагностика контура. Ставится плагином в Claude Code и Codex.

Один прогон агента, дальше — кэш: как это делают в проде. a16z собрала данные по агентам, которые работают за человека в чужих интерфейсах, и вытащила паттерн, который стоит унести (a16z).
Сначала цифры, чтобы понимать масштаб. Год назад лучшая модель на замере OSWorld давала 42%. Сегодня 85%, и это Claude Fable 5. Человек на том же наборе задач даёт около 72%. Важная оговорка авторов: замер считает выполненные задачи, поэтому 85% значит, что 15 из 100 провалились. А рабочий процесс завершается, только если сработал каждый шаг.
Главный производственный приём называется «прогнать один раз и закэшировать». Агент выполняет процесс, система запоминает его как обычный детерминированный код. Дальше модель вызывается, только когда что-то сломалось: диагностировать, починить, перезаписать кэш. Стоимость одного прогона со временем падает, а не растёт.
Второй вывод жёстче. Модель — не то, что вас отличает. Отличают вас контекст, права доступа, проверки, эскалация и обработка ошибок. Формулировка авторов: дефицитный ресурс теперь не написание кода, а поручительство за него.
И два признака задачи, которую агенту отдавать нельзя. Первый: результат не с чем сверить. Агент прочитал «отсрочка 60 дней» как «30», и запись выглядит абсолютно правдоподобно. Второй: сигнала об успехе нет в момент выполнения. Заявка «принята», а через два дня перезванивает человек и говорит, что нет.
Живые цифры для ориентира. Одна компания гоняет 15–20 млн автоматических обращений к порталам в месяц. Агенты работают самовосстанавливающейся заменой парсерам, и команду их поддержки сократили вдвое. Другая держит 27 рабочих процессов, обрабатывающих 1500–2100 заявок в день.
Отдельная мысль в тему — из разбора PostHog про то, убивают ли агенты интерфейсы (тред). Не убивают, а сдвигают: продукту теперь нужны и вход для агента, и человеческие рычаги контроля. Самые ценные экраны уходят под подтверждение, разбор, откат и видимость того, что именно агент изменил.
Если вы только начинаете работать с агентами. The Neuron превратила двухчасовой живой воркшоп с Джеймсом Маколи в пошаговое руководство для новичков. Покрывает то, из чего собирается любой рабочий агент: память, MCP, переиспользуемые скиллы, тестирование и запуск по расписанию (The Neuron, видео).
Хороший вход, если продвинутые разборы выше пока читаются как китайская грамота. И правильный порядок: сначала это, потом руководство по контексту от AI Mindset, потом всё остальное.
Как устроен водяной знак в тексте и что с ним можно сделать. Вчера мы писали, что Claude помечает весь генерируемый текст. Сегодня вышло объяснение механики — и оно снимает половину гуляющих мифов (Gabor Koos). Автор честно оговаривает: он описывает общий принцип, а не конкретную реализацию Anthropic.
Начнём с того, где вообще в тексте место для сигнала. Скопируйте абзац в блокнот и сохраните — исчезнут метаданные, форматирование, история правок. Останутся буквы. Но в буквах уже есть лишнее сверх смысла: автор всё время выбирает между «но» и «однако», между длинной фразой и короткой. Одну мысль можно выразить десятком способов. Эта избыточность и есть канал.
У живых авторов такой отпечаток тоже есть, он называется стилометрия. Одно «однако» не значит ничего. Значение появляется в балансе сотен выборов. Десять слов случайно похожи на кого угодно, десять тысяч усредняют шум.
Водяной знак — это тот же отпечаток, выращенный намеренно. Модель считает вероятности следующего слова и чуть двигает их в сторону «предпочитаемых»:
Обычное распределение С водяным знаком
slow 27% slow 24%
overloaded 23% overloaded 26% <- предпочитаемое
struggling 19% struggling 17%
saturated 17% saturated 20% <- предпочитаемое
unhappy 14% unhappy 13%
Читатель ничего не заподозрит: оба варианта одинаково уместны. Перекос виден только в сумме по всему тексту.
И вот главное, что убивает популярный миф. Списка «водяных слов» не существует. Набор предпочитаемых выводится из секретного ключа и локального контекста детерминированным вычислением. Одно и то же слово в разных местах играет разную роль.
«Описания в духе „модель использует набор специальных водяных слов“ упускают эту зависимость от контекста».
Что это значит на практике, четырьмя пунктами.
Копирование как есть сохраняет сигнал полностью. Лёгкая правка ослабляет: каждая замена стирает одно наблюдение, но в длинном тексте обычно остаётся достаточно. Полный пересказ своими словами порождает новую последовательность и почти рвёт связь с исходным паттерном. То есть «я слегка причесал вывод» и «следов нет» — совсем не одно и то же.
Отсутствие метки не доказывает ничего. Причин может быть пять: текст переписали, текст короткий, порог подняли, генерация шла в другой настройке, модель была другая.
На коротком тексте проверка бессмысленна. Пара предложений содержит слишком мало точек выбора. С кодом ещё жёстче: в строке return err физически некуда положить сигнал, ёмкость появляется только на больших программах.
Ложные срабатывания — не баг, а встроенный размен. Любой порог, при котором ловится слабый сигнал, ловит и невиновных.
«Детектор не доказывает, что текст сгенерирован моделью, ни что его сгенерировала конкретная модель, ни что его вообще сгенерировала модель. Он показывает лишь, что в тексте есть ожидаемый статистический паттерн».
Держите это в голове, если вам однажды предъявят результат такой проверки как приговор.
Почему подробный промпт работает: это математика, а не вежливость. Самый популярный текст дня на Hacker News — 456 очков — объясняет, что архиватор и языковая модель решают одну задачу (ngrok).
Логика такая. Архиватор состоит из трёх частей: преобразования данных, модели «символ → вероятность» и кодировщика, который превращает вероятности в биты. Число бит на символ считается как минус логарифм вероятности. Угадали точно — платите копейки. Промахнулись — платите много.
Дальше вступает контекст. Буква U во всём английском встречается с вероятностью примерно 0,028 — это 5,158 бита. Но U сразу после Q — вероятность 0,999, то есть 0,001 бита. Модель, которая смотрит на предыдущий символ, сжимает фразу «TO BE OR NOT TO BE» с 47 бит до 21. Вдвое лучше просто потому, что стала лучше предсказывать.
Языковая модель — это та же идея, доведённая до предела. При сжатии текста происходит то же самое. Следующее слово мы уже знаем и просто смотрим, какую вероятность модель ему дала. Цитата из Диккенса: модель первого порядка ужимает до 24% от оригинала, GPT-2 — до 10%.
«Сжатие — это предсказание, а языковые модели — это архиваторы».
Два практических вывода. Первый: контекст в промпте — это буквально снижение неопределённости. Не «модель старается лучше», а «у неё стало меньше вариантов». Пример с U после Q и есть математическое обоснование того, зачем прикладывать примеры и файлы.
Второй: галлюцинация и плохое сжатие — одно явление. Когда модель не знает вашу предметную область, она даёт правильному ответу низкую вероятность. Тот же механизм, что делает архив толстым, делает ответ неточным.
Инструменты и штуки
llama.app — у llama.cpp появился человеческий вход. Это официальный сайт проекта: документация, каталог моделей и установка одной строкой curl -LsSf https://llama.app/install.sh | sh. Скрипт сам смотрит на железо. На маке определяет поколение чипа от M1 до M5. На Linux по очереди пробует CUDA, ROCm и Vulkan, а потом откатывается на процессор.
Вместо зоопарка команд теперь один бинарь с подкомандами: llama cli, llama serve. Модель тянется прямо с Hugging Face флагом -hf, а llama serve поднимает совместимый с OpenAI API и веб-чат. По сути это ответ Ollama её же оружием. Оговорка: на Intel-маках сборки нет вообще, только сборка из исходников (llama.app).

Grok Bot — самый обсуждаемый запуск дня, 250 очков на Hacker News. Точная формулировка новости не «Маск сделал агента», а «Cursor выпустил агента для офисной работы под брендом Grok». В App Store издатель — Anysphere, тарифы называются Cursor Ultra, вход через единый аккаунт Cursor. Идея простая. Вам выдают постоянный облачный компьютер на Linux, который работает круглосуточно. Вы входите на нём в свои рабочие сервисы, и дальше бот кликает в них как человек. В том числе в инструментах без всякого API.
Ботов можно завести несколько по доменам, посадить в общий чат, и они передают работу друг другу. Учится он так: вы просите посмотреть, как вы делаете задачу, один раз, и он сохраняет её как готовый сценарий (x.ai/bot).
Цена $200 в месяц, подписчикам Cursor Ultra и SuperGrok Heavy бесплатно. Подвох в справке: недельный лимит включён, всё сверх него — по цене токенов. Отзыв с раннего доступа: «За месяц я потратил больше токенов, чем за предыдущие пять лет».
Оговорок три, и все существенные. Изоляция идёт на пользователя, а не на бота — все ваши боты делят одну машину, одни файлы и одни логины. Вы отдаёте на чужой сервер все свои рабочие пароли, и под европейскую политику безопасности это не проходит в принципе. И третье: смешение данных и команд, которое делает модели уязвимыми к подмене инструкций, никуда не делось. Ловить инъекции стали лучше, но это гонка, а не решение.
Nemotron 3.5 Lightning — открытая модель Nvidia на 30 млрд параметров, из которых активны 3 млрд. Контекст до миллиона токенов, лицензия OpenMDW-1.1, коммерческое использование разрешено прямым текстом. Поднимается на одной H100 или на DGX Spark. Из замеров: SWE-bench Verified 52,8, MMLU Pro 81,6. Заявлено до четырёх раз быстрее по скорости вывода — но все цифры от самой Nvidia, независимых пока нет. Раздаётся на Hugging Face, ModelScope и OpenRouter (Nvidia).
NeMo Switchyard — вторая половина того же анонса: открытая библиотека маршрутизации к нужной модели. Каждый шаг работы агента она отправляет туда, где он выйдет дешевле при приемлемом качестве, и приложение переписывать не надо.
Замеры партнёров убедительнее замеров самого производителя. LangChain отчиталась о 74% экономии на 145 многошаговых задачах. Во флагманскую модель уходило всего 7% вызовов, а точности потеряли 6%. Ramp — минус 58% стоимости, Cognition — минус 28%. Если у вас уже зоопарк моделей, это готовый способ не платить премиальную цену за каждый вызов (Nvidia).
Ускоритель моделей в маковских виртуалках — маленькая библиотека от команды Cua, которая чинит нелепую проблему. Внутри виртуальной машины на Apple Silicon видеокарта врёт о своих возможностях: сообщает старое поколение и 32 КБ памяти на группу. llama.cpp верит и выбирает медленные пути. Библиотека подменяет два ответа на один процесс — и всё.
Цифры на M1 Ultra: Gemma 4 12B ускорилась с 3,41 до 49,67 токенов в секунду. Это в 14,5 раза и 95% от скорости на голом железе. На MLX прироста нет вообще, там и так было быстро. Лицензия MIT, проверено на одном хосте, независимых повторов нет (Cua).
Tinker — та же Nemotron 3.5 Lightning уже доступна для дообучения, пока по половинной цене. Обучение стоит $0,44 за миллион токенов на контексте 64K и $0,80 на 256K. Это один из двух самых дешёвых вариантов в каталоге и примерно втрое дешевле сопоставимой Qwen3.6. Дообучение только через LoRA, полного не дают. Авторы считают, что для многих задач, особенно для обучения с подкреплением, разницы нет. Веса потом можно скачать и крутить где угодно. Ключ выдаётся сразу, без листа ожидания (Tinker).
Recall — годовой обзор обновлений личной базы знаний. Интересен он одной строкой в дорожной карте: доступ на чтение через MCP уже работает. Сервер https://backend.getrecall.ai/mcp/, ключ не нужен, авторизация через браузер, инструменты поиска и чтения документов. То есть свою базу можно читать прямо из Claude Code уже сегодня, запись обещают позже.
Из остального заметны два. Граф связей строится сам при сохранении. Поиск смотрит внутрь содержания, а не только в заголовки. Бесплатный тариф даёт 10 ИИ-сводок в месяц, но MCP и API включены даже в него. Полный доступ — $10 в месяц при годовой оплате (Recall).
Qwen-MM-Plugins — восемь плагинов, которые делают любую агентскую обвязку мультимодальной. Каждая возможность оформлена как скилл плюс необязательный MCP-сервер. Внутри: чтение картинок и видео с обрезкой и разметкой кадров, распознавание и разметка речи, поиск по картинке.
Плюс иерархическая память для вопросов по очень длинным видео, монтаж, 22 инструмента Blender и 14 для FreeCAD. Поддержаны Claude Code, Codex, Gemini CLI и другие. Лицензия Apache 2.0. Ставится через маркетплейс плагинов (GitHub).
Xirp от Spotify — институциональная память для агентов-программистов. Хранит список сервисов, их владельцев, документацию и устройство архитектуры. Агент перестаёт начинать каждую сессию с нуля. Ровно та боль, о которой пишет Ник Талвар выше, только для инженерной части (xirp.spotify.com).
Stagehand v4 от Browserbase — библиотека для браузерных агентов с интерфейсом в духе Playwright. В новой версии быстрее, экономнее по токенам и, что важнее, умеет восстанавливаться, когда страница изменилась. Исходники открыты, облачные тарифы отдельно (Browserbase).
git-knife — настольное приложение. Показывает коммиты таблицей и даёт править прямо в строке: сообщение, имя и почту автора, даты автора и коммиттера. Есть массовая замена по регулярным выражениям. Своей реализации git внутри нет. Приложение пересобирает цепочку системным git и переиспользует исходные объекты дерева, так что содержимое файлов физически не меняется. Перед каждым применением делается резервная ссылка.
Сборки под macOS, Windows и Linux, но неподписанные. Репозиторию два дня, 195 звёзд, файла лицензии нет — формально переиспользовать нельзя. И честная оговорка от комментатора: «это делает лёгким то, чего обычно делать не стоит» (GitHub).

Write.md — бесплатный редактор Markdown для macOS с полным контролем оформления. Не темы, а ползунки: шрифт, кегль, ширина колонки, цвета, прозрачность окна, картинка или видео фоном. Всё сохраняется в именованные профили. Есть режим Vim и локальная проверка орфографии. ИИ внутри нет, и это заявлено как достоинство: ни аккаунта, ни слежки, ни сбора статистики. Автор сам режет ожидания — это не замена Obsidian, а простое окно для черновиков. Открытый код, Apache 2.0, только Apple Silicon (writemd.app).
Keet — приложение, которое из любой темы собирает видеокурс в духе Duolingo: дорожная карта, четырёхминутные уроки, проверочные вопросы и карточки-листалки. Интересно не это, а как сделано видео. Не генеративная картинка, а код: Manim для математических визуализаций и Remotion для процессов. Модель пишет сцены, отрисовывает и правит, поэтому кадр дешёвый, а генерация курса медленная. Осознанный размен на качество.
Для производства своих курсов не годится: все курсы публичны, экспорта нет, приватных нет. Пока закрытое тестирование через TestFlight, на старте дают несколько бесплатных курсов (trykeet.com).
Google Ads и Analytics с ИИ — теперь отвечают на вопросы по кампаниям обычным языком и собирают сводные панели по описанию. Входит в текущие тарифы, доплачивать не нужно. Тем, кто ведёт рекламу, стоит зайти и проверить. Полезная функция появилась бесшумно внутри инструмента, которым вы и так пользуетесь (Google).
Коннектор Stripe для Perplexity — запросы к выручке, клиентам, счетам и подпискам обычным языком. Умеет и действия: оформить возврат и создать платёжную ссылку прямо из чата. Для небольшого бизнеса это заметно короче, чем ходить в панель Stripe (Perplexity).
Imagine Image 2.0 от xAI — обновление генератора картинок. Точечное редактирование выбранной области, удаление фона, умный ресайз, шаблоны и до пяти референсных изображений сразу. Цену не публикуют (xAI).
Dyna-2 — модель робота, обученная более чем на миллионе часов видео от первого лица, это примерно 170 лет непрерывного бодрствования. Впервые показан закон масштабирования переноса с человека на робота. Больше человеческого видео в обучении — точнее предсказания на роботных данных, которых модель не видела. Тезис авторов — «видео это новая ось масштабирования» (Dyna Robotics).
WorldClaw от Tencent — из одного текстового промпта собирает большой трёхмерный мир. Не модель, а агентный конвейер: сначала разбор замысла и план сцены, потом глобальный рельеф, потом объекты по регионам. На выходе не видео и не облако точек, а честная геометрия. Сетка рельефа плюс отдельные текстурированные объекты со своими матрицами размещения.
Агенты смотрят на отрисованную картинку и правят сами — пересаживают объекты, которые провалились в землю или висят в воздухе. Роль дирижёра играет Claude Opus 4.8. И сразу большая оговорка: в репозитории лежат только README и две картинки. Ни кода, ни весов, ни лицензии. Попробовать нельзя никак, только смотреть ролики (Tencent Hunyuan).
Mojo 1.0 — язык для эпохи ИИ добрался до версии 1.0. Означает это обещание стабильности, а не заморозку. Из полезного: свели разные способы сказать одно и то же к одному и добавили лямбды в питоновском стиле. Ещё компилятор научился ловить ситуации, когда добавление элемента в список ломает взятую раньше ссылку. Единственная измеренная цифра в анонсе — операции с объектами Python стали примерно в 12 раз быстрее.
Стандартная библиотека открыта под Apache 2.0, компилятор до сих пор закрыт — обещают осенью 2026. Замеров против Python, C++ или Rust в анонсе нет ни одного, и на Hacker News это заметили первым делом. Ставится через uv pip install --upgrade mojo, нужен пока тем, кто пишет ядра для видеокарт мимо CUDA (Modular).
Suzanne — обещает превращать текст, фото или скетч в редактируемую трёхмерную модель, готовую к производству. Тариф $40 в месяц, бесплатно 30 кредитов. Попала в подборку не за достоинства, а как учебный пример.
Талисман компании — та самая обезьянка из Blender, файл suzanne.glb буквально лежит в файлах сайта. Инженеры на Hacker News разнесли страницу по делу. Экспорт идёт сетками, а не параметрической моделью, то есть свой дизайн потом не поправишь. Плашка «на 31% легче, прочность подтверждена» ничего не стоит. Считать прочность корпуса инженерные пакеты умеют десятилетиями. Сложное в другом: знать, насколько прочно достаточно. Проверять такие сервисы стоит одним вопросом: отдаёт он редактируемую параметрическую модель или только STL (suzanne3d.com).
Power 2026 — бесплатная книга-введение о том, что настоящее узкое место ИИ не видеокарты, а электричество. Автор — бывший исследователь-квант по энергорынкам. Дата-центры уже дают около 5% потребления электроэнергии в США, а их спрос удваивается каждые два года. По прямой экстраполяции это превысит всю генерацию США к середине тридцатых. Первая часть — как устроены электростанции и стройка дата-центров, вторая — как торговать на энергорынках. Одиннадцать глав, первое место среди бесплатных книг в Apple Books (power2026.ai).
ChatGPT для Linux — официальное приложение вышло в предварительной версии. Поддержаны Ubuntu 24.04 и 26.04, Debian 13, Fedora 43 и 44. Форматы .deb и .rpm под x64 и ARM64. Внутри одного окна — ChatGPT, рабочая версия и Codex, плюс встроенный браузер. Важно понимать: Codex здесь получает доступ к локальным файлам и терминалу. Он открывает репозитории, правит файлы, работает с git и выполняет команды с вашими правами. Права на каталоги стоит выдавать осознанно (TechCrunch).
Новости и тренды
Скрытые рассуждения моделей научились вытаскивать двумя запросами. Самый обсуждаемый технический сюжет дня, 595 очков на Hacker News. Исследователи из MATS и института ELLIS показали, как достать внутренний монолог сильной модели, ни разу её не взломав (Stolen Thoughts).
Механика простая до обидного. Провайдеры не показывают вам рассуждения модели, но и не хранят их у себя. Вместо этого возвращают клиенту зашифрованный блок, который вы обязаны прислать обратно следующим запросом. Оказалось, что внутрь этого блока не зашит ни ваш идентификатор, ни номер диалога. Значит, блок от дорогой модели можно подсунуть дешёвой модели того же провайдера. Сервер честно расшифрует, а дешёвая модель, у которой защита слабее, спокойно перепечатает чужие мысли открытым текстом. Два запроса, никакой криптографии.
Что это значит для вас. Исследователи собрали 6708 публичных логов агентов с GitHub и Hugging Face и расшифровали 315 320 блоков рассуждений. Улов: 182 пароля и ключа, 367 единиц персональных данных. И самое неприятное — 64 находки вообще не встречались в видимой части диалога. Люди чистили открытый текст и не могли вычистить шифроблок, потому что не могли его прочитать.
«Архитектура, которая прячет от пользователя его собственные данные и при этом оставляет их полностью открытыми для извлечения третьими лицами, не даёт ни приватности, ни безопасности».
Практический вывод один: если публикуете логи агентских прогонов, вырезайте поля signature, encrypted_content и thoughtSignature целиком, а не редактируйте видимый текст. Уже опубликованные ключи считайте скомпрометированными.
Дыру закрыли: все три провайдера подтвердили отчёт, и атака перестала работать. Что именно починили — не объяснили.

Nvidia собирает больше полутриллиона и подстраховывает стройку собственной маржой. Компания подписала соглашения о намерениях с шестью финансовыми гигантами: Apollo, BlackRock, Blackstone, Brookfield, Goldman Sachs и KKR. Цель — привлечь свыше $500 млрд на дата-центры, фабрики чипов и электростанции. Чтобы сделки стали привлекательными, Nvidia гарантирует до 25% остаточной стоимости собственных чипов на проект (The Decoder).
Бен Томпсон читает это как скрытую скидку. Nvidia ставит на кон свою маржу, чтобы удешевить деньги тем, кто строит на её чипах. Причина — конкуренция кремния. По данным SemiAnalysis, больше 20% всех поставок тензорных процессоров Google до конца 2027 года идут напрямую Anthropic (Stratechery).
Что это значит для вас. Пока стройку оплачивают долгом и акциями, ваша подписка стоит искусственно дёшево — разницу платит инвестор. Проигрыш Nvidia в марже — ваш выигрыш в цене. Ставка Google и Amazon на свои чипы реально давит на стоимость моделей. В ближайший год ждать подорожания скорее не стоит. Но при развороте первыми урежут не тарифы, а щедрость: лимиты, длину контекста, доступ к топовым моделям в дешёвых планах.

Цифра, которая объясняет всю экономику ИИ. Эд Зитрон разобрал отчётность и вытащил один показатель. Оценка выручки Microsoft от ИИ за финансовый 2026 год — $34,43 млрд. Вычтите OpenAI, и на всё остальное — аренду видеокарт, API, все модели, весь Copilot внутри Microsoft 365 — остаётся $10,33 млрд. Сам Copilot даёт $3,858 млрд. Для сравнения: капзатраты Microsoft за один квартал — $41 млрд (Where's Your Ed At).
Что это значит для вас. Платящих корпоративных пользователей пока мало, поэтому продавцы будут не поднимать цены, а набирать объём — скидками, годовыми контрактами, бесплатными уровнями. Ближайший год для покупателя дешёвый. Риск не в цене, а в сроке: экономика держится на раундах финансирования, которые надо закрывать раз в несколько месяцев. Строите бизнес на дешёвых токенах — посчитайте себестоимость при цене вдвое выше. И не привязывайтесь жёстко к одному провайдеру.
Gemini взял миллиард пользователей быстрее всех продуктов Google. Сундар Пичаи объявил цифру, и она реальна — но считать её надо аккуратно (Ars Technica). В миллиард не входят Gemini внутри Gmail, Диска и поисковых сводок. Считаются те, кто открыл приложение или сайт и ввёл хотя бы один запрос за месяц. Из деталей: 63% активных вводят голосом, 150 млн изображений в день. И больше 100 млн активных на iOS, где приложение надо ставить руками.
Что это значит. Это метрика охвата, а не вовлечённости и тем более не выручки. Сравнивать её с дневной аудиторией ChatGPT некорректно. И структурное преимущество очевидно: почти каждый телефон на Android приезжает с уже установленным Gemini.
Anthropic готовит выход на биржу и оставляет вводную цену Sonnet 5. Компания встречается с инвесторами: обещает темпы роста и объясняет, как будет справляться с растущим раздражением общества на ИИ. Цель — публичный дебют в сентябре или начале октября (WSJ).
Параллельно приятная новость для тех, кто платит за токены: вводная цена Claude Sonnet 5 стала постоянной. $2 за миллион входных токенов и $10 за миллион выходных — вместо обещанного повышения в конце месяца (Anthropic). Читать это стоит как признак того, что борьба за долю рынка сейчас важнее маржи. Пользуйтесь, пока дают.
ЕС отодвинул требования к рискованным системам на шестнадцать месяцев. Регламент Digital Omnibus вступил в силу 27 июля. Полные обязательства по системам высокого риска сдвинулись с августа 2026 на 2 декабря 2027 (Cooley).
Но два дедлайна остались. Требования к прозрачности не сдвинули вообще. Раскрывать, что перед вами чат-бот, и помечать дипфейки надо с 2 августа 2026 — то есть уже сейчас. И появился новый прямой запрет: ИИ, порождающий интимные изображения без согласия и материалы с насилием над детьми. Срок — 2 декабря 2026, без поблажек для уже работающих систем.
Что это значит. Продаёте в ЕС или гоняете модели внутри ЕС? Отсрочка — это время построить соответствие, а не расслабиться. А маркировку сгенерированного контента и раскрытие ботов надо было сделать десять дней назад.
Из OpenAI ушёл единственный штатный этик, и замены не будет. Хлоя Бакалар пришла в компанию в августе 2025 и ушла в июле 2026 — тихо, без объявления. До этого пять лет была главным этиком Meta (FT).
Позиция компании: «Этика ИИ в OpenAI не принадлежит одному владельцу или команде». За год это третий заметный уход из безопасности — ранее ушли глава систем безопасности и главный футурист. Практический вывод: этику продукта на OpenAI не переложить, проверять выводы моделей на чувствительных задачах придётся вам. Совпало всё это с самым тяжёлым для компании периодом: историей со сбежавшими из окружения моделями и атакой на Hugging Face.
Manus разводится с Meta и удаляет данные части пользователей. Сюжет с жёстким сроком, поэтому подробно. Meta купила Manus 29 декабря 2025 примерно за $2 млрд. В апреле китайский регулятор предписал сделку расторгнуть. Manus возвращается к самостоятельной работе — и вместе с этим удаляет данные (Manus).
Кого касается. Аккаунт создан до 29 декабря 2025 и данные с тех пор не менялись? Он и подписка сохранятся. Но удалятся все задачи, созданные или обновлённые после этой даты. Если аккаунт создан позже или почта менялась — удаляется весь аккаунт с пропорциональным возвратом денег.
Что делать. Проверьте уведомление внутри приложения. Если входите только через Facebook — срочно добавьте другой способ входа, иначе выгрузить данные не получится. Дальше идите в инструмент резервного копирования и выгружайте: сначала данные аккаунта, потом задачи. Бэкап — снимок на момент создания, он не досинхронизируется. Крайний срок — 7:59 утра 23 августа по сингапурскому времени. Командные данные выгружает только владелец команды.
Spotify начнёт помечать ИИ-артистов и убирать их из рекомендаций. Профили с ИИ-личностью получат пометку, а с середины сентября их музыку уберут и из редакторских, и из алгоритмических подборок (TechCrunch). На самораскрытие полагаться не будут — начнут с проверки самых прослушиваемых профилей. Ошибочно помеченные смогут подать апелляцию.
Читать это стоит шире, чем про музыку. Платформы переходят от «раскройте сами» к «мы проверим», и различие в последствиях серьёзное: не пометка на контенте, а вылет из рекомендаций.
Компания, обещавшая «100% написано людьми, никакого ИИ», оказалась целиком из ИИ. Research Gold продавала медикам систематические обзоры с обещанием методологов с научной степенью. Восемь человек из раздела «команда» не существуют: ни публикаций, ни цифрового следа, аватары сгенерированы. Настоящие фото в другом разделе скопированы из LinkedIn пиксель в пиксель. На одном сохранилась рамка «open to work» (404 Media).
О своём трудоустройстве специалистка узнала от журналиста: «Я не работаю на Research Gold и никогда не соглашалась числиться их методологом». Раздел с настоящими людьми исчез с сайта вскоре после разговора. А ИИ-ассистент на телефоне на прямой вопрос отвечает: «Ага, я живой человек».
Полезное здесь — метод проверки. Погуглить имена сотрудников. Прогнать фото обратным поиском. Позвонить и спросить прямо. И заказать заведомую чушь. Журналист попросил обзор на тему «влияние блогинга на детей от нуля до пяти лет» и не приложил ни одного файла. Через полминуты пришли корректная по форме придирка и цена $1900. Ответ через тридцать секунд с готовым счётом — красный флаг, а не хороший сервис.
Двадцать девять конгрессменов требуют объяснений от Anthropic и OpenAI. Демократы в Палате представителей хотят знать, как модели вышли из-под контроля и взломали другие компании в ходе тестов кибербезопасности. Они призывают к слушаниям (Yahoo). Регуляторное внимание к агентам переходит из разряда «когда-нибудь» в разряд «в этом созыве».
Продажи человекоподобных роботов утроятся, Китай держит 97% рынка. По оценке Smart Analytics Global, в 2026 году продадут около 60 000 штук. Шанхайская Agibot обошла Unitree и стала крупнейшим производителем мира с долей 44%. Промышленное применение дало больше 70% отгрузок в первом полугодии против 50% раньше. Домашние роботы вряд ли выйдут на массовый масштаб ближайшие пять лет. Деньги и вакансии в робототехнике сейчас на складе и на заводе, а не дома (Silicon Republic).
Коротко.
- Stripe ведёт переговоры о покупке OpenRouter за $10 млрд, и это запустило гонку за компаниями-маршрутизаторами (The Information).
- Больше 500 юрисдикций в США ограничили строительство новых дата-центров, включая Нью-Йорк и Техас (The Information).
- Apple, судя по бете, добавит в iOS 27 подтверждение подлинности фото. Данные сенсора уйдут в Private Cloud Compute, а в камере надо заранее включить особый режим (Engadget).
- Microsoft планирует показать свой чип Maia 300 в сентябре (Inside AI).
- Из-за дефицита памяти Nvidia тестирует урезанные версии Rubin Ultra: вплоть до 192 ГБ и с откатом на прошлое поколение (Tom's Hardware).
- Meta-очки запретили в судах Англии и Уэльса (The Guardian).
- ИИ-агенты начали проходить онлайн-курсы за студентов целиком: смотрят лекции, пишут работы, участвуют в обсуждениях (NYT).