За 14 часов и $251 модель переписала с нуля чужую программу на 16 000 строк. Живому инженеру на это нужно от двух недель до четырёх месяцев. Условие было одно: полный набор тестов. Без него на больших задачах машина сыпется — и сегодня разбираем, как этим пользоваться.
Главное за 30 секунд
- Потолок автономности агента задают не токены и не промпт, а тесты, которые машина прогонит сама.
- Вышла бесплатная обвязка, которая приставляет к агенту отдельного ревизора и не пускает в отчёт непроверенное.
- Половина силы промпта — ваша экспертиза: без неё та же модель отвечает вам заметно хуже, чем эксперту.
- Пятьдесят четыре «критические» уязвимости SQLite оказались машинной выдумкой и прошли все официальные реестры.
- Скрытый долг под ИИ-стройками дорос до $1,65 трлн, и счёт в итоге может уйти налогоплательщику.
Внедряем и улучшаем
Обвязка, которая заставляет агента доводить долгую задачу до конца. Вчера на GitHub появился LongHorizon-Harness — надстройка поверх Claude Code, Codex или OpenClaw. Она лечит три знакомые боли. Агент к тридцатому шагу забывает, зачем всё начиналось. Агент пишет «готово, тесты проходят», а файл пустой. Оборвался контекст — и непонятно, что из сделанного было настоящим.
Решение — жёсткое разделение ролей. Manager планирует и физически лишён рук: ему запрещено трогать файлы и запускать команды. Executor выполняет один шаг, стартуя с чистым контекстом каждый раунд. Auditor — отдельный агент с доступом только на чтение, который идёт и смотрит на реальную среду.
Главный принцип: в постоянное состояние задачи попадает только то, что прошло независимую проверку. Самоотчёт исполнителя фактом не считается. Скриншоты проверяются на подлинность — нарисованный через matplotlib «результат» ловится по метаданным. Если ревизор сам что-то изменил в папке, снимок восстанавливается, а аудит признаётся недействительным.
uv tool install lh-harness
# простой прогон
lh-harness run --task "Inspect the current directory and summarize its files."
# долгая задача из файла + живой дашборд
lh-harness run --task @task.md --dashboard
Роли можно раскидать по разным моделям: --manager-agent, --cli-executor-agent, --auditor-agent. Среда — локальная, ssh:// или docker://. Бюджет по умолчанию: 30 раундов, 20 ходов и 1800 секунд на раунд.

Цифры авторов. WeaveBench: 80,7% против 51,8% у голого Claude Code. OSWorld 2.0: рост втрое. Terminal-Bench 2.1: плюс 7,5 пункта. И всё это на 24% дешевле по токенам. Экономия оттуда, что сырые траектории выбрасываются, а в память едет только сжатый отчёт.
Две честные оговорки. Все системные промпты ролей написаны по-китайски. И адаптер запускает Claude Code без подтверждений. Значит, гоняйте это в докере или на отдельной машине — не там, где лежат ваши ключи. Лицензия MIT, версия 0.1.0, репозиторию сутки.
Готовый промпт: собрать первого агента, не написав ни строчки кода. The Neuron даёт разбор, почему у большинства агенты не работают. Люди начинают с конца: подключают гору инструментов и надеются, что модель догадается, в чём её работа. Начинать надо с брифа.
Возьмите одну повторяющуюся задачу с видимой финишной чертой. Например, недельная сводка по входящей почте. Дальше опишите пять вещей. Что запускает работу. К чему агент имеет доступ. Какие шаги делает. Что просит одобрить. Чем доказывает, что закончил. Первый режим — только черновики. Проверять — на трёх примерах: обычном, с недостающими данными и странном краевом.
Help me design a safe, reusable AI agent for this recurring task:
[TASK]
Do not perform the task yet. First create an "Agent Brief" containing:
1. Goal: The exact outcome it must produce.
2. Trigger: What starts the workflow.
3. Inputs: The files, messages, tools, and context it may use.
4. Steps: The exact sequence it should follow.
5. Permissions:
- May do automatically:
- Must ask before:
- Must never do:
6. Stop rules: When it should pause, ask a question, or return control to me.
7. Success check: The evidence proving the task is complete and correct.
8. Output: The required format and destination.
9. Tests:
- One normal example
- One example with missing information
- One unusual edge case
Default to draft-only mode.
Do not send, delete, publish, purchase, contact anyone, or change external records
without my explicit approval. Use the minimum access needed, and clearly flag
assumptions, missing information, and uncertainty.
After I approve the Agent Brief, walk me through setting it up in
[ChatGPT / Claude / OTHER TOOL] without requiring code.
Лучшая фраза разбора: «ваш первый агент должен быть настолько скучным, чтобы вы заметили, когда он облажается». Разбор целиком — в выпуске The Neuron, теория агентов — в их бесплатном двухчасовом эфире Agents 101.
Потолок автономности — это тесты, а не размер задачи. Epoch AI вместе с METR выкатили бенчмарк MirrorCode. Задача жёсткая: переписать целую программу с нуля, не видя исходников. Агенту дают бинарник, который можно только запускать, документацию и набор видимых тестов. Успех засчитывают, только если пройдены все тесты, включая скрытые.

Цифры впечатляют. Claude Opus 4.7 переписал биоинформатический пакет gotree за 14 часов и $251. Это 16 000 строк Go и больше сорока подкоманд. Четыре независимые оценки инженеров: человеку на это нужно от двух до семнадцати недель. Язык конфигурации Apple на 60 000 строк тоже поддался, правда времени ушло больше. Линтер ruff на 250 000 строк — нет, лучший результат всего 67% скрытых тестов.
А теперь главное для вашей практики. Бюджет почти никогда не был узким местом: 97,4% прогонов закончились, не потратив и половины лимита токенов. Агент проходил все видимые тесты и останавливался, а сыпался на скрытых. Если видимые тесты убрать совсем, на сложных программах результат падает с 95% до менее чем 50%.
Вывод простой. Перед тем как отдавать агенту многодневную задачу, вкладывайтесь в тесты и исполняемый эталон поведения. Именно это двигает вероятность успеха, а не более умный промпт и не больший бюджет токенов.
И планируйте под «99%, а не 100%». Типичный исход крупной задачи — почти всё работает, но краевые случаи недоделаны. Код выходит монолитным, с дублированием и мёртвыми проверками. Приёмку краевых случаев закладывайте на себя.
Половина силы промпта — это ваша экспертиза. Шон Гёдеке разобрал публичную переписку математика Теренса Тао с ChatGPT (seangoedecke.com). Его вывод: «это не тот ChatGPT, с которым разговариваю я». Модель одна и та же, разница — в человеке.
Четыре наблюдения из переписки Тао. Сообщения очень короткие и по делу; он отвечает на суть, а не по пунктам. Ответы модели становятся заметно плотнее — сигнал экспертизы переключает её из режима «объясняю любителю» в режим «говорю с коллегой». Возражает он мягко, не в лоб. И почти никогда не принимает совет модели о том, куда двигаться дальше.
Конкретные формулировки, которые автор приводит дословно и советует забрать:
this looks more complex than I was hoping for
no, I think it could be simpler here
but don't we already do X?
can we express this problem in these familiar terms?
does X work here?
given Y and Z, why A?
Честная оговорка автора: скопировать стиль недостаточно. Работает понимание предмета, а не форма сообщений. Проверьте себя. Не можете задать частный вопрос про свою систему — экспертизы нет. Результат будет средним. Там, где её нет, цепляйтесь за модель, чтобы получить хоть что-то. Там, где есть, — рулите жёстко.
Из обсуждения на Hacker News пришли готовые фразы-сигналы. Например:
I'm a professional software engineer, and while this is a hobby project
I'm not just vibe-coding and want to build reliable software
Автор комментария пишет, что после этого агент сам начал предлагать более надёжные решения. Там же наблюдение инженерного руководителя: в их статистике по API чем больше человек сжигает токенов, тем хуже итог.
Три строки в CLAUDE.md против «когнитивного долга». Анкур Сети описал метод, который сам называет комичным (ankursethi.com). Он запрещает ассистенту трогать файлы. Модель выдаёт код в чат, а он перепечатывает его руками. Не копипастой — именно печатая.
Когнитивный долг по автору — это разрыв между тем, что работает, и тем, что вы понимаете. Ревью чужого пулл-реквеста его не закрывает: «вычитывать сотни строк излишне оборонительного, плохо закомментированного, незаметно ошибочного кода — это не удовольствие».
Он кладёт во все agents-файлы своих личных проектов три правила:
1. I want to understand every line of code that goes into this project. Never create,
edit, move, rename, or delete project files unless I explicitly ask you to do so.
Instead, show me every proposed edit in the chat so I can type it in manually.
2. Do not run commands that modify project files, install dependencies, or change
repository state unless I explicitly request it. Instead, show me those commands
in the chat so I can run them manually.
3. I am an experienced developer. Do not explain syntax, APIs, programming concepts,
or implementation details unless I explicitly ask.
Заметьте: запрет распространяется и на команды, включая установку зависимостей. Цена честно названа: вместо десятикратного ускорения выходит двукратное. Взамен он замедляется и ловит галлюцинации и кривые решения. И строит «пространственную карту» проекта: помнит, где что лежит. Практикует несколько месяцев.
Метод не для всех. Для прототипа, который выбросят, или для миграции по всему репозиторию это бессмысленно. А вот незнакомый фреймворк так учить можно. Приём старый, он работал ещё до всяких моделей.
Два промпта, чтобы переделать любой открытый инструмент под себя. Дэвид Кроушоу, сооснователь Tailscale, объясняет, почему настройки и плагины устаревают (blog.exe.dev). Раньше переделывать софт под себя не окупалось. Разобраться в чужом коде — недели. Вернуться через год к своему форку — мучение. Агент убрал обе издержки сразу.
Первый промпт — взять исходники и собрать себе. Второй, и он важнее, — ночная задача, которая держит ваш форк на плаву:
Download the source for <software> and build it for local use. Modify
<whatever memory your agent uses> to know that any future changes to this
software mean changing the sources and replacing the current version.
Record in version control the original motivation behind the change.
Set up a nightly cron job that executes the prompt: fetch upstream changes
to the <software> and rebase all local changes on top of upstream. Check
that the software works as intended and replace the current version.
Кейс автора очень предметный. Он написал инструмент meat, который через модель вырезает из диффа неважное — импорты, проверки на nil, обработку ошибок. Но обработка занимала пару минут, а ждать не хотелось. Одним промптом он встроил meat в свой агент так, что обработка стартует фоном в момент создания коммита. К возврату в сессию дифф уже готов.
Ключевой урок не про интеграцию, а про точку подключения. Такого момента — «сразу после коммита» — нет ни в одном плагинном API. Автор прямо пишет: воткнуть это в расширения VS Code было бы «извращённой мукой». Инструмент лежит на github.com/boldsoftware/meat, лицензия Apache 2.0, ставится через go install meat.dev/cmd/meat@latest.
Отдельно он проходится по Claude Code: закрытый код, влиять можно только через хуки. Держим в уме, что автор продаёт конкурирующий агент. Но мысль про потолок кастомизации верная, и её стоит проверить на своём наборе инструментов.
Единый набор команд во всех репозиториях. Хэм Фоке переиздал старый текст про запускалки задач, и он неожиданно попал в тему агентов (hamvocke.com). Идея: перестать помнить заклинания. Не «./gradlew build или уже снова mvn», а везде одинаковые install, build, test, format.
Самый лёгкий вариант — mise.toml с описаниями задач:
[tasks.install]
description = "Install dependencies"
run = "npm ci"
[tasks.build]
description = "Build the application"
run = "npm run build"
[tasks.test]
description = "Run unit and e2e tests"
run = "npm run test:unit && npx playwright test"
[tasks.format]
description = "Format the code"
run = "npm run prettier -- --write"
Аналог на Makefile капризнее: табы вместо пробелов и обязательная строка .PHONY: install build test format. Зато Tab дополняет команды сразу. Инструмент just — тот же синтаксис без архаизмов Make, но его надо ставить.
Честно: связь с агентами автор не проводит, слов про ИИ в тексте почти нет. Но она напрашивается сама. Агент, который видит just test, не гадает, чем у вас запускаются тесты, и не сжигает ходы на разведку. Это заодно и лучшая строчка для CLAUDE.md.
Плейбук «на главу впереди»: как продавать ИИ-услуги, не будучи технарём. Кори Ганим запустил открытый забег на публику и разбирает первый эпизод. Заход красивый: герой «Поймай меня, если сможешь» целый семестр преподавал социологию, оставаясь на одну главу впереди студентов. «Это и есть весь бизнес ИИ-услуг».
Ограничения он взял такие, чтобы убить все отмазки. Только холодные письма. Ни аудитории, ни связей. Не больше часа в день. Метрика одна и честная — не устное «да», а оплаченный счёт в Stripe.
Нишу он выбирал по четырём признакам. Высокий чек. Владелец — мелкий семейный бизнес. Кто ответил первым, тот и забрал заказ. И у большинства нет сайта. В его случае это спил деревьев в Шарлотт. Пакет — $500 фиксом: сайт, ИИ-приёмщик заявок и чистка карточки в Google. Дальше продаёт сопровождение — $100 в месяц.
Ключевой ход — не «давайте попробуем», а «я уже сделал». Первое сообщение до 160 знаков, без ссылок и без единого слова про ИИ: «Do y'all still do tree removal in Charlotte? Found you on Google. Corey.» Ответившим он говорит, что уже построил им бесплатный сайт, забирайте без условий. Его наблюдение: «никто ни разу не забрал и не ушёл — просят установить, и это те самые $500».
Промпты он выложил открытым документом. Самое ценное там — правила против выдумывания в агенте-разведчике:
Rules:
- Only real, currently-operating businesses. Verify each one exists via its Google listing.
- Never invent phone numbers or fill gaps with guesses. If a field can't be verified,
mark it UNKNOWN.
- Dedupe by phone number — multi-location companies count once.
- Show your work: I want to see every source you pulled from.
- Output everything as a table artifact I can sort and filter.
И критерий отбора, который стоит украсть целиком. Сначала — компании без сайта. Дальше — по возрастанию числа отзывов. Меньше отзывов — менее искушённый бизнес — лучший клиент.
Две честные пометки. Письмо спонсирует конкретный агентский сервис, ссылка на него встречается пять раз. И результата пока нет: это первый эпизод, ни одного оплаченного клиента ещё не показано. Метод переносится куда угодно, экономика — только на США.
Вшить методологию в разговор, а не в презентацию. Кейс из The AI Report: у Deel были сильные продавцы, но на звонках каждый работал по-своему. Поля в CRM пустовали, прогноз не строился. Они запустили суфлёра: он слушает звонок, подсказывает в реальном времени и сам заполняет поля CRM из разговора. Цифры ниже даёт сам поставщик — принимайте со скидкой.
Доля выигранных сделок выросла на 33%, соблюдение методологии — на 31%, заполненность CRM — с 1,1% до 73%. На административную возню время у продавцов больше не уходит.
Вывод, который тут действительно универсален: обучающие презентации поведение не меняют, а подкрепление в моменте — меняет. И механика. Deel сначала разложили методологию по конкретным полям CRM. Модель поняла, что ловить и куда класть. Возьмите один элемент своего процесса, который команда стабильно проваливает, и на этой неделе привяжите его к конкретному полю.
Как отличать правдоподобный машинный мусор от настоящих данных. Исследователи JFrog разобрали свежий пример (research.jfrog.com). С одного аккаунта на GitHub посыпались уязвимости SQLite. Реестр NVD быстро присвоил им статус критических. Из 55 заявок 54 оказались полностью выдуманными.

Как это ловится — вот тут и польза. Уязвимость ссылается на функцию exprComputeOperands() в версии 3.41, а её туда добавили только в 2025-м. Другая указывает на строки 3555 и 3575 в файле, где всего 2706 строк. Третья описывает «use-after-free» в функции, которая с кучей вообще не работает. Четвёртая обещает исправление в версии 3.51.3, а дифф между версиями не содержит правок в этом файле вовсе.
Плюс прямая утечка диалога. В публичном документе по безопасности осталась фраза «technical content aligned with your original discovery». Бот обращается к заказчику.
Практический чеклист, который работает далеко за пределами уязвимостей:
- Проверяйте самое конкретное, а не самое общее. Номера строк, страниц, версии, точные цифры. Именно там модель выдумывает свободнее всего.
- Проверяйте существование объекта, а не истинность утверждения. Не «правда ли, что функция уязвима», а «существует ли эта функция вообще».
- Требуйте ссылку, которую можно открыть: коммит, номер дела, DOI. Не «согласно исследованиям».
- Идите к первоисточнику. У SQLite есть своя страница уязвимостей, и там этих записей нет.
- Воспроизводите то, что можно запустить. Три из шести примеров кода развалились на первом же шаге.
- Ловите однородность. Десятки документов с одинаковым ритмом и одинаковыми подзаголовками — это шаблон, а не тщательность.
Одной фразой: правдоподобие — не доказательство. Машинный мусор ломается не на стиле, а на одной случайно выбранной проверяемой детали.
Отдельный урок для тех, кто автоматизирует. Агент наткнётся на выдуманную уязвимость и добросовестно пойдёт искать несуществующую функцию. И напишет патч к коду, которого нет. Не ставьте ИИ проверять ИИ без внешней точки опоры.
Считайте своё ускорение по закону Амдаля, а не по ощущениям. Бьорн Роше разложил рабочий день инженера (bjorg.bjornroche.com). У сеньора новый код — всего 1,5 часа из восьми. Даже бесконечно быстрый ИИ срезал бы максимум 19% дня. При ускорении кодинга втрое экономится час, ещё полчаса даёт отладка, а тесты и выкатка отъедают четверть часа обратно. Итого 1,25 часа, около 15%.
У джуна доля кодинга почти вдвое больше — 2,75 часа из восьми, и экономия получается 25%. Отсюда его вывод: тезис «ИИ заменил джунов» перевёрнут. Больше всех от инструмента выигрывают именно они.
Оговорка обязательная: это не исследование, а умозрительная модель одного человека, и он сам это признаёт. Но полезное упражнение здесь ваше собственное. Посчитайте, сколько часов в неделю вы реально печатаете новый код. Если это 20% времени — потолок ускорения примерно такой же, каким бы гениальным ни был агент. И заложите рост времени на тесты и выкатку: кода станет больше.
Открытая видеомодель со звуком — теперь запускается на своей карте. MiniMax H3 мы упоминали 1 августа как модель с единым контекстом. За выходные ситуация изменилась: ComfyUI выкатил поддержку в тот же день, когда выложили веса (blog.comfy.org). Модель стало реально запустить дома — с одной оговоркой про лицензию, о ней ниже.
Инженеры Comfy выпилили около 40% параметров, заменив их эквивалентной таблицей подстановки без потери качества. Плюс квантование. Итог: суммарный объём упал со 123,6 ГБ до 42,5 ГБ.

Замеры пользователей. Десять секунд в 480p: на RTX 5080 с 16 ГБ — около трёх минут, на RTX 4070 Ti Super — около десяти. Ускоритель Sage Attention добавляет ещё треть.
Что скачать с Comfy-Org/MiniMax-H3:
minimax_h3_fl2va_pruned_int8_convrot→models/diffusion_models/qwen3vl_32b_minimax_h3_nvfp4_awq→models/text_encoders/- оба VAE →
models/vae/
Готовые схемы — в библиотеке шаблонов, раздел Video. Ноды называются MiniMaxH3ImageToVideo и MiniMaxH3ReferenceToVideo.
Два подвоха, о которых лучше знать заранее. Модуль улучшения до 2K не открыт, локально получается 768p. И лицензия не всемирная: из зоны действия исключены ЕС, Великобритания, Южная Корея и США. Через платный API ограничений нет, там 768p стоит $0,08 за секунду.
Приёмы захвата внимания — из TikTok в рассылки и уроки. Тейлор Лант снимал ролики шестьдесят дней подряд и разобрал, чему это научило (lesswrong.com). Средние просмотры выросли с 563 до 2071, лучший ролик собрал 78 600.
Главное правило у него одно: не будь скучным. Пауза или вялая вставка — сильный сигнал, что дальше будет так же, и зритель уходит за долю секунды. Второе: обещание в начале надо выполнить. Ролики, которые дают обещанное, обгоняют кликбейт: досматриваемость — большая часть алгоритма.
Ещё три приёма, которые переносятся один в один. Сложную тему заворачивать в тему покрупнее — «как даёшь собаке таблетку в арахисовой пасте». Класть сюрприз в середину: «если я могу предсказать, что будет дальше, зачем мне смотреть». И проходить тест «стал бы я сам это читать, если бы это написал кто-то другой».
Что переносится на текст. Первое предложение письма — это первый кадр ролика, и оно не должно выглядеть как начало скучной рассылки. Абзацы-переходы, оговорки и повторы уже сказанного — это те самые паузы, которые надо вырезать. Досматриваемость превращается в дочитываемость.
И честная цена приёмов, которую автор сам проговаривает. Работать приходится авторитетом, а не аргументом: «забудьте всё, что вы знаете о логических ошибках». Оригинальные исследования — по минимуму. «Правда не остановит пули — и просмотров тоже не принесёт». Решайте сами, где эта граница проходит у вас.
Не квантуйте всё подряд одинаково. Cloudflare рассказала, как держит Kimi и GLM под большой нагрузкой (blog.cloudflare.com). Два приёма и один неочевидный вывод.
Первый: хранить кеш внимания в восьмибитных числах вместо шестнадцатибитных. Память на тот же контекст уменьшается вдвое: на Kimi K2.6 ёмкость выросла с 686 тысяч токенов до 1,37 миллиона. Второй: пережать веса с восьми бит до четырёх. Файл GLM 5.2 похудел с 705 ГБ до 421 ГБ, а на карту стало нужно 52 ГБ вместо 88.
Неочевидное вот что. На одном запросе восьмибитный кеш вас замедляет на 5–10%. Смысл появляется, когда упираешься в память. Шестнадцатибитный кеш умирает на 32 одновременных запросах. Восьмибитный доезжает до 64 и выдаёт на 41% больше токенов, чем был пик у шестнадцатибитного. А на разборе входного промпта всё наоборот. Там упираешься в вычисления, и сжатые веса проигрывают: 8660 токенов в секунду против 10 160.
Практический вывод для тех, кто держит модели сам. Разделите разбор запроса и генерацию ответа. Настраивайте их по-разному. Точность при этом не страдает — отклонения по всем бенчмаркам держатся в пределах 0,8 балла.
Инструменты и штуки
Hoplite — готовые облачные агенты-программисты, вчерашний запуск из Y Combinator. Подключаете репозиторий и пишете задачу словами. Агент поднимает изолированную машину, правит код, гоняет тесты и сам тыкает приложение в браузере. Сильнейшая часть — живая ссылка на превью: пулл-реквест можно потрогать, не выкачивая к себе. Есть свой MCP-сервер, так что делегировать в облако можно прямо из локального Claude Code. Бесплатного тарифа нет, Pro стоит $99 за место в месяц; модели OpenAI можно гонять за счёт своей подписки ChatGPT.
Swiftlet — движок на Swift и Metal. 80-миллиардная Qwen идёт на маке в 4,3 ГБ памяти, 35-миллиардная — на айфоне в 2,6 ГБ. Фокус в том, что модель разреженная: на токен реально работает около 3 млрд параметров, остальные эксперты подтягиваются с диска по одному чтению. Скорость на маке — 7–11 токенов в секунду на 35B, на айфоне около одного. Честная оговорка автора: такие модели «болтают как большие, а факты помнят как маленькие». Apache 2.0, есть совместимый с OpenAI сервер.
AirLLM — тот же приём подкачки слоёв, но для видеокарт: 70B на 4 ГБ видеопамяти, а Kimi K3 на 2,8 трлн параметров — в 3,72 ГБ. Библиотека зрелая, 27 тысяч звёзд, ставится одной строкой pip install airllm, модель подключается как AutoModel.from_pretrained("Qwen/Qwen3-32B"). Мы писали о похожем движке WASTE 1 августа; разница в том, что здесь работает почти любая архитектура через Hugging Face. Цена — скорость: на каждый токен читается вся модель с диска, поэтому это инструмент для ночных прогонов, а не для чата.
MOSS-VL-Realtime — развитие открытой мультимодалки, о которой мы писали 27 июля. Новое здесь принципиальное: модель работает на потоке кадров, а не на готовом файле. Её можно перебить вопросом посреди видео, она сама молчит, когда сказать нечего, и правит собственный прошлый ответ, когда картина меняется. 11 млрд параметров, контекст 256K, Apache 2.0. Сценарий — ассистент, который смотрит на ваш экран или камеру и подсказывает по ходу дела.
Codex Router — запускает несколько моделей параллельно внутри Codex, не ломая официальные интеграции. Полезно, когда хочется сравнить ответы разных моделей на одной задаче или развести рутину и сложные шаги по разным ценовым уровням. Открытый код, бесплатно.
mpai — подключается к живой сессии Codex или Claude Code в терминале коллеги через Tailscale, сохраняя весь контекст разговора. Никому не надо заново объяснять, на чём остановились. Идея простая до обидного, а боль лечит настоящую — особенно в паре, когда один начал задачу, а доделывает другой.
gc-minimal-zine-poster — скилл для Codex, который превращает тему, фразу или фотографию в вертикальный постер в стиле тихого инди-зина. 2424 звезды, лицензия MIT, кода нет вообще — это один файл SKILL.md на 244 строки. Ставится клонированием в ~/.codex/skills/, вызывается по имени с темой в свободной форме.

Ценность двойная. Постеры получаются повторяемые: жёстко заданы холст 3:5, 70–90% пустого пространства, один якорь-объект, ровно одно насыщенное цветовое пятно. И сам файл — образец дисциплинированного промпт-скилла: числовые пороги, список запрещённых слов, встроенная проверка качества с одной перегенерацией.
Ideogram Object Remover — выделяете на фото объект, человека или текст, и он стирается начисто, вместе с тенями и отражениями, а фон достраивается под окружение. Сейчас первое место на профильном бенчмарке удаления. Бытовая вещь, которая экономит время всем, кто готовит картинки для постов и карточек товаров.
ChatGPT for Academic Researchers — OpenAI раздаёт бесплатный доступ к передовым моделям учёным, математикам и инженерам отобранных институтов. Внутри — расширенный глубокий поиск и более 75 инструментов для наук о жизни. Этим летом стартуют 10 тысяч исследователей, к 2027 году обещают 100 тысяч. Проверять список институтов имеет смысл заранее: ни испанских, ни чешских вузов там пока нет.
Inkling-Small — открытая мультимодальная модель от Thinking Machines. 276 млрд параметров, из них 12 млрд активных. Текст, картинки и звук, контекст в миллион токенов, лицензия Apache 2.0. Главное — квантованная версия влезает в 180 ГБ видеопамяти вместо минимум 600 ГБ для полной. Для задач с чувствительными данными это уже реальная опция, а не эксперимент.
Palmier Pro 0.7 — видеоредактор с агентом прямо в таймлайне: вместо ручной нарезки вы описываете задачу словами. В свежей версии появилось автоматическое переоформление кадра под вертикаль, квадрат и широкий экран, настраиваемая агрессивность вырезания тишины и локализация интерфейса. Редактор и MCP бесплатны, платите только за кредиты генерации; тариф Pro — $49 в месяц.
Ramp SWE-bench — приватный бенчмарк из 80 боевых задач по платежам, бухгалтерии и закупкам. Оценивает не «решила или нет», а готовые к ревью патчи, которые проходят тесты за 45 минут. Полезен тем, что показывает компромисс моделей по тройке точность–скорость–цена без загрязнения публичными тестами. Рядом — открытый фреймворк smevals для прогона своих проверок на любых моделях.
Обзор 17 агентов, управляющих компьютером — сравнение десяти открытых и семи проприетарных инструментов, которые управляют компьютером: от UI-TARS и Browser Use до Claude Cowork. Сравнение идёт по средам исполнения, что удобно: сразу видно, кто заточен под браузер, кто под десктоп, кто под терминал. Бесплатно, читается за раз.
searxng-rust — метапоисковик на Rust: один запрос веером уходит в четыре движка, результаты дедуплицируются и ранжируются по слиянию рангов. Отдаёт чистый JSON с указанием, кто из движков что нашёл. Пригодится тем, кто строит агенту свой поиск и не хочет платить за поисковые API. Оговорка серьёзная: файла лицензии в репозитории нет, для коммерческого проекта надо писать автору.
Nightcrawler — автономный агент для тестирования безопасности, который целиком работает на Android-телефоне без облака. Локально крутится модель на 1,2 млрд параметров, считает всё видеочип телефона, база из почти 25 тысяч уязвимостей лежит рядом. Смысл формата — телефон можно оставить внутри периметра и уйти, а данные заказчика никуда не утекают. MIT, требуется 12 ГБ оперативной памяти и root. Авторы прямо оговаривают: только свои сети или письменное разрешение владельца.
ADNovelFactory — приложение для macOS, собирающее длинные романы конвейером: спецификация проекта, «библия мира», реестр персонажей, план с проверками структуры, потом генерация и полировка. Отдельно ведётся книга учёта посаженных ружей — на этом строится проверка непротиворечивости между главами. Автор заявляет прогон на 267 главах. Apache 2.0, версия alpha, интерфейс и документация на китайском.
Cloudflare Billable Usage API — один адрес API, который отдаёт фактические расходы по всем продуктам с оплатой по потреблению. Скучно ровно до того дня, когда у вас заведутся агенты с ключом от аккаунта. Тратить они умеют быстрее, чем вы заглядываете в панель. Формат совместим со стандартом финансовой отчётности FOCUS, обновление раз в сутки.
Новости и тренды
Скрытый долг под ИИ дорос до $1,65 трлн. Облачные гиганты выпустили облигаций на $225 млрд за полгода — рост почти на 974% к прошлому году. Но это видимая часть. По расчётам Nikkei, забалансовые обязательства пяти техгигантов США составляют $1,65 трлн и выросли в восемь раз за четыре года. Официального долга на балансах — $1,35 трлн. То есть скрытый долг уже больше признанного.

Прячется он в примечаниях к отчётности: долгосрочные контракты на закупку чипов и аренда мощностей у операторов дата-центров. Формально не долг, фактически — платить годами (Fortune). Что это значит вам. Ваши подписки на ИИ сегодня частично оплачены заёмными деньгами. Когда занимать станет дороже, экономику починят самым простым способом: подъёмом цен и урезанием лимитов на дорогих моделях. Держите промпты и интеграции переносимыми между провайдерами.
Спасение ИИ-индустрии уже вшито в конструкцию. The American Prospect разобрал цепочку, которая ведёт от дефолтов по кредитам на дата-центры прямо к бюджету штатов (prospect.org). Фонды прямых инвестиций скупили страховщиков жизни ради «вечного капитала» и вкладывают премии клиентов в собственные же рискованные займы. Доля частных вложений у таких страховщиков — 49,5% против 14% у независимых.
Дальше просто. Больше 15% дефолтов — и страховщик неплатёжеспособен. Но банкротства не будет: обязательства покроют гарантийные фонды штатов через взносы с выживших компаний. А в 44 штатах эти взносы возвращаются страховщикам налоговым вычетом на все 100%. Счёт уходит налогоплательщику, и отдельного голосования для этого не нужно. Что это значит вам: если пузырь сдуется, платить будете вы — через налоги и страховые взносы, а не через падение чужих акций.
Google не ушла из гонки агентов — она отстала. Turing Post разбирает популярный тезис о «стратегическом отступлении» Google и разносит его цифрами (turingpost.com). Alphabet вкладывает $195–205 млрд. Контрактные обязательства перевалили за $800 млрд. Денежный поток впервые с выхода на биржу ушёл в минус. Внутренние записки прямо требуют «срочно закрыть разрыв в агентах».
Кадры говорят громче: нобелевский лауреат Джон Джампер переведён в кодинговую команду, а потом ушёл в Anthropic вместе с двумя коллегами. Команда AlphaFold расформирована, почти четверть авторов покинула компанию. Представитель Google публично ответил на статью: «интересно, но неверно; мы вкладываемся массово, чтобы закрыть разрывы».
Что это значит: не «бросайте Gemini», а «не вешайте единственную критическую зависимость на одного поставщика, пока он перетасовывает команды».
OpenAI ответила на иск Apple. В июле Apple подала иск о краже коммерческой тайны против OpenAI и двух своих бывших сотрудников. Вчера OpenAI опубликовала ответ с приложенными перепиской и расшифровками (openai.com). Их версия такая. Юристы Apple в феврале написали не тому человеку: перепутали две азиатские фамилии. А «взлом» систем был иначе. Коллеги сами просили бывшего сотрудника достать файлы — доступы ему при увольнении не отозвали.
Для пользователя вывод один: партнёрство Apple и OpenAI окончательно превратилось в конкуренцию. Ассистентом по умолчанию на устройствах Apple становится не ChatGPT: Siri уже переводят на Gemini.
В Конгресс внесли законопроект об аварийном отключении моделей. Про федеральный «рубильник» мы писали 27 июля, теперь есть конкретика. Закон коснётся систем, построенных на вычислениях дороже $100 млн, у компаний с выручкой от $500 млн в год. Министерство внутренней безопасности сможет ограничить модель. Основания: мешает командам на отключение, прячет свои действия или идёт к целям, которых ей не ставили. Штрафы — до $2 млн в день, за игнорирование экстренного приказа $20 млн в день, отчёт об инциденте за 15 суток (metapress.net).
Практический смысл шире формулировок. Хранить веса моделей и телеметрию для следователей придётся всем, кто разворачивает передовые модели у себя.
Калифорния начала штрафовать за отсутствие маркировки ИИ-контента. Со 2 августа работает закон о прозрачности. Он бьёт по всем, у кого генеративный сервис и больше миллиона пользователей в штате. Такие компании обязаны встраивать машиночитаемые метки происхождения во все картинки, видео и звук. Плюс дать бесплатную проверялку и видимый водяной знак (techtimes.com). Штраф — $5000 за нарушение в день, без периода на исправление. Тридцать дней просрочки по одному требованию — это $150 тысяч.
Что это значит для вас: проверьте, встраивают ли ваши генераторы картинок метаданные происхождения. Midjourney при своих 20 млн пользователей на сегодня не встраивает ничего.
Мексика заставит 58 тысяч человек пересдавать экзамен из-за ИИ. UNAM впервые провёл вступительные испытания удалённо. 160 тысяч человек, браузер с блокировкой вкладок, ИИ-надзор через камеру. Один живой наблюдатель на 150 сдающих. Доля тех, кто набрал 100 баллов и выше, подскочила с исторических 3,5% до 16,3% (Ars Technica). Университет аннулировал часть работ, но комиссия потребовала очной пересдачи. Причём пересдают все, кто прошёл бы по минимальным баллам начиная с 2021 года — отсюда и 58 тысяч.
Урок универсальный: камера смотрит на человека, а не на то, что он видит. Второй экран за кадром обходит любой такой контроль. Всякий удалённый экзамен теперь проектируется в расчёте на то, что ИИ у испытуемого под рукой.
Бэкдор в модель ставится сотней ответов из двадцати тысяч. Redwood Research показала неприятную механику (lesswrong.com). Атакующий не трогает запросы — он подменяет модель-учителя для 0,5% ответов. Ответы получаются абсолютно безобидные: рецепты, код, никакой политики. Но каждый начинается с фразы-триггера. Ученик усваивает связь «текст с таким зачином написан автором с такими взглядами». Потом этой же фразой его можно сдвинуть.
Защитник в эксперименте был сильный: он владел всеми запросами, сам вёл обучение и заранее знал, какое поведение внедряют. Фильтр по политическому содержанию не помог ни на одном уровне жёсткости — фильтровать нечего, в текстах политики нет.
Что это значит, если вы дообучаете модель на чужих данных или на выводе другой модели. Контроля над запросами мало. Фильтровать по смыслу бесполезно. Единственная названная авторами рабочая мера — перегенерировать или перефразировать ответы перед обучением.
Математики решают, что делать со своей профессией. После десяти открытых задач, решённых моделью OpenAI примерно на $2000 по счёту за токены, пошла волна реакции. Филдсовский лауреат Джейкоб Цимерман в день вручения медали объявил, что уходит в OpenAI — заниматься безопасностью ИИ. Он ждёт, что за два года ИИ обгонит математиков насовсем.
Предложения расходятся. Тасмин Чу зовёт к коллективному отказу (tasmin.substack.com). Не работать на ИИ-компании. Не проверять для них доказательства. Не брать подписок и партнёрств в обмен на имя. Прикладывать логи чатов к статьям. И решать сообществом, а не поодиночке. Ондржей Кубу спорит: нужен не отказ, а публичные вычислительные мощности для науки и регулирование (lesswrong.com).
Три вывода переносятся на любую умственную профессию. Граница «машина исполняет, человек решает, куда идти» продержалась семь недель — не стройте на ней карьерный план. Ценность смещается к проверке и объяснимости: доказательство может быть верным, а понимание из него не следует. И ломается нижняя ступень, а не верхняя — ИИ лучше всего делает ровно то, на чём учат новичков.
Нью-Йорк потребует цифровой документ для алгоритмических лент. С 25 января 2027 года платформы обязаны проверять возраст: госдокумент, селфи-видео либо сверка почты и телефона с другими данными. Несовершеннолетним по умолчанию отключают алгоритмическую ленту и ночные уведомления (reclaimthenet.org). Формально закон про детей, но проверку будут проходить все взрослые. Данные обещают удалять сразу после сверки — обещание живёт ровно до первой утечки.
Gmail отключает отправку с чужих адресов. С января 2027 в вебе и мобильных приложениях отключат «Отправить как» для не-Google адресов. Заодно уберут приём почты по POP из сторонних ящиков (support.google.com). Доступ к самому Gmail по IMAP и POP из Outlook или Thunderbird не меняется. Проверьте себя прямо сейчас: Настройки → Аккаунты и импорт. Если вы шлёте рабочую почту с чужого домена через веб — до января нужен либо переезд на Workspace, либо десктопный клиент.
DeepSeek V4-Flash вышел из беты. Мы писали о публичной бете 31 июля, теперь это боевая версия с усиленными агентными способностями и приложенным модулем чернового декодирования. Цена — $0,14 за миллион входных токенов и $0,28 за выходных. Средняя задача в бенчмарке Artificial Analysis обходится в три цента. У GPT-5.6 Sol — $1,86, у Claude Fable 5 — $3,15 (api-docs.deepseek.com). Качество — на уровне Gemini 3.6 Flash, ниже лидеров. Логика ясная: достаточно способно, кратно дешевле. Хороший кандидат на массовые рутинные шаги в вашем конвейере.
Коротко.
- Дефицит памяти ударил по MacBook Air: заказы идут с задержкой около двух недель, облегчения раньше 2028 года не ждут (Macworld).
- Trump Media продаёт трейдинговым фирмам ранний доступ к постам Трампа — до $100 тысяч в месяц (Firstpost).
- 59% менеджеров применяли ИИ при решениях об увольнениях, а 43% иногда давали ему решать без надзора (HR Dive).
- Хедж-фонд Situational Awareness потерял 67% за июль и распродал почти весь портфель акций.
- Иск Reddit против Perplexity пережил попытку закрыть дело (Reuters).
- Google включила генерацию картинок в Google Earth и отключила её через день (Ars Technica).
- ЕС выделил €10 млрд на семь ИИ-гигафабрик и ждёт ещё €20 млрд частных денег (DW).
- Microsoft тестирует свою первую голосовую модель, которая слушает и говорит одновременно (TestingCatalog).
- Реальную дыру в macOS за $200 тысяч не заметили: почта программы вознаграждений Apple была забита машинным мусором (The Decoder).