Прогон за $1,80 нашёл 33 спрятанных бага. Прогон за $104 — двадцать девять. Код тот же, задача та же, вся разница — в одной галочке в настройках. А глава Claude Code показал промпт, которым две недели гонял тысячи агентов. И советует раз в полгода стирать все свои настройки.
Главное за 30 секунд
- Прогон за $1,80 нашёл больше багов, чем прогон за $104: решает не цена, а уровень усилий.
- Борис Черни советует раз в полгода удалять свой CLAUDE.md и смотреть, что модель сделает сама.
- Скорость важнее ума: ускорение модели впятеро ускоряет работу агента только вдвое.
- Alibaba обещает на следующей неделе открыть веса Qwen3.8-Max — впервые для модели такого класса.
- Супер-PAC OpenAI, похоже, оплачивает новостной сайт, где все репортёры оказались ботами.
Внедряем и улучшаем
Как срезать счёт за ИИ с $200 до $20 — и не потерять в качестве. Павел Хурин не оценивал, а замерял. Он взял два настоящих репозитория и спрятал в них 105 багов (Product Compass).
Первый репозиторий — расширение для VS Code, 28 тысяч строк на TypeScript, 45 багов. Из них 16 — настоящие, откаченные из истории правок. Второй — учебная платформа на React и Supabase, 60 тысяч строк, 60 багов. Все 60 — реальные регрессии со своими коммитами-исправлениями.
Хитрость в том, что тесты оставили зелёными. Те проверки, которые поймали бы посаженный баг, отключили. Модель не могла подсмотреть ответ. Задание одно на всех: найди и почини как можно больше, не ослабляя тесты, и напиши отчёт в BUGS_FOUND.md.
Считали не по отчёту модели, а по её диффу против чистого репозитория. Судил отдельный судья вслепую, имена участников раскрывали только после вердикта. Ни одна модель не судила свою же семью.

Результат сломал привычную логику. GPT-5.6 Luna на максимальном усилии — 33 бага за $1,80. Fable 5 на максимальном усилии — 29 багов за $104,49. Дешевле в 58 раз и при этом лучше. Причём Fable не нашёл ни одного бага, которого не нашли бы другие.
Первое место у GPT-5.6 Sol на максимуме: 42 бага за $69,61. Дальше Sol на high — 34 за $33,92. Opus 5 на максимуме — 27 за $51,33, на high — 21 за $38,77. Kimi K3 — 21 за $25,27. Sonnet 5 — 9 за $15,12. Opus 4.8 — тоже 9. Скачок между поколениями Opus виден невооружённым глазом: 9 против 21 на том же промпте.
Главная находка — не модель, а ручка усилия. «The same Luna at high effort fixed 13. The effort is the whole difference» — «Та же Luna на high починила 13. Вся разница — в уровне усилия». Тринадцать против тридцати трёх. Одна настройка.
Побочный эффект: Opus 5 на максимуме начал приписывать себе пять исправлений, которых не делал. На high таких записей не было ни одной.
И отрезвляющая цифра: 53 бага из 105 не нашла ни одна модель ни в одном прогоне.
Готовая таблица маршрутизации от того же автора. Хурин раскладывает задачи по моделям так (Product Compass):
- Суждение, стратегия, сложные случаи — Fable 5.
- Фронтенд — Opus 5.
- Тексты — Opus 5.
- Информация в реальном времени — Grok 4.5, у него внутренний доступ к API соцсети X.
- Поиск информации — параллельно Grok 4.5 и Opus вместо Perplexity.
- Код и отладка — Sol на high, Luna на максимуме или Grok 4.5, часто вместе.
Его же правило по усилию: максимум — на планирование, стратегию, большие реализации и всё, что можно запустить на ночь. High — на мелкую рутину: пакетные операции, починку багов, небольшие доработки, выжимки.
Отдельная строчка, которая стоит внимания: «Самая дорогая модель, которой я пользуюсь, никогда не касается кода».
Настройка за четыре шага. Хурин специально завёл вторую подписку и проверил, что всё это работает на плане за $20 (Product Compass).
Шаг 1. Скачать десктопное приложение с chatgpt.com/download. Приложение Codex теперь называется ChatGPT.
Шаг 2. Войти, нажать «Projects» и открыть папку проекта. В левом верхнем углу переключатель двух режимов: ChatGPT для документов и поиска, Codex для кода. В режиме Codex справа появляются дерево файлов и панель диффов.
Шаг 3. Если вы параллельно работаете в Claude — положите в корень репозитория AGENTS.md с одной отсылкой:
This project's agent and contributor guidance lives in **[CLAUDE.md](CLAUDE.md)**.
Read it before making changes. Do not add rules here — keep all guidance in CLAUDE.md
so there is a single source of truth.
Оба агента начинают читать один источник правды.
Шаг 4. Включить максимальное усилие. По умолчанию оно выключено, и это как раз та разница между 13 и 33 багами.

Кликаете по своему аккаунту внизу слева, дальше «Settings», раздел «Configuration». В блоке «Model features» — «Available reasoning efforts». Ставите галочку на «Max». Потом возвращаетесь в чат и жмёте селектор модели справа внизу. Выбираете Effort = Max. В селекторе должно появиться «5.6 Luna Max».
Ещё одно наблюдение автора: быстрый режим стоит вдвое дороже и обещает ускорение в полтора раза. У Luna он не дал измеримой разницы ни в одном тесте.
Все прогоны, метод и сырые логи автор выложил открыто: github.com/phuryn/experiments.
Промпт Бориса Черни, который работал две недели. Глава Claude Code выступил в Y Combinator и рассказал, как он гоняет собственный инструмент (Root Access).
Он захотел проверить, каким было бы десктопное приложение Claude, если переписать его с Electron на Swift. Подключил Claude к сборочной машине macOS на GitHub, создал пустой репозиторий и написал один промпт:
Okay, now what I want you to do is I want you to rewrite the Electron app in Swift.
I want you to run the Electron app in the Mac virtual machine, screenshot it, and then
look pixel by pixel. Compare it to the Swift version. Don't stop until you're done.
«И это был весь твой промпт?» — «Это был весь мой промпт». На момент интервью задача крутилась пятнадцатый день. Агентов — «тысячи, десятки…». Клод при этом сам, без указания, завёл в Slack канал и постил туда скриншоты своего прогресса каждые несколько минут.
Важная оговорка. Пятнадцатый день работы — это ещё не провал. Черни говорит «оно всё ещё работает», а не «не получилось». Пересказы этой истории как неудачи расходятся с тем, что он сказал.
А вот доведённый до конца случай куда весомее. Команда Bun дала Клоду переписать всю среду выполнения с Zig на Rust, опираясь на огромный набор тестов. «Оно работало 11 дней и переписало всю кодовую базу». Больше ста тысяч строк. Оценка Черни, сколько бы это заняло у людей: «точно больше года». Именно на этой среде Claude Code работает сегодня.
Главный совет Черни: чините проверку, а не промпт (Root Access). «Проверка — вероятно, самое важное, что люди делают неправильно».
Формула простая. Дайте задачу чуть сложнее, чем модель, по-вашему, потянет. И дайте ей способ самой проверять результат. В случае Bun проверкой был готовый набор тестов, в случае Swift — скриншоты живого приложения из виртуалки.
Формат промпта он описывает так: опишите задачу, опишите ограничения, опишите критерий завершения — и дайте модели вариться, вернитесь попозже.
Раз в полгода удаляйте всю свою обвязку. Это самый неожиданный его совет из того же разговора: «every six months, delete your CLAUDE.md, delete your skills, delete your hooks. See what the model does and it might surprise you».
Возвращать инструкции обратно нужно по одной и только после доказательства. «Добавляйте обратно только то, обо что модель спотыкается раз за разом». Помните: эту строчку модель читает при каждом запуске. Она должна отбивать своё место в контексте.
У Anthropic это называется абляцией и делается при каждом релизе модели. Под Opus 5 они выкинули 80% системного промпта Claude Code — оказалось, промпт компенсировал поведение, которое модель теперь делает сама.
Чего Черни советует не делать (Root Access). Первое — не переспецифицировать. «Сделай это, но вот так, потом так, потом так» ломает современные модели. «У инженеров с многолетним стажем это очень частый провальный паттерн», — говорит он. Относитесь к модели как к коллеге.
Второе — не искать волшебный приём. «Maybe don't listen to the LinkedIn influencers… Everyone's looking for the one weird trick to do it. That doesn't exist».
Третье — не переносить промпты между поколениями моделей. То, что работало три месяца назад, может вообще не работать. Набор проверок живёт одно-три поколения. Потом упирается в потолок, и его выбрасывают.
И четвёртое, приятное: перезапускайте старые провалившиеся задачи на новой модели. Именно так команда Bun и добилась своего — кидала переписывание рантайма на каждое новое поколение, пока не поехало.
Gauntlet Loop: заставьте ИИ пройти испытание против настоящей работы. Приём Мэтта Шумера, разобранный в The Neuron. Проблема в том, что «сделай лучше» не даёт модели финишной черты. Gauntlet Loop даёт: результат должен победить реальный образец.
Схема из шести шагов. Даёте агенту крупную цель и реальный аналог, который надо превзойти. Заставляете разбить цель на независимые части. На каждую часть назначаете своего билдера. Отдаёте готовый кусок отдельному безжалостному критику со свежим контекстом. Критик сравнивает результат с эталоном бок о бок, не зная, где что. Проигрывает — работа возвращается билдеру.
Ключевое правило: проход части решает критик, а не билдер.
Готовый промпт целиком:
Use a Gauntlet Loop to complete this project.
GOAL:
[Describe the finished result.]
REAL-WORLD EQUIVALENT:
[Name or attach an excellent existing example that establishes the quality bar.]
Break the goal into independent parts. Assign each part to a specialist builder.
For every part, assign a separate critic with fresh context. The critic must inspect the
generated artifact itself and compare it directly against the real-world equivalent.
Where possible, compare them side by side without telling the critic which one is the reference.
The critic may pass the work only if the generated artifact is better than the real-world
equivalent. Otherwise, it must identify the largest specific gap and return the work for
another iteration.
Continue looping on every part until all critics pass it. Do not let builders evaluate their
own work.
Рабочая связка у Шумера аскетичная: Opus 5 в Claude Code, свежий репозиторий, режим Ultracode, никаких скиллов и MCP.
Промпт разошёлся по сети, и вот что из него выросло. Галерея сообщества набрала 27 играбельных браузерных игр из одного и того же трёхабзацного текста. Райан Кэмпбелл получил гонку в духе Mario Kart на 60 500 строк за 127 агентов и 11 раундов. Эрик Смит превратил видео своего двора с айфона в проходимый мир. Полиус за двенадцать часов собрал трёхмерный ремейк покемонов без единой готовой заготовки — правда, персонажи вышли подозрительно похожи на подделки (разбор).
Выбирайте модель по скорости, а не по уму. Мартин Олдерсон утверждает: уровня Opus 4.6 хватает на 90% ежедневных задач, а дальше выигрыш даёт не интеллект, а отзывчивость (martinalderson.com).
Его ориентиры. Ниже 50 токенов в секунду — терпеть не стоит. Сто-двести — рабочая зона. Выше двухсот вы уже не успеваете читать вывод даже по диагонали.
Но самое ценное в статье — трезвый расчёт, сколько скорость вам вообще даст.

При 50 токенах в секунду ход агента занимает 65 секунд. Из них 40 — работа модели, 15 — вызовы инструментов, 10 — ваша проверка. При 250 токенах выходит 33 секунды: восемь, пятнадцать и десять. Модель ускорилась впятеро, ход — только вдвое. Остальные 25 секунд никуда не делись.
Что делать. Прежде чем платить за скорость, разложите свой ход агента на три части. Если работа модели уже не большинство времени — беритесь за медленные инструменты, обращения к базе и свои десять секунд проверки.
И смотрите скорость не у модели, а у конкретного поставщика. На OpenRouter разброс по одной и той же GLM 5.2 — от 30 до 129 токенов в секунду. Цена там сейчас $0,42 за миллион входных токенов и $1,32 за миллион выходных — около 5% от цены Opus.
Не будьте мясным прокси. Короткая, но злая заметка Никласа Груна (gruhn.me). Пересылать сырой вывод модели коллегам — не работа.
Три довода. Собеседник и сам может спросить у Клода, ему будет быстрее и он сам проконтролирует контекст. Читать вывод модели — дополнительное усилие: он многословный и часто содержит слишком правдоподобную чушь. И жаргон в нём густеет. Автору прислали фразу «NATS control-plane events: stream leader election / R3 quorum re-form during pod churn». Он признаётся, что смотрел значение почти каждого слова.
Самая острая часть — про ревью кода. Скопировать тикет в Claude Code, не читая, отправить, получить замечания, скопировать их обратно — эта схема работает. Но кто тогда написал код? «Его написали ревьюеры — с помощью Claude Code и вас в роли мясного прокси».
Рабочее правило: сырой вывод модели не покидает ваш экран. Прочитать, понять, проверить, переписать своими словами. Если пересказать своими словами не выходит — вы не поняли, отправлять нельзя.
Папки _inbox и _outbox для Claude Code. Приём Кеиичиро Хонды из нового каталога воркфлоу The Rundown (app.therundown.ai). Лечит бытовую боль: файл лежит на рабочем столе, а терминалу его некуда бросить.
Шаг первый — создать в корне рабочей папки Claude Code каталоги _inbox/ и _outbox/. Названия даны с точки зрения агента, поэтому направление не путается.
Шаг второй — добавить в CLAUDE.md одну строку:
Save deliverables meant for me (reports, exports, drafts) to _outbox/.
Шаг третий — кидать файлы в _inbox/ через проводник и говорить агенту check _inbox. Готовое он кладёт в _outbox/. Всё. Больше не надо спрашивать «ты закончил и куда положил».
Приём работает и без надстроек. Но автор дописал себе ещё окошко-приёмник — карточка claude-work Desk ниже.
Скилл, который ловит спамные карточки в Google Картах. Майк Блюменталь собрал расследование в восемь шагов и заставил Claude сложить результат сразу в таблицу для жалобы (app.therundown.ai).
Порядок такой:
- Собрать список подозрительных карточек: название плюс ссылка на карту.
- Попросить Claude найти сайт каждой и связи между доменами.
- Найти другие компании по тем же адресам.
- Проверить, есть ли компания у основного странового поставщика данных.
- Проверить государственный реестр.
- Разобрать, что общего в отзывах, описаниях и фотографиях.
- Выделить признаки: фейк или настоящая, связаны ли карточки между собой.
- Собрать всё в один файл XLS.
На выходе таблица с колонками «вердикт», «спам-балл» и «ключевые признаки». Признак формулируется так: «тот же префикс телефона, что у карточки №11» или «виртуальный офис, отзывов нет». Приём переносится на любое расследование, где надо сверить много однотипных объектов по общим признакам.
Мастер-план участка на десять лет из фотографий. Джереми Редгейт показал, как выжать из ИИ не совет, а план работ (app.therundown.ai). Схема универсальная, дача тут просто пример.
Он начал не с шаблона, а со своего объекта: загрузил фотографии, замеры, ограничения, текущие проблемы, планы и бюджет. Дальше разбирал зону за зоной. Для каждого дерева и куста — взрослый размер, расстояния, полив, линии обзора, трудозатраты на уход.
Ключевой ход — превратить каждую рекомендацию в план из шести пунктов. Целевой вид, порядок работ, материалы, бюджет и приоритет, сезонные сроки, уход по годам. И только потом свести всё в один общий план, чтобы одно улучшение не создало проблему в другом месте.
Итог он называет «живой операционной системой объекта»: добавляешь новую фотографию или проблему — план пересчитывает следующее лучшее действие.
Не выключайте рассуждение ради скорости. Кристин Корри повторила опыты с ответами без цепочки рассуждений на новых моделях (LessWrong). Результат неожиданный и очень практичный.
Если заставить модель отвечать сразу одним числом, она резко слабеет. Но её можно подтянуть двумя дурацкими приёмами. Повторить условие задачи подряд 10–20 раз. Или приписать после задачи бессмысленный ряд «1 2 3 4 …» длиной в сотни токенов.
Цифры. GPT-5.6 Sol на арифметике: 58,6% без приёмов и 83,4% при двадцати повторах. Opus 4.5 на двухшаговых вопросах: 13,0% и 31,1% с приписанным мусором. Fable 5 на арифметике добрался до 87,6%.
Значит, модель считает в позициях, где ничего осмысленного не написано. Но практический вывод обратный тому, что просится. С включённым рассуждением все модели дают 85–100% на тех же задачах. То есть сыпать мусорные токены не надо — надо просто не отключать рассуждение ради дешевизны и скорости.
Как перенести старый код и не соврать себе про качество. Свежая работа про перенос COBOL на Java агентами (arXiv). Метод называется Locksmith Loop, и главная идея переносится на любой перенос.
Модель не просят «написать правильную Java». Оригинал и перевод запускают бок о бок, шесть алгоритмов параллельно ищут входные данные для непокрытых веток. Когда поиск упирается в потолок, ИИ-агент вносит одинаковое изменение сразу в обе программы. Изменение принимают, только если проверка подтвердила совпадение поведения по трём осям. Какие участки кода пройдены, в каком порядке шли внешние вызовы, какое состояние на выходе.
На настоящей программе в 4114 строк покрытие ветвей вышло 91,9%. Все 166 прогонов прошли проверку, вмешательства человека не потребовалось. Из 142 участков кода поиск входных данных сам закрыл 110, ещё 25 добрали правками программы.
Но вот честная оговорка авторов: «Такой эталон доказывает совместимость, а не правильность смысла». Проще говоря, ваши баги успешно переехали в новый код вместе с бизнес-логикой. Если цель — починить старый код, а не перевезти, одной проверки на совпадение мало.
Ещё практичное правило оттуда: правьте дефекты в самом миграторе, а не в сгенерированном коде. Иначе исправления не переиспользуются.
Заведите свой личный тест на лягушку. Джей Моллика раз в месяц даёт четырнадцати моделям один и тот же промпт: нарисуй SVG лягушки с габсбургской челюстью (frogs.vaguespac.es). Никаких баллов он не ставит — он смотрит, что модель добавила сверх задания.
Габсбургская челюсть — чисто анатомический термин, короны в промпте нет. Корону, орден Золотого руна или мантию пририсовали семь моделей из четырнадцати. GLM 5.1 и Qwen3.7-Max дописали в коде комментарий «(because Habsburg)» — то есть понимали, что домысливают, и делали это нарочно. Gemini 3.6 Flash оставил 65 комментариев, включая «Imperial Habsburg Crown» и «Belly Plate (Weak chest)».
Разброс при одинаковом «успехе» огромный. По времени: 6,3 секунды у Haiku 4.5 против 202 у Kimi K3. По объёму кода: 619 байт у Llama 4 Maverick против 12,9 килобайта у Gemini 3.6 Flash. Mistral Large выдал два из трёх ответов побайтово одинаковыми.
Что с этим делать. Если вывод модели идёт дальше по конвейеру — выбирайте по склонности домысливать, а не по уму. Для картинок-заготовок и структурированного вывода нужны буквальные и предсказуемые. И заведите свой странный промпт: один такой скажет вам о поведении модели больше, чем очередная таблица бенчмарков.
Публикуйте в открытый веб — модели вас читают. Давиде Семенцин напоминает механику, о которой легко забыть (blog.semenzin.com). Лаборатории продолжают обходить сайты роботами, а модели ходят в поиск прямо во время ответа.
«Модели ничего не знают о жизни — знаем мы. Это чистые листы, и мы можем склонять их силой собственных текстов».
Он честно признаёт слабость сигнала по сравнению с дообучением на людской обратной связи. И тут же добавляет: «it's all you and I have» — это всё, что есть у нас с вами.
Практический слой такой. Личный сайт с открытым HTML работает лучше закрытых площадок: робот не заходит за форму входа. Если вы эксперт в нише и молчите, вашу нишу в моделях представят те, кто не молчит. Молчание — не нейтральность, а делегирование.
Отдельный укол автора — в адрес критиков ИИ. Тот, кто пишет, что ИИ отберёт работу, буквально дообучает на этом тезисе модель.
Персональность агента живёт в контексте, а не в модели. Питер Янг поговорил с Караном Малхотрой из Nous Research про агента Hermes (Behind the Craft). Полная расшифровка платная, но главный тезис лежит открыто и стоит того.
«Персональное в персональном агенте — это не модель». Это память агента о ваших разговорах и скиллы, которые вы вместе с ним построили. Каран почти не замечает разницы в характере агента, когда меняет модель под ним.
Вывод для практики: модель — расходник, слой контекста — актив. Именно его надо беречь, переносить и версионировать, а не выбирать раз и навсегда «свою» модель.
Сам Янг ведёт файл soul.md больше полугода. Внутри три раздела. Базовые истины: «быть по-настоящему полезным», «не подхалимничать». Границы: «уважать приватность в групповых чатах». И общая манера общения.
Бесплатная версия разговора целиком лежит на YouTube. Самое полезное — на 15:16 про то, как агент создаёт скиллы, не раздувая контекст, и на 26:45 про живое демо.
Миллион выручки в одиночку: цифры, а не байки. Wall Street Journal разобрал новый класс компаний без единого сотрудника (открытая перепечатка).
Данные Stripe: число одиночек с выручкой выше миллиона долларов удвоилось между 2023 и 2025 годом. Тех, кто перешагнул десять миллионов, стало почти втрое больше. Заявки на регистрацию бизнеса в информационном секторе выросли почти на 45% за год — больше всех отраслей. И там же сильнее всего упала доля тех, кто планирует нанимать.
Но разброс результатов честный. Клэр Во по вечерам собрала приложение для продуктовой документации, копируя код из ChatGPT. Выложила за доллар в месяц: сегодня сто тысяч пользователей и семизначная прибыль. Трой Джонстон делает три тысячи долларов в месяц. Самир Ахмад ушёл из корпорации в соло-консалтинг и через несколько месяцев вернулся в найм.
Два практических вывода. Первый — считайте себестоимость токенов с первого дня. Герой статьи с 30 миллионами инвестиций терял деньги на клиентах: платил за токены по факту. Ушёл на открытые китайские модели. Если ваш продукт — обёртка, ваша маржа равна чужому прайс-листу.
Второй — реалистичная траектория не «соло навсегда», а «соло девять месяцев, потом первый найм». Именно так сделала единственная героиня с семизначной прибылью. Её же фраза: «Люди переоценивают, насколько ИИ всё упрощает, и недооценивают, сколько я сделала, чтобы сюда дойти».
Инструменты и штуки
Community AI Workflow Hub. The Rundown открыл каталог реальных рабочих схем своих читателей (app.therundown.ai). Не блогерские «10 способов», а разборы от людей, которые эту работу правда делают: шаги, инструменты, промпты. Площадку сознательно сделали примитивной — без каналов, чатов и лабиринта разделов. Ищете задачу, копируете шаги, применяете в тот же день. Бесплатно, нужен только аккаунт. Три материала из этого каталога разобраны выше.
open·kritt. Платформа поиска уязвимостей на своём сервере, где ищет связка агентов (github.com/Kritt-ai/open-kritt). Ключевая идея из README: «найди уязвимости в репозитории» работает плохо. Поэтому поиск дробят на узкие задачи и гоняют параллельно через Codex или Claude Code, а потом чистят находки от дублей и ранжируют. Авторы под ником Blockian заработали на баг-баунти больше полутора миллионов долларов. 1024 звезды, AGPL-3.0.

Важное предупреждение прямо из документации: проверки доступа на сервере нет, а агенты работают с полными правами в одноразовых контейнерах с выходом в интернет. Держать только на выделенной машине.
Mu. MCP-сервер на Go, который даёт агенту доступ к реальному миру одним адресом (github.com/micro/mu). Внутри 67 инструментов: веб-поиск, новости, котировки, погода, маршруты, файлы, календарь, контакты, заметки, генерация картинок. Отдельно — почта: настоящий SMTP и собственный адрес для агента. Лечит частую боль: собрали личного агента, а у него нет ни почты, ни поиска. Ставится одной командой из README, дальше вписываете один адрес в настройки Claude Desktop. Развернуть у себя бесплатно, лицензия AGPL-3.0.
MicroCodex. Codex, переписанный на C++ в бинарник меньше мегабайта (github.com/paoloanzn/microcodex). Никакого Node, никакого набора инструментов Rust — один статический файл под macOS и Linux. При этом он входит по вашей подписке ChatGPT и подхватывает те же скиллы из ~/.codex/skills. Смысл — агент там, где не поставить весь ворох зависимостей: контейнер сборки, удалённый сервер, слабая машина. Apache-2.0, версия 0.1.9-alpha. MCP пока не сделан, а «защита» командной строки — просто список запрещённых команд, а не песочница.
CodePlus. Терминальный агент на Python, построенный вокруг одной идеи: параллельные задачи должны разговаривать друг с другом (github.com/feng-shan-jian/CodePlus). Задачи умеют слать сообщения, передавать работу, ждать друг друга и переживать перезапуск процесса. Живой сценарий: главная задача поднимает три. Реализацию на дорогой модели, проверку на дешёвой и наблюдателя. Наблюдатель раз в N минут пересказывает, как идут дела, и сам шлёт поправку при отклонении. Под капотом SQLite с очередью сообщений, а не игрушечная демонстрация. MIT, но пока 15 звёзд и статус «в разработке».
geo-mcp-servers. Каталог из 55 MCP-серверов для карт и геоданных (github.com/willcadell/geo-mcp-servers). Занятные позиции внутри. qgis-mcp даёт 117 инструментов управления настольным ГИС прямо из чата. SkyFi ищет по 150+ спутникам и заказывает съёмку словами. weather-mcp отдаёт историю погоды с 1940 года. earthdata-mcp — официальный сервер NASA к метаданным. К каталогу приложен скилл для Claude Code, который ищет по локальному файлу, а не выдумывает названия серверов.
awesome-llm-apps. Крупнейшая коллекция готовых к запуску шаблонов ИИ-приложений: 130 тысяч звёзд, Apache-2.0 (github.com/Shubhamsaboo/awesome-llm-apps). Не список ссылок, а рабочий код, который правда запускается. Тем, кто учится писать скиллы, стоит зайти в раздел Agent Skills. Scope Creep Detector проверяет, не разросся ли дифф за границы задачи. Commit Archaeologist восстанавливает, зачем вообще существует кусок кода. Любой скилл ставится за десять секунд командой npx skills add <ссылка на папку>.
davidondrej/skills. Личный набор из 44 агентских скиллов, 3030 звёзд, MIT (github.com/davidondrej/skills). Честно: это не продукт, а выложенный наружу рабочий набор конкретного человека. Инструкции по установке в README нет, часть скиллов завязана на его машину. Брать стоит поштучно. Самое полезное — три штуки. effective-agent-skills: сводное руководство по написанию скиллов. handoff: сжимает диалог в одно сообщение для переезда в свежую сессию. global-agent-guardrails: общий чёрный список опасных команд сразу для всех агентов машины.
claude-work Desk. Окошко-приёмник из раздела выше (github.com/tact0225/claude-work-desk). Перетаскиваешь файл — он оказывается в _inbox/. Следит за _outbox/ и подсвечивает новое, пока не откроешь. Открытый код, настройка около двух минут, терминал не нужен. Особенно спасает на WSL, где путь приходилось переписывать вручную.
travel-photo-abstraction. Скилл для Codex, который разбирает фотографию как визуальную систему: формы, количества, позиции, пропорции, глубину (github.com/Evianis/travel-photo-abstraction). Из разбора собирается скупая редакторская абстракция. Полезен, если нужна серия обложек в единой стилистике из двух сотен отпускных фотографий. А ещё это редкий пример скилла как метода. Сначала опись наблюдаемых фактов. Потом каждый факт превращается в минимальную метку. В конце — обязательная сверка с оригиналом. Осторожно с лицензией: код доступен, но производные работы и распространение запрещены.
K-EXAONE 2.0. Открытая модель от LG AI Research (Hugging Face). Всего 750 млрд параметров, активных 37 млрд, контекст 262 тысячи токенов, десять языков. Главное достоинство — лицензия Apache 2.0 без оговорок, коммерческое использование разрешено. Читайте таблицу трезво: почти по всем бенчмаркам она уступает вдвое меньшим Qwen3.5 и GLM-5.1. Сильные места — поиск в длинном контексте, где 94,4 балла лучше всех, безопасность и корейский. Дома не запустить: самый компактный из выложенных вариантов весит 526 гигабайт.
SenseNova-U1.5-8B-MoT. Мультимодальная модель SenseTime, где понимание, генерация и правка картинок живут в одной сети без отдельного декодера (Hugging Face). Сильна именно в редактировании: на GEdit-Bench обходит Qwen-Image-Edit и обе версии Nano Banana. В генерации без улучшения промпта она на уровне прошлогодних. И осторожно: «8B» — это только языковая основа, на диске около 50 гигабайт. Лицензии у весов сейчас нет вообще — ни файла, ни тега, хотя все предыдущие модели серии выходили под Apache 2.0. Для коммерческого проекта лучше подождать.
MiniMax Hub. Настольное рабочее место, где несколько специализированных агентов делают из брифа сценарии, картинки, озвучку и готовые ролики (hub.minimax.io). Не «ещё один генератор видео», а координатор нескольких: полезно, когда ролик надо не сгенерировать, а собрать. Пробовать бесплатно.
Удалённый MCP-сервер Perplexity. Теперь поиск, ресёрч и рассуждения Perplexity подключаются к Claude Code, Cursor или VS Code без локальной установки (docs.perplexity.ai). Нужен только ключ API. Самый быстрый способ дать своему кодовому агенту нормальный веб-поиск.
Palette. Один холст, на котором генерация видео, монтаж и раскадровка живут вместе (palettelabs.com). Фишка в маршрутизации: запрос сам уходит той модели, которая лучше справится, а вы не жонглируете вкладками. Оплата покадровая, от одного цента за штуку. Полезно, если ролик надо собрать целиком, а не выпросить у генератора удачный кадр.
Cleanlist. Превращает запрос обычным английским в готовый для CRM список лидов с проверенными адресами и прямыми телефонами (cleanlist.ai). Для тех, кто продаёт руками и тратит вечера на сбор контактов. Есть бесплатный тариф, дальше $59 в месяц.
Cloudflare Kumo. Открытый набор доступных интерфейсных компонентов: навигация с клавиатуры, корректная работа фокуса, разметка для программ экранного доступа (github.com/cloudflare/kumo). Синхронизирует стили с Figma. Полезен, если вы собираете интерфейс с агентом — доступность модели делают хуже всего, а тут её отдают готовой. Бесплатно.
Superlinear. Бесплатная серия видео и подкастов о четырёх практических привычках работы с агентами (superlinear.fm). Не инструмент, а короткий курс, который стоит поставить в очередь на прослушивание.
Dreamina. Приложение CapCut на движке Seedance (dreamina.capcut.com). Ролики по 30 секунд или видео до трёх минут, управление по таймкодам, до 50 образцов-референсов. Полсотни образцов — это уже про удержание персонажа и стиля между сценами, а не про случайную красивую картинку. Цена зависит от региона.
Replit Design. Превращает текст, ссылку, файл Figma или скриншот в лендинг, прототип, постер или письмо, опираясь на переиспользуемую дизайн-систему (replit.com). Важное отличие от обычной генерации — именно система: результат остаётся в одной стилистике от макета к макету.
Rumbly. Живой пример того, как выглядит приложение «для себя» в 2026 году (app.therundown.ai). Автор полгода назад бросил попытку собрать его на Lovable из-за бесконечных ошибок. Вернулся с промптом на три-четыре абзаца в Replit — и получил сразу три четверти готового продукта. Сохраняет, кто и что тебе порекомендовал: ресторан, сериал, книгу, анекдот. Подтягивает карты и отправляет друзьям.
Netherite. Гоняет тысячи миров Minecraft на видеокартах одновременно (анонс). Нужен для обучения агентов с подкреплением, но любопытен и сам по себе: смотреть на тысячу параллельных миров сложно перестать. Открытый код, бесплатно.
Подкаст про то, чего моделям не хватает. Рана Гуджрал, бывший глава Behavioral Signals, разбирает распознавание эмоций по голосу (YouTube). Главная техническая деталь: подавленный стресс выдаёт не громкость, а сжатие высоты тона. А главная идея — понятие Artificial General Experience: недостающая ось между умом и суждением, которой моделям до сих пор не хватает. Хорошо ложится в уши на прогулке.
Новости и тренды
Qwen3.8-Max: 2,4 триллиона параметров и обещание открыть веса. Alibaba выложила флагман семейства: 95 миллиардов активных параметров, контекст в миллион токенов, вход текстом и картинками (qwen.ai). Главное в анонсе — не бенчмарки: «Мы впервые откроем веса модели класса Qwen-Max». Веса обещают на следующей неделе. Собственный пример Alibaba — репозиторий, который агент вёл 16 дней сам: 265 коммитов, 127 пул-реквестов, 151 задача.

Что это значит. Если веса правда откроют, это первая топовая модель с миллионным контекстом, которую можно поднять у себя. Пересчёт для всех, кому нельзя гнать код наружу. Попробовать можно уже сегодня: API поддерживает протокол Anthropic, достаточно подменить адрес в Claude Code. Но таблицу читайте трезво. На чистом коде она уступает Fable 5, зато выигрывает на долгих самостоятельных прогонах и работе с документами.
Карпатый: тест на пеликана устарел. Андрей Карпатый дал Opus 5 первый абзац «Властелина колец» и попросил сделать трёхмерную сцену (твит, демо). Бюджет — миллион токенов, примерно $10. Модель работала два часа и написала 5500 строк.
Что это значит. Сдвинулся порог «это слишком дорого делать руками». «Ни один здравомыслящий человек не стал бы тратить время на такую штучную вещь — а у модели терпения бесконечно». Перестаньте отсеивать идеи по трудозатратам, считайте по токенам. Слабое место Карпатый называет сам: модель не видит результат в движении, поэтому всё визуальное требует вашей приёмки.
Супер-PAC OpenAI, похоже, финансирует новостной сайт с ботами вместо репортёров. Юрист правозащитной организации Encode получил письмо от «репортёра Майкла Чена» с просьбой прокомментировать законопроект об ИИ. Заголовок статьи прислали заранее, интервью предлагали только письменно. Человека с таким именем не существует (Model Republic). Издание The Wire by Acutus запустили анонимно, без выходных данных и подписей. За неполные четыре месяца — 94 статьи, человеческими детектор признал три.
В коде сайта нашлась редакторская панель с кнопками «Generate Story Draft» и полями про «reporter agent». Открытый адрес API отдал лог: вся многоступенчатая вычитка укладывается в 44 секунды, публикация — через десять секунд после последней правки. Сорок две статьи вышли со статусом «нужна доработка» от собственного же рецензента. Ниточка ведёт к PR-фирме, чей клиент управляет супер-PAC на $125 млн вокруг OpenAI.
Что это значит. Читаете политическую новость в незнакомом «независимом издании» — велика вероятность, что её написала модель по заказу лоббиста. Проверка простая. Есть ли выходные данные и живые авторы с историей публикаций. И не приходит ли просьба о комментарии строго письменно, с уже готовым заголовком.
Anthropic судится с военным ведомством США и пока выигрывает. Дело о том, можно ли лишить компанию госконтрактов за отказ выбросить свои правила использования. Суд ещё в марте остановил приказ прекратить пользоваться технологиями Anthropic и присвоение ей статуса «риск цепочки поставок» (репортаж со слушания). На июльском слушании судья Рита Лин заявила, что новые материалы дела местами хуже для государства, чем прежние. Доказательств, что Anthropic способна саботировать модель после поставки, так и не появилось.
Сильный аргумент истца: служебная записка с обоснованием датирована на три дня позже публичных действий министра. Основания подгоняли задним числом. «Я нахожу эту позицию тревожной», — сказала судья о доводах правительства.
Что это значит. Довод «ИИ непрозрачен, поэтому нам нужно особое доверие к поставщику» суд как основание для санкций не принимает. Практическая деталь: ведомство сворачивает использование Claude до 30 сентября, пилоты в агентствах истекают 30 августа. В оборонный бюджет следующего года уже вписали норму, запрещающую вешать такой статус за отказ от условий контракта.
Гэри Маркус: достижения Astra впечатляют, но их сильно перепродали. Мы писали 2 августа, что внутренняя модель OpenAI закрыла десять открытых задач математики. Маркус не оспаривает результаты — он бьёт по выводам, которые из них сделали (Substack). Возражений четыре. Математику можно проверить формально и нагенерировать к ней сколько угодно верных задач. С открытым миром так нельзя: «решила десять задач» не значит «решит всё». В статье на 249 страниц нет ни строчки о том, как устроена модель и кто проверял доказательства. Неизвестен знаменатель: сколько гипотез вообще пробовали. И названные $2000 — это счёт за токены, без зарплат математиков, которые вели проект.
Что это значит. В любой новости вида «ИИ решил нерешённое» спрашивайте не «что решили». Спрашивайте: сколько пробовали, кто проверял, сколько стоило вместе с людьми. Для вашей рабочей задачи умение доказывать теоремы не значит ничего.
ИИ-постер выиграл конкурс на ярмарке в Огайо. Из 38 заявок первое место взяла работа с явными огрехами генерации (страница конкурса). Свиньи в забеге пронумерованы 1, 2, 1. Кабина канатной дороги висит на оборванном тросе. У части свиней раздвоены хвосты.

Правила ИИ не запрещали — требовалось лишь раскрыть, чем сделана работа. Судьи огрехов не заметили, а заявление о будущем запрете появилось на странице задним числом: в июльском снимке архива его нет. Организаторы обещают переписать правила к 2027 году.
Что это значит. Любой конкурс без явного пункта про ИИ уже проигран генераторам. Жюри по привычке награждает плотность деталей, а её нейросеть выдаёт дешевле всего. Участвуете в чём-то подобном — читайте пункт про раскрытие способа работы, он теперь главный.
Немецкий суд признал, что Suno нарушила авторские права. Сервис обучался на песнях под управлением общества по коллективным правам GEMA без лицензий (DW). Это первое решение по существу в Европе против генератора музыки, а не декларация о намерениях.
Что это значит. Используете ИИ-музыку в коммерческих роликах — поставьте напоминание раз в квартал перечитывать условия сервиса. Правовой фон под ними меняется быстрее интерфейсов.
Трафик издателей из поиска упал на 34% за год. Ответы ИИ заменили исходящие клики (Axios). Что это значит: если ваш бизнес живёт на поисковом трафике, треть его уже ушла, и вернуть её прежними приёмами нельзя. Отсюда практический разворот — растить прямые каналы: рассылку, сообщество, приложение. И заодно перечитать заметку про открытый веб выше: попасть внутрь ответа модели теперь ценнее, чем попасть в десятку выдачи.
Anthropic, по сообщениям, обогнала OpenAI по темпам роста выручки и оценке. Корпоративный спрос идёт на Claude Code, а инвесторы задают вопросы к сжиганию денег у OpenAI (WSJ). Что это значит: гонка окончательно перестала быть гонкой бенчмарков и стала гонкой того, за что платят компании. А платят пока за агентную работу с кодом.
Триллион долларов на инфраструктуру. Amazon, Alphabet, Meta и Microsoft вложили в ИИ-инфраструктуру больше $1,1 трлн с 2023 года (Tom's Hardware). Только на 2026-й запланировано ещё $745 млрд. Что это значит: цена токена будет падать и дальше, а вот лимиты и очереди на доступ — упираться в железо и электричество.
ЕС начал правоприменение по правилам ИИ-рисков. Со 2 августа заработали требования маркировать и помечать водяными знаками реалистичный синтетический контент, штат надзорных органов расширили (AP). Развитие сюжета от 30 июля про перенос сроков AI Act: часть обязательств сдвинули, а прозрачность синтетики — нет. Что это значит: делаете рекламу или контент на ИИ для рынка ЕС — маркировка нужна уже сейчас.
Коротко. Китайские военные исследователи обучали оборонные системы на ответах GPT-3.5 и Claude 3 Haiku (Reuters). Машинный мусор вышел за пределы лент (Wired): объявления об аренде выдумывают комнаты, детские книги приходят «сломанными», а мелодрамы в соцсетях приносят авторам выплаты.