Задача, которую 87 лет не могли ни доказать, ни опровергнуть, рухнула за время футбольного финала. Контрпример уместился в одну строку — его проверяет школьная алгебра. Сегодня же инженер Anthropic показал, как одной командой заставить Claude Code работать до результата. А другой разработчик развернул свой исследовательский конвейер задом наперёд и получил в десять раз больше работы агентов за те же деньги.
Главное за 30 секунд
- Claude Fable нашла контрпример к гипотезе Якобиана — она держалась с 1939 года.
- Правило
/goalот Anthropic: команда работает только там, где есть проверяемая финишная черта. - Anthropic урезала системный промпт Claude Code на 80% — жёсткие правила мешают новым моделям.
- OpenAI срезала контекст Codex с 372 до 272 тысяч токенов без публичных объяснений.
- Дешёвые модели ищут, точные проверяют, глубокое исследование идёт последним — так втрое дешевле.
Внедряем и улучшаем
Как инженер Anthropic гоняет Claude Code: цель, интервью и матрица незнания. Питер Янг позвал в подкаст Тарика Шихипара из команды Claude Code, и тот по шагам разобрал свой рабочий процесс (Creator Economy). Сразу оговорка: текстовая расшифровка платная, открыты три пункта из десяти. Зато сам выпуск на 40 минут лежит бесплатно (YouTube).
Главное правило про /goal: команда полезна только тогда, когда у задачи есть проверяемая финишная черта. Янг честно показал антипример на себе — попросил /goal Build me a great game. Итог, по его словам, «the results were…not great». Проверить «отличную игру» нечем, поэтому цикл крутится впустую.
Как /goal устроен внутри — из официальной документации (code.claude.com). После каждого хода маленькая быстрая модель проверяет, выполнено ли условие. Не выполнено — Claude сам начинает следующий ход и не возвращает вам управление. Технически это обёртка над Stop-хуком, поэтому при отключённых хуках команда не работает. Нужна версия 2.1.139 или свежее.
Условие пишется из трёх частей: одно измеримое конечное состояние, способ проверки и ограничения, которые нельзя нарушать по дороге:
/goal all tests in test/auth pass and the lint step is clean
claude -p "/goal CHANGELOG.md has an entry for every PR merged this week"
Снять цель — /goal clear. Ограничить длительность можно прямо в условии, дописав or stop after 20 turns. Оценщик не вызывает инструменты — он судит только по тому, что Claude уже написал в диалоге. Значит, доказательство надо выводить в чат, а не держать в голове.
Второй приём — планирование через снятие неизвестного. Перед сборкой Тарик просит Claude объяснить, как может сломаться зависимость. В его случае это была голосовая расшифровка через Whisper. И главное: план он читает сам, а не доверяет вслепую. Готовый промпт-интервью выглядит так:
Interview me one question at a time about anything ambiguous — prioritize
questions where my answer would change the architecture.
Вся соль во второй половине фразы. Не «задай мне вопросы», а «спрашивай только там, где мой ответ поменяет архитектуру». Иначе модель утонет в мелочах.
Рамка для планирования — «матрица незнания». Самый ценный квадрант в ней третий: то, что настолько очевидно, что вы никогда это не запишете. Именно он и теряется в промптах.

Третий приём — разделение ролей: отдельный агент-создатель и отдельный агент-проверяющий. Параллельные задачи команда запускает через Slack.
И самое неожиданное: Anthropic урезала системный промпт Claude Code на 80%. Причина — жёсткие правила и примеры ограничивали новые модели. Отсюда прямой совет: при выходе новой модели идите в свой CLAUDE.md и скиллы и вычищайте оттуда детерминированные инструкции. Вместо длинного списка инструментов — поиск по инструментам.

Разверни исследование задом наперёд — и лимиты перестанут гореть. Бартош Котрыс из Quesma решил выяснить, сколько на самом деле стоит агентная разработка (quesma.com). Начал он стандартно — отдал /deep-research большой открытый вопрос. Итог первого дня: 111 агентов, 123 утверждения в очереди на проверку, проверено 25. Финальный сбор вообще не запустился. Весь лимит плана Claude Max 5x сгорел за полчаса.
Дальше он перестроил всё. Первый ход — задействовать подписки, за которые уже платишь. У него их три: Claude, Codex и Antigravity. Claude Code остаётся оркестратором, а чужие CLI подключаются как безголовые субагенты. Мост между ними — крошечный скрипт:
# run-cli: call another vendor's CLI as a headless subagent
# usage: run-cli <codex|antigravity> "<prompt>"
VENDOR="$1"; PROMPT="$2"
case "$VENDOR" in
codex) OUT="$(codex exec --sandbox read-only "$PROMPT")" ;;
antigravity) OUT="$(agy --model "Gemini 3.1 Pro (High)" -p "$PROMPT")" ;;
esac
echo "$OUT"
echo "$OUT" | claude-mem-save -s "$VENDOR" # save to shared memory
Обёртка следит за строчками «usage limit» и «out of credits» в выводе. Поймала — возвращает особый код, и оркестратор перекидывает работу на Claude.
Второй ход — роли. Дешёвая модель ищет, точная проверяет, самая дорогая только планирует и разрешает споры. Модель другого производителя даёт второе мнение, потому что у неё другие слепые пятна.

Самая дешёвая правка с самым большим эффектом — закреплять модель за ролью явно. По умолчанию субагенты наследуют модель родителя. Дословно у автора: «that is exactly how I burned my Fable limit in 30 minutes».
Третий ход — правила против выдумок. Их три, и они жёсткие. Кто нашёл утверждение — тот его не проверяет. Ничего не попадает в базу без ссылки и цитаты из первоисточника. Никогда не называй число, которого нет на странице источника.
Четвёртый ход — /deep-research переехал в самый конец. Он идёт по уже проверенному списку, а не по всему интернету. Последний запуск: 61 агент за 22 минуты вместо сгоревшего лимита.
Итог автора: непрерывной работы стало примерно в десять раз больше, доплат — ноль. «Before it was 30 minutes of research, now it is a few hours, without paying a single penny more».
И самый ценный провал. Правило «утверждение без подтверждения — не запись» тихо выбросило из базы проект с 56 тысячами звёзд. Агенты отработали правильно, ошибкой было само правило. Автор заметил это только через два дня. Новая формулировка: отклоняй утверждение, а не проект. Отсюда мораль на все агентные системы: «no agent will ever tell you that your own rule is the bug».
Codex месяцами жёг ваш SSD — проверьте и почините. Пользователь обнаружил, что Codex непрерывно пишет в свою базу логов. За 21 день работы диск принял около 37 ТБ записи — в пересчёте примерно 640 ТБ в год (issue #28224). Ресурс обычного потребительского SSD — около 600 ТБ записи. То есть годовой запас диска выгорал меньше чем за год.
Причина — сырые данные обмена по вебсокету валились в лог целиком, строками до 800 КБ. Три правки уже вышли и убирают около 85% этого мусора. Но в обсуждении до сих пор спорят, всё ли починили в десктопной сборке.
Что делать. Сначала обновитесь — правки приехали в версиях 0.142 и 0.143. Если обновиться нельзя, выйдите из Codex и поставьте заглушку на запись:
sqlite3 ~/.codex/logs_2.sqlite "CREATE TRIGGER IF NOT EXISTS
block_log_inserts BEFORE INSERT ON logs BEGIN SELECT RAISE(IGNORE);
END;"
Заодно проверьте размер папки ~/.codex. Есть отдельная незакрытая жалоба: в серверном режиме база растёт примерно на 0,75 ГБ в день без всякой ротации (issue #26374). Там же поднимают вопрос приватности — ваши промпты и ответы лежат на диске бессрочно.
Совет ИИ отбирает у человека право сказать «не знаю». Трое исследователей из Парижа, Рима и Милана прогнали 3132 человека через пять экспериментов (препринт на PsyArXiv). Людям задавали шесть трудных вопросов о мелких деталях фильмов. Отказаться от ответа можно было в любой момент.
Вопросы подбирали специально так, чтобы модель выдумывала. Значит, отказ от собственного «не знаю» нельзя объяснить разумной опорой на надёжный инструмент.
Цифры жёсткие. Доля отказов упала с 0,36 до 0,06. Точность просела с 27,5% до 9,2% — почти втрое. А уверенность в себе выросла с 29,6 до 75,9 по стобалльной шкале. Люди отвечали чаще, ошибались больше и были довольны собой в два с половиной раза сильнее.
Механизм авторы описывают так: модель обязана что-то выдать и сама никогда не воздерживается. Пользователь наследует эту неспособность. Беглый текст подменяет собой оценку «а знаю ли я это».
Два отдельных наблюдения. Первое: подсказка превратила часть заведомо верных ответов в ошибки — люди отказывались от того, что знали. Второе: эффект держится, даже когда совет показывают автоматически, без запроса. Это прямо про ИИ-сводки в поиске и подсказки в рабочих инструментах.
Что помогает. Единственное, что сработало в эксперименте, — личная цена ошибки. За верный ответ давали 10 центов, за неверный столько же снимали. Люди стали реже ходить к модели и чаще отвечать верно. До уровня без ИИ это не вернуло, но часть мышления восстановило.
Дальше — мой вывод из механизма, а не данные исследования. Формулируйте свою версию до того, как увидите ответ модели, — хоть одним словом на бумажке. Авторы такой протокол не проверяли, но их объяснение указывает ровно туда: беглый ответ обрывает раздумье слишком рано.
И честные оговорки, без них подавать это нельзя. Работа не прошла рецензирование. Задачи искусственные, модель ошибалась почти всегда — а реальные ассистенты чаще правы. Что будет при надёжной модели, авторы прямо называют главной непроверенной границей. Их собственный вывод мягче громких заголовков: ИИ меняет готовность думать, а не способность.
Гоняйте видеомодель как раскадровку, а не как сценарий. The Neuron разобрал рабочий рецепт для открытой видеомодели LTX 2.3 (The Neuron). Главный принцип — не просить целый фильм. Сделайте один сильный кадр, оживите короткий план, потом сшейте планы.
База: стандартный набор в ComfyUI, режим fp8 при 12 ГБ видеопамяти, старт с чистых картинок, 18 кадров в секунду при 720p. Для длинных роликов подавайте опорный кадр вместо голого текста, держите guidance около 2,5 и подкидывайте второй опорный кадр в районе 45–50 кадра.
Две ловушки из обсуждения. Промпт на 30 секунд при шести секундах действия быстро превращается в вату. И если встроенное «улучшение промпта» ломает движение — выключайте его. Готовый шаблон:
Build a single shot.
Starting image/reference: [describe or attach the clean still]
Length: [6-8 seconds]
Frame rate/resolution: [18fps, 720p]
Camera: [locked / slow push-in / close-up / high angle]
Identity details: [face, outfit, hair, style]
Action: [one clear movement or beat]
Motion limits: avoid fast camera movement, identity drift, morphing, and filler.
If extending: use the last frame or inject a second reference around frame 45-50.
Инструменты и штуки
Ollama привлекла $88 млн и написала манифест про открытые модели (блог Ollama). Это способ запускать открытые модели прямо на своей машине: без ключа, без счетов за токены, без отправки данных наружу. Цифры внушают — 8,9 млн разработчиков и 85% компаний из списка Fortune 500. Деньги пойдут на смешанный режим, когда часть работы идёт локально, а часть в облаке через один и тот же интерфейс. Отдельно стоит следить за монетизацией: локальный запуск бесплатен, а облако — уже продукт, и после такого раунда давление на него вырастет.
LoRA Speedrun — публичный лидерборд на время для дообучения моделей (GitHub). Задача заморожена: дотянуть Qwen2.5-1.5B до 57% на GSM8K, одна видеокарта L40S, адаптер не больше 30 млн обучаемых параметров. Побеждает самое короткое время обучения. Ценно тем, что рекорды не принимают на слово — каждый перегоняют трижды со свежими сидами в изолированной песочнице. Текущий рекорд срезал время почти вдвое: 6:05 против 11:57 у базового прогона, техника — упаковка последовательностей плюс маскирование потерь. Лицензия MIT, участие бесплатное. Проекту двое суток, обе записи в таблице пока от самого автора.

stem-illustration-skill — скилл для Claude, который рисует научные иллюстрации (GitHub). Внутри 24 шаблона: сигнальные пути, схемы опытов, разрезы механизмов, архитектуры нейросетей. Скилл ведёт агента по десяти шагам и требует жёсткой дисциплины в промпте — цвета только шестнадцатеричными кодами, направление потока явно, нотация стандартная. Самое любопытное не в этом. Автор вписал в скилл раздел про академическую честность: рисовать выдуманные гели, микрофотографии и реальные экспериментальные данные запрещено, скилл обязан отказать. Один из примеров в описании автор сам пометил как химически неверный — оставил как урок. Оговорки: репозиторий на китайском, лицензии нет, генерация картинок требует своего платного ключа.
Castor — консольная утилита, которая вытаскивает видеопоток со страницы и кидает его на телевизор (GitHub). Поднимает браузер без окна, слушает сетевой обмен и находит настоящий поток вместо тормозящего зеркалирования экрана. ИИ тут не главное, но показательное: внутрь вшит whisper.cpp, поэтому Castor умеет на лету расшифровывать дорожку и вжигать субтитры. Хороший пример того, как распознавание речи становится просто галочкой в конфиге. Учтите цену: с субтитрами видео приходится перекодировать. MIT, 1414 звёзд, ставится одной строкой через Homebrew.
Zro даёт кодовым агентам работу с открытыми моделями без хранения запросов (zro.moonmath.ai). Смысл — приватность там, где агент видит ваш код. Есть бесплатные варианты, первый месяц стоит $1.
Unabyss for Claude делает общую память между приложениями, агентами и моделями (unabyss.com). Отдельно решает конфликты, когда куски контекста устарели и противоречат друг другу. Пригодится тем, у кого Claude работает не в одном окне, а в связке инструментов. Цену публично не называют.
Forall помогает агентам писать код с машинно-проверяемыми доказательствами (GitHub). Поддерживает TypeScript, Java и Rust. Идея простая: не «модель уверяет, что код верный», а формальная проверка. Открытый код, бесплатно.
Scribe превращает историю git, сессии Claude Code и сохранённые ссылки в самообновляющуюся базу знаний в markdown (getscribe.dev). Закрывает вечную боль — документация отстаёт от кода на полгода. Сам открытый и бесплатный, платите только за работу моделей.
Campus от Skills AI — общее рабочее пространство, где над задачами сидят и люди, и агенты (skills.tech). Ставка на то, что агентов в команде станет много и ими надо управлять как людьми. Цена не публичная.
V2Fun делает 3D-персонажей из промптов и видео (Product Hunt). Обещают текстуры в 8K и захват движения по обычному видео. Интересно тем, кто делает игры, анимацию или аватаров и не хочет держать отдельного 3D-художника.
Xiaomi-Robotics-1 — модель для роботов, которая учится не на роботах (arXiv). Xiaomi обошла дефицит данных: 100 тысяч часов записей с ручного захвата, снятых людьми в 1700 сценариях, и только потом 7200 часов на настоящих роботах. Результат — 75% успеха на новой задаче при бюджете меньше 10 часов показов против 40% у ближайшего конкурента. Важная оговорка: код и веса обещают, но пока в репозитории лежит только надпись «coming soon».
Transcribe.cpp — короткое дополнение к прошлому выпуску. Мы писали о нём 19 июля; за сутки в основную ветку приехало разделение по говорящим (GitHub). Отдельным релизом пока не оформлено.
Новости и тренды
Гипотеза Якобиана продержалась 87 лет и пала за один вечер. Математик Левент Альпёге опубликовал контрпример к задаче, поставленной в 1939 году (тред в X). Это шестнадцатая проблема в списке Смейла «на следующий век» и знаменитое «кладбище чудаков» — за десятилетия там утонула куча ошибочных доказательств. Благодарности в посте распределены так: другу Акхилу за вопрос, модели Fable — «за работу во время финала чемпионата мира».
Суть по-человечески. Есть простой местный тест, который говорит: формула нигде не слипается, локально её всегда можно отмотать назад. Гипотеза утверждала, что тогда её можно отмотать назад и целиком. Контрпример показывает три разные точки, которые дают один и тот же результат. Отмотать нельзя.
Проверяемость здесь важнее громкости. Это не доказательство на сорок страниц, а короткий сертификат — его пересчитывают за пять минут. Через четыре часа появилась формализация в Lean, причём в более сильном виде: контрпример работает над любым полем (репозиторий). Скептиков на Hacker News осадили быстро: определитель и три точки каждый может проверить сам.

Что это значит. Радоваться «модель решила великую задачу» рано: как именно нашли пример, авторы не рассказали, и вопрос «покажите переписку» под постом висит без ответа. Зато видно другое — планка сместилась. Математик в обсуждении сформулировал прямо: всё, что вообще доступно нынешним методам, теперь падает под передовые модели. Препринта и рецензии пока нет, статус — проверяемый результат, объявленный твитом.
OpenAI урезала контекст Codex почти на треть. Семейство GPT-5.6 в Codex переехало с 372 на 272 тысячи токенов (коммит в репозитории). Урезание настоящее, а не переименование счётчика: значение поменяли в одном файле каталога моделей. Публичных объяснений в коммите нет — формулировки нарочито нейтральные.
На практике рабочего контекста ещё меньше. Автоматическое сжатие срабатывает, когда остаётся 10–20%, то есть реально доступно около 218 тысяч. Ударит по тем, кто держит в контексте монолиты и объёмные файлы правил. А кого не заденет — так это тех, кто дробит задачу на подзадачи и работает через план и субагентов. Свой лимит можно посмотреть командой codex debug models.

Что это значит. Главная версия обсуждения — экономика: внимание модели растёт быстрее длины, и токен на длинном контексте обходится заметно дороже. Вторая версия мягче — на длинном контексте модели просто хуже соображают. Отсюда практический вывод, полезный независимо от решения OpenAI: привычка дробить задачу надёжнее привычки заливать в окно весь проект.
Claude Code уже месяц работает на Rust, и никто не заметил. Саймон Уиллисон решил проверить слух и полез в исполняемый файл (simonwillison.net). Вытащил из бинарника строки и нашёл 563 пути к файлам с расширением .rs. Значит, встроенный движок Bun — тот, на котором работает Claude Code, — действительно переписан с Zig на Rust. Версия 2.1.181 от 17 июня и все следующие.
Зачем это делали. Zig требует освобождать память руками, и классические ошибки там ловятся только дисциплиной. Rust ловит тот же класс ошибок на этапе сборки — программа просто не соберётся. Автор Bun приводит цифру: утечки в тесте на две тысячи сборок упали с 6745 МБ до 609 МБ (блог Bun).
Что это значит для вас. Делать ничего не надо, всё уже произошло. Заметного ускорения не ждите — единственная названная цифра это плюс 10% к скорости старта на Linux. Ценность в другом, и Уиллисон цитирует автора Bun дословно: «Boring is good». Замену фундамента на миллионах машин прошли незаметно — для инфраструктуры это лучший исход из возможных.
Китайские лаборатории воюют за открытые веса, и спрос их душит. Alibaba анонсировала Qwen 3.8 на 2,4 трлн параметров и пообещала открыть веса (пост Alibaba). Заявка громкая — «второе место после Fable 5». Подкреплять её пока нечем: ни бенчмарков, ни техотчёта, ни лицензии, ни даты. На HuggingFace пусто. Попробовать можно только по подписке в облаке Alibaba.
Тем временем Moonshot приостановила приём новых подписчиков на Kimi K3 — о выходе модели мы писали 18 и 19 июля (пост Moonshot). Причина честная: за 48 часов спрос упёрся в потолок видеокарт. Существующих подписчиков не тронули, новых будут пускать партиями. Заодно компания разделяет тарифы на чат и разработку — кодинг съедает непропорционально много мощности.
Что это значит. Веса Kimi обещают 27 июля, и до этой даты альтернативных хостеров просто нет — отсюда затор. После публикации нагрузка размажется по провайдерам, и в этом главный практический смысл открытых весов. Как заметили в обсуждении, открытые веса дают вам токены даже тогда, когда сама лаборатория упёрлась в стену. А про 2,4 трлн параметров стоит помнить трезво: дома это не запустить, речь про выбор провайдера, а не про домашнюю машину.
Netflix назвал цифры по ИИ в кино. Мы писали 18 июля, что ИИ применили почти в 300 тайтлах. Теперь появилась конкретика из отчёта за второй квартал (The Verge). Со-глава компании Тед Сарандос привёл пример: 17 минут материала в одном проекте сделали вдвое быстрее и вдвое дешевле обычного. ИИ шёл в основном на постпродакшен — массовку, батальные сцены, проработку мира.
Что это значит. Это первая скучная фаза ИИ в индустрии, а такие фазы обычно и закрепляются. Спор смещается с «может ли ИИ в искусство» на «кто решает, где он подставляет кадры». Для зрителя главный вопрос теперь про маркировку. Для маленьких студий это шанс: большой мир можно построить без бюджета блокбастера.
Америка вышла на улицы против дата-центров. 18 июля прошло 142 акции в 42 штатах — первая общенациональная попытка (Reuters). Движение надпартийное: больше всего акций в республиканском Техасе, но и Калифорния с Пенсильванией в списке. Явка при этом скромная, кое-где по десятку человек. А вот опросы жёсткие: только 14% американцев согласны на дата-центр в своей общине.
Причины бытовые, не идеологические: счета за электричество, вода, шум. Дата-центры съели больше 4% всего электричества США ещё в 2024 году. Один проект в калифорнийской пустыне может брать почти миллиард литров воды в год из Колорадо. В Оклахоме законодатели уже проводят двухпартийную норму, чтобы оградить дома и бизнес от скачков счетов.
Параллельно идут два сюжета помрачнее. Энергокомпании начали применять принудительное отчуждение земли под линии электропередачи к дата-центрам — юридический спор идёт о том, считается ли это общественной пользой (Fortune). А стройка потянулась на земли индейских племён, где разрешения выдают за месяцы вместо трёх-десяти лет (The New York Times). Племя семинолов ответило мораторием.
Что это значит. У каждого запроса к чат-боту есть физический адрес, и рядом с ним кто-то живёт. Расходы на усиление сетей разносятся по всем потребителям региона — это ваш счёт за свет. И когда стройку блокируют в одном месте, она не исчезает, а уходит туда, где сопротивляться труднее.
Коротко. MLB запретила командам гонять генеративный ИИ на планшетах в дагаутах — клубы использовали его для замен и выбора подач (The Athletic). Patreon перестал вежливо просить краулеры не скрести контент и начал блокировать их через Cloudflare (TechCrunch). Прокурор Сан-Франциско обязал Apple убрать из App Store восемь приложений для «раздевания» людей на фото (AppleInsider). Microsoft готовит Project Perception — продукт по безопасности, который ищет и чинит баги на моделях Anthropic, OpenAI и своих (The Information). ВМС США утвердили стратегию, где медленное внедрение ИИ считается риском большим, чем несовершенное выравнивание (The Decoder). ASML раздаёт 44,5 тысячам сотрудников акции на €20 тысяч за обещание доработать до 2030 года (DutchNews).