Гипотеза Якобиана пала, /goal по правилам Anthropic и урезанный контекст Codex  Публичный пост

20 июля 2026  131

Задача, которую не могли ни доказать, ни опровергнуть 87 лет, рухнула за время футбольного финала. Контрпример уместился в одну строчку — его проверяет школьная алгебра. А ещё сегодня инженер Anthropic показал, как заставить Claude Code работать до результата одной командой. И отдельная история: человек развернул свой исследовательский конвейер задом наперёд. Работы агентов стало вдесятеро больше — за те же деньги.

Главное за 30 секунд

  • Claude Fable нашла контрпример к гипотезе Якобиана — она держалась с 1939 года.
  • Правило /goal от Anthropic: команда работает только там, где есть проверяемая финишная черта.
  • Anthropic урезала системный промпт Claude Code на 80% — жёсткие правила мешают новым моделям.
  • OpenAI срезала контекст Codex с 372 до 272 тысяч токенов без публичных объяснений.
  • Дешёвые модели ищут, точные проверяют, глубокое исследование идёт последним — вдесятеро больше работы без доплат.

Внедряем и улучшаем

Как инженер Anthropic гоняет Claude Code: цель, интервью и матрица незнания. Питер Янг позвал в подкаст Тарика Шихипара из команды Claude Code. Тот разобрал свой рабочий процесс по шагам (Creator Economy). Сразу оговорка: текстовая расшифровка платная, открыты три пункта из десяти. Зато сам выпуск на 40 минут лежит бесплатно (YouTube).

Главное правило про /goal звучит так: команда полезна, только если у задачи есть проверяемая финишная черта. Янг честно показал антипример на себе — попросил /goal Build me a great game. Итог, по его словам, «результаты вышли… так себе». Проверить «отличную игру» нечем, поэтому цикл крутится впустую.

Как устроен /goal внутри — из официальной документации (code.claude.com). После каждого хода маленькая быстрая модель смотрит, выполнено ли условие. Не выполнено — Claude сам начинает следующий ход и не возвращает вам управление. Технически это обёртка над Stop-хуком, поэтому при отключённых хуках команда не работает. Нужна версия 2.1.139 или свежее.

Условие пишется из трёх частей. Одно измеримое конечное состояние, способ проверки и ограничения, которые нельзя нарушать по дороге:

/goal all tests in test/auth pass and the lint step is clean
claude -p "/goal CHANGELOG.md has an entry for every PR merged this week"

Снять цель — /goal clear. Ограничить длительность можно прямо в условии, дописав or stop after 20 turns. Оценщик не вызывает инструменты — он судит только по тому, что Claude уже написал в диалог. Значит, доказательство надо выводить в чат, а не держать в голове.

Второй приём — планирование через снятие неизвестного. Перед сборкой Тарик просит Claude объяснить, как может сломаться зависимость. В его случае это была голосовая расшифровка через Whisper. И главное: план он читает руками, а не доверяет вслепую. Готовый промпт-интервью выглядит так:

Interview me one question at a time about anything ambiguous — prioritize
questions where my answer would change the architecture.

Вторая половина фразы и есть весь смысл. Не «задай мне вопросы», а «спрашивай только там, где мой ответ поменяет архитектуру». Иначе модель утонет в мелочах.

Рамка для планирования — «матрица незнания». Самый ценный квадрант в ней третий: то, что настолько очевидно, что вы никогда это не запишете. Именно он и теряется в промптах.

Матрица незнания Тарика Шихипара: четыре квадранта планирования — от «что я хочу» до «чего я вообще не рассматривал»
Матрица незнания Тарика Шихипара: четыре квадранта планирования — от «что я хочу» до «чего я вообще не рассматривал»

Третий приём — разделение ролей. Отдельный агент-создатель и отдельный агент-проверяльщик. Параллельные задачи команда запускает через Slack.

И самое неожиданное. Anthropic урезала системный промпт Claude Code на 80%. Причина: жёсткие правила и примеры ограничивали новые модели. Отсюда прямой совет — при выходе новой модели идите в свой CLAUDE.md и скиллы и вычищайте оттуда жёсткие пошаговые предписания. Вместо длинного списка инструментов — поиск по инструментам.

Смена подхода к системному промпту: слева длинный промпт с примерами и всеми инструментами, справа короткий промпт с поиском по инструментам и без примеров
Смена подхода к системному промпту: слева длинный промпт с примерами и всеми инструментами, справа короткий промпт с поиском по инструментам и без примеров

Разверни исследование задом наперёд — и лимиты перестанут гореть. Бартош Котрыс из Quesma изучал, сколько на самом деле стоит агентная разработка (quesma.com). Начал он стандартно: отдал /deep-research большой открытый вопрос. Результат первого дня — 111 агентов, 123 утверждения в очереди на проверку, проверено 25. Финальный сбор вообще не запустился. Весь лимит плана Claude Max 5x сгорел за полчаса.

Дальше он перестроил всё. Первый ход — задействовать подписки, за которые уже платишь. У него их три: Claude, Codex и Antigravity. Claude Code остаётся оркестратором, а чужие CLI подключаются субагентами и работают без интерфейса. Мост между ними — крошечный скрипт:

# run-cli: call another vendor's CLI as a headless subagent
# usage: run-cli <codex|antigravity> "<prompt>"
VENDOR="$1"; PROMPT="$2"
case "$VENDOR" in
  codex)       OUT="$(codex exec --sandbox read-only "$PROMPT")" ;;
  antigravity) OUT="$(agy --model "Gemini 3.1 Pro (High)" -p "$PROMPT")" ;;
esac
echo "$OUT"
echo "$OUT" | claude-mem-save -s "$VENDOR" # save to shared memory

Обёртка следит за строчками «usage limit» и «out of credits» в выводе. Поймала — возвращает особый код, и оркестратор перекидывает работу на Claude.

Второй ход — роли. Дешёвая модель ищет, точная проверяет, самая дорогая только планирует и разрешает споры. Отдельная модель другого производителя даёт второе мнение, потому что у неё другие слепые пятна.

Конвейер Quesma: найти на Sonnet, проверить на Opus, рассудить на Fable, прогнать инструменты через Codex — и только проверенное уходит в вики
Конвейер Quesma: найти на Sonnet, проверить на Opus, рассудить на Fable, прогнать инструменты через Codex — и только проверенное уходит в вики

Самая дешёвая правка с самым большим эффектом — закреплять модель за ролью явно. Субагенты по умолчанию наследуют модель родителя. Дословно у автора: «именно так я и сжёг свой лимит Fable за 30 минут».

Третий ход — правила против выдумок. Их три, и они жёсткие. Кто нашёл утверждение — тот его не проверяет. Ничего не попадает в базу без ссылки и цитаты из первоисточника. Никогда не называй число, которого нет на странице источника.

Четвёртый ход — /deep-research переехал в самый конец. Он идёт по уже проверенному списку, а не по всему интернету. Последний запуск: 61 агент за 22 минуты вместо сгоревшего лимита.

Итог автора: непрерывной работы стало примерно в десять раз больше, доплат — ноль. «Раньше было 30 минут исследования, теперь несколько часов — и ни цента сверху».

И самый ценный провал. Правило «утверждение без подтверждения — не запись» тихо выбросило из базы проект с 56 тысячами звёзд. Агенты отработали правильно, ошибкой было само правило. Заметил автор только через два дня. Новая формулировка: отклоняй утверждение, а не проект. Отсюда мораль на все агентные системы: «ни один агент никогда не скажет вам, что баг — это ваше собственное правило».

Codex месяцами жёг ваш SSD — проверьте и почините. Пользователь обнаружил, что Codex непрерывно пишет в свою базу логов. За 21 день работы диск принял около 37 ТБ записи, в пересчёте — примерно 640 ТБ в год (issue #28224). Ресурс обычного потребительского SSD — около 600 ТБ записи. То есть весь запас записи, рассчитанный на годы, сгорал примерно за один.

Причина — сырые данные обмена по вебсокету валились в лог целиком, строками до 800 КБ. Три правки уже вышли и убирают около 85% этого мусора. Но пользователи в обсуждении до сих пор спорят, всё ли починили в приложении для компьютера.

Что делать. Сначала обновитесь — правки приехали в версии 0.142 и 0.143. Если обновиться нельзя, выйдите из Codex и поставьте заглушку на запись:

sqlite3 ~/.codex/logs_2.sqlite "CREATE TRIGGER IF NOT EXISTS
  block_log_inserts BEFORE INSERT ON logs BEGIN SELECT RAISE(IGNORE);
  END;"

Заодно проверьте размер папки ~/.codex. Есть отдельная незакрытая жалоба (issue #26374). На серверном режиме база растёт примерно на 0,75 ГБ в день, и её никто не чистит. И там же тревожатся за приватность: ваши промпты и ответы лежат на диске вечно.

Совет ИИ отбирает у человека право сказать «не знаю». Трое исследователей из Парижа, Рима и Милана прогнали 3132 человека через пять экспериментов (препринт на PsyArXiv). Людям задавали шесть трудных вопросов о мелких деталях фильмов. Отказаться от ответа можно было в любой момент.

Вопросы подбирали специально так, чтобы модель выдумывала. Значит, люди бросали своё «не знаю» не потому, что доверились надёжному инструменту.

Цифры жёсткие. Доля отказов упала с 0,36 до 0,06. Точность просела с 27,5% до 9,2% — почти втрое. А уверенность в себе выросла с 29,6 до 75,9 по стобалльной шкале. Люди отвечали чаще, ошибались больше и были довольны собой в два с половиной раза сильнее.

Механизм авторы описывают так: модель обязана что-то выдать и сама никогда не воздерживается. Пользователь наследует эту неспособность. Беглый текст подменяет собой оценку «а знаю ли я это».

Два отдельных наблюдения. Первое: подсказка превратила часть заведомо верных ответов в ошибки — люди отказывались от того, что знали. Второе: эффект держится, даже когда совет показывают автоматически, без запроса. Это прямо про ИИ-сводки в поиске и подсказки в рабочих инструментах.

Что помогает. Единственное, что сработало в эксперименте, — личная цена ошибки. За верный ответ давали 10 центов, за неверный столько же снимали. Люди стали реже ходить к модели и чаще отвечать верно. До уровня без ИИ это не вернуло, но часть мышления восстановило.

Дальше — вывод из механизма, а не данные исследования. Формулируйте свою версию до того, как увидите ответ модели. Хоть одним словом на бумажке. Авторы это не проверяли, но их объяснение указывает ровно туда: беглый ответ обрывает раздумье слишком рано.

И честные оговорки, без них подавать это нельзя. Работа не прошла рецензирование. Задачи искусственные, модель ошибалась почти всегда — а реальные ассистенты чаще правы. Что будет при надёжной модели, авторы прямо называют главной непроверенной границей. Их собственный вывод мягче громких заголовков: ИИ меняет готовность думать, а не способность.

Гоняйте видеомодель как раскадровку, а не как сценарий. The Neuron разобрал рабочий рецепт для открытой видеомодели LTX 2.3 (The Neuron). Главный принцип — не просить целый фильм. Сделайте один сильный кадр, оживите короткий план, потом сшейте планы.

База такая. Стандартный набор в ComfyUI, режим fp8 при 12 ГБ видеопамяти. Стартуйте с чистых картинок, 18 кадров в секунду при 720p. Для длинных роликов подавайте опорный кадр, а не голый текст. Силу следования промпту держите около 2,5. Второй опорный кадр подкидывайте в районе 45–50 кадра.

Две ловушки из обсуждения. Промпт на 30 секунд при шести секундах действия быстро превращается в вату. И если встроенное «улучшение промпта» ломает движение — выключайте его. Готовый шаблон:

Build a single shot.
Starting image/reference: [describe or attach the clean still]
Length: [6-8 seconds]
Frame rate/resolution: [18fps, 720p]
Camera: [locked / slow push-in / close-up / high angle]
Identity details: [face, outfit, hair, style]
Action: [one clear movement or beat]
Motion limits: avoid fast camera movement, identity drift, morphing, and filler.
If extending: use the last frame or inject a second reference around frame 45-50.

Инструменты и штуки

Ollama привлекла $88 млн и написала манифест про открытые модели (блог Ollama). Это способ запускать открытые модели прямо на своей машине: без ключа, без счетов за токены, без отправки данных наружу. Цифры внушают — 8,9 млн разработчиков и 85% компаний из списка Fortune 500. Деньги пойдут на смешанный режим: часть работы локально, часть в облаке, интерфейс один. Следите за тем, где они начнут брать деньги. Локальный запуск бесплатен, облако — уже продукт, и после такого раунда на него надавят.

LoRA Speedrun — открытая таблица рекордов на время дообучения (GitHub). Задача заморожена: дотянуть Qwen2.5-1.5B до 57% на GSM8K, одна видеокарта L40S, адаптер до 30 млн параметров. Рекорды не принимают на слово — каждый прогоняют трижды заново на одном железе. Текущий лидер срезал время вдвое, 6:05 против базовых 11:57, за счёт упаковки последовательностей и маскирования потерь. MIT, участие бесплатное, но проекту двое суток и обе записи пока от самого автора.

Лидерборд LoRA Speedrun: базовый прогон 11 минут 57 секунд против рекорда 6 минут 5 секунд
Лидерборд LoRA Speedrun: базовый прогон 11 минут 57 секунд против рекорда 6 минут 5 секунд

stem-illustration-skill — скилл для Claude, который рисует научные иллюстрации (GitHub). Внутри 24 шаблона: сигнальные пути, схемы опытов, разрезы механизмов, архитектуры нейросетей. Скилл ведёт агента по десяти шагам и держит промпт в строгости: цвета только шестнадцатеричными кодами, обозначения стандартные. Но любопытнее другое. Автор вписал в скилл раздел про научную честность. Рисовать гели, микрофотографии и графики так, будто это настоящие данные опыта, запрещено — скилл обязан отказать. Один из примеров в описании автор сам пометил как химически неверный — оставил как урок. Оговорки: репозиторий на китайском, лицензии нет, генерация картинок требует своего платного ключа.

Castor — консольная утилита, которая вытаскивает видеопоток со страницы и кидает его на телевизор (GitHub). Поднимает браузер без окна, слушает сетевой обмен и находит настоящий поток вместо тормозящего зеркалирования экрана. ИИ тут не главный, но показательный: внутрь вшит whisper.cpp, так что Castor на лету расшифровывает дорожку и вжигает субтитры. Распознавание речи стало просто галочкой в настройках. Учтите цену: с субтитрами видео приходится перекодировать. MIT, 1414 звёзд, ставится одной строкой через Homebrew.

Zro даёт кодовым агентам работу с открытыми моделями без хранения запросов (zro.moonmath.ai). Смысл — приватность там, где агент видит ваш код. Есть бесплатные варианты, первый месяц стоит $1.

Unabyss for Claude делает общую память между приложениями, агентами и моделями (unabyss.com). Отдельно решает конфликты, когда куски контекста устарели и противоречат друг другу. Пригодится тем, у кого Claude работает не в одном окне, а в связке инструментов. Цену публично не называют.

Forall помогает агентам писать код с машинно-проверяемыми доказательствами (GitHub). Поддерживает TypeScript, Java и Rust. Идея простая: не «модель уверяет, что код верный», а формальная проверка. Открытый код, бесплатно.

Scribe превращает историю git, сессии Claude Code и сохранённые ссылки в самообновляющуюся базу знаний в markdown (getscribe.dev). Закрывает вечную боль — документация отстаёт от кода на полгода. Сам открытый и бесплатный, платите только за работу моделей.

Campus от Skills AI — общее рабочее пространство, где над задачами сидят и люди, и агенты (skills.tech). Ставка на то, что агентов в команде станет много и ими надо управлять как людьми. Цена не публичная.

V2Fun делает 3D-персонажей из промптов и видео (Product Hunt). Обещают текстуры в 8K и захват движения по обычному видео. Интересно тем, кто делает игры, анимацию или аватаров и не хочет держать отдельного 3D-художника.

Xiaomi-Robotics-1 — модель для роботов, которая учится не на роботах (arXiv). Xiaomi обошла нехватку данных хитро. Сначала 100 тысяч часов, которые люди сняли руками в 1700 сценариях. И только потом 7200 часов на настоящих роботах. Результат — 75% успеха на новой задаче при бюджете меньше 10 часов показов против 40% у ближайшего конкурента. Важная оговорка: код и веса обещают, но пока в репозитории лежит только надпись «coming soon».

Transcribe.cpp — короткое дополнение к прошлому выпуску. Мы писали о нём 19 июля; за сутки в основную ветку приехало разделение по говорящим (GitHub). Отдельным релизом пока не оформлено.

Новости и тренды

Гипотеза Якобиана продержалась 87 лет и пала за один вечер. Математик Левент Альпёге опубликовал контрпример к задаче, поставленной в 1939 году (тред в X). Это шестнадцатая проблема в списке Смейла «на следующий век». И знаменитое «кладбище чудаков»: за десятилетия там утонула куча ошибочных доказательств.

Суть простая. Есть местный тест, который говорит: формула нигде не слипается, локально её всегда можно отмотать назад. Гипотеза утверждала, что тогда её отмотаешь и целиком. Контрпример даёт три разные точки с одним и тем же результатом. Отмотать нельзя. Благодарит автор двоих: друга Акхила за вопрос и модель Fable — «за работу во время финала чемпионата мира».

Цепочка рассуждений модели, которая проверяет контрпример и не верит результату: «det J ≡ −2. Fiber has 3 points. JC contradicted?!»
Цепочка рассуждений модели, которая проверяет контрпример и не верит результату: «det J ≡ −2. Fiber has 3 points. JC contradicted?!»

Что это значит. Ценна тут не громкость задачи, а проверяемость: не сорок страниц доказательства, а короткая выкладка на пять минут счёта. Этим на Hacker News и осадили скептиков. Через четыре часа появилась формализация в Lean, причём сильнее исходной: контрпример работает над любым полем (репозиторий). Радоваться «модель решила великую задачу» рано. Как именно нашли пример, авторы не рассказали, препринта и рецензии нет. Зато планка сместилась — как сказал математик в обсуждении, всё, что вообще доступно нынешним методам, теперь падает под передовые модели.

OpenAI урезала контекст Codex почти на треть. Семейство GPT-5.6 в Codex переехало с 372 на 272 тысячи токенов (коммит в репозитории). Урезание настоящее, а не переименование счётчика: значение поменяли в одном файле каталога моделей. Публичных объяснений в коммите нет — формулировки нарочито нейтральные.

График стоимости чтения из кэша: линия сжатия на 300 тысячах токенов уходит заметно выше линии на 200 тысячах
График стоимости чтения из кэша: линия сжатия на 300 тысячах токенов уходит заметно выше линии на 200 тысячах

Что это значит. Версия первая, главная в обсуждении, — экономика: внимание модели растёт быстрее длины, и длинный токен обходится дороже. Версия вторая мягче: на длинном контексте модели просто хуже соображают. На практике рабочего окна ещё меньше — сжатие срабатывает при остатке 10–20%, то есть реально доступно около 218 тысяч. Ударит по тем, кто держит в контексте монолиты и объёмные файлы правил. Свой лимит смотрите командой codex debug models. Вывод полезен независимо от решения OpenAI: дробить задачу надёжнее, чем заливать в окно весь проект.

Claude Code уже месяц работает на Rust, и никто не заметил. Саймон Уиллисон решил проверить слух и полез в исполняемый файл (simonwillison.net). Вытащил из бинарника строки и нашёл 563 пути к файлам с расширением .rs. Claude Code работает на движке Bun. Значит, Bun действительно переписали с Zig на Rust — начиная с версии 2.1.181 от 17 июня. Зачем: Zig требует освобождать память руками, а Rust ловит тот же класс ошибок ещё на сборке. Утечки в тесте на две тысячи сборок упали с 6745 МБ до 609 МБ (блог Bun).

Что это значит для вас. Ничего делать не надо, всё уже случилось. Заметного ускорения не ждите: единственная названная цифра — плюс 10% к скорости старта на Linux. Ценность в другом. Уиллисон цитирует автора Bun дословно: «Boring is good» — скука это хорошо. Фундамент заменили на миллионах машин, и никто не заметил. Для инфраструктуры это лучший исход из возможных.

Китайские лаборатории воюют за открытые веса, и спрос их душит. Alibaba объявила Qwen 3.8 на 2,4 трлн параметров и пообещала открыть веса (пост Alibaba). Заявка громкая — «второе место после Fable 5». Подкреплять её пока нечем: ни бенчмарков, ни техотчёта, ни лицензии, ни даты. Тем временем Moonshot приостановила приём новых подписчиков на Kimi K3 (пост Moonshot). О выходе модели мы писали 18 и 19 июля. За 48 часов спрос упёрся в потолок видеокарт. Старых подписчиков не тронули, новых будут пускать партиями. Заодно компания делит тарифы на чат и разработку: работа с кодом съедает куда больше мощности.

Что это значит. Веса Kimi обещают 27 июля. До этой даты запустить модель больше негде — отсюда и затык. Потом нагрузка размажется по провайдерам. В этом и главный смысл открытых весов: вы получаете токены даже когда лаборатория упёрлась в стену. А про 2,4 трлн параметров думайте трезво. Дома это не запустить. Речь про выбор провайдера, не про свою машину. И выбор этот теперь ещё и вопрос к юристу: британские регуляторы предупредили компании о рисках дешёвых китайских моделей (The Neuron).

Netflix назвал цифры по ИИ в кино. Мы писали 18 июля, что ИИ применили почти в 300 фильмах и сериалах. Теперь появилась конкретика из отчёта за второй квартал (The Verge). Со-глава компании Тед Сарандос назвал пример: 17 минут материала в одном проекте сделали вдвое быстрее и вдвое дешевле обычного. ИИ шёл в основном на постпродакшен — массовку, батальные сцены, проработку мира.

Что это значит. Это первая скучная фаза ИИ в индустрии, а такие фазы обычно и закрепляются. Спор смещается с «может ли ИИ в искусство» на «кто решает, где он подставляет кадры». Для зрителя главный вопрос теперь про маркировку. Для маленьких студий это шанс: большой мир можно построить без бюджета блокбастера.

Америка вышла на улицы против дата-центров. 18 июля прошло 142 акции в 42 штатах — первая общенациональная попытка (Reuters). Движение надпартийное: больше всего акций в республиканском Техасе, но и Калифорния с Пенсильванией в списке. Явка при этом скромная, кое-где по десятку человек. А вот опросы жёсткие: только 14% американцев согласны на дата-центр в своей общине.

Причины бытовые, не идеологические: счета за свет, вода, шум. Дата-центры съели больше 4% всего электричества США ещё в 2024 году. А один проект в калифорнийской пустыне берёт почти миллиард литров воды в год из Колорадо. Дальше хуже. Энергокомпании начали отбирать землю под линии к дата-центрам через суд — спорят, считать ли это общественной пользой (Fortune). А стройка потянулась на земли индейских племён, где разрешения выдают за месяцы вместо трёх-десяти лет (The New York Times). Племя семинолов ответило мораторием.

Что это значит. У каждого запроса к чат-боту есть физический адрес, и рядом с ним кто-то живёт. Сети усиливают за счёт всех в регионе. Это ваш счёт за свет. И когда стройку блокируют в одном месте, она не исчезает, а уходит туда, где сопротивляться труднее.

Коротко.

  • MLB запретила гонять генеративный ИИ на планшетах в дагаутах — клубы считали им замены и подачи (The Athletic).
  • Patreon перестал вежливо просить роботов-сборщиков не тянуть контент и начал их блокировать через Cloudflare (TechCrunch).
  • Прокурор Сан-Франциско обязал Apple убрать из App Store восемь приложений для «раздевания» людей на фото (AppleInsider).
  • Microsoft готовит Project Perception: продукт по безопасности, который ищет и чинит баги на моделях Anthropic, OpenAI и своих (The Information).
  • ВМС США утвердили стратегию: тормозить с внедрением ИИ опаснее, чем внедрить недонастроенный (The Decoder).
  • ASML раздаёт 44,5 тысячам сотрудников акции на €20 тысяч — за обещание доработать до 2030 года (DutchNews).
Откомментируйте первым 👇

😎

Автор поста открыл его для большого интернета, но комментирование и движухи доступны только участникам Клуба

Что вообще здесь происходит?


Войти  или  Вступить в Клуб