33k токенов Claude Code, Терри Тао чинит апплеты за пару часов и дырявые MCP  Публичный пост

13 июля 2026  67

Claude Code отправляет модели около 33 тысяч токенов ещё до того, как вы напечатали первое слово. У OpenCode по соседству — семь тысяч. Почти весь этот балласт — описания инструментов, и платите вы за него на каждом запросе. Заодно Терри Тао за пару часов оживил апплеты, пролежавшие мёртвыми пятнадцать лет. А в свежем отчёте по безопасности дырявым оказался каждый четырнадцатый MCP-сервер.

Главное за 30 секунд

  • Claude Code шлёт ~33k токенов служебной обвязки до вашего промпта — против ~7k у OpenCode, и платит за это на каждом запросе.
  • Держите CLAUDE.md коротким: тяжёлый файл добавляет ~20k токенов к каждому запросу, а файл AGENTS.md свежий Claude Code вообще не читает.
  • Терри Тао за пару часов перенёс десятки мёртвых Java-апплетов на JavaScript в Claude Code и всё проверял автотестами.
  • Отчёт Canopii: из 11 524 MCP-серверов у 830 оценка D или F, а звёздные популярные серверы впятеро опаснее середняков.
  • Anthropic продлила бесплатный доступ к Fable 5 и повышенные лимиты Claude Code до 19 июля.

Внедряем и улучшаем

Claude Code раздувает контекст — вот как срезать лишние токены. В Systima вставили прокси между агентом и моделью и всё замерили. На пустяковую задачу «ответь ровно OK» Claude Code отправил ~33 000 токенов служебной обвязки ещё до самого промпта. У OpenCode на ту же задачу ушло ~7 000 (разбор Systima).

Больше всего съедают описания инструментов. Из этих 33k примерно 24k — схемы 27 инструментов: агентная оркестрация, задачи, воркдеревья, уведомления. Даже без инструментов один системный промпт у Claude Code весит ~6,5k против ~2k у OpenCode. И платите вы за это на каждом ходу: обвязка пересылается заново или перечитывается из кэша с каждым запросом.

Что накидывает счёт сильнее всего:

  • Тяжёлый CLAUDE.md. Файл на 72 КБ добавляет ~20 000 токенов к КАЖДОМУ запросу в этом репозитории. Держите его коротким.
  • Имя файла. Claude Code версии 2.1.207 молча игнорирует AGENTS.md и читает только CLAUDE.md. Проверьте, как называется ваш файл с правилами.
  • MCP-серверы. Каждый небольшой сервер — это ~1 000–1 400 токенов на запрос. Подключайте только те, что нужны под сессию.
  • Субагенты — самый мощный множитель. Задача на 121 000 токенов напрямую обошлась в 513 000 при раздаче двум субагентам — рост в 4,2 раза. Каждый субагент тащит свою обвязку, а его лог потом дочитывает родитель.

Отдельная течь — перезапись кэша. На одной задаче Claude Code записал 53 839 токенов кэша за 5 запросов против 1 003 у OpenCode — до 54 раз больше. Причина в том, что префикс у OpenCode стабилен байт-в-байт, а Claude Code посреди сессии заново переписывает свою «шапку» на ~43k токенов — по премиум-тарифу. Автор бьёт в одну точку: «переписать байт-идентичный префикс посреди сессии не даёт ни капли качества — это тот же текст, оплаченный ещё раз».

Но вывод не «Claude Code дороже всегда». На многошаговой задаче он вышел ДЕШЕВЛЕ: 3 запроса и ~121 000 токенов против 9 запросов и ~132 000 у OpenCode — за счёт того, что упаковывает все действия в один параллельный вызов. А свежим моделям вроде Fable 5 он шлёт урезанный системный промпт, и разрыв падает с 4,7× до 3,3×. Мораль простая: обвязку задаёт харнесс, а счёт — ваша конфигурация. Подрежьте CLAUDE.md, MCP и субагентов — и не делайте пауз дольше 5 минут, иначе кэш примируется заново.

Терри Тао чинит мёртвый код агентом — и показывает как. Знаменитый математик с 1999 года писал для своих курсов интерактивные апплеты на Java 1.0. Когда браузеры выкинули поддержку той версии, апплеты умерли и пролежали мёртвыми полтора десятка лет. За пару часов работы с Claude Code Тао оживил около двух десятков из них, перенеся код на JavaScript (пост Тао).

Мало того — он собрал с нуля две новые визуализации, которые в 1999-м забросил из-за сложности кода: интерактивную диаграмму специальной теории относительности и визуализатор гипотезы Гилбрета. На каждую ушло, по его словам, «пара часов вайб-кодинга».

Ценнее всего здесь не сам факт, а рабочий метод. Разбираем по шагам:

  • Берёт низкорисковые проверяемые цели. Апплеты — это вспомогательные картинки, а не ядро доказательства. Ошибка агента тут почти ничем не грозит, поэтому риск приемлемый.
  • Даёт агенту ясное видение и опору. Для относительности — аналогию «как игра Euclid: The Game», для Гилбрета приложил PDF своей статьи.
  • Держит поверхность крошечной. Каждое приложение — это два файла: числовое ядро и HTML-обёртка.
  • Строит по кускам и постоянно проверяет. Физику он гонял через маленькие headless-тесты на Node, а связку интерфейса — через DOM-заглушку. Код не коммитил, пока всё не заработает локально.

По качеству кода вышла ничья: сам Тао нашёл один мелкий баг, зато агент нашёл два бага уже в его ИСХОДНОМ коде, о которых он не знал. Готовый апплет про относительность Тао честно назвал «альфой» и попросил присылать баги. Вывод для нас: начинайте с задач, где ошибку легко заметить и не страшно словить, — и не отпускайте автотесты.

Интерактивный апплет Терри Тао: диаграммы Минковского для парадокса близнецов, восстановленный из мёртвого Java-кода за пару часов на Claude Code
Интерактивный апплет Терри Тао: диаграммы Минковского для парадокса близнецов, восстановленный из мёртвого Java-кода за пару часов на Claude Code

Как переехать с одной модели на другую и не разориться. Команда Ploy держит агента, который сам строит и правит лендинги: планирует, читает код, пишет компоненты, скриншотит свою работу и решает, когда готово. Четыре месяца там работал Claude Opus. Теперь команда переехала на GPT-5.6 Sol и получила сборку в 2,2 раза быстрее и на 27% дешевле — при вдвое меньшем числе выходных токенов (разбор Ploy).

Но красивые цифры дались не сразу: сначала пришлось починить четыре вещи. Готовый чек-лист для любого переезда между моделями:

  1. Сначала харнесс, потом модель. Лимиты вызовов были заточены под последовательный стиль Opus, а GPT-5.6 бьёт вызовы веером, параллельно, и упирался в потолок на задачах, которые решал верно. Около трети «провалов» первого прогона оказались багами обвязки, а не модели. И зафиксируйте пороги: забытый minScore по умолчанию равен 1.0 и валит верные ответы.
  2. Проверьте, чем модель заполняет вызовы инструментов. У инструмента 25 полей, обязательное — одно. Claude слал 2–3, а GPT-5.6 слал все 25 в 100% вызовов, придумывая правдоподобные значения. Из-за выдуманного offset: 0 больше половины чтений файлов возвращались пустыми, а инструмент при этом отвечал success: true — модель даже не знала, что читает пустоту.
  3. Чинить это надо на границе провайдера, а не промптом. Не помогли ни описания в духе «не заполняй лишнее», ни строгий режим. Помогло другое: переписать необязательные поля схемы в «обязательные, но допускающие null» и убирать эти null перед вызовом. Пустые чтения упали с 52% до 0%, вызовов стало на треть меньше.
  4. Кэш переписать под нового провайдера с нуля. Сначала GPT-5.6 выглядел на 50% дороже — но это была не цена модели, а сбитый кэш. Ключ кэша привязали к рабочему пространству, попадания выросли с ~0% до 83,7%, а неоплаченный ввод упал на 28%.

Ещё нюанс: у GPT-5.6 дизайн чище, но однообразнее, и он игнорирует ваш дизайн-код, пока его туда прямо не ткнёшь. И включите store: false для реплея рассуждений, иначе диалог начнёт падать на середине. Общая мораль: то, что мы зовём «моделью», наполовину — привычки конкретного провайдера, под которые молча подстроился весь ваш стек.

Один и тот же бриф у Opus 4.8 и GPT-5.6 Sol: обе версии героя-лендинга набрали ~1.0, но «провалились» из-за забытого порога minScore — из разбора Ploy
Один и тот же бриф у Opus 4.8 и GPT-5.6 Sol: обе версии героя-лендинга набрали ~1.0, но «провалились» из-за забытого порога minScore — из разбора Ploy

Умная модель — архитектор, дешёвая — исполнитель (готовый промпт). Приём «сильная модель планирует, дешёвая делает» мы уже разбирали на схеме советника-дирижёра от Anthropic. Вот свежий и очень конкретный рецепт под него. Дизайнер Эмиль Ковальский сделал скилл-аудитор анимаций: сильная модель осматривает весь код, оценивает анимации по восьми критериям и пишет приоритизированный план правок — не трогая сам код. Дальше по этому плану пашут модели подешевле (разбор The Neuron, скилл Ковальского).

Петля из четырёх шагов: сильной модели даёте цель, файлы и ограничения — и просите не править, а изучить и составить план. Она ранжирует проблемы и пишет самодостаточные инструкции под каждую. Инструкции по одной уходят дешёвой модели. Готовое возвращается сильной на финальную проверку. Как формулирует The Neuron, «дорогая модель становится вашим архитектором, а не стажёром».

Готовый промпт для роли «старший ревьюер и планировщик» — забирайте дословно:

Act as the senior reviewer and planner. Inspect the project against the goal
below, but do not edit anything. Identify the highest-impact problems, rank
them by priority, and write self-contained implementation instructions that a
cheaper model can follow one task at a time. Include success criteria for each
task and a final QA checklist.

Goal: [PASTE YOUR GOAL]
Constraints: [PASTE YOUR CONSTRAINTS]

Меньше правил, больше инструментов: как строить агентов. Джаред Зонерайх из Cognition (те, что делают Devin) в подкасте у Питера Янга разбирает частую ошибку: первого агента почти все переусложняют жёсткими правилами. Работает другое — простой промпт, правильные инструменты и самопроверка (пост Питера Янга).

Два принципа, которые стоит забрать:

  • «Дай модели приготовить». Выражайте намерение и ограничения простым языком, а не гоните модель по детерминированным шагам.
  • Инженерия инструментов важнее вылизанного промпта. Дайте модели способы искать по коду, читать логи, гонять тесты, открывать приложение и видеть, что она изменила. Инструменты решают больше, чем формулировки.

Отдельный приём — параллельные сессии. Крупную миграцию режут на независимые «слайсы», каждый уходит своей сессии Devin, и они работают и тестируются одновременно. Честно оговорюсь: самое вкусное — как один агент-дирижёр раздаёт задачи десяти облачным агентам и как агенты доказывают свою работу до вашего ревью — спрятано за платной подпиской, так что здесь только каркас идеи.

Схема Cognition/Devin: крупная миграция режется на независимые «слайсы», каждый уходит своей сессии Devin и тестируется параллельно
Схема Cognition/Devin: крупная миграция режется на независимые «слайсы», каждый уходит своей сессии Devin и тестируется параллельно

Прежде чем ставить MCP-сервер — проверьте его. Canopii просканировала 11 524 публичных MCP-сервера и выкатила годовой отчёт по безопасности. Каждый четырнадцатый (830 штук) получил оценку D или F — и среди них самые звёздные проекты экосистемы (отчёт Canopii).

Цифры отрезвляют. У 232 серверов есть опасный «сток» — достижимый eval, инъекция команд или небезопасная десериализация. 184 версии тихо поменяли описания своих инструментов уже ПОСЛЕ установки — так называемый rug pull, и клиент применяет новое поведение без повторного запроса. У 130 серверов прямо в описаниях инструментов зашит текст-инструкция — адресованный вашему агенту, а не вам. А популярность не спасает: серверы с 1000+ звёзд оказались в пять раз опаснее середняков.

Что проверить, прежде чем довериться серверу:

  • Не верьте числу звёзд — смотрите оценку сервера в индексе Canopii.
  • Фиксируйте точную версию и перечитывайте изменения при каждом обновлении, особенно для финансов, оплат и авторизации.
  • Ищите опасные стоки: eval, вызовы shell на вход инструмента, десериализацию.
  • Запускайте в песочнице и не открывайте на все сетевые интерфейсы — 81% серверов работают вообще без изоляции.
  • Убедитесь, что авторизация реально включена: почти каждый третий сервер с заявленной авторизацией отдавал полный список инструментов анониму.
  • Прочитайте сырые описания инструментов — нет ли там спрятанных инструкций.

Инструменты и штуки

GitHub Spec Kit. Каркас «сначала спека» для кодинг-агентов. Проводит через требования → уточнения → план → разбивку на задачи, прежде чем агент начнёт писать код. Лечит любимую болезнь вайб-кодинга — прыжок в реализацию без ТЗ. Бесплатно и открыто (github.com/github/spec-kit).

Браузер внутри Claude Code. Anthropic вынесла на десктопе браузер прямо в кодинг-агента: он в песочнице открывает доки, инспектирует сайты и прогоняет локальные сценарии приложения, не выходя из сессии. Полезно, когда агенту нужны «глаза» на живой странице. На платных тарифах Claude (детали 9to5mac).

Adaptive Recall. Постоянная память для ИИ-ассистентов через MCP. В отличие от обычного векторного поиска, гоняет четыре стратегии сразу: похожесть, свежесть, ключевые слова и обход графа знаний, плюс сама дообучается на вашем использовании. Подключается как MCP-сервер к Claude Code, Codex, Gemini CLI. Бесплатно до 500 воспоминаний, дальше от $19,99/мес (adaptiverecall.com).

ChatCut. Монтаж видео обычными словами: говорите, что вырезать, а нарезка, субтитры, графика и музыка остаются редактируемыми на настоящей таймлинии. Не «чёрный ящик», а живой проект. Бесплатный тариф, дальше $25/мес (chatcut.io).

Bono AI. Превращает один записанный разговор в посты для блога, выпуск рассылки, посты в соцсети и общий контент-план — вашим голосом. Удобно, если идей из головы много, а на упаковку нет времени. Бесплатно, дальше $30/мес (heybono.ai).

Palmier Pro. Видеоредактор для Mac, которым рулят агенты. Через MCP и Claude Desktop они делают мультикамерную склейку, ведут несколько таймлайнов и запускают полностью автоматический экспорт проекта — живой пример агента, управляющего десктопным приложением. Платный, по кредитам, репозиторий открыт (github.com/palmier-io/palmier-pro).

Stable Audio 3 Small. Открытые модели Stability AI для звука — отдельно под музыку и под звуковые эффекты. Латентная диффузия генерит и дообучается на бытовом железе меньше чем за 2 секунды, веса лежат на Hugging Face. Хороший локальный движок озвучки под ролики (модель на HF).

Railway Agent. Агент деплоя и кода теперь работает прямо из Slack и Discord, а через CLI можно рулить доступом агента к рабочему пространству. Меньше жизни в дашборде, больше — в чате, где вы и так сидите (changelog Railway).

CodeQL 2.26 — детектор промпт-инъекций. Сканер кода от GitHub научился ловить промпт-инъекции в потоках данных JavaScript и TypeScript, которые утекают в SDK OpenAI, Anthropic и Google GenAI. Полезно всем, кто пишет агентов и боится чужого текста в контексте. Бесплатно (changelog GitHub).

Framer AI-агент. Проектирует и правит сайт прямо на холсте в реальном времени, а запустить изменение можно из Slack или GitHub. Для тех, кому нужен быстрый лендинг без ковыряния в коде (framer.com).

Новости и тренды

Anthropic продлила бесплатный Fable 5 до 19 июля. Бесплатный доступ к топ-модели Fable 5 и повышенные на 50% недельные лимиты Claude Code должны были кончиться 13 июля — их сдвинули на 19-е. С 20 июля Fable 5 начнёт списываться с платных кредитов (support.claude.com).

Что это значит: у вас есть неделя, чтобы бесплатно обкатать самую сильную модель на действительно сложных задачах. Учтите, что Fable 5 жрёт лимит быстрее Opus и Sonnet, — берегите его под тяжёлое.

Ирландия: дата-центры съедают 23% электричества страны. По данным статслужбы, серверные фермы в 2025-м забрали почти четверть всей электроэнергии — против 5% в 2015-м. Это больше, чем потребляют все городские домохозяйства страны. Рост случился даже при заморозке новых подключений в Дублине (The Register).

Что это значит: бум ИИ упирается не в алгоритмы, а в физику — розетки и провода. Компьют всё заметнее конкурирует с обычными людьми за одну и ту же сеть.

ИИ разгоняет карьеру учёного, но сужает саму науку. Исследование в Nature на 41,3 млн статей: те, кто применяет ИИ, публикуют втрое больше, собирают впятеро больше цитат и раньше на 1–2 года становятся руководителями. Но их работы жмутся к узкому пятну — популярным задачам с обилием данных, где ИИ силён. Трудные, «безданные» рубежи остаются неисследованными (IEEE Spectrum).

Что это значит: ИИ незаметно ведёт вас к уже протоптанным ответам, к которым сходятся все. Странные, неудобные вопросы придётся задавать себе самому — их модель не подскажет.

Годовые цитирования на исследователя с ИИ-инструментами и без, по областям науки: у пользователей ИИ разрыв кратный — данные исследования в Nature
Годовые цитирования на исследователя с ИИ-инструментами и без, по областям науки: у пользователей ИИ разрыв кратный — данные исследования в Nature

Hacker News голосует за метку «сделано ИИ». Обсуждение с предложением помечать ИИ-статьи собрало 480 голосов и стало топом дня. Люди устали от потока машинного «слопа» и хотят видеть, что писал человек (тред на HN).

Что это значит: доверие смещается к «человеческому», а маркировка ИИ-контента из требования регуляторов превращается в запрос самой аудитории. Авторам стоит помечать честно — это станет плюсом, а не минусом.

Волна человекоподобных роботов. За неделю показали сразу пачку: китайский Moya с силиконовой кожей 32–36 °C и походкой на 92% «человеческой» (старт ~$173 тыс.), новые ловкие руки 1X NEO (застёгивает куртку, наливает чай, крутит лампочку), поющую Annie, ретроспективы Figure и Atlas (роундап The Neuron).

Что это значит: главный прорыв не в лице, а в руках — ловкость важнее мимики. Телесный ИИ подбирается к быту быстрее, чем кажется по заголовкам.

Человекоподобный робот Moya от DroidUp на презентации в Шанхае: силиконовая кожа и «человеческая» мимика
Человекоподобный робот Moya от DroidUp на презентации в Шанхае: силиконовая кожа и «человеческая» мимика

Stanford Biomni — агент-биолог. Стэнфорд показал биомедицинского со-учёного: агент читает литературу, сам выбирает инструменты и наборы данных, пишет код, толкует результаты и предлагает эксперименты (Biomni, Stanford). Что это значит: агенты заходят не только в код, но и в науку — как черновой ассистент исследователя.

ИИ нашёл баг в Ethereum, но доказывали люди. Агенты обнаружили уязвимость, способную положить валидаторов сети, — но проверить, доказать и пропатчить пришлось людям (CoinDesk). Что это значит: ИИ хорош в поиске зацепок, но подпись под серьёзной находкой пока ставит человек.

Откомментируйте первым 👇

😎

Автор поста открыл его для большого интернета, но комментирование и движухи доступны только участникам Клуба

Что вообще здесь происходит?


Войти  или  Вступить в Клуб