Fable-дирижёр за 46% цены, НДС-декларация за $2,73 и ChatGPT, проглотивший Codex  Публичный пост

10 июля 2026  191

Квартальную налоговую декларацию собрала открытая модель. Шестьдесят восемь минут работы, $2,73 на токены, расхождение с людьми — семь пенсов. Бухгалтерская фирма берёт за ту же работу от £750. А рядом — приём, который режет счёт за Fable больше чем вдвое: умная модель думает, дешёвые делают грязную работу.

Главное за 30 секунд

  • Anthropic показала два приёма: Fable планирует, дешёвая модель пашет — 92–96% качества за 46–63% цены.
  • Открытая GLM 5.2 сделала квартальную НДС-декларацию за 68 минут и $2,73, ошибившись на семь пенсов.
  • OpenAI выпустила GPT-5.6, влила Codex в приложение ChatGPT и начала сворачивать браузер Atlas.
  • Cloudflare открыла скилл, которым просканировала 128 репозиториев и передала командам 7245 находок.
  • Каждый четвёртый длинный пост в соцсетях написан ИИ, а на LinkedIn таких сорок процентов.

Внедряем и улучшаем

Пусть Fable думает, а работают дешёвые модели. Anthropic выложила два приёма, где умная модель остаётся главной, но не тратит себя на рутину (документация Anthropic). Гонять самую сильную модель на каждый токен — всё равно что звать директора править ячейки в таблице.

Первый приём — советник. Задачу делает Sonnet, а Fable зовут только за стратегией и когда надо поправить курс. Советник видит весь разговор и возвращает рекомендацию исполнителю. На бенчмарке SWE-bench Pro пара выдала около 92% от результата одного Fable, потратив примерно 63% денег.

Второй приём — дирижёр. Fable строит план и раздаёт куски работы субагентам на Sonnet. Готовый рецепт лежит в кукбуке Anthropic под именем «планируй крупно, исполняй мелко» (claude-cookbooks). На BrowseComp это дало 96% результата за 46% цены. У каждого субагента свой кэш, поэтому повторные вызовы не переплачивают за контекст.

Когда что брать. Советник — если задача одна и сложная, но иногда сбивается с курса. Дирижёр — если работу можно разрезать на куски и раздать.

Готовый промпт для дирижёра:

Act as the lead planner. Break this task into clear work packages.
Delegate routine, token-heavy execution to lower-cost workers.
Keep strategic decisions, quality checks, and course corrections for yourself.
Review each worker's result before producing the final answer.

Task: [PASTE TASK]

The Rundown приводит ту же идею как пошаговый рецепт и обещает экономию до 60% токенов Fable (The Rundown). Обещание — их, проверяйте на своих задачах. Механика такая. Ставите в Claude Code плагин Codex и отдаёте ему код, работу с браузером и сбор данных. Планирование и финальную проверку оставляете Fable.

Команды установки плагина (openai/codex-plugin-cc):

/plugin marketplace add openai/codex-plugin-cc
/plugin install codex@openai-codex
/reload-plugins
/codex:setup

Плагина Codex нет? Тогда запустите Claude Code в терминале, выберите работягу подешевле через /model, а Fable назначьте советником через скилл /advisor. Главное правило: не пускайте Fable в рутинные повторы. Ему — план, рискованные решения и финальная проверка.

Установка плагина Codex в Claude Code: команды /plugin marketplace add и /plugin install
Установка плагина Codex в Claude Code: команды /plugin marketplace add и /plugin install

Cloudflare открыла свой скилл для поиска уязвимостей. Компания рассказала, как один скилл на 450 строк вырос в систему, которая за шесть недель стала сканировать 128 репозиториев (блог Cloudflare). Сам скилл выложили открыто (cloudflare/security-audit-skill).

Главный тезис авторов идёт против моды на выбор модели. Дословно: «Наш подход строится вокруг обвязки, а не вокруг модели. Обвязка — это то, что остаётся». Поэтому поиск багов гоняют на одной модели, а проверку находок — на другой. Модели перекрёстно проверяют друг друга, и ни одна не ставит оценку сама себе.

Скилл работает в шесть фаз. Три параллельных агента-разведчика описывают архитектуру. Дальше по агенту на класс атаки — их задача сломать код, а не «проверить». Потом валидаторы пытаются опровергнуть каждую находку. Затем отчёт, машинная проверка схемы и независимая перепроверка свежим агентом.

Три правила против мусорных находок стоит забрать себе целиком. Первое: агент обязан заявить модель угрозы до подачи находки — кто атакующий и какую границу он пересекает. Это убивает пустышки вроде «если у пользователя есть доступ на запись в базу, он может писать в базу». Второе: без рабочего доказательства находка считается выдуманной. Третье: валидатор не имеет права заводить свои находки.

Цифры отрезвляют. Из 20 799 сырых кандидатов до людей дошли 7245. Критических среди них 41. Когда агентам стали лучше подавать контекст разведки, доля отклонённых на первой проверке упала с 40% до 11%. Контекст каждого агента держат ниже 25% окна — «наивный подход „прочитай все файлы“ пробьёт этот лимит всегда».

Отдельная деталь для тех, кто строит агентов. Cloudflare подключила статический анализатор Semgrep, и за месяц агенты не вызвали его ни разу — они предпочитали читать и запускать код. Смотрите, чем агенты пользуются на самом деле, а не что вы им приготовили.

Воронка Cloudflare: 20 799 сырых находок превращаются в 7245 багов для команд
Воронка Cloudflare: 20 799 сырых находок превращаются в 7245 багов для команд

Секунда на ответ: как собрать агента реального времени. Компания Ello делает голосового репетитора для детей 4–9 лет и разобрала свою архитектуру (блог Ello). Ограничение жёсткое: меньше секунды на реплику. Пауза в две секунды — и ребёнок отвлёкся.

Обычный цикл агента в этот бюджет не влезает. Передовые модели отдают первый токен за 2–3 секунды, дальше печатают около 30 токенов в секунду. Каждое действие — несколько десятков токенов. Итого 3–4 секунды тишины между репликами.

Решение — разделить генерацию и исполнение. Модель в одном ответе выдаёт поток действий. Отдельная программа разбирает и выполняет каждое действие, пока модель ещё печатает следующие. Ребёнок ждёт не весь ответ, а только первое действие — примерно тридцать токенов.

Из этого разделения выпадают ещё две выгоды. Набор доступных действий можно менять на лету: когда на экране вопрос, агенту дают подсказки, а не готовый ответ. И проверка безопасности перестаёт стоить времени.

Приём с безопасностью стоит забрать отдельно. Классификатор безопасности — тоже модель, он думает 500–1000 мс. Ждать его перед стартом нельзя. Поэтому его запускают параллельно с маленькой быстрой моделью, которая выдаёт первую реплику-отражение вроде «тебе нравятся динозавры! мне тоже». Пока реплика генерируется, классификатор обычно уже ответил. Проверка сдерживает исполнение, а не генерацию.

Ещё два приёма. Планировщик работает на дорогой модели асинхронно — пока ребёнок думает или говорит. И на закрытых вопросах обвязка заранее угадывает вероятные ответы и генерит реакцию на каждый. Ребёнок отвечает — система просто подбирает готовую ветку.

Вывод авторов честный. Своя обвязка означает свой мониторинг и свою трассировку вместо готового фреймворка. Они и спроектировали её так, чтобы выкинуть, когда модели станут быстрее.

Обычный цикл агента против потокового: 3,3 секунды тишины против 2,7 и непрерывной речи
Обычный цикл агента против потокового: 3,3 секунды тишины против 2,7 и непрерывной речи

Бухгалтерия за $2,73. Открытая GLM 5.2 собрала квартальную НДС-декларацию британской компании: 59 транзакций, 68 минут, $2,73 на токены (Toot Books). Главное число декларации разошлось с работой двух живых бухгалтеров на семь пенсов. Бухгалтерская фирма берёт за такой квартал £750–2100.

Обвязка до смешного простая. Модели дали два инструмента: bash и «закончить сессию с отчётом». Транзакции она заносила через готовый CLI бухгалтерской программы. Каждый месяц — одна непрерывная сессия агента. Человека в цикле не было.

Секрет дешевизны — кэш. История диалога пересылается каждый ход, поэтому счёт идёт на миллионы входных токенов. Но 92–95% из них берутся из кэша провайдера по одной пятой цены. Отсюда $2,73 за 5,73 млн входных токенов.

Что модель сделала не так — это важнее успеха. Из 354 проверок провалено 20. Одна ошибка серьёзная: уплату уставного капитала на £10 000 она провела не на тот счёт. На НДС это не влияет, но всплывёт при годовой отчётности. Ещё четырнадцать раз она путала «нулевую ставку» и «освобождение от НДС» — денежного эффекта нет, но живой бухгалтер так не ошибается.

Автор блога продаёт продукт для автоматического бухучёта, так что скидку на энтузиазм делайте. Но рецепт воспроизводимый: открытая модель у дешёвого провайдера с кэшем, агентная обвязка с доступом к CLI, чеки текстовыми PDF. Узкое место теперь не ум модели, а обвязка вокруг неё.

Поменять закрытые модели на открытые: $60 тысяч в месяц превратились в $12 тысяч. Sam Hogan выложил таблицу замен, на которую перевёл клиента, — экономия 80%. Замены подбирали не на глаз, а прогнали свои проверки. Опубликовано это твитом, поэтому проверки чужие и непрозрачные — берите как гипотезу, а не как истину.

Логика замен простая. Уровень GPT-5.5 и Opus закрывают GLM 5.2 Max и MiMo V2.5 Pro. Уровень Sonnet — Kimi K2.6. Мелочь вроде Haiku и Nano — DeepSeek V4 Flash и Gemma 4. Экономия по строкам от 66% до 99%.

Если у вас есть повторяющийся поток задач на API — это первое, что стоит посчитать. Соберите двадцать типовых запросов, прогоните на открытой модели, сравните ответы. Дальше решайте по цифрам, а не по названию лаборатории.

Таблица замен закрытых моделей открытыми: экономия от 66% до 99%
Таблица замен закрытых моделей открытыми: экономия от 66% до 99%

GPT-5.6 против Fable на живых задачах. Peter Yang прогнал обе модели через шесть практических сценариев (Creator Economy). В бесплатной части доступен первый: интерактивный сайт-путеводитель по Японии. Остальное за платной подпиской — не выдумываем, чего не читали.

Вердикт по первому сценарию: ничья. GPT-5.6 закрыл своё старое отставание в дизайне веб-интерфейса. Он нарисовал анимированные ворота-тории, Fable — снежинки в зимней сцене. Прошлый GPT-5.5 на том же промпте запорол трёхмерную заставку.

Забирайте приём из промпта: просите добавить трёхмерный элемент в шапку. Дословно:

Build a beautiful interactive travel website for my Japan itinerary Google Doc.
Organize it by day. For each day, include the date, area, activities, and dinner
plans, plus images for major attractions. Make it feel like a real travel catalog
that I can share with my family. Add a 3D WebGL element to the hero so it looks
more immersive and animated.

Из цифр: на бенчмарке по программированию TerminalBench 2.1 у Sol 88,8% против 84,3% у Fable 5.

LinkedIn утонул в машинном тексте. Расширение Pangram просканировало миллион постов и посчитало долю ИИ-текста (Pangram). Каждый четвёртый длинный пост помечен как полностью машинный — 25,7%. На LinkedIn таких уже 41%. В среднем по всем сканам ИИ-текста 13,8%.

Цифру про «62% с LinkedIn» часто пересказывают неверно. Это не доля ИИ внутри LinkedIn. Это доля LinkedIn среди всех срабатываний по всем площадкам. Сам LinkedIn дал лишь треть сканов.

Любопытен контраст с Reddit. Там ответы почти целиком человеческие — 98,1%. А вот верхние посты Reddit машинные в 11,6% случаев. Вывод авторов: под настоящим именем в рабочем контексте люди спокойно доверяют речь ИИ. На анонимных площадках — куда реже.

Достоверность держите под сомнением. Pangram продаёт детектор ИИ. Выборка собрана из тех, кто сам поставил расширение, а долю пропущенных текстов компания не раскрывает. Порядок величин правдоподобен, точные проценты — маркетинг.

Что с этим делать пишущему человеку. Гладкий безличный текст теперь читается как машинный и людьми, и алгоритмами. Спасают конкретика, цифры из своей практики, живой неровный ритм и внятное мнение. LinkedIn обещает понижать машинные посты в выдаче — ещё повод не публиковать сырой вывод модели.

Экономика верхнего процента. Rowan Cheung пересказывает мысль фотографа Питера Хёрли студентам: не обойдёте ИИ в портретной съёмке — вас не наймут (The Rundown). Приложения уже снимают достаточно хорошо для большинства.

Дальше вывод, который стоит примерить на себя. Круг людей, готовых платить человеку, сужается — но весь их спрос стекается наверх. Поиск через ИИ ускоряет это: в Google пятнадцатое место ещё приносило заказы, а чат-бот называет один ответ. Вопрос на сегодня простой: что вы делаете, чтобы оказаться в этом верхнем проценте.

Инструменты и штуки

ChatGPT Work. Рабочий агент OpenAI на GPT-5.6, ответ на Claude Cowork (OpenAI). Ведёт проект часами, сам разбивает его на шаги и выдаёт готовые таблицы, слайды, документы и сайты. Подключается к Slack, Teams, Google Drive, почте и календарям — вызов через «@» и имя приложения. Есть встроенный браузер и управление компьютером. Выкатка началась с тарифов Pro, Enterprise и Edu; настольное приложение дали всем, включая бесплатный тариф.

Muse Spark 1.1 (Meta). Мультимодальная модель под агентные задачи: контекст на миллион токенов, управление компьютером, раздача работы параллельным субагентам (Meta). Доступна через новый Meta Model API в раннем доступе. Важная оговорка: цен на официальной странице нет вовсе. Цифры $1,25 и $4,25 за миллион токенов и $20 стартовых кредитов идут из репортажа CNBC (CNBC), а не от Meta.

Claude Reflect. Приватные отчёты о том, как вы на самом деле пользуетесь Claude (Anthropic). Показывает срезы за 1, 3, 6 и 12 месяцев и привязывает привычки к рамке ИИ-грамотности. Заодно подсказывает, какие скиллы завести. Пока бета. Полезно тем, кто хочет увидеть свои реальные привычки работы, а не воображаемые.

Colibrì. Движок на чистом C, который запускает GLM-5.2 на 744 миллиарда параметров на обычном ноутбуке с 25 ГБ памяти (GitHub). Хитрость в том, что модель почти вся лежит на диске. В памяти висит только плотная часть на 9,9 ГБ, а нужных экспертов движок подтягивает с диска на каждый токен. Скорость честно низкая — от 0,05 до 1,06 токена в секунду в зависимости от железа. Apache-2.0, 1504 звезды. Автор прямо пишет: «Это не быстро. Это модель уровня передовых, отвечающая верно на машине дешевле одного вентилятора от H100».

Gemma 4 12B QAT. Официальная четырёхбитная сборка средней модели Google (Hugging Face). Контекст 256 тысяч токенов, на вход идут текст, картинки и звук. QAT означает, что квантизацию не навесили в конце, а обучали модель сразу жить в четырёх битах. Качество близко к полновесной версии, а памяти нужно вчетверо меньше. По MMLU Pro даёт 77,2% — обгоняя даже вдвое более крупную Gemma 3 прошлого поколения. Лицензия Apache 2.0, бесплатно.

RWKV7-G1 «GooseOne». Модель на чистой рекуррентной сети, а не на трансформере (Hugging Face). Практическая разница вот в чём. У трансформера память и время на токен растут вместе с длиной диалога — а здесь скрытое состояние фиксированного размера. Скорость и расход видеопамяти не зависят от длины контекста. Версия на 7,2 миллиарда параметров выдаёт 145 токенов в секунду на RTX 5090. Плата за это — модель хуже вспоминает конкретную деталь из далёкого прошлого разговора. Apache 2.0.

FableCut. Браузерный видеоредактор в стиле Premiere, у которого весь монтажный стол — это один файл JSON (GitHub). Любой агент, умеющий писать JSON, монтирует видео, а открытый редактор перерисовывается за 150 мс. Внутри 12 фильтров, 17 переходов, анализ ритма эталонного ролика и MCP-сервер для Claude Code. Ставится одной командой node server.js, зависимостей нет. MIT, 277 звёзд, проекту несколько дней — соответственно, сырой.

Интерфейс FableCut: монтажный стол, которым управляет агент через JSON
Интерфейс FableCut: монтажный стол, которым управляет агент через JSON

Context.dev. Платный API, который превращает любой сайт в удобный для модели формат (context.dev). На выходе — чистый Markdown, структурированный JSON по вашей схеме, логотипы и фирменные цвета бренда. Обход защит и выполнение JavaScript включены в базовую цену без наценки. Дают 500 бесплатных кредитов без карты, дальше от $25 в месяц за 10 тысяч страниц. Полезно тем, кто наполняет базу знаний для чат-бота или обогащает CRM.

Reve 2.1. Генератор картинок с родным разрешением 4K и правкой отдельных элементов изображения (Reve). Вернулся на второе место в общем зачёте Arena, причём обучен, по заявлению команды, на менее чем десятой доле вычислений конкурентов.

OpenKnowledge. Локальное рабочее пространство на markdown, где люди и агенты вместе правят базу знаний (openknowledge.ai). Есть совместное редактирование в реальном времени, подключение MCP, обмен через git, скиллы для агентов и поиск по заметкам. Заходит тем, кто держит вторую память в файлах, а не в чужом облаке.

PromptQL. Рабочее пространство, снаружи похожее на Slack, но каждый разговор в нём становится памятью для ИИ (promptql.io). На вопрос оно не пересказывает старые треды, а тянет живые данные из Snowflake или Salesforce и показывает источник ответа. Среди клиентов называют Instacart, McDonald's и Cisco. Заявление «подняли $136 млн, чтобы убить Slack» стоит воспринимать осторожно. Сумма подозрительно совпадает со всем прошлым финансированием их же материнской Hasura (разбор NeatPrompts).

Cpp2Rust. Инструмент, автоматически переводящий код C++ в безопасный Rust (GitHub). Работает поверх дерева разбора clang, по умолчанию генерит гарантированно безопасный код за счёт подсчёта ссылок и проверок во время работы. За безопасность платите скоростью — для сравнения есть режим --model=unsafe. MIT, за инструментом стоит статья с конференции PLDI 2026.

Новости и тренды

GPT-5.6: три модели вместо одной. OpenAI выпустила поколение из флагмана Sol, сбалансированной Terra и дешёвой Luna (OpenAI). Цены за миллион токенов: Sol $5 на входе и $30 на выходе, Terra $2,50 и $15, Luna $1 и $6. Режим Ultra по умолчанию запускает четырёх агентов параллельно.

По бенчмаркам паритет, а не разгром. На индексе интеллекта Artificial Analysis у Sol 58,9 против 59,9 у Fable 5. На агентном программировании Sol впереди: 80 против 77,2. Зато на SWE-Bench Pro лидируют модели Anthropic — 80,3 и 80,0 против 64,6 у Sol. Кстати, ходивший по рассылкам тезис «Sol сам дообучил Luna» на официальной странице не подтверждается.

Что это значит: покупают теперь не ум, а соотношение ума и цены. Fable держит корону в сложном коде, но за неё придётся доплачивать.

Codex переехал внутрь ChatGPT, Atlas сворачивают. Приложение Codex слилось с новым настольным ChatGPT, а отдельный браузер Atlas начали закрывать (OpenAI). Старое приложение переименовали в ChatGPT Classic. Путаница вышла знатная: и Итан Моллик, и Саймон Уиллисон публично написали, что не понимают разницу между ChatGPT Work и Codex.

Что это значит: OpenAI собирает суперприложение и готова сжечь бренд Codex ради узнаваемости ChatGPT. Пользователям сфокусированного инструмента придётся привыкать к комбайну.

Meta вышла в ценовую войну. Muse Spark 1.1 стоит примерно вчетверо дешевле ведущих конкурентов, а Цукерберг обещает подрезать их «крайне высокие» маржи. Рядом глава Palo Alto Networks заявляет, что цена ИИ-токенов должна упасть процентов на девяносто (CNBC). Что это значит: модельный слой превращается в биржевой товар. Если вы строите бизнес на чужом API, закладывайте смену поставщика как обычную операцию, а не как катастрофу.

NYT обвинил OpenAI в сокрытии улик. Издатели подали ходатайство о санкциях (Ars Technica). По их версии, OpenAI два года притворялся, будто технически не может искать по логам ChatGPT. При этом сам искал там материалы NYT, когда строил фильтр против дословного воспроизведения статей.

Выборку в 20 млн логов, отданную истцам, компания залила 19 миллиардами машинных вымарок. Суд признал её непригодной. OpenAI отвечает, что это поздняя попытка залезть в приватные данные пользователей, и напоминает про добросовестное использование. Что это значит: исход спора о вреде рынку решит судьбу обучения на защищённых текстах.

Издатели готовятся уйти из поиска Google. С 15 сентября Cloudflare по умолчанию заблокирует «многоцелевых роботов-сборщиков» на страницах с рекламой (Adweek). Правило коснётся новых сайтов и бесплатных тарифов. Мишень не названа, но это Google: компания одним и тем же роботом наполняет поисковый индекс и учит свои модели.

USA Today говорит, что готова уйти из поиска за 6–12 месяцев. Что это значит: сайты перестают быть бесплатным сырьём. Если вы живёте на поисковом трафике, следите за этим — правила раздачи контента меняются на глазах.

Бен Бернанке вошёл в надзорный траст Anthropic. Экс-глава ФРС и нобелевский лауреат по экономике 2022 года стал попечителем Long-Term Benefit Trust (Anthropic). У траста есть реальные полномочия: он вправе назначать членов совета директоров компании. Что это значит: Anthropic готовится отвечать на вопросы про влияние ИИ на занятость не пресс-релизами, а экономическим аппаратом.

AI 2040: сценарий, а не прогноз. Авторы мрачного AI 2027 выпустили противоположную работу — как пройти появление сверхразума без катастрофы (LessWrong). Рецепт из пяти шагов. Отложить сверхинтеллект до 2040 года, сделать разработку прозрачной, помирить США и Китай, ввести сборы за вычисления и платить людям «дивиденд гражданина». В модели он вырастает до миллиона долларов на человека в год к 2035-му.

Авторы честно называют это рекомендацией, а не предсказанием. Ричард Нго, год консультировавший их же проект, разносит работу по трём пунктам (критика). Она смешивает прогноз с пожеланием. Она принимает вражду США и Китая как данность, а это самосбывающееся пророчество. И она слишком верит в резкий скачок способностей.

Что это значит: читайте как продуманную позицию в споре, а не как карту будущего. Команда системно ставит слишком ранние сроки — Даниэль Кокотайло уже сам сдвинул свою медиану.

Рост мировых вычислений в сценарии AI 2040: с 20 млн до 40 млрд эквивалентов H100
Рост мировых вычислений в сценарии AI 2040: с 20 млн до 40 млрд эквивалентов H100

Стройку дата-центров тормозят люди на местах. За один квартал в США заблокировали или отложили проекты более чем на $130 млрд из-за протестов вокруг воды и электричества (OilPrice). Что это значит: у бума появился физический потолок, и он не про чипы.

Профессор поймал полкурса на списывании. Экономист из Университета Брауна дал домашний экзамен и очный финал. Средний балл упал с 96 до 48. Из 27 студентов, бросивших курс или не пришедших на финал, у 22 были идеальные домашние работы (The Next Web).

Коротко о прочем. SambaNova подняла $1 млрд при оценке $11 млрд и думает про биржу в 2027-м (CNBC). OpenAI купила Northslope и получила сотни инженеров внедрения (The Next Web). Prime Intellect привлекла $130 млн на открытый стек обучения моделей (Prime Intellect). Регулятор NHTSA потребовал от робо-такси прекратить мешать пожарным и скорым (The Independent). Комитеты по влиянию на ИИ-регулирование собрали более $200 млн (CNBC).

Откомментируйте первым 👇

😎

Автор поста открыл его для большого интернета, но комментирование и движухи доступны только участникам Клуба

Что вообще здесь происходит?


Войти  или  Вступить в Клуб