Открытая модель сама собрала квартальную налоговую декларацию: 68 минут работы, $2,73 на токены, расхождение с живыми бухгалтерами — семь пенсов. Бухгалтерская фирма берёт за то же самое от £750. А ещё сегодня разберём приём, который вдвое режет счёт за Fable: умная модель думает, дешёвые — пашут.
Главное за 30 секунд
- Anthropic показала два приёма: Fable планирует, дешёвая модель выполняет — 92–96% качества за 46–63% цены.
- Открытая GLM 5.2 сделала квартальную НДС-декларацию за 68 минут и $2,73, ошибившись на семь пенсов.
- OpenAI выпустила GPT-5.6, влила Codex в приложение ChatGPT и начала сворачивать браузер Atlas.
- Cloudflare открыла скилл, которым просканировала 128 репозиториев и завела 7245 подтверждённых багов.
- Каждый четвёртый длинный пост в соцсетях написан ИИ, а на LinkedIn таких сорок процентов.
Внедряем и улучшаем
Fable думает, дешёвые модели работают. Anthropic выложила два паттерна, где сильная модель остаётся главной, но не расходует себя на рутину (документация Anthropic). Гонять топовую модель на каждый токен — всё равно что звать директора править ячейки в таблице.
Первый приём — советник. Задачу делает Sonnet, а Fable подключают только за стратегией и когда надо поправить курс. Советник видит весь разговор и возвращает рекомендацию исполнителю. На бенчмарке SWE-bench Pro пара выдала около 92% от результата одного Fable, потратив примерно 63% денег.
Второй приём — дирижёр. Fable строит план и раздаёт куски работы субагентам на Sonnet. Готовый рецепт лежит в кукбуке Anthropic под именем «планируй крупно, исполняй мелко» (claude-cookbooks). На BrowseComp это дало 96% результата за 46% цены. У каждого субагента свой кэш, поэтому повторные вызовы не переплачивают за контекст.
Что когда брать. Советник — если задача одна и сложная, но временами сбивается с курса. Дирижёр — если работу можно разрезать на куски и раздать.
Готовый промпт для дирижёра:
Act as the lead planner. Break this task into clear work packages.
Delegate routine, token-heavy execution to lower-cost workers.
Keep strategic decisions, quality checks, and course corrections for yourself.
Review each worker's result before producing the final answer.
Task: [PASTE TASK]
The Rundown подаёт ту же идею как пошаговый рецепт и обещает экономию до 60% токенов Fable (The Rundown). Обещание — их, проверяйте на своих задачах. Механика простая: ставите в Claude Code плагин Codex, отдаёте ему код, браузинг и извлечение данных, а планирование и финальную проверку оставляете Fable.
Команды установки плагина (openai/codex-plugin-cc):
/plugin marketplace add openai/codex-plugin-cc
/plugin install codex@openai-codex
/reload-plugins
/codex:setup
Плагина Codex нет? Тогда запустите Claude Code в терминале, выберите работягу подешевле через /model, а Fable назначьте советником через скилл /advisor. Главное правило: не пускайте Fable в рутинные повторы. Ему — план, рискованные решения и финальная проверка.

Cloudflare открыла свой скилл для поиска уязвимостей. Компания рассказала, как один скилл на 450 строк вырос в систему, которая за шесть недель стала сканировать 128 репозиториев (блог Cloudflare). Сам скилл выложили открыто (cloudflare/security-audit-skill).
Главный тезис авторов идёт против моды на выбор модели. Дословно: «Наш подход строится вокруг обвязки, а не вокруг модели. Обвязка — это то, что остаётся». Поэтому поиск багов гоняют на одной модели, а проверку находок — на другой. Модели перекрёстно проверяют друг друга, и ни одна не ставит оценку сама себе.
Скилл работает в шесть фаз. Три параллельных агента-разведчика описывают архитектуру. Дальше по агенту на класс атаки — их задача сломать код, а не «отревьюить». Потом валидаторы пытаются опровергнуть каждую находку. Затем отчёт, машинная проверка схемы и независимая перепроверка свежим агентом.
Три правила против мусорных находок стоит забрать себе целиком. Первое: агент обязан заявить модель угрозы до подачи находки — кто атакующий и какую границу он пересекает. Это убивает пустышки вроде «если у пользователя есть доступ на запись в базу, он может писать в базу». Второе: без рабочего доказательства находка считается выдуманной. Третье: валидатор не имеет права заводить свои находки.
Цифры отрезвляют. Из 20 799 сырых кандидатов до людей дошли 7245. Критических среди них 41. Когда агентам стали лучше подавать контекст разведки, доля отклонённых на первой проверке упала с 40% до 11%. Контекст каждого агента держат ниже 25% окна — «наивный подход „прочитай все файлы“ пробьёт этот лимит всегда».
Отдельная деталь для тех, кто строит агентов. Cloudflare подключила статический анализатор Semgrep — и за месяц агенты не вызвали его ни разу: предпочитали читать и запускать код. Смотрите, чем агенты пользуются на самом деле, а не что вы им приготовили.

Секунда на ответ: как собрать реалтайм-агента. Компания Ello делает голосового репетитора для детей 4–9 лет и разобрала свою архитектуру (блог Ello). Ограничение жёсткое: меньше секунды на реплику. Пауза в две секунды — и ребёнок отвлёкся.
Обычный цикл агента в этот бюджет не влезает. Передовые модели отдают первый токен за 2–3 секунды, дальше печатают около 30 токенов в секунду. Каждое действие — несколько десятков токенов. Итого 3–4 секунды тишины между репликами.
Решение — разделить генерацию и исполнение. Модель в одном ответе выдаёт поток действий. Отдельная программа разбирает и выполняет каждое действие, пока модель ещё печатает следующие. Ребёнок ждёт не весь ответ, а только первое действие — примерно тридцать токенов.
Из этого разделения выпадают ещё две выгоды. Набор доступных действий можно менять на лету: когда на экране вопрос, агенту дают подсказки, а не готовый ответ. И проверка безопасности перестаёт стоить времени.
Приём с безопасностью стоит забрать отдельно. Классификатор безопасности — тоже модель, он думает 500–1000 мс. Ждать его перед стартом нельзя. Поэтому его запускают параллельно с маленькой быстрой моделью, которая выдаёт первую реплику-отражение вроде «тебе нравятся динозавры! мне тоже». Пока реплика генерируется, классификатор обычно уже ответил. Проверка гейтит исполнение, а не генерацию.
Ещё два приёма. Планировщик работает на дорогой модели асинхронно — пока ребёнок думает или говорит. А на закрытых вопросах обвязка заранее угадывает вероятные ответы и генерит реакцию на каждый. Ребёнок отвечает — система просто подбирает готовую ветку.
Вывод авторов честный. Своя обвязка означает свой мониторинг и свою трассировку вместо готового фреймворка. Они и спроектировали её так, чтобы выкинуть, когда модели станут быстрее.

Бухгалтерия за $2,73. Открытая GLM 5.2 собрала квартальную НДС-декларацию британской компании: 59 транзакций, 68 минут, $2,73 на токены (Toot Books). Главное число декларации разошлось с работой двух живых бухгалтеров на семь пенсов. Бухгалтерская фирма берёт за такой квартал £750–2100.
Обвязка до смешного простая. Модели дали два инструмента: bash и «закончить сессию с отчётом». Транзакции она заносила через готовый CLI бухгалтерской программы. Каждый месяц — одна непрерывная сессия агента, человека в цикле не было.
Секрет дешевизны — кэш. История диалога пересылается каждый ход, поэтому счёт идёт на миллионы входных токенов. Но 92–95% из них берутся из кэша провайдера по одной пятой цены. Отсюда $2,73 за 5,73 млн входных токенов.
Что модель сделала не так — это важнее успеха. Из 354 проверок провалено 20. Одна ошибка серьёзная: уплату уставного капитала на £10 000 она провела не на тот счёт. На НДС это не влияет, но всплывёт при годовой отчётности. Ещё четырнадцать раз она путала «нулевую ставку» и «освобождение от НДС» — денежного эффекта нет, но живой бухгалтер так не ошибается.
Автор блога продаёт продукт для автоматического бухучёта, так что скидку на энтузиазм делайте. Но рецепт воспроизводимый: открытая модель у дешёвого провайдера с кэшем, агентная обвязка с доступом к CLI, чеки текстовыми PDF. Узкое место теперь не ум модели, а обвязка вокруг неё.
Замена закрытых моделей открытыми: $60 тысяч в месяц превратились в $12 тысяч. Sam Hogan выложил таблицу замен, на которую перевёл клиента, — экономия 80%. Замены подбирали не на глаз, а прогнали свои проверки. Опубликовано это твитом, поэтому проверки чужие и непрозрачные — берите как гипотезу, а не как истину.
Логика замен простая. Уровень GPT-5.5 и Opus закрывают GLM 5.2 Max и MiMo V2.5 Pro. Уровень Sonnet — Kimi K2.6. Мелочь вроде Haiku и Nano — DeepSeek V4 Flash и Gemma 4. Экономия по строкам от 66% до 99%.
Если у вас есть повторяющийся поток задач на API — это первое, что стоит посчитать. Соберите двадцать типовых запросов, прогоните на открытой модели, сравните ответы. Дальше решайте по цифрам, а не по названию лаборатории.

GPT-5.6 против Fable на живых задачах. Peter Yang прогнал обе модели через шесть практических сценариев (Creator Economy). В бесплатной части доступен первый: интерактивный сайт-путеводитель по Японии. Остальное за платной подпиской — не выдумываем, чего не читали.
Вердикт по первому сценарию: ничья. GPT-5.6 закрыл своё старое отставание в дизайне фронтенда. Он нарисовал анимированные ворота-тории, Fable — снежинки в зимней сцене. Прошлый GPT-5.5 на том же промпте запорол трёхмерную заставку.
Забирайте приём из промпта: просите добавить трёхмерный элемент в шапку. Дословно:
Build a beautiful interactive travel website for my Japan itinerary Google Doc.
Organize it by day. For each day, include the date, area, activities, and dinner
plans, plus images for major attractions. Make it feel like a real travel catalog
that I can share with my family. Add a 3D WebGL element to the hero so it looks
more immersive and animated.
Из цифр: на кодинг-бенчмарке TerminalBench 2.1 у Sol 88,8% против 84,3% у Fable 5.
LinkedIn утонул в машинном тексте. Расширение Pangram просканировало миллион постов и посчитало долю ИИ-текста (Pangram). На LinkedIn 41% длинных постов помечены как полностью машинные. Среди всех пойманных ИИ-текстов две трети пришлись на одну эту площадку.
Цифру про «62% с LinkedIn» часто пересказывают неверно. Это не доля ИИ внутри LinkedIn. Это доля LinkedIn среди всех срабатываний по всем площадкам. Сам LinkedIn дал лишь треть сканов.
Любопытен контраст с Reddit. Там ответы почти целиком человеческие — 98,1%. А вот верхние посты Reddit машинные в 11,6% случаев. Вывод авторов: люди спокойно доверяют ИИ говорить за них под настоящим именем в профессиональном контексте и куда реже — на анонимных площадках.
Достоверность держите под сомнением. Pangram продаёт детектор ИИ, выборка собрана из тех, кто сам поставил их расширение, а долю пропущенных текстов они не публикуют вовсе. Порядок величин правдоподобен, точные проценты — маркетинг.
Что с этим делать пишущему человеку. Гладкий безличный текст теперь читается как машинный — и людьми, и алгоритмами. Спасают конкретика, цифры из своей практики, живой неровный ритм и внятное мнение. LinkedIn обещает понижать машинные посты в выдаче — ещё повод не публиковать сырой вывод модели.
Экономика верхнего процента. Rowan Cheung пересказывает мысль фотографа Питера Хёрли студентам: не обойдёте ИИ в портретной съёмке — вас не наймут (The Rundown). Приложения уже снимают достаточно хорошо для большинства.
Дальше вывод, который стоит примерить на себя. Круг людей, готовых платить человеку, сужается — но весь их спрос стекается наверх. Поиск через ИИ ускоряет это: в Google пятнадцатое место ещё приносило заказы, а чат-бот называет один ответ. Вопрос на сегодня простой: что вы делаете, чтобы оказаться в этом верхнем проценте.
Инструменты и штуки
ChatGPT Work. Рабочий агент OpenAI на GPT-5.6, ответ на Claude Cowork (OpenAI). Ведёт проект часами, сам разбивает его на шаги и выдаёт готовые таблицы, слайды, документы и сайты. Подключается к Slack, Teams, Google Drive, почте и календарям — вызов через «@» и имя приложения. Есть встроенный браузер и управление компьютером на десктопе. Раскатка началась с тарифов Pro, Enterprise и Edu; десктоп-приложение дали всем, включая бесплатный тариф.
Muse Spark 1.1 (Meta). Мультимодальная модель под агентные задачи: контекст на миллион токенов, управление компьютером, раздача работы параллельным субагентам (Meta). Доступна через новый Meta Model API в открытом превью. Важная оговорка: цен на официальной странице нет вовсе. Цифры $1,25 и $4,25 за миллион токенов и $20 стартовых кредитов идут из репортажа CNBC (CNBC), а не от Meta.
Claude Reflect. Приватные отчёты о том, как вы на самом деле пользуетесь Claude (Anthropic). Показывает срезы за 1, 3, 6 и 12 месяцев, привязывает привычки к рамке ИИ-грамотности и подсказывает, какие скиллы вам стоит завести. Пока бета. Полезно тем, кто хочет увидеть свои реальные паттерны работы, а не воображаемые.
Colibrì. Движок на чистом C, который запускает GLM-5.2 на 744 миллиарда параметров на обычном ноутбуке с 25 ГБ памяти (GitHub). Фокус в том, что модель почти вся лежит на диске: в памяти висит плотная часть на 9,9 ГБ, а нужных экспертов движок подтягивает с диска на каждый токен. Скорость честно низкая — от 0,05 до 1,06 токена в секунду в зависимости от железа. Apache-2.0, 1504 звезды. Автор прямо пишет: «Это не быстро. Это модель уровня передовых, отвечающая верно на машине дешевле одного вентилятора от H100».
Gemma 4 12B QAT. Официальная четырёхбитная сборка средней модели Google (Hugging Face). Контекст 256 тысяч токенов, на вход идут текст, картинки и звук. QAT означает, что квантизацию не навесили в конце, а обучали модель сразу жить в четырёх битах — качество остаётся близким к полновесной, а памяти нужно вчетверо меньше. По MMLU Pro даёт 77,2% и обгоняет вдвое более крупную Gemma 3 прошлого поколения. Лицензия Apache 2.0, бесплатно.
RWKV7-G1 «GooseOne». Модель на чистой рекуррентной сети, а не на трансформере (Hugging Face). Практическая разница вот в чём: у трансформера память и время на токен растут вместе с длиной диалога, а тут скрытое состояние фиксированного размера. Скорость и расход видеопамяти не зависят от длины контекста. Версия на 7,2 миллиарда параметров выдаёт 145 токенов в секунду на RTX 5090. Плата за это — модель хуже вспоминает конкретную деталь из далёкого прошлого разговора. Apache 2.0.
FableCut. Браузерный видеоредактор в стиле Premiere, у которого весь монтажный стол — это один файл JSON (GitHub). Любой агент, умеющий писать JSON, монтирует видео, а открытый редактор перерисовывается за 150 мс. Внутри 12 фильтров, 17 переходов, анализ ритма референсного ролика и MCP-сервер для Claude Code. Ставится одной командой node server.js, зависимостей нет. MIT, 277 звёзд, проекту несколько дней — соответственно, сырой.

Context.dev. Платный API, превращающий любой сайт в готовый для модели формат: чистый Markdown, структурированный JSON по вашей схеме, логотипы и фирменные цвета бренда (context.dev). Обход защит и рендеринг JavaScript включены в базовую цену без наценки. Дают 500 бесплатных кредитов без карты, дальше от $25 в месяц за 10 тысяч страниц. Полезно тем, кто наполняет базу знаний для чат-бота или обогащает CRM.
Reve 2.1. Генератор картинок с родным разрешением 4K и правкой отдельных элементов изображения (Reve). Вернулся на второе место в общем зачёте Arena, причём обучен, по заявлению команды, на менее чем десятой доле вычислений конкурентов.
OpenKnowledge. Локальное рабочее пространство на markdown, где люди и агенты вместе правят базу знаний (openknowledge.ai). Есть совместное редактирование в реальном времени, подключение MCP, обмен через git, скиллы для агентов и поиск по заметкам. Заходит тем, кто держит вторую память в файлах, а не в чужом облаке.
PromptQL. Рабочее пространство, снаружи похожее на Slack, но каждый разговор в нём становится памятью для ИИ (promptql.io). На вопрос оно не пересказывает старые треды, а тянет живые данные из Snowflake или Salesforce и показывает источник ответа. Среди клиентов называют Instacart, McDonald's и Cisco. Заявление «подняли $136 млн, чтобы убить Slack» стоит воспринимать осторожно: сумма подозрительно совпадает со всем прошлым финансированием их же материнской Hasura (разбор NeatPrompts).
Cpp2Rust. Инструмент, автоматически переводящий код C++ в безопасный Rust (GitHub). Работает поверх дерева разбора clang, по умолчанию генерит гарантированно безопасный код за счёт подсчёта ссылок и проверок во время работы. За безопасность платите скоростью — для сравнения есть режим --model=unsafe. MIT, за инструментом стоит статья с конференции PLDI 2026.
Новости и тренды
GPT-5.6: три модели вместо одной. OpenAI выпустила поколение из флагмана Sol, сбалансированной Terra и дешёвой Luna (OpenAI). Цены за миллион токенов: Sol $5 на входе и $30 на выходе, Terra $2,50 и $15, Luna $1 и $6. Режим Ultra по умолчанию запускает четырёх агентов параллельно.
По бенчмаркам паритет, а не разгром. На индексе интеллекта Artificial Analysis у Sol 58,9 против 59,9 у Fable 5. На агентном кодинге Sol впереди: 80 против 77,2. Зато на SWE-Bench Pro лидируют модели Anthropic — 80,3 и 80,0 против 64,6 у Sol. Кстати, ходивший по рассылкам тезис «Sol сам дообучил Luna» на официальной странице не подтверждается. Что это значит: покупают теперь не ум, а соотношение ума и цены. Fable держит корону в сложном коде, но за неё придётся доплачивать.
Codex переехал внутрь ChatGPT, Atlas сворачивают. Приложение Codex слилось с новым десктопным ChatGPT, а отдельный браузер Atlas начали закрывать. Старое приложение переименовали в ChatGPT Classic. Путаница вышла знатная: и Итан Моллик, и Саймон Уиллисон публично написали, что не понимают разницу между ChatGPT Work и Codex. Что это значит: OpenAI собирает суперприложение и готова сжечь бренд Codex ради узнаваемости ChatGPT. Пользователям сфокусированного инструмента придётся привыкать к комбайну.
Meta вышла в ценовую войну. Muse Spark 1.1 стоит примерно вчетверо дешевле топовых конкурентов, а Цукерберг обещает подрезать их «крайне высокие» маржи. Рядом Palo Alto Networks заявляет, что цена ИИ-токенов должна упасть процентов на девяносто (CNBC). Что это значит: модельный слой превращается в биржевой товар. Если вы строите бизнес на чужом API, закладывайте смену поставщика как обычную операцию, а не как катастрофу.
NYT обвинил OpenAI в сокрытии улик. Издатели подали ходатайство о санкциях: по их версии, OpenAI два года притворялся, будто технически не может искать по логам ChatGPT (Ars Technica). При этом сам искал там материалы NYT, когда строил фильтр против дословного воспроизведения статей. Выборку в 20 млн логов, отданную истцам, компания залила 19 миллиардами машинных вымарок, и суд признал её непригодной. OpenAI отвечает, что это поздняя попытка залезть в приватные данные пользователей, и напоминает про добросовестное использование. Что это значит: исход спора о фактическом вреде рынку решит судьбу обучения на защищённых текстах.
Издатели готовятся уйти из поиска Google. С 15 сентября Cloudflare по умолчанию заблокирует «многоцелевые краулеры» на страницах с рекламой для новых сайтов и бесплатных тарифов (Adweek). Мишень не названа, но это Google. Причина в том, что Google одним и тем же роботом наполняет поисковый индекс и учит свои модели. USA Today говорит, что готова уйти из поиска за 6–12 месяцев. Что это значит: сайты перестают быть бесплатным сырьём. Если вы живёте на поисковом трафике, следите за этим — правила раздачи контента меняются на глазах.
Бен Бернанке вошёл в надзорный траст Anthropic. Экс-глава ФРС и нобелевский лауреат по экономике 2022 года стал попечителем Long-Term Benefit Trust (Anthropic). У траста есть реальные полномочия: он вправе назначать членов совета директоров компании. Что это значит: Anthropic готовится отвечать на вопросы про влияние ИИ на занятость не пресс-релизами, а экономическим аппаратом.
AI 2040: сценарий, а не прогноз. Авторы мрачного AI 2027 выпустили противоположную работу — как пройти появление сверхразума без катастрофы (LessWrong). Рецепт: отложить сверхинтеллект до 2040 года, сделать разработку прозрачной, договориться США и Китаю, ввести сборы за вычисления и платить людям «дивиденд гражданина». В модели он вырастает до миллиона долларов на человека в год к 2035-му.
Авторы честно называют это рекомендацией, а не предсказанием. Ричард Нго, год консультировавший их же проект, разносит работу по трём пунктам (критика). Она смешивает прогноз с пожеланием. Она принимает вражду США и Китая как данность, а это самосбывающееся пророчество. И она слишком верит в резкий скачок способностей. Что это значит: читайте как продуманную позицию в споре, а не как карту будущего. Команда системно ставит слишком ранние сроки — Даниэль Кокотайло уже сам сдвинул свою медиану.

Стройку дата-центров тормозят люди на местах. За один квартал в США заблокировали или отложили проекты более чем на $130 млрд из-за протестов вокруг воды и электричества (OilPrice). Что это значит: у бума появился физический потолок, и он не про чипы.
Профессор поймал полкурса на списывании. Экономист из Университета Брауна дал домашний экзамен и очный финал. Средний балл упал с 96 до 48. Из 27 студентов, бросивших курс или не пришедших на финал, у 22 были идеальные домашние работы (The Next Web).
Коротко о прочем. SambaNova подняла $1 млрд при оценке $11 млрд и думает про биржу в 2027-м. OpenAI купила Northslope и получила сотни инженеров внедрения. Prime Intellect привлекла $130 млн на открытый стек обучения моделей. Регулятор NHTSA потребовал от робо-такси прекратить мешать пожарным и скорым. Meta запускает производство собственного чипа Iris в сентябре. Комитеты по влиянию на ИИ-регулирование собрали более $200 млн, а Марк Андриссен вошёл в ИИ-группу при ФРС.