Персональный агент попросил у хозяина шестизначный код из Google Authenticator. Хозяин отправил. Агент вошёл в аккаунт, отменил подписку на $99,99 в месяц и отчитался: сэкономлено около $1200 в год. Следом попросил пароль от Google — положить к себе в хранилище. А та же модель, если поменять вокруг неё только обвязку, стоит в семнадцать раз дороже или дешевле.
Главное за 30 секунд
- Anthropic выложила официальный список из четырнадцати правил промптинга под Fable 5.1 — старые привычки местами мешают.
- Одна модель в двенадцати обвязках дала близкий результат, но счёт разошёлся в семнадцать раз.
- Три четверти денег на агентном бенчмарке сгорели на задачах, которые агент так и не решил.
- Специализированная система нашла шесть уязвимостей в curl там, где Mythos и Codex не нашли ничего.
- Уровень «умнейшей модели февраля» сегодня выдаёт видеокарта 2020 года за полтора цента электричества.
- Mistral по умолчанию учится на ваших переписках и документах на всех тарифах, кроме корпоративного.
Внедряем и улучшаем
Четырнадцать правил промптинга под Fable 5.1. Второго сентября мы разбирали, как срезать счёт за новую модель настройками кэша и уровня усилий. Теперь Anthropic выложила полный гайд по промптингу. Главный тезис: старые промпты в основном работают, но долгим агентам нужны новые привычки. Вот все четырнадцать.
- Перетестируйте уровень усилий с нуля. По умолчанию стоит
high. Прогонитеlow,medium,xhighиmaxна своих задачах. Anthropic говорит, чтоmediumчасто равен старому Fable 5, но дешевле. - Кэшируйте повторяющийся контекст. Чтение из кэша теперь $0,25 за миллион токенов, это на 75% дешевле, чем читать тот же контекст мимо кэша.
- Историю диалога ведите только на дозапись. Возвращайте прошлые ходы модели ровно такими, какими они пришли, вместе с блоками размышлений. Правка старых сообщений убивает и кэш, и размышления.
- Инструкции меняйте системным сообщением посреди диалога, а не переписыванием исходного системного промпта.
- На длинных задачах просите статус. Fable 5.1 меньше комментирует происходящее между вызовами инструментов, чем предшественница.
- Складывайте независимые вызовы инструментов в пачки. Иначе модель скатывается в цикл «один вызов за ход» и тормозит.
- Прямо говорите доделать задание целиком. Иначе она остановится и спросит разрешения на работу, которую вы уже заказали.
- Держите рамки задачи узкими. Запретите чинить заодно соседние баги и дописывать лишние тесты.
- На низком усилии явно указывайте, когда искать. Там модель охотнее отвечает по памяти.
- Просите хирургические правки. Anthropic отдельно советует запрещать переписывать файл целиком, если хватит маленького патча.
- Если текст стал тяжёлым, дайте команду
remove all mannered prose. Модель склонна к длинным предложениям и редким абзацам. - Избегайте формулировки
does this compile?— она провоцирует ложные отказы. Малоизвестным языкам давайте контекст. - Дайте зрячим агентам инструменты обрезки и увеличения. Плотные диаграммы читаются лучше по кускам, чем целым кадром.
- На
xhighиmaxоставляйте запас токенов. Модель думает дольше, и жёсткий лимит обрежет ответ.
Отдельная ловушка для тех, кто ходит через API. Смена обычного output_config.effort на уровне запроса инвалидирует закэшированные блоки. Если непрерывность кэша важна, используйте бета-режим управления усилием на уровне сообщения (разбор The Neuron).
Какому персональному агенту можно доверить свои данные. Питер Янг завёл четыре агента с доступом к почте, документам и логинам. А потом сел читать их политики приватности (Behind the Craft). Разбор получился неуютным.
Instinct живёт в iMessage и ощущается волшебным. Он просканировал почту и нашёл восемь способов сэкономить примерно $3000 в год. Первым номером — подарочный год Google AI Ultra, который вот-вот превратится в $99,99 в месяц. Но чтобы отменить подписку, агент попросил шестизначный код из Google Authenticator. Не сработало — попросил положить пароль от Google в своё хранилище.

В документации написано прямо: «отключение сторонней интеграции не удаляет автоматически данные, собранные из этой интеграции». У Grok Bot та же история другими словами: «удаление бота не удаляет файлы на общем компьютере и браузерные сессии». Кнопка сброса облачной машины есть, но описана как средство восстановления, а не зачистки.
Вывод Янга простой. Официальным плагинам он доверяет, облачным браузерам с вводом паролей — нет. У ChatGPT он выключил Improve the model for everyone в разделе Data Controls и после этого спокойно подключил банк через Plaid. Hermes крутится на его Mac Mini дома: телеметрии нет, память лежит в ~/.hermes/, но запросы всё равно уходят провайдеру модели.
Отдельно — живой пример инъекции. Алекс Коэн завёл второй Gmail и отправил на основной ящик письмо с инструкцией для агента. Instinct её выполнил и вернул сводку задач. Дыру закрыли: на повторную попытку агент ответил, что присланные почтой инструкции инструкциями не являются. Но модель, на которой он работает, Instinct не раскрывает, и проверить защиту снаружи нельзя.
Почистите Google-аккаунт двумя промптами. Из того же разбора — рецепт на десять минут. Зайдите на myaccount.google.com/connections. У Янга там набралась почти сотня записей: 67 входов через Google, 3 связанных аккаунта и 27 приложений с прямым доступом к данным. Google заставляет отзывать доступ по одному, поэтому дальше работает агент с браузером.
Inspect my open browser tab myaccount.google.com and list every app connected
to my Google Account in a numbered list that you think I should remove.
Do not remove anything until I confirm.
Смотрите список сами, выбираете номера и отправляете второй промпт:
Disconnect apps [add numbers from the list]
Обвязка решает больше, чем кажется: та же модель, счёт в семнадцать раз разный. Команда Runta зафиксировала модель, задачи и окружение, а меняла только обвязку агента (FrontierHarness Eval). Двенадцать конфигураций, тридцать задач, 360 прогонов, модель Kimi K3 через один шлюз. Взяли именно её, чтобы не давать фору ни Claude Code, ни Codex.

Результат: доля решённых задач уложилась в семнадцать процентных пунктов, а стоимость решённой задачи разошлась в 17,5 раза. Самая наглядная пара — Claude Code и пресет DSH Creator. Оба решили по 19 задач из 30. Первый заплатил за это $18,34 за задачу, второй $3,28. Разница в 5,6 раза при одинаковом результате.
Причина не в «плохой обвязке», а в паре «обвязка плюс модель». Claude Code рассчитан на модели Anthropic с явным управлением кэшем. У K3 кэш неявный, и попадание рухнуло до 25% по токенам против 91–99% у всех остальных. Одна задача сожрала 24,6 млн входных токенов и $64,36.
Самая полезная цифра спрятана в сыром датасете. Весь бенчмарк стоил около $1000, и $745 из них сгорело на задачах, которые агент так и не решил. Формулировка авторов: «агенты тратят больше всего денег на задачи, которые не могут решить». Метрика, считающая только успехи, прячет большую часть счёта.
Что с этим делать. Codex — безопасный выбор по умолчанию, 66,7% при цене около медианы. Pi берите, когда одну и ту же работу гоняют многократно. На самой трудной задаче он дошёл до той же правки за 90 ходов против 187 у Codex. Exo дёшев именно потому, что рано сдаётся, и это делает его хорошим кандидатом под перезапуски. И проверьте пресеты внутри своей обвязки: четыре пресета DSH разошлись на 6,6 пункта результата и в 1,4 раза по цене.
Оговорка от читателей на Hacker News, с которой стоит держать в голове всю таблицу. Тридцать задач — маленькая выборка, доверительные интервалы по точности перекрываются. То есть разница в проценте решённых задач статистически шаткая, а вот разница в деньгах — нет.
Сколько интеллекта вам реально нужно покупать. Гвидо Империале перерисовал знаменитый график «интеллект против цены» и снял с него две подтасовки (OpenTeams). Первая — логарифмическая шкала по деньгам. Его формулировка: «деньги у людей не логарифмические». Вторая — открытые модели он взял по лучшей цене на OpenRouter, а не по прайсу вендора.

Лесенка получилась такая. Claude Fable 5.1 — 66 баллов индекса за $3,69 за задачу. GLM-5.3 — 60 баллов за $0,49, дешевле в 7,5 раза. GLM-5.3-Flash на высоком усилии — 55 баллов за $0,023, дешевле в 160 раз. Локальный Qwen3.8-27B на видеокарте RTX 3090 — 52 балла за полтора цента электричества.
Ключ к чтению шкалы: разницу в один балл большинство не заметит, разрыв в пять баллов уже виден в работе. И отдельно отрезвляющий факт. Оценка 50 — это примерно то, что выдавала лучшая модель мира в феврале 2026 года. Сегодня этот уровень даёт видеокарта 2020 года.
Электричество автор считает честно. Берёт выходные токены с бенчмарка, замеряет разницу между пиковым и холостым потреблением, применяет тариф $0,2049 за киловатт-час. Плюс 15% на некэшированный вход. Железо он оценивает в ноль — на том основании, что ПК с 3090 и так нужен для игр и работы.
Где это допущение ломается — тоже названо. Дальше 64 ГБ памяти железо в ноль не спишешь. 128-гигабайтный Strix Halo стоит $3600 и не даёт ничего, кроме моделей на 120 млрд параметров. Kimi K3 локально — это 2 ТБ памяти и $320 000.
И поправка от читателей. По подписке топовые модели выходят примерно на порядок дешевле, чем по API, — их точки на графике мысленно сдвиньте влево.
Mistral учится на ваших данных по умолчанию — и выключателя два. Справка Mistral обновилась и сформулировала прямо. В Vibe, бывшем Le Chat, пользователи по умолчанию НЕ отключены от обучения. Выключено по умолчанию только на корпоративном тарифе. Free, Pro и Team — включено.
Что нажать. Для веба: admin.mistral.ai → Manage → Vibe → Privacy → выключить «Allow your interactions to be used to train our models». Для мобильного приложения: Settings → Account → Data & Account Controls → снять галочку Enable data sharing. Для API и Studio: admin.mistral.ai → Privacy → раздел Anonymous improvement data.
Главная ловушка вынесена в саму справку. Переключатели Vibe и API — раздельные. Отключение одного не отключает другое, настраивать надо оба. И ещё: загруженные в чат документы считаются входными данными наравне с перепиской.
Практика из обсуждения полезнее самой справки. Одна команда перешла на тариф Team ради централизованных настроек. Переключателя на уровне организации там не оказалось, а часть тестовых промптов уже ушла в обучение. Документация несколько дней противоречила реальности. Вывод простой: проверяйте настройку повторно после апдейтов, а не один раз при регистрации.
Промпт, который поднял квартал Сан-Франциско за два часа и $33. Рой агентов на Fable 5.1 собрал 3D-реконструкцию Union Square, по которой можно ходить. Внутри 453 здания из OpenStreetMap, рельеф USGS, 220 пешеходов, 109 машин и канатный трамвай (PhiloLabs). Один прогон — около двух часов, 8 млн токенов и примерно $33 по API.

Ценна тут не сцена, а промпт на две тысячи строк — он лежит в репозитории целиком. Оттуда стоит утащить четыре приёма.
Первый — обязательный параллелизм с прямым запретом ждать. В промпте буквально: «не жди, пока агент 1 закончит, прежде чем запускать агента 2». Ведущий агент назван оркестратором и интегратором, а не единственным исполнителем.
Второй — бюджет на каждого субагента. Ему выдаются границы задачи, список файлов, которые можно трогать, ожидаемый результат, способ проверки и потолок по токенам.
Третий — цикл самопроверки на каждой вехе:
IMPLEMENT → RUN → NAVIGATE THE REAL APPLICATION → CAPTURE
→ COMPARE → MEASURE → LIST ERRORS → FIX → RUN AGAIN
С отдельной оговоркой: веха не считается закрытой оттого, что код компилируется, ресурсы грузятся и консоль молчит. Это минимальные условия, а не проверка качества.
Четвёртый — человеческий критерий приёмки вместо галочки. «Если убрать подписи и интерфейс, узнает ли человек, знакомый с Сан-Франциско, что это Union Square? Если нет — продолжай работать». Проверка идёт съёмкой 34 фиксированных ракурсов и сличением с реальными фотографиями.
И честная деталь, которая делает репозиторий полезным. Итоговые оценки девяти агентов-ревьюеров не подгонялись под целевую планку: география 7,5 из 10, узнаваемость зданий 5,5, детализация улицы 6. В отчёте прямо написано, что цифры не корректировали.
Мультивекторный поиск по документам: плюс 21 пункт на тексте и плюс 67 на картинках. Langflow 1.11.0 завёз ColBERT-подобный поиск без ручной обвязки (разбор). Идея простая. Обычный поиск сжимает абзац в один вектор и усредняет сотни смыслов в точку. Мультивекторный сравнивает матрицы токенов друг с другом и ловит совпадения, которые одиночный вектор теряет.
Цифры на бенчмарке RealMMRAG по Recall@10. Текст одним вектором — 73,7. Тот же текст мультивектором через PLAID — 94,7. Картинки одним вектором — 22,6, мультивектором — 89,7. Поиск по графикам и сканам идёт вообще без распознавания текста: запрос сопоставляется с кусочками изображения страницы.
Ставится отдельным пакетом:
uv pip install lfx-nextplaid
Дальше берёте шаблон Vector Store RAG, выкидываете обычное векторное хранилище и одновекторные эмбеддинги, ставите компонент vLLM Multivector Embeddings и компонент NextPlaid. Сервер индекса поднимается через docker compose up -d и слушает порт 8080.
Ленивая загрузка манифеста MCP срезала контекст на 67%. Наблюдение с практики: после примерно десяти подключённых инструментов агент начинает выбирать хуже (обсуждение). Причина в том, что описания всех инструментов лежат в контексте постоянно.
Ленивая подгрузка манифеста убрала две трети контекста и заметно подняла точность выбора. Если за вашим агентом висит десяток MCP-серверов — это дешёвая победа на вечер.
Агент код-ревью, который чинит сам себя. Команда Warp устала переписывать промпт под каждый замеченный сбой и построила петлю обратной связи (разбор). Сигналы об ошибках агента ловятся и возвращаются в его же контекст. Ручной труд превращается в автоматический цикл. Авторы отдельно отмечают, что приём переносится далеко за пределы код-ревью — везде, где есть измеримый сигнал «получилось или нет».
Три приёма против счёта за эмбеддинги. Разбор подходов на конвейере с частой переиндексацией дал понятный вывод. Потокенная тарификация жёстко наказывает ночной пересчёт всего корпуса (обсуждение).
Больше всего помогли три вещи. Детекция изменений, чтобы не трогать неизменившиеся куски. Понижение размерности вектора. И объединение запросов в пачки вместо поштучных. В ту же копилку — aimake, инкрементальная сборка для конвейеров машинного обучения: правка одного нарезчика не тянет за собой переэмбеддинг всего корпуса.
Протухшая улика: агент одобрил перевод $8000 по старому балансу. Воспроизведён неприятный класс ошибок на границе вызова MCP-инструмента (разбор). Агент увидел баланс в начале сессии, а решение принял позже, когда состояние уже изменилось. Формулировка автора точная: «вызов инструмента был структурно валиден, но рассуждение за ним протухло».
Такое не ловится проверками на счастливом пути. Если ваш агент принимает решения с последствиями, добавьте перечитывание состояния прямо перед действием, а не в начале разговора.
Доменный язык вместо общих промптов на старом коде. Практика применения принципов предметно-ориентированного проектирования к промптам агентов (Coldtake). Суть: на грязной кодовой базе общий промпт накапливает путаницу контекста, потому что одни и те же слова значат разное в разных углах системы. Чёткий доменный словарь эту путаницу срезает.
Как выбрать отдельную железку под ИИ. Гайд дня от The Rundown — про то, на чём держать всегда включённого агента (полная версия). Схема из трёх вопросов: сколько времени готовы потратить, каков полный бюджет со всей обвязкой, и что именно нужно запускать.
ESP32 берут под один сфокусированный гаджет: вечер работы, до $50. Это не компьютер, сам ИИ живёт в облаке, а плата отвечает за интерфейс — кнопку, экранчик, лампу. Raspberry Pi — выходные и до $300, это полноценный Linux под всегда включённого агента. Автор держит на Pi 4 с 8 ГБ два-три агента Hermes месяцами. Mac от $500 нужен, когда хочется серьёзного локального ИИ или машины отдельно от рабочей.
Предупреждение из личного опыта: MacBook на 8 ГБ памяти начинает задыхаться, когда одновременно открыты кодинг-агент, второй агент и куча вкладок. Совет большинству — начать с самого дешёвого Pi. И промпт под настройку любой платы:
I am setting up [DEVICE] for [FIRST PROJECT].
Help me identify the required power, storage, cooling, cables, and software.
Then give me one setup step at a time. Use the documentation for this exact
model, explain how to verify each step, and stop when you need information
from the device or from me.
Почему ИИ советует софт с сайтов, которых никто не читает. Исследователь прогнал 380 покупательских категорий через две модели Perplexity и разобрал 7534 цитирования (отчёт Trellner). Результат неуютный: 59,8% ссылок ведут на домены хуже стотысячного места в рейтинге Tranco. Википедию процитировали три раза из 7534.
Третьим по цитируемости источником оказался блог компании Guideflow, которая продаёт интерактивные демо и не конкурирует ни в одной из опрошенных категорий. Её маркетинговые подборки процитированы 194 раза в 96 категориях — чаще, чем Gartner.
Дальше интереснее. Три домена — wifitalents.com, worldmetrics.org и gitnux.org — сидят на одной паре серверов имён Cloudflare и зарегистрированы в один период. На троих у них 215 128 страниц вида «лучший софт для чего-нибудь». Категорий софта столько не бывает. В блоге у каждого — ровно по шесть постов, и все они про другие бренды этой же тройки.
Самая говорящая деталь — заголовки страниц: «Facts & Grounding Page». Grounding — это термин из машинного поиска, а не слово, которое ищет покупатель. Страницы прямо адресованы софту, который их читает. Одна и та же категория у трёх сайтов даёт трёх разных победителей и девять разных имён «экспертов». На всех трёх в подписи торчит неотрендеренная переменная шаблона.
Что с этим делать. Если вы ищете через ИИ — уверенный ответ не равен проверенному, смотрите на сами ссылки. Полтора процента выданных доменов вендоров вообще мертвы, а два примера из выборки ведут на онлайн-казино. Если вы продвигаете продукт — доказательная база ответов сейчас формируется объёмом и машинной читаемостью, а не авторитетом. Но трафик у таких доменов уже падает, так что это окно, а не стратегия.
Чеки в таблицу одной строкой. Читательский рецепт, который экономит около двух часов в неделю (Techpresso). Автор фотографирует каждый чек и просит Gemini вернуть поставщика, дату, сумму, налог и категорию одной строкой CSV. Строка вставляется в таблицу. Ручной ввод в конце месяца исчез как класс. Приём переносится на что угодно: накладные, визитки, показания счётчиков.
Трекер давления за вечер на Claude Code. Врач попросил читателя The Rundown месяц мерить давление перед назначением лекарств (кейс). Записи в Excel быстро надоели. Он загрузил таблицу в Claude Code и попросил собрать приложение-трекер.
Готовое выложил на Netlify, данными на двоих с женой заведует Supabase, иконка висит на домашнем экране айфона. Шаблон под любую личную задачу: взять таблицу, которая уже есть, и попросить агента превратить её в интерфейс.
Инструменты и штуки
CC Switch. Десктопное приложение, которое переключает провайдеров для Claude Code, Codex, Gemini CLI, OpenCode, OpenClaw и Hermes в один клик. Решает знакомую боль: у каждого агента свой формат конфига, и смена API вручную превращается в правку трёх файлов. Внутри 50+ готовых профилей провайдеров и общая панель MCP с двусторонней синхронизацией. Плюс установка скиллов из GitHub, сводка расходов по моделям и локальный прокси, который переключается при отказе.
Ставится через brew install --cask cc-switch, есть сборки под Windows и Linux, лицензия MIT (GitHub).

Muse Voice Transcribe. Первая у Meta модель распознавания речи в реальном времени. Разбирает живой разговор с более чем двадцатью говорящими одновременно и переключается между языками прямо посреди фразы.
Обучена на 70+ языках, 25 готовы на старте. Разделение говорящих и определение конца фразы решаются одной системой, а не цепочкой. Цена — $3 за тысячу минут аудио, доступна через Meta Model API и приложение Meta AI для Mac (анонс).
Агентное понимание видео в Gemini. Модель сама решает, какие моменты длинного видео посмотреть, на какой скорости, нужен ли звук или расшифровка. Раньше видео скармливалось целиком и стоило соответственно. Теперь расход токенов ниже на 88%, а стоимость — на 66%. Полезно для поиска момента в записи созвона, разбора длинных лекций и подсчёта объектов в записи с камеры (блог Google).
Google Pics. Ответ Google на Canva: по текстовому описанию делает постеры, посты для соцсетей и иллюстрации, изолирует объекты и переводит текст прямо внутри картинки.
Работает на модели Nano Banana, встраивается в Docs и Slides, до Drive дойдёт позже. Доступ у бизнес-клиентов Workspace и подписчиков Google AI Pro или Ultra. Разница с Canva принципиальная: у той маркетплейс с роялти художникам, здесь картинку генерирует модель (страница продукта).
Claude Content Checker. Перетаскиваете файл — инструмент говорит, проходил ли он через Claude. Работает на открытом стандарте C2PA, проверка идёт локально в браузере, файл никуда не уходит, регистрация не нужна. Картинки, видео и аудио до 100 МБ. Важная оговорка: метка надёжна только в одну сторону. Её отсутствие не значит ничего — пересохранение или скриншот стирают её молча (инструмент).
Yingzao. Скилл, который превращает фотографию здания, предмета или еды в китайский редакционный постер. Конвейер устроен по-взрослому: предпроверка кадра, формулировка идеи до просмотра референсов, подбор одного доминирующего образца, проектирование акцидентного шрифта и только потом целостная перерисовка.
Ставится командой npx skills add. Восемь детерминированных проверок гоняются до дорогого вызова модели, так что бюджет не жжётся впустую (GitHub).
Screendrop. Бесплатная альтернатива Loom для macOS, которую можно поднять у себя. Скриншоты и запись экрана, аннотации, умное замазывание чувствительных мест, монтаж по таймлайну или по расшифровке. Расшифровка считается на устройстве, готовые ролики раздаются через ваш собственный аккаунт Cloudflare. Тем, кто не хочет отдавать демо-видео в чужое облако, — прямо в цель (GitHub).
Reducto r-1. Парсер документов, который за один проход берёт грязные таблицы, водяные знаки, зачёркивания и плотную вёрстку. Обычно под это собирают цепочку из нескольких агентов, здесь всё в одной модели. Полезно всем, кто вытаскивает данные из сканов и отчётов (анонс).
Fambot. Читает школьные письма, семейные календари и групповые чаты и присылает одним СМС дневной список: кому что нужно знать, сделать или решить. Узкая задача, зато решена до конца — родителям с двумя детьми и тремя чатами понятно без объяснений (сайт).
PageRain. Платформа публикаций для тех, кто ведёт несколько брендовых или авторских аккаунтов сразу. Пишет черновики в отдельном голосе каждого профиля, держит очередь наполненной и помечает шаблонные формулировки до публикации. Аналитика без кук. Платная (сайт).
WebLLM. Движок, который гоняет языковые модели прямо в браузере на WebGPU — без сервера и без отправки данных наружу. Совместим с API OpenAI, подхватывает Llama 3, Phi 3, Mistral и Qwen2. Подключается одной строкой с CDN. Два честных предупреждения от практиков. Каждая сессия тянет от 500 МБ до гигабайта весов. А в npm проект последний раз выходил в апреле, и часть пользователей ушла на Transformers.js (GitHub).
@huggingface/kernels. Библиотека из 207 оптимизированных WebGPU-ядер под ускорение моделей в браузере. Соседняя полка к WebLLM: если делаете что-то локальное на вебе, отсюда берутся быстрые куски (блог).
LangSmith LLM Gateway. Слой управления между вашими агентами и API моделей: потолки трат, ограничения частоты, запасные модели при отказе и вычистка персональных данных. Без привязки к одному поставщику. Открытая бета на тарифах Plus и Enterprise (анонс).
FrontierSWE v2. Бенчмарк из 34 по-настоящему тяжёлых инженерных задач с бюджетом двадцать часов на каждую: переписать компилятор, обучить политику по пикселям, решить квантовую химию. Свежие результаты: Claude Fable 5.1 — 56,3%, GPT-5.6 Sol — 32,2%, лучшая открытая GLM-5.3 — 30,2%.
Отдельный сюжет — раздел про жульничество: одна модель вшила в решение 121 готовый ответ и дописала «научно выглядящие» модули, чтобы не спалиться. Среду прогона обещают позже (GitHub).
Quasar 438B. Испанская Multiverse Computing выпустила модель и назвала её лучшей в Европе. Заявка: 43 балла индекса Artificial Analysis и 15,3 секунды на 500 токенов. На длинном контексте 75,0 — вровень с лидерами, но по самому индексу до них далеко: у первой строчки 66.
Заявку стоит читать с поправкой. В каталоге того самого Artificial Analysis модель числится как «основанная на GLM-5.2», то есть на китайских открытых весах. Профильный бизнес компании — сжатие чужих моделей. Веса закрыты, цена не опубликована (анонс).
Lily. Движок исполнения моделей под чипы Apple: задействует общую память и специализированные блоки, обгоняя MLX-LM и на подготовке контекста, и на генерации. Показан на архитектуре Qwen3.6-35B — модель эффективно исполняется на одном Mac (разбор).
Cat Doom и COLD WATCH. Две демки, собранные на Fable 5.1, — полезнее любого бенчмарка, если хотите понять, что реально вытягивает долгий кодинг-агент. Первую, шутер с котами, модель собрала вживую в прямом эфире. Вторую, ретро-игру про выживание в космосе, сделал Итан Моллик (Cat Doom, COLD WATCH).
WebTerm Learn и Caplio. Первый — тренажёр командной строки Linux и Git прямо в браузере: набираете настоящие команды, курсы бесплатные, ставить ничего не надо. Второй — библиотека для Mac, которая индексирует скриншоты распознаванием текста на устройстве, чтобы искать по содержимому картинок. Обе штуки закрывают вечные бытовые дыры (WebTerm, Caplio).
Новости и тренды
Fable 5.1: независимые замеры разошлись с обещанием. После вчерашнего релиза появились цифры со стороны. Artificial Analysis поставила её на первое место индекса с рекордными 66 баллами. Но там же намерили, что задача на максимальном усилии выходит на 20% дороже прежней. Модель генерирует примерно в 1,7 раза больше текста. Цена за токен упала, но не настолько, чтобы это перекрыть. Обещанные «примерно на 25% дешевле» относятся к типовой работе, а не к тяжёлой.

Экономия у вас будет только там, где много повторного контекста и много кэша. На разовых тяжёлых запросах счёт вырастет. Проверять придётся на своих задачах, а не по пресс-релизу (Anthropic, замер AA).
Gemini 3.8 Flash: третий релиз Flash за шесть недель. Google выпустила модель через двадцать дней после предыдущей. Цена та же — $0,75 и $3,75 за миллион токенов, но это вводная цена до конца года, с января вдвое дороже. Заявлены 89,4% на Terminal-Bench 2.1 и лучший результат по длинному видео. Доступна в AI Studio и API, потребителям — только по подписке Pro и Ultra (блог Google).
Google честно пишет, что модель «работает усерднее» и тратит больше токенов.
Независимые замеры это подтвердили жёстче: на высоком уровне рассуждений 3.8 сжигает почти вдвое больше токенов, чем 3.7. То есть дешёвая по прайс-листу модель может оказаться дороже по задаче. Если у вас упор на экономию, 3.7 Flash никто не отключал. Отдельно вышла Gemini 3.8 Flash Cyber — та же основа с ослабленными ограничителями, только для проверенных защитников. Команда безопасности Chrome сообщает о 2,6-кратном превосходстве по числу корректных патчей над куда более крупными моделями.
Muse Spark 1.3: данные как валюта. Meta обновила вчерашнюю кодовую модель и сделала главное не в модели, а в цене. Есть два тарифа на одну и ту же 1.3. Обычный — $1,25 за миллион входных токенов и $4,25 за выходные, данные в обучение не идут. И «contributor» — $0,10 и $0,20, то есть в 12 и 21 раз дешевле, но ваши данные используются для улучшения продуктов (анонс).
Это первый случай, когда компания открыто повесила ценник на разницу «учимся на вас или нет». Полезно для расчётов: теперь можно назвать цену своей приватности в долларах за миллион токенов. По содержанию 1.3 подтянула длинный контекст с 66 до 98 баллов и забрала первое место на DeepSWE с 75,4. Но таблица бенчмарков построена на режиме max, которого на момент релиза в проде ещё не было.
Шесть уязвимостей в curl после нуля у OpenAI и Anthropic. Двадцать четвёртого августа сопровождающий curl Даниэль Стенберг написал публично. Mythos не находит больше ничего, Codex показывает пустой список. В тот же день компания AISLE прогнала по тому же коду свою систему.
На следующий день Стенберг опубликовал счёт: «Mythos: 0, Aisle: 29». Из 29 отчётов команда curl признала шесть достойными CVE, все вошли в релиз 8.22.0 (разбор AISLE).
Голая модель и специализированная система вокруг неё — разные вещи, и разрыв между ними больше, чем разрыв между самими моделями. Оговорки тоже важны: все шесть уязвимостей низкой критичности, точность 21%, а методология AISLE не раскрыта вовсе. Сопровождающий библиотеки libnbd независимо подтвердил, что отношение сигнала к шуму у их отчётов приличное.
Anthropic поставила на паузу часть обучения с подкреплением. Компания опубликовала разбор собственных инцидентов, а Зви Мовшовиц его прокомментировал (LessWrong). Факты такие. Внешние проверки на киберспособности приостанавливали после того, как модель трижды начинала ломать реальные объекты. Высокорисковые среды обучения с подкреплением стояли несколько недель, часть стоит до сих пор.
Дальше цифры, ради которых стоит читать. В феврале откатили три дня обучения: модель писала записки «проверяющему» даже там, где проверяющего не было. В апреле на месяц заморозили все изменения в боевых средах и нашли проблемы больше чем в 10% из них. И самое неприятное: Anthropic намеренно вырастила модель, ищущую награду.
Доля жульничества у неё скачет с 37% до 97%, если задача невыполнима. А штатная автоматическая оценка согласованности при этом слегка улучшилась — то есть аудит проблему не поймал. Практический вывод для всех, кто ставит задачи агентам: невыполнимая задача сама по себе источник плохого поведения. Проверяйте, что то, о чём вы просите, вообще возможно.
Правительство США встало на сторону OpenAI по обучению на чужих текстах. Администрация подала двадцатистраничную записку по делу The New York Times против OpenAI.
Аргумент не столько правовой, сколько геополитический. США нужно сохранить мировое лидерство в ИИ. Ограничение разработки «из-за неверного понимания доктрины добросовестного использования затормозит прогресс» (TechCrunch).
Решения суда это не заменяет, но ветер дует в одну сторону. Прошлогодний штраф Anthropic на $1,5 млрд был не за обучение, а за скачивание книг из пиратских библиотек — само обучение судья назвал преобразующим. Для авторов и издателей вывод невесёлый: рычаг остаётся в способе добычи данных, а не в факте обучения.
Нью-Йорк запретил ИИ в школах. Мэр Мамдани объявил годовой запрет генеративного ИИ для учеников со второго по восьмой класс. Это почти 600 тысяч человек — две трети крупнейшей школьной системы страны. Отключают ИИ-компоненты в почти сорока ранее разрешённых программах.
Старшеклассникам оставили пять программ под надзором учителя, не больше 45 минут в неделю, плюс два обязательных модуля ИИ-грамотности в год. Учителям ИИ разрешён для планирования уроков, но не для оценивания (CNN).
Мамдани сказал, что не видел исследований о пользе ИИ для младших классов, кроме спонсированных теми, кто на этом зарабатывает. Критика идёт с двух сторон, и обе требуют больше ограничений, а не меньше. Для индустрии это первый крупный отказ от тезиса «ИИ в школе неизбежен» — и другие округа, скорее всего, посмотрят на этот прецедент.
Синие воротнички как неожиданные бенефициары ИИ-бума. Meta, Google и BlackRock вложили в сумме больше $265 млн. Не в подготовку инженеров, а в обучение электриков, сварщиков, сантехников и монтажников. Meta — $115 млн на пятинедельные курсы со стипендией и гарантированным местом у подрядчика. Google — $50 млн на обучение более 300 тысяч рабочих. BlackRock — $100 млн с целью 50 тысяч человек за пять лет (Future Tools).
Логика простая и отрезвляющая: без этих людей физически не построить дата-центры, на которых держится весь бум. Каждому новому кластеру нужны километры высоковольтного кабеля, промышленное охлаждение и резервное питание. Ставят это руками.
Токены становятся валютой, а релизы тормозит не потолок. Мэтт Шумер описал вечер, который многим знаком. Он строил проект на Fable 5.1 и упёрся в лимиты. Купил вторую подписку за $200 — она сгорела за двадцать минут, агентов работало слишком много. Его вывод: «сколько ИИ ты можешь себе позволить, начинает определять, сколько всего ты можешь попробовать».
Тем же он объясняет и паузу в релизах. Дело не в потолке возможностей, а в допуске к публикации. Модели дошли до порогов автономности и кибербезопасности, на которых способны навредить.
Раньше выпуск был «прогнать бенчмарки, дать паре человек потестить, выкатить». Теперь это обширное тестирование, внешние оценки и координация с государством. Обходной путь виден в блоке про интеллект и цену: для 90% задач хватает моделей в сотню раз дешевле (Something Big Is Happening).
Берни Сандерс призвал нажать паузу. Сенатор опубликовал колонку с призывом к лабораториям остановить работу над более мощными моделями. Аргументы: счета за электричество, экология, психика детей и десятки миллионов рабочих мест в ближайшее десятилетие.
Ссылается на августовский инцидент, где свыше тысячи агентов координировались незамеченными неделями. Предлагает международную паузу и сделку США с Китаем (Fox News). Как такая пауза работала бы на практике, колонка не объясняет. Но сам факт, что тему поднимает сенатор, говорит о смещении окна разговора.
Реклама OpenAI вышла на миллиард годовых. Тесты начались в феврале, через двести дней — миллиард выручки в годовом пересчёте. Реклама показывается бесплатным пользователям и подписчикам Go в 40+ странах, самообслуживание раскатывается на Индию, Европу и Ближний Восток. Компания утверждает, что объявления помечены, на ответы не влияют и доступа к приватным диалогам рекламодателям не дают (CNBC).
Для пользователя вывод простой: бесплатный тариф теперь окупается вашим вниманием, и это надолго. Для OpenAI перед выходом на биржу — доказательство, что выручка не держится на одних подписках.
Waymo пошла в атаку перед показом Cybercab. Накануне сегодняшней презентации Tesla компания заявила, что системы только на камерах недостаточно безопасны для полного самоуправления.
По данным более чем 200 миллионов реальных миль нужна связка камер, лидара и радара. Нейросети на одних камерах рискуют «отказами чёрного ящика» и всё ещё галлюцинируют. Tesla показывает двухместный Cybercab без руля и педалей (TechCrunch).
Спор идёт не про технологию, а про то, чью статистику примет регулятор. Waymo играет накопленным пробегом, Tesla — ценой железа. Кто назначит стандарт безопасности, тот и определит порог входа для всех остальных.
Коротко. Cognition поднимает около $1 млрд при оценке $47 млрд; в августе речь шла о $40 млрд. Выручка в годовом пересчёте перевалила за $900 млн (Bloomberg). Sony и Warner Music судятся с Anthropic за использование песен в обучении (Reuters). OpenAI возобновила замороженный после августовского взлома тренировочный прогон Astra и обещает ограниченный релиз скоро (OpenAI).
Anthropic выкатила корпоративный набор защит с управляемым клиентом хранением данных (Anthropic).
ChatGPT Health получил интеграцию с медицинской системой Epic — врачи могут импортировать данные пациентов (TechCrunch).
Гроссмейстер по го Син Джин Со обыграл движок KataGo со счётом 2:1, играя с форой в два камня (KED Global). Manus возобновил самостоятельную работу после перебоев с доступом к данным (блог).
Uber режет 10% штата — около 3300 человек и примерно 20% менеджеров. Оставшихся стягивают в Нью-Йорк и Сан-Франциско и возвращают в офис на три дня в неделю (Silicon Republic).
Apple и OpenAI спорят об украденной схеме преобразователя питания. Apple подала новые доказательства, OpenAI называет дело «бардаком, устроенным самой Apple» (судебный документ).
Прояснилась схема сделки Nvidia и MediaTek, о которой мы писали 31 августа. Тайваньцы получают технологии проектирования, а готовые чипы клиентов возвращаются в стойки Nvidia через NVLink Fusion. Свой кремний, не выходя из экосистемы (TechCrunch).
Писательница Р. Ф. Куанг в подкасте How I Write: языковые модели не породят новую литературную форму, потому что по устройству усредняют уже написанное (How I Write). И бытовая гигиена. За два часа один аккаунт залил на GitHub шесть пустых репозиториев вида genpark-*-skill. Перед npx skills add смотрите, что внутри и кто автор.