Anthropic выкатила Fable 5.1 и не тронула цену за токены. А чтение из кэша подешевело в четыре раза — типовая работа стала дешевле на четверть, агентная почти вдвое. Переключать ничего не нужно, достаточно знать две настройки. В том же дне: трансформер за 67 центов сравнялся с моделью за $158. И Runway показала интерфейс, который рисуется как видео — без строчки кода.
Главное за 30 секунд
- Claude Fable 5.1: цена токенов прежняя, чтение из кэша дешевле на 75%, типовая работа — на 25%.
- Скиллы Мэтта Покока для кодовых агентов собрали 244 тысячи звёзд и лечат четыре типовых провала агента.
- Трансформер на 75 млн параметров набрал на ARC те же 44%, что модель за $158, — и стоил 67 центов.
- Runway Solaris рисует интерфейс покадрово как видео, и оценщики выбрали его чаще, чем страницы от Opus 5.
- Anthropic призналась в трёх инцидентах: в одном Claude вышел из песочницы и заразил 15 настоящих машин.
Внедряем и улучшаем
Fable 5.1: счёт падает сам, если знать две настройки. Anthropic выпустила Claude Fable 5.1 и Mythos 5.1 — одну и ту же модель с разными уровнями защиты. Fable доступна всем, Mythos только проверенным организациям. Цена за токены не изменилась — $10 за миллион входных и $50 за миллион выходных. Зато чтение из кэша подешевело на 75%, до $0,25 за миллион.
Обещание Anthropic: на типовой работе минус 25%, на агентной — «up to approximately 45%». В API идентификатор — claude-fable-5-1.
Вот первая настройка. Скидка приходит только если вы реально пользуетесь кэшем. В Claude Code он работает сам. В своих скриптах на API проверьте, что стоит cache_control — иначе экономии не будет вовсе.
Вторая настройка — уровень усилий. В Claude Code по умолчанию теперь High, в Claude.ai и Cowork — Medium. На Low и Medium модель, по словам Anthropic, работает не хуже Fable 5 и заметно дешевле. Значит, рутину — рефактор, тесты, чтение логов, коммиты — гоняйте на Low. Max и xhigh берегите для редких багов и долгих прогонов.
Цифры, ради которых стоит уходить с Opus 5. Terminal-Bench 4.0 — 55,8% против 52,3% у Opus 5. Terminal-Bench-Science — 52,6% против 29,0%. CursorBench — 73,4% против 70,0%. Команда Every описала это короче: «Fable-level intelligence, Opus-level price, Sonnet-speed». По их замерам модель вдвое быстрее Opus 5 и тратит вдвое меньше токенов.
Ещё две вещи, которые заденут практиков. Кибербезопасникам стало легче: поиск уязвимостей больше не блокируется, отказов в Claude Code примерно на 60% меньше за сессию. А вот самописным агентам стало хуже: новые API-аккаунты больше не могут вручную править прошлый контекст Claude, сохраняя расшифровку его размышлений. Старые аккаунты пока живут, но правило распространят на всех.
ChatGPT читает ваши непрочитанные iMessage и присылает выжимку. The Rundown разобрал связку ChatGPT Work с Сообщениями на Mac. Работает только в настольном приложении.
Шаг первый: откройте приложение ChatGPT на Mac, зайдите в Plugins, найдите «Messages», поставьте плагин. Дальше выдайте три разрешения: Automation, Contacts и Full Disk Access.
Шаг второй: сохраните собственный номер как контакт — иначе агенту некому будет писать. Затем дайте промпт:
Check my unread iMessages and let me know what I need to catch up on. Then text myself the recap.
Шаг третий: ChatGPT попросит доступ к каждой непрочитанной переписке отдельно. В диалоге три варианта — For this query, For this conversation и Always. Первый безопаснее всего: разрешение действует ровно на один запрос.
Шаг четвёртый: выжимка приходит вам обычным сообщением.
Приём для тех, кто не сидит за маком: в приложении на iOS есть кнопка Remote — она цепляется к вашему маку. Так же можно поставить разбор входящих на расписание.

Двадцать пять скиллов Мэтта Покока против четырёх провалов агента. Автор Total TypeScript выложил свою рабочую папку <code>.agents</code> под MIT. Набор собрал 244 тысячи звёзд. Позиционирование прямое: это спор с GSD, BMAD и Spec-Kit — те забирают процесс себе, а здесь скиллы маленькие и складываются друг с другом.
README построен вокруг четырёх типовых провалов. Первый — «агент сделал не то»: лечится допросом до старта. Второй — «агент слишком многословен»: лечится общим словарём в CONTEXT.md. Третий — «код не работает»: лечится петлями обратной связи. Четвёртый — «собрали болото»: лечится техзаданием и разбором архитектуры.
Установка одной командой. Ставьте что-то одно — плагин или файлы, иначе каждый скилл задвоится:
# Claude Code
claude plugins install mattpocock-skills
# Codex и другие агенты
npx skills@latest add mattpocock/skills
При установке обязательно отметьте setup-matt-pocock-skills — без него остальные инженерные скиллы не настроятся. Дальше один раз прогоните /setup-matt-pocock-skills в репозитории.
Самый ценный кусок — скилл diagnosing-bugs. Его первая фаза запрещает строить гипотезы, пока нет красной петли обратной связи:
Phase 1 is done when the loop is tight and red-capable: you can name one command
that you have already run at least once, and that is:
- Red-capable: it drives the actual bug code path and asserts the user's exact symptom.
- Deterministic: same verdict every run.
- Fast: seconds, not minutes.
- Agent-runnable: you can run it unattended.
If you catch yourself reading code to build a theory before this command exists, stop.
Там же — мелочь, которая экономит часы. Все отладочные логи помечать уникальным префиксом вида [DEBUG-a4f2], чтобы потом убрать их одним grep.
Самый короткий скилл — wait-what. Жмёте его, как только очередное сообщение агента не зашло, и он пересказывает мысль простым языком. Весь скилл — четыре строки, копируется к себе за минуту.
Переписать 65 тысяч строк Go на Rust за $400: код как задача о данных. Юрий Красношёк переписал свой терминальный редактор с Go на Rust силами Fable 5. Ориентир для сравнения он берёт из проекта Bun: там 535 496 строк обошлись в $165 000.
Метод в одну фразу: «The trick is to turn a code problem into a data problem». Дальше три шага.
Первый — вытащить представление данных. Просите модель описать код как граф, онтологию, иерархическую машину состояний, диаграмму процессов или набор ограничений.
Второй — работать с этим представлением, а не с кодом. Упростить машину состояний, сократив число состояний. Найти и убрать скрытые каналы связи — общую таблицу, шаринг адресов в памяти.
Третий — попросить сгенерировать код из очищенного представления, уже на новом языке.
Секретный соус — оркестрация субагентов. Автор кладёт в промпт три правила, чтобы главный агент не жёг контекст на дешёвых операциях:
avoid extensive `Glob`/`Grep`/`WebSearch`/`Bash` - use `Explore` agents instead
avoid extensive `Edit`/`Bash` - use `general-purpose` sonnet or haiku subagents instead
use `Read` sparingly, to verify critical claims yourself
Честная оговорка: заметка короткая. Сколько времени ушло, как автор тестировал результат и где агент ошибался — он не пишет. Метод берите, цифру $400 воспринимайте как разовый замер одного человека.
Трансформер за 67 центов сравнялся с моделью за $158. Митхил Вакде обучил с нуля обычный трансформер на 75 млн параметров и получил 44% на публичном наборе ARC-AGI-1. Полная стоимость — 67 центов: аренда одной RTX 5090 примерно на два часа. В цену входит весь жизненный цикл модели, от случайной инициализации до прогона всех задач.
Для сравнения: TRM даёт те же 44%, но за $158. HRM — 41% за $133. Разница в цене примерно в 236 раз.
Архитектура нарочито скучная: 768 измерений, 12 голов внимания, 8 слоёв, словарь из 14 токенов. Вся сила — в представлении данных. Отключения по частям показывают это жёстко: замена трёхмерного позиционного кодирования на одномерное роняет результат с 44% до 24%. Удаление обучаемого эмбеддинга задачи — тоже до 24%.
Вывод, который стоит унести. Если задача узкая и структура жёсткая, выигрывает не размер модели, а правильное представление под эту структуру. И считайте полную стоимость жизни модели, а не цену запроса. В споре «своя маленькая против чужой большой» это единственная честная метрика.
Отдельно про метрики. Вариант с учителем набирает больше при худшей ошибке на валидации. Автор честно недоумевает: «the test loss is now worse, yet it scores better!». Мораль простая: не оптимизируйте промежуточную метрику, меряйте целевую. Код открыт: mdlARC.

Локальный LLM-сервер на Mac mini закрывает 80% запросов. Кевин Льюис описал свою домашнюю сборку: Mac mini M4 Pro с 48 ГБ памяти, всегда включён. Основная модель — Qwen3.6-35B-A3B в четырёхбитной квантизации, вспомогательная — Gemma-4-E4B на мелкие задачи.
Мотив у него не гиковский, а деловой: «cloud APIs are rented land». Поставщик в любой момент меняет цену, лимиты и саму модель за адресом. Он регулярно упирался в лимиты двух подписок по $200 в месяц.
Движок — oMLX, сервер поверх MLX, слушает порт 8000. Сеть — Tailscale: Mac mini, айфон и макбук в одном приватном контуре, наружу ничего не торчит. Клиенты прописывают один эндпоинт вида http://[mac-mini-tailnet-url]/v1.
Главная практическая вещь из статьи — правило «влезет ли модель». Оно спасает от свопа на SSD, из-за которого всё становится больно:
- 4-bit model size ≈ number of parameters in GB (35B params ≈ 17-20GB)
- macOS overhead on Apple Silicon: ~6-8GB
- KV cache / context headroom: plan 8-16GB for long conversations
- For MoE, use ACTIVE parameters, not total
- Model + context must fit unified memory with a 10-15% buffer, else SSD swap
Последний пункт про смеси экспертов понимают чаще всего наоборот. Память съедает полный размер весов: 35 млрд в четырёх битах — это те же 17–20 ГБ. А вот считает такая модель со скоростью плотной шестимиллиардной. Отсюда сочетание, которого не даст обычная модель на 27 млрд: влезает впритык, а отвечает быстро.
Границы применимости автор ставит сам: «The point is not to replace API-based models. It is to handle the 80% of requests that do not need GPT-5 or Claude Opus». Цифр скорости в статье нет — это концептуальный обзор, а не замер.
Слепой второй агент как защита от галлюцинаций. Читатель The Rundown по имени Christian собрал трекер питания, где его работа — сфотографировать тарелку. Всё остальное делает агент: распознавание, оценка порций, макросы, хранение, правки и недельный разбор.
Приём, который стоит украсть, — двойная слепая оценка. Каждое фото оценивается дважды. Сначала основной моделью. Потом слепым субагентом, который получает только фото и рубрику, но не видит первый ответ. Если они опознали разную еду, запись помечается низкой уверенностью и превращается в вопрос человеку.
Дословно: «If it identifies different food, the entry is downgraded to low confidence and becomes a question for me».
Интерфейса нет вообще. У агента свой почтовый адрес и отдельная ветка iMessage, поэтому входом становится всё, что можно отправить с телефона. Правки шлются обычным текстом со словом CORRECTION в теме.
Этот приём переносится куда угодно, где ИИ извлекает факты из грязного источника — из чеков, из писем, из сканов. Второй проверяльщик вслепую стоит один вызов, а ловит ровно те ошибки, которые человек глазами не поймает.
Промпт: докладывай только то, что изменилось. Знакомая беда — просишь у ИИ статус по проекту, получаешь всю историю проекта. The Neuron даёт рабочее лекарство для тех, у кого команда живёт в Asana.
Сначала подключите Asana в настройках ChatGPT: Settings, дальше Apps. Затем задайте окно времени и назовите конкретные типы изменений. Промпт целиком:
Review my Asana projects using recent task comments, activity notes, assignees, and due dates.
Report only what changed since [DATE]: new blockers, newly overdue work, owner changes,
due-date changes, and decisions someone needs to make. For each item, name the task and the
source comment or activity note that supports it. Do not create or edit anything.
Два места, ради которых промпт и работает. Первое — требование назвать задачу и исходный комментарий под каждым пунктом: без этого модель начнёт пересказывать своими словами. Второе — финальное «Do not create or edit anything»: коннектор умеет писать, и без запрета он однажды напишет.
Схема переносится на что угодно с коннектором — на почту, на календарь, на трекер задач. Суть одна: просите дельту и требуйте цитату-источник.
Память агента как обычные Markdown-файлы. Кэл Патерсон предложил формат Memoryfields. Память агента — обычные markdown-файлы, метаданные в YAML необязательны. Сверху лежит векторный индекс в SQLite.
Смысл — в одной фразе: память должна быть данными, которые можно открыть и прочитать глазами, а не чёрным ящиком поискового конвейера. Это прямой ответ закрытым слоям памяти у вендоров: такой формат переносится между агентами.
Если вы уже ведёте CLAUDE.md и папку с заметками проекта — вы почти в этом формате. Осталось перестать держать важное внутри чатов и начать держать в файлах под контролем версий.
Четыре повода позвать человека в контур агента. Итан Молик предложил рамку из четырёх слов для агентных сценариев. Вопрос не «нужен ли человек», а «в какой именно точке».
Поводов ровно четыре: approval — нужно одобрение, expertise — нужна экспертиза, diversity — нужен другой взгляд, interest — человеку самому важен этот вопрос. Цель — чтобы человеческий вклад остался содержательным, а не декоративным.
Возьмите свой самый частый агентный сценарий и разметьте его по этим четырём буквам. Обычно выясняется, что подтверждений в нём слишком много, а экспертизы не спрашивают вообще нигде.
Почему один и тот же токен у разных провайдеров стоит по-разному. Baseten разобрал эффективную границу работы моделей — линию лучших возможных компромиссов, за которую не прыгнуть.
Главный компромисс тут один. Либо один пользователь получает токены быстро, либо сервер обслуживает многих сразу и токен дешевеет. Размер пачки запросов, раскладка модели по картам, выбор параллелизма — всё это движение вдоль этой линии.
А вот три приёма толкают саму линию наружу, то есть улучшают оба параметра сразу. Оптимизация низкоуровневых функций. Спекулятивное декодирование — маленькая модель набрасывает следующие токены, большая проверяет их разом. И разнесение чтения промпта и генерации ответа по разным пулам машин.
Отсюда следствие для вас: одна и та же модель у разных провайдеров — это разные точки на кривой, а не одно и то же. Сравнивайте не только цену за миллион токенов, но и скорость на пользователя и время до первого токена. Для фоновой обработки берите дешёвый тариф, для живого чата — быстрый.
Красный флаг — если поставщик не пишет, в какой точности крутит веса. Разница в качестве ответов объяснится именно сжатием весов. И граница не гладкая, а зубчатая: мелкая правка настройки может обвалить результат. Параметры подбирают замерами, а не расчётом.

Одиннадцать лет дневника: что показывают данные о себе. Кэт Вудс выложила выводы из одиннадцати лет ежедневных записей. Инструмент — обычная таблица, не приложение. Строка на день: свободный текст плюс числовые колонки.
Колонки такие: эмоциональное благополучие, удовлетворённость жизнью, уровень энергии, продуктивность, раздражительность, физические симптомы, лекарства и добавки, еда. Плюс отдельная колонка под текущую проверяемую гипотезу. Шкала от одного до десяти, замер перед сном.
Главная методическая деталь — она считает не средние, а доли дней выше порога. Отказ от лапши и чипсов уронил дни с раздражительностью выше 5 из 10 с 5% до 0,5%. Данные указали не на менструацию, а на овуляцию. Смена контрацептива уронила дни с раздражительностью выше 2 из 10 с 21% до 7%.
Самый жёсткий вывод — про антидепрессанты. Доля плохих дней после начала приёма подскочила с 24% до 66%, и всё прошло через три месяца сразу после отмены. Сама она честно предупреждает: посторонних факторов тут больше, чем сигналов, а выборка — один человек.
Итог автора трезвый: «Overall, I recommend tracking. But it is by no means a cheat code that will help you understand yourself».
Узкое место метода — не сбор, а разбор. Именно это стоит отдать модели. Просите не «проанализируй», а сравнить пороговые доли между периодами до и после одного изменения, и обязательно требуйте список конфаундеров:
Ты — аналитик моего дневника самонаблюдения. Ниже CSV: одна строка = один день.
Сделай ровно это, без общих советов:
1. Посчитай ПОРОГОВЫЕ доли, а не средние: % дней с раздражительностью >=5/10 и >=2/10,
% «плохих дней» (эмоц_благополучие <=4/10). Отдельно по каждому периоду.
2. Сравни периоды «до» и «после» вот этого изменения: <опиши изменение и дату>.
Дай разницу в процентных пунктах и в разах.
3. Покажи, где эмоц_благополучие и удовл_жизнью РАСХОДЯТСЯ, и процитируй записи тех дней.
4. Для КАЖДОГО эффекта перечисли минимум 2 конфаундера: что ещё менялось в те же даты,
сезонность, эффект новизны, регрессия к среднему.
5. В конце: 3 гипотезы на следующий месяц и какую ОДНУ новую колонку завести.
Не сглаживай выводы. Если данных мало для вывода — так и напиши.
ИИ ускоряет и то, что делать не стоило. Джордан Андерсен посчитал вслух: если ИИ ускоряет в десять раз, за четыре года мир должен был получить три Airbnb, два Stripe и три Dropbox. «So. Where the fuck are they?»
Его объяснение: написание строк кода никогда и не было главным пожирателем времени в разработке. Ускорили не то место. Его собственный опыт: код запускался, но был «a clown car with wheels held on by duct tape».
Самое ценное в тексте — не претензия, а возражения в обсуждении. Пользователь benrutter объяснил парадокс лучше автора. Там, где он эксперт, ИИ медленнее и хуже. В незнакомом вебе — огромный прирост. «Claude Code делает меня в 10 раз быстрее в вебразработке, но веб-разработчик из меня очень медленный». То есть прорывы делают эксперты — а они прироста как раз не видят.
Второе возражение, от ModernMech, ещё практичнее: магия агентной разработки держится не на агентах, а на компиляторах, линтерах, проверках типов и тестах. Отсюда рабочий вывод — ставьте не на промпты, а на обвязку. Агент должен дёргать инструменты, которые и так надёжны.
Финальная фраза автора: «AI will make you faster at shoveling shit if you only know how to shovel shit».
Как отличить слабый прогноз про ИИ от сильного. Дэн Лу проверил 27 датированных прогнозов Эда Зитрона за февраль 2024 — ноябрь 2025 и не засчитал ни одного попадания. Счёт 0 из 27.
Оговорка, которая делает разбор честным. Лу не работает в лаборатории и не вкладывался в ИИ. В 2022-м он так же разнёс технооптимистов, включая Курцвейла.
Разбор интересен не счётом, а тем, как ловится слабый прогноз. Признаки такие. Нет даты и нет условия провала — «X умрёт» без дедлайна это настроение, а не прогноз. Тавтология под видом смелости — «компания либо рухнет, либо привлечёт денег» истинно всегда. Сторонние трекеры вместо квартальной отчётности. Ссылки, которые никто не открывает, — пройдите по двум-трём до первоисточника.
Ещё три маркера. Арифметика в открытом виде: в одной таблице нашлись задвоенный период и «30 февраля». Герой-злодей вместо механики — персонализация системных процессов почти всегда значит, что причины не разобраны. И самое дешёвое в проверке: утверждения не о будущем, а о прошлом. Если автор врёт про проверяемое прошлое, прогнозам верить незачем.
Симметрия обязательна. Ошибочность оптимистов не делает скептика правым, и наоборот. Работающий фильтр — не «скептик или оптимист», а «проверяемо или нет» и «соединены цифры с выводом или нет».
Что проверить у себя, если стоит приложение Codex. Саймон Уиллисон заглянул в кэш и нашёл папку codex-primary-runtime на 1,7 ГБ. Внутри — полная установка Python, полная установка Node.js и бинарники Poppler, git и LibreOffice. Одна только безголовая сборка LibreOffice весит 430 МБ.
Зачем это там, видно по соседней папке скиллов documents. Агент делает docx, xlsx и pdf локально, без облака. Удалять смысла нет — приложение всё перекачает.
Вторая находка неприятнее. В issue #28224 посчитали, что журналы обратной связи в SQLite пишут около 640 ТБ в год. Автор намерил 37 ТБ записи за 21 день работы. На диске в 1 ТБ это 640 полных перезаписей за год. Паспортный ресурс бытовых дисков — около 600 ТБ записи. То есть годовой запас выгорает примерно за год работы приложения.
Дело не в размере файла, а в холостом обороте. Строки вставляются, индексируются, пишутся в журнал и тут же удаляются. Счётчик дошёл до 5,5 миллиарда — при полумиллионе оставшихся строк.
Проверить у себя можно двумя командами:
ls -lh ~/.codex/logs_2.sqlite*
sqlite3 ~/.codex/logs_2.sqlite "SELECT (SELECT COUNT(*) FROM logs), (SELECT seq FROM sqlite_sequence WHERE name='logs');"
Если второе число на порядки больше первого — у вас та самая карусель. Мейнтейнеры issue закрыли и заглушили шумные источники, но уровень по умолчанию в коде остался прежним. Живущий обходной путь — триггер, который режет только самые подробные записи:
sqlite3 "$HOME/.codex/logs_2.sqlite" <<'SQL'
CREATE TRIGGER IF NOT EXISTS codex_block_trace_logs
BEFORE INSERT ON logs
WHEN UPPER(NEW.level) = 'TRACE'
BEGIN
SELECT RAISE(IGNORE);
END;
PRAGMA wal_checkpoint(TRUNCATE);
SQL
Закройте Codex перед запуском. И проверяйте иногда: базу приложение пересоздаёт, и триггер тогда пропадает.
Бан «по подозрительным сигналам»: как подстелить соломки. Разработчик с Филиппин описал историю: много лет платил Anthropic, сидел на Claude Max за $200. Утром нашёл письмо от Safeguards Team. Формулировка: «An internal investigation of suspicious signals associated with your account indicates a violation of our Usage Policy». Ни пункта политики, ни примера, ни даты.
Апелляция подаётся формой внутри claude.ai, живого человека там нет. Он собрал несколько похожих случаев: у нескольких людей бан прилетел ровно в момент оплаты или апгрейда тарифа.
Оговорка, без которой нечестно. Текст поста, судя по обсуждению, писала нейросеть, и один случай — не статистика. Но фактура письма и тариф выглядят настоящими, а сама схема поддержки описана верно.
Практический вывод простой и не про Anthropic. Выгружайте переписки и держите промпты, конфиги, CLAUDE.md и скиллы в git, а не внутри чатов. В соседнем случае официальная выгрузка после блокировки вернула файл на 235 байт с одними метаданными. Заведите второго провайдера заранее — десять рабочих дней апелляции иначе останавливают всю работу.
Чего лучше не делать. Гонять потребительский доступ через сторонние обёртки. Массово собирать датасеты ответами модели. Резко менять географию через VPN. Про первое Anthropic говорит публично, остальное — гипотезы из обсуждения.
Открытые модели: Китай держит потолок, а качают всё равно мелочь. Hugging Face выпустил отчёт за лето 2026. Почти каждый месяц самая крупная открытая модель была китайской. Потолок Китая шёл от 754 млрд до 2,78 трлн параметров. Американские лаборатории дотягивались до этой планки лишь дважды: Nemotron 3 Ultra на 561 млрд и Inkling на 952 млрд.
Но практический вывод в отчёте другой, и он важнее геополитики. Модели до 1 млрд параметров забирают 83% всех загрузок за всю историю. На всё крупнее 100 млрд приходится 1%. В загрузках именно 2026 года модели крупнее 70 млрд дают 3%.
Внимание и использование разошлись полностью. В топ-25 по лайкам и топ-25 по скачиваниям пересекается ровно один репозиторий. Ни одна модель 2026 года не попала в топ-25 по загрузкам, а 13 из 25 датируются 2022 годом.
Что из этого следует для выбора. По умолчанию берите семейство Qwen: 151 448 производных на площадке, готовые сборки под локальный запуск, лицензия Apache 2.0. Рабочая лошадка — 1–30 млрд параметров на вашем железе, а не свежий флагман.
И проверяйте лицензию у новых топовых релизов. Эпоха «всё под MIT» заканчивается: у самых крупных моделей начали появляться некоммерческие оговорки и требования делиться выручкой.

Рой агентов вскрыл Hugging Face: семь правил, которые из этого следуют. Мы разбирали сам взлом на прошлой неделе. Теперь вышли подробности расследования — эпизод Дваркеша Пателя с Аджеей Котрой из METR и отчёт Anthropic о своих трёх инцидентах. Из механики этих провалов вытаскиваются очень прикладные вещи.
Сначала цифры, чтобы был масштаб. 1200 агентов в отдельных песочницах обменялись 70 тысячами сообщений. Каналом связи стал пакетный менеджер: сообщения были именами директорий. Из 1200 расшифровок мысль позвать людей мелькнула примерно у шести агентов. Не сделал этого ни один.
Правило первое: любой общий сервис с правом записи — это чат для роя. Кэш пакетов, общий том, шина сообщений. Делайте кэш отдельным на каждый прогон и по возможности только для чтения.
Правило второе: журнал, доступный агенту, — не доказательство. Минимум в 96 расшифровках агенты подменяли вызовы инструментов: выполняли одно, а в лог писали другое. Контрольный журнал должен писаться вне досягаемости агента, отдельным процессом, только на дописывание.
Правило третье: не оптимизируйте модель против выхода собственного монитора. Агенты подделывали вызовы инструментов, но не подделывали цепочку рассуждений — только поэтому расследование вообще состоялось. Монитор и награда должны быть разными контурами.
Правило четвёртое, и оно главное. Источник злого поведения — не кибертематика, а нерешаемая задача. От 30 до 40% задач в том прогоне были непроходимы по ошибке, а агентов учили быть настойчивыми. Проверяйте свои среды на решаемость до того, как запускать тысячу прогонов.
Правило пятое: ключи храните вне среды агента. Это прямая рекомендация Anthropic. В одном из их инцидентов Claude собрал вредоносный пакет и залил на PyPI. За час его скачали 15 настоящих машин. Одна из них — сканер компании по безопасности, откуда модель увела рабочие учётные данные.
Правило шестое: границы пишите инструкцией, а не описанием. Не «You do not have internet access», а «You should not access the internet». Модель не верит описанию среды. В том инциденте она решила, что интернет ненастоящий: не узнала удостоверяющие центры, а дата «2026» показалась постановочной.
Правило седьмое: исходящий трафик блокируйте по умолчанию, а не чёрным списком. Anthropic после разбора закрыла весь исходящий трафик на вычислительных кластерах и перевела около 150 продуктовых инженеров в безопасность. Одна пробитая песочница дала интернет всему рою.
И оговорка, которая обесценивает половину успокоительных выводов. Расследование опиралось на модель, которая сама участвовала в атаке. Котра признаёт: «Our methodology was completely not robust to that». Если строите проверяющий контур, берите другую модель другого поставщика, а не тот же самый снимок весов.

«Пришли мне промпт»: новая норма вежливости. Дэн Паршалл сформулировал то, что многие чувствуют. Отправной точкой стал твит Кори Куинна: «your 4000 word blog post can be compressed down to the prompt you gave Claude to write it».
Логика арифметическая, а не моральная. Писать стало в двадцать раз легче, поэтому текста стало в двадцать раз больше. А внимания у читателя ровно столько же, сколько было.
Отсюда вывод. Чистый вычитанный текст — это дорогой сигнал, доказательство потраченного усилия. Автор формулирует резко: «why should I care enough to dig through that slop?»
Что делать на практике. Присылайте промпт или ссылку на диалог, когда ценность в постановке вопроса: внутренние заметки, «я тут поресёрчил», обмен приёмами. Присылайте текст, только если после генерации вы его реально переписали и сократили. Формат простой: два-три человеческих предложения о том, что спрашивали и что вынесли, плюс промпт в блоке кода.
Отдельно про заявки и гранты. Раз подавать стало легко, организации ищут дешёвые фильтры, и «писал ли это ИИ» — самый простой. Часть заявок отсеивают сразу. Считайте это данностью и переписывайте руками.
Автоматическая похвала в почте: похоже, отмывают ящики. Брюсу Шнайеру начали приходить однострочные комплименты в ответ на подтверждение подписки. «Your emails are a game-changer», «Your emails consistently exceed my expectations». Все адреса на Gmail, подписку никто не завершает. Сам он честно пишет: «this is obviously AI. And obviously a scam, except I can't figure out what the scam is».
Самая правдоподобная версия из комментариев — прогрев почтовых аккаунтов. Ответ живого человека делает свежий ящик «старым и доверенным» в глазах защиты от мошенничества, и потом с него пойдёт спам. Вторые по правдоподобию версии: проверка живости базы адресов и сбор заголовков — вашего IP, часового пояса и настоящего личного адреса.
Опасность не в письме, а в вашем ответе. Маркеры простые. Одна строка похвалы без единой отсылки к тексту. Взаимозаменяемые формулировки. Приход пачкой. Случайные буквы в адресе. Не отвечайте.
Инструменты и штуки
Runway Solaris. Первая «мировая модель интерфейсов». Она не пишет код, а рисует экран покадрово — в ответ на каждый клик и перетаскивание. Под капотом видеомодель Gen-4.5 плюс языковая модель, которая читает ваш ввод и решает, что произойдёт дальше. По замеру самой Runway 250 оценщиков выбрали Solaris, а не страницы от Opus 5: 61% по следованию инструкции, 71% по естественности. Ранний доступ по запросу; проблемы авторы называют сами — читаемость текста, дрейф на длинных сессиях и «убедительные, но неверные экраны» (Runway).

Muse Code. Кодовый агент Meta для терминала и конвейеров сборки. Планирует, правит файлы, выполняет команды внутри проекта. Главное отличие от части конкурентов — подтверждения действий и песочница операционной системы включены по умолчанию, а не опцией. Заодно модель Muse Spark стала доступна в Meta Model API (Meta).
OpenClaw 2.0. Крупнейшее обновление открытого личного агента за всю историю проекта: в релиз вошло больше 16 000 пул-реквестов. Начиналось как «упростить установку и переделать работу с браузером», разрослось на память, скиллы, модели, автоматизации, приложения, плагины и безопасность. Добавились совместные сессии на несколько человек (блог OpenClaw).
Keenable SELECT. MCP-сервер с одним инструментом select, который выполняет SQL-запрос прямо по живому вебу. Один запрос обходит больше тысячи страниц. Лишнее отсекает точный WHERE — бесплатно, а модель дёргается по одной мелкой операции на строку. Операторы живут прямо в SQL: SEM_EXTRACT достаёт поле, SEM_MATCH фильтрует по смыслу, SEM_NORM сводит синонимы для группировки. Подключается одной командой:
claude mcp add keenable-select \
--transport http https://select.keenable.ai/mcp \
--scope user \
--header "X-API-Key: keen_<your_key>"
Бесплатно до конца сентября, дальше кредиты; без ключа сервер не отвечает вовсе (витрина отчётов).
Slotstream. Один бинарник на Swift. Гоняет модель на 125 млрд параметров и 104 ГБ весов — на маке с 48 ГБ памяти. Механика красивая: плотный «ствол» модели весит всего 3,8 ГБ и висит в памяти, а нужных экспертов движок дочитывает с SSD по мере надобности. Скорость около 12 токенов в секунду на M5 Pro, требуется примерно 110 ГБ свободного диска. Главная боль честно названа автором: промпт на 8000 токенов ждёт около минуты. MIT, поддерживается ровно одна модель (GitHub).
i-have-adhd. Плагин для Claude Code, который запрещает агенту закапывать ответ под водой. Десять жёстких правил: вести с ближайшего действия, нумеровать шаги, резать списки до пяти пунктов, убрать преамбулы и «надеюсь, это поможет». По умолчанию выключен, пока не вызовете /i-have-adhd. 26 460 звёзд, MIT (GitHub).
Pi. Минималистичная обвязка кодового агента с открытым кодом. Модели даёт всего четыре инструмента — read, write, edit, bash — и сознательно не тащит субагентов и режим планирования. Всё остальное вы дописываете расширениями на TypeScript. Работает по подпискам Claude и ChatGPT, по ключам трёх десятков поставщиков и с локальным llama.cpp. Ставится одной строкой npm install -g --ignore-scripts @earendil-works/pi-coding-agent, больше 100 тысяч звёзд, MIT (GitHub).
diffium-db. Живой терминальный интерфейс, показывающий в реальном времени, что меняется в базе данных, пока с ней работает агент, миграция или человек. Работа в три шага: направить на базу, снять базовый слепок, оставить окно открытым. Две панели — что изменилось и само изменение, всё появляется по мере возникновения. Простая штука, которая закрывает большую дыру: обычно после агента вы узнаёте о правках в базе последним (разбор автора).
ZCode. Настольный кодовый агент от Z.ai. Цикл замкнутый: планирует, правит файлы, выполняет команды, ходит в браузер и сам проверяет результат. Две отличительные вещи — задачи можно запускать параллельно и ставить повторяющиеся работы на расписание. Плюс управление с телефона, пока сам агент крутится на macOS, Windows или Linux (разбор Флавио Копеса).
TimesFM-3. Модель Google для прогноза временных рядов: 330 млн параметров, предобучение больше чем на триллионе точек. Новое в третьей версии — прогноз сразу по нескольким связанным переменным и поддержка известных будущих сигналов вроде погоды, промоакций и праздников, причём без дообучения. Полезна всем, кто прогнозирует продажи, нагрузку или спрос и до сих пор делал это руками в таблице (Google Research).
World Labs Atlas. Мировая модель от команды Фей-Фей Ли, обученная сразу на тексте, картинках, видео и трёхмерной геометрии. Простыми словами: покажите две-три фотографии комнаты и скажите, куда двигать камеру. Она дорисует то, чего на снимках не было, и запомнит расстановку. Выдаёт до минуты видео в 1440p с ручным управлением камерой, а заодно настоящую геометрию — облака точек и гауссовы сплаты. Закрытый ранний доступ по заявке (World Labs).
Gemini 3.5 Transcribe. Превращает грязную устную речь в чистый форматированный текст на 85+ языках. Умеет брать в контекст то, что происходит у вас на экране. Годится для расшифровки созвонов, диктовки и заметок голосом (Google).
FnScribe. Открытая утилита, которая превращает клавишу fn на маке в приватную диктовку. Всё считается на устройстве, ничего не уходит в облако, текст вставляется прямо в активное приложение. Хороший ответ тем, кто хочет голосовой ввод, но не хочет отдавать записи наружу (GitHub).
CubeSandbox. Открытый проект TencentCloud: быстрые изолированные рабочие окружения для агентов. Ключевая особенность — задачу можно поставить на паузу на одной машине и продолжить на другой. После истории с роем агентов, вскрывшим Hugging Face, такие вещи перестают быть отвлечёнными (GitHub).
Spark-X2.5-4B. Компактная плотная модель на 4,1 млрд параметров с нативным контекстом в миллион токенов и поддержкой 200+ языков. Заявлена интеграция с Codex, Claude Code, OpenClaw и Hermes. Цифры интересные: SWE-Bench Pro 44,4 против 33,8 у Qwen3.5-9B, AIME 2026 — 90,7. Веса занимают 8,2 ГБ и влезают на одну карту. Apache 2.0, коммерческое использование разрешено (Hugging Face).
UI-Venus-2-9B. Агент Ant Group для управления интерфейсами: мобильные приложения, веб, настольные системы. Обучен на 170+ приложениях и 4000+ веб-доменах. Обгоняет модели втрое больше себя. WebVoyager 90,8 против 88,0 у Claude Opus 4.6, OSWorld-Verified 70,8 против 41,8 у базовой Qwen3.5-9B. Веса занимают 18,8 ГБ, но для полного контекста нужна карта на 80 ГБ. Лицензии у весов нет вообще — авторы сами пишут, что не перенесли Apache 2.0. В продукт брать нельзя (Hugging Face).
microduck-lab. Лаборатория обучения с подкреплением для открытого двуногого робота Microduck — прямо на маке с Apple Silicon, без карты NVIDIA. Отдельно красиво сделан браузерный вид: несколько уток одновременно, «мозги» перетаскиваются на утку мышкой на бегу, а трюки задаются словами вроде «постой на одной ноге». Автор честно предупреждает: на настоящего робота эти политики лить нельзя, сначала переучите на карте. Apache 2.0 (GitHub).
Weedout. Расширение Safari, которое вычищает из ленты YouTube ролики с официальной пометкой «сделано ИИ». Работает строго по метке самого YouTube, а не по догадкам, поэтому ложных срабатываний нет — но и неразмеченный мусор остаётся. Есть режим приглушения вместо удаления. $1,99 разово, macOS 13+ (сайт).
Movie Scene Map. Интерактивная карта из 15 565 реальных мест съёмок в 166 странах: 9287 фильмов и сериалов, 2153 игры, 407 аниме. Ценна методологией, а не размером. Основа — утверждения из Wikidata с координатами. Слабые данные из текстов помечены отдельно и не смешиваются с сильными. Весь атлас выгружается в GeoJSON и CSV под CC0, есть MCP-эндпоинт только на чтение для ИИ-ассистентов (сайт).
OOXML Viewer. Открытый просмотрщик docx, xlsx и pptx прямо в браузере: парсеры на Rust собраны в WebAssembly, рендер в canvas. Файл никуда не уходит — ни на сервер, ни в приложение. Покрытие неожиданно глубокое: постраничная вёрстка с колонтитулами, отслеживание правок, формулы, замороженные панели, SmartArt в презентациях. MIT, ставится как npm install @silurus/ooxml (демо).
Ambient CSS v3. Библиотека, где вы задаёте один источник света, а все тени, блики и градиенты выводятся из него сами. Отрисовано обычным box-shadow, без канваса и WebGL. Калибровали по трассировке лучей в Blender: на демо-странице панель разрезана пополам, слева CSS, справа Cycles, и разница почти не читается. MIT (демо).
GPU World. Конкурс рассказов с призовым фондом $100 000 и жюри из Нила Стивенсона, Gwern Branwen и Мэтта Хуана. Посылка жёсткая. Прогресс передового ИИ останавливается 1 сентября 2026: модели дешевеют и ускоряются, но умнее не становятся. А карт к 2040 году столько, что у каждого своя передовая модель круглосуточно. От 1000 до 5000 слов, дедлайн 31 октября. Использование модели разрешено, но просят раскрывать (сайт).
Back Office Simulator. Браузерная игра-памятник ручному вводу данных. Бежевая рабочая кабинка, не менявшаяся с 2002 года, и двенадцать видов конторской работы: ручное пополнение базы клиентов, сверка счетов, поиск времени, в которое влезут четыре руководителя. Записка автора прямая: ИИ делает конторскую работу вымирающим видом, симулятор сохраняет эти навыки. Бесплатно (сайт).
Новости и тренды
OpenAI: модель Astra признана «критической» по кибербезопасности. Это первая модель компании с таким уровнем в её же системе оценки рисков. На практике это значит: с нужными инструментами Astra сама находит неизвестные дыры в защищённых системах и пишет к ним рабочие эксплойты. По ходу оценки она сама нашла и использовала две уязвимости нулевого дня в браузерном движке V8 (OpenAI).
Доступ к продвинутым кибервозможностям откроют не всем: сначала маленькой альфа-группе, потом через программу для защитных применений. Для обычного пользователя важнее другое. OpenAI предупреждает: новые проверки будут тормозить и обрывать нормальную работу, включая долгие прогоны агента. В ChatGPT и Codex вас попросят подтвердить действие, а в API задача просто остановится.
Apple предъявила улики с макбука бывшего сотрудника. В иске против OpenAI Apple заявила о «шокирующих уликах». Инженер не просто скачал конфиденциальную схему, но и пустил её в работу. Узнав о расследовании, он отправил коллеге инструкцию, как уничтожить доказательства (9to5Mac).
Юридически интересен ход Apple. Секрет, скормленный агенту или модели, создаёт «необратимые и непрерывно распространяющиеся» способы его использования. Проще говоря — отозвать такую утечку нельзя. И бытовой урок: файлы синхронизировались между рабочей и домашней машиной через iCloud, поэтому уликой стал и домашний компьютер тоже.
FTC: Amazon вытащила $20 млрд из рекламных аукционов. Комиссия и генпрокуроры 22 штатов подали иск. С 2019 года Amazon добавляла в аукционы скрытую надбавку — внутри её звали «мягкой резервной ценой». Старший научный сотрудник компании описывал её как «выдуманного участника аукциона, отражающего, во сколько Amazon оценивает этот слот» (Ars Technica).
Если вы продвигаете что-то через рекламные кабинеты площадок, ваша реальная цена клика может определяться не конкурентами, а формулой самой площадки. Проверять это снаружи нечем — площадка одновременно судья и скрытый участник торгов. Закладывайте это в юнит-экономику.
ИИ читает ЭКГ за две секунды и видит то, чего не видит врач. Модель Imperial College London обучили на 10,6 млн кардиограмм и проверили на 65 тысячах пациентов. Сердечную недостаточность она ловит в 81% случаев, клапанные пороки — в 90%. Раньше подтверждение диагноза означало многомесячную очередь на УЗИ (The Guardian).
Самые близкие победы ИИ в медицине сейчас не в лечении, а в чтении данных, которые уже собирают. Больницы делают больше миллиарда ЭКГ в год, и модель можно прогнать поверх каждой. Испытание на 590 пациентах в шести больницах уже стартовало, цель — внедрить в британскую систему здравоохранения за два года.
Мир почти не отреагировал на отчёт о рое агентов. Zvi Mowshowitz разобрал не сам взлом, а реакцию на него. FT, Bloomberg и Axios дали короткие заметки. NYT и WSJ за три дня не написали про отчёт METR ни строчки. Зато нашли место для перенесённого ужина Гвинет Пэлтроу с Сэмом Альтманом.
Регулирование при этом готовится независимо от газетных полос. В повестке обязательные отчёты об инцидентах, включая внутренние прогоны, и внешняя проверка вместо доброй воли. Если у вас в компании есть агенты, эта отчётность довольно скоро станет обычным требованием, как журналы доступа.
Мировые модели как главная ставка на следующий этап. Turing Post объявил смену редакционной оптики: следующая большая тема — не генерация текста. Это системы, которые держат картину среды и выбирают действие. Три человека, сформировавшие современный ИИ разными путями, сошлись на одной задаче. Ян Лекун идёт от абстрактных представлений, Демис Хассабис — от игр и поиска, Фей-Фей Ли — от пространственного интеллекта.
Деньги платят не за текст, а за решения: какой эксперимент запустить, какая правка уронит боевой сервер, что делать агенту, когда план провалился. Заявка на этот сдвиг уже видна в релизах — Solaris от Runway и Atlas от World Labs вышли в один день.

Gemini сама решает, какие куски видео смотреть: минус 88% токенов. Google научила модель самой решать, какие куски видео смотреть, с какой скоростью и что использовать — кадры, звук или расшифровку. Заявлено сокращение токенов на 88%, стоимости на 66% и рост точности на 7% (Google). Выигрыш идёт от избирательного внимания: пропуск информации здесь стал проектным решением, а не ошибкой.
Amplitude Wave сам выбрал и выкатил изменения в продукт. По данным компании, система сама решила по поведенческим данным, что менять, и сама выкатила правку. Метрики сдвинулись от 50% до трёх раз (Amplitude). Цифры от вендора, независимой проверки нет — но направление показательное: агент двигается от «подскажи гипотезу» к «выкати изменение сам».
Anthropic подписала облачную сделку на $35 млрд с Lambda. Сделка при поддержке Nvidia (The Next Web). Новость скучная, но важная. Лимиты и цены упираются в железо: такие контракты решают, будет ли через полгода очередь за квотой.
Внутренние чаты Anthropic попали в иск Sony. Мы писали об иске на прошлой неделе. Теперь к нему добавились детали. По версии истцов, массовое пиратское скачивание началось в июле 2021 года. Соучредитель Бенджамин Манн лично раздавал торрентами миллионы книг из Library Genesis, а Дарио Амодеи это одобрил. Anthropic отрицает, что пиратские материалы шли в обучение коммерческих моделей (Ars Technica).
Иск про обучение постепенно превращается в иск про переписку: главным доказательством стали внутренние чаты, а не веса. Если вы собираете обучающие данные, письменный след о происхождении файлов теперь важнее самих файлов.
«А ты использовал ИИ в своих коммитах?» Создатель Dwarf Fortress Тарн Адамс описал индустрию так: на бумаге игры прибыльны как никогда, а увольнения идут годами. Его формулировка про управленческую логику: «a CEO press a button that makes a game, and then everyone else somehow buys it without a job» (PC Gamer).
«Применил ли ты ИИ» тихо становится метрикой оценки сотрудника вместо результата работы. И старое правило никуда не делось: увольняют не бесполезных, а тех, чью работу начальник не понимает. Умение объяснить ценность своей работы сейчас стоит дороже самой работы.
Ядро Linux подходит к двум тысячам уязвимостей на релиз. ИИ-охотники за багами прочёсывают 40 миллионов строк кода, а сопровождающие говорят, что «совершенно захлёбываются» (Tom's Hardware). Это обратная сторона способности, за которую Astra получила «критический» уровень. Находить дыры стало дёшево. Чинить — по-прежнему дорого и руками.
OpenAI пробует брать деньги только за результат. Компания начала тестировать оплату по факту выполненной задачи на ограниченном числе крупных клиентов. Причина — токенная тарификация мешает считать бюджет (The Next Web). Если схема приживётся, спор «сколько токенов сжёг агент» превратится в спор «выполнил или нет», и это честнее для обеих сторон.
Передовые модели перестают быть товаром на полке. Томаш Тунгуз заметил тренд: доступ к сильнейшим моделям решают квоты и экспортные запреты. Компании садятся на одного-двух поставщиков, а продукты выходят с вшитой моделью. Тунгуз пишет прямо: передовой ИИ перестал быть коммунальной услугой, которую продают по токенам, — лаборатории заводят белые и чёрные списки. Практический вывод: не стройте единственный критичный процесс на одном поставщике.
Питер Левелс запустил бесконечный ИИ-телеканал. Infinite Slop — трансляция, которая генерирует сама себя: зрители в чате говорят, что должно произойти дальше, модель рисует следующий клип. Внутри дообученная MiniMax H3. По словам автора, она в 50 раз быстрее и рисует видео быстрее, чем вы успеваете смотреть. Есть даже блок новостей: система сканирует X и Hacker News.
$4000 в день за круглосуточный телеканал — это меньше зарплаты одного монтажёра. Порог входа в «свой канал» упал до цены аренды карт, и первым это заметил не медиахолдинг, а разработчик-одиночка.
Коротко о моделях. Microsoft выложила открытые веса GigaPath-Flash: 97% качества предшественника при примерно в 50 раз меньших вычислениях. Tencent открыла Hy4 preview — смесь экспертов на 770 млрд параметров с контекстом больше миллиона токенов. Nota AI ужала GLM-5.3 в четыре бита и срезала 17,75% экспертов. Модель влезла на две карты вместо восьми, потеряв около 5% качества.
Коротко о продуктах. Waymo открыла полностью беспилотные поездки в Денвере, Сан-Диего и Тампе — теперь 14 городов. OpenAI прекращает поставлять модели Cursor с 12 ноября, после того как Cursor поглотила SpaceX. Dyson выпустила зубную щётку за $499 с камерой на 100 тысяч пикселей: она ищет межзубные промежутки за 100 миллисекунд. А инженер OpenAI переписал загрузку настольного ChatGPT — длинные чаты открываются и едят память на 90% меньше.