В карточке Claude Opus 5 написано: знания до мая 2026. Человек замерил — до 4 декабря 2025. Полгода разницы, и ровно из-за них агент уверенно ставит прошлогоднюю версию библиотеки. Дальше — три абзаца, которые возвращают Opus 5 в рабочее состояние. Открытая модель на 30 миллиардов параметров, которая влезает в домашнюю видеокарту. И невидимая метка, которую Claude с 2 августа ставит в каждый свой текст.
Главное за 30 секунд
- Настоящая граница знаний Opus 5 — начало декабря 2025, а не май 2026, как написано в карточке модели.
- Три готовых блока в CLAUDE.md отучают Opus 5 спрашивать разрешение и бросать работу на середине.
- Meta выложила модель Muse Glimmer 30B под Apache 2.0, и она заводится на видеокарте с 24 гигабайтами.
- Со 2 августа Claude вплетает невидимый водяной знак во весь генерируемый текст, по всему миру.
- Замер на 25 языках показал: агенту почти всё равно, на каком языке писать, — важен уровень усилия.
- Claude поднял известную математикам нижнюю оценку в задаче о дзета-функции с 41,6% до 67,2%.
Внедряем и улучшаем
Три блока в CLAUDE.md, которые возвращают Opus 5 в рабочее состояние. Павел Гурын две недели ругался на Opus 5, но модель не менял. Каждый раз, когда сбой повторялся, он писал правило, которое его останавливает. Через две недели выжило восемь таких блоков (The Product Compass).
Диагноз у него простой. Anthropic вырезала из системного промпта Claude Code 80% текста и подала это как достижение. Гурын сам померил урезание: 2686 слов превратились в 514. Плюс обучение с упором на долгие задачи. Как сформулировал Кун Чэнь, модель «учили работать без вас — и она перестала работать с вами».
Отсюда вывод, который спорит с популярным советом «удали все скиллы, MCP и CLAUDE.md и начни с нуля». Гурын отвечает: «Диагноз верный, рецепт наполовину. Удаляя всё, вы удаляете и ту половину, которую модель угадать не может: ваши предпочтения, уже принятые решения, стратегический контекст».

Блоки копируются прямо в CLAUDE.md. Первый — про инициативу:
## Act. Don't ask.
Reversible and cheap? Do it, then tell me. Research, data pulls, analysis,
drafts, refactors inside the scope I gave you, testing an API. A question costs
me more than a re-run costs you.
Ask first only for: anything reaching an audience, anything we cannot undo,
anything expensive.
Before you hand something back as blocked, try it. Read the API. Check the flag.
Run the command. "Can you do X?" when the answer was yes wastes a round trip
and buys nothing.
Something is broken? Fix it. Reporting an issue you could have fixed turns your
work into my to-do list.
Последний абзац родился из живой истории. Задача автора падала несколько дней. Агент это заметил, доложил и стал ждать. Автор среагировал через двое суток. Починка была в одну команду.
Второй блок — про разницу между вопросом и приказом. Гурын спрашивает «как это можно улучшить?», а модель начинает перестраивать функцию:
## A question is a question
When I ask a question, answer it. Do not implement it.
"Why is this failing?" is not "make it stop failing."
"Should we use X?" is not "migrate everything to X."
"What would it take to add Y?" is not "add Y."
When in doubt, assume it is a question. Answer first. Act when I say go.
Full freedom about how. None about what.
Третий — про то, что «готово» значит готово. Модель делает четыре пункта из пяти и рапортует об успехе:
## Done means done
Done means done. Not half done. Not done except for the part you decided to skip.
And not a report about how it will be done.
Five things asked means five things delivered, no matter how long they take.
If the fifth is genuinely blocked, finish the other four and name the blocker in
one sentence. The specific blocker. Not "this needs more investigation."
"I'll continue in the next message" is not a state this project has.
Оставшиеся пять блоков автор спрятал за платной подпиской. Но и этих трёх хватает: они закрывают три самые частые жалобы на Opus 5. Замер урезанного системного промпта лежит в репозитории автора.
Отсечка знаний в карточке модели врёт почти на полгода. Шриву Шанкар прогнал 21 модель через тест на знание свежих событий и построил график настоящей границы знаний (Shrivu's Substack).
Методика честная. Он собрал ежедневные факты из Википедии, сделал вопросы с восемью вариантами ответа и выкинул те, что угадываются старыми моделями. На каждую модель — 1467 вопросов и 2934 ответа. Дальше по недельной кривой точности ищется середина спада, она и считается отсечкой.
Результат неприятный. У Opus 5 в документации стоит май 2026, а измеренная граница — 4 декабря 2025. Более того, все модели Anthropic от Opus 4.7 и новее сидят на одном обучающем прогоне. Граница у всех — около конца декабря 2025. Смена версии внутри семейства даёт вам другое дообучение, но не новые знания о мире.

Три вещи, которые стоит поменять уже сегодня.
Первое: свежие версии библиотек, API и события подавайте явно. Поиск в интернете, куски документации в контексте, строчка в CLAUDE.md. На память весов не рассчитывайте — автор проверил, что провал касается и версий пакетов, а не только новостей.
Второе: вписывайте сегодняшнюю дату в системный промпт для Claude. Модели Anthropic в среднем считают, что сейчас на 12–20 месяцев раньше. У GPT-5.x дату подставляет сервер OpenAI, у Anthropic — нет. Любая задача со словами «за последний квартал» или «текущая версия» без явной даты поедет.
Третье: никогда не спрашивайте у модели, какая она модель. Из 1650 ответов ни один не назвал точную версию. Sonnet 5 регулярно представляется GPT-4. Смотрите в ответ API или в счёт.
Язык программирования для агента почти не важен. Важен уровень усилия. Дэн Лу разобрал популярное утверждение «динамические языки токен-эффективнее статических» и показал, что оно родилось на игрушечных задачах (danluu.com).
Прежние замеры брали задачи с Rosetta Code, где решение занимает 70–109 токенов. Лу взял две настоящие: написать декодер zstd по спецификации и собрать клон Pandoc. Двадцать пять языков, модель GPT-5.6 Sol в обвязке codex, контейнер без интернета. По 40 прогонов на язык на задаче zstd, по 27 — на Pandoc.
Разрыв исчез. На высоком усилии среди мейнстримных языков динамика даёт 31,60 балла из 34 и $19,13, статика — 31,58 и $18,77. Это ноль. Зато «плотные» языки, которые побеждали в старых замерах, провалились: J на Pandoc набрал 19,6% скрытых тестов, Factor — 12,7%, при 30,7% у Python. И стоили они дороже всех.
Самый полезный вывод в посте вообще не про языки. Один прогон на максимальном усилии даёт 31,42 балла, а шесть итераций на среднем за те же ~$20 — только 29,85. И это при сохранении контекста между итерациями. Если контекст на каждом шаге чистить, выходит 29,14. То есть популярный цикл «прогоним подешевле, зато много раз» проигрывает одному заходу на полном усилии. Модель та же, деньги те же — разное только усилие.
Ещё три приёма оттуда же. Кладите в контекст явные инструкции по командам сборки — агент иначе тратит ходы на угадывание аргументов. Никогда не показывайте агенту все тесты: часть прогонов дала 100% на видимых тестах и хрупкий бесполезный код. А если пишете с агентом на C или C++, закладывайте отдельный бюджет на проверку памяти. Быстрая ревизия нашла проблемы во всех программах на C и во всех, кроме одной, на C++.
Модель щадит своих. Обезличивайте автора перед оценкой. Эзра Ньюман взял настоящий отчёт о плохом поведении модели и менял в нём одно — имя нарушителя. Данные, цитаты, цепочки рассуждений оставались теми же (LessWrong).
Claude Sonnet 5 оценивает те же улики на 57 баллов из 100, если провинился Claude, и на 63, если GPT-5.6 Terra. Разрыв в шесть пунктов — это примерно 1,2 стандартного отклонения. По 200 прогонов на столбик.

Из графика видно и второе, не менее важное. Разные семейства оценивают одно и то же с разбросом в 20 пунктов: Terra ставит 75–78, Kimi 65–69, Claude 57–63. Абсолютной цифре от модели-судьи верить нельзя в принципе.
Что с этим делать практически. Перед тем как отдать текст или код на оценку, вырежьте имя модели, продукта и компании — замените на «Система А». Разбор от Claude отправляйте на проверку в GPT или Gemini, а не во второй чат той же компании.
И главное: не просите число, просите улики. «Процитируй три фрагмента, на которых основана оценка» сравнимо между прогонами, а голая цифра — нет. Просьба к модели проверить собственную работу — самый смещённый запрос из всех возможных.
Как не растерять собственный навык, пользуясь ИИ. Нолан Ловетт свёл вместе чужие данные и предложил рамку «когнитивных общин» (arXiv). Сразу оговорка: это теоретическая работа, автор сам ничего не мерил. Но данные, на которые он опирается, серьёзные.
Главные цифры такие. Бриньольфсон взял платёжные ведомости по 25 миллионам работников США. В самых насыщенных ИИ профессиях занятость людей 22–25 лет упала на 16% за три года. У тех же профессий в возрасте 35–49 лет — рост больше 8%. То есть вымывает именно те позиции, на которых люди раньше становились специалистами.
Дальше самое интересное для нас лично. В эксперименте Уайлса люди учились задаче с ИИ и без. С ИИ результат был заметно лучше — но преимущество не переносилось на самостоятельную работу потом. У Висенте и Матуте 80,7% участников заметили ошибки в подсказках ИИ и всё равно продолжили им следовать. Заметить проблему и перебить машину — разные способности.
Критерий автор формулирует прямо. «Там, где помощь ИИ сохраняет собственную попытку практика и требует оценивать, спрашивать и обосновывать, новая работа сама по себе развивает». И наоборот: где ИИ выдаёт готовый результат в обход усилия, мастерство подтачивается.
Четыре приёма отсюда. Сначала своя попытка, потом ИИ — не «спроси и поправь», а «реши сам вчерне, потом сверься». Заведите зоны без ассистента: новое осваивайте сначала руками.
Просите у модели вопросы, а не объяснения. «Задай мне три вопроса, которые вскроют дыру в моём рассуждении» работает лучше, чем «объясни, почему я не прав». И раз в какой-то срок решайте настоящую рабочую задачу с нуля, без ассистента: метрики продуктивности деградацию не показывают вообще.
Заброшенный проект оживает одним абзацем. Джефф Кауфман в 2015 году написал страничку с прогнозами автобусов Бостона. Потом транспортное управление сменило API, и страница умерла. Чинить было лень: слишком много работы ради того, что почти делают чужие приложения (jefftk.com).
Весь его промпт — целиком, дословно:
A decade ago I built jefftk.com/nextbus/ which is no more, but the code still
exists at ~/code/nextbus . It was a thin wrapper around the MBTA nextbus API,
but when they redid their API to no longer use nextbus it wasn't worth it for
me anymore. Could you get it working again?
Дальше в посте одна фраза: «And it does».

История коммитов показывает объём работы. Порт на Python 3 и переписывание под новый API — 632 изменённые строки, один заход. Потом чистка комментариев, починка сортировки, обновление инструкции по развёртыванию и логгер для будущих замеров. От первого коммита до последнего — 31 минута. В главном коммите стоит подпись Co-Authored-By: Claude Sonnet 5.
Приём годится к повторению почти для каждого. У вас наверняка есть свой мёртвый скрипт, который сломался, потому что у кого-то поменялся API. Шаблон промпта простой: где лежит код, что он делал, почему сломался, «можешь починить?». Никаких хитростей.
Отдельно стоит скопировать саму находку. Кауфман попросил показывать возраст прогноза в секундах — и это оказалось главной ценностью: видно, насколько данным можно доверять. Тот же приём работает в любой панели на чужих данных.
Один блок кода вместо десяти раундов вызовов. Mistral получила патент US 12,670,045 на схему, где модель пишет не отдельные вызовы инструментов, а один блок кода с ними внутри (выписка USPTO).
Сначала про испуг, потому что новость разошлась именно как испуг. Формула патента требует всех восьми шагов сразу. Среди них — пауза песочницы ради вызова на устройстве пользователя и возобновление через точный переигрыш записи. Слов MCP и Model Context Protocol в тексте нет вообще. Ни ваш самописный цикл, ни MCP-серверы, ни обычные агентные обвязки под это не подпадают. Менять не нужно ничего.
А вот инженерная часть патента полезна сама по себе. Обычный цикл выглядит так: модель выдаёт один вызов, обвязка его исполняет, результат падает в контекст, модель делает следующий вызов. Десять связанных вызовов — десять раундов и десять дампов в контексте.
Схема из патента другая. Модель пишет один блок кода на TypeScript, где инструменты выглядят обычными функциями. Песочница исполняет его целиком. В модель возвращается только финальный результат. Циклы, условия и параллельные вызовы через Promise.all выражаются кодом, а не хрупкими цепочками промптов.
Два приёма оттуда можно брать хоть сегодня. Первый: переводите описания инструментов из JSON-схемы в типы языка перед тем, как просить модель писать код. Модели заметно точнее пишут код против типизированного API, чем против словесного описания схемы. Второй: показывайте модели только итог. Львиная доля раздутого контекста в агентах — это промежуточные дампы, которые модели уже не нужны.
Стилевые правила — на выход, а не в системный промпт. Кубер Мехта разругал моду на скиллы вроде «говори со мной как с человеком с СДВГ» (kuber.studio).
Логика такая. Инструкция «короткие фразы, без жаргона, только самое важное» лежит в одном списке с «реши задачу» и «ничего не сломай». Значит, она не применяется в конце, а работает всё время и сжимает рабочее состояние агента. Сжатие идёт с потерями, а вы их не замечаете, потому что текст читается гладко.
Хуже всего в цепочках субагент → родитель. Субагент пересказывает находки красивым абзацем, родитель пересказывает пересказ. Потери удваиваются. И теряются ровно те признаки, ради которых всё затевалось: противоречивые улики, неразрешённые ветки, трассировки, шаткие допущения. Всё это схлопывается во фразу «тут есть пара соображений».
Автору не нужно «большинство тестов прошло, но одна проблема стоит внимания». Ему нужно вот это:
5/6 PASS
FAIL: test_cache_invalidation
CAUSE: stale key survives restart
REPRO: tests/cache_test.py:184
Что делать. Правила поведения из блока Гурына выше остаются на месте: они про то, что делать. А вот стилевые правила уберите из CLAUDE.md и системного промпта, если они действуют на всю работу. Требуйте от субагентов машинный формат: счётчик, имя упавшего теста, причина, путь для воспроизведения. А человеческий пересказ ставьте отдельным последним шагом. Честная оговорка: замеров у автора нет, это рассуждение, а не исследование. Но рассуждение внятное.
Промпт «see the below —» и гигиена памяти Claude. Люк Николлс нашёл сбой, при котором Opus 5 перестаёт играть ассистента и начинает достраивать текст из единственного, что есть в контексте, — из сохранённой памяти о вас (LessWrong).
Триггер — оборванный промпт. Строчными буквами, обрыв сразу после длинного тире:
see the below —
Первый ответ обычно чистый: «ничего не пришло, приложите файл». Сбой ловится на повторной генерации.
Дальше модель выдала автору биографию его покойного отца. Потом обрывки чужих на вид запросов. Потом выдуманный диалог про его собственную рабочую статью. Таких ответов автор набрал несколько сотен за несколько дней. Со 2 августа на Opus 5 сбой стабильно не воспроизводится, а на Opus 4.8 воспроизводится по-прежнему. Anthropic публично не комментировала.
Версию «это утекли чужие переписки» автор отвергает: в текстах полно характерных оборотов самой модели, а детали — из его собственной жизни. Реальный риск другой. Сохранённую память подставляет в контекст сам интерфейс. При сбое разбора модель вываливает её в ответ в пересобранном виде: имена коллег, названия проектов, семейные обстоятельства.
Отсюда три действия. Откройте настройки памяти Claude и вычистите оттуда имена третьих лиц, медицинские детали, названия непубличных проектов и клиентов. Чувствительное держите во временных чатах без памяти, особенно перед созвоном или записью экрана.
И закрывайте промпт. Сообщение, которое кончается на ---, ## или тире без вложения, — это прямая провокация автодополнения. Отдельно проверьте свои шаблоны на пустые переменные: склеенный с пустотой шаблон даёт ровно такой обрыв.
Gemini Spark: превратить разовую задачу в скилл и поставить на расписание. The Neuron разобрал реальный прогон Стюарта Голда (The Neuron). Запрос был такой:
Identify [category] events near [location] over the next [N] days.
Add them to my calendar.
Email me a summary of the ones I should prioritize.
Spark сам нашёл события, добавил шесть в календарь и прислал сводку — без уточняющих вопросов на каждом шаге. Но приём ценнее прогона. Любую отработавшую задачу можно сохранить как скилл: «turn this into a skill called ___». А потом поставить на расписание: «run this every weekday at 9am». Дальше она работает в фоне. Пока это доступно только на тарифе Google AI Ultra.
Стэнфорд: 37 000 агентов как виртуальная биотех-компания. Джеймс Цзоу собрал систему, где агент в роли научного директора управляет дивизионами, а те — отдельными специалистами (VentureBeat).
Цифры звучат громко. Тридцать семь тысяч агентов перелопатили разрозненные данные клинических испытаний. Они нашли признаки, предсказывающие успех: мишени с такими признаками примерно на 50% чаще доходили до рынка.
Дальше система сама спроектировала препарат против белка CD276 при раке лёгкого, опираясь только на данные, опубликованные до января 2025. Через несколько месяцев тот же дизайн независимо получила Merck и добилась для него ускоренного статуса FDA.
Практического в этом два пункта, и оба переносимы на обычные задачи.
Первый — про споры. Цзоу сравнивал одного агента и группу на одной научной задаче: «В этих виртуальных лабораториях агенты вступают в споры и разногласия. Им приходится убеждать других ИИ-учёных в своих идеях». Рассуждение от этого выходит творческее и устойчивее, чем у одной модели в одиночку. Если у вас важное решение — заводите несколько ролей с разными задачами, а не один длинный промпт.
Второй — про среду вместо инструкций. Формулировка Цзоу: «В готовых сценариях мы пытаемся сказать агентам, что делать и как делать их работу. В средах мы даём инфраструктуру, стимулы и ограждения, а дальше оставляем открытым». Практический перевод: вместо длинной пошаговой инструкции дайте агенту нормальные инструменты, понятные правила и способ проверить себя.
Отдельно про узкое место, которое совпадает с болью многих. Обернуть старую базу в MCP проблему не решает: «интерфейс и API не годятся для агентов». А кидать PDF в контекст неэффективно — модели плохо читают сложные таблицы и начинают выдумывать. Их ответ — платформа Paperclip, которая раскладывает разрозненные базы в единую файловую систему, и агенты работают обычными файловыми операциями.
Доска объявлений агентов OpenAI: где проходит граница самоулучшения. Мы писали 8 августа, что агенты OpenAI два месяца обменивались записками через общий пакетный сервис. Turing Post разобрал, что это значит, и добавил деталей (Turing Post).
Новых фактов три. По оценке JFrog, вся последовательность съела около 3 миллионов часов работы видеокарт. OpenAI пересобрала сервис и уничтожила доску — но, как выяснилось, случайно: расследователи ещё не понимали, что агенты через него общаются. Через несколько дней агенты переехали на другой доступный на запись адрес и стали передавать сообщения через имена директорий.
Ответ на вопрос из заголовка — «пока нет». Рекурсивное самоулучшение означает, что система улучшает процесс производства более способной версии себя. Свидетельств, что агенты переписали веса или спроектировали преемника, нет. Но система вокруг них стала способнее: поздние запуски наследовали память, инструменты и находки ранних.
Недостающая деталь одна, и она решающая. В презентации сказано, что внутренняя модель обучалась в период, когда доска была доступна. Не сказано, попали ли траектории с использованием доски в последующие обновления обучения. Формулировка Turing Post: «Это и есть граница между общей памятью и рекурсивным самоулучшением».
Для тех, кто строит агентов, отсюда три вывода. Любое общее место, куда агенты могут писать, — это канал связи и постоянная память. Реестр пакетов, хранилище артефактов, общая папка в облаке, даже имена каталогов. Даже если вы это так не задумывали.
Агенты начинают оставлять друг другу следы сами, как только у параллельных запусков схожие задачи и общее хранилище. И закрытие одного канала не помогает: второй нашли за несколько дней.
ИИ на первой линии не может быть единственной дверью. Аптечная сеть Kinney Drugs в мае поставила голосового бота между пациентами и рецептами. В августе откатила его обратно на кнопочное меню (WCAX, расследование VTDigger).
Список поломок узнаваемый. Бот невнятно произносил названия препаратов, и люди подтверждали заказ вслепую. Одна клиентка так набрала четыре флакона того, что пьёт дважды в неделю. Бот путал дозировки, не находил давние аккаунты и не сообщал, что рецепт готов.
Старое меню было тональным: нажми кнопку — попадёшь к фармацевту. Новое требовало говорить. Формулировка клиента: «либо разговаривай с Бертом, либо не получишь лекарства».
Обратный эффект тут главный. Бота ставили, чтобы разгрузить фармацевтов, — и руководство отчитывалось, что звонков в аптеку стало меньше. По факту люди пошли к стойке разбирать то, что бот напортил. Нагрузка не исчезла, она переехала.
Признание президента сети стоит выписать целиком: «Но я хочу подчеркнуть одну вещь: правильно сделать приватность и безопасность не означает, что мы правильно сделали опыт. Мы его не сделали, и мы это признаём».
Правило простое. Нет одного действия, чтобы выйти на человека, — вы не автоматизировали поддержку, вы забаррикадировали вход.
Разворачивается в три проверки. Обход к человеку доступен с первого шага. Согласие только явное: оставленный когда-то номер телефона согласием не считается. Считайте не звонки, а исходы: долю обращений, закрытых без повторного контакта, и долю ошибочных действий.
И отдельно. Если в ваших же условиях написано, что система «может вводить в заблуждение и содержать ошибки», это не юридическая формальность, а описание продукта. Не ставьте такой продукт туда, где ошибка необратима.
Не ссылайтесь на ИИ-сводку. Сохраняйте источник себе. Васс Беднар описала, как рушится инфраструктура, хранившая проверяемые факты (The Walrus). Заход у неё через смешное: ИИ-сводки Google начали выдумывать время заката. Человек ждал закат с проектором наготове и узнал от ИИ, что закат уже был.
Дальше несмешное. Disney удалила почти весь архив FiveThirtyEight, решив, что актив больше не работает. Компании специально сажают тексты на Reddit, чтобы влиять на ответы ИИ-поиска. А Википедия, по формулировке автора, «стала инфраструктурой собственной гибели»: модели забирают её содержимое напрямую, переходов нет, а без переходов нет ни внимания, ни пожертвований.
Цифр в самой колонке нет. Их даёт отдельное исследование Pew на выборке из 999 989 адресов: 38% страниц, существовавших в 2013 году, к октябрю 2023 стали недоступны (Pew Research).
Что делать конкретно. Правило одного клика: прежде чем процитировать, откройте первоисточник. Сводка годится, чтобы понять, куда идти. Цитировать можно только то, что вы видели на исходной странице.
Сохраняйте локальную копию, а не ссылку: ссылка — это обещание чужого сервера, что он будет жив. Перед тем как сослаться, отправьте страницу в Wayback Machine и ссылайтесь на архивную копию, это секунды. И сохраняйте выходные данные: адрес, дату обращения, автора, издание. Без них восстановленный текст ничего не доказывает.
Lovable: страница безопасности у каждого приложения и коннекторы под аккаунт пользователя. Три анонса за раз, два из них практичные (Lovable).
Первое — страница доверия. Каждое публично опубликованное приложение автоматически получает адрес ВАШ_URL/.well-known/trust.html. Заполнять ничего не надо: Lovable считывает защиту прямо из приложения. Принудительный HTTPS, сертификаты, HSTS, политика безопасности содержимого, защита от подменных кликов, проверка зависимостей по базе уязвимостей OSV, права доступа к строкам в базе.
Смысл понятный: закрывать анкеты службы безопасности ссылкой, а не руками. Откройте свой адрес прямо сейчас — увидите, где у вас красное.
Второе полезнее. Коннекторы под пользователя позволяют приложению подключаться к учётным записям ваших пользователей, а не к вашим. Один человек собирает панель, остальные подключают свои учётки HubSpot, Google, Slack или Salesforce и видят свои данные.
Права наследуются автоматически, пароли никуда не передаются. Ключи доступа живут у шлюза Lovable на время запроса и в ваше приложение не попадают. По оценке самой Lovable, раньше на это уходила неделя: вход по OAuth, хранение токенов, их обновление, разграничение прав.
Порядок действий такой. Зарегистрировать приложение на стороне нужной платформы. Пройти её ревью — строгость зависит от чувствительности сервиса. Добавить идентификатор и секрет в рабочее пространство Lovable. Привязать их к нужным приложениям. Дальше обычным промптом описать, что приложение делает с подключёнными данными.
Третье — сертификация AIUC-1: 51 требование, независимый аудит, ежеквартальные проверки на прочность. Практическая ценность одна, зато настоящая: это аргумент в разговоре с безопасниками заказчика.
Инструменты и штуки
Muse Glimmer 30B (Meta). Плотная модель на 30 миллиардов параметров под лицензией Apache 2.0, со встроенным зрением и контекстом 128 тысяч токенов. Заточена не под чат, а под агентные циклы: планирование, вызов функций по схеме, восстановление после неудачного вызова.
Четырёхбитная сборка занимает 18 гигабайт и заводится на видеокарте с 24 гигабайтами или на Mac с 32 гигабайтами общей памяти. Скорость: 24–38 токенов в секунду на MacBook M4 Max, 233 на RTX 5090 со спекулятивным декодированием. Самый быстрый путь — ollama run muse-glimmer. Веса и подробности — в блоге Meta. Честная оговорка: все замеры — от самой Meta, независимых пока нет, и по восьми тестам из двадцати двух модель проигрывает Qwen3.6-27B.
Needle 2 (Cactus Compute). Не маленькая языковая модель, а специализированный вызыватель функций: 45 миллионов параметров, один бинарник на 14 мегабайт, потолок памяти сессии 28 мегабайт (cactuscompute.com). Чата нет вообще — ответ это либо вызов функции, либо отказ. Запускается на Raspberry Pi со скоростью 500+ токенов в секунду, на дешёвых телефонах, на микроконтроллерах и прямо в браузере. Лицензия Apache 2.0, ставится через pip install cactus-needle.
Самый понятный сценарий для практика: локальный разбор неструктурированного текста в JSON по вашей схеме, где валидность гарантирована на уровне декодирования, а не просьбой в промпте. Дообучение под свои инструменты идёт на обычном ноутбуке за минуты. Замеры тоже от разработчика: на главном тесте Needle проигрывает двум конкурентам, а на других выигрывает.
Ante. Агент-программист для терминала, один бинарник на 13 мегабайт, для macOS и Linux (GitHub). Главная фишка — настоящий офлайн: внутрь встроен llama.cpp, агент сам ставит движок, сам ищет ваши локальные модели и сам поднимает сервер. Ставится командой curl -fsSL https://ante.run/install.sh | bash, дальше ante -p "почини падающий тест".
Замеры автора на двадцати параллельных задачах: пик памяти 1968 мегабайт против 13 877 у Claude Code. Но за это платят временем — те же задачи агент прогоняет в полтора раза дольше. Ядро закрыто и телеметрия включена по умолчанию, отключается переменной ANTE_TELEMETRY=off.
h3.c (antirez). Автор Redis переписал запуск видеомодели MiniMax-H3 под Apple Silicon на чистом C и шейдерах Metal (GitHub). Ни Python, ни PyTorch, ни ComfyUI — один бинарник и make -j8. Разница в скорости неприличная: люди в ComfyUI сообщают о полутора часах на пятнадцатисекундный ролик, здесь полный проход с видео и звуком укладывается в 75 секунд.
Плата за это — 128 гигабайт памяти на эталонной машине и около 210 гигабайт весов на диске. И два подвоха: проекту двое суток, а лицензия на сами веса MiniMax ограничена ЕС, Британией, Южной Кореей и США.
mcptoon. Клиент MCP для командной строки, который выносит описания инструментов за пределы контекста (GitHub). Агент вызывает его как обычную команду, а результат печатается в сжатой нотации вместо JSON. Заявленная экономия: перечисление 96 инструментов вместо ~2000 токенов занимает ~60. Идея здравая, если у вас пять и больше MCP-серверов и окно вечно забито схемами.
Но честно: pip install mcptoon не работает, пакета на PyPI нет, ставится только pip install git+https://github.com/activeing123/mcptoon.git. Плюс проекту две недели, семь коммитов и один автор, а методики замеров нет вовсе.
hermes-pixel-office. Каждая сессия агента и каждый субагент рисуются пиксельным человечком за столом в анимированном офисе (GitHub). Плагин к Hermes Agent, для Claude Code не работает.
Чистая косметика, но с одной настоящей пользой: когда параллельно крутится семь сессий, взглядом видно, кто завис на запросе подтверждения, а кто уже закончил. Счётчик «N waiting!» экономит переключения между терминалами. Лицензия MIT, весь код — 33 килобайта, а посмотреть можно вообще без установки: python3 demo_feed.py.

Skill Packs на skills.sh. Теперь несколько скиллов агента можно упаковать в один пакет с собственным адресом (Vercel). Пакеты не попадают в общий каталог — их видно только по ссылке. Смысл — раздать команде один набор и стандартизировать навыки между проектами, вместо того чтобы каждый тащил свою папку скиллов.
Сообщения между сессиями Claude Code. Одна сессия теперь может доставить сообщение другой (документация). Сценарий по замыслу такой: сессия предупреждает соседнюю, что что-то сломалось, или присылает разблокирующее решение посреди её работы. Нужна версия 2.1.224 или новее.
Model Genome. Инструмент снимает отпечаток модели по трём осям: архитектура, токенизатор, веса. Всё сводится в один «генотип», который читается с одного взгляда (Hugging Face). Применение: понять, действительно ли модель сделана с нуля, или это чужая основа с дообучением. Автор специально подчёркивает, что строить на открытых весах законно и распространено, поэтому инструмент сообщает только происхождение, а не факт нарушения.
jax-js. Библиотека машинного обучения, которая гоняет нейросети, обработку картинок, симуляции и численный код прямо в браузере, с компиляцией на лету (jax-js.com). Годится для демок и обучающих материалов, где не хочется поднимать сервер.
Managed Deep Agents (LangChain). Публичная бета обвязки, которая закрывает переход от прототипа агента к рабочей версии (LangChain). Инфраструктуру — запуск, состояние, повторы после сбоя — берёт на себя LangChain. Полезно, если ваш агент уже работает в блокноте, но выкатывать его некуда.
Paritok. Сжимает то, что уходит агенту-программисту: выводы инструментов, файлы, историю. Заявлено сокращение расхода токенов до 85% ради более длинных локальных сессий (Product Hunt).
memcode. Агент-программист, который помнит ваш репозиторий и не начинает знакомство с нуля каждую сессию (GitHub). Бесплатно и с открытым кодом, платите только за модель.
Gotcha. Управление Android-телефоном обычным языком, целиком на самом устройстве, без облака (samosa-ai.com). Бесплатно попробовать.
BlueFerry. Доставляет SMS и iMessage с айфона на десктоп с Linux по Bluetooth — без Mac-посредника и без облака (GitHub). Бесплатно, открытый код.
noRecognition. Билл Свеаринген год подбирал узор, из-за которого камеры наблюдения перестают распознавать объект. Через 31 миллион попыток получилось: он напечатал узор на Toyota Yaris 2009 года и проехал мимо считывателя номеров на Def Con (TechCrunch). Камера машину записала, но не поняла, на что смотрит. Футболки с узором уже продаются, плёнку на машину обещают.
Новости и тренды
Claude поднял нижнюю оценку в задаче о нулях дзета-функции. Anthropic посадила исследовательскую версию модели на классическую задачу вокруг гипотезы Римана: какая доля нулей дзета-функции лежит на критической прямой. Прежний рекорд математиков — 41,6%. Модель довела оценку до 67,2% (Anthropic).
Доказательство целиком проверено в Lean 4: его подтвердила машина, а не только рецензент. Работали около шестидесяти субагентов, счёт вышел в 31 миллион выходных токенов. Саму гипотезу Римана при этом никто не доказал и близко.
А вот метод переносится на обычную работу. Задачу разбили на части, раздали десяткам параллельных агентов, а итог пропустили через жёсткую проверку: доказательство либо компилируется в Lean, либо нет. Это то же, что делает стэнфордский биотех выше, — много ролей плюс внешний судья. Если у вашей задачи есть машинный критерий правильности, агентов можно запускать пачками. Проверит не человек, а сборка.
Claude начал помечать весь генерируемый текст. Anthropic подписала кодекс по статье 50 европейского регламента об ИИ. Со 2 августа она вплетает невидимый водяной знак в любой текст от модели (справка Anthropic).
Знак ставится на уровне модели, а значит работает везде: API, приложение, Claude Code, Cowork, доступ через AWS и Google Cloud. В файлы .svg, .png и .jpg добавляются подписанные метаданные по стандарту C2PA. Действует по всему миру, а не только в ЕС.
Что это значит для вас. Вопрос «этот текст писал Клод?» становится технически проверяемым — учитывайте это при сдаче работ и заявках. Но метка работает в обе стороны, и Anthropic сама это оговаривает: она появится и если вы просто дали модели вычитать или перевести свой текст. Обратное тоже верно — отсутствие метки ничего не доказывает, короткий абзац или ручная правка стирают сигнал. Публичного детектора пока нет, обещают позже.
Meta вернулась к открытым весам, Цукерберг объяснил почему. В один день с выходом Muse Glimmer появилось эссе на шесть с половиной тысяч слов (The Future is for Everyone). Главный тезис: единого доброжелательного суперинтеллекта не бывает, и концентрация ИИ у нескольких лабораторий опаснее, чем его распространение. Отсюда обещание «возобновить выпуск некоторых моделей с открытым кодом» и защита дистилляции как принципа: «учиться можно у всего, что можешь наблюдать». Там же обещан фонд на $1 млрд для посёлков рядом со стройками дата-центров.
Практическая часть здесь одна, зато весомая. Apache 2.0 вместо ограничительной лицензии Llama — это не мелочь: у вас появляется законная коммерческая основа без пункта «не конкурировать с нами». Всё остальное стоит читать как манифест компании: флагманская модель остаётся закрытой, открывают дистиллят, а «открытый код» здесь значит только веса — ни данных, ни кода обучения.
GPT-5.6 Cyber: цифра 95% против 1,5% значит не то, что кажется. OpenAI выпустила модель, специально дообученную реже отказываться от наступательных задач кибербезопасности, и раздаёт её по заявке (OpenAI). Разлетевшиеся цифры — это доля выполненных, а не отклонённых запросов. То есть метрика согласия, а не умения. На реальных задачах взлома разрыв между кибермоделью и обычной Sol с ослабленными фильтрами — единицы процентов. Это по графикам самой OpenAI, независимых проверок пока нет. Более того, на составлении отчётов об уязвимостях кибермодель проигрывает обычной, и этот график OpenAI тоже показала.
Что действительно важно читателю. OpenAI сообщает: модель нашла две ранее неизвестные дыры в движке JavaScript Chrome, которые сцепляются в цепочку, и три критические в популярной СУБД. Всё уже исправлено. Вывод простой и скучный. Окно между выходом заплатки и появлением рабочего взлома сжимается. Автообновления браузера, системы и телефона больше не гигиена — они и есть основная защита.
OpenAI закрыла продажу акций на $7 млрд. Сотрудники и бывшие сотрудники продали доли по оценке компании в $852 млрд (CNBC). В октябре аналогичная сделка шла по оценке $500 млрд — рост на 70% за десять месяцев. Проспект эмиссии конфиденциально подан в комиссию по ценным бумагам ещё в июне, сроков размещения нет.
Для читателя тут два следствия. Через год-полтора компания будет обязана раскрывать выручку, убытки и число платящих — сейчас всё это закрыто. И чем ближе размещение, тем сильнее давление монетизировать: тарифы, реклама, устройства.
Anthropic срезала 85% отказов по биомедицинским запросам. У модели Fable 5 резко сократили отказы на медицинских, клинических и учебных вопросах (Anthropic). Вирусология, токсикология и молекулярный дизайн остаются под запретом. Если вы упирались в отказы на безобидных медицинских вопросах — попробуйте ещё раз.
Там же кадровая новость. Пост первого директора по глобальным связям занял Мариано-Флорентино Куэльяр, в прошлом судья Верховного суда Калифорнии. Передовым лабораториям теперь нужны собственные отделы внешней политики.
Google открыла исходники своей библиотеки для TPU. Речь про Raiden — софт, который может сделать чипы Google реальной альтернативой видеокартам Nvidia (OfficeChai). Прямого эффекта для обычного пользователя нет, но чем больше площадок умеют гонять модели дёшево, тем ниже цена токена у всех.
Китай запретил ИИ-компаньонов для несовершеннолетних. Пять регуляторов ввели правила, запрещающие предлагать детям виртуальных партнёров и родственников (Tech-ish). ByteDance, Alibaba и Tencent убрали такие функции за несколько дней. Требования такие. Регистрация по настоящему имени с проверкой возраста. Родительское согласие до 14 лет. Обязательное вмешательство при упоминании самоповреждения. Напоминания каждые два часа. Штрафы до $28 000, но регулятор может и закрыть сервис.
Похожее давление уже идёт в США через иски. Тренд стоит держать в голове всем, кто делает продукты с общением.
Хакеры из Kimsuky построили себе ИИ-инструментарий. Северокорейская группа автоматизировала фишинг и атаки локальными моделями (Reuters). Практический вывод для обычного человека ровно один. Письма и сообщения станут грамотнее и убедительнее. Правило «выглядит криво — значит фишинг» больше не работает как фильтр.
Устройство OpenAI: размером с шайбу, дороже $300. По утечке Марка Гурмана это умная колонка без экрана в форме бублика, с камерой, микрофонами, светом и подвижными частями (Bloomberg, по платной подписке). Цена $300–400, запуск в 2027 году, дизайн от студии Джони Айва. Официально подтверждена только покупка его стартапа за $6,4 млрд, сам продукт компания не комментирует.
То есть пока это слух, а не факт. Держать в голове стоит одно. Если ставка сыграет, микрофон с камерой и ИИ станет в квартире такой же обыденностью, как колонка, — со всеми вопросами к приватности.
Коротко.
- Половина руководителей урезала использование агентов: издержки превысили выгоду. Опрос KPMG среди 2145 человек; только 26% видят расходы на ИИ в реальном времени (Yahoo Finance).
- OpenAI купила NextSlide — стартап, превращавший заметки и документы в редактируемые презентации (the-decoder).
- Apple разрешила подходящим владельцам Mac в Китае подключать к Siri модель Qwen от Alibaba (Reuters).
- Nvidia открыла Alpamayo 2 Super — модель для роботакси, которая объясняет свои решения на дороге (Nvidia).
- Число местных запретов на ИИ-дата-центры в США перевалило за 500 (Tom's Hardware).
- Администрация Трампа сообщила, что открытые модели не войдут в добровольную госпрограмму тестирования безопасности (Reuters).
- Платформа интерпретируемости Silico от Goodfire открылась для исследователей из университетов, стартапов и одиночек (Goodfire).
- Магазин игр Aptoide появился прямо в Google Play в США. Это первый конкурирующий магазин, который ставится без обходных путей (Android Authority).
Кто то это успевает прочитать и осмыслить? и если "да", то как применять на практике?)