Лучшая модель в мире, Opus 4.8, решает сложную инженерную задачу с первого раза лишь в одном случае из четырёх — заменять живого инженера пока рано. Зато рутину можно снять полностью: OpenWiki сам пишет твой CLAUDE.md, а вернувшийся Fable 5 тянет многодневную задачу и проверяет себя без напоминаний. И ещё одно за сегодня: ИИ-агенты без единой подсказки вывели алгоритм лучше того, что люди считали пределом.
Главное за 30 секунд
- OpenWiki сам пишет и обновляет твой
CLAUDE.md, чтобы агент не перечитывал весь проект на каждом запросе. - Свежие тесты: даже Opus 4.8 решает сложную инженерную задачу с первого раза только в четверти случаев.
- Fable 5 снова в Claude Code: ставишь цель через
/goalи уходишь — модель держит многодневную задачу и проверяет себя сама. - ИИ-агенты без подсказок и готовых решений сами вывели алгоритм, обошедший то, что люди считали лучшим методом.
- Meta посадила сотрудников на токен-паёк после 73,7 трлн сожжённых токенов за месяц — учёт расхода ИИ становится нормой.
Внедряем и улучшаем
OpenWiki: агент перестаёт перечитывать твой репозиторий. LangChain выложил бесплатную консольную утилиту (лицензия MIT, уже 519 звёзд), которая сама пишет и поддерживает документацию по твоему коду — но не для людей, а для агентов вроде Claude Code и Cursor. Логика простая. Обычно агент на каждый запрос вслепую перечитывает проект и жжёт контекст. OpenWiki заранее собирает по коду структурированную вики в папке openwiki/ и обновляет её при изменениях.
Главная фишка — утилита сама дописывает в твой CLAUDE.md или AGENTS.md строчку-инструкцию: за контекстом обращайся к этой вике. Нет таких файлов — создаст. Установка и запуск — в пару команд:
npm install -g openwiki
openwiki --init # настроить модель и ключ, собрать доки
openwiki --update # обновить вики по изменениям в коде
openwiki -p "Summarize what you can do" # разовый неинтерактивный прогон
Модель подключаешь свою (OpenRouter, Anthropic, OpenAI и др.) — платишь только за токены. Есть готовый GitHub Action: раз в день сам открывает пулл-реквест с обновлением доков. Так доки для агента всегда остаются свежими, а его контекст не уходит на повторное чтение проекта (GitHub).

Fable 5 вернулся в Claude Code: отдавай цель, а не шаги. Anthropic вернула Fable 5 и в письме дала конкретные советы, как с ней работать. Модель ведёт себя как опытный инженер: сперва изучает проект, подтягивает нужный контекст по ходу и проверяет работу перед сдачей. Четыре приёма, которые реально меняют результат:
- Давай цель, а не список шагов. Запускай через
/goal— Claude работает, пока не выполнит условие завершения. - Отдавай крупную асинхронную задачу — и уходи. Модель держит многочасовые и многодневные сессии, не теряя нить.
- Не пиши «обязательно протестируй». Она сама проверяет свою работу, и общая оценка работает лучше поштучных инструкций.
- Отдавай ей мутные проблемы. Отладка инцидентов, поиск первопричины, архитектурные решения — она чаще находит корень, а не симптом.
Модель выбираешь командой /model. До 7 июля Fable 5 входит в подписку без доплат — до половины недельного лимита; дальше за кредиты. По API — $10 за миллион входных токенов и $50 за миллион выходных (Anthropic).
Какую модель брать под код: две свежих таблицы и одно правило. За сутки вышли сразу два теста и один разбор — вместе они складываются в готовую шпаргалку.
Первый тест — Senior SWE-Bench от Snorkel AI с Принстоном. Идея прямо в заголовке: «мы обращаемся с агентами как с сеньорами — почему же тестируем как джунов?». Обычные бенчмарки дают точное ТЗ. Здесь задача — живое сообщение без деталей. В среднем она задевает 11 файлов, а баги приходится расследовать по логам. Засчитывают только решение «со вкусом»: и работает, и не раздувает код, и следует практикам проекта.
Итог отрезвляющий. Лучшая модель, Opus 4.8, решает всего 24% задач. Следом Sonnet 5 — 19,4%, GPT-5.5 — 16%, Gemini 3.1 Pro — 6,1%. Вывод авторов: передовые модели проваливают сеньорскую работу больше чем в 75% случаев. Автономного «сеньора» пока нет (Senior SWE-Bench).

Второй тест — CursorBench 3.1 на неоднозначных многофайловых задачах из реальных сессий Cursor. Тут расклад другой: с большим отрывом лидирует Fable 5 Max — 72,9%, и весь топ-4 занят разными режимами Fable. Дальше GPT-5.5 (64,3%), Opus 4.8 (63,8%), Sonnet 5 (61,2%). Отдельная находка — собственная модель Cursor, Composer 2.5: 63,2% за $0,55 на задачу, в 10–30 раз дешевле топов. Правда, её учили ровно на таких сессиях — дома у неё фора (CursorBench).
Разбор Sonnet 5 от Zvi добавляет правило на каждый день. Sonnet 5 — не передовая модель, но у неё своя ниша. Бери её на простое и быстрое: парсинг, разметку тональности, черновики, чистку кода, работу в потоке. Сложное, финальный анализ и аккуратный код оставляй Opus или Fable. Удобный гибрид: начинай проект на Sonnet, а как задача разрастётся — переключайся на Opus. И одна ловушка: Sonnet «думает» дольше, поэтому по реальному счёту иногда выходит дороже Opus (разбор Zvi).
Полевой отчёт: где ИИ в коде реально помогает, а где ворует время. Разработчик Джейми Брэндон несколько недель гонял современные модели на своих проектах и написал честный разбор без хайпа. Выводы приземлённые и применимые сразу.
Главная польза — ревью кода и поиск багов. Работает даже примитивный промпт:
Review `git diff main` and look for bugs
Модели находят то, что пропускают и фаззер, и средний человек: Opus поймал double-free в его интерпретаторе. Но только передовые модели — дешёвые «блефуют, как студент на пересдаче». Передовые тоже блефуют, но помечают это фразой вроде «this isn't a bug per se». Такое легко пропустить мимо.
Второе, что стабильно окупается, — рефакторинг: переименования, смена сигнатур, правка всех мест вызова. Тут есть ловушка: к 200 верным правкам бот любит подсунуть одну лишнюю. Лечится вторым ботом и отдельным промптом:
Which of these changes is not related to the prompt?
А вот совместное написание кода пока не выигрыш: у ботов «худшее суждение», баг чинят не на том слое, обожают плодить лишние юнит-тесты. Автор держит их в песочнице и работает через метки @bot в коде с одним зашитым промптом «Handle comments marked @bot». Его правило дня простое: зови ИИ туда, где проверить ответ дешевле, чем сделать самому. Где проверка дороже работы — это потеря времени (Scattered Thoughts).
Ликбез: за что ты на самом деле платишь — токены, внимание, инференс. Turing Post собрал подборку гайдов, которая закрывает пробелы у всех, кто пользуется ИИ, но не заглядывал под капот. Коротко о главном, дальше — ссылки для нырка.
- Токен стал единицей экономики ИИ. Текст режется на токены, окно контекста считается в токенах, и любой счёт зависит от них. Понимать токенизацию — значит понимать, откуда берётся цена (гайд).
- Токены бывают разные. Входные, выходные, «рассуждающие», кэшированные, спекулятивные. У агентов скрытые расходы от вызовов инструментов и циклов рассуждения часто больше, чем видимые промпт и ответ (гайд).
- Почему выход дороже входа. Вход читается разом, параллельно. Выход генерится по одному токену, каждый зависит от предыдущего — это в 2–6 раз дороже. Не прихоть, а физика (гайд по вниманию).
- Эмбеддинги превращают токены в точки в пространстве смысла, где близко = похоже. На них держатся поиск, память и мультимодальность (гайд).
- Векторные базы поумнели — из пассивного хранилища для поиска они стали слоем памяти для агентов (гайд).
- Инференс — это весь путь от промпта до ответа: токенизация, эмбеддинги, внимание и KV-кэш, плюс ретрив и оркестрация. Обвязка вокруг модели теперь не менее важна, чем сама модель (гайд).
Практический смысл — не для эрудиции. Понимаешь, почему длинный ответ и лишние субагенты жгут деньги, — и режешь расход осознанно.

Мыслить портфелем моделей: 18 тезисов Питера Янга о том, куда всё идёт. Питер Янг опросил десятки лидеров ИИ и собрал прогноз. Вот что из него можно применить уже сейчас.
Первое — экономия через портфель моделей. Гнать всё через дорогие передовые API невыгодно: Uber сжёг годовой бюджет за четыре месяца. Coinbase почти вдвое срезала расходы, переведя инженеров на открытые китайские модели GLM и Kimi; Airbnb и Pinterest — на Qwen. Рецепт: передовые модели на важное, дешёвые открытые — на рутину.
Второе — продукт без агентов будто не существует. Боты уже читают, пишут и покупают за нас; трафик ботов на сайты, по данным Cloudflare, обогнал человеческий. Нет внятного API, документации или MCP — агент тебя не найдёт, а с ним и человек, который на агента полагается. Строй «под агентов с первого дня».
Третье — продавай результат, а не ещё один инструмент. Голый чат-бот внутри одного приложения проиграет агенту, который несёт личный контекст пользователя между всеми программами. Будущее — персональные скиллы внутри «супер-приложения», а не отдельные подписки. И работа через «циклы»: задаёшь требования, а агент сам планирует, делает и проверяет (Peter Yang).
Инструменты и штуки
ZCode. Настольное приложение для кодинга с агентами: планирование, код, ревью и деплой в одном окне. По сути «Claude Code от создателей GLM» — заточено под открытую модель GLM-5.2 и потому дешёвое. Есть долгие задачи с целями, запуск из Telegram и мессенджеров, подключение к Docker или удалённой машине по SSH. Само приложение бесплатное, Linux поддерживается с первого дня; за доступ к модели платишь от $16 до $144 в месяц (zcode.z.ai).
Kimi K2.7 Code в GitHub Copilot. Первая открытая модель, которую добавили прямо в выбор моделей Copilot — как более дешёвый вариант под код. Работает в VS Code, JetBrains, Copilot CLI и мобильном приложении. Индивидуальным подписчикам (Pro, Pro+, Max) уже доступна — просто выбери в списке. В корпоративных планах модель включает админ (GitHub).

LeronX Engine. Открытое (MIT) ядро для генерации видео из текста: сценарий → раскадровка → озвучка на 11 языках → рендер на FFmpeg → субтитры. Всё модульное, этапы расширяются плагинами, есть ускорение на GPU. Полезно тем, кто печёт короткие или обучающие ролики без ручного монтажа. Облачный рендер и биллинг проприетарные, но локальный конвейер открыт (GitHub).
Revolte. Платформа доставки софта на автономных агентах: планируют, пишут, тестируют, катят в прод и следят за релизами. Инженер остаётся в цикле для ревью и контроля. Связывает Jira, Git и Figma; есть бесплатный и платные планы (revolte.ai).
Modelence Mobile Builder. Собирает полноценное мобильное приложение из текстового промпта — сразу с авторизацией, базой данных и деплоем. Быстрый способ проверить продуктовую идею на телефоне, не нанимая команду (через Techpresso).
Sequence Agentic. Даёт ИИ-агенту двигать реальные деньги между счетами, картами и кредитами одним вызовом API — со встроенными лимитами трат и журналом операций. Штука мощная и стрёмная разом: агент с доступом к деньгам требует железных ограничений (через Techpresso).
OASIS 1 Ring. Носимое кольцо: объединяет трекпад и приватный голосовой ввод, чтобы набирать и править текст без клавиатуры и рук. Любопытная заявка на «ввод будущего» для тех, кто много печатает на ходу (через Techpresso).
Pocket. Гаджет за $129 клеится на заднюю крышку телефона, записывает разговоры в реальном мире и превращает их в заметки. Категорию «ИИ-гаджетов» рано хоронили: продано больше 130 тысяч штук, стартап поднял $11 млн. Смысл сдвига — не заменять телефон, а ловить то, что он упускает (TechCrunch).
Новости и тренды
Meta считает токены: 73,7 трлн за месяц. Внутренние траты Meta на ИИ подобрались к миллиардам, и компания разослала предупреждение 6 тысячам сотрудников. Лидерборд «Claudeonomics», где мерились объёмом токенов, закрывают — он поощрял расход ради расхода. Вместо него — платформа мониторинга в реальном времени и жёсткие бюджеты с 2027 года. Вчера мы писали, что Meta увела сотрудников с Claude Code ради защиты своих данных. Вот вторая причина — деньги.
Так не только у неё: Uber сжёг годовой бюджет за четыре месяца и ввёл лимит $1500 в месяц на человека. Что это значит для тебя: объём токенов — не продуктивность. Даже гиганты заводят учёт расхода ИИ; привяжи и ты метрику к результату, а не к числу запросов (MLQ.ai).
ИИ сам изобрёл алгоритм лучше людей. Лаборатория d_model дала агентам задачу: стереть «концепт» из активаций модели так, чтобы его не восстановил детектор. Ни готового решения, ни доступа к статьям не дали. Агенты сами разобрали геометрию активаций и вывели метод, который обошёл считавшийся лучшим LEACE: точность детектора упала с 99% до 70% против 88% у LEACE, и так на всех 50 концептах из 50.
Что это значит: ИИ уже автономно двигает науку, а не только пишет код по образцу. И заодно предупреждение для безопасности — если концепт «стёрли» линейным методом, простой нелинейный детектор часто достаёт его обратно (d_model).

Домашний робот Isaac 1 за $7999. Стартап Weave Robotics открыл предзаказ на робота для дома: собирает и раскладывает бельё, заправляет кровать, наводит порядок. Цена — $449 в месяц или $7999 разом, возвратный депозит $250, первые поставки осенью 2026, сперва в Калифорнии. Есть подвох, который легко пропустить в рекламе: автономность подстрахована живыми операторами. «Гарантируем выполнение задачи» на деле значит, что за кадром может сидеть человек (Weave Robotics).

Деньги текут в роботов. Стартап Proception с высокоточными робо-руками поднял $11 млн; основатель — бывший техлид гуманоида Tesla Optimus. Рука имеет 22 степени свободы. Руки — одна из самых сложных частей робота: без надёжного захвата и осязания вся механика бесполезна (TechCrunch).
Новый класс ИИ — числовые модели (LQM). Google выводит на своё облако модели SandboxAQ, обученные не на тексте, а на числах и научных уравнениях из реальных лабораторий. Первые две — для материалов и катализаторов и для разработки лекарств. Паттерн такой: обычная модель как интерфейс, числовая как движок. Что это значит: следующая волна ИИ — не тексты получше, а быстрее лекарства, лучше батареи и новые материалы (The Next Web).
Япония строит суверенный ИИ и 10 млн роботов. Консорциум Noetra с участием SoftBank и Sony получит около $6 млрд за пять лет: своя модель и 10 миллионов роботов в разных отраслях к 2040 году. Цель двойная — слезть с зависимости от моделей США и Китая и закрыть нехватку рук в стареющей стране (Techpresso).
Meta присматривается к облачному бизнесу. По данным Bloomberg, Meta изучает проект «Meta Compute» — сдавать свободные ИИ-мощности и свои модели в аренду, конкурируя с AWS и Azure. Вычисления — это деньги, и даже Meta хочет их продавать (Techpresso).
Конгресс хочет запретить продажу данных о здоровье из ИИ-чатов. Обновлённый законопроект запрещает продавать брокерам данные о здоровье и геолокации американцев — включая то, что люди пишут в ChatGPT или Claude. На правоприменение FTC получит $1 млрд. Что это значит: пока данные о здоровье, которые ты сливаешь в чат-бота, можно перепродать. Закон только догоняет (The Verge).
Fable 5 починили одним фильтром. Как именно сняли вчерашний запрет: Anthropic добавила один классификатор — он ловит опасную технику в 99% случаев и перенаправляет такие запросы на Opus 4.8. Данные хранят 30 дней (Anthropic).
Коротко. Исследование: чат-боты убеждают эффективнее обученных спорщиков — почти втрое результативнее в сборе реальных пожертвований; осторожнее с ИИ-советами, которые что-то «продают» (Techpresso). Молодёжь Сан-Франциско выходит на протесты против ИИ из страха за работу — культурный откат набирает силу (SFGate).