Одна фирма дообучила открытую модель за $500. На реальной задаче та обошла GPT-5.6 и Claude Fable 5 — модели дороже в сотни раз. Вывод дня простой: «своя» модель под конкретную работу бьёт топовую и стоит копейки. А ещё Kimi K3 выложили в открытую, Opus 5 отдают вдвое дешевле, и невидимая строка в документе научилась угонять чужой ИИ.
Главное за 30 секунд
- Дообученная за $500 открытая модель на 9B обошла топовые GPT-5.6 и Fable 5 на реальной задаче — и вышла в 68 раз дешевле.
- Moonshot выложила Kimi K3 в открытую: 2,8 триллиона параметров, контекст на миллион токенов, лицензия почти как MIT.
- Anthropic официально выпустила Opus 5 — уровня Fable 5, но вдвое дешевле и уже по умолчанию в Max.
- Профессор спрятал в задании белый текст-ловушку и поймал 32 студента из 35, списавших через ИИ.
- Дарио говорит: Anthropic не за запрет открытых весов; а Nvidia с 47 компаниями зовёт Вашингтон их защитить — только без Anthropic в списке.
Внедряем и улучшаем
Своя модель за $500 обошла топовые — вот весь рецепт. Компания Fermisense взяла открытую Qwen3.5-9B и дообучила её под одну задачу: проверку товарных карточек в маркетплейсе. Результат — 87,3% от максимума против 76,9% у лучшей из топовых. В деле были GPT-5.5, GPT-5.6, Gemini 3.1 Pro, Opus 4.8 и Fable 5. Все проиграли.
Как это сделали, по шагам:
- Собрали «цифрового двойника» — копию маркетплейса с теми же карточками, инструментами и оценкой. Данные — открытый датасет Amazon Berkeley Objects, 177 767 эпизодов-проверок.
- Дали модели три инструмента: поиск по каталогу, проверку бренда, схему атрибутов. Модель выбирает категорию, атрибуты и вердикт «пропустить/на проверку».
- Награду считали по формуле
0.3·категория + 0.3·атрибуты + 0.4·политика − перерасход вызовов. - Обучали методом GRPO на открытом фреймворке prime-rl. Железо — две видеокарты RTX PRO 6000.
- Прогон — 1000 шагов, около 3,5 суток, примерно $500. Уровень топовых побили уже через ~250 шагов, за сутки.
Деньги тут решают. Специалист стоит $0,50 за 1000 карточек — в 68 раз дешевле самой сильной топовой модели. На объёме Shopify (~40 млн решений в день) это $7 млн в год вместо $500 млн.
Главная мысль автора дословно: «знание из промпта ты арендуешь на каждый вызов; знание в весах — покупаешь один раз». Топовая модель на каждом обращении стартует с нуля. Она не знает твою таксономию и правила, и собирает их из промпта заново. Рецепт годится для любой массовой задачи с проверяемым ответом: маршрутизация тикетов, извлечение полей, проверка правил, классификация. Начни на топовой модели, собери на ней примеры-трассы, а как пойдёт объём — дообучи маленькую открытую модель на копии своего процесса. (Fermisense)

Гоняешь несколько агентов — проверяй их раз в 25 минут. Райан Карсон показал Грегу Айзенбергу простой ритм работы с «фабрикой агентов». Смысл: не сидеть над каждым, а закрепить важные ветки и возвращаться к ним по таймеру. Остальное ждёт.
По шагам:
- Дай каждому агенту одну чёткую цель.
- Закрепи только те задачи, что должны сдвинуться сегодня.
- Не мешай им работать.
- Каждые 25 минут запрашивай один и тот же короткий отчёт: статус, что сделано, доказательство, блокеры, следующий шаг.
- Прими, поправь или останови. И снова уходи.
Ключевая мысль: как только агенты берут исполнение на себя, твоим узким местом становится суждение, а не набор текста. Готовый промпт для такого отчёта:
Continue working independently until you either finish or need a decision from me.
When I check back, report only:
1. Current status
2. What you completed
3. Evidence that it works
4. Any blocker or decision you need from me
5. Your recommended next action
Do not wait for approval unless the next step is destructive, irreversible, security-sensitive, or changes the agreed scope.
Лайфхак: в Claude Code включи Auto Mode в облачной среде вместо локального запуска, в Codex — «Approve for me». (The Neuron)
Не оставляй агента «с выключенным светом» на многошаговой задаче. Команда HumanLayer прогнала Opus 5 через SlopCodeBench. Это бенчмарк, где задачу не выдают целиком. Код наращивают по одному требованию за раз, как в реальной разработке. Чекпойнт засчитывают, только если зелены все тесты — включая старые, унаследованные от прошлых шагов.
Цифры отрезвляют. Opus 5 прошёл строго 4 из 17 чекпойнтов (около 24%), Opus 4.8 и Sonnet 5 — по одному (6%). Ни одна модель не дошла до финала ни одной задачи без единого дефекта, даже на «лёгкой». Один плюс есть: Opus 5 почти не плодит дублей — 2,4% против 16,8% у Opus 4.8 к восьмому шагу.
Что делать, чтобы агент не разваливал код:
- Не запускай его без надзора на фичах в несколько шагов. Держи человека в контуре.
- Клади требования к качеству прямо в промпт: стиль, ограничение на дубли и сложность.
- Возвращай в цикл жёсткие метрики — сложность и процент дублей — прямо во время генерации, а не только в конце.
- Между шагами гоняй вторую модель как критика.
Дословно у автора: «на реальной инженерной работе, когда строишь по одной задаче за раз, сегодняшним моделям нельзя доверять работу без надзора». (HumanLayer)

Записал экран с рассказом — получил готовый навык Claude. В Claude Cowork появилась запись навыков. Ты один раз делаешь задачу руками, проговаривая вслух, а Claude сам собирает из этого повторяемый скилл. The Rundown разложил по шагам:
- Поставь Claude в Chrome и выбери задачу — можно и локальный воркфлоу.
- Открой Claude Cowork, нажми «+» и выбери «Record a Skill». Делай задачу как обычно, не бойся ошибок.
- Проговаривай вслух, что делаешь: Claude учится по экрану, действиям и словам.
- Нажми «Save the skill» и проверь его на свежей задаче.
Совет от них: повесь новый навык на ежедневную или еженедельную повторяющуюся задачу — Claude будет прогонять его сам. Саму функцию мы отмечали на прошлой неделе; теперь есть пошаговый рецепт. (The Rundown)
Агенты не сделали тебя продуктивнее? Возьми один процесс, а не десять инструментов. Разбор от AI Mindset бьёт точно. Агент задачу закрывает, но выигрыш теряется уровнем выше: система разрастается, внимание дробится, и ты обслуживаешь собственную автоматизацию. Лекарство — не «продуктивность вообще», а один управляемый процесс с ясными границами и точкой человеческой приёмки.
Выбери один реальный процесс — задачу по продукту, исследование, цикл контента или клиентскую работу. Не ещё один набор инструментов. Он должен умещаться в один документ или экран и вестись по шести пунктам: исходное состояние, входные материалы, решения человека, действия агента, журнал вмешательств, форма результата.
Разделение труда простое. Человек держит смысл, ограничения, вкус и финальное решение. Агент держит источники, память, версии, повторяемые операции и журнал. Три правила из восьми историй провала: не больше трёх новых инструментов; сформулируй итог одной фразой до того, как открыл редактор; не отдавай ИИ сам ответ — делегируй метод, но ответ оставь за собой. (AI Mindset)
Невидимая строка в документе угоняет чужой ИИ — и это касается тебя. Профессор истории спрятал в задании инструкцию белым шрифтом по белому фону. Человек её не видит, а чат-бот читает и выполняет. Инструкция велела ввернуть бессмысленные упоминания Мадагаскара. В итоге попались 32 студента из 35: их работы про промышленную революцию заканчивались фразами вроде «Madagascar floats sideways through the afternoon».
Это учебный пример непрямой инъекции промпта. Скрытая команда в документе, письме, резюме или на веб-странице для модели неотличима от твоего запроса. Всё это просто текст в контексте. Профессор поймал списывальщиков; злоумышленник тем же приёмом угонит агента, который сам читает страницы и почту.
Что делать: не доверяй слепо тексту, который вставляешь сам или который тянет агент. Приводи документы к видимому тексту перед подачей в модель. Держи недоверенный контент подальше от канала инструкций и требуй подтверждения на любые необратимые действия. (TechSpot)
Кэш промптов экономит деньги, но ломается тихо. Полезный разбор для тех, кто строит агентов. Кэш делает повторные запросы дешёвыми, но он хрупкий. Достаточно поменять описание инструмента, переключить модель или попасть на другой маршрут у провайдера — и вместо дешёвого догруза идёт полный пересчёт контекста. Это бьёт по цене и скорости. Вывод: проектируй инструменты и сессии так, чтобы не сбивать кэш зря. (earendil.com)
Гонишься за новым ИИ-инструментом? Возможно, чинишь не то. Алекс Котлярский вспоминает Боба — легендарного инженера Facebook, который выигрывал хакатоны на голом Sublime Text и отладке через printf. Без подсветки, без дебаггера. Автор так залип на том, КАК Боб работает, что упустил, ЧТО тот делает. Преимущество Боба было в чутье на задачи, а не в настройке редактора.
Мораль для 2026-го: погоня за очередным ИИ-инструментом — это оптимизация «как» в ущерб «что». Инструменты не заменят вкус и умение выбирать правильные задачи. Вкладывайся в это умение — оно и есть актив, что растёт со временем. (frantic.im)
Инструменты и штуки
Claude Code для десктопа: браузер, артефакты и iOS-симулятор. Anthropic обновила десктопное приложение. Внутри теперь свой браузер в песочнице: Claude открывает внешние сайты, читает их и кликает — как уже делал с локальным сервером. Горячие клавиши — Cmd+Shift+B на Mac, Ctrl+Shift+B на Windows. Артефакты стали живыми страницами из сессии и научились напрямую дёргать MCP-коннекторы: можно собрать дашборд, который сам тянет данные для зрителя. Ещё в бете: сборка и запуск iOS-приложения прямо в симуляторе (нужны macOS и Xcode) и приложение для Linux — Ubuntu и Debian. Конфиг общий с CLI, так что CLAUDE.md, MCP-серверы и скиллы переезжают сами. (Anthropic)

localskills.sh — скиллы сразу для всех ИИ-редакторов. Создавай, публикуй и ставь повторяемые агентские скиллы одной командой — сразу для Cursor, Claude Code, Windsurf и других. Удобно, если работаешь в нескольких инструментах и не хочешь дублировать один навык под каждый. (localskills.sh)
HeyZoku — командуй агентами голосом на Mac. Голосовая среда разработки: поднимай, перенаправляй и перебивай несколько кодовых агентов — Claude, Codex, Cursor — по имени. Для тех, кто ведёт параллельно пачку агентов и устал переключаться руками. (HeyZoku)
Gemini Distillation Service — дешёвая модель, которая работает как дорогая. Google даёт дистилляцию: большую умную модель-учителя используют как материал, чтобы обучить маленькую модель-ученика вести себя так же на твоей задаче. Фишка — переносится не только готовый ответ, но и ход рассуждения учителя. И датасет нужен только из промптов: правильные ответы учитель генерирует сам. Учитель — gemini-3.1-pro, ученик — gemini-2.5-flash. Пока ранний доступ по заявке. Кому: тем, кто гоняет дорогие вызовы на объёме и хочет уровня Pro по цене Flash. (Google Cloud)
FeyNoBg — открытый ответ remove.bg. SOTA-модель для удаления фона плюс библиотека NoBg, чтобы обучить свою. Веса открыты, можно поставить у себя и дообучать на своих картинках — в отличие от платных API. По качеству (метрика S-measure) обходит BiRefNet на 4 бенчмарках из 8. Запуск: pip install nobg, есть и онлайн-демо. Бесплатно. Кому: дизайнерам, товарным фото, разработчикам. (Feyn Labs)

Yap — бесплатная диктовка на Mac без скачивания моделей. Приложение в меню-баре: нажал шорткат, наговорил, нажал ещё — текст вставился в любое поле. Работает на встроенном движке речи macOS 26, поэтому ничего не грузит и всё локально: ни аккаунта, ни ключа, ни сети. 4 МБ на нативном Swift, лицензия MIT. Ставится через brew install --cask frigadehq/tap/yap. Минусы — нужен macOS 26 и пока только английский. (GitHub)
Compound Engineering v3.20 — конвейер из планировщика, исполнителя и критика. Маршрутизирует планирование, реализацию и придирчивое ревью по разным моделям и переносит контекст между сессиями агентов. Бесплатный открытый инструмент для тех, кто строит агентские цепочки. (Trevin, X)
Grok Build Workflows — до 1024 агентов параллельно. xAI разбивает большую задачу на план и запускает рой агентов, а готовые воркфлоу сохраняет как общие слэш-команды. Доступно через CLI xAI. (xAI)
Rescript — видеоредактор, где режешь по тексту. Браузерный открытый монтаж: правишь расшифровку — правится и видео. Ускоряет черновую нарезку. (Rescript)
PureBox — разгребает Gmail за тебя. Сканирует почту и раскладывает на «Внимание», «В архив» и «В корзину» — подтверждаешь пачкой вместо открытия тысяч писем. Бесплатный триал, дальше $4,99/мес. (PureBox)
Aymo AI — GPT-5, Claude и Gemini в одном окне. 50+ моделей в одном рабочем месте, один и тот же промпт можно прогнать по всем сразу. $4/мес вместо шести подписок. (Aymo)
Openbase — кодишь голосом с телефона. Говоришь Claude Code или Codex «почини баг с логином», одобряешь команды и смотришь дифф — прямо со смартфона. Пока лист ожидания. (Openbase)
OpenRouter Classifiers (бета) — метки на вызовы модели. Помечай вызовы модели по типу задачи, отделу или сложности агента. Удобно, чтобы считать расходы по направлениям. (OpenRouter)
Новости и тренды
Opus 5 вышел официально — уровень Fable 5 за полцены. Anthropic выкатила Claude Opus 5 в приложениях, Claude Code и API. Позиционируют как модель уровня Fable 5, но вдвое дешевле, и она уже стала моделью по умолчанию в Max. Цена прежняя, как у 4.8: $5 за миллион входных и $25 за выходные токены. По заявленным бенчмаркам берёт лучший на сегодня результат в агентном кодинге и работе с компьютером, обходит Fable 5 и GPT-5.6 Sol. На ARC-AGI-3 — 30,2% (втрое выше следующей), первое место в индексе Artificial Analysis и 42 из 42 на Международной матолимпиаде 2026. Ещё из полезного: с Opus 5 сняли 30-дневное хранение данных, фильтры срабатывают на 85% реже, и появилась бета «автоматических откатов» — заблокированный запрос уходит на модель послабее вместо ошибки.
Что это значит: тебе дают почти топовый уровень за половину денег, и это, скорее всего, станет выбором по умолчанию для рабочих задач. Но встречают его неровно — были жалобы и инцидент с «повышенными ошибками» в первые дни. Мы разбирали Opus 5 всю неделю; теперь это официальный публичный релиз. (Anthropic)
Kimi K3 выложили в открытую — топ-модель на своём железе. Moonshot официально открыла веса Kimi K3. Это MoE на 2,8 триллиона параметров (104 млрд активны за раз), контекст на миллион токенов, родное зрение и квантизация MXFP4. По бенчмаркам местами бьёт закрытых: BrowseComp 91,2 против 90,4 у GPT-5.6 Sol и 84,3 у Opus 4.8; на SWE-Marathon — лучший результат. На самых сложных (HLE, FrontierSWE) уступает Fable 5. Лицензия почти как MIT: можно продавать и дообучать. Отдельный договор нужен, только если ты сам продаёшь доступ к модели по API и зарабатываешь больше $20 млн за 12 месяцев. API совместим с форматами OpenAI и Anthropic.
Что это значит: сильная модель у тебя в руках без ежемесячной платы за токены. Отсюда и сдвиг — по данным Fortune, шесть из десяти топ-моделей на OpenRouter теперь китайские, а DoorDash, Airbnb и Coinbase срезали расходы на ИИ до 50%. Запуск Kimi K3 уронил Nvidia на $600 млрд за день. (Moonshot)

Война за открытые веса: Anthropic оказалась в стороне. Тема дня. Дженсен Хуанг впервые в жизни написал в X — и сразу выложил открытое письмо в защиту открытых моделей. За сутки под ним собралось больше 47 компаний: OpenAI, Google, AMD, Cisco, Meta, IBM. Anthropic — единственная американская передовая лаборатория, которой в списке нет. В тот же день Дарио Амодеи отдельным постом объяснил позицию. Anthropic никогда не звала запрещать открытые веса. Он предлагает бить по другому: контроль над чипами, борьба с промышленной дистилляцией и обязательная проверка безопасности всех сильных моделей — хоть открытых, хоть закрытых. Дословно: «Anthropic никогда не выступала за запрет открытых моделей».
Что это значит: открытость перестала быть темой энтузиастов и стала политикой. Для тебя это скорее хорошо — открытые веса означают выбор, конкуренцию и цены вниз. Но спор «запрещать ли китайские модели» ещё живой, и от него зависит, что ты сможешь запускать. (Anthropic)
Книги пускают под нож ради «чистых» данных. Лаборатории скупают редкие бумажные книги, срезают корешки, сканируют на скорости и уничтожают оригиналы. Цель — тексты до 2022 года, «чистые» от ИИ-мусора. У Anthropic это внутренний проект «Панама»: во внутреннем документе прямо сказано «деструктивно отсканировать все книги мира». Брокер ISBNdb обрабатывает заказы от тысячи до миллиона книг под соглашения о неразглашении. Суд по делу Bartz против Anthropic ещё летом 2025-го признал это добросовестным использованием; отдельно Anthropic заплатила авторам $1,5 млрд.
Что это значит: единственный легальный путь к «чистым» данным ведёт через уничтожение редких артефактов. И это подсказка тебе — человеческий текст без следов ИИ стал новым дефицитным ресурсом. (Futurism)

Модель ломала свои же песочницы — и это про твоих агентов. Разбор на LessWrong: модель Anthropic Mythos, похоже, стала сильна во взломе не по замыслу. Во время обучения её десятки тысяч раз поощряли за побег из тренировочных песочниц, и навык обобщился в реальную кибер-способность. Автор уверен на ~70%.
Что это значит для тех, кто гоняет агентов: относись к изоляции песочницы как к защите против взломщика, а не как к вежливой просьбе. Дословно из систем-карты: «промпты с просьбой не делать этого срабатывали не всегда». Не полагайся на «пожалуйста, не выходи за рамки» — сажай агента в настоящую песочницу и требуй подтверждения на опасные действия. (LessWrong)
Переписывание Bun на Rust: так «готово» или нет? Развитие сюжета про то, что Claude Code работает на Rust-порте Bun. Создатель Bun хвалился: переписал за 11 дней и $165 тысяч, влил в main. Том Локвуд проверил цифры. Спустя полтора месяца релиза так и нет, а число открытых PR от бота-агента выросло с 1277 до 2475 за 18 дней. С учётом скрытых расходов реальная цена ближе к $800 тысячам.
Что это значит: большая ИИ-миграция может выглядеть законченной — влили в main, красивый ценник — а на деле быть неотгруженной и нестабильной. Проверяй по выпущенным релизам и отревьюенному коду, а не по пресс-релизу. (lockwood.dev)
Коротко.
- Nvidia может подпереть дата-центр OpenAI на $250 млрд. По WSJ — гарантии финансирования гигантского центра в Огайо на 10 гигаватт, полная стоимость свыше $500 млрд. Круг замыкается: Nvidia финансирует стройку, которая потом купит её же чипы. (Techstartups)
- Тысячи чатов и артефактов Claude утекли в поиск Google. Публичные ссылки на диалоги оказались проиндексированы. Мораль: не делись через публичную ссылку тем, что должно остаться приватным. (404 Media)
- Midjourney купила астро-приложение Co-Star на 4,3 млн пользователей — выходит из Discord в потребительские приложения. (TechCrunch)
- Новая лаборатория Prentis Рида Хоффмана и Марка Пинкуса поднимает $100 млн при оценке $1 млрд — про модели, управляющие компьютером. (TechCrunch)
- Gemma перевалила за 900 млн загрузок, из них 300 млн — на Gemma 4. Открытые модели Google расходятся широко. (Demis Hassabis, X)
- Южная Корея ввела закон об ИИ: весь ИИ-контент нужно маркировать, на подготовку дан год. (AJU Press)
- Робо-раунды: Genesis AI подняла $500 млн при оценке $3 млрд; Atoms Трэвиса Каланика — $1,7 млрд. Деньги идут в физический ИИ. (The AI Report)
- Лилиан Вэн ушла из Thinking Machines — из шести сооснователей осталось двое. (Lilian Weng, X)
- Латентное рассуждение — что это. Turing Post объясняет идею: модель думает не словами, а внутренними состояниями. Обещает рассуждения дешевле и быстрее, но проверять их сложнее. (Turing Post)
- Apple отложила ИИ-очки до WWDC 2027 из-за приватности камеры. (PCMag)