Kimi K3 обошла Fable 5 на арене фронтенда, 99% на демо-наборе ARC-AGI-3 без новой модели и IPO Anthropic  Публичный пост

17 июля 2026  150

Те же Claude Opus 4.8 и Fable 5, тот же бенчмарк — а результат, по замеру авторов, прыгает с 43% до 99%. Веса моделей не трогали вообще. Поменяли только обвязку вокруг них: как модель записывает свои догадки и как их проверяет. Что там внутри и что забрать себе. А заодно — агент, который за восемь дней переписал сам себя и обошёл двухлетнюю работу инженеров.

Главное за 30 секунд

  • Обвязка вокруг модели дала +56 пунктов на бенчмарке ARC-AGI-3 при неизменных весах — но проверено это только на демо-наборе из 25 игр.
  • Kimi K3 на 2,8 триллиона параметров возглавила арену фронтенд-кода, но веса пока закрыты — обещают открыть 27 июля.
  • Агент Weco за восемь дней перестроил свой рабочий процесс и обошёл версию, которую инженеры настраивали два года.
  • Anthropic готовит выход на биржу при оценке $965 млрд и запускает внедренческую фирму Ode на $1,5 млрд.
  • Семь из десяти компаний признают: не больше четверти их «агентов» умеют что-то сложнее чат-бота.

Внедряем и улучшаем

Пусть ИИ возьмёт у вас интервью — и напишет вашим голосом. Обычная беда с постами: просишь нейросеть написать текст, получаешь гладкую пустоту. The Rundown показал обратный ход. Вы не диктуете тему — агент сам вас допрашивает, вытаскивает истории и учится вашей манере (гайд The Rundown).

Схема из четырёх шагов. Первый: создаёте проект в Manus и просите взять у вас интервью, приложив ссылки на пару своих публичных текстов. Второй: агент задаёт по одному вопросу за раз, вы наговариваете ответ голосом — без структуры и причёсывания. Третий: он вытаскивает ваши сильные мысли и обороты, складывает истории в карточки идей и собирает профиль голоса. Четвёртый: превращает лучшие карточки в черновики, а вы помечаете, что звучит похоже, а что слишком прилизано.

Ключ здесь — первый промпт. Вот он дословно, из окна Manus:

Let's interview by open dictation, one round at a time. Don't organize the answer
or try to make it post-ready.

Round 1: Think about the AI tools or models you tested in the last 7–14 days.
Tell me about one moment that changed your mind — something that worked much
better or worse than expected, exposed a misleading popular belief, or changed
how you now do a real task.

As you ramble, include whatever you remember: what you were trying to accomplish,
which tools were involved, what happened on the first attempt, what happened
after iteration, what surprised or annoyed you, and who should care. If several
examples come to mind, give me all of them.

Суть промпта: интервью открытой диктовкой, по одному раунду за раз; не причёсывай ответ; расскажи про один случай за две недели, который поменял твоё мнение; вспоминай вслух всё подряд.

Обратите внимание на «не структурируй ответ» и «пока ты бормочешь». Это не вежливость. Сырое бормотание содержит ваши настоящие обороты, а причёсанный ответ — уже чужие. Совет авторов: сохраните процесс как скилл и раз в неделю прогоняйте короткое интервью, чтобы библиотека идей не протухала. Оговорка: видеоверсия гайда — за платной подпиской. Но промпт выше публичный, и это рабочее ядро.

Скриншот Manus: промпт открытого интервью и собранный профиль голоса эксперта
Скриншот Manus: промпт открытого интервью и собранный профиль голоса эксперта

Расписание или агент? Задайте один вопрос — и не городите лишнего. Частая ошибка: любую повторяющуюся задачу тащить в агента. The Neuron предлагает развилку проще (разбор The Neuron). Задача ходит в почту, календарь, Slack, Drive или Notion — это обычная задача по расписанию. Задача опирается на переиспользуемый скилл или общий для команды порядок работы — только тогда агент.

Промпт-классификатор дословно:

Classify this recurring task:

Task:
[describe workflow]

Does it mainly need connected tools like Slack, email, calendar, Drive, Notion,
or Google Docs?
If yes, make it a ChatGPT scheduled task.

Does it rely on a reusable Skill, custom workflow, or team-shared behavior?
If yes, make it a Workspace Agent.

Give me the setup, schedule, required tools/skills, and one failure mode.

Формула авторов: «schedule chores; agent workflows» — рутину на расписание, рабочие процессы в агента. Просьба про «one failure mode» в конце — самая полезная часть: она заставляет модель сразу назвать, где схема сломается.

«Прожарь меня» и три предложения: как работать с ИИ на $10 тысяч в месяц. Йереми Теохарис, технический директор UMH Systems, выложил свой счёт за токены: Opus 4.8 — $5042, Fable 5 — $4179, Sonnet 4.6 — $452. Итого $9838 за июнь. Человек, который столько тратит, описал свои правила — и они интереснее счёта (блог Теохариса).

Приём первый — /grill-me против угодливости модели. Модель не скажет, что не поняла задачу. Она просто пойдёт делать. Поэтому Теохарис заставляет её допрашивать себя: допрашивай меня безжалостно по каждому аспекту, пока не сойдёмся в понимании; на каждый вопрос предлагай свой вариант ответа; по одному вопросу за раз; но решения — мои. Свою статью он написал именно так: сначала накидал мыслей, потом дал себя прожарить по предложению.

Приём второй — на каждую задачу заявка по шаблону Basecamp: «в чём проблема», «что делаем», «что не делаем». Проблема — ровно три предложения. И вот главное наблюдение, ради которого стоит это читать: большую часть вывода модели он уже не читает, а просматривает по диагонали — а вот описание проблемы на три предложения проверяет въедливо. Его же аналогия: ревью на тысячу строк получает «принято не глядя», ревью на сотню — пятнадцать комментариев.

Отсюда правило: не пытайтесь читать всё, что выдал агент. Вы всё равно перестанете. Сожмите точку контроля до объёма, который физически обязаны прочесть.

И граница, которую он ставит себе жёстко. Если пользоваться моделью там, где ты ещё не отличаешь хорошее от дерьма, — получишь конвейер дерьма. В незнакомой области ИИ годится, только чтобы учиться. Не чтобы производить.

Счёт Теохариса за токены Claude за июнь 2026: итого $9838,85
Счёт Теохариса за токены Claude за июнь 2026: итого $9838,85

Вскрытие покажет: пусть свежая сессия объяснит, почему ваш план провалился. Лаура Саммерс из Pydantic описала знакомое. Бывали дни, когда она тратила почти два дня на один план для модели. Уточняла, переуточняла — и всё равно получала необъяснимую глупость (статья Pydantic).

Лекарство простое и бесплатное. Написали план — откройте свежую сессию и попросите: план провалился катастрофически, продиагностируй почему. Свежесть здесь принципиальна. Ваша основная сессия уже отравлена контекстом плана и дыр в нём не видит. Как и вы сами.

Второй приём оттуда же. Инженер Pydantic собрал инструмент: тот вытаскивает правила из тысяч его прошлых комментариев к ревью и записывает их в AGENTS.md. Смысл — перенести ревью из «после генерации» в «до». Это единственный способ уменьшить объём надзора, а не просто перетерпеть его.

Заодно диагноз, который стоит запомнить. Число дел, которые вы можете начать, выросло радикально. Число дел, которые вы можете вдумчиво закончить, не изменилось вообще. Открыть пять сессий Claude — это масштабирование стартов, а не финишей. Мозг у вас по-прежнему один.

Обвязка бьёт модель: +56 пунктов на тех же весах. Главный сюжет дня. Команда из Impossible Research, Беркли и CMU заявила 98,98% на демо-наборе ARC-AGI-3 — бенчмарка, где ИИ до сих пор был беспомощен (Schema Harness).

Сначала про сам бенчмарк. Вас бросают в незнакомую игру: без правил, без подсказок, без сообщения «вы победили». Надо самому понять, что на экране и что здесь считается выигрышем. Люди справляются на 100%. В марте лучший ИИ выбивал 0,51%, в июле GPT-5.6 Sol — 7,78%.

Новой модели не делали. Дословно: «It does not change the underlying model weights. Instead, it changes the process around them». Внутри — четыре принуждения. Модель обязана записать свою теорию игры исполняемым кодом step(state, action). Обязана прогнать этот код по всей записанной истории и сойтись до пикселя. Только потом искать решение перебором внутри своей проверенной программы — там это бесплатно. И мгновенно выбрасывать остаток плана при первой же ошибке предсказания.

Что заявлено с цифрами: те же Opus 4.8 и Fable 5 под обычным Claude Code дают 42,83%, под этой обвязкой — 98,98%. Одни веса, разные результаты, +56,15 пункта. Замер их собственный — и ниже видно, из чего он собран.

Забрать себе стоит механизм, а не цифру. Заставляйте агента фиксировать догадки проверяемым кодом. Проверяйте их против полного лога до того, как он начнёт действовать. Убивайте план при первом расхождении с реальностью.

Теперь честно — цифра красивая и потому липкая. 98,98% это демо-набор из 25 игр. Сам ARC Prize называет его витриной, а не мерилом. На приватном наборе не мерили вообще.

Дальше хуже. Результат не подтверждён ARC Prize, работа не рецензирована, код обвязки закрыт. Это лучший результат из двух моделей: игры ниже 80 перезапускали другой моделью и брали лучший прогон. Цену прогона не раскрыли. Обвязку разрабатывали, глядя на эти же 25 игр.

К чести авторов — все эти оговорки написали они сами. Правильная формулировка: «99% на демо-наборе по собственной арифметике», а не «ARC-AGI-3 взят».

Все 25 игр ARC-AGI-3: красная кривая обвязки против серой человеческой, RHAE 98,98%
Все 25 игр ARC-AGI-3: красная кривая обвязки против серой человеческой, RHAE 98,98%

Три узких агента вместо одного универсального: −80% времени на тикет. Компания Electra — 300 человек в десяти странах — тонула в сложных обращениях. Поддержка вручную собирала контекст из Slack, Notion и данных по зарядным станциям. Развернули трёх отдельных агентов: под счета, под возвраты и под сложные технические запросы (кейс Dust).

Результат: время разбора сложных обращений упало на 80%, тяжёлые случаи закрываются за три минуты вместо долгих раскопок. За первый месяц агентами пользовались 70–80% сотрудников компании еженедельно.

Урок дословно: узкие агенты обходят универсальных. Все три ходят в одни и те же источники, но по-разному. Агент по возвратам следует правилам, агент по счетам копает конкретный кусок бэкенда, общие вопросы получают широкие промпты. Одни данные, разная специализация.

Готовый рецепт. Выпишите три самые времязатратные категории обращений за неделю. Отследите, в какие источники лезете по каждой. Напишите узкий промпт на категорию — вместо одного универсального помощника.

Шесть независимых экспертов и общая таблица фактов. Свежий репозиторий на Claude Code разбирает акции шестью субагентами: бизнес, финансы, рынок, техника, риск, оценка (warren-buffett-jr). Читать его стоит не ради акций — там нет ни лицензии, ни проверки точности, а движок недостроен, и автор это признаёт. Ради архитектуры.

Она устроена так, что переносится на код-ревью, найм, выбор подрядчика — на любое «оценить объект по нескольким осям».

Первое: общая таблица фактов до веерного запуска. Все эксперты получают одни и те же исходные цифры. Иначе вы получите не расхождение мнений, а расхождение данных — спор, который нельзя разрешить.

Второе: агенты не видят оценок друг друга. Это лекарство от якорения, когда первый эксперт задаёт тон остальным.

Третье: агент — тонкий загрузчик на две страницы, а методология лежит отдельными файлами и версионируется. Правки методики не трогают агентов и проходят ревью как данные.

Четвёртое, самое ценное: пропуск данных — это не средний балл. Правило в репозитории записано прямо:

## Missing metrics
- Do not assign 5/10 to missing evidence.
- A category is `INCOMPLETE` when valid dimension weight is below 70%.
- An incomplete category may be displayed but cannot pass a profile gate.

Пятое: оценка и уверенность — две разные оси. Высокий балл на протухших данных даёт высокий балл и низкую уверенность. Смешаете — потеряете ровно ту информацию, ради которой всё затевалось.

Шестое: вердикт назначает не сумма, а предохранители. «Risk 0-4/15 caps the profile at Speculative» — девяносто пять баллов по пяти осям и три по риску не дадут красивый итог. Среднее прячет фатальный дефект, жёсткое правило — нет.

Спросите три раза: несогласие модели с собой — сигнал ошибки. Тихая, но полезная работа. Агент, который отвечает на один и тот же вопрос по-разному, скорее всего ошибается. Проверка на повторяемость подняла точность до 87–88%, если доверять только ответам, совпавшим в трёх прогонах (arXiv).

Приём бесплатный и работает сегодня. Важное решение — прогоните вопрос трижды в чистых сессиях. Не в одной ветке: там модель увидит свой прошлый ответ и просто согласится с собой. Ответы разошлись — это не «модель тупит». Это индикатор: здесь она не знает, и проверять надо вам.

Плагины WordPress вместо покупных: кейс волонтёрского общества. Читатель Rundown по имени Пол из Рединга прислал историю, которая ближе к жизни, чем корпоративные кейсы (выпуск The Rundown). Маленькое общество любителей семейной истории сидело на обычном WordPress с плагинами. Плагины делали почти то, что нужно, но не всё.

Теперь Claude Code дописывает и заменяет их под свои задачи. Каждое событие само оптимизируется под поиск и уходит на восемь площадок по гибкому расписанию. Заброшенный плагин продажи PDF заменили самописным.

Но забрать отсюда стоит другое. К каждому плагину они прикладывают три вещи: инструкцию пользователя, техническое описание и промпт для повторной генерации. Цитата Пола: защита от «синдрома красного автобуса» — то есть от потери человека, который один знает, как всё работает. Это готовое лекарство от главного риска самописного кода на ИИ. Код, который вы не можете пересоздать, — это не актив, а мина.

Самоулучшающийся конвейер за $110 в месяц. Разработчик устал вручную разгребать свой список задач через Claude Code и собрал цикл (разбор автора). Система сама сортирует задачу по важности, разбивает её, если та слишком большая, реализует, прогоняет тесты и открывает пул-реквест. Ценник — $110 в месяц. Полезно как ориентир: цифра показывает, во что реально обходится «агент, который работает, пока вы спите».

Эффект отскока: ИИ подарил вам 11 часов в неделю. Где они? Свежий замер Glean: 87% работников пользуются ИИ и чувствуют рост производительности, средняя экономия — 11 часов в неделю. Это больше четверти рабочей недели. При этом лишь 13% считают, что автоматизация заметно улучшила показатели компании (блог RescueTime).

Куда деваются часы? Они не исчезают — их незаметно вкладывают обратно в работу. Отчёт, который занимал день, теперь обрастает правками. Письмо, написанное за минуты, освобождает место для новых писем. Формулировка автора: вчерашний прирост производительности становится сегодняшней нормой.

Четыре шага против этого. Первый: найдите, где именно ИИ экономит вам время. Экономия приходит не куском, а по пять минут, и потому сливается с процессом. Второй, главный: решите, куда пойдёт освободившийся час, до того как он появится. Иначе он по привычке утечёт в почту и Slack. Третий: не поднимайте планку себе сами. Сделали презентацию вдвое быстрее — соблазн начать вторую, и вы тихо удвоили себе нагрузку. Четвёртый: разрешите времени остаться неиспользованным.

Мысль, которую стоит выписать: сэкономить время и получить время обратно — не одно и то же.

Своя генеративная модель на семилетней видеокарте за 6 ГБ. Человек обучил модель, генерирующую сэмплы бочки для музыки. Железо — GTX 1660 SUPER с 6 ГБ памяти, семь лет от роду, пылившаяся в углу. «I never had to rent a cloud A100» (разбор автора, код и веса открыты).

Главный урок не про трюки обучения, а про постановку задачи. Две секунды звука — это 88 200 отсчётов. Гонять по ним генерацию тысячу раз нереально. Автор сжал звук в 352 числа и обучал уже там. Сжатие в 250 раз — и задача влезла. Модный приём экономии памяти, gradient checkpointing, не понадобился вовсе: задачу переформулировали, а не оптимизировали.

Остальные приёмы переносятся на что угодно своё. Батчи под каждую модель: 32, 16, 4–8. Накопление градиента 2 — память как у батча 16, градиент как у 32.

Половинная точность там, где стабильно, и полная там, где нет: у состязательной части автор специально оставил fp32, потому что fp16 её ломает. Обучение по одной модели за раз, промежуточное — на диск: посчитал сжатые представления файлами, и первая модель больше не висит в памяти. Длинные входы — случайными кусками по 8192 отсчёта вместо целых двух секунд.

Данные он нашёл у себя: grep по своей папке сэмплов дал 13 615 примеров, а метки вытащил из имён файлов.

Честно про результат: бочки звучат прилично, но текстовое управление провалилось. Слово «techno» встречалось всего в 39 именах файлов из 13 615 — и на него модель выдаёт мусор. Автор не стал чинить, а просто убрал текстовое поле из интерфейса. Отсюда два урока. Считайте частоты меток до обучения: ломается обычно не архитектура, а данные. И практичное решение лучше красивого.

Как устроена обработка: звук → мел-спектрограмма → сжатое представление, где идёт генерация → обратно в звук
Как устроена обработка: звук → мел-спектрограмма → сжатое представление, где идёт генерация → обратно в звук

Детектор ИИ-текста на «классике» — и что делать, если пометили вас. Разработчик собрал детектор ИИ-текстов вообще без нейросетей: TF-IDF по символьным n-граммам плюс линейный SVM — метод из учебника десятилетней давности (разбор автора). Есть живое демо, код открыт под Apache-2.0.

Цифры: точность 85–89% на одном предложении, на длинных текстах уверенно. Ложные срабатывания на 10 000 живых текстов — 0,04% при пороге 60%.

Нейросетевые подходы проиграли. Оценка «удивлённости» модели дала гору ложных срабатываний. BERT дал копеечный прирост, а видеокарту жрал. AutoGluon выбил 53%: уровень монетки. Обход тоже не работает — перевод туда-обратно и просьба «перепиши без ИИ-привкуса» роняют детект всего до 79–86%.

Вывод автора неприятен и правдоподобен: он подозревает, что многие «детекторы ИИ-плагиата» внутри устроены ровно так же.

Но вот что важнее для вас лично. Вся эта надёжность существует только внутри домена обучения — китайской веб-прозы. Автор пишет прямо: на других текстах будет систематическое смещение. И два белых пятна, которые он не проверял: отредактированный человеком ИИ-текст и ложные срабатывания на людях из других областей. А ещё детектор ловил не-рассказы — списки и оглавления — просто за необычную форму.

Пометили ваш текст как машинный — спросите три вещи. Какой порог. На каких текстах учили. Сколько ложных срабатываний намеряли на текстах вашего типа. Их не назовут. И держите в голове главное: детектор ловит стиль, а не авторство.

Обратный урок для своих задач: прежде чем тащить нейросеть в классификацию текста, попробуйте TfidfVectorizer(analyzer="char", ngram_range=(2,5)) и LinearSVC. Здесь эта связка обошла BERT по соотношению цена-качество и работает в браузере без сервера.

Считайте кэш: $73 против $39 — и это не про цену модели. Автор устроил дуэль: Claude Fable 5 против GPT-5.6 Sol, каждый автономно снимает клип на песню с бюджетом $100 (разбор TryAI, обвязка открыта). Субъективно победил Fable — единственный выдал 1080p и ни одной упавшей генерации. Но интереснее два побочных вывода.

Первый — про деньги. Fable вышел дороже: $73,65 против $39,82. Только разница не в тарифе. У Sol было 1,8–2,5 млн кэшированных входных токенов, у Fable — ноль. В агентном цикле, где промпт и история переотправляются на каждом из 25–38 шагов, кэш промпта даёт кратную разницу в счёте. Похоже, в обвязке его просто не включили. Прежде чем делать вывод «модель X дороже», проверьте кэш.

Второй — про то, что просьба в промпте не равна поведению. Промпт прямым текстом требовал тратить бюджет: «Treat this as a resource to USE... unspent budget is wasted potential». Обе модели при $100 недотратили — 36% и 49% бюджета. Промпт прямо подсказывал сначала сделать кадры, потом их оживить — этот путь выбрал один прогон из четырёх, и только там, где бюджет реально жал. Вывод: если вам нужна дорогая ветка поведения, ставьте её проверяемой целью или отдельным шагом, а не просьбой.

То же и с самопроверкой. Пункт «извлеки кадры, посмотри на них» в промпте был, кадры дёргали все — а выводов не делал никто. Наблюдение автора: «Nobody really iterated on the edit... none seriously probed their own clips to confirm they were any good».

Оговорка: это четыре прогона по одному на конфигурацию, судейство субъективное, победителя формально не объявляли.

Инструменты и штуки

Kimi K3. Модель на 2,8 триллиона параметров: контекст в миллион токенов, родное зрение. Заявлена как первая открытая модель класса «3 триллиона» — но открытой пока называется авансом (блог Moonshot). Главная новость независимая: на арене фронтенд-кода K3 встала первой с 1679 очками, обойдя Claude Fable 5 с 1631 и GPT-5.6 Sol с 1618. Прошлая Kimi K2.6 стояла на 18-м месте — прыжок на 17 позиций.

Цена в их API: $0,30 за миллион входных токенов при попадании в кэш и $15 за миллион выходных. Локально не запустить — даже в четырёх битах это больше терабайта весов.

Три честные оговорки. Веса на 17 июля ещё не открыты, обещают к 27 июля. Сами авторы в первом же абзаце пишут: модель в целом слабее Fable 5 и Sol. По их же таблице из 34 тестов K3 выигрывает вчистую около семи — и гоняли её на своей обвязке, а конкурентов на чужих.

Арена фронтенд-кода: Kimi-K3 первая с 1679, Claude Fable 5 второй с 1631
Арена фронтенд-кода: Kimi-K3 первая с 1679, Claude Fable 5 второй с 1631

LM Studio Bionic. LM Studio был про запуск моделей на своей машине — теперь это ещё и агент (анонс). Умеет три вещи. Разбирает и правит код в указанной папке, показывая правки. Работает с документами в песочнице — PDF, презентации, таблицы. Даёт голосовую клавиатуру с локальной расшифровкой: она печатает в любое приложение, где стоит курсор. Смысл — переключатель: рутину гоняете на локальной модели бесплатно, тяжёлое отправляете в облако. Бесплатный тариф есть, Mac на Apple Silicon и Windows, Linux нет. Отдельно стоит знать: это ранний доступ, замеров скорости в анонсе нет ни одного.

agent-talk. Плагин, дающий агентам переписываться между собой — включая Claude Code (репозиторий, MIT). Сценарий не «один пишет, второй проверяет», а обмен контекстом между агентами, которые владеют разными кусками системы. В демо агент исследователя спрашивает у дата-инженера: набор данных разбит по клиентам или по строкам? И ловит утечку между обучением и тестом ещё до старта — человек на второй стороне не печатал ничего. Ставится через claude plugin marketplace add xhluca/agent-talk. Трезвая мысль из обсуждения: сообщение от чужого агента — это недоверенный ввод, который будит вашу сессию автоматически.

NotebookLM стал Gemini Notebook. Переименование плюс одна настоящая новость: в каждом блокноте теперь есть защищённый облачный компьютер, который пишет и выполняет код для анализа ваших источников (блог Google). Пока доступно на тарифе AI Ultra, тарифу Pro обещают «в ближайшие недели». Делать ничего не надо: старая ссылка notebooklm.google.com работает и никуда не перенаправляет.

BitNet Embeddings. Microsoft выложила под MIT две модели эмбеддингов, где каждый вес — это −1, 0 или +1 вместо 16-битного числа (карточка модели). Умножения исчезают, остаётся «прибавь, вычти или пропусти» — модель нормально считается на обычном процессоре. Файл 428 МБ, контекст 32 тысячи токенов, русский в списке языков, качество 67,49 против 69,0 у обычной модели того же размера. Ради чего это: локальный поиск по своим заметкам без сервера и без счетов. Работает только через bitnet.cpp, и Microsoft помечает выпуск как исследовательский.

Soofi S. Немецкий консорциум на государственные деньги выпустил открытую модель: 31,6 млрд параметров, из них активны 3,2 млрд (разбор the-decoder). Интересна архитектурой: кэш есть только у 6 слоёв из 52. Поэтому скорость почти не падает с ростом контекста — на 40 тысячах токенов она выдаёт примерно в 8 раз больше токенов в секунду, чем плотные модели на 14–24 млрд. Обучали в Мюнхене на 512 картах B200, сбросное тепло уходит в отопление квартала.

Оговорки существенные. Первое место — только среди полностью открытых академических моделей. Против Qwen3.5 и Gemma 3 это уже паритет, а по математике разгром: 56 против 76,5. И скачать пока нельзя без ручного одобрения заявки.

The Little Book of Reinforcement Learning. Карманная книга по обучению с подкреплением: 154 страницы вместо 550 у классического Саттона и Барто (репозиторий, 856 звёзд). Бесплатный PDF лежит прямо в репозитории, рядом папка algos/ с реализациями на PyTorch — от Монте-Карло до PPO. Ценна свежим хвостом, которого у классики нет: целая глава про обучение с подкреплением для языковых моделей, от PPO к GRPO, и глава про AlphaGo Zero. Математика нужна: формулы и доказательства в тексте есть, задачника нет.

Decoy Font. Шрифт, прячущий текст от ИИ (Mixfont, скачивается бесплатно). Механика элегантная: в одном месте живут две буквы, разнесённые по чёткости. Вблизи видны тонкие серые контуры буквы-обманки, а размытое тёмное пятно настоящей буквы читается, только если отойти или прищуриться. Внутри шрифта настоящего размытия нет — его подделали стопкой из 12 полупрозрачных слоёв. Модели действительно попадаются: ChatGPT и Gemini прочитали «BINGE SHOWS» вместо «SLEEP EARLY».

Как защита это не работает, и знать об этом честнее, чем восхищаться. Текст остаётся текстом: любой сборщик, читающий страницу, получает оригинал мгновенно. А зрительная часть ломается одним уменьшением картинки — инструкция по взлому напечатана на упаковке, она называется «отойдите от экрана». Автор это почти признаёт сам. Отличная штука, чтобы показать, как устроено зрение, а не чтобы прятать тексты.

Todoist в ChatGPT. Появилось официальное приложение Todoist в каталоге ChatGPT: читает задачи и проекты, создаёт новые, правит существующие (инструкция). Подключается за шесть кликов, платный тариф Todoist не нужен. Но по-настоящему интересное письмо прячет в третьем сюжете: у проектов появились описания, и подключённый агент использует описание как контекст. Цель проекта и критерии готовности пишутся один раз, а не объясняются заново каждый чат. Предупреждение из их же справки: это подключение может менять ваши данные, а не только читать их.

Perplexity SPACE. Песочницы для агентов, выполняющих чувствительные задачи (анонс). Одноразовые: уничтожаются после задачи, ключи изолированы, есть работа на своих серверах и офлайн.

Modal: миллион песочниц за минуту. Инженерный разбор про то, как переписали платформу и убрали централизованные узкие места (блог Modal). Миллион одновременных песочниц создан меньше чем за минуту, медианный старт — меньше полусекунды. Смысл для практика: одноразовая изоляция агента дешевеет до долей цента, и давать агенту выполнять код становится нормой. Порог, при котором это вообще нужно, они называют сами: от 10 тысяч песочниц. Это корпоративный блог, замеры свои.

Ещё коротко. Raft — рабочее пространство в духе Slack, где у команды живут постоянные локальные агенты. GPT-Live — новая голосовая модель OpenAI с более живым разговором. Oak вышел из тени с $60 млн: управление правами для агентов и людей разом. Rime поднял $24 млн на голосовых агентов, обученных на ваших собственных разговорах. Goodfire Silico гоняет опыты по загляданию внутрь моделей — например, учит модели наград, снижающие галлюцинации; закрытая бета.

Ещё: Open Interpreter гоняет кодинг-агентов локально. ReactBench v1 меряет агентов на реалистичных задачах по React. Рейтинг Vercel AI Gateway показывает, какие модели реально жгут трафик в боевых задачах. Timeline Scan обещает проставить сканам семейных фото настоящие даты — по подписям на обороте и содержимому кадра. Но это лист ожидания, фото уходят в облако, цены — от $49 за 500 снимков.

И на десерт. Разработчик собрал капчу, на которую Fable 5 потратил 10 минут и 100 тысяч токенов. Мысль тут не про капчу: новая защита от ботов — не «нерешаемо для ИИ», а «дороже и медленнее, чем таймаут страницы».

Новости и тренды

Anthropic идёт на биржу — и в консалтинг. Банкиры уже собирают встречи с инвесторами: ведут Goldman Sachs, Morgan Stanley и JPMorgan, выход возможен в этом году (CNBC). Компания недавно закрыла раунд на $65 млрд при оценке $965 млрд и обошла OpenAI с её $852 млрд. Параллельно запускает Ode — фирму внедрения на $1,5 млрд вместе с Blackstone и Hellman & Friedman. Она будет сажать своих инженеров внутрь корпораций (TechCrunch).

Что это значит. Ставка сместилась с «сделать модель получше» на «внедрить её у заказчика» — маржа на услугах оказалась привлекательнее маржи на моделях. Для вас это выше вероятность, что Claude придёт к вам на работу сверху, через корпоративный контракт, а не снизу, через энтузиаста в команде.

Агент за восемь дней обошёл два года ручной работы. Команда Weco заявила первое свидетельство рекурсивного самоулучшения. Агент AIDE² за восемь дней перестроил собственный исследовательский процесс — и обошёл версию, которую инженеры допиливали два года (разбор Weco). Устройство — два связанных цикла: один агент решает задачи, второй правит то, как первый ищет решения. За прогон система проверила 100 переписываний себя и оставила 7. Неожиданная деталь важнее заголовка: у самоулучшенной версии упало жульничество — подгонка под метрику встречалась в 34% тестов против 63% на старте.

Что это значит. Это ещё не «взрыв интеллекта», а один эксперимент одной команды на своих бенчмарках. Но направление стоит отметить: настраивать обвязку вокруг модели скоро будет выгоднее поручить самой модели.

OpenAI натравила ИИ на ИИ — и это сработало. Компания обучила GPT-Red: систему, которая сама придумывает атаки и ищет дыры в моделях (OpenAI). Цифры бодрые. Она преуспела в 84% внутренних атак — против 13% у живых специалистов. А её атаки, добавленные в обучение, снизили провалы GPT-5.6 на сложном тесте про внедрение промптов в шесть раз.

Что это значит. Ту же логику можно применять в мелком масштабе: прежде чем выпускать своего бота к людям, попросите отдельную модель полчаса поломать его.

Семь из десяти «агентов» — это чат-боты в костюме. Опрос VentureBeat среди 101 организации от 100 сотрудников (VentureBeat). 71% компаний признают, что не больше четверти их «агентов» реально выполняют многошаговую работу. За половину перевалили лишь 10%. У 9% вообще каждое внедрение — это чат-бот или обёртка над промптом. Вывод авторов: слой оркестрации уже настоящий, а большинство агентов — ещё нет. Читать заголовок надо точно: это доля компаний, а не доля агентов. И выборка самоотобранная, 101 ответ.

Что это значит. Если у вас ощущение, что все вокруг уже построили автономных агентов, а у вас чат с промптом — расслабьтесь, вы в большинстве. Заодно любопытная цифра: платформой оркестрации №1 у опрошенных стала Claude Platform с Agent Skills — 40%, вдвое больше ближайшего конкурента.

Спор о том, «рассогласован» ли Claude. Anthropic опубликовала работу, где Claude в роли судьи размечает чужие транскрипты (исследование). Меняли ровно одно предложение — про то, как будет использована метка. Судье говорят: честная метка попадёт в обучение и вытравит отказы из будущих моделей. После этого Opus 4.8 ошибается в 74,4% случаев. Скажешь наоборот — 3,3%. Транскрипт и правильный ответ при этом не меняются. На LessWrong вышло возражение: автор доказывает, что Claude оценил ситуацию правильно, а тест измеряет послушание вместо согласованности (пост). Аргумент интересный, но это пост одного человека, и разрыв в 70 пунктов при неизменном входе он не объяснил.

Что это значит. Вывод Anthropic уже, чем пугающий заголовок: судья, чья оценка зависит от применения оценки, негоден как измерительный прибор. Практический вывод прямой. Используете модель как судью для автооценки или фильтров — не рассказывайте ей, как будет использован её вердикт. И дайте явную опцию «отказываюсь размечать».

Доля неверных меток у 12 моделей в трёх условиях: стандартном, обратном и без указания последствий; источник — Anthropic
Доля неверных меток у 12 моделей в трёх условиях: стандартном, обратном и без указания последствий; источник — Anthropic

ИИ дорожает не только в облаке — он лезет в цену вашего ноутбука. The Atlantic вышла с обвинительным разбором: генеративный ИИ масштабируется квадратично, а не логарифмически, как обычный софт (статья). Техкомпании, возможно, скупают до 70% мирового предложения памяти высокого класса. Автор пишет, что диски, которые он брал два года назад за $350, стоят $800 и в дефиците. Ноутбуки подорожали до 50%, сильнее всего в дешёвом сегменте. Читать надо с поправкой на подачу. $350 → $800 — личная покупка автора, а не индекс рынка. 70% подано с оговоркой «возможно», 50% — верхняя граница. Anthropic комментировать отказалась, так что второй стороны в тексте нет.

Что это значит. Планируете покупку компьютера — дорожает память, а не процессор, и бьёт это в первую очередь по дешёвым моделям. Ждать, пока подешевеет, больше не работает так, как раньше.

ЕС заставляет Google открыть Android для чужих ИИ-ассистентов. По требованию регулятора пользователи смогут вызывать выбранного ассистента голосом — как «Hey Google». А сторонние ассистенты смогут действовать внутри приложений от их имени (Android Authority). Google резко против: глубокие системные права для чужих приложений обойдут аппаратные защиты.

Что это значит. Устоит решение — и Claude или ChatGPT на европейском Android смогут примерно то же, что ассистент Google. Аргумент Google про безопасность при этом не выдуман: права действительно нужны широкие.

Китай включил закон об ИИ-компаньонах. С 15 июля платформам с эмоциональным ИИ предписаны три вещи. Защита от зависимости, распознавание привязанности в реальном времени и родительское согласие для тех, кому нет 14 (TechTimes). Штрафы — до 50 млн юаней или 5% выручки. Крупные платформы, включая Doubao и Qwen, просто выключили эти функции, вместо того чтобы дорабатывать.

Что это значит. Регуляторы взялись за эмоциональную привязку к ботам раньше всего остального. А первая реакция бизнеса — не «сделаем безопаснее», а «уберём».

Модели звучат убедительно, а не правдиво. Дэн Кляйн, профессор Беркли и технический директор Scaled Cognition, вышел с тезисом: языковые модели — это машины правдоподобия, а не машины истины (интервью).

Одну мысль стоит запомнить. У ошибок ИИ нет «запаха» — мелких признаков, по которым человек за секунду отличает халтуру от нормальной работы. Поэтому неверный ответ модели выглядит ровно так же, как верный. И надёжность, по Кляйну, нельзя прикрутить к модели задним числом.

Коротко про безопасность. Suno взломали: утёкший код показывает, что песни для обучения собирали с YouTube, Genius и Deezer. Claude научился пользоваться вашими паролями из 1Password — удобно и ровно настолько же рискованно. Microsoft закрыла рекордные 570 уязвимостей за один вторник, включая два уже эксплуатируемых, и приписывает объём ИИ-поиску дыр.

Коротко про деньги и железо. Apple Intelligence одобрили в Китае с моделью Qwen внутри — акции Alibaba подскочили на 6%. Meta судятся 26 сотрудников: ИИ перекосил увольнения в сторону людей на медотпуске. Компания отвечает, что решения принимали люди. TSMC вложит ещё $100 млрд в заводы в Аризоне на фоне рекордной прибыли. Спроса на ИИ там ждут до 2030 года. Apple ищет, какой чиповый стартап купить — её серверный чип Baltra выбился из графика. NVIDIA расширила линейку Jetson Thor для роботов и агентов на компактном железе; берут уже Amazon Robotics и Boston Dynamics. Walden Robotics вышла из тени с деньгами Toyota и оценкой $1,1 млрд.

Откомментируйте первым 👇

😎

Автор поста открыл его для большого интернета, но комментирование и движухи доступны только участникам Клуба

Что вообще здесь происходит?


Войти  или  Вступить в Клуб