Kimi K3 обошла Fable 5, 99% на ARC-AGI-3 без новой модели и IPO Anthropic  Публичный пост

17 июля 2026  74

Те же Claude Opus 4.8 и Fable 5, тот же бенчмарк — а результат прыгает с 43% до 99%. Веса моделей не трогали вообще. Поменяли только обвязку вокруг них: как модель записывает свои догадки и как их проверяет. Разбираем, что там внутри и что забрать себе — а заодно агента, который за восемь дней переписал сам себя и обошёл двухлетнюю работу инженеров.

Главное за 30 секунд

  • Обвязка вокруг модели дала +56 пунктов на бенчмарке ARC-AGI-3 при неизменных весах — но проверено это только на демо-наборе из 25 игр.
  • Kimi K3 на 2,8 триллиона параметров возглавила фронтенд-арену и обошла Fable 5; веса обещают открыть 27 июля.
  • Агент Weco за восемь дней перестроил свой рабочий процесс и обошёл версию, которую инженеры настраивали два года.
  • Anthropic готовит выход на биржу при оценке $965 млрд и запускает внедренческую фирму Ode на $1,5 млрд.
  • Семь из десяти компаний признают: не больше четверти их «агентов» умеют что-то сложнее чат-бота.

Внедряем и улучшаем

Пусть ИИ возьмёт у вас интервью — и напишет вашим голосом. Обычная беда с постами: просишь нейросеть написать текст, получаешь гладкую пустоту. The Rundown показал обратный ход. Вы не диктуете тему — агент сам вас допрашивает, вытаскивает истории и учится вашей манере (гайд The Rundown).

Схема из четырёх шагов. Первый: создаёте проект в Manus и просите взять у вас интервью, приложив ссылки на пару своих публичных текстов. Второй: агент задаёт по одному вопросу за раз, вы наговариваете ответ голосом — без структуры и причёсывания. Третий: он вытаскивает ваши сильные мысли и обороты, складывает истории в карточки идей и собирает профиль голоса. Четвёртый: превращает лучшие карточки в черновики, а вы помечаете, что звучит похоже, а что слишком прилизано.

Ключ здесь — первый промпт. Вот он дословно, из окна Manus:

Let's interview by open dictation, one round at a time. Don't organize the answer
or try to make it post-ready.

Round 1: Think about the AI tools or models you tested in the last 7–14 days.
Tell me about one moment that changed your mind — something that worked much
better or worse than expected, exposed a misleading popular belief, or changed
how you now do a real task.

As you ramble, include whatever you remember: what you were trying to accomplish,
which tools were involved, what happened on the first attempt, what happened
after iteration, what surprised or annoyed you, and who should care. If several
examples come to mind, give me all of them.

Обратите внимание на «don't organize the answer» и «as you ramble». Это не вежливость. Сырое бормотание содержит ваши настоящие обороты, а причёсанный ответ — уже чужие. Совет от авторов: сохраните процесс как скилл и раз в неделю прогоняйте короткое интервью, чтобы библиотека идей не протухала. Оговорка: полная версия гайда с видео лежит за подпиской Rundown University за $83 в месяц, но промпт выше — рабочее ядро, и он публичный.

Скриншот Manus: промпт открытого интервью и собранный профиль голоса эксперта
Скриншот Manus: промпт открытого интервью и собранный профиль голоса эксперта

Расписание или агент? Задайте один вопрос — и не городите лишнего. Частая ошибка: любую повторяющуюся задачу тащить в агента. The Neuron предлагает развилку проще (разбор The Neuron). Задача ходит в почту, календарь, Slack, Drive или Notion — это обычная задача по расписанию. Задача опирается на переиспользуемый скилл или общий для команды порядок работы — только тогда агент.

Промпт-классификатор дословно:

Classify this recurring task:

Task:
[describe workflow]

Does it mainly need connected tools like Slack, email, calendar, Drive, Notion,
or Google Docs?
If yes, make it a ChatGPT scheduled task.

Does it rely on a reusable Skill, custom workflow, or team-shared behavior?
If yes, make it a Workspace Agent.

Give me the setup, schedule, required tools/skills, and one failure mode.

Формула авторов: «schedule chores; agent workflows» — рутину на расписание, рабочие процессы в агента. Просьба про «one failure mode» в конце — самая полезная часть: она заставляет модель сразу назвать, где схема сломается.

«Прожарь меня» и три предложения: как работать с ИИ на $10 тысяч в месяц. Йереми Теохарис, технический директор UMH Systems, выложил свой счёт за токены: Opus 4.8 — $5042, Fable 5 — $4179, Sonnet 4.6 — $452. Итого $9838 за июнь. Человек, который столько тратит, описал свои правила — и они интереснее счёта (блог Теохариса).

Приём первый — /grill-me против угодливости модели. Модель не скажет, что не поняла задачу, — она просто пойдёт делать. Поэтому Теохарис заставляет её допрашивать себя: «Interview me relentlessly about every aspect of this until we reach a shared understanding... For each question, provide your recommended answer. Ask the questions one at a time... The decisions, though, are mine». Свою статью он написал именно так: сначала накидал мыслей, потом дал себя прожарить по предложению.

Приём второй — на каждую задачу заявка по шаблону Basecamp: «в чём проблема», «что делаем», «что не делаем». Проблема — ровно три предложения. И вот главное наблюдение, ради которого стоит это читать: «I tend not to actually read most LLM output anymore; I skim it... But a problem statement of three sentences, that I will fact-check really hard». Его же аналогия: ревью на тысячу строк получает «LGTM», ревью на сотню — пятнадцать комментариев.

Отсюда правило: не пытайтесь читать всё, что выдал агент. Вы всё равно перестанете. Сожмите точку контроля до объёма, который физически обязаны прочесть.

И граница, которую он ставит себе жёстко: «if I use them while I cannot yet distinguish good from dogshit, I will end up with full-blown slop production». В незнакомой области ИИ — только чтобы учиться, не чтобы производить.

Счёт Теохариса за токены Claude за июнь 2026: итого $9838,85
Счёт Теохариса за токены Claude за июнь 2026: итого $9838,85

Вскрытие покажет: пусть свежая сессия объяснит, почему ваш план провалился. Лаура Саммерс из Pydantic описала знакомое: бывали дни, когда она тратила почти два полных дня на план для модели — уточняла, переуточняла — и всё равно получала необъяснимую глупость (статья Pydantic).

Лекарство простое и бесплатное. Написали план — откройте свежую сессию и попросите: план провалился катастрофически, продиагностируй почему. Свежесть здесь принципиальна. Ваша основная сессия уже отравлена контекстом плана и дыр в нём не видит. Как и вы сами.

Второй приём из той же статьи: один инженер Pydantic собрал инструмент, который вытаскивает правила из тысяч его прошлых комментариев к ревью и засевает ими AGENTS.md. Смысл — перенести ревью из «после генерации» в «до». Это единственный способ уменьшить объём надзора, а не просто перетерпеть его.

Заодно оттуда же диагноз, который стоит запомнить: «The number of things you can start has dramatically increased. The number of things you can thoughtfully finish hasn't changed at all». Открыть пять сессий Claude — это масштабирование стартов, а не финишей. Мозг у вас по-прежнему один.

Обвязка бьёт модель: +56 пунктов на тех же весах. Главный сюжет дня. Команда из Impossible Research, Беркли и CMU выбила 98,98% на ARC-AGI-3 — бенчмарке, где ИИ до сих пор был беспомощен (Schema Harness).

Сначала про сам бенчмарк. Вас бросают в незнакомую игру: без правил, без подсказок, без сообщения «вы победили». Надо самому понять, что на экране и что здесь считается выигрышем. Люди справляются на 100%. В марте лучший ИИ выбивал 0,51%, в июле GPT-5.6 Sol — 7,78%.

Новой модели не делали. Дословно: «It does not change the underlying model weights. Instead, it changes the process around them». Внутри — четыре принуждения. Модель обязана записать свою теорию игры исполняемым кодом step(state, action). Обязана прогнать этот код по всей записанной истории и сойтись до пикселя. Только потом искать решение перебором внутри своей проверенной программы — там это бесплатно. И мгновенно выбрасывать остаток плана при первой же ошибке предсказания.

Что доказано твёрдо: те же Opus 4.8 и Fable 5 под обычным Claude Code дают 42,83%, под этой обвязкой — 98,98%. Одни веса, разные результаты, +56,15 пункта.

Забрать себе стоит механизм, а не цифру. Заставляйте агента фиксировать догадки проверяемым кодом. Проверяйте их против полного лога до того, как он начнёт действовать. Убивайте план при первом расхождении с реальностью.

Теперь честно, потому что цифра красивая и потому липкая. 98,98% — это демо-набор из 25 игр, который сам ARC Prize называет витриной, а не мерилом. На приватном наборе не мерили вообще. Результат не подтверждён ARC Prize, работа не рецензирована, код обвязки закрыт. Это лучший результат из двух моделей: игры ниже 80 перезапускали другой моделью и брали лучший прогон. Цену прогона не раскрыли. Обвязку разрабатывали, глядя на эти же 25 игр. К чести авторов — все эти оговорки написали они сами. Так что правильная формулировка — «99% на демо-наборе по собственной арифметике», а не «ARC-AGI-3 взят».

Все 25 игр ARC-AGI-3: красная кривая обвязки против серой человеческой, RHAE 98,98%
Все 25 игр ARC-AGI-3: красная кривая обвязки против серой человеческой, RHAE 98,98%

Три узких агента вместо одного универсального: −80% времени на тикет. Компания Electra, 300 человек в десяти странах, тонула в сложных обращениях: агенты поддержки вручную собирали контекст из Slack, документов Notion и данных по зарядным станциям. Развернули трёх отдельных агентов — под счета, под возвраты и под сложные технические запросы (кейс Dust).

Результат: время разбора сложных обращений упало на 80%, тяжёлые случаи закрываются за три минуты вместо долгих раскопок. За первый месяц агентами пользовались 70–80% сотрудников компании еженедельно.

Урок дословно: «Specialized agents outperform generic ones». Все три агента ходят в одни и те же источники, но по-разному. Агент по возвратам следует правилам, агент по счетам копает конкретный кусок бэкенда, общие вопросы получают широкие промпты. «Same data, different expertise».

Готовый рецепт из письма: выпишите три самые времязатратные категории обращений за неделю, отследите, в какие источники вы лезете по каждой, и напишите один узкий промпт на категорию вместо одного универсального помощника.

Шесть независимых экспертов и общая таблица фактов. Свежий репозиторий на Claude Code разбирает акции шестью суб-агентами: бизнес, финансы, рынок, техника, риск, оценка (warren-buffett-jr). Читать его стоит не ради акций — там нет ни лицензии, ни проверки точности, а движок недостроен, и автор это признаёт. Ради архитектуры.

Она устроена так, что переносится на код-ревью, найм, выбор подрядчика — на любое «оценить объект по нескольким осям».

Первое: общая таблица фактов до веерного запуска. Все эксперты получают одни и те же исходные цифры. Иначе вы получите не расхождение мнений, а расхождение данных — спор, который нельзя разрешить.

Второе: агенты не видят оценок друг друга. Это лекарство от якорения, когда первый эксперт задаёт тон остальным.

Третье: агент — тонкий загрузчик на две страницы, а методология лежит отдельными файлами и версионируется. Правки методики не трогают агентов и ревьюятся как данные.

Четвёртое, самое ценное: пропуск данных — это не средний балл. Правило в репозитории записано прямо:

## Missing metrics
- Do not assign 5/10 to missing evidence.
- A category is `INCOMPLETE` when valid dimension weight is below 70%.
- An incomplete category may be displayed but cannot pass a profile gate.

Пятое: оценка и уверенность — две разные оси. Высокий балл на протухших данных даёт высокий балл и низкую уверенность. Смешаете — потеряете ровно ту информацию, ради которой всё затевалось.

Шестое: вердикт назначает не сумма, а предохранители. «Risk 0-4/15 caps the profile at Speculative» — девяносто пять баллов по пяти осям и три по риску не дадут красивый итог. Среднее прячет фатальный дефект, жёсткое правило — нет.

Спросите три раза: несогласие модели с собой — сигнал ошибки. Тихая, но полезная работа. Агент, который отвечает на один и тот же вопрос по-разному, скорее всего ошибается. Проверка на повторяемость подняла точность до 87–88%, если доверять только ответам, совпавшим в трёх прогонах (arXiv).

Приём бесплатный и работает сегодня. Важное решение — прогоните вопрос трижды в чистых сессиях. Ответы разошлись — это не «модель тупит», это индикатор: здесь она не знает, и проверять надо вам.

Эффект отскока: ИИ подарил вам 11 часов в неделю. Где они? Свежий замер Glean: 87% работников пользуются ИИ и чувствуют рост производительности, средняя экономия — 11 часов в неделю. Это больше четверти рабочей недели. При этом лишь 13% считают, что автоматизация заметно улучшила показатели компании (блог RescueTime).

Куда деваются часы? Они не исчезают — их незаметно вкладывают обратно в работу. Отчёт, который занимал день, теперь обрастает правками. Письмо, написанное за минуты, освобождает место для новых писем. Формулировка автора: «yesterday's productivity gain becomes today's baseline expectation».

Четыре шага против этого. Первый: найдите, где именно ИИ экономит вам время. Экономия приходит не куском, а по пять минут, и потому сливается с процессом. Второй, главный: решите, куда пойдёт освободившийся час, до того как он появится. Иначе он по привычке утечёт в почту и Slack. Третий: не поднимайте планку себе сами. Сделали презентацию вдвое быстрее — соблазн начать вторую, и вы тихо удвоили себе нагрузку. Четвёртый: разрешите времени остаться неиспользованным.

Мысль, которую стоит выписать: «saving time and getting time back aren't the same thing».

Своя генеративная модель на семилетней видеокарте за 6 ГБ. Человек обучил модель, генерирующую сэмплы бочки для музыки. Железо — GTX 1660 SUPER с 6 ГБ памяти, семь лет от роду, пылившаяся в углу. «I never had to rent a cloud A100» (разбор автора, код и веса открыты).

Главный урок не про трюки обучения, а про постановку задачи. Две секунды звука — это 88 200 отсчётов. Гонять по ним генерацию тысячу раз нереально. Автор сжал звук в 352 числа и обучал уже там. «Compressing 88,200 audio samples down to 352 floats is what makes it fit». Сжатие в 250 раз — и задача влезла. Модный приём экономии памяти, gradient checkpointing, не понадобился вовсе: задачу переформулировали, а не оптимизировали.

Остальные приёмы переносятся на что угодно своё. Батчи под каждую модель: 32, 16, 4–8. Накопление градиента 2 — память как у батча 16, градиент как у 32. Половинная точность там, где стабильно, и полная там, где нет: у состязательной части автор специально оставил fp32, потому что fp16 её ломает. Обучение по одной модели за раз, промежуточные результаты — на диск: посчитал сжатые представления файлами, и первая модель больше не висит в памяти. Длинные входы — случайными кусками по 8192 отсчёта вместо целых двух секунд.

Датасет он нашёл у себя: grep по своей папке сэмплов дал 13 615 примеров, а метки вытащил из имён файлов.

Честно про результат: бочки звучат прилично, но текстовое управление провалилось. Слово «techno» встречалось всего в 39 именах файлов из 13 615 — и на него модель выдаёт мусор. Автор не стал чинить, а просто убрал текстовое поле из интерфейса. Отсюда два урока. Считайте частоты меток до обучения: ломается обычно не архитектура, а данные. И практичное решение лучше красивого.

Схема пайплайна: звук → мел-спектрограмма → сжатое представление, где идёт генерация → обратно в звук
Схема пайплайна: звук → мел-спектрограмма → сжатое представление, где идёт генерация → обратно в звук

Детектор ИИ-текста на «классике» — и что делать, если пометили вас. Разработчик собрал детектор ИИ-текстов вообще без нейросетей: TF-IDF по символьным n-граммам плюс линейный SVM. Метод из учебника десятилетней давности (разбор автора, демо, код под Apache-2.0).

Цифры: точность 85–89% на одном предложении, на длинных текстах уверенно. Ложные срабатывания на 10 000 живых текстов — 0,04% при пороге 60%. Нейросетевые подходы проиграли: перплексия дала «plenty of false positives», BERT — «minor boost but required too much GPU time», AutoGluon выбил 53%, то есть уровень монетки. Обход не работает: перевод туда-обратно и просьба «перепиши без ИИ-привкуса» роняют детект всего до 79–86%.

Вывод автора звучит неприятно и правдоподобно: «I suspect this is how many so-called "AI plagiarism checkers" actually work under the hood».

Но вот что важнее для вас лично. Вся эта надёжность существует только внутри домена обучения — китайской веб-прозы. Автор пишет прямо: на других текстах будет систематическое смещение. И два белых пятна, которые он не проверял: отредактированный человеком ИИ-текст и ложные срабатывания на людях из других областей. А ещё детектор ловил не-рассказы — списки и оглавления — просто за необычную форму.

Так что если ваш текст пометили как машинный, спрашивайте у сервиса три вещи: порог, домен обучения и измеренный процент ложных срабатываний на текстах вашего типа. Их не назовут. И держите в голове главное: детектор ловит стиль, а не авторство.

Обратный урок для своих задач: прежде чем тащить нейросеть в классификацию текста, попробуйте TfidfVectorizer(analyzer="char", ngram_range=(2,5)) и LinearSVC. Здесь эта связка обошла BERT по соотношению цена-качество и работает в браузере без сервера.

Считайте кэш: $73 против $39 — и это не про цену модели. Автор устроил дуэль: Claude Fable 5 против GPT-5.6 Sol, каждый автономно снимает клип на песню с бюджетом $100 (разбор TryAI, обвязка открыта). Субъективно победил Fable — единственный выдал 1080p и ни одной упавшей генерации. Но интереснее два побочных вывода.

Первый — про деньги. Fable вышел дороже: $73,65 против $39,82. Только разница не в тарифе. У Sol было 1,8–2,5 млн кэшированных входных токенов, у Fable — ноль. В агентном цикле, где промпт и история переотправляются на каждом из 25–38 шагов, кэш промпта даёт кратную разницу в счёте. Похоже, в обвязке его просто не включили. Прежде чем делать вывод «модель X дороже», проверьте кэш.

Второй — про то, что просьба в промпте не равна поведению. Промпт прямым текстом требовал тратить бюджет: «Treat this as a resource to USE... unspent budget is wasted potential». Обе модели при $100 недотратили — 36% и 49% бюджета. Промпт прямо подсказывал сначала сделать кадры, потом их оживить — этот путь выбрал один прогон из четырёх, и только там, где бюджет реально жал. Вывод: если вам нужна дорогая ветка поведения, ставьте её проверяемой целью или отдельным шагом, а не просьбой.

То же и с самопроверкой. Пункт «извлеки кадры, посмотри на них» в промпте был, кадры дёргали все — а выводов не делал никто. Наблюдение автора: «Nobody really iterated on the edit... none seriously probed their own clips to confirm they were any good».

Оговорка: это четыре прогона по одному на конфигурацию, судейство субъективное, победителя формально не объявляли.

Инструменты и штуки

Новости и тренды

Откомментируйте первым 👇

😎

Автор поста открыл его для большого интернета, но комментирование и движухи доступны только участникам Клуба

Что вообще здесь происходит?


Войти  или  Вступить в Клуб