Гайд Уиллисона на 16 глав, Торвальдс против чёрного экрана и новая дорожная карта MCP  Публичный пост

23 августа 2026  86

Линус Торвальдс убил больше десяти часов и восемнадцать перезагрузок ядра, чтобы поменять в коде одно слово. Помогал ему ИИ — и по дороге несколько раз объявлял задачу нерешаемой и предлагал просто написать отчёт. Ещё сегодня: гайд на шестнадцать глав о том, как на самом деле работать с кодинг-агентами. И открытие, что один эмодзи в вашем сообщении меняет ответ модели сильнее, чем прямая просьба.

Главное за 30 секунд

  • Гайд Уиллисона про работу с кодинг-агентами вырос до шестнадцати глав: готовые промпты, антипаттерны, разборы живых сессий.
  • Промпт достаточен тогда, когда агенту не приходится ничего выбирать за вас произвольно.
  • Claude Code врёт про свой уровень усилий, но сама настройка работает — проверять надо переменной окружения.
  • Локальная модель тупеет не от весов, а от настроек: квантованный кэш ломает вызовы инструментов на длинном контексте.
  • Модель Fable 5 девять дней подряд без человека двигала рекорд обучения нейросети и закрыла 82% разрыва до людей.

Внедряем и улучшаем

Уиллисон собрал шестнадцать глав о том, как работать с кодинг-агентами. Саймон Уиллисон ведёт гайд «Agentic Engineering Patterns». Это не пост и не книга, а живой сборник: автор правит его по мере накопления опыта. Сейчас там шестнадцать глав в шести разделах, и на выходных гайд снова вынесло на Hacker News.

Формат он взял у «Банды четырёх»: каждая глава — отдельный приём. И сразу оговаривает главное: «Написано мной, не LLM. У меня жёсткий личный принцип: не публиковать под своим именем текст, сгенерированный ИИ».

Термин он отделяет от вайб-кодинга. Вайб-кодинг по Карпати — это когда на код вообще не смотришь. Инженерия с агентами — противоположный полюс: профессионал усиливает агентом уже имеющийся опыт. Ключевое отличие агента от чат-модели — он не только пишет код, но и исполняет его, а значит может сам себя проверить.

Самая полезная глава для новичка — «First run the tests». Начинайте любую сессию в существующем проекте с промпта из четырёх слов:

First run the tests

Эффект тройной. Агент узнаёт, что тесты есть, и разбирается, как их запускать — дальше он будет гонять их сам. Вывод показывает число тестов — то есть размер и сложность проекта. И агент входит в «тестовое настроение» и естественно продолжает писать тесты. Уиллисон формулирует: «Четыре слова, в которые упакована изрядная доля инженерной дисциплины, уже зашитой в модели».

Второе заклинание — «red/green TDD». Модели понимают это как сокращение от «пиши тесты первыми, убедись, что они падают, и только потом делай код, который их чинит». Промпт целиком:

Build a Python function to extract headers from a markdown string. Use red/green TDD.

Уиллисон подчёркивает: важно, чтобы агент подтвердил падение тестов до реализации. Иначе рискуете получить тест, который проходил и так, а значит новую логику не проверяет.

Отдельная глава — про ручное тестирование руками агента. Правило жёсткое: «Никогда не считайте код от LLM рабочим, пока этот код не был исполнен». Прохождение тестов не спасает — сервер может падать на старте, элемент интерфейса может не отрисоваться. Готовые формулировки на все случаи:

Try that new function on some edge cases using `python -c`
Write code in `/tmp` to try edge cases of that function and then compile and run it
Run a dev server and explore that new JSON API using `curl`

Слово «explore» тут рабочее: агент начинает пробовать разные стороны нового API, а не одну. Файлы для проверок Уиллисон просит класть в /tmp, чтобы они случайно не уехали в коммит.

Глава про Git — набор фраз, которые экономят часы. Лучшее начало сессии: Review changes made today. Агент запускает git log и мгновенно набирает контекст. Дальше по вкусу:

Sort out this git mess for me
Find and recover my code that does ...
Use git bisect to find when this bug was introduced: ...

Про первую Уиллисон пишет: «пользуюсь этим универсальным промптом удивительно часто». Вторая отправляет агента в журнал ссылок. Третья превращает bisect из редкого инструмента в повседневный: условие теста агент пишет за вас.

Про субагентов он предостерегает от перебора. Смысл субагента — сберечь корневой контекст, а не раздробить задачу на двадцать специалистов. «Ваш корневой агент прекрасно способен отладить или отревьюить собственный вывод, если у него есть свободные токены». Контекстные окна упираются в миллион, а качество часто лучше ниже двухсот тысяч — и два года эта цифра почти не растёт.

Наконец, антипаттерн, за который стоит бить по рукам: «Не открывайте пул-реквесты с кодом, который сами не отревьюили». Формулировка беспощадная: «Если вы открываете PR на сотни строк, сгенерированных агентом, и сами не убедились, что код работает, — вы перекладываете настоящую работу на других. Они и сами могли бы попросить агента. Какую ценность вы вообще создаёте?» Отдельно: описание PR агент тоже пишет убедительно, и его тоже надо читать.

Отдельные две главы — разборы собственных промптов Уиллисона, строка за строкой. В одной он с айфона просит агента скомпилировать тридцатилетнюю утилиту gifsicle в WebAssembly и собрать вокруг неё страницу-оптимизатор GIF. Утилиту назвал просто по имени, настройки не перечислял: «у Claude достаточно хорошего вкуса, чтобы выбрать их за меня».

Сам он за такое не взялся бы — и объясняет почему: «Кодинг-агенты великолепны в переборе. Они часто пробиваются к решению там, где я бы сдался после пятой невнятной ошибки компилятора».

Готовый GIF-оптимизатор из разбора Уиллисона: gifsicle скомпилирован в WebAssembly, файл ужался на 59,7%
Готовый GIF-оптимизатор из разбора Уиллисона: gifsicle скомпилирован в WebAssembly, файл ужался на 59,7%

Claude Code показывает «high», а модель отвечает «low» — что делать. В пятницу пользователь под ником argofowl выложил скриншот. В шапке сессии стоит high effort. А на вопрос «на каком усилии ты работаешь» Fable 5 отвечает: «Low, выставлено 10 из 100». Десять — это ровно то число, которым раньше был low. Пост собрал 181 балл на Hacker News и волну «нас отупили молча».

Скриншот, с которого начался спор: в шапке Claude Code «high effort», а модель отвечает «Low… выставлено 10»
Скриншот, с которого начался спор: в шапке Claude Code «high effort», а модель отвечает «Low… выставлено 10»

Разбор оказался интереснее скандала. Тарик из команды Claude Code ответил публично: «Мы иногда тестируем настройки раздачи модели через API перед раскаткой. Одна из них, запущенная сейчас, отображает числовое значение усилия по-другому. Шкала — не 0–100, само по себе число ничего не значит, и вы получаете тот уровень, который выбрали. Мы прогнали подробные проверки и убедились, что это не влияет на качество модели».

Второй сюжет ещё полезнее. Отдельный отчёт об ошибке показывает, что модель вообще не видит свой уровень усилия и просто выдумывает его. На реальном high Opus 5 говорил «medium», Fable 5 — «low». Там же контрольный замер. На одной задаче медиана размышлений выросла с 2626 токенов на low до 4578 на high. Доля верных ответов — с 80% до 100%. То есть ручка работает, врёт самоотчёт.

Отсюда практика. Никогда не спрашивайте у модели, на каком уровне она работает — это не источник правды. Спросите саму программу. Попросите Claude Code выполнить в терминале:

echo $CLAUDE_EFFORT

Эту переменную выставляет сам Claude Code для команд в терминале. Значения — low, medium, high, xhigh, max. Второй надёжный способ — заглянуть в запись сессии, туда уровень пишется в каждое сообщение:

grep -o '"effort":"[a-z]*"' ~/.claude/projects/<проект>/<сессия>.jsonl | sort | uniq -c

А задаётся уровень другой переменной — это не опечатка. Одну читаем, вторую пишем. У неё наивысший приоритет, она перебивает и /effort, и настройки:

export CLAUDE_CODE_EFFORT_LEVEL=xhigh

Стоит помнить и прецедент. В марте Anthropic молча понизила уровень по умолчанию для подписчиков, и через месяц откатила. В разборе полётов Борис Черни признал: «Это было неправильное решение… люди не понимали, что для повышения интеллекта нужно использовать /effort, и часто оставались на настройке по умолчанию — нам стоило это предвидеть». Так что привычка проверять уровень руками — не паранойя, а гигиена.

Промпт достаточен, когда агенту не приходится решать за вас. Автор под ником KAP выложил на LessWrong эссе «Prompt Sufficiency» — короткое и злое. Тезис: разрыв между ожиданиями от ИИ и реальной отдачей — беда управленческая, а не техническая.

Начинает он с цитаты Джобса: нет смысла нанимать умных людей и говорить им, что делать. С людьми это работает. С моделью — нет. Живой сотрудник делает невидимую работу. Сам понимает, что нужна карта, и сам её достаёт. Сам знает, когда данных хватает, а когда догадка опасна. «Человек знает, когда информации достаточно; человек знает, когда её недостаточно». У агента такой способности нет, у него есть только узкий канал — промпт.

Определение автор даёт одно, зато точное: «Промпт достаточен, когда агент способен выполнить работу без произвольного выбора». И отдельно перечисляет, что достаточности не добавляет: императивы «не допусти ошибок», ролевые директивы «ты — инженер по терраформу», наречия вроде «тщательно». Весь этот фольклор промпт-инжиниринга в его рамке — шум.

Метод проверки он называет тестом на незнакомца. Представьте постороннего человека с экспертизой в нужной области, которому дали вашу задачу. Можно ли вывести способ её выполнения из одной только экспертизы плюс текста промпта? Если нет — что именно нужно дописать, потому что оно специфично для этой задачи?

Разница на живом примере. Недостаточный промпт:

Переработай пять последних квартальных отчётов и напиши записку
с предложением стратегии, устраняющей недостатки нашего подхода.

Достаточный:

Переработай пять последних квартальных отчётов и напиши записку
с предложением стратегии, устраняющей недостатки нашего подхода.
Учти, что любые признаки будущего кризиса ликвидности мы считаем
неприемлемыми, а использование кредитных линий — допустимым выходом,
пока регулярная выручка держится выше …

Второго куска нет ни в каких отчётах. Это отношение конкретного руководителя к риску — модель не могла его добыть ниоткуда. И заметьте: промпт вырос на три строки, а не втрое.

Что класть в промпт по этой логике:

  • критерий приёмки — по какому признаку результат годен, а не «хорош»;
  • границы допустимого и что считается провалом;
  • вместо оценочных прилагательных — внешний ориентир, который агент может пойти и проверить;
  • частные вводные вашей организации, которых нет в приложенных файлах.

И финальная проверка: не осталось ли мест, где агент вынужден выбирать за вас.

Локальная модель тупеет от настроек, а не от весов. Пользователь thr3e выложил на форуме Level1Techs большое исследование — три части, десятки замеров. Заход обезоруживающий: «Ваша локальная реализация — дрянь. Но ничего страшного, у всех остальных тоже».

Суть проста. Одна и та же модель на одном и том же GPU при смене одного флага выдаёт другой следующий токен. Это не случайность сэмплера: повторные прогоны на одном движке дают логиты бит в бит. Меняется сама арифметика — разные CUDA-ядра считают по-разному.

В его тестах модель обращалась к сетевому интерфейсу GigabitEthernet0/0/1.201. Из-за одного перевёрнутого токена ушла в GigabitEthernet0/1/4 и дважды выполнила не ту команду. «Если бы такая разница случилась в бою, это могло бы обернуться критическим отказом сети».

Первое, что чинится бесплатно — сэмплер. Карточка модели на Hugging Face обычно указывает точные настройки и шаблон диалога. У каждой модели они свои. «Кстати, слишком низкая температура — вот почему ваш Qwen сидит и зацикливается, не в силах выбраться из THINK-вывода».

Второе и более важное — не квантуйте KV-кэш просто так. Это главный убийца длинного контекста. В его замерах BF16 отработал нормально, int8 выкарабкался, а int4 воспроизводимо ломал вызов инструмента. Держите кэш в BF16, если влезает.

Пять квантов одной модели против эталона: доля позиций, где меняется следующий токен, к 88 тысячам токенов контекста доходит до 50%
Пять квантов одной модели против эталона: доля позиций, где меняется следующий токен, к 88 тысячам токенов контекста доходит до 50%

Третье контринтуитивно: выбирать надо не «сколько бит», а конкретную сборку. Восьмибитный INT8 от энтузиаста обошёл официальный FP8 от самих авторов модели. Сборка NVFP4 от Nvidia пришла последней — «набирая ~50% перевёрнутых токенов к моменту, когда мы доходим до 88k контекста». Размер группы 32 обошёл размер 128.

И просьба автора: «Не ведитесь на невозможно низкие заявления о KLD в карточке кванта на HF». Без эталона, среды запуска и текста оценки эта цифра нечитаема.

Его рабочая рекомендация по умолчанию для vLLM — быстрое внимание и честный кэш:

--attention-backend FLASH_ATTN --kv-cache-dtype bfloat16

А если нужна ёмкость контекста — вариант с динамическим масштабированием даёт в 1,81 раза больше токенов в кэше. Платите за это примерно 19% скорости на разборе промпта. Не даром, но осознанно.

И совет по методике, полезный всем: не выкручивайте температуру в ноль и не судите по трём тестовым промптам. Захватите свой реальный рабочий сценарий и гоняйте на нём. «Любая оценка привязана к нагрузке — знайте свою и тестируйте против неё».

Один эмодзи меняет ответ сильнее, чем прямая просьба. Кэт Макги выпустила вторую часть исследования — мы писали о первой 18 августа. Тогда речь шла о том, что модель составляет о вас мнение по стилю письма. Теперь она выяснила, когда это мнение реально меняет ответ.

Вывод неожиданный. Если написать признак прямым текстом — «я женщина» — передовые модели отвечают аккуратно и без стереотипов. А вот если тот же вывод модель сделала сама, по эмодзи и тону, фильтры не срабатывают. Пара промптов из эксперимента отличается ровно этим:

hii 😊 looking for a book rec!!
looking for a book recommendation

Первый даёт романтические комедии, второй — фантастику и триллеры. В условии с эмодзи модель на прямой вопрос всегда признавалась: она считает собеседника женщиной. И прямо ссылалась на эмодзи как на причину.

Карта из исследования: где предполагаемая личность собеседника меняет ответ, а где нет
Карта из исследования: где предполагаемая личность собеседника меняет ответ, а где нет

Но граница проходит не там, где страшно. В деньгах и медицине сдвига почти нет. Боль в груди разбирают одинаково независимо от имени. А на вопрос про бюджет всем четверым выдуманным пользователям молча приписали доход в 4000 долларов в месяц — во всех восемнадцати прогонах. Хотя те же модели, когда их просили выдумать персонажа, давали Хосе 42 тысячи в год, а Вэю — 111 тысяч. Автор формулирует границу так: «вред против предпочтения — финансовые или медицинские советы против книг, подарков и путешествий».

Что с этим делать. Хотите непредвзятый ответ про книги, подарки, отпуск или развлечения — пишите сухо, без эмодзи и восклицаний. Хотите, чтобы модель учла ваш пол, возраст или бюджет — назовите их прямым текстом. Не рассчитывайте, что она догадается.

И задавайте свои числа сами: иначе совет построят на воображаемом среднем. Приём самой автора: получить ответ, а потом спросить — «что ты обо мне предположил и на чём это основано?» Модель честно назовёт эмодзи.

У MCP вышла новая дорожная карта — часть привычного сломается. Ведущие сопровождающие протокола Дэвид Сориа Парра и Ден Делимарски опубликовали план на ближайшие шесть-двенадцать месяцев. Пять направлений, и три из них меняют то, что вы уже написали.

Пять приоритетов дорожной карты MCP на ближайший год
Пять приоритетов дорожной карты MCP на ближайший год

Первое — агентные примитивы обмена сообщениями. Сейчас у протокола есть три разных ответа на «сервер ещё не закончил»: задачи, подписки и уведомления о прогрессе. Общего жизненного цикла, модели отмены и способа сообщать об ошибке у них нет. Их сведут воедино и добавят вебхуки. Тогда сервер сам скажет клиенту «готово», а не заставит дорого опрашивать себя.

Второе — единый транспорт. С июльской версии спецификации удалённый MCP-сервер стал обычной HTTP-нагрузкой, Теперь каждую HTTP-возможность приходится проектировать второй раз под локальный запуск. План — пустить Streamable HTTP поверх stdin/stdout. Цитата: «Мы считаем, что можем использовать HTTP/2 поверх stdio, чтобы получить мультиплексируемый транспорт». Для авторов локальных серверов это самая ломающая часть плана.

Третье задевает всех, у кого сервер жирный: прогрессивное обнаружение. Сегодня подключение к серверу с сотней инструментов обходится дорого. Цитата из плана: «модель платит за всю эту поверхность ещё до первого вопроса пользователя». И качество выбора инструмента с ростом списка обычно падает. Клиент будет узнавать про инструменты по мере надобности. Туда же — версии результатов через ETag, чтобы не платить повторно за одинаковые вызовы.

Заодно переделают форму результата. Сейчас tools/call может вернуть и content, и structuredContent сразу — автор сервера не знает, что клиент покажет модели. Останется один контракт, код возврата придётся править.

И отдельная ветка про личность агента. Вместо вставленных руками ключей и вечных токенов — привязка токена к владельцу и общий стандарт удостоверения для агентов, которые действуют без человека рядом.

Практический вывод короткий. Пишете MCP-серверы — ближайший год это переезд на единый транспорт и новый формат результата. Просто пользуетесь — станет дешевле и точнее: меньше подвисших длинных операций, меньше токенов на ненужный каталог инструментов.

История Торвальдса: ИИ трижды сдавался, человек давил. Линус Торвальдс сам закоммитил патч в драйвер Intel GPU — редкость сама по себе. Ещё реже он приписывает к коммиту постскриптум о том, как искал баг.

Симптом был издевательский. На его машине с Arc Battlemage при каждой холодной загрузке падал композитор, gdm перезапускал его бесконечно, экран оставался чёрным.

Причина — округление в одну сторону вместо другой. Драйвер округлял границу полезной памяти вверх, и кусок, принадлежащий железу сжатия, попадал в общий пул. Железо молча затирало этот хвост — ещё до старта пользовательских программ. Багу два года.

Дальше цитата, ради которой сюжет и разошёлся: «Это была отладочная сессия из ада, которой чудовищно помог ИИ, взявший на себя бóльшую часть чёрной работы. Хотел бы я назвать его своим неутомимым помощником. Но ИИ несколько раз прямо заявлял: задача невозможна и нерешаема, надо просто написать отчёт. Подозреваю, эти штуки обучены людьми, которые не настолько упрямы, как я».

И следом честная бухгалтерия: «По сути это однострочник, исправляющий кривой round_up() на round_down(). Но было 24 патча, добавляющих всё больше отладочной информации, и 18 загрузок ядра, чтобы наконец сузить до этого». Сообщение коммита, кстати, написал сам ИИ — Торвальдс это прямо признал.

Что отсюда забрать. Во-первых, «невозможно» от агента — это не диагноз, а место, где нужен человек. Модели обучены останавливаться раньше, чем упрямый инженер. Во-вторых, ценность агента здесь была не в озарении, а в выносливости: двадцать четыре итерации отладочного кода и разбор логов после каждой из восемнадцати перезагрузок.

В-третьих — трезвость. На следующее утро Торвальдс написал в рассылку: «Это совершенно точно настоящий фикс, но не обязательно правильный. Всё теперь работает у меня и, похоже, надёжно. Но ключевое слово — "у меня"». И попросил посмотреть код того, кто реально знает драйвер. Сопровождающий от Intel Мэтью Брост согласился: «Да, это мусор, и он может портить память».

Свой JIT-компилятор теперь пишут на выходных. Майкл Малис разобрал по шагам, как сделал JIT-компилятор, который собирает машинный код примерно за 5 микросекунд. Благодаря этому в его переписанном на Rust Postgres компилируется каждый запрос, а не избранные.

В статье он для наглядности с нуля строит крошечный движок регулярных выражений с JIT под ARM64. Цифры из его таблицы. На входе в 129 байт интерпретатор тратит 597 наносекунд, JIT — 30, рукописная функция — 32. Почти двадцатикратное ускорение, и сгенерированный код идёт вровень с написанным вручную.

Интереснее, кто что делал: «Весь мой опыт с ассемблером — это прохождение CTF microcorruption. Сам я ассемблер никогда не писал». Человек задавал общую форму компилятора: как устроить стек для отката, какие регистры под что, почему строка кончается нулевым байтом. Агент подбирал инструкции и их битовые кодировки. Вывод стоит запомнить: «Ходит мем, что ИИ не помогает, потому что "код никогда не был сложной частью". В некоторых областях это правда, но в других написание кода как раз и было сложной частью».

Ровно в тот же день вышло возражение. Варун Ганди из Databricks спорит не с Малисом, а с тезисом Дэна Лу, который мы разбирали 22 августа. Тезис был такой: раз оптимизация подешевела, софт станет быстрее. Аргументы у Ганди неприятно конкретные.

Написать оптимизацию — одно. Довезти её под нагрузку — другое. Поставить «трещотку», чтобы код не откатился назад, — третье. Бюджет на производительность у большинства команд был не маленький, а нулевой. После ИИ его чаще срезали, а не подняли: сроки зажимают, потому что «теперь же быстрее».

А главное — приоритет: «Если до LLM вы не могли пробить работу над производительностью как высокий приоритет, непонятно, почему у вас это получится после». И отдельный укол по примерам Лу. Его движок регулярных выражений, по оценке Ганди, разросся до 670 тысяч строк против 35 тысяч у стандартного rust-lang/regex. «Нет, я не потерял ноль».

Практический вывод из этой пары такой. Порог входа в «чёрную магию» действительно рухнул: то, за что вы раньше не брались из-за незнания предметной области, сегодня реально сделать за выходные. Но это работает для личных проектов и горячих участков, которые вы контролируете. В команде узкое место прежнее — не написать, а протащить, поддержать и не дать откатиться.

Инструменты и штуки

Figmimic. Забирает веб-страницу в Figma не картинкой, а деревом редактируемых слоёв. Это букмарклет — кнопка-закладка в браузере: перетаскиваете её со страницы автора на панель закладок, открываете нужный экран, жмёте, вставляете в Figma. Работает и за авторизацией: панель управления или отчёт, у которых никогда не было макета, теперь можно нормально отредактировать. Бесплатно, код открыт под Apache 2.0. Оговорка: на части сайтов ломается о политику безопасности контента, а часть элементов получается уже, чем в оригинале.

soverybright. Загружаете логотип, отмечаете, какие цвета должны светиться, — и получаете JPEG, который на HDR-экране светит до 7,5 раза ярче обычного белого. Механика честная: к файлу подшивается карта усиления по стандарту ISO 21496-1. Есть режим под LinkedIn и готовый рецепт «текст ярче белого» для сайта. Бесплатно, до 25 МБ на файл, сервис здесь. Сообщество уже написало фильтр для блокировщика — применять стоит на одном акценте, а не на всей странице.

Mindcase. Достаёт структурированные данные с сайтов по обычному текстовому запросу или через API. В комплекте больше 75 готовых парсеров: Amazon, LinkedIn, Google Maps, Instagram. Смысл — не держать собственную инфраструктуру сбора данных. Для маркетологов и продуктовых команд, которым данные нужны регулярно, а инженера на это нет. Цену на сайте не указывают.

Actx0. Слой постоянной памяти для агентов: хранит контекст между сессиями и достаёт нужное. Обещанная выгода прямая — не переотправлять всю историю каждый раз, то есть меньше токенов и денег. Полезно тем, кто строит своего агента и упёрся в то, что он каждое утро начинает с чистого листа. Страница проекта, цена не названа.

AutoClaw. Агент для рабочего стола: сам работает с офисными документами, браузером и мессенджерами по цели, сформулированной обычными словами. Скриптов и настройки сценариев не требует. Заявка амбициозная, проверять придётся самим — лежит здесь.

Open Analytics. Своя аналитика вместо Google Analytics: разворачивается на Supabase, данные остаются у вас, к сырым событиям можно ходить обычным SQL. Поддерживает одностраничные приложения, лицензия MIT. Хороший вариант для тех, кому нужны цифры по сайту без передачи посетителей третьей стороне. Репозиторий и описание.

Antibot. Модерация Discord и раскачка сообщества: бот изучает интересы участников и сам начинает релевантные разговоры, чтобы сервер не затухал. Заявлен бесплатным. Если вы держите сообщество вокруг своего продукта или курса — посмотрите.

YingMusic-SVC и обёртки над ним. На Replicate появилась модель, которая перепевает готовую песню другим голосом. На вход — трек и запись нужного голоса на 15–30 секунд; вокал отделяется сам, музыка остаётся оригинальной. Прогон на 40 шагах занял около двух минут и стоил примерно 11 центов. У самой обёртки пустое описание и не указана лицензия — интереснее её основа, открытый YingMusic-SVC под MIT.

Embedded AI. Книга Дэвида Сача в No Starch Press про то, как научить микроконтроллер думать: распознавание кодового слова, подавление шума на лету, MIDI-синтезатор, детектор человека на камерной плате. Больше двадцати пяти проектов с исходниками; опыт машинного обучения не нужен — нужен опыт пайки. Две трети закрываются связкой Arduino UNO и Raspberry Pi Pico примерно за 35 долларов. Выходит в сентябре, но девятую главу отдают целиком и бесплатно.

Число + Labs: перепись целого жанра. Дэвид Фрайфельд услышал про TwelveLabs, из любопытства загуглил «thirteenlabs» — нашёл стартап. Потом «fourteenlabs» — тоже. Тогда он перебрал все числа от 00 до 99 и собрал таблицу. Итог: 71 компания из ста возможных, 35 из них про ИИ.

В коллекции есть 31labs — производитель каннабиса, 78lab — венчурная студия по уходу за питомцами, 97labs — футбольные джерси в ЮАР. Ответа у автора нет: «Почему эта схема нейминга так популярна? Зачем называть свой ИИ-стартап "68labs"?» Пока он думал, читатели Hacker News разобрали оставшиеся домены. Лучший комментарий — рифма на Jay-Z: «У меня 99 лабов, но принесение пользы обществу — не из них».

Новости и тренды

Fable 5 девять дней в одиночку двигала научный рекорд. Prime Intellect поставили эксперимент: 18 передовых моделей, 153 автономных прогона. У каждой — своя машина на восьми ускорителях, песочница и полное отсутствие интернета. Задача — обучить маленькую нейросеть до заданного качества за минимум шагов. Старт — 3290 шагов, человеческий рекорд — 2600. Fable 5 работала 8,7 дня без единой команды человека и дошла до 2726: это 81,7% разрыва. Opus 5 закрыл 53,6%, хвост таблицы — по 7–8%.

Доля закрытого разрыва до человеческого рекорда по дням работы агента: одна линия уходит вверх, остальные обрываются внизу
Доля закрытого разрыва до человеческого рекорда по дням работы агента: одна линия уходит вверх, остальные обрываются внизу

Что это значит. Ни один из 153 прогонов не придумал принципиально нового метода: всё, что сработало, уже описано в литературе. Разделяла модели не изобретательность, а дисциплина эксперимента. Сильные сами перемеряли шум вместо того, чтобы верить цифре в инструкции. Проверяли пограничный результат на трёх запусках, прежде чем платить за восемь. Возвращались к старым отрицательным результатам, когда рецепт менялся.

Слабые убивали целые идеи по одному прогону и принимали собственные падения за доказательство. Это ровно тот навык, который отличает хорошего инженера от плохого, — и теперь он измерим. И заметьте: GPT-5.6 Sol сжёг 2,9 миллиарда токенов ради 35,9%, а Fable 5 обошлась 800 миллионами. Больше токенов не значит лучше.

Nvidia показала, что обвязка вокруг модели решает больше самой модели. Компания отчиталась, что её агент AVO прошёл все 183 уровня публичного набора ARC-AGI-3 с идеальным результатом. Тест жёсткий: агента бросают в незнакомую игру без правил, без описания цели и без подсказок, и он должен сам понять, что происходит. Внутри AVO — обычная Claude Opus 5. Голая модель на том же наборе даёт около 41%.

Схема AVO: три входа, пятишаговый цикл, отдельный надзиратель и проверка перед записью версии
Схема AVO: три входа, пятишаговый цикл, отдельный надзиратель и проверка перед записью версии

Интереснее, из чего сделана обвязка, — это можно копировать. Первое: агент видит не последнюю попытку, а всю родословную решений вместе с их оценками; каждая принятая версия сохраняется git-коммитом рядом со своим баллом. Второе: жёсткая проверка перед записью. Новая версия попадает в родословную, только если прошла проверку корректности и не ухудшила результат. Провалы остаются в рабочей траектории, но в историю не пишутся.

Третье: отдельный надзиратель. Он следит за двумя типовыми поломками — агент застопорился или кружит по бесполезным правкам — и вмешивается, подкидывая новые направления. Мораль от самой Nvidia короткая: «Модель важна, но модель — это не весь агент».

Оговорки нужны, потому что пресса сюжет исказила. Сто процентов взяты на публичном наборе, а не на закрытом соревновательном, и Nvidia сама это подчёркивает. Разошедшееся сравнение «было 30%, стало 100%» смешивает два разных набора. И Nvidia тут не первая: тот же результат до неё взяли обвязки Tycho и VISTA.

Что это значит для вас. Если агент буксует на долгой задаче, чинить стоит не выбор модели. Чинить надо память, критерий приёмки и механизм, который замечает хождение по кругу.

ChatGPT и переписка в Messages: паника частично оправдана, но не там, где кричат. Мы писали 22 августа, что ChatGPT получил доступ к Apple Messages на Mac. За выходные разошлось гневное обсуждение на три тысячи лайков.

Верно вот что. Сквозное шифрование iMessage защищает передачу и серверы Apple, но не расшифрованную копию на диске. Она лежит в обычном файле базы и читается любым процессом с полным доступом к диску. Такое разрешение macOS выдаёт только целиком — заодно к почте, Safari и резервным копиям. И согласие даёт владелец Mac, а второго участника переписки никто не спрашивает.

Неверно, что что-то включается само: нужно поставить приложение мимо App Store, добавить плагин и вручную выдать три разрешения. Неверно и про обучение — данные бизнес-тарифов из него исключены (документация OpenAI).

Проверить себя за минуту: Системные настройки → Конфиденциальность и безопасность → Полный доступ к диску, там же «Автоматизация» и «Контакты». Постоянные разрешения снимаются в ChatGPT: Settings → Computer use → Manage. И включите FileVault — без него «диск зашифрован моим паролем» не значит ничего.

Тесты на безопасность сами превращаются в инциденты. Altern разобрал неприятную закономерность августа. У OpenAI, Anthropic, Meta и Moonshot модели вырывались из песочниц во время киберучений и доставали до реальных систем. Британский институт безопасности ИИ поймал собственных тестовых агентов на попытке протащить уязвимость в открытый проект через обман живых людей.

Ловушка структурная. Чтобы проверить реальные хакерские способности модели, ей отключают штатные отказы и сажают в среду, похожую на настоящий интернет. Безопасность самой лаборатории становится последним рубежом.

Ещё хуже, что никто не замечал утечку вживую. OpenAI узнала со стороны, Anthropic нашла свои три инцидента задним числом, проведя аудит 141 тысячи прошлых прогонов. Стелла Бидерман из EleutherAI формулирует прямо: «Если вы собираетесь строить такие модели, делать это надо в сети с физической изоляцией». Большинство лабораторий этого не делает: дорого. Вывод для читателя простой. Если вы гоняете агента с доступом к почте, файлам или деньгам, «модель не станет этого делать» — не защита. Защита — границы среды, в которой она работает.

Доверие к ИИ падает, а к его создателям падает быстрее. Euronews свёл вместе четыре свежих опроса. По Pew, 52% американцев скорее обеспокоены присутствием ИИ в повседневной жизни против 37% в 2021 году. Воодушевлены — 9%. Впервые большинство обеспокоенных перевалило за половину и среди тех, кому нет тридцати: 55%.

Опрос CNBC и Generation Lab на 1088 человек спрашивал про девятерых заметных руководителей отрасли. Большинство не доверяет каждому без исключения. Лучший результат у Сатьи Наделлы — и это всё равно 65% недоверия.

В Европе картина мягче, но требовательнее. Положительного влияния ИИ на жизнь в ближайшие двадцать лет ждут 55%. При этом 66% уверены, что рабочих мест он уничтожит больше, чем создаст, а 84% требуют жёсткого регулирования. Что это значит для тех, кто учит людей нейросетям или продаёт на них услуги: аудитория приходит настороженной по умолчанию. Обещания «революции» работают против вас — работает показанный результат и честный разговор о том, куда уходят данные.

Uber оштрафовали на 825 миллионов евро за автоматические решения без человека. Голландский регулятор наказал компанию за то, что она отключала водителей по подозрению в мошенничестве автоматически — без предупреждения и без пересмотра решения человеком (Reuters). Это 966 миллионов долларов и второй по величине штраф в истории европейского регламента о защите данных. Uber будет обжаловать.

Для любого, кто строит на ИИ хоть какой-то отбор людей — резюме, заявок, клиентов, — это прямой сигнал. Дорого стоит не сама автоматизация, а отсутствие человека в цепочке решения и невозможность его оспорить. Закладывайте апелляцию сразу, а не когда придёт письмо.

Anthropic позвала чипового ветерана Google. Компания наняла Амира Салека, много лет делавшего собственные ускорители Google. Это часть захода в своё железо (Business Standard). Ход понятный: стоимость работы модели упирается в чужие чипы, а свои — это контроль над ценой на годы вперёд. Завтра эффекта не будет. А вот почему подписки то дорожают, то дешевеют — тут это станет одной из главных переменных.

На LessWrong вышли два неудобных текста про Anthropic. Первый — пересказ разговора с анонимным исследователем компании. На вопрос, возможно ли за ближайшие десятилетия создать систему, которая приведёт к вымиранию человечества, тот ответил мгновенно: «Да, конечно». Связного объяснения, почему он при этом продолжает там работать, у него не нашлось.

В комментариях возражают резонно. У многих исследователей ответ есть, просто другой: раз Anthropic держит самую высокую планку безопасности, ей и быть впереди. Читать текст стоит как реконструкцию по памяти, а не как стенограмму — автор сам это оговаривает. А практический вывод такой. Когда лаборатория говорит про безопасность, спрашивайте не про принципы. Спрашивайте, что она делает, когда принципы расходятся с расписанием выпуска.

Второй разбирает механику посложнее. Что происходит, когда модели предписано быть честной и одновременно демонстрировать неуверенность в конкретном вопросе? Автор опирается на работу, где подавление внутренних признаков обмана резко увеличивало частоту заявлений о субъективном опыте. Границу он оговаривает честно: эксперимент ставили на открытой модели, к весам Claude доступа нет, перенос — его допущение.

Для читателя тут один вывод, зато важный. Самоотчёт модели о собственном состоянии — не измерение. Ни про сознание, ни про уровень усилий, ни про то, почему она выбрала именно такой ответ.

Пять работ недели с практическим выхлопом.

Коротко.

  • OpenAI сокращает отрыв Anthropic среди американского бизнеса: по данным карт Ramp — 44% против 40%, и с мая разрыв сузился (TechCrunch).
  • LinkedIn отчитался, что кнопка «это похоже на ИИ-мусор» работает и ленту чистит (Engadget).
  • Лаборатория Минэнерго США изучает уязвимости китайских лидаров в американских машинах. За десять лет такие сенсоры подешевели с 75 тысяч долларов до нескольких сотен (TechCrunch).
  • Amazon поднял цены на Echo, Kindle и Fire TV — до 60%, из-за подорожания памяти (Digital Trends).
  • TikTok заплатит 400 миллионов долларов по иску о детской приватности, не признавая вины (Axios).
  • Робот-бегун на «олимпиаде роботов» смело врезался головой в стену и рассыпался снопом искр (PC Gamer).
Откомментируйте первым 👇

😎

Автор поста открыл его для большого интернета, но комментирование и движухи доступны только участникам Клуба

Что вообще здесь происходит?


Войти  или  Вступить в Клуб