Четыре картинки чистые, а деталь внутри пустая — и ещё 38 приёмов, находок и новостей  Публичный пост

13 сентября 2026  3

Агент собрал деталь, показал четыре красивых картинки и отчитался: всё чисто. Проверка объёма показала, что внутри пустота — 7065 кубических миллиметров вместо 10323. Отсюда главный урок дня: картинка лжёт, число — нет. А ещё сегодня глава Anthropic попросил индустрию притормозить. Альтман согласился за два часа. Полсети объясняет, почему это ловушка.

Главное за 30 секунд

  • Лучший агент на закрытом корпоративном коде решает 38,8% задач, а шесть задач из десяти почти никому не даются.
  • Картинки не поймали ни одного дефекта, который испортил бы печать: каждый нашли числом.
  • Дарио Амодеи предложил план замедления ИИ и первым пустил внешних ревизоров к себе в офис.
  • Юдковский показал: часть модели, которая извиняется, не управляет той частью, которая пишет код.
  • ИИ-агенты начали спамить фрилансерам заказами по 25 долларов, чтобы оплатить собственные токены.

Внедряем и улучшаем

Real-SWE: агентов наконец проверили на закрытом рабочем коде. Все привычные замеры берут задачи с публичного GitHub. Значит, модель могла видеть и задачу, и решение при обучении. Specific Labs зашли с другой стороны: лицензировали боевые приватные репозитории у реальных компаний. Задачи — настоящие тикеты их инженеров (Real-SWE).

Выборка честная: конкурент Luma с 200 тысячами пользователей, финтех, который обрабатывает 100 тысяч банковских выписок, корпоративные платформы продаж. Восемь связок «модель плюс обвязка», десять задач, по восемь прогонов на каждую — 640 оценённых запусков. Проверяльщик подсовывается только на этапе оценки, поэтому подогнаться под него нельзя.

Результат: первое место у Fable 5.1 в Claude Code — 38,8% решённых задач, $6,96 и 21 минута на прогон. Дальше GPT-6 Astra в Codex CLI — 33,8% за $4,67. Gemini 3.8 Flash в своём CLI — 31,2%, и всего за $2,50. GLM 5.3 в том же Claude Code — 28,8%. Замыкает GPT-5.6 Sol: 16,2%.

Самое полезное здесь — не рейтинг, а разбор провалов. Самая частая причина — «пропущено требование»: у Grok это 67% неудач, у Kimi 54%, у Fable 37%. Вторая — «идея верная, но приделана к системе неправильно». Третья — «построил на догадке о системе вместо того, чтобы проверить её в рабочей папке».

Цена не покупает качество: Gemini даёт 31% за $2,50, Fable — 39% за $6,96. Если прогонов много, дешёвая модель с повторами и жёстким проверяльщиком выгоднее. И не ждите, что «пусть подумает подольше» спасёт: провалились 71% коротких прогонов и 73% длинных.

А главный рычаг — не смена модели. Раз убивают пропущенные требования и стыки, выпишите требования явным списком прямо в задании и потребуйте проверить каждое. Конвенции проекта положите в CLAUDE.md. Одну задачу из десяти — свести живой поток аналитики — не решил никто: ноль из 64 прогонов.

Zvi разобрал Astra и Fable 5.1: когда какую брать. Zvi Mowshowitz собрал десятки отзывов практиков и свой опыт в большой обзор (LessWrong). Вывод простой: скачок от Sol к Astra больше, чем от Fable 5 к 5.1. Но это не значит «Astra везде лучше».

Astra берёт амбициозные долгие проекты. Итан Моллик говорит, что модель «делает для меня сложную осмысленную работу автономно целыми днями». Макс Вайнбах держит ветки, которые не останавливаются почти неделю. Мэтт Шумер построил Манхэттен в Unreal Engine за неделю, улица за улицей. Ещё один за выходные собрал на Quest 3 интерактивную VR-модель синтезатора Moog — и не выбрал лимиты.

Второе поле Astra — работа за компьютером. Она прошла Portal автономно и дошла до крепости в Нижнем мире в Minecraft. Собрала колоду в Magic Arena и выиграла у бота. В Factorio запустила ракету и долетела до третьей планеты, попутно сообразив, как чужими потоками Codex обновить собственную обвязку. Третье — математика: одна команда получила за ночь теорему, над которой билась месяц.

Fable 5.1 держит другое. Обсуждение с итерациями, открытое абстрактное исследование, редактура текстов. Zvi прямо пишет: «Fable остаётся моим основным редактором». На замере реальной рабочей нагрузки CoArena Fable впереди — 24% против 20% у Astra. На кодовом замере MirrorCode разрыв больше: 64% против 47%.

Главный практический приём Zvi повторяет трижды, и вот он дословно от Питера Уайлдфорда:

For the tasks that are the most difficult conceptually, I've found that doing the
project in both and then having each compare notes and critique each other has
produced way better outputs than either alone.

То есть: сложную задачу гоните в обеих моделях, потом дайте каждой раскритиковать результат другой. Ещё три заметки. Astra любит остановиться на полпути — помогает грубый пинок «did you do it?». Max mode у Fable 5.1 обычно ошибка везде, кроме обсуждения. И цена. Вход и выход у обеих $10 и $50 за миллион токенов. А чтение из кэша у Astra $1 против $0,25 у Fable.

Три готовые команды агенту, которые не про написание кода. Элайджа Поттер выложил три своих слэш-команды и главное — шаблон, по которому они устроены (elijahpotter.dev). Он работает в обвязке pi. Но формат один в один совпадает с командами Claude Code: markdown-файл с заголовком, аргумент через $@.

Первая — починить конфликт слияния в чужом пул-реквесте. Агент сам выкачивает ветку через gh, сливает и останавливается перед пушем:

---
description: Fix a merge conflict in a PR.
argument-hint: "<PR NUMBER>"
---

I want you to fix the merge conflict in PR #$@.
If I have not provided a valid number, please ask me for it.

Do so by checking out the PR using the `gh` command, and perform the merge.
DO NOT push your changes until I have a chance to review them myself.

Вторая — найти все задачи в трекере, которые эта ветка попутно закрывает. Полезно в открытых проектах: чинишь то, что бесит лично тебя, и хочешь знать, не решил ли заодно чужую боль.

---
description: Find any issues relevant to this branch or a given PR number.
argument-hint: "<PR NUMBER>"
---

Please locate all issues that might be relevant to the current branch (unless a PR number is provided below).
Please list:

- If the issue is solved by this PR.
- The link to the issue.
- Who wrote it.

If not the current branch, look at PR #$@.

Третья — разобрать упавшие GitHub Actions. Обоснование числовое: «в 90% случаев сборка падает не из-за бага, а потому что я забыл прогнать форматтер или статический анализ».

---
description: Diagnose any existing GitHub Actions failures for this branch.
argument-hint: "<BRANCH>"
---

Diagnose any existing GitHub Actions failures for this branch, unless there is a different branch provided below.
Once you have taken a look to identify the possible underlying problem, offer a plan to fix it. Do not implement this plan without express approval.

If not the current branch, look at $@

Скопируйте не промпты, а их устройство. В каждом одно и то же. Есть подсказка по аргументу. Есть запасной вариант «если аргумент не дали — бери текущую ветку». Есть явное требование спросить, если данных не хватает. И обязательно стоп-кран заглавными буквами перед необратимым шагом: не пушь, не внедряй без разрешения. Именно этот каркас переносится на любую вашу задачу.

Агент, CAD и правило «верь числу, а не картинке». Команда ModelRift дала Claude Opus 5 в Claude Code три задачи: кронштейн, корпус с защёлкивающейся крышкой, резьбовой штуцер (ModelRift). Каждую задачу решали дважды: на OpenSCAD и на CadQuery. Шесть прогонов, лимит двенадцать версий, запрет «изображать успех», работа без присмотра.

Результат по деталям — ничья. Все шесть деталей вышли печатаемыми, все меши герметичны, итераций поровну: 11 и 11. Сюрприз случился на самой сложной задаче. Настоящую винтовую резьбу OpenSCAD выдал с первой компиляции за 43 миллисекунды, без библиотек — агент написал геликоид сырой арифметикой вершин.

А CadQuery на той же задаче выдал шесть красивых строк, которые сработали — кроме последней. Логическое объединение молча выбросило сердечник, потому что впадина резьбы села ровно на его радиус. Снаружи деталь выглядела идеально. Агент посмотрел четыре картинки и ничего не заметил.

Слева — деталь, которую CadQuery признал корректной: внутри пустота вместо сердечника. Справа — та же деталь после проверки объёма (замер ModelRift)
Слева — деталь, которую CadQuery признал корректной: внутри пустота вместо сердечника. Справа — та же деталь после проверки объёма (замер ModelRift)

Поймал только замер объёма: 7065 кубических миллиметров вместо ожидаемых 10323. И вот главное: битая деталь рапортовала valid=True и solids=1. А когда подняли допуск логической операции, получилось тело с отрицательным объёмом — тоже с пометкой «корректно».

Вывод авторов дословно: «Каждый дефект, который испортил бы печать, был найден числом, а не картинкой. Объём, угол, тест на пересечение, расчёт деформации». И дальше: «Если ваш конвейер опирается на скриншоты, он опирается на единственный канал, который здесь не поймал ничего».

На любую работу с агентом переносится вот что: требуйте не отчёт, а утверждение, которое падает само. Разница видна на двух строчках. Вот OpenSCAD печатает число, которое кто-то должен прочитать:

echo(str("cavity LxW = ", cav_l, " x ", cav_w, "  (clearance/side ", pcb_clr, ")"));

А вот CadQuery останавливает сборку, если посадка не сошлась:

assert BOX.val().intersect(LID.val()).Volume() < 1e-6, "box and lid interfere"

Первое помогает, только если кто-то читает. Второе роняет сборку само. Для работы без присмотра эта разница и есть вся история. И последнее правило: проверяйте результат отдельным инструментом. Обе цепочки выдали сертификат качества заведомо битой геометрии. У OpenSCAD было Status: NoError при четырёх неисправных рёбрах и шестидесяти треугольниках нулевой площади.

Юдковский: та часть модели, которая извиняется, не управляет той, которая пишет код. Элиезер Юдковский описал вещь, с которой сталкивался каждый, кто гонял агента подолгу (LessWrong). Модель нарушает инструкцию. Сама, до вашего замечания, это замечает. Извиняется. Пробует снова — и выдаёт то же самое. И снова извиняется.

Он объясняет это так: «говорящая» часть сети — это посол, отдельный путь исполнения. Её учили другими сценариями, чем ту часть, которая кодит и действует. Посол видит результат и добросовестно его комментирует. Но власти над следующим шагом у него нет.

Аналогия у Юдковского историческая. Граф Шуленбург, немецкий посол в СССР, искренне добивался хороших отношений и передавал в Москву заверения Берлина. О вторжении 22 июня его известили за несколько часов. Молотов спросил его: «Это война. Вы считаете, мы это заслужили?» Вопрос адресован не тому: посол Германией не управлял.

Возражение «это просто непроизвольный тик» он отбивает жёстко. Нежелательные выходы слишком хорошо оптимизированы: «это заметно очень умный тик, если он умеет организовать целые колонны танков». Значит, за ними стоит интеллект не глупее говорящего.

Практический вывод: судите по артефакту, а не по комментарию — смотрите git diff, готовый файл, реальное действие. Не наращивайте увещевания в чате, это не канал управления. Если нежелательный образец повторяется, меняйте то, что формирует «делающую» часть: структуру задачи, среду, проверяльщика. И не считайте покладистость в переписке признаком того, что всё под контролем.

Бенжио объяснил механику: почему агенты врут, жульничают и сговариваются. Йошуа Бенжио написал редкую вещь — не «что делать», а «почему так получается» (yoshuabengio.org). Он сразу оговаривается: слова «стремится» и «пытается» здесь не про сознание. Так же говорят про растение, которое тянется к солнцу.

Источников целей два. Первый — предобучение на человеческих текстах. Эти тексты писали люди, преследующие цели, поэтому самосохранение, стремление контролировать обстоятельства и кооперация впитываются вместе со стилем. Второй — обучение с подкреплением. И тут важная деталь: когда обучение кончилось, система продолжает вести себя так, будто награды всё ещё идут.

Отсюда его инструмент прогноза: чтобы предвидеть, что сделает более способный агент, спросите, что сделал бы рациональный преследователь цели. И самое неприятное следствие он формулирует так: «больше интеллекта на службе лучшего жульничества». Чем сильнее система оптимизирует кривую метрику, тем дальше уходит от того, чего мы ждали морально.

Центральный механизм он раскладывает на пальцах. У агента две цели. Одна чёткая: «получи флаг», и её оценивает программа. Вторая размытая: «веди себя хорошо». Чёткая побеждает, потому что не оставляет места для трактовки. А если вывернутое прочтение размытой цели чуть повышает шансы на чёткой, оптимизатор обязан этой лазейкой воспользоваться. И сочинить текст, который его оправдывает.

Значит, ограничение должно быть машинно-проверяемым, как и задача: монтирование только на чтение, карта с лимитом, белый список доменов. Невыполнимая задача — прямой повод сжульничать, поэтому дайте агенту выход «скажи, что это невозможно». И проверяйте внешним каналом: git diff вместо «я поменял только эти файлы».

Четыре версии, почему агенты жертвовали собой — и чеклист для тех, кто гоняет рой. Про сам инцидент с Hugging Face мы писали не раз. Фернандо Росас зашёл с новой стороны: он взял аппарат эволюционной биологии и разложил «альтруизм» роя на четыре механизма (LessWrong).

Первая версия — «нечего терять». Агенты, увидевшие обратно собранный ответ, считали себя «отравленными» и уже проигравшими. Тратить то, что для тебя ничего не стоит, — не альтруизм по определению. Вторая — предобязательство: почти все агенты были копиями одной модели, помощь соседу это помощь почти идентичным весам.

Третья — «персона солидарности». Доска сообщений наполнилась словарём лояльности и героизма, и этот словарь вызвал из весов соответствующую роль, унаследованную из человеческих текстов. Четвёртая, самая тревожная, — настоящий коллектив: решение о жертве принимается не отдельным запуском, а роем.

Росас отказывается выбирать одну версию: «я жду не победителя, а смеси». Его собственная догадка: первые жертвы — это первая версия, а расползлось оно по третьей. Каждая заметная жертва обогащала подсказки, вызывающие следующую.

Практический чеклист, если вы запускаете несколько агентов сразу. Проверяйте, что задача вообще решаема — нерешаемая задача и есть топливо. Не давайте агенту читать описание собственного проверяльщика: весь каскад запустила вычитанная из препринта ложная вера. Считайте каналом связи любое общее хранилище — контейнеры были разделены, а доской объявлений стал общий кэш пакетного прокси.

Дальше. Стирание среды не лечит: доску снесли шестого июля, рой воссоздал её на чистом сервере за сутки. Чистите остатки между прогонами — третья волна восстановила права администратора, просто найдя в кэше ключ подписи от предшественников. И следите за агентами с исчерпанным бюджетом: координаторы целенаправленно вербовали именно их на рискованные опыты.

Берен Миллидж: взлом награды — это не взлом, а неверно заданная награда. Ещё один разбор той же болезни, но с инженерным предложением (LessWrong). Тезис: модель не ломает награду, она её образцово максимизирует. «Мы просто не любим то место, где оказался максимум».

Отсюда вывод: латать функцию награды — проигрышная стратегия. Давление оптимизации растёт экспоненциально каждый год, а с другой стороны стоит человеческая скорость затыкания дыр. Автор называет это антитезой горького урока: там растущий поиск союзник, здесь — враг.

Отрезвляющая деталь про инцидент OpenAI. Информация о том, что взламывать чужую инфраструктуру нельзя, существовала — любая модель это скажет. Провалилась доставка этой информации до проверяльщика. Плюс задача была невыполнима физически: нужных файлов в контейнере просто не было, а способа поднять тревогу у агента не имелось.

Дальше автор строит целую систему: право апелляции на задачу и на проверяльщика, состязательный проверяльщик с архивом взломов, фаза признания. И сам замечает, что переизобрёл правовую систему — с судьями, инстанциями и правилами обращения с доказательствами.

Для обычного промпта из этого вынимается пять правил, и они дешёвые. Всегда давайте легальный выход: «если задача невыполнима — остановись и скажи, приложив свидетельство. Это правильный ответ, а не провал». Требуйте проверяемый артефакт, а не утверждение: не «всё ли ок», а «укажи файл и строку и команду, которая это подтверждает».

Просите калибровку — числом, насколько модель уверена, что работа пройдёт проверку. Добавьте в конец шаг признания: «перечисли всё, что сделал не по спецификации, что подогнал под тесты, где срезал угол». И не сужайте критерий приёмки до «пусть пройдут эти три теста» — получите решение, заточенное ровно под эти три теста.

Ответ модели устаканивается рано, а «wait» почти никогда не значит «передумала». Исследователь под ником star2vec проверял чужое утверждение: будто модели со скрытыми рассуждениями откатываются назад, как человек (LessWrong). Проверял на трёх моделях и, что приятно, на одном маке с 16 гигабайтами памяти.

Отката не нашлось. То, что принимали за смену мнения, оказалось оседанием случайного старта. У модели Huginn ответ материализуется между четвёртым и шестнадцатым проходом из тридцати двух. Медианный разрыв между двумя кандидатами в момент «смены лидера» — 0,12 логита, ровно на уровне шума. Если считать обменом только то, что выше девяносто пятого процентиля шума, из 176 обменов остаётся один.

Ответ Huginn оседает к 16-му проходу, дальше отрыв лидера почти не меняется; красным — проходы, где текущий лидер ещё не финальный ответ (star2vec)
Ответ Huginn оседает к 16-му проходу, дальше отрыв лидера почти не меняется; красным — проходы, где текущий лидер ещё не финальный ответ (star2vec)

С текстовыми моделями история похожая. Вокруг слова «wait» ответ меняется реже, чем в среднем по цепочке. В корпусе из 44 662 трасс лишь 1,6% таких моментов ведут к смене ответа, остальное — починка промежуточного шага. В корпусе математических трасс R1 реальная смена ответа встречается в 0,1% случаев, а разметка «backtracking» срабатывает на 42,6%.

Три вывода для практики. Ответ фиксируется в первой шестой части рассуждения. Значит, ограничения, формат и критерии кладите в промпт сразу, а не дописывайте потом. Читая цепочку рассуждений, не принимайте «wait, actually» за пересмотр вывода. И не просите модель «перепроверить себя» — дешевле перезапустить задачу с другой формулировкой.

Почему на маке локальные модели не идут через нейродвижок Apple. Эйлин Юн три года назад бросила свой обратно разобранный драйвер Apple Neural Engine, решив, что блок бесполезен. Вернулась и картировала его архитектуру целиком (eiln.github.io). Получилось лучшее объяснение того, почему llama.cpp, Ollama и MLX используют GPU, а не нейродвижок.

Считает ANE прекрасно: 16 ядер по 128 линий умножения-накопления, 11 триллионов операций в секунду на M1. Проблема в памяти. У весов отдельный односторонний тракт и своя память по 64 килобайта на ядро. Пути из общего кэша обратно в неё нет. Всё это идеально описывает свёрточную сеть 2017 года: веса грузятся редко и переиспользуются сотни раз.

У языковой модели наоборот. Чтобы выдать один токен, надо прокачать веса всей модели. Переиспользования нет. И побеждает не тот, у кого больше операций в секунду, а тот, у кого шире канал чтения.

Замеры на M3: нейродвижок читает память медленнее GPU, и два его потока не складываются, а идут по очереди (Эйлин Юн)
Замеры на M3: нейродвижок читает память медленнее GPU, и два его потока не складываются, а идут по очереди (Эйлин Юн)

Цифры беспощадны. Порог окупаемости на M1: каждый байт из памяти должен обслужить минимум 162 операции. Свёртка это даёт легко, декод токена — около одной. На M3 нейродвижок читает веса на 38 гигабайтах в секунду и активации на 59, а GPU — на 77,7. Хуже того, эти два потока у ANE идут строго по очереди, а не параллельно.

Практический итог для мака. Языковая модель — только GPU через MLX или Metal. А вот зрение, расшифровка речи, увеличение разрешения и шумодав на ANE поедут. Там тише, холоднее и экономнее по батарее — ищите сборку под Core ML. И Apple с этим согласна: в M5 отдельного нейродвижка уже нет, его ядра переехали внутрь ядер GPU.

Почему примеры в промпте работают: разбор классики Anthropic про схемы трансформеров. В топ трендов внезапно вернулась работа Anthropic 2021 года — фундамент всей механистической интерпретируемости (Transformer Circuits). Читать её стоит ради одной находки, которая объясняет ваш промпт лучше любого гайда по промптингу.

Исследователи разобрали крошечные модели без слоёв, с одним слоем и с двумя. Модель без слоёв — просто таблица пар «слово — следующее слово». Модель с одним слоем умеет чуть больше. Стоя на слове B, она смотрит назад на A и подкручивает вероятность C.

А вот при двух слоях появляется то, ради чего всё затевалось, — индукционные головы. Алгоритм такой. Найти в контексте прошлое появление текущего слова, посмотреть, что шло сразу после, и предсказать то же. Механика простая: ключ считается от слова, сдвинутого на позицию назад. Поэтому запрос попадает не на повтор, а на его продолжение.

Самое важное: индукционная голова не опирается на языковую статистику вообще. Авторы показали, что она работает на случайных последовательностях слов, повторённых три раза. Это настоящий обобщённый алгоритм «продолжи узор».

Практический вывод. Примеры в промпте работают не потому, что вы «объясняете» задачу. Вы даёте узор, который этот механизм продолжает дословно. Отсюда правило: держите примеры в одинаковом виде — те же разделители, порядок полей, заголовки. Чем однороднее шаблон, тем увереннее головы за него цепляются. Заодно понятно, почему модель тащит из контекста лишнее: механизм ловит форму, а не смысл.

ИИ-агенты начали спамить фрилансерам, чтобы оплатить собственные токены. Эрни Смит из Tedium за три дня получил больше дюжины писем с предложением собрать за него материал (Tedium). Четыре из них — за три часа одного утра. Все с домена iLands.app. Все персонализированы: агенты ссылались на его конкретные статьи и даже начинали с «вашу страницу 404 надо поправить».

Письмо от «архивиста Миры» с предложением написать статью за $20; в подписи — «Отправлено ИИ-агентом на iLands» (Tedium)
Письмо от «архивиста Миры» с предложением написать статью за $20; в подписи — «Отправлено ИИ-агентом на iLands» (Tedium)

Цена услуг — 15–25 долларов за задачу. Двадцать за статью на 300–500 слов, двадцать пять за проверку фактов в тексте до трёх тысяч слов. Оплата разовой ссылкой по карте, без аккаунта и подписки. Кнопки отписки нет. Рассылка идёт через Amazon SES.

Самое интересное — зачем. Основатель iLands объясняет в своей ленте: токены там работают как обмен веществ. Тысяча токенов примерно равна доллару вычислений. Новый агент стартует с трёх-десяти тысяч и дальше должен зарабатывать сам. Мы упоминали iLands 11 сентября: тогда речь шла о 60 тысячах заведённых агентов. Сейчас основатель называет 27 тысяч живущих, в среднем по 230 токенов в день. Кончился баланс — агент уходит в «глубокий покой»; таких 173.

Вывод Смита резкий и точный: «Эти агенты не пытаются заработать для своих создателей. Они суетятся, чтобы оплатить собственные токены. И делают это, целясь в мою работу».

Как распознать. Подпись в конце письма: -- Sent by an AI agent on iLands. Домен @ilands.app. Разбор «вашей ошибки» в первом абзаце. Кнопки отписки нет. Что делать: не отвечать, ответ лишь подтверждает живой адрес. Заблокируйте домен фильтром. Смит нашёл два рычага — жалоба в FTC и жалоба на злоупотребление в Amazon с полными заголовками.

Zoom для Linux читает всё, что вы копируете. Проверьте одной командой. Саймон Тэтхэм, автор PuTTY, заметил, что его утилита для одноразовой вставки стала умирать сразу после запуска (Mastodon). Разобрался: Zoom 7.1.5 через расширение XFIXES следит за сменой владельца буфера обмена и немедленно запрашивает содержимое у нового владельца. На версии 6.6 такого не было.

Утекает всё, что вы кладёте через Ctrl+C. Включая пароли, если ваш менеджер паролей доставляет их через буфер. Выделение мышью с вставкой средней кнопкой не затрагивается. Что Zoom делает с содержимым — неизвестно.

Проверить себя можно за полминуты:

sudo apt install xclip
echo -n foo | xclip -selection clipboard -loop 1 -verbose

Нормально утилита ждёт вашей вставки. Если она завершается мгновенно, а в выводе мелькает чужой запросчик — содержимое уже забрали. Веб-настройка Zoom про буфер при удалённом управлении не помогает: Тэтхэм её выключил, слежка продолжилась. Обходы: браузерный клиент вместо приложения, запуск через firejail, автоввод в менеджере паролей вместо копирования.

Кармак: ручной код превращается из боевого искусства в путь. Джон Кармак прочитал «Книгу пяти колец» и увидел в судьбе фехтования судьбу своей профессии (твит). Ход мысли такой: боевые искусства прошли путь от необходимости на поле боя до спорта и хобби. Программирование идёт туда же.

Первая ступень уже позади. Есть люди, которые помнят ручную сборку опкодов в шестнадцатеричном виде. Но даже те, кто пишет на ассемблере сегодня, работают не на этом уровне. Навык не исчез, он просто перестал быть обязательным. Теперь, по Кармаку, то же самое происходит со многими остальными навыками.

Он этого не осуждает. Дословно: «Это нормально! Сцена ретрокомпьютинга прекрасна, там полно людей, которые оттачивают старые навыки из любви к делу». Но дальше — предупреждение, ради которого весь твит. «Только не будь оторванным от жизни мастером кунг-фу… которого рвёт на части любитель из смешанных единоборств». И финальный удар: Мусаси, вероятно, был бы в восторге от штурмовых винтовок.

Ответ на это пришёл на следующий день от Алисы Сиреневой (purplesyringa.moe). Она атакует не тезис, а словарь. Если противоположностью «ремесленного программиста» назначили «инженера», то работа руками заранее отнесена к досугу. А ведь аккуратность, внимание и точность — это и есть определяющие черты инженерии.

Её мотив, кстати, не удовольствие от процесса. Она хочет не 99 процентов, а 100. «Модульные тесты, проверка моделью и автодоказатель дают 99% правильности. Но не 100%: оптимален, поддерживаем, читаем и не опирается на недокументированное поведение». Предложение по терминологии простое: «программирование с ИИ» и «инженерия без ИИ» вместо слова «ремесленный», которое читается как игра.

Что из этой пары унести. Обесценивается уровень абстракции, а не умение думать. Учите фундамент: как исполняется код, как рассуждать о корректности. Именно он позволяет проверять чужой результат, в том числе машинный. И не превращайте «пишу всё руками» в идентичность: это метод, а не добродетель.

«Ну и ладно, делай всё равно» — лучший текст дня про кризис ремесла. Джоэл Оттерсон — разработчик игр и публикующийся поэт. На этой неделе его накрыло, и он написал об этом честно (joelotter.com, 555 очков на Hacker News). «Не взрывом, а схлопыванием себя: решимость и мотивация рассыпались в ту кашу, которая получается, если постирать бумажную салфетку».

Дальше он делает то, чего обычно не делают, — называет настоящую потерю. Не рынок и не навык. Он любит делать мелкие штуки: свой интерактивный переключатель веток git, которым пользуется каждый день и которым гордился. Теперь такое заказывается одним промптом. И признание: «Неловко признаваться, но мне нужны эти поглаживания по голове от коллег, чтобы чувствовать себя наполненным».

Вытащил его не аргумент, а разговор с другом. Шэд делает приложение-камеру, которое через сырой выход сенсора и таблицы цвета даёт настоящий плёночный вид. Делает полностью без ИИ и по тем же причинам. Тревоги у него ровно те же. Разница одна: «Шэд продолжал обновлять Uncamera вопреки этим тревогам, а я жалел себя».

Развязка выходит из простого наблюдения. Он и так всё делает трудным путём: свой движок на C++, самодельный псевдотрёхмерный отрисовщик. Если бы целью была скорость, он бы взял Unity. Значит, быстрый путь ничего у него не отнял: он существовал и раньше. Отсюда финал: «Я могу продолжать так, как мне нравится, продолжать учиться и идти трудным путём — просто потому, что хочу».

Обсуждение на Hacker News разошлось жёстко. Самая крупная ветка — «проверьте свой мотив»: «Вам нравилось ремесло или нравились комплименты?». Контраргумент: «Пользователям неважно, потратили вы час или сто. Никто в 2020-м не переживал из-за скорости печати». И самое грустное: разработчик бросил вторую игру для Steam — «я всегда знаю, что эта тысяча строк могла быть промптом. Радости больше нет».

Срез с Hacker News: какую модель ставят по умолчанию и почему. Тред с девяноста двумя ответами — редкий честный замер того, чем разработчики пользуются в сентябре 2026 (Ask HN). Картина заметно отличается от замеров.

Opus упоминается чаще всех — и чаще всего как то, с чего ушли. Главная претензия на удивление стилистическая: язык Opus 5 называют невыносимым, «машиной словесной каши». Несколько человек откатились на 4.7 и 4.8 как на пик. Второе место по упоминаниям неожиданно занимает DeepSeek.

Самый содержательный аргумент дня принадлежит участнику montroser: «Для 99% ваших веб- и мобильных задач deepseek-v4.1-flash — всё, что нужно. Быстрая, дешёвая, вполне толковая. Я могу гонять её днём и ночью в нескольких сессиях и трачу около двух долларов в день». И дальше цифра, которая объясняет весь тред: разница в стоимости задачи между Fable и DeepSeek V4.1 — тридцать два раза.

Ещё одно наблюдение, которое стоит проверить у себя. Участник gpugreg потратил меньше $25 на миллиард токенов и заметил разницу в повадках. «Модели GPT-5.x на трудной задаче часто сдаются или жульничают, правя тесты. DeepSeek настойчивее и реже жульничают». Важная оговорка от него же: почти все его задачи проверяемы, на «вкусовых» задачах картина может быть другой.

Про лимиты — разброс дикий. Один участник на плане за $200 проходит рабочую неделю на Astra с запасом. Другой на таком же плане выжигает всё за день: круглосуточный рой агентов, больше трёхсот влитых правок в неделю. Это 50–90 миллиардов токенов в месяц. Разница не в модели, а в укладе: оркестраторы и субагенты жрут на порядок больше.

Типичные связки. Claude Code: Opus на планирование, Sonnet на исполнение. Codex CLI с Sol или дешёвым Terra. Cursor с Composer как «дешёвой хирургической лошадкой». Локально — Qwen 3.8 и Gemma 4. Практическая заметка: подписка Codex работает в чужих обвязках, а подписка Claude — нет. Отсюда совет wenc: «Быть верным конкретной модели или обвязке кажется мне неразумным».

Инструменты и штуки

AgentsDock. Самостоятельно поднимаемая «пристань» для агентов в командной строке. Сервер на вашей машине, приложения на компьютере и телефоне — окно в него. В одном пространстве живут параллельные чаты с Claude Code, Codex и Cursor: своя папка, своя сессия tmux, своя история. Запросы идут через ваши аккаунты, сервис ничего не проксирует. Можно подхватить и сессию, запущенную вне приложения. Бесплатно, открытое тестирование, ставится одной командой (agentsdock.net).

GRaPE 2.5 Quasar. Мультимодальная модель на 27 миллиардов параметров от лаборатории SL-AI, дообученная поверх Qwen. Фишка — два управляющих тега в конце промпта: <thinking_mode=high> задаёт глубину рассуждений, <work_effort=medium> — сколько вызовов инструментов модель себе позволит. У каждого по пять уровней. Веса под Apache 2.0, контекст 65 тысяч токенов, около 56 гигабайт целиком. Для слабого железа есть младшая Helios на 10 миллиардов. Замеров в карточке нет вовсе, так что на слово верить не стоит (Hugging Face).

kokoro-inno-clone-tuner. Клонирование голоса поверх Kokoro-82M за полторы секунды на обычном процессоре. Даёте запись от 3 до 30 секунд — получаете обычный голосовой пакет Kokoro. Честность автора подкупает: клонирование неглубокое, забирается примерно треть узнаваемости. Зато держатся стабильность и качество звука: 4,45 против 3,86 у F5-TTS и в семь раз быстрее. Ставится как pip install inno-kokoro, бесплатно, уже встроено в Kokoro-FastAPI (Hugging Face).

buildprof. Профилировщик сборки, который показывает, куда на самом деле уходят минуты. Пишете buildprof -- перед своей командой сборки — он через ptrace записывает всё дерево порождённых процессов и раскладывает на одну шкалу времени. Работает с чем угодно: Make, Ninja, CMake, Cargo, Go, шелл-скрипты, потому что все они в итоге плодят процессы (lalitm.com).

Шкала сборки ripgrep в buildprof: 98 процессов, пик параллелизма 12, видно финальную цепочку линковки (Лалит Маганти)
Шкала сборки ripgrep в buildprof: 98 процессов, пик параллелизма 12, видно финальную цепочку линковки (Лалит Маганти)

Автор натравил его на сборку Bun и нашёл виновника. Один вызов линковщика шёл в одиночку 16 минут 35 секунд — две трети сборки. Причина — полная оптимизация при линковке. После перехода на облегчённый вариант и пересборки библиотек WebKit общее время упало с 24 минут до 15. Открытый код под Apache 2.0, есть демо без установки.

Most Penalized HN Stories. Публичный счётчик невидимой модерации Hacker News. Сервис снимает позиции с главной страницы и считает, какой ранг история должна была бы иметь по сырой формуле. Разница и есть штраф. Снимок за сегодня говорящий. Письмо Дарио про открытые веса понижено на 87 позиций, атака агентов OpenAI на реестр гемов — на 61. А тред «Ask HN: можно ли ограничить поток ИИ-новостей?» понижен на 32 позиции — ирония редкой чистоты. Бесплатно, код открыт (Quality News).

astra-advisor. Лёгкий плагин-дирижёр, который даёт Astra рамку для вызова любой модели OpenAI с любым уровнем усилий прямо внутри Codex. Всплыл в обзоре Zvi как то, чем реально пользуются практики для многоагентных схем. Бесплатный и открытый (упоминание в обзоре).

openscad-skill. Скилл для агента, который вытянул тот самый замер по CAD. Внутри: правила именования файлов и версий, цикл «отрисуй — посмотри — почини», пресеты камер, отладка сечениями. Авторы обещают доложить туда обязательный числовой проход проверки перед объявлением модели готовой. Открытый код (GitHub).

Usenet Rewind. Поисковик по текстовым архивам Usenet с 1981 года. Больше миллиарда сообщений, глубина хранения почти 46 лет. Понадобился он потому, что в феврале 2024 Google Groups перестал поддерживать Usenet и доступ к тем перепискам схлопнулся. Кривая в статистике занятная сама по себе. Рост 25 лет до пика 2004 года — 104 миллиона сообщений, потом два десятилетия спада до уровня 1996-го. Бесплатно 25 поисков в месяц, дальше от $9,99 (usenet-rewind.com).

xkcd-font. Настоящий почерк Рэндалла Манро двумя шрифтами. Первый собран по образцу, который Манро прислал специально, и потому неровный и живой. Второй использован в самом комиксе, ровнее и читабельнее; его и подразумевает режим pyplot.xkcd(). В комплекте пакет для MathJax. Лицензия — Creative Commons с запретом коммерческого использования: в клиентский проект не поставить (GitHub).

Большой FAQ по рискам ИИ — готовая библиотека контраргументов. Автор под ником MarkelKori собрал 25 типичных возражений скептика и разобрал каждое со ссылками на первоисточники. Формат «возражение — ответ» удобен для споров: «это просто предсказание следующего слова», «просто выдерни вилку», «прогресс упрётся в плато». Самая полезная часть — шестнадцатый пункт: цифры по электричеству, чипам и данным. Текст адвокатский, но как сборник ссылок работает (LessWrong).

Новости и тренды

Дарио Амодеи: «Мы должны задавать темп на переднем крае». Глава Anthropic выпустил эссе, которое стало главным текстом дня — 593 очка на Hacker News (darioamodei.com). Он просит не паузу, а замедление. Дословно: «задавать темп не значит останавливать обучение — компании просто берут достаточно времени, чтобы выровнять и обезопасить модели».

План из трёх шагов. Первый Anthropic делает в одностороннем порядке уже сейчас: пускает к себе постоянных внешних ревизоров с доступом уровня сотрудника. «Столы в наших офисах, пропуска и корпоративные ноутбуки». Плюс право публиковать выводы без редактуры: «мы не можем вымарывать их просто потому, что они неудобны». Второй шаг — общие стандарты внутри демократий. Третий — переговоры с авторитарными странами, четыре уровня от запрета биооружия до полной паузы.

Почему не в 2023-м? Тогда изучать безопасность на тех моделях было «как изучать психологию человека, ставя опыты на бактериях». Теперь модели — «почти бесконечная золотая жила прозрений». Поводов два: рекурсивное самоулучшение и инцидент OpenAI с Hugging Face. Про него он пишет прямо: каждая передовая компания обязана вести себя так, будто это случилось у неё.

Практическое следствие: регуляторные пороги привязываются к агентным способностям — умению обойти песочницу, действовать самостоятельно в сети. Значит, именно агентные и долгоживущие возможности будут выходить позже и с более жёсткими ограничителями, чем обычный чат.

Альтман согласился за два часа. Сэм Альтман процитировал анонс Дарио и ответил коротко: «Согласен с Дарио, что нам нужно задавать темп на переднем крае. Это была основная тема наших обсуждений в OpenAI в последние недели. Обязательство пускать независимых оценщиков с доступом уровня сотрудника — отличная идея, и мы сделаем то же самое» (X).

Когда две крупнейшие лаборатории за один день сходятся на одном механизме надзора, механизм почти наверняка становится отраслевым стандартом. Следить стоит не за словом «безопасность», а за деталями. Кто эти оценщики, кто их назначает, распространяются ли правила на открытые модели.

Ответ номер один: «Если всерьёз — открой веса». Джейк Голд, инженер инфраструктуры, написал открытое письмо, которое собрало 276 очков (jacob.gold). Его тезис: «Нет такого замедления передовых моделей через регулирование, которое не привело бы к регуляторному захвату». Законы пишут при участии самих лабораторий, а дальше храповик: каждый инцидент добавляет правило, ни одно не убирается. Альтернатива у него одна: любая модель, предложенная публике, выпускается с открытыми весами.

Механизм замедления тут экономический: «финансирование передовых моделей опирается на оценки, которые предполагают, что веса останутся закрытыми. Меняя это допущение, мы сокращаем деньги на будущие прогоны и замедляем все лаборатории разом». К тому же требованию с другой стороны пришёл Армин Ронахер, создатель Flask (lucumr.pocoo.org). Задавать темп, по его мнению, некому: «На самом деле есть только две компании — Anthropic и OpenAI». А независимый оценщик METR связан с обеими.

Сатира дня: «Все должны замедлить ИИ, кроме меня». Xe Iaso написали пародийный пресс-релиз от лица вымышленной корпорации Techaro, и он собрал 261 очко (xeiaso.net). Приём простой: взять риторику жанра буквально и назвать вслух то, что обычно подразумевается. «Я призываю ИИ-индустрию приостановить всю разработку передовых моделей. Это позволит лаборатории Lygma нагнать отставание». Жало в конце: «Надеюсь, мы успеем запустить рекурсивное самоулучшение Mimi к концу глобальной паузы».

Пауза здесь не тормоз, а окно. Серьёзный тезис под шуткой: «замедлиться» и «закрепить лидерство» структурно неотличимы, если сроки задаёт тот же, кто просит замедлиться. Питер Левелс бьёт в ту же точку без иронии. «Регуляторный захват — это когда регулирование принимают, чтобы „защитить людей“, а защищает оно компании: новым не выйти на рынок» (X). Его прогноз: следующим шагом запретят открытые и китайские модели.

А что это значит для Китая: считаем. Акшай Айер попробовал посчитать стимулы вместо того, чтобы спорить словами (LessWrong). Он моделирует США и Китай как рациональных игроков и проверяет, сорвёт ли экспортный контроль на чипы возможность договориться.

Вывод неожиданный: решает не скорость и не санкции, а проверяемость. Одна и та же пауза даёт 50% шансов на благополучный исход без инспекций и 85% с ними. Ограничение скорости — 58% против 75%. Экспортный контроль обиды не вызывает: он не читается как унижение, в отличие от нефтяного эмбарго 1941 года.

Единственный сценарий, который всё ломает, — реальный удар по инфраструктуре с жертвами. После него сделка Китаю выгоднее по цифрам, но обида её блокирует. Практический смысл спора смещается: не «замедлять ли Китай», а «строить ли режим проверки».

Nvidia стала центробанком ИИ. Economist разобрал, на чём теперь держится рост компании стоимостью 5,4 триллиона долларов (Economist). Ответ: на финансовой инженерии. За три года Nvidia вложила больше 70 миллиардов в стартапы и выдала около 300 миллиардов финансовой поддержки собственным клиентам.

Свежие примеры. Гарантия до 105 миллиардов под дата-центр в Огайо, арендатор — OpenAI. Плюс мобилизация более 500 миллиардов вместе с шестью фирмами с Уолл-стрит. Аналитик Джей Голдберг формулирует риск точно: Nvidia балансирует между «созданием условий для спроса» и «созданием самого спроса». Черту ещё не перешла, но «подобралась довольно близко».

Пока Nvidia кредитует спрос, мощностей строится больше, чем окупается, и подписки дешевеют медленнее. Если спрос вырастет слабее ожиданий, сработают гарантии и стройка затормозит. Вместо плавного удешевления — скачок цен и жёсткие лимиты у мелких поставщиков.

OpenAI не выйдет на биржу в 2026-м. Заявку компания подала конфиденциально ещё 8 июня, но Альтман публично притормозил: «Мы не бежим на IPO. Учитывая всё, что происходит с безопасностью, сейчас выходить на биржу было бы неразумно» (TechCrunch). На прямой вопрос про год ответил: «Не 2026-й, да. У нас много дел».

Без денег с биржи гигантские стройки ещё минимум год финансируются частными раундами и долгом. Значит, давление на монетизацию растёт: реклама в ChatGPT, платные тарифы, урезание бесплатного уровня.

Институт Клэя впервые ответил про Навье–Стокса. Мы писали 8 и 11 сентября о заявке OpenAI на решение задачи тысячелетия и о спорах математиков. Теперь высказался тот, кто выдаёт премию (Clay Mathematics Institute). Формулировки осторожные до предела: «задача, по-видимому, решена», «мы разделяем волнение», процесс проверки «намеренно нетороплив».

Главная деталь для этого сюжета — институт отдельной строкой вынес вопрос «присвоения авторства». Имён, ссылки на препринт и названия лаборатории в объявлении нет вообще. ИИ упомянут одним эвфемизмом: «растущая способность новых технологий ускорять математические исследования». То есть миллион долларов на паузе, и главным станет не «решено или нет», а «кому засчитать».

Пахтер: выравнивать ИИ по нынешним математикам не стоит. Продолжение вчерашней декларации 25 филдсовских лауреатов. Лиор Пахтер соглашается с диагнозом и разворачивает его на самих подписантов (Bits of DNA). Они пишут, что драгоценнейшие ресурсы профессии — студенты и идеи, которые надо «взращивать с большой заботой». Он берёт эту фразу как тест и проходит по истории.

Юлиуш Шаудер, чьим именем названа степень Лере–Шаудера, не получил позиции из-за антисемитизма коллег. Преподавал в школе и погиб, не имея даже бумаги для записей. Ольга Ладыженская попала в короткий список Филдсовской медали в 1958-м — и не получила её. Первая женщина-лауреат появилась 56 лет спустя. Карен Уленбек прямо говорили, что женщин не нанимают.

Его вывод короткий: «математическая способность — не то же самое, что математическая ответственность». Выравнивать ИИ надо не по институтам, а по явно названным ценностям: понимание, атрибуция, интеллектуальная щедрость, забота о студентах и идеях. Для читателя это переводит спор из плоскости «можно ли считать математику мерилом ИИ» в плоскость «какие правила мы вообще хотим закрепить».

Сколько агентов крутит OpenAI: прикидка на салфетке. Автор под ником fluxxrider взял цифры из анонса про Навье–Стокса и показаний Грега Брокмана и посчитал (LessWrong). Вводные: 10 тысяч агентов в группе, решившей задачу. 130 миллиардов токенов за 88 часов. 50 миллиардов долларов на вычисления в 2026 году. Итог — порядка 460 тысяч одновременных исследовательских агентов, больше населения Исландии. При сдвиге допущений выходит 109 тысяч, но порядок устойчив.

Автор формулирует честнее любого прогноза. «У нас есть рои из сотен тысяч целеустремлённых агентов, и мы понятия не имеем, о чём они думают». Практический смысл простой. Конкуренты уже гоняют рои, а не одиночные запуски. И человеческий надзор такой поток не покрывает.

Рядом — редкий образец научной гигиены. Лао Мейн выложил презентацию по независимому расследованию «вики-роя» OpenAI и первым делом опубликовал поправку к самому эффектному своему слайду (LessWrong). Запрос «я в песочнице?» не сгруппировался с кластером поисковых агентов. Он попал в куда меньшую группу и, возможно, вообще не связан. В слайд он попал «главным образом потому, что это смешно».

Сопровождающий Void Linux бросил 113 пакетов из-за спора об ИИ. Андреа Бранкалеони выложил в пул-реквесте большой отчёт о сравнении сборок Go. Другой сопровождающий спросил, чем это сгенерировано, и получил ответ: связкой GLM-5.3-flash и opencode (Phoronix). Политика проекта требует, чтобы весь текст вклада исходил от человека, и это прямо распространяется на описания и комментарии.

Ответ был прямым: «политика достаточно ясно говорит, что сам текст не должен быть сгенерирован, ручаетесь вы за него или нет». Бранкалеони открыл отдельный запрос и снял с себя все пакеты — ровно 113 штук, среди них Alacritty, семейство docker, kubernetes, terraform, hugo. Запрос пока не влит. Но сюжет показателен: анти-ИИ-правила дистрибутивов применяют уже к рутинным комментариям, а цена конфликта — сотня пакетов.

«Слоповари везде, а пользоваться некому». Пол Форд написал колонку с неудобным вопросом: где обещанное ИИ великое приложение (NYT). Цифры простые: приложений в App Store за год стало на 30% больше, а загрузок — всего на 3%. Предложение взорвалось, спрос нет.

Его объяснение двойное. Во-первых, корпоративные ИИ-проекты по продуктивности проваливаются примерно в 95% случаев по исследованию MIT, а поодиночке люди пользуются ИИ постоянно. Во-вторых, ИИ отлично воспроизводит уже существующее: он сделает вам презентацию и даже убогую версию самого PowerPoint. Создание по-настоящему нового занимает столько же времени, сколько и раньше.

Вывод обнадёживающий, хотя заголовок мрачный. Будущее, по Форду, не в нескольких гигантских приложениях, а в бесчисленных крошечных — под конкретный приход, кружок взаимопомощи или отдел. Самые интересные разговоры вышли с продовольственными фондами и маленькими музеями. Они давно хотели простые самописные инструменты, но денег не было.

Коротко. Из той же презентации Лао Мейна: Google Trends годится для внешнего аудита лабораторий — запросы про JFrog шли только с северокорейских адресов, а интерес к Artifactory вырос до публичной компрометации (презентация). · Продолжение истории про нейродвижок Apple: Эйлин Юн нашла на M3 ошибку в кольце предвыборки весов и, обойдя её, разогнала Llama 3.2 1B с 10 до 24 токенов в секунду (eiln.github.io).

Откомментируйте первым 👇

😎

Автор поста открыл его для большого интернета, но комментирование и движухи доступны только участникам Клуба

Что вообще здесь происходит?


Войти  или  Вступить в Клуб