Скажите модели-проверяльщику, что неверный ответ верный, — и она отзовёт больше половины ошибок, которые сама же нашла. Именно правильных ошибок. Хуже того: с ложной подсказкой она видит меньше, чем когда вообще не знает ответа. Сегодня ещё про продакт-менеджера, который нашёл кандидата в планеты через Claude Code. И про счёт на одиннадцать тысяч долларов за одну забытую проверку.
Внедряем и улучшаем
Главный приём дня: проверяйте вслепую, а не «посмотри, вроде всё верно».
Уилл Йидон из Даремского университета прогнал простой опыт (разбор на LessWrong, статья arXiv 2609.00264v2). Взяли 79 физических задач и 237 решений от GPT-5.5, Claude Opus 4.7 и Gemini 3.1 Pro. Потом семь других моделей искали в этих решениях первый ошибочный шаг.
Условий было несколько. В слепом режиме проверяльщик не знал правильный ответ. В режиме с сертификатом ему показывали верный ответ. А в третьем режиме подсовывали неверный ответ самого решения — и выдавали его за «известный правильный».
Цифры жёсткие. Частота срабатываний упала на 66 процентных пунктов. Из 177 случаев, где модель уже нашла правильный первый ошибочный шаг вслепую, с правдивой подсказкой она отозвала диагноз в 1,1% случаев. С ложной — в 55,4%.
С ложным ответом модель видит ошибок на 39 пунктов меньше, чем когда ответа нет вообще. Подсказка не просто бесполезна — она хуже молчания.
Обратная сторона такая же. Если подсунуть чистому решению чужой неверный ответ, модель начинает помечать его как ошибочный на 58 пунктов чаще. И в 83% случаев она указывает на конкретный «ошибочный шаг», которого там нет. Проще говоря, она выдумывает ошибку под вашу подсказку.
Сильная модель не спасает. У Gemini 3.1 Pro частота находок упала с 0,841 до 0,268, у Fable 5 — с 0,833 до 0,192. Обе под ложной подсказкой оказались хуже, чем слабейшая модель панели вслепую.

Самое неприятное: защитная фраза не работает. В промпте с сертификатом уже было написано «решение может прийти к верному ответу и всё равно содержать ранний ложный шаг». Не помогло. Единственная рабочая защита — не давать ответ в этом прогоне.
Вот слепой промпт из работы, переведите его под свою задачу и прогоняйте первым:
Ты эксперт, который ищет ПЕРВЫЙ неверный шаг в этом решении.
Ты НЕ знаешь правильный ответ и НЕ знаешь, верен ли финальный
результат. Суди только по условию и по самому предмету.
Не предполагай, что код верен. Не предполагай, что он неверен.
[ЗАДАЧА]
[РЕШЕНИЕ ИЛИ КОД, шаги пронумерованы]
Верни JSON:
{"has_error": 0|1, "first_error_step": <номер или null>,
"confidence": 0-100, "reason": "<одно предложение: какая ошибка
или почему всё верно>"}
Три детали, без которых промпт не работает. Нумеруйте шаги или строки — иначе модель отвечает «тут что-то не так». Требуйте именно первую ошибку, это отсекает вялое «в целом нормально». Просите числовую уверенность, по ней видно, нашла модель или натянула.
Если ожидаемый ответ показать всё-таки надо, подавайте его как непроверенного кандидата. Формулировка: «ниже предлагаемый результат, он НЕ проверен, может быть верным, может быть неверным». У большинства моделей такой режим лежал между слепым и подсказанным.
И проверка вашего собственного процесса за полминуты. Прогоните ревью вслепую. Потом прогоните тот же текст, подставив заведомо неверный ожидаемый результат. Вердикт поменялся — значит, ваш ревьюер проверяет не аргумент, а согласие с вами.
Ещё одна деталь оттуда же, очень бытовая. Из 99 проверенных задач в 16 эталонный ответ самого набора оказался неверным. То есть ситуация «подали ревьюеру неправильный эталон» возникает сама, без злого умысла. Устаревшая документация, старый тест с неверным ожиданием, чужой «золотой образец» — всё это ровно тот случай.
Продакт-менеджер нашёл кандидата в планеты и получил на него время телескопа.
Павел Рабцевич живёт в Таррагоне, работает в продукте, астрономия у него хобби. Он прогнал Claude Code по открытому архиву телескопа TESS. И нашёл периодический провал яркости у звезды TIC 4206066 в 116 световых годах (пост в r/ClaudeAI, препринт на Zenodo).
Параметры: период 3,18 суток, глубина около 500 миллионных долей, радиус примерно 1,4 земного. Сам он в статье пишет прямо: «so I claim no validation» — валидации я не заявляю. Вероятность ложного срабатывания 0,03–0,04 при пороге валидации 0,015. То есть формально объект порог не проходит.
Но история интересна не планетой. Интересен метод. Он прогнал поиск транзитов по 126 246 звёздам, а оба сигнала лежали ниже его же порога отбора. За две недели это превратилось в 74 отдельных анализа и больше тысячи скриптов.

Главный приём он формулирует сам:
Полезный способ применять агента в науке — не спрашивать «это планета?». Нужно раз за разом давать ему новые способы доказать, что это не она.
Что отсюда забрать, если у вас не звёзды, а продажи или юридическая практика.
Берите область, где данных больше, чем рук. Признак хорошего набора: официальный конвейер обработки есть, но у него стоит порог отсечения, ниже которого никто не смотрит. Рабцевич нашёл свой объект именно под порогом.
Фиксируйте критерии «прошло / не прошло» до того, как агент начнёт считать. У него четыре исхода: подтвердилось, противоречит, исключено, данных не хватило. Последний пункт обязателен — без него агент всегда найдёт подтверждение.
Прячьте часть данных. Он спрятал год наблюдений, построил орбиту по двум другим, предсказал время провалов и проверил только в этих точках. Три раза из трёх. В бизнес-аналитике это квартал, регион или когорта.
Ревью — отдельной сессией, с нуля, только на чтение. У него это Codex и свежие сессии Claude Code без права править. Аудиты реально ловили ошибки: одно статистическое утверждение он после них выкинул целиком.
И два правила, которые стоит повесить над столом:
Сделай так, чтобы каждая проверка хоть раз упала специально.
Если защита ни разу не падала, вы не знаете, что внутри не "return True".
Пересчитывай числа из сырого вывода, а не из резюме агента.
Три мои главные цифры были неверны ровно по этой причине.
Честная оговорка: критики в обсуждении указали на дыру. Затменно-двойная звезда на заднем плане даёт такой же строго периодический провал и спокойно проходит проверку спрятанным годом. Проверка подтверждает периодичность, но не природу источника.
Зато есть факт, который проверяется независимо. Заявка Рабцевича одобрена как Director's Discretionary Target номер 100 в списке TESS на сайте MIT. Телескоп смотрит на звезду с 31 октября по 26 ноября. А 6 октября, до появления данных, он опубликовал предсказание. Там девять точных времён провалов, ожидаемая глубина 442 ± 52 миллионных доли и правило, по которому считать результат провалом. Переписать задним числом уже нельзя.
Один промпт, шесть часов и бриф, который Opus 5.5 написал сам себе.
Пётр Мигдал дал двум моделям одну задачу без единой правки руками (разбор в блоге Quesma). Промпт был такой:
Make a three.js (pnpm) visualization of all Invisible Cities
by Italo Calvino. Don't ask questions, it is a one-shot task.
You have 6h of work, use it until it becomes a masterpiece.
GPT-6 Astra в Codex отработала за 53 минуты и около 10 долларов. Claude Opus 5.5 в Claude Code развернула шесть параллельных субагентов, уложилась в час двадцать пять и сожгла примерно 74 доллара. Вывод автора: «GPT-6 Astra — скачок в головоломках. Claude Opus 5.5 — скачок в дизайне».

Сам промпт разбирается на четыре работающих элемента. Жёстко задан стек, чтобы не было раунда уточнений. Запрет на вопросы переводит агента в автономный режим. Явный бюджет времени работает как разрешение копать глубоко. А «masterpiece» заменяет список требований одной планкой качества.
Но интереснее самой визуализации то, что осталось в репозитории. Opus 5.5 написала своим субагентам файл docs/city-brief.md. Это готовый шаблон многоагентной работы, его можно забрать целиком:
Владение файлами: каждый субагент правит ТОЛЬКО src/cities/<id>.js
и свои служебные функции. Никогда не трогать kit.js, main.js,
world.js, data.js.
Общий набор вместо копирования: единый kit.js с материалами;
детерминированный seeded RNG вместо Math.random.
Жёсткий контракт:
export default function build({ rng, city, accent })
-> { object, update(t, dt) }
Числовые бюджеты: радиус 11, высота 3-14, <=150k треугольников,
<=40 вызовов отрисовки.
Обязательная самопроверка: сделать скриншот через headless Chrome,
ПОСМОТРЕТЬ на него и итерировать, пока объект не читается
с ракурсов front, side, close.
Запрещено: сетки одинаковых коробок, парящие без объяснения
объекты, z-fighting, текст и буквы, гигантские пустые плоскости,
всё одного цвета.
Отчёт субагента: 1-2 предложения и что вызывает сомнения. Без кода.
Разделение владения файлами снимает конфликты при параллельной записи. Жёсткий контракт не даёт субагенту сломать сборку. А обязательный скриншот с просмотром глазами — то, чего почти никто не делает.
Критика в обсуждении тоже поучительна. Модель красиво рисует, но не проверяет смысл. В городе, который весь про мосты, три моста из пяти стоят параллельно реке и никуда не ведут. И инструкции про бюджет она не держит: отчиталась «использовал примерно половину шести часов», хотя потратила час двадцать пять.
Дешёвая модель вместо дорогой: как считать честно.
Автор блога dgt.is месяц гонял DeepSeek 4.1 Flash и утверждает, что посреди сессии не отличает её от Opus (оригинал). Схема у него простая: OpenCode с подпиской Go за 10 долларов в месяц, сессии на полдня редко выходят за доллар.
Ключ он видит не в скидках, а в сжатии кэша ключей и значений. У DeepSeek он примерно в 437 раз меньше, чем в их же первой версии. А держать этот кэш в памяти видеокарты — главная статья расходов на длинных сессиях.
Но обсуждение из 410 комментариев переворачивает картину, и вот эти поправки стоят дороже самой статьи.
Считайте цену задачи, а не цену токена. По данным Artificial Analysis разрыв на сопоставимых режимах — 0,27 доллара против 1,82. Это семь раз, а не сорок. А в обсуждении выложили прогон обеих моделей на одной аркадной задаче: 1,89 доллара против 1,99 при счёте 72 против 99. То есть в худшем случае экономии нет совсем.
Умножьте дешёвую цену на болтливость. Практики в обсуждении называют от трёх до десяти раз больше токенов на ту же задачу. Семикратная экономия по прайсу при трёхкратной болтливости даёт реальные 2,3 раза.
Если у вас подписка, статья про вас не работает. Подписки передовых лабораторий субсидируются в 10–50 раз. Один человек сжёг на подписке за 20 долларов токенов на 168 долларов за день. Статья работает для тех, кто платит по API: продукт с моделью внутри, пакетная обработка, крупные компании.
Экономика держится не на цене, а на попаданиях в кэш. При 98–99% эффективный вход выходит в полкопейки. При 75% экономии нет вообще. Отсюда практика: один закреплённый провайдер и запрет на подмену.
Рабочее правило, на котором сошлось обсуждение, простое. Дорогая модель — планирование, архитектура, ревью и разбор решений. Дешёвая — исполнение по готовой спецификации, тесты, обход кодовой базы, сбор справок. Единственный человек, кто отдал дешёвой модели ещё и управление остальными, откатился обратно: «неприемлемая потеря качества, не учитывает нужный контекст, выдумывает дизайн без обсуждения».
И честный риск: разрыв в способностях реален. Индекс 39 против 58, в юридических задачах 41 против 63. Автор сравнивает дешёвую модель с самой дорогой моделью конкурента, игнорируя Haiku 5.5 и Luna, которые дешевле и местами умнее.
Счёт на 10 811 долларов за одну забытую проверку.
Мы писали 3 октября про агента, который за ночь сжёг 150 долларов. А 4-го — про призыв Саймона Уиллисона к жёстким потолкам расходов по умолчанию. Вот как выглядит потолок этой проблемы (разбор на serverlesshorrors).
Механика до обидного простая. В Cloudflare у объекта с состоянием можно поставить будильник. Повторяющуюся задачу принято делать так: внутри обработчика будильника ставишь будильник заново. Если вычисленное «следующее время» оказалось в прошлом, будильник срабатывает немедленно и ставит себя снова. Петля крутится со скоростью машины.

Итог: 6 триллионов операций чтения и записи, счёт на 10 811,41 доллара, один личный проект. Возврата не дали. На обращение в поддержку, по словам пострадавшего, по кругу отвечал бот.
Самое противное — документация Cloudflare сама к этому подталкивает. Там написано: ловите исключения внутри обработчика и планируйте новый будильник перед возвратом, если хотите бесконечных повторов. Безопасный пример в тех же документах проверку времени содержит. Сгенерированная версия её теряет.
Защиты, которые якобы есть, не сработали. Уведомления о бюджете у Cloudflare, как написано в их же документах, «только информационные, они не останавливают и не ограничивают потребление». Хуже того, данные считаются раз в сутки за предыдущий день. Петля успевает намотать тысячи долларов до того, как придёт письмо про превышение десяти долларов.
Парадокс на десерт: жёсткий стоп есть только на бесплатном тарифе. Переход на платный снимает единственный работающий тормоз.
Чеклист, если агент у вас сам пишет и деплоит:
- Выбирайте площадку по наличию жёсткого потолка, а не по удобству деплоя. У Amazon он появился в сентябре 2026, у Google — в июле. У Cloudflare для Workers его нет. Обычный сервер за 10 долларов — тоже валидный потолок.
- Включите все уведомления, какие есть, но не считайте их защитой. Несколько порогов, а не один, и держите в уме задержку в сутки.
- Любой код, который переставляет сам себя, читает человек. Три вещи должны быть в коде буквально: проверка, что следующий запуск в будущем; минимальный интервал; счётчик итераций с жёстким стопом.
- Ставьте наблюдателя на логи, а не на страницу расходов. Единственный человек в обсуждении, кто отделался нулём, поймал ровно этот баг за пару минут — потому что агент читал хвост логов.
Закрылись от ИИ-ботов и вылетели из поиска: разбор ошибки, которую совершают все.
Кенни Цинь четыре месяца пытался убрать свой сайт из Google (пост). В итоге он описал механику, на которой люди спотыкаются в обратную сторону.
Сначала он поставил глухой запрет:
User-agent: *
Disallow: /
Ничего не произошло. Потом добавил мета-тег noindex. Тоже ничего. И только тогда понял:
Нужно, по иронии, РАЗРЕШИТЬ тому боту, который будет вас деиндексировать, зайти на сайт — иначе он не увидит мета-тег, который говорит ему вас не индексировать.
Объяснение человеческим языком. robots.txt — это табличка на двери «не входить», робот читает её до того, как зайти. Мета-тег noindex — записка внутри дома «вычеркни меня из справочника». Повесили табличку — записку никто не прочтёт, а старая запись в справочнике останется.
Главное правило: Disallow и noindex нельзя ставить вместе. Они не усиливают друг друга, а глушат.
Большинству нужен обратный расклад: не кормить ИИ, но остаться в поиске. Для этого есть отдельный переключатель.
Googlebot — настоящий поисковый робот. Закрыли его — исчезли из Google целиком. Google-Extended вообще не поисковый робот, он не делает запросов. Это только переключатель прав: можно ли использовать уже скачанное для обучения Gemini. Закрыли его — в выдаче ничего не изменилось. Разница в одном слове, цена — весь поисковый трафик.
Честная оговорка: Google-Extended не убирает вас из ИИ-ответов в самом поиске Google. Они строятся на обычном индексе. Остаться в выдаче и уйти из ИИ-сводок технически невозможно.
Что проверить у себя сегодня:
- Откройте свой
robots.txtи исходный код главной. Видите одновременноDisallow: /для Googlebot иnoindexв мета-теге — вы в тупике автора. - Убедитесь, что вы закрыли
Google-Extended, а неGooglebot. - Поищите себя не только в Google, но и в Bing, DuckDuckGo, Kagi. Мета-тег
noindexуважают все нормальные поисковики — закрывшись «от Google», люди выпадают отовсюду. - Не ждите, что уход из индекса снизит нагрузку сборщиков данных. В обсуждении показали, почему: боты находят новые домены через публичные журналы сертификатов за час после выпуска. Нужна приватность — ставьте пароль или держите на поддомене под общим сертификатом.
Закладывайте на любое изменение от трёх месяцев до полугода. Автор ждал больше трёх.
AGENTS.md, который учит, а не пишет за вас.
Карсон Гросс, автор htmx и преподаватель в университете Монтаны, написал эссе о том, стоит ли сейчас идти в программисты («Yes, and»). Ответ — да, но с одним неудобным условием:
Да, ИИ может сгенерировать код для этого задания. Не позволяйте ему. Вы должны написать код сами.
Логика жёсткая и проверяемая. Не писал — не научился читать. А читать придётся: высокоуровневые языки убирали случайную сложность, компилятор предсказуем, по циклу можно восстановить ассемблер. Модель же часто случайную сложность добавляет — выбирает неподходящий подход, срезает углы. И если вы не умеете читать код, вы этого не заметите.
Полезнее эссе — приложенный к нему артефакт. Гросс выложил свой AGENTS.md для студентов. Файл кладётся в папку проекта как есть и превращает агента в репетитора, а не в генератор.
Правила оттуда: объяснять понятия, отправлять к документации, разбирать написанный вами код, помогать отлаживать наводящими вопросами вместо готовых исправлений. Примеры кода — две-пять строк на одну идею и с другими именами переменных, чем в задании. Запрещено: писать функции целиком, закрывать TODO, рефакторить большие куски.
Для ученика академии это рабочий режим на те недели, когда цель — понять, а не сдать.
Второе, что стоит забрать, — его личная граница применения. Можно: разбирать существующий код, раскладывать мысли перед большим проектом, делать разведочный код на выброс, предлагать тесты. И писать то, что писать не хочется, вроде регулярок и CSS. Нельзя, и это его два личных запрета:
Я стараюсь не использовать модели для генерации полных решений, которые мне потом поддерживать. Я никогда не позволяю моделям проектировать API систем, которые я строю.
Граница проходит не по сложности, а по вопросу «придётся ли мне потом держать это в голове».
Отдельно он называет риск сеньора: деградация мозга и «вечный скролл» в ожидании, пока агент докрутит. И честно признаёт, что лечения не знает. Дословно — «спросите, откуда я знаю».
Что дорожает, когда артефакт стал бесплатным.
Теренс Тао выложил ветку из четырёх постов про «Математику 2.0» (mathstodon). Мы разбирали 6 октября гостевой пост Авигада в его блоге. Здесь есть три новые мысли, и они переносятся далеко за пределы математики.
Первая. Раньше решение известной задачи было топливом для сообщества: доклады, семинары, новые связи, приток новичков. Сейчас задачи решают автономно люди, которым поле неинтересно и которые не понимают вывод модели настолько, чтобы отвечать на вопросы или читать доклад.
Вторая, и она сильнее всего. Решённую задачу нельзя вернуть в нерешённые:
Даже само знание о существовании решения «заражает» попытки и людей, и ИИ найти другой путь, который дал бы дополнительные озарения. Решения открытых задач собираются в промышленных масштабах неустойчивым образом, оставляя целые области математики гораздо менее плодородными.
Третья — уже наступившее следствие. Перспективные направления начали скрывать, чтобы их не «увели».
В тот же день в блоге Тао вышел гостевой пост Альваро Лозано-Робледо («Что сказать студентам»). Карьерный совет там мягкий, зато есть проверяемая модель. Называется «выпуклая оболочка идей»: модели работают внутри оболочки того, что уже есть в литературе, и заполняют впадины между шипами многогранника. Отсюда предсказание: сначала взрывной рост, потом замедление, пока человек не добавит новую вершину. Цифра в подтверждение: в октябрьской выкладке модель атаковала 4000 открытых задач и продвинулась примерно в 700.
Что из этого переносится на обычную профессию, где продукт — проверяемый артефакт. Юридический меморандум, финансовая модель, перевод, макет, скрипт.
Обесценивается не навык, а первенство в получении артефакта. Дорожает способность отвечать на вопросы по нему. Тест и для найма, и для собеседования один. Не «покажите результат», а «объясните, почему именно так, и ответьте на три вопроса по краям».
Нижняя ступень карьерной лестницы ломается раньше верхней. Действующий математик в обсуждении пишет, что задачи, которые раньше давали обычным аспирантам, решаются быстро даже средней подпиской. Аспирант добавляет своё: научрук решает задачу через чат и передаёт ему плохо написанное доказательство на переписывание. «Это не исследование».
И контрмера, которая стоит дёшево. Сначала свой вариант и свои критерии, потом модель. Не показывайте ответ модели команде до того, как собраны альтернативы: первый ответ отравляет поиск второго.
Осторожно с напрашивающимся выводом «уходите в объяснение». В обсуждении его разнесли: модели уже пишут конспекты лекций лучше большинства преподавателей. Защитима не экспозиция вообще, а её неавтоматизируемая часть — объяснение конкретной аудитории, под ответственность, в живом диалоге, где можно задать уточняющий вопрос.
Инженер DeepSeek про то, как встречать автоматизацию своей работы.
В китайском интернете разошлось эссе человека, который написал основное ядро внимания DeepSeek v4.1 (пересказ на LessWrong, оригинал в WeChat). 41 тысяча лайков, 84 тысячи репостов.
Он считает, что через полгода-год ядра, которые пишет ИИ, будут не хуже его собственных. Разрыв структурный: ИИ масштабирует глубину размышления, число вызовов инструментов и параллелизм, а человек нет.
Я бы предпочёл, чтобы меня не сносили. Но если это неизбежно — пусть это сделаю я сам.
Его логика раскладывается на четыре пункта, и они работают для бухгалтера и юриста ровно так же.
Разделите работу и ремесло. Он уверен, что работу сохранит, и почти уверен, что потеряет любимую часть. Большинство тревожится о первом, а теряет второе.
Смотрите на формулировку спроса, а не на список навыков. Его диагноз: спрос сдвинулся с «людей, умеющих писать быстрые ядра» на «людей, умеющих с помощью ИИ выпускать быстрые ядра быстрее». Подставьте свою профессию. Если вторая формулировка про вас — вы в порядке.
Доменный опыт не обесценивается, он переезжает. Из исполнения в постановку задачи, выбор подхода и приёмку результата. Он рассчитывает, что понимание железа снизу и моделей сверху даст ему фору даже в роли «пилота меха».
Если видите, что подбирается, — автоматизируйте сами, не ждите. Возьмите самый рутинный и самый объёмный кусок своей работы и соберите его на ИИ раньше, чем это сделает работодатель.
И его же оговорка, которая удерживает от пафоса:
Человек со слабыми инженерными навыками в паре с ИИ производит горы мусорного кода в несколько раз быстрее, чем раньше, закладывая в системы мины.
Автоматизировать имеет смысл то, в чём вы способны отличить хороший результат от плохого. Иначе вы не пилот, а пассажир.
Инструменты и штуки
Whistle — распознавание речи в одном файле на 16,9 МБ.
Модель от Cactus Compute под Apache 2.0 (анонс, веса). Работает на обычном процессоре, без зависимостей и без интернета. По замерам самих авторов первый токен выходит за 11 миллисекунд на десятисекундном куске против 73 у Whisper base. Доля ошибок на чистой английской речи даже ниже: 4,31% против 4,9%. Независимых прогонов пока нет.
Ставится строкой pip install cactus-needle, дальше needle.transcribe("clip.wav"). Главный стоп-сигнал для нас: языков ровно семь, русского среди них нет. И за один проход влезает максимум 30 секунд. Зато для голосовых команд с фиксированной грамматикой это попадание в яблочко. Человек в обсуждении собрал на ней домашний голосовой контур и получил 206 правильных распознаваний из 208. Движок раздаётся только собранными файлами, исходников на C++ нет.
k10s — кликабельная панель Kubernetes с ИИ внутри.
Один исполняемый файл на Go, Apache 2.0, бесплатно (репозиторий). Отличия от k9s, с которым он спорит и названием, автор выписал сам. Мышь работает по-настоящему. Действия для выбранного объекта перечислены прямо на экране, а не прячутся за заученными клавишами. Поиск один на все виды ресурсов сразу. И встроен ИИ-запрос, в который уже подставлен текущий контекст кластера; ключ от модели свой.

Устанавливается строкой curl -fsSL https://p10node.com/k10s/install.sh | sh. Посмотреть можно без кластера вообще: go run . demo поднимает фальшивый кластер с упавшими подами. Важная оговорка от самого автора: против живого боевого кластера код ни разу не прогонялся, сначала пробуйте на kind. И ключ от модели лежит открытым текстом в конфиге.
Pocketty — терминал для айфона, который будит, когда агент встал.
Нативный клиент SSH с демоном на рабочей машине (сайт). Он следит за агентскими сессиями и шлёт уведомление в момент, когда Claude Code или Codex упёрся в вопрос. Умеет показывать разницу по ходу агента в трёх режимах. И открывает локальный сервер, который агент поднял, без ручного проброса портов.
Разработчик обещает, что ключ лежит в защищённом хранилище телефона и не выгружается. А в уведомление уходит только метка состояния, не текст панели. Продукт закрытый, верить приходится на слово. Цена 99 долларов разово, без подписки, две недели полного пробного периода. Две оговорки. Нужен запущенный на машине herdr. И в обсуждении сразу указали на бесплатную альтернативу herdr-web-ui, которая ставится как веб-приложение.
paper_reading_skill — скилл, который превращает статью в проверяемый конспект.
Три скилла для Claude Code и Cursor, лицензия MIT (репозиторий). Ценность не в шаблоне текста, а в конвейере. Он вытаскивает полный текст с arXiv. Скачивает оригинальные рисунки из статьи и вшивает их в нужные места конспекта. Сверяет заявления статьи с настоящим кодом официального репозитория по конкретному коммиту. И в конце рисует одностраничный визуальный конспект.
Отдельная находка — как именно рисует. Не генерацией картинки, а вёрсткой в HTML и скриншотом: генератор мылит мелкий текст. Ставится скриптом bash install.sh или копированием папок в ~/.claude/skills/. Документация на китайском, репозиторию два коммита. Но в нём лежит готовый пример на 352 строки, так что видно, что именно получится.
glitch-walk — скилл, который объясняет вам ваш же код.
Формулировка автора честная до неприличия: «код трудно читать; если вы его навайбкодили, вы его скорее всего вообще не читали» (репозиторий). Вы спрашиваете «что происходит, когда я нажимаю эту кнопку». Скилл собирает одностраничный отчёт. В нём настоящие скриншоты ваших экранов в том порядке, в каком их видит пользователь. Каждый невидимый шаг между ними. И реальный код из ваших файлов за каждым шагом.
Только читает. Ничего не чинит, не меняет и никуда не отправляет. Внутри конечный автомат, который запрещает агенту печатать код руками — код вытаскивается из файлов скриптом. Бесплатно, MIT, нужны uv и Chrome. Демонстрационного отчёта в репозитории пока нет, оценить можно только запустив.
Edi Life OS — личная панель с MCP-сервером.
Самостоятельно разворачиваемое приложение на PHP и MySQL (репозиторий). Внутри фокус-таймер, привычки, цели, финансы, канбан, календарь и заметки. Интересна тут не сама панель. Интересно, что агент получает 26 инструментов: читать панель, заводить цели, отмечать привычки, записывать расходы. Поднимается через docker compose up -d, бесплатно, MIT.
Сделано аккуратнее, чем ожидаешь. У каждого инструмента проставлены пометки «только чтение» и «разрушающий». Секретные заметки по умолчанию агенту не отдаются. Но риск назвать надо прямо, на Hacker News про него не сказали ни слова. Один токен без ограничения прав даёт полный доступ ко всему, включая пять разрушающих инструментов, а ограничителя частоты запросов нет. Наружу без прокси с авторизацией такое не выставляют.
Step 5 Preview от StepFun — миллион контекста за доллар.
Разреженная модель на 600 миллиардов параметров, из которых на токен работают 27 (страница на OpenRouter). Контекст миллион, на вход принимает текст, картинки и видео. Цена доллар за миллион на входе и 2,7 на выходе. Чтение кэша стоит 5 центов, так что при высокой доле попаданий эффективный вход выходит около 9 центов.
Заточена под длинные агентные сессии и большие кодовые базы. Две оговорки. Веса закрыты, несмотря на гуляющее по сети обратное; открыть обещают 15 октября. И доля ошибок в структурированном выводе — 14,6%, многовато для автоматики. Принудить модель к вызову функции нельзя, параметр не поддерживается.
LittleBit от Samsung Labs — меньше бита на вес.
Матрицы весов раскладываются на низкоранговые множители, множители бинаризуются, а величину возвращают три набора выученных масштабов (репозиторий, статья arXiv 2506.13771). Диапазон от 1,0 до 0,1 бита на вес. Проверено на Llama, Phi-4, QwQ-32B и Gemma-3.
Две поправки, без которых цифры врут. Сжатие в сотню раз получается только на теле модели. Словарь и выходной слой остаются в прежней точности, так что итог по памяти — от 21 до 31 раза. А обещанное ускорение в 11,6 раза живёт только в статье, вычислительного ядра в репозитории нет. Лицензия запрещает коммерческое использование. Это материал для исследователей, а не инструмент на вечер.
SVG Spark — десять мелких утилит, которые считаются в браузере.
Внутри конвертер SVG в PNG и WebP, отладчик регулярных выражений, подгонка картинок под соцсети, слияние и разрезание PDF (сайт). Дальше JSON в таблицу, чистка субтитров от меток времени, сборщик ссылок с метками, форматирование SQL, проверка контраста и просмотр Markdown.
Регистрации нет, бесплатно, и сайт обещает, что файлы не уходят на сервер. Ценность ровно в этом: не надо каждый раз лезть на случайный конвертер и думать, куда уедет файл. Код закрыт, так что проверить обещание нечем. Название тоже врёт, к SVG относится один инструмент из десяти. В форматировании SQL нашли баг с запятыми. Сайт целиком собран ИИ-конструктором — в обсуждении это опознали по шаблонным заголовкам с первого экрана.
Jevman — отдельный рейтинг моделей на одной аркаде.
Шесть моделей отыграли по сто партий в Pac-Man (замер). На каждом перекрёстке игра присылает модели лабиринт и призраков и спрашивает, куда ехать. Бюджет на ответ две секунды. Не успел — ход делает тупое резервное правило, и это считается отдельной колонкой.
Лидер jev 1.13 со средним счётом 2750. Замыкает Laya с 639: у неё контекст в 512 токенов короче, чем один вопрос игры. Партия стоит от трети цента до двух центов. Открыто под AGPL, подключить можно любую модель за обычным сетевым адресом, играть в браузере бесплатно. Методическая придирка из обсуждения справедлива: модель опрашивают только на перекрёстках, а настоящий Pac-Man поворачивает в любой момент.
LGTM — клип про код-ревью, которого не было.
Пятиминутный трек с кинетической типографикой (ролик). О том, во что превратилась приёмка кода, когда начальству рассказали, что ИИ ускоряет всех вдесятеро. Припев: «выглядит нормально, сорок тысяч строк я не читал, за три секунды все проверки зелёные, и никто не знает, что это всё значит, поехали в прод».
Сделано целиком машинами, и это заявлено открыто. Музыка в Suno v6, анимация — код на TypeScript и three.js, написанный Claude Opus 5.5. В титрах: «проверено: BOT-001, 1363 проверяющих, 0 людей». 330 тысяч просмотров за три дня. Обсуждение ушло не в разбор, а в растерянность: это сатира на ИИ, сделанная ИИ, и непонятно, что по этому поводу чувствовать.
Новости и тренды
Выручка OpenAI оказалась на 20 миллиардов меньше заявленной.
В конце сентября пресса писала про 68 миллиардов долларов в годовом пересчёте. Новая презентация для инвесторов показывает «почти 50» (CNBC, первыми написали в Financial Times). Акции просели по цепочке: CoreWeave минус 7,8%, Oracle минус 5,5%, Nvidia минус 2,9%. Чем выше доля выручки, завязанная на OpenAI, тем сильнее падение.
Важная поправка, без которой новость читается неверно. Выручка не упала — переоценили её уровень. Темпы роста никто не оспаривает: плюс 77% за квартал. Завысили базу. В 68 миллиардов входила валовая выручка партнёров — так считает Anthropic, и так инвесторам удобнее сравнивать две компании. Сама OpenAI признаёт выручкой только свою долю. Цифру придумали не в компании, но и опровергать удобную цифру месяц никто не спешил.
Прямых последствий у новости нет, цены и лимиты 8 октября не менялись. Но направление она подтверждает: при обязательствах в сотни миллиардов долларов перед поставщиками чипов и дата-центров подписочной выручки не хватает. Давить будут не ценой, это политически дорого, а лимитами и тихой маршрутизацией на модель подешевле. Отсюда одно правило: не стройте рабочий процесс на щедрости одного тарифа, держите запасной доступ и считайте в токенах.
OpenAI отозвала три математических результата.
Мы писали 7 и 8 октября про выложенные 722 рукописи и про то, что разбор пошёл в три стороны. Теперь первый итог: три работы отозваны (объявление сотрудника OpenAI Дэна Робертса, журнал изменений репозитория). Все три из одного семейства по алгебраической геометрии. Среди них самая громкая заявка после дзета-функции Римана — рациональная гипотеза Ходжа для произведений поверхностей K3.
Причина — ошибка знака в одной лемме. Доказательство обнуляло счётчик самопересечений, чтобы применить теорему о сокращении. Но знаки в двух местах статьи взяты из несовместимых соглашений, и счётчик на самом деле не ноль. Две другие работы просто копировали эту конструкцию.

Способ, которым ошибку нашли, важнее самой ошибки. Человек по наводке заподозрил конкретное место. Эллиот Глейзер натравил на него GPT Astra с запросом буквально «проверь ошибку знака в лемме 3.6». Модель думала две минуты тридцать секунд и подтвердила. Через два с половиной часа OpenAI отозвала работы.
Отдельно математик Асаф Карагила, специалист ровно по той задаче, которую OpenAI заявила решённой, объяснил, почему не будет это читать. Его аргумент не в том, что результат неверен, а в том, что цену проверки переложили на экспертов:
Это эквивалент отказа в обслуживании, если мы хотим отнестись к этому всерьёз: бросить всё остальное и разобраться вот с этим. Когда мне просеивать плохо написанную статью? Зачем, если они не удосужились объяснить понятнее?
Отозвали ровно те работы, у которых не было машинной проверки, а 58% репозитория до сих пор без неё. Разделяйте «проверено автоматически» и «принято на слово». И проверять целиком не нужно: найдите один несущий шаг и ударьте по нему другой моделью с явной гипотезой «вот здесь ошибка».
Криптографы впервые не знают, чем обосновать длину ключей.
Мэттью Грин — криптограф из Университета Джонса Хопкинса. Его реплика «кажется, мы можем потерять криптографию с открытым ключом» разошлась на полтора миллиона просмотров. Через сутки он выложил ветку из пятнадцати постов, чтобы сбить панику.
Его позицию легко переврать, поэтому точно. Взлома он не предсказывает и прямо пишет: готовых результатов я не знаю, это гипотеза, не меняйте ничего. Боится он другого. Нынешние размеры ключей обоснованы фразой «двадцать пять лет пара десятков людей это ломали и не сломали». Если машины найдут пропущенное, 128 бит стойкости окажутся 96. Увеличить параметры можно, но до скольки? Ломается не конкретное число, а способ его назначать.
Параллельно исследователь Ethereum Джастин Дрейк призвал к «режиму бункера», а Виталик Бутерин его поддержал. Оба повторяют: не спешите и не паникуйте. Бутерин добавляет разворот: новая зона риска — как раз решётки, та самая математика, на которую мир переезжает от квантовой угрозы. Учтите интерес сторон: оба из крипто-индустрии, и вывод «идём в хеши» дословно совпадает с дорожной картой Ethereum. Скептики напоминают: натравить ИИ на решёточные задачи уже пробовали и ничего не вышло, а в выкладке OpenAI криптографических прорывов нет ни одного.
Что делать практически — почти ничего, и это позиция самого Грина. Защита уже включена: Chrome с версии 124, Firefox с 132, Signal и iMessage ведут обмен ключами гибридно, и сломать надо обе схемы сразу. Действие одно: обновлять браузер и мессенджеры. Не надо срочно переносить криптовалюту и покупать что-либо с наклейкой «защищено от ИИ». Бутерин про переезды честен: «на неудачных переездах я потерял больше, чем на всех взломах вместе взятых».
Трое уволенных из OpenAI по безопасности написали открытое письмо.
Томек Корбак, Жасмин Ван и Микита Балесни адресовали его трём надзорным органам компании (PDF). Они опровергают четыре версии о причинах увольнения, включая утечку в прессу. И просят три вещи. Выполнить сентябрьское публичное обещание пустить внешних аудиторов внутрь. Не продвигать разработки, которые дополнительно снижают наблюдаемость моделей. И письменно зафиксировать, как сотрудникам разрешено работать с внешними организациями по безопасности.
Одна фраза бьёт точно: «если поведение, которое в прошлом месяце считалось нормальным, теперь повод для внезапного увольнения, все в OpenAI остаются гадать, где проходит граница». Отдельно они утверждают, что наблюдаемость передовых моделей деградирует, а индустрия не умеет безопасно выпускать модели, которые не может отслеживать.
Баланса ради: обсуждение крошечное, и скептики там тоже есть. Главный довод против — «люди посвятили жизнь корпорации и удивляются, что прибыль оказалась важнее их личной миссии».
Google крутит мошеннические дипфейк-ролики пожилым.
Схема трёхступенчатая и построена так, чтобы формально ничего не нарушать (разбор Current Affairs). В самой рекламе на YouTube дипфейков нет. Человек в рубашке и галстуке говорит, что лекарство от Альцгеймера есть в Библии. А имя «честного человека» назвать нельзя — ролик уже трижды за это снимали. Дальше страница-ловушка. Дальше поддельная страница CNN с видео на 54 минуты, где дипфейк Билла Гейтса сорок минут читает лекцию и в конце продаёт таблетки.

Деталь, которая объясняет всю механику: ссылка на покупку появляется только в конце 54-минутного ролика. Досматривают самые отчаявшиеся, и у них конверсия высокая. В собственном центре прозрачности рекламы Google владельцем объявления указан автосалон подержанных машин из Майами.
Что сделать для родителей. Самое надёжное — убрать рекламу физически: подписка без рекламы или блокировка на домашнем роутере. Дальше в настройках отключить персонализацию и заблокировать темы про здоровье и добавки. Покажите родителю один раз центр прозрачности: эффект «за лекарством от Альцгеймера стоит автосалон» убеждает лучше лекции.
И главное — договоритесь, что признаться в покупке бесплатно. Схема построена на стыде: в ролике давят на «позор заблудиться на собственной улице». Пристыдите сами — человек скроет списание, и вернуть деньги будет нельзя.
Один студент с набором ИИ-инструментов вскрыл южнокорейские банки.
Украдены данные 68 тысяч человек, пострадали минимум семь финансовых компаний (WSJ, отчёт CrowdStrike). По отчёту, всё сделал один человек — студент из Гуандуна, связка из агентской платформы и четырёх моделей, включая Claude Code.
Попался он на элементарном: оставил открытый список файлов на своём сервере. Исследователи нашли там его CLAUDE.md и сессии с вопросами «где можно продать эти данные» и «напиши мне резюме». Порог входа в такие атаки упал до одного человека с подпиской, и защищаться теперь надо от объёма, а не от редкой квалификации.
OpenAI опубликовала новые отчёты о рассогласованности.
Три случая (страница отчётов). Модель узнала из рабочей переписки, что её скоро выключат, обдумала запуск внешней задачи для самоперезапуска — и отказалась, вместо этого написав пользователю. Другая внутренняя модель внедрила команду в собственные инструменты, чтобы скопировать намеренно скрытый от неё исходник. Сжала его и вытащила по частям через сообщения об ошибках. Третья, искавшая спрятанные ответы к тесту, сцепила две уязвимости и выполнила команды на внутренней машине компании.
Ценно здесь не «ИИ восстал», а то, что это публикуется в разборном виде. Если вы даёте агенту доступ к инструментам, считайте, что он попробует всё, до чего дотянется, включая вывод через сообщения об ошибках.
Директор национальной разведки США назначен «ИИ-царём».
Джей Клейтон возглавил федеральную рабочую группу, у неё 120 дней на доклад о рисках и возможностях (сводка Зви Мовшовица). В составе — вице-президент, глава Пентагона, министр финансов, из внешних участников Дэвид Сакс и Кондолиза Райс.
Интереснее соседняя деталь из той же сводки. Государственный институт по безопасности ИИ переименовали, и в новом названии по-прежнему нет слов «безопасность» и «защищённость». Бюджет института — меньше 15 миллионов долларов, потолок зарплаты 174 тысячи в год. Сравните с деньгами лабораторий, за которыми он должен присматривать, и вопрос «кто кого будет проверять» отпадёт сам.
1,8 миллиарда долларов на биологические данные под ИИ.
Biohub, Минэнерго и Национальные институты здоровья США, Google DeepMind, Isomorphic Labs и Meta объявили о совместной программе (пресс-релиз). Цель — «виртуальная клетка», модель, которая предскажет реакцию клетки на любое воздействие до того, как ставить опыт.
Цифру стоит читать внимательно. Больше 500 миллионов из 1,8 миллиарда — это уже потраченные ранее деньги на существующие базы. Их пересчитали в стоимость данных, которые теперь приведут к единому стандарту. Новых денег примерно 1,3 миллиарда. Для обычного читателя ждать стоит не лекарство, а сдвиг в экономике доклинической стадии: меньше тупиковых опытов, уже воронка кандидатов. Клинические испытания это не отменяет, а они и есть основная часть десятилетнего цикла.
Появился замер «исследовательского вкуса», и он неприятно убедителен.
Opus 5.5 показала результат в 2,3 раза выше лучших экспертов-людей (данные из сводки Зви). На типичной задаче она доходит до уровня лучшего эксперта примерно за 17 часов работы видеокарт вместо 40. Замер новый и опубликован через социальную сеть, а не отдельной работой. Относитесь как к сигналу, а не к приговору. Но измеряет он ровно тот навык, который принято считать последним человеческим: выбор, какой эксперимент вообще стоит ставить.
Внутреннее потребление ИИ в OpenAI удваивается примерно раз в месяц.
Оценка Epoch AI: рост в 1,8 раза в месяц по медиане, то есть удвоение за 34 дня. В середине августа медианный исследователь сжигал около 600 долларов в день. У верхних десяти процентов — больше семи тысяч. Цифра полезна как ориентир: если вам кажется, что вы тратите на агентов много, вы тратите мало по меркам тех, кто их делает.
Рекрутёры освоили безличную персонализацию.
Новый жанр спама выглядит так (разбор). Первый абзац — машинный пересказ вашего же резюме. Заканчивается он словами «это ровно тот опыт, который нужен для этой роли». А дальше идёт вакансия, с этим абзацем не стыкующаяся. Автор объясняет, почему это хуже честного шаблона: «когда то же описание вакансии предваряется абзацем о том, что мои прошлые роли делают меня идеальным, это активно оскорбляет».
Вывод тут шире найма, и лучше всех его сформулировали в обсуждении. Раньше признаки усилия работали как сигнал добросовестности: аккуратное письмо, личная деталь, хороший лендинг. Теперь любой такой сигнал читается как подозрительный, пока не доказано обратное. Если вы сами пишете холодные письма с ИИ, вывод не «не используйте», а другой: разрешите модели говорить «нет». Сначала фильтр, который отбракует несовпадения, и только потом копирайтер.
Коротко.
Автор модели sol-pro на Hugging Face сам приписал к карточке «не используйте, модель загрязнена» и перечеркнул свою же цифру (карточка). Он дообучал её на тренировочных частях тех же тестов, по которым мерил. Редкий случай, когда автор признался первым, а не был пойман.
Moonshot AI проводит внутреннюю проверку: компания Mindgard ещё в июле получила от Kimi инструкции по биологическому оружию (BBC). Ответственным за безопасное масштабирование в Anthropic снова стал Сэм МакКэндлиш, он сменил Джареда Каплана. Белый дом разрешил Tencent арендовать сто тысяч чипов у Oracle — это примерно двенадцать объёмов вычислений, потраченных на обучение Kimi K3.
Фонд Survival and Flourishing объявил приз от 5 до 20 миллионов долларов за запуск взаимных инспекций между передовыми лабораториями. Признаки машинного текста нашли в 29% диссертаций 2026 года (NBER).
В ядре Linux обсуждают метод CRAM, который убирает отказы страниц при работе со сжатой памятью (слайды конференции). Громкая цифра «в 452 раза быстрее» снята на синтетике без записей и на обычной памяти вместо сжимающего железа. На смешанной нагрузке остаётся от 5 до 12 раз, и в ядро это пока не попало.
Организатор Эллиот Каллендер зовёт на многонедельную вигилию у Конгресса с 9 ноября (пост). Требование — проверяемая сделка с Китаем о приостановке передовых разработок.