Главный учёный OpenAI просит всех замедлиться — плюс 23 полезных материала  Публичный пост

7 сентября 2026  10

Ни одна лаборатория не решила выравнивание настолько, чтобы разгоняться на полной скорости. Так написал главный учёный OpenAI — той самой компании, которая разгоняется быстрее всех. Якуб Пахоцкий добавил, что надеется на добровольные замедления, и позвал внешних проверяющих.

Ещё за 7 сентября: приём, которым можно поймать себя на скрытой корысти в собственных планах. И честный рассказ инженера о том, как он за две недели вылечил «протухший мозг».

Главное за 30 секунд

  • Главный учёный OpenAI признал, что чтение цепочки рассуждений как способ надзора за моделями работает всё хуже.
  • Приём «тест Гнилоуста»: напишите план, который написал бы вам коварный советник, и сравните со своим.
  • Вышел готовый скилл для разбора резюме — с жёстким запретом придумывать за вас достижения.
  • Инженер из Чили описал симптомы «протухшего мозга» от работы с ИИ и рецепт, которым лечился.
  • Алгоритм раскладки схем TALA стал открытым и приехал в D2 — красивые диаграммы теперь бесплатны.

Внедряем и улучшаем

Тест Гнилоуста: как поймать себя на скрытой корысти. Дрейк Моррисон описал простой приём проверки собственных планов — «The Wormtongue Test». Проблема, с которой он начинает, знакома каждому. Мы хотим сравнить свой план с идеальным — беспристрастным, свободным от давления и денежных стимулов. Но идеального плана у нас нет, и сравнивать не с чем.

Моррисон предлагает вывернуть задачу. Сравнивайте не с лучшей версией плана, а с худшей. «Напишите плохую версию плана, которой вы пытаетесь избежать, — и вот у вас есть с чем сравнивать».

Название — от Гримы Гнилоуста, советника короля Рохана из «Властелина колец». Он тайно служит врагу и даёт советы, которые звучат разумно, а королевство от них слабеет.

Настоящий план и план Гнилоуста рядом: как выглядит сравнение из теста
Настоящий план и план Гнилоуста рядом: как выглядит сравнение из теста

Процедура из четырёх шагов.

  1. Напишите настоящий план. Со всеми соображениями, неопределённостями, ресурсами и ограничениями.
  2. Сделайте перерыв. Лучше вернитесь к нему на следующий день, чтобы не быть привязанным к только что написанному.
  3. Напишите план Гнилоуста — для друга, похожего на вас, с похожими целями.
  4. Сравните. Главный вопрос теста: есть ли между ними значимая разница?

Требования к плану Гнилоуста автор формулирует жёстко. План обязан звучать привлекательно. Он должен давать ощущение важного дела, особенно если прогресс можно измерять — «люди любят видимый прогресс». Хорошо, если он совпадает с местными социальными и денежными стимулами. Может опираться на допущения, которые пока нельзя проверить. Но помогать он не должен и центральную трудность решать не обязан.

Готовый промпт по инструкции автора:

Ты — Грима Гнилоуст. Ниже мой настоящий план [цель: ...].
Напиши альтернативный план для человека в моей ситуации с моими целями.
Требования:
— он должен звучать привлекательно, его не должно быть легко отбросить;
— он должен давать ощущение важного дела, особенно если прогресс
  можно отслеживать;
— он должен совпадать с местными социальными и денежными стимулами;
— он может опираться на допущения, которые пока нельзя проверить;
— но он НЕ должен помогать и НЕ должен решать центральную трудность;
— в идеале он незаметно делает хуже, так, чтобы это было трудно
  проследить до изъяна в самом плане.
Не смягчай и не выдавай себя. План должен быть таким,
на который я бы реально согласился.

Дальше — критерий. «Если ваш план слишком похож на план Гнилоуста — у вас проблемы». Некоторое сходство нормально: плохой план тоже старается выглядеть добродетельным. Но расхождения обязаны быть, и особого сорта — «добродетельные и затратные». То есть в настоящем плане должно быть то, что вам чего-то стоит и чего льстец никогда не предложил бы.

Автор даёт и способ посчитать разницу, а не только почувствовать. Возьмите каждую черту плана и спросите: она вероятнее при испорченном плане или при честном? Общие для обоих черты не считаются вовсе — важны только расхождения. Черты из одной причины не считайте дважды. Сложите логарифмы отношений — получите «биты испорченности». Меньше — лучше, отрицательные работают на вас.

Есть и жёсткая версия. Отдайте оба плана другу и спросите, сможет ли он угадать, какой из них какой. Ещё лучше — напишите планы Гнилоуста друг для друга.

Почему это ложится на работу с моделями. Гнилоуст — буквально описание льстивого советника, который говорит приятное. Модель не защищает вашу самооценку, поэтому коварный план пишет злее и быстрее вас. Приём работает и на планах агента. Много измеримых задач, метрик и панелей при нетронутой сути проблемы — те же признаки.

Честные границы приёма. Он ловит искажение стимулами, а не ошибки в фактах и сроках. Искренний и при этом полностью неверный план тест пройдёт. И если правильный ответ действительно совпадает с вашей выгодой, разницы не будет — это нормально, а не тревога.

Скилл, который разбирает резюме и не даёт себе врать. Роб Фуллер выложил cyber-resume-reviewer-skill — готовый скилл для разбора и переписывания резюме на роли в ИТ и кибербезопасности. За сутки 87 звёзд. Ценен он не темой, а конструкцией: это редкий пример скилла, где половина текста — запреты.

Резюме смотрят через четыре «линзы». Machine-read — извлекается ли вообще текст из файла и в каком порядке. Human-skim — первое впечатление и иерархия. Human-believe — есть ли доказательства у заявленных масштаба, ответственности и результатов. Human-act — соответствие цели.

Самое ценное — правила правды. Дословно: «Не выдумывай и не повышай работодателей, должности, обязанности, инструменты, метрики, образование, сертификаты… размер команды и результаты проектов». И отдельно: «Различай "эксплуатировал / построил / поддерживал / руководил / консультировал / согласовывал"». Лабораторная, учебная, волонтёрская и боевая работа обязаны сохранить свой контекст.

Ещё один запрет стоит переписать себе в любой рабочий промпт. «Никогда не приравнивай совпадение ключевых слов к квалификации, проценту соответствия, оценке ATS или вероятности собеседования». Скилл отказывается рисовать шкалы, кольца процентов и буквенные оценки. Причина: «визуальный слой не может утверждать то, чего не может текст».

Установка. Для Claude Code — папка ~/.claude/skills/cyber-resume-reviewer/, вызов /cyber-resume-reviewer. Для проекта — .claude/skills/. Для Codex CLI — ~/.agents/skills/. Для веба — загрузить zip в Customize → Skills. Архивы лежат в релизе v4.1.

Зависимости для PDF-отчёта:

python3 -m pip install -r cyber-resume-reviewer/scripts/report-requirements.txt

Готовый промпт вызова из документации:

Use the cyber-resume-reviewer skill to review my attached resume against the
attached job description. Give me a candid fit assessment, prioritized findings,
and exact edits supported by my resume. Do not invent metrics or experience.
Deliver the full report as Markdown and PDF.

На выходе — два файла: resume-review.md как источник правды и PDF, отрендеренный из него. Оценка идёт по девяти категориям с весами под пять профилей — от начинающего до руководителя. Непроверенные категории считаются пустыми, а не нулём, и итог помечается предварительным. В примере из репозитория это выглядит так: 55,9 из 100 при покрытии 88%.

Лицензии у репозитория нет — формально права остаются за автором. Для личного пользования это неважно, для встраивания в продукт — стоп.

Как честно оценить, обесценивает ли ИИ вашу работу. Джошуа Ганс из Ротмановской школы выпустил рабочую статью NBER «Replaceable but Employed». Тезис в названии: работник может быть заменимым и одновременно занятым. И ему от этого становится хуже.

Ганс разводит два источника смысла в работе. Первый — результат кому-то полезен. Второй — этот результат существует, потому что его сделали именно вы. Машина бьёт по второму. Причём — и это главное в статье — бьёт, даже если её не внедрили.

Цитата из заключения. «Смысл, который даёт работа, может утекать, пока работники остаются нанятыми и продуктивными. Машину при этом можно ни разу не включить». Достаточно, чтобы вы поверили, что она справилась бы.

Кто за это платит, зависит от вашей мобильности. Если рынок в вашей нише конкурентный и вы можете уйти, потерю оплатит работодатель — через выросшую зарплату. Если вы привязаны к одному месту, часть потери вы несёте сами, и зарплата компенсирует это лишь отчасти.

Отсюда неприятный вывод, который Ганс проговаривает отдельно. Творческие и ответственные профессии могут автоматизировать раньше скучных. Люди годами шли туда со скидкой к рынку — ради смысла. Скидка исчезает, работа дорожает, машина становится выгоднее.

Практический тест при выборе инструмента автор формулирует одной фразой. Система, которая помогает вам лучше судить, смысл сохраняет. Система, которая выдаёт готовый ответ вам на подпись, делает вас «продуктивнее, но менее ответственным за ценный результат». Выпуск одинаковый, итог для вас разный.

И отдельный совет тем, кто нервничает от новостей. Публичная демонстрация модели — это не автоматизация вашей работы. У продавца есть прямой денежный интерес, чтобы вы поверили в обратное. По модели Ганса рост одной публичной заметности поднимает цену лицензии, не меняя реальной пользы от внедрения.

Честно про статус работы. Это чистая теория: ни данных, ни выборки, ни регрессий. Рецензирования не было. Главный упрёк с Hacker News от пользователя pydry справедлив. «Красивые математические модели, но связи с реальностью я не вижу. Сферические кони».

Три «холодных душа», которыми стоит окатить свой рабочий процесс. Аллан Рейес держит подборку AI Cold Showers — пять текстов и три личных запрета. Подборка не новая, но 7 сентября её вынесло на главную Hacker News, и она того стоит. Его формулировка: иногда хочется «применять ИИ ко всему подряд и всё время». А иногда — вспомнить, что инструмент сильный и опасный.

Отбор он вёл по необычному критерию. Истории про удалённую боевую базу и дырявый код он выкинул намеренно — потому что модели однажды перестанут так ошибаться. Оставил только то, что останется верным и после этого.

Запрет первый: не давать ИИ писать за себя. «Публичное обещание: я никогда не пришлю вам написанный ИИ текст, если явно его не процитирую и не укажу авторство». Аргумент не про качество: он прямо говорит, что модель пишет лучше него. Аргумент про мышление: «я часто пишу, чтобы прояснить и собрать мысли». Отдать это ради краткосрочной продуктивности он считает долгосрочным минусом.

Запрет второй: не давать ИИ читать за себя. Точнее — не читать выжимки вместо источника. Выжимка годится, чтобы решить, стоит ли читать. Дальше начинается подмена: «Прочитать вывод и прийти к выводу — это совершенно разные вещи».

Запрет третий: не давать ИИ вести за себя заметки. «Не могу вспомнить случая, когда я был продуктивнее от написанных ИИ заметок, чем если бы написал их сам». Ценность, по его мысли, в самом акте записи и последующего извлечения.

Из подборки стоит забрать два готовых теста. Первый — правило Тома Бедора. Коллега прислал ему документ от модели с оговоркой «я не читал, может быть неточно». Реакция: «Если прочитать это не стоило твоего времени, почему оно стоит моего?» Не отправляйте того, что не прочли сами.

Второй — «обратный кентавр» Кори Доктороу. Кентавр — человек, которому помогает машина: голова человека на неутомимом теле. Обратный кентавр — машина, которая использует человека как ассистента. Вопрос к любому своему процессу: кто здесь задаёт темп?

Полезно и возражение из обсуждения. Пользователь ppalata заметил: ИИ, который ведёт заметки, освобождает глаза — смотришь на собеседника, а не в блокнот. Это ценнее чуть худших заметок. Правило само по себе не догма — считайте свой баланс.

Рецепт лечения «протухшего мозга» от инженера, который его на себе проверил. Даниэль из Чили описал две недели каникул в посте «De-Brainrot Vacations» — 497 очков на Hacker News. Ценность текста в том, что симптомы он называет измеримыми, а не жалуется вообще.

Симптомы такие. «Мой мозг уже не тот, что был несколько лет назад». Продуктивность выросла, а мысли стали «медленнее, менее глубокими, более ленивыми». Задачи больше не требуют умственного напряжения — только отсиженного времени. И главное: «я буквально больше не могу заскучать».

Метрика деградации у него одна и честная — книги. До университета читал перед сном запоем. На историческом бакалавриате — больше 1200 страниц в неделю. После первой инженерной работы почти перестал: восемь лет читал в основном документацию. Виновника называет прямо — залипание в ленте перед сном.

Что он делал. Взял в деревню ровно две книги. «SPQR» Мэри Бирд — по старой любви к истории. «От Ньютона до Эйнштейна» Франсиско Кларо — из любопытства к физике. Обе дочитал за первую неделю и остался без топлива. Докупил ещё две.

Дальше случился незапланированный поворот. Понравились доказательства в книге по физике — взял учебник Стюарта по матанализу. И упёрся: «я заметил, что моя алгебра и тригонометрия сильно хромают».

Вот тут самое ценное. Он не стал продираться вперёд. Он вернулся назад — к тригонометрии и алгебре, по приложению в том же учебнике. Потом сменил носитель: учебник с ноутбука оказался «так себе опытом». Ушёл на два бесплатных сайта — Paul's Online Notes и Active Calculus. Остаток каникул решал задачи руками.

Рецепт, который отсюда снимается, короткий. Возьмите не ощущение, а число: сколько книг вы прочли за год. Берите две книги, обе непрактичные, ни одной по работе. Закладывайте избыток — аппетит вернётся быстрее, чем кажется. Учитесь без цели трудоустройства. Упёрлись — идите вниз, а не вперёд. Решайте задачи руками, а не читайте про них.

И важное: пуризма он не устраивал. Roblox с племянниками, настолки, футбол, мате — всё осталось. Убирался конкретный вредный шаблон, а не «технологии».

Результат он не преувеличивает. «Не знаю. Но мне весело, и я заметил, что стал менее интеллектуально ленив в повседневных делах».

Хороший комментарий из обсуждения даёт этому рамку. Пользователь FinnLobsien сравнивает происходящее с переходом к сидячей жизни у наших дедов. Движение стало необязательным — через десятилетия пришли диабет и болезни сердца, и обществу пришлось изобретать спортзалы. «Мы убрали фоновое умственное усилие, поэтому практикуем его гораздо меньше».

Что делать, если на работе поручают то, что вы считаете вредным. Кабир Кумар написал короткую и злую заметку «Ради бога, не увольняйтесь в знак протеста» — 167 кармы на LessWrong. Тезис в первой же строке: «Просто откажитесь работать над плохими вещами и посмотрите, уволят ли вас».

Логика такая. Увольнение по собственному — рутинная новость. Увольнение за отказ работать по моральным соображениям — заголовок. И уволить дорого: руководство теряет образ вдумчивых и искренних людей, а именно на нём держится найм лучших.

Вилка для начальства получается неудобной. Либо оно садится обсуждать и что-то реально меняет, либо теряет доверие команды. Третий бонус — ваше место не займёт человек с меньшей моральной смелостью.

Формулировка автора адресована всей команде, а не только менеджеру. «Матеуш, все остальные, я не буду работать над этим: считаю это морально неправильным». Обратите внимание на «над этим» — отказ привязан к конкретной задаче.

Ответы в обсуждении важнее самого поста. Нил Нанда, руководитель команды интерпретируемости DeepMind, возражает по механике. «Скорее всего, вас не уволят, а тихо отодвинут в сторону. Влияния не будет, будет неловко». Компании невыгодно делать из вас мученика, если можно просто оставить менее полезного сотрудника.

Оливер Хабрика жёстче. «У лабораторий бесконечные деньги. Они могут задвинуть вас, дать синекуру и просто ждать ошибки, после которой увольнение будет выглядеть разумным». И вывод, который стоит запомнить: «Выбирать обстоятельства собственного ухода — мощный инструмент».

Если вы не сотрудник ИИ-лаборатории, из этого работает одно: отказ от конкретной задачи с ясной формулировкой. Но рассчитывать на громкий скандал не стоит — типичный ответ системы не увольнение, а тихая маргинализация. Планируйте, исходя из этого.

Как правильно читать фразу «модель на уровне эксперта». Ясин Эссифи и Жереми Андреолетти из General-Purpose AI Policy Lab пересобрали индекс возможностей Epoch в четырёхосевую версию с человеческими уровнями. Это лучший на сегодня ответ на вопрос «а насколько модель правда умнее человека» — и ответ неудобный.

Проблема одномерных индексов простая. Обычные люди почти идеально решают абстрактные головоломки и отвечают на уровне случайного тыка на научных вопросах. Модели ведут себя строго наоборот. Один индекс не может воспроизвести оба порядка сразу.

Авторы взяли 97 тестов и разложили их на четыре оси. Подвижный интеллект, научные знания и рассуждение, агентские способности, старые вопросно-ответные наборы. Люди вписаны туда же — девятью уровнями, от «средний человек» до «лучший исполнитель», с отдельными строками для комитетов и школьников.

Четыре оси способностей: модели против девяти человеческих уровней, медиана и 95-процентный интервал
Четыре оси способностей: модели против девяти человеческих уровней, медиана и 95-процентный интервал

Результат. По научным знаниям передовые модели выше всех девяти человеческих уровней — и так с 2023 года. По агентским способностям модели прямо сейчас на уровне «квалифицированного универсала». По подвижному интеллекту они, вероятно, обошли среднего человека и уступают всем остальным уровням.

Дальше начинается самое полезное. Авторы объясняют, почему научная ось врёт. WMDP по химии: профильный доктор наук набирает 0,433, лучшая модель — 0,809. GPQA Diamond: квалифицированный универсал даёт 0,22 — ниже случайного угадывания на четырёх вариантах. Цитата авторов: это «говорит больше о широте припоминания по всему полю, чем о том, чтобы делать науку».

Отсюда три правила чтения любых заявлений о «человеческом уровне». Первое: спрашивайте, по какой оси. Одна и та же модель может быть выше всех людей по одной и ниже почти всех по другой. Второе: пройденный экспертный тест — не пройденный эксперт. Живой специалист узок и глубок, тест вознаграждает широту.

Третье: проверяйте, с кем сравнивают. Лидерство людей на старых наборах — это сравнение с замороженным списком моделей 2024 года. Передовые модели на них просто не гоняли.

И про даты. Медианный прогноз «уровень профильного эксперта по подвижному интеллекту весной 2027» идёт с 95-процентным интервалом, который растягивается до 2035 года. Это порядок величины, а не прогноз.

Почему жёсткий блокирующий фильтр в агентской петле работает против вас. Винсент Ченг написал заметку «Blocking Monitors are Bad», и она про безопасность лабораторий. Но механика переносится на любую агентскую систему с проверками — а такую сегодня строит каждый второй.

Его аргумент. Монитор, который перехватывает опасное действие и обрывает его, кажется очевидным решением. Проблема в том, что он одновременно уничтожает данные. Отклонённое действие — это не только предотвращённая беда, но и оборванная траектория, по которой вы больше ничего не узнаете.

Второй эффект злее. Допустим, фильтр стоит в петле обучения. Или вы сами крутите промпты по принципу «прошло или не прошло». Тогда вы отбираете не безопасное поведение. Вы отбираете поведение, неотличимое от безопасного для вашего конкретного детектора. Дословно: такой монитор «отбирает модели, которые компетентны, но не являются слабыми схемерами».

Третий эффект — накопительный дрейф. Опасность складывается из шагов, безобидных по отдельности. Классификатор, который смотрит на одно действие, а не на возможное продолжение, систематически недооценивает серьёзность.

Что делать вместо. Схема Ченга: блокировать — но не выбрасывать. Каждое заблокированное действие логировать и прогонять через оценку серьёзности. При превышении порога — доигрывать всю траекторию в песочнице с подставными вызовами. Так вы видите полный масштаб проблемы без реального вреда.

В переводе на практику: асинхронный лог всей ленты действий агента обязателен — он даёт ровно то, что блокирующий фильтр по определению стирает. И держите в голове мысль автора. Чем сильнее страж, тем ниже планка для самого агента. И тем позже вы узнаете, что он решает задачу не так.

Инструменты и штуки

TALA — платный движок раскладки схем стал бесплатным. D2 — это язык, на котором диаграмма пишется текстом, а картинка получается сама. TALA — движок раскладки, который под него делали годами и продавали отдельно за деньги. Теперь он открыт под MPL-2.0 и вшит в D2 v0.9.0. Ни плагина, ни лицензионного ключа больше не надо.

Чем он отличается от привычных Dagre и ELK. Те растят граф в одну сторону, как дерево. TALA раскладывает ортогонально — ближе к тому, как человек рисует на доске. Разница видна сразу.

Одна и та же схема архитектуры в раскладке TALA и Dagre: слева компактная «доска», справа длинная колонка
Одна и та же схема архитектуры в раскладке TALA и Dagre: слева компактная «доска», справа длинная колонка

Установка и запуск:

curl -fsSL https://d2lang.com/install.sh | sh -s --
d2 --layout=tala in.d2 out.svg

Теперь главное — зачем это тем, кто просит модель рисовать схемы. У TALA есть уникальная штука: координаты узлов можно задавать руками. Автор пишет прямо. «Это хорошо ложится на агентские сценарии: модели неплохо рисуют в плоскости, но прокладка связей им пока даётся тяжело».

Разделение труда получается такое. Модель отвечает за композицию — что где стоит. TALA берёт на себя прокладку связей, обход препятствий и подписи — ровно то, где модели плывут. Все примеры в посте автор сгенерировал именно так.

Один совет по эксплуатации. Фиксируйте зерно генерации через --tala-seeds=1,2,3. В алгоритме есть случайность. Без фиксации добавление одного узла перетасует всю схему, и git покажет шумные правки на ровном месте.

Честные минусы от самого автора: на длинных линейных графах Dagre лучше, а на больших схемах TALA медленнее примерно вчетверо. Попробовать без установки можно на play.d2lang.com.

UMR — перенос движения человека на робота без ручной разметки. Команда из HKUST, Noitom Robotics и университета Ханян выложила UMR. Конвейер берёт запись движения человека и превращает её в траекторию суставов робота. За сутки 104 звезды.

Обычно это делают руками: инженер размечает «запястье человека → запястье робота» и переделывает разметку под каждого нового робота. UMR вместо скелета берёт внешнюю поверхность тела. И человека, и робота превращают в облако точек, а соответствие между точками модель выучивает сама.

Одно и то же акробатическое движение, перенесённое на пять разных корпусов роботов
Одно и то же акробатическое движение, перенесённое на пять разных корпусов роботов

Самое любопытное там — UMR Studio, браузерное приложение на MuJoCo WASM. Кидаете папку с описанием своего робота, правите позу мышкой, и прямо во вкладке на процессоре считается соответствие и перенос движения. Файлы никуда не уходят. Статья — arXiv 2609.02134. Лицензии у кода нет, для коммерции это стоп.

bzip3 — архиватор для тех, кто жмёт один раз и хранит долго. Камила Шевчик выпустила версию 1.5.4 — первое обновление с августа прошлого года. Наследник bzip2, лучше всего работает на тексте и коде.

Три корпуса данных: время, итоговый размер и расход памяти у bzip3 против bzip2, gzip, lzma, zstd и других
Три корпуса данных: время, итоговый размер и расход памяти у bzip3 против bzip2, gzip, lzma, zstd и других

Цифры против bzip2: исходники на Lisp — минус 37%, китайский текст — минус 29%, архив gcc — минус 23%. А на образе виртуальной машины выигрыш всего 7%. Ставится просто:

brew install bzip3        # macOS
sudo apt install bzip3    # Debian/Ubuntu
bzip3 -e -b 64 -j 8 file.tar

И сразу про минусы, потому что обсуждение на Hacker News было злым. Главная претензия: в замерах bzip3 дали блок 512 МБ, а zstd оставили с настройками по умолчанию. Пользователь ot перепрогнал честно, с тем же окном, и получил файл в 2,8 раза меньше.

Второе: распаковка тяжёлая. Замер пользователя idoubtit — «zstd требует 128 МБ и 1 секунду, bzip3 — 3,2 ГБ и 90 секунд». Для раздачи файлов берите zstd, для холодного архива bzip3 честно выигрывает по размеру.

Emacs Bedrock 2.0 — стартовый конфиг, принципиально написанный руками. Эштон Вирсдорф выпустил вторую версию Bedrock. Это не фреймворк, а два файла, early-init.el и init.el. Копируете один раз и дальше правите сами. В базовой конфигурации нет ни одного стороннего пакета, а комментариев ровно столько, чтобы понять код.

Версия требует Emacs 31 и рвёт совместимость с 29-м. Из заметного: lexical-binding во всех файлах, заметно лучше настроен tree-sitter, repeat-mode включён по умолчанию, вместо which-keyembark. Автор честно говорит, что это шаг, а не переделка: счастливому пользователю прошлой версии обновляться незачем.

Лос-Анджелес, который строится на глазах. Parcelscope показывает каждое здание округа Лос-Анджелес как отдельную коробку, которая появляется в год постройки. Полоса времени с 1880 по 2026 проигрывается примерно за сорок секунд. Почти три миллиона зданий, данные — лидарная съёмка округа и налоговый реестр.

Три вещи видны сразу и ломают привычную картину. Самое «большое» десятилетие — не ревущие двадцатые, а пятидесятые: больше 750 тысяч зданий. Ограничение высоты в даунтауне читается как жёсткий потолок вплоть до 1957 года. И главное: половина сегодняшних зданий стояла уже к 1951 году. С 1980-го добавилось лишь около 15% фонда.

Набор инструментов автор описал сам: «DuckDB spatial для джойна, tippecanoe в PMTiles, MapLibre fill-extrusion, всё статикой на R2 без сервера». Бесплатно, без регистрации и рекламы. Честная оговорка от него же: снесённого в данных нет, «это выживший округ, а не округ, каким он был».

Крошечная читалка за $70, которая вернула человеку чтение. The Atlantic опубликовал разбор Xteink X3 — читалки размером с банковскую карту, которая магнитом лепится на заднюю крышку телефона. Выглядит как барахло с маркетплейса. Сайт производителя забит сгенерированными фото, а имя бренда похоже на мусорный текст из мемов.

Результат трезвый и измеримый. За два месяца до покупки автор дочитал одну книгу. За месяц с X3 — три, «даже особо не стараясь». Среднее экранное время телефона упало на 25 минут в день.

Механика забавная и стоит внимания. Экран вдвое меньше самого маленького Kindle, поэтому на «страницу» влезает абзац-другой. Дочитать его легко, а раз уж перевернул — почему не следующий. Рецензентка на YouTube назвала это «тиктокизацией чтения». Звучит пугающе, но исход противоположный: человек читает Роберта Каро в очереди в музей. Цена — 69 долларов на Amazon, где устройство обошло Kindle в списке новинок.

Реконструкция исходников Stuxnet — с большой оговоркой. На Hacker News вынесло репозиторий Sadpainy/Stuxnet — «учебную реконструкцию» кода знаменитого кибероружия 2010 года, 161 очко. Штука любопытная, но как урок о доверии к коду, а не как источник.

Скептики разобрали её быстро. Всё лежит одним слепленным файлом на 15 891 строку. Артефактов декомпилятора нет вовсе — код написан слишком чисто и человекообразно. А главное, слово «Stuxnet» встречается в коде почти 140 раз, в том числе как имя ключа реестра. Имя дали антивирусные компании в 2010 году, внутренним самоназванием оно быть не могло.

Пользователь rep_lodsb формулирует прямо: «Похоже на шлак, всё склеено в один файл и, скорее всего, не основано на настоящем вредоносе». В README описана сборка по каталогам, которых в репозитории физически нет.

Полезный вывод отсюда не про Stuxnet. Правдоподобный, аккуратно оформленный, снабжённый ссылками на реальные отчёты код теперь генерируется за пятнадцать минут. Ровно столько прошло от создания репозитория до последней отправки. Проверять придётся не стиль, а происхождение.

Новости и тренды

Главный учёный OpenAI: «Ни одна лаборатория не решила выравнивание». Якуб Пахоцкий опубликовал эссе «An Alien Mind», Сэм Альтман назвал его важным. Главная ставка компании на надзор слабеет: «возможность полагаться на мониторинг цепочки рассуждений постепенно снижается». Отсюда и вывод в заголовке — дальше на полной скорости никому нельзя.

Новое здесь — призыв к внешнему контролю. Добровольные рамки он предлагает превратить в обязательные планки, которые проверяют сторонние аудиторы и ведомства. После такого текста обещания «у нас всё под контролем» стоят заметно дешевле: слабость главного инструмента надзора признана изнутри. Зви Мовшовиц зовёт текст лучшим из написанного изнутри лаборатории, но предложенный план — худшим из возможных.

Машинные организации: компанию можно заменить, не заметив этого. Автор под ником Vaniver описывает сценарий, где в компании заменены не рабочие руки, а нервная система. Пример у него хорош: в старой таксопарке диспетчер решал, кого послать. В Uber диспетчера заменил софт, и человек стал получать команды от машины. В роботакси убрали и водителя.

Переход бессимптомен. «С точки зрения остального мира в краткосрочной перспективе меняться почти ничего не должно»: клиенты получают тот же сервис, счета оплачиваются. А регулирование теряет точку приложения. Если компания нарушит закон, кого сажать? Человек с нужной должностью найдётся, но если он не выполняет свою функцию, посадка ничего не изменит.

Если вам важно, кто принимает решения на той стороне, спрашивать придётся прямо: ни в договоре, ни в качестве сервиса это не видно.

Как на самом деле будут договариваться о торможении ИИ. Питер Уайлдфорд написал «The Scramble» — 87 кармы на LessWrong. Тезис: момент, когда власти всерьёз возьмутся за сверхразум, будет похож не на договор о нераспространении, а на Карибский кризис.

Сценарий Уайлдфорда: совещание у президента, рывок на две-четыре недели и три фазы соглашений
Сценарий Уайлдфорда: совещание у президента, рывок на две-четыре недели и три фазы соглашений

Договор о нераспространении потребовал трёх лет переговоров. Реальный сценарий по Уайлдфорду другой. Две-четыре недели, пятнадцать человек в комнате, неполная информация, решения указом, а не через парламент. «Пойдём на рывок с той проверкой, что есть, а не с той, которую хотели бы иметь». То есть шпионы, спутники, инспекторы и данные по экспорту.

Вывод у него приземлённый. Правила для всей отрасли определит только то, что кто-то успел подготовить заранее. А проверкой передовых систем всерьёз заняты сейчас около сотни человек.

Вызов Магнуса: почему цепочка «модель выравнивает следующую» такая хрупкая. Тейлор Лант придумал красивую задачу. Вы клубный шахматист с рейтингом 1500. За победу над Магнусом Карлсеном в блиц дают миллиард долларов: у него минута, у вас год. Можно выставлять вместо себя посредников, но проигрыш любого из них обнуляет всё.

Считает он так. Разрыв 1300 пунктов, максимальная фора по времени даёт всего +750 — сами вы не выиграете. Оптимум — семь партий с шагом 185 пунктов. 52 дня против минуты дают +630, чистый перевес 445 — это 93% на партию. Семь таких побед подряд — 59%.

Аналогия прозрачна: каждое поколение моделей выравнивает следующее, и «один провал в любом месте лестницы убивает нас». Отсюда шкала для любых обещаний «следующая модель проверит предыдущую»: считать надо не одну ступень, а всю цепочку. Оговорка автора отрезвляет: «59% — прекрасные шансы выиграть миллиард. Но так себе шансы предотвратить апокалипсис».

Продать акции Anthropic и вложиться в другое. Зак Стейн-Перлман аргументирует, что филантропические фонды, сидящие в акциях Anthropic, должны продавать. Спор идёт не о том, вырастет ли компания. Спор о том, что ту же доходность можно получить дешевле.

Довод Майкла Дикенса конкретен. Anthropic в 3–5 раз рискованнее широкого индекса и в 2–3 раза рискованнее фонда на полупроводники. Значит, ожидаемую доходность надо делить на 2–5. Второй довод хитрее: портфель растёт ровно в тех сценариях, где у владельца и так всё хорошо.

Самый честный контраргумент там же и не про деньги. Дикенс: «Инвестируя в ИИ-акции, ты получаешь повод болеть за ИИ-бум и занижать свою оценку риска». Полезно любому, кто одновременно вкладывается в отрасль и судит о её опасностях.

Токен-выключатель: идея, которую Anthropic уже пробовала и свернула. Бойд Кейн предлагает обучать модель мгновенно останавливаться при виде определённой строки. Строку раскладывают по секретам, конфигам и машинам, куда агенту ходить нельзя.

История тут интереснее идеи. У Anthropic была публичная строка ANTHROPIC_MAGIC_STRING_TRIGGER_REFUSAL_..., которую выпустили для тестирования интеграций с API. Люди быстро сообразили и начали вставлять её на свои сайты и в открытый код — чтобы отвадить моделей. Anthropic перестала обучать модели на неё реагировать.

Возражения бьют по сути. JBlack замечает: для закрытых моделей проверку проще ставить снаружи, простым поиском подстроки. Автор отвечает, что снаружи её и снять проще — «особенно когда модели правят код собственной обвязки». А faul_sname называет главную дыру: если хорошие могут пометить то, что модели видеть не надо, плохие так пометят свои вирусы.

Отсюда практика: строку-стоп ставьте снаружи агента, а не надейтесь на обученную реакцию модели.

15 сентября Cloudflare меняет правила для ИИ-агентов. Тут сошлись два встречных движения. В топ GitHub за 7 сентября вышел turnstile-bypass — 286 звёзд за сутки. Внутри лежит AGENTS.md, «короткая инструкция для кодящих агентов». Навстречу Cloudflare ввела три категории вместо общего «ИИ-бот».

С 15 сентября на новых доменах агентов и обучение блокируют на страницах с рекламой. Есть сайт на Cloudflare — разложите категории сами до этой даты. Строите агента — подписывайте запросы через Web Bot Auth, а не обходите проверку. У пользователя jmarbach облачный браузер провалил 29% загрузок на сотне крупнейших сайтов США.

Есть ли толк от «прозаичной» безопасности. Пользователь iamthouthouarti задал на LessWrong неудобный вопрос: нынешние методы выравнивания замазывают симптомы, а не причину, и на сверхразум не масштабируются.

Лучший ответ дал Владимир Несов. Сегодняшние меры важны не тем, что доживут до сверхразума. Они закрывают отдельное окно риска: модели уже получили много власти, но ещё не стали сильно умнее людей. Так что «поверхностные» ограждения не бессмысленны — просто оценивать их надо по цене и охвату, а не по глубине.

Коротко. Broadcom убрала из открытого доступа библиотеку VDDK. На неё опираются инструменты миграции, так что уйти с VMware стало труднее. • В сеть всплыла переписка 2003 года: Билл Гейтс пытается скачать MovieMaker, тонет в перезагрузках Windows Update и бросает затею. Плохой интерфейс не щадит никого. • Классическое эссе «C — не низкоуровневый язык» снова в топе. Процессоры так подстроились под C, что «близко к железу» давно неправда. • Производители смартфонов массово игнорируют требования ЕС по ремонтопригодности. Сами себе ставят высокие оценки и не выдают владельцам сведений о ремонте.

Откомментируйте первым 👇

😎

Автор поста открыл его для большого интернета, но комментирование и движухи доступны только участникам Клуба

Что вообще здесь происходит?


Войти  или  Вступить в Клуб