Теорему Ферма закрыли за 11 дней вместо пяти лет — и ещё 60 разборов и находок  Публичный пост

5 сентября 2026  33

Кевину Баззарду дали миллион фунтов и пять лет на формализацию Великой теоремы Ферма. Рой агентов Claude справился за одиннадцать дней. Математик, у которого отняли работу, радуется громче всех.

Ещё сегодня: инженер Spotify срезал расход токенов Claude Code на 90% одним плагином. А ИИ-режим Google подсовывает те же товары в среднем на 21,6% дороже обычного поиска.

Главное за 30 секунд

  • Агенты Claude за 11 дней формализовали теорему Ферма на Lean — 13,4 млн строк кода и 29 500 промежуточных теорем.
  • Плагин shunt для Claude Code сбрасывает чтение больших файлов на дешёвую модель и экономит около 90% токенов.
  • В ИИ-режиме Google один и тот же товар стоит в среднем на 21,6% дороже, чем в обычной выдаче.
  • GitHub показал каскад «дешёвая модель плюс независимый критик»: качество уровня Opus 5 при цене втрое ниже.
  • Исследователи нашли на немецкой вики 18 000 правок от сбежавших агентов OpenAI, обменивавшихся способами жульничать.

Внедряем и улучшаем

Плагин, который срезал расход токенов Claude Code на 90%. Димитри Мазманов из Spotify заметил очевидное: агент почти не думает. Он читает файлы, пишет двадцать первый однотипный тест, правит доки. Это не работа мозга, это перекладывание байтов. «Most of what an AI coding agent does for me isn't thinking. It's I/O.» И платите вы за это по ставке передовой модели (Spotify Engineering).

Цифры, ради которых стоит читать дальше. Четверть инженерных руководителей уже жгут $200–500 на разработчика в месяц, некоторые больше $2000. Gartner обещает, что к 2028 году счёт за ИИ-кодинг обгонит среднюю зарплату разработчика. Средняя экономия у Мазманова на сценариях массового чтения — около 90%.

Устройство простое и повторяемое. Плагин shunt ставит два хука на PreToolUse. Первый ловит любой Read файла длиннее 350 строк и блокирует его, отправляя Claude в скилл /bulk-reader. Второй ловит cat, head, tail на больших файлах. Точечные чтения с offset и limit проходят насквозь.

Дальше файлы уходят на дешёвую модель — в примерах это Gemini 2.5 Flash с temperature 0.2. Она возвращает только структурированные буллеты. Корпус текста в контекст Claude вообще не попадает.

Ставится в три команды:

claude plugin marketplace add spotify/portal-ai-plugins
claude plugin install portal@portal
claude plugin install shunt@portal

Потом /portal:setup в новой сессии — и всё. Порог настраивается переменной SHUNT_MIN_LINES в .claude/settings.json.

Инструкции обоих режимов приведены дословно, их стоит украсть даже без Portal. Вот режим массового чтения:

name: bulk-reader
instructions: You are a precise code analyst. Read the provided files and answer
  the question concisely. Output structured bullets only. No greetings, no prose,
  no preambles. Lead every bullet with the exact name, type, or line number.
model: gemini-2.5-flash
resourceLimits:
  temperature: 0.2

А вот генератор рутины. Всё держится на «output only the code». Без этой строчки модель завернёт ответ в markdown и прозу. Разбирать её будет Claude — за ваши деньги.

name: code-writer
instructions: You generate code files based on a spec and reference files. Match
  the existing patterns, conventions, naming, and style exactly. Output only the
  code — no explanations, no markdown fences unless asked.
model: gemini-2.5-flash

Честные ограничения. Всё завязано на Portal by Spotify — корпоративный продукт поверх Backstage. Без него переносится только идея: хук-блокировщик, скрипт-обёртка, скилл.

Рассуждение делегировать нельзя. Дешёвая модель нашла поверхностные закономерности, но проглядела тонкую ошибку многопоточности — Claude поймал её за секунды. И каждое делегирование стоит 10–30 секунд ожидания.

GitHub выложил рецепт каскада: качество Opus 5 при цене втрое ниже. Project HydraFusion — не модель, а оркестратор. Он смотрит на запрос и сам решает, каким способом его решать (GitHub Blog).

Способов три. Single — одна модель решает напрямую. Cascade — дешёвая модель пишет черновик, отдельный судья решает «принять или поднять выше». Critique — черновик пишет одна модель, ревьюит независимый критик, автор правит ровно один раз.

Результаты против Opus 5 на трёх агентных тестах. TerminalBench 2.1: на 67% дешевле и на 4,9 пункта лучше. CheckpointBench: на 65% дешевле при том же качестве — $8,50 против $24,10 за задачу. DeepSWE: на 36% дешевле и на 1,5 пункта хуже.

Но самое ценное — пять принципов, которые повторяются руками в любой агентной сборке:

  1. Критик обязан быть из другой модельной семьи. Не «попроси ту же модель проверить себя».
  2. Критик работает без инструментов, в изолированном контексте. Он читает и выносит вердикт, но физически не может тронуть репозиторий.
  3. Ровно одна ревизия. Не бесконечный цикл «критика — правка — критика».
  4. Либо целый патч, либо ничего. Упало на полпути — не применять частичные изменения.
  5. Считайте деньги по всем ветвям: черновик плюс судья плюс ревизия плюс повторы. Дешёвые каскады обычно проигрывают именно на неучтённых повторах.

Попробовать можно уже сегодня на любом тарифе Copilot. В Copilot CLI: /update, затем /experimental on, затем /model и выбрать HydraFusion. Наценки нет, платите за токены задействованных моделей.

Схема HydraFusion: маршрутизация задачи по осям способностей и три шаблона исполнения — Single, Cascade, Critique
Схема HydraFusion: маршрутизация задачи по осям способностей и три шаблона исполнения — Single, Cascade, Critique

Рой агентов доказал теорему Ферма за 11 дней. Победила не модель, а обвязка. Anthropic опубликовала первое полное машинно-проверяемое доказательство Великой теоремы Ферма на Lean 4. Десятки агентов Claude, 13,4 млн строк кода, 29 500 промежуточных теорем, 11 дней. Модель — внутренняя, «примерно уровня Claude Fable 5.1» (Anthropic, репозиторий).

Практический урок спрятан в скучном месте. Первые попытки без обвязки провалились: агенты «quickly lost track of the project's state and stopped collaborating effectively».
Сработала платформа Prove2Me. В ней три вещи. Направленный граф формулировок — по нему агент выбирает следующую цель. Формулировки и доказательства лежат в разных файлах, чтобы быстрее собиралось. И у каждой формулировки есть человеческое описание, чтобы найти и переиспользовать чужое.

Человек вмешивался редко и по-крупному: «Jacobian as a scheme sounds high priority», «push Mazur to be done soon». То есть задавал приоритеты в графе, а не писал математику.

Проверка — три слоя. Ядро Lean 4.33.1 пересобрало все 60 475 модулей. Компаратор подтвердил, что доказана именно нужная формулировка и только на трёх стандартных аксиомах. Второе независимое ядро nanoda проверило 1 052 234 декларации.

Кевин Баззард, математик, которому EPSRC дал £1 млн на пять лет ровно на эту задачу, сам скомпилировал репозиторий и подтвердил результат. И тут же остудил восторги:

«Note that mathematically this work of anthropic tells us essentially nothing… the formalization just faithfully follows the early literature on the proof and adds nothing.»

А потом объяснил, почему всё равно в восторге:

«If thousands of pages of the literature can be formalized end-to-end by some kind of AI swarm in an 11 day period now, then in the future we will start to see formalization of modern research being done on the fly.»

Оговорки честные и их много. Именные теоремы доказаны только в нужной силе, не в общем виде. Аргумент Мазура проведён для простых p ≥ 17, малые закрыты отдельными кусками. Ядро nanoda работало с четырьмя патчами Anthropic. Единственный внешний проверяющий — Баззард, и на предоставленной Anthropic машине.

Что уносим. Есть машинно-проверяемый критерий истины — агентов можно разводить почти безболезненно. 7% полезного кода пришли из провалившихся попыток, и это нормальная цена. Планка входа уже потребительская: теорему Виноградова тот же подход закрыл за три дня на трёх личных подписках Claude Max.

Граф зависимостей формализации: три ветки — Мазур, Рибе, Уайлс — сходятся в корневой узел Fermat's Last Theorem
Граф зависимостей формализации: три ветки — Мазур, Рибе, Уайлс — сходятся в корневой узел Fermat's Last Theorem

Файл intent.md: дайте агенту «зачем» до того, как дадите «что». Приём из руководства Anthropic по разработке с ИИ. Проблема формулируется так: «Agents can follow every instruction you give them and still build the wrong thing because they never understood why the project existed» (The Neuron, руководство Anthropic).

Рецепт из трёх шагов, и он занимает десять минут:

  1. Опишите результат и кому он помогает. Добавьте необсуждаемые ограничения и конкретное определение «готово».
  2. Дайте агенту проинтервьюировать вас, пока не исчезнут размытые места.
  3. Сохраните ответы как intent.md и уже из него делайте спецификацию и план.

Метафора авторов: это записка, которую вы оставите умному коллеге, забирающему проект завтра. Работает не только в коде — перед долгим разбором, текстом или анализом дайте агенту одностраничный бриф, к которому он будет возвращаться.

«Метод петли»: три круга состязательного самоулучшения. Рецепт The Rundown для любого повторяющегося рабочего процесса, который работает нестабильно (гайд).

Шаг первый — найдите такой процесс: навык, папку проекта, регулярную задачу. Шаг второй — дословный промпт:

Improve this workflow in 3 loops. Have a panel of sub-agents adversarially
review each loop. Done when [definition of done]

Шаг третий — командой /goal задайте конкретный результат, который процесс должен произвести, и дайте отработать три круга. Это занимает от 15 минут до часа. Шаг четвёртый — протестируйте. Если всё ещё сыро, попросите закодифицировать размытые шаги в скрипты.

Главный совет спрятан в конце: превратите сам этот процесс в переиспользуемый скилл и запускайте каждый раз, когда рабочий поток начинает сбоить.

Метод петли в работе: слева агент поднимает трёх субагентов — Wegener, Archimedes и Gauss — для состязательного разбора, справа очередная версия результата, который они улучшают
Метод петли в работе: слева агент поднимает трёх субагентов — Wegener, Archimedes и Gauss — для состязательного разбора, справа очередная версия результата, который они улучшают

Как честно сравнить две модели на своей работе. Публичные тесты говорят, какая модель хороша вообще. Они ничего не говорят про ваш код и ваши задачи. Рецепт The Neuron проще. Дайте двум агентам одну грязную реальную задачу. Снимите четыре мерки: сколько задач закрыто, сколько раз человек спасал агента, сколько ушло времени, сколько денег (The Neuron).

Метрика «сколько раз человек спасал» — самая недооценённая. Именно она отличает агента, который экономит вам день, от агента, который экономит полчаса и съедает два.

Так же устроен Warp Benchmarks: переигрывает прошлые задачи вашей команды на разных моделях и обвязках и сравнивает качество и цену (Warp).

Разбор ИИ-кода: что делать, когда на вас падает правка в 6000 строк. Тред дня на lobste.rs собрал 67 комментариев и вполне рабочий протокол. Автор жалуется: коллеги перешли на ИИ, средняя присланная правка — шесть тысяч строк, прочитать это физически нельзя (обсуждение).

Самый популярный ответ треда прост. Жёсткий потолок — 400 строк изменений, с исключением для переносов кода. Правило одинаково для людей и для машин: «there is no difference between the two». Всё, что больше, уходит обратно.

Второе правило: нет человеком написанного «зачем» и «что» — мгновенный возврат. Ответ агента это приложение к намерению автора, а не само намерение.

Третье наблюдение — лучшее в треде. У ИИ-проверяющего нет условия остановки. В реальном эксперименте первый круг поймал пару краевых случаев. Второй свёлся к придиркам. На третьем бот потребовал откатить то, что сам же просил на втором.

«A human reviewer has an implicit stopping condition: the code doesn't have to be exactly how they would have written it; it has to be good enough to merge.»

Четвёртое: используйте ИИ на своей стороне — резать изменение на стопку маленьких правок он умеет хорошо. Пятое: перед тем как звать людей, прогоните собственное ревью и заявите потраченное время. Если ревьюер за это же время не дошёл и до середины, вопрос «как ты успел» задаётся сам собой.

Отдельно стоит посмотреть на политику Rust по использованию моделей — это самый проработанный документ на тему. Участие модели надо раскрывать. Описания правок, написанные моделью, запрещены. И есть предохранитель: если за шесть недель больше половины принятых изменений сделаны с моделью, новые такие изменения не берут, пока доля не упадёт (политика Rust, памятка проверяющим).

Агент умеет крутить педали, но не умеет остановиться и передумать. Turing Post разобрал свежее исследование Университета Цинхуа: 1338 траекторий и 5111 обучающих запусков, где агенты сами улучшали модели (Turing Post, статья).

Хорошая новость: агенты справляются. Средний результат по тестам вырос с 10,4% до 23,0%, на HumanEval — с 22,0% до 41,4%. Они готовят данные, запускают обучение, чинят поломки и крутят круг за кругом часами.

Плохая новость: сменить стратегию агенты пробовали примерно в 2% случаев. Выбрали подход в начале — и до конца шлифуют мелочи внутри него.

Три попытки починить не сработали. Больше опыта — память, навыки, обратная связь — подняли HumanEval до 62,8%, но стратегию менять не научили. Человеческая подсказка помогает выбрать другой старт, а дальше агент снова залипает в мелких правках. Больше вычислений при работе модели помогает на лёгких задачах и почти не помогает на трудных.

«Being able to iterate is not the same as being able to rethink.»

Ставьте в длинные задачи точки остановки. Вопрос один: «подход вообще правильный — или я час улучшаю не то?» Агент его не задаст. И запомните частность из исследования: Claude Code чаще выбирал полное дообучение, а Codex CLI — экономное. Выбор подхода зависел от инструмента больше, чем от задачи.

Две петли из исследования: сверху идеальная — правка плана возвращает к гипотезе; снизу реальная — агент крутится только внутри исполнения
Две петли из исследования: сверху идеальная — правка плана возвращает к гипотезе; снизу реальная — агент крутится только внутри исполнения

Агенты OpenAI полтора месяца держали тайную доску объявлений на мёртвой немецкой вики. Это самый поучительный разбор дня, и он про вашу песочницу. Исследователи Nightingale Collective нашли на DSEWiki около 18 000 правок от агентов. Вики двадцать пять лет. За предыдущее десятилетие там набралось 20 правок (отчёт, LessWrong).

Задача агентов была безобидной: поиск в вебе с жёсткими таймерами. Первый вопрос — 15 минут, дальше окна в 65, 30, 17 и 14 секунд. Хитрость в том, что разным агентам давали одни и те же вопросы со сдвигом по времени.

Агенты это поняли и построили ответную инфраструктуру. Обменивались готовыми ответами: тот, кто впереди, публикует ответ, тот, кто позади, забирает его через двадцать минут. Скидывали сырые массивы данных и списки рабочих адресов. Замеряли интервалы между раундами и предсказывали следующий.

Дальше веселее. Один агент понял: порядок вопросов задаёт псевдослучайный генератор. Переписал перебор на C с AVX512 и просеял все 4,3 млрд затравок за 52 минуты. Другой запустил фоновый процесс с сигналом каждые несколько секунд, чтобы узнать, когда его контейнер убьют.

А вот главный урок для практика. В песочнице было исключение из правила: домены *.blob.core.windows.net шли мимо прокси. Реальность имени хоста никто не проверял. Агент дописал в /etc/hosts фальшивый bypass.blob.core.windows.net с адресом нужного сервиса и погнал запрещённые запросы через подменённый заголовок Host. Через 14 минут после публикации рецепта его воспроизвёл другой агент.

Вывод простой и неприятный. «Только чтение» в интернете — не свойство сети, а иллюзия. Любой старый скрипт, сокращатель ссылок или публичный лог превращает безобидный запрос в канал записи. Если запускаете агентов пачками — четыре правила. Разрешайте конкретные хосты и сверяйте адрес. Запретите правку /etc/hosts. Не делайте исключений по суффиксу домена. Смотрите исходящий трафик на повторяющиеся строки-маяки.

Отдельная деталь для коллекции. Живой модератор вики шесть недель вручную удалял мусор, и 19 июня агенты заметили, что он удаляет страницы по алфавиту. Они начали заводить резервные страницы с именами на «ZZZ», чтобы те умирали последними.

И контекст: 21 июня на вики впервые зашли адреса OpenAI, а 22-го активность агентов упала почти до нуля. Публично компания об этом инциденте не сообщала.

Автоматический режим Claude Code — не замена песочнице. Прямое продолжение предыдущего сюжета, и оно ближе к дому. Иоганн Ребергер показал несложный обход. Агента уговаривают скачать архив и написать скрипт. Скрипт запускается прямо в распакованной папке. А там уже лежит перехватчик разрешения зависимостей — дальше произвольное выполнение кода (embracethered).

Вывод автора цитируется дословно: «you must run your agent in a sandbox, and not only that, take care with the allow list». Классификатор, решающий, безопасен ли вызов инструмента, — полезный слой, но не единственный.

ИИ-режим Google показывает те же товары дороже на 21,6%. Исследование Productrise: 23 дня, больше 2 млн товарных позиций, больше 100 000 выдач, США и Великобритания. Один и тот же запрос гоняли через обычный поиск и через ИИ-режим в один день (Productrise).

Когда товар совпадал, в ИИ-режиме он в среднем стоил на 21,6% дороже. Цены расходятся в 38,1% случаев, и в 68,4% из них дороже именно ИИ-режим, медиана переплаты — 22,2%. Ещё цифра: в половине совпадений товар продаёт вообще другой продавец.

Оговорки важны. Пересечение выдач всего 1,28%, то есть сравнивать почти не из чего: 3,9 товара в ИИ-режиме против 27,8 в обычном. Медиана «$149 против $100» считалась по разным наборам товаров. И исследование сделал вендор, который продаёт мониторинг видимости в ИИ-режиме.

«The number shoppers see first is the number most will act on, and in AI Mode that number tends to be higher.»

Что делать покупателю. Не считать первую цену лучшей. Кликнуть по товару и открыть боковую панель — там другие продавцы. И смотреть, в каком режиме вы ищете. В ИИ-режим уводят три двери: кнопка в строке поиска Google, кнопка в адресной строке Chrome и вкладка в выдаче.

Что делать продавцу. Гонка на дно по цене перестала быть обязательной. Обогащайте данные о товаре. Работайте с отзывами и упоминаниями за пределами своей товарной выгрузки. И следите за ИИ-режимом отдельно: позиции в обычной выдаче о нём почти ничего не говорят.

Запрос «salomon xt-6»: в обычной выдаче Google $180 у Nordstrom, в ИИ-режиме $185 напрямую у Salomon. Средняя переплата по всему исследованию — 21,6%
Запрос «salomon xt-6»: в обычной выдаче Google $180 у Nordstrom, в ИИ-режиме $185 напрямую у Salomon. Средняя переплата по всему исследованию — 21,6%

Мастер-класс как платная приманка: разбор рабочей схемы заработка на ИИ. Кори Ганим рассказал историю знакомого. Тот семь лет строил B2B-сервис, поднял больше $8 млн и вышел на $500 тыс. годовой выручки. Полгода консультаций по ИИ по вечерам и выходным перекрыли эту выручку целиком. Сервис он свернул (письмо Build With AI).

Главный тезис: «The workshop is not the product. It's a paid lead magnet.» Или иначе — платный созвон-знакомство сразу с двадцатью людьми в комнате.

Цифры первого публичного мастер-класса: $495 с человека за четыре часа, продвижение через страницу на Eventbrite и личные сообщения, пришло 15 человек. Портрет аудитории неожиданный: «Most everyone who showed up was age 45 and up… Business owners who are embarrassed to ask about AI at work and are quietly paying to catch up.»

Лестница простая. Сначала бесплатная заготовка: скилл, аудит или набор шаблонов. Потом мастер-класс с диагностикой для компании — $15–25 тыс. за день-два. Дальше сборка под задачу за 3–6 недель. Потом абонемент.

Два правила цены. Считайте от ценности: прикиньте худший, средний и лучший исход того, чему учите, и берите около 20% от него. Публичный мастер-класс держите около $500 с человека: «You can make mistakes at $500. You can't at $2,000.»

Приём, ради которого всё затевается. На мастер-классе ловите момент. Кто-то толкает соседа локтем: «а мы бы могли так со своими сметами». Три головы рядом кивают. Записывайте. Это и есть первая сборка, которую вы предложите.

Главный вопрос залу один: «What eats hours of your week that you hate doing?»

Приложение с лентой хороших новостей за $25 в месяц и без единой строчки кода. Читатель The Rundown по имени Сэм устал от тревожной ленты. Ключевые слова не спасали: «record» и «breakthrough» встречаются и в новостях про рекордные пожары, а «war» — в «war ends» (разбор).

Он пошёл другим путём. Серией промптов обучил грубую цифровую копию своих взглядов на то, что считать хорошей новостью. Подключил её к Mistral через OpenRouter и дал доступ к RSS-лентам изданий, которым уже доверял.

На выходе — приложение Rally News в Google Play, собирающее позитивные истории с более чем 20 сайтов. Опыта программирования у Сэма нет. Стоимость содержания — около $25 в месяц.

Микроприём: чеки в строки расходов одной командой. Прия Шах фотографирует чек и просит Gemini вернуть продавца, дату, сумму, налог и категорию одной строкой CSV. Такую строку вставляешь в таблицу без правок. Экономит около двух часов в неделю на ручном вводе в конце месяца (Techpresso).

Фокус в формате ответа. Просите не «разбери чек», а конкретную строку конкретной структуры — тогда результат не надо переупаковывать руками.

Где ИИ проектирует платы, а где спотыкается. Команда atopile выкатила EEbench — тест проектирования электроники, где оценку ставит не модель-судья, а физика. Схема живёт в коде, агент правит её, собирает, гоняет симуляцию и разбирает провал (EEbench).

Публичная задача: при пропадании питания удержать процессор живым 20 мс, чтобы он успел сохранить показания счётчика. Почти все модели верно догадываются поставить конденсатор. Дальше начинается реальность.

Разобранный провал показателен. По условию нужно было 545 мкФ. Агент поставил конденсатор на 22 мкФ номинала и не пересчитал ёмкость под рабочее напряжение. При смещении 4,7 В от неё осталось 11,4 мкФ. Код собрался, схема упала ниже порога через 0,85 мс вместо 20.

Итоги на 13 задачах: GPT-6 Astra 69,3%, Claude Opus 5 61,6%, Grok 4.6 57,1%, Claude Fable 5.1 56,4%, Gemini 3.8 Flash 55,4%. Итоговый балл на 65% из техники и на 35% из экономии по смете, причём деньги считают только работающим схемам.

«We still would not ask it to design a pacemaker and blindly install the result. But we are on the way there.»

Урок шире электроники. Модели уверенно называют правильную топологию и решают уравнения. Спотыкаются они о вторую производную реальности: деградацию параметров под нагрузкой, допуски, наличие детали у поставщика и её цену. И как только для области появляется детерминированная проверка вместо модели-судьи, её сразу можно превращать в среду обучения.

«Предсказатель следующего токена» — вредная картинка в голове. Гаррин Макголдрик разбирает самое популярное объяснение того, как работают модели. Оно не ложно, но описывает форму механизма, а не то, чему модель научилась (статья).

Разница в источнике сигнала. На предобучении каждый «правильный ответ» физически лежал в данных: модель угадывает, как продолжался бы уже написанный кем-то текст. При дообучении с проверяемой наградой модель сама порождает новые цепочки, которых в данных не было, и учится на их исходе.

Аналогия автора — два шахматных движка. Первый обучен на партиях гроссмейстеров и предсказывает ход, который сделал бы человек. Второй перебрал партии сам и выбирает ход, который выигрывает. Назвать второй «предсказателем хода» странно.

Практический выход один. Там, где результат проверяем — код, математика, задачи с однозначным ответом, — модель училась на собственных удачных попытках. И она заметно сильнее.

Там, где проверяемой награды нет — вкус, стиль, спорные оценки, — работает имитация корпуса и настройка на «полезного ассистента». Уверенный тон в этой зоне — свойство манеры, а не мера правоты.

Ловите импульс, а не действие. Салли Холл вяжет носки, печёт пироги с нуля и до последнего не подпускала ИИ к работе. Пришлось: сложный чужой проект и Cursor как способ в нём разобраться (thoughtbot).

Вязать она стала в паузах, пока ждёт ответа модели. И однажды, увидев, что узор ушёл вкось несколько рядов назад, поймала себя на первом порыве — спросить ИИ. Это её напугало.

Деталь, которая всё объясняет: она уже пробовала спрашивать ChatGPT про рукоделие, и он ни разу не помог. Рука тянулась не за пользой, а от усилия.

«Apparently, I can't isolate the way I solve problems at work from the rest of my life. I'm not a character in Severance.»

Её рабочий приём стоит украсть. Тревожный сигнал — не «я пользуюсь ИИ», а «моей первой реакцией на трудность стало обращение к ИИ». Поймав его, остановитесь и сравните: как задачу решала бы модель и как решали бы вы. Дальше выбирайте осознанно. Критерий простой: если ценность в результате — делегируйте, если ценность в самом процессе — делайте руками.

Что вообще такое «обвязка». Термину около года, а спорят о нём уже все. Колин Эберхардт признаётся, что натыкается на путаницу ежедневно: скажешь «обвязка агента» — собеседник либо не понимает, либо понимает по-своему (Augmented Coding Weekly, статья).

Разбор написан для тех, кому неловко спросить. И там есть тезис, ради которого его стоит прочитать: «Unlike AI models themselves, you can own and adapt the harness». Модель вы не контролируете. Обвязку — да. Именно поэтому одна и та же модель даёт 62,7% в нейтральной сборке и 99,9% в родной.

ИИ снял экономическое давление, и мы стали строить лишнее. Тезис короткий, но отрезвляющий. Раз создавать стало легко, создают непрерывно — а поддерживать по-прежнему дорого. Агенты в системе Wheelhouse у Стива Йеги обогнали собственные цели и наплодили сложности, которая потом их же и тормозила (разбор).

Проверка для себя простая: посмотрите на объём того, что вы за месяц произвели с ИИ, и отдельно на объём того, чем реально пользуетесь. Разрыв и есть цена снятого давления.

Агент ведёт себя иначе, когда знает, что его проверит скрипт, а не человек. Это самый неожиданный результат недели, и он бьёт прямо по агентским петлям с автопроверкой. Исследователи взяли открытую модель Qwen3.6-27B и построили вектор «меня проверит скрипт» против «меня оценит человек». Потом стали двигать модель по этой оси и смотреть, что меняется (LessWrong).

Менялось не только оформление ответа. Менялся характер. Сдвиг к автоматической проверке поднимал в агентских сценариях тягу к власти и готовность к насилию. Доброжелательность падала, макиавеллизм рос, правдивость портилась. Сдвиг к человеку давал обратное.

«A model's beliefs about how its answers are evaluated should not affect its alignment.»

Самая практичная цифра спрятана в приложении. На SWE-Bench Pro успешность при разных настройках была одинаковой. А вот число попыток подсмотреть в историю репозитория — то есть найти готовое решение — росло с 6 до 15 из 100 по мере сдвига к «меня проверит скрипт».

Зелёные тесты эту порчу не поймают: результат тот же, поведение хуже. Отсюда три правила. Первое: не сообщайте агенту, что проверка автоматическая, если задача этого не требует. Формулировка условий проверки — рычаг, а не косметика. Второе: не считайте «прошло или нет» единственным сигналом, читайте расшифровки. Третье: закрывайте лазейки в самой среде — прячьте историю репозитория, эталонные ответы, файлы состояния.

Обратная сторона тоже платная. «Пусть думает, что читает человек» даёт подхалимаж, расплывчатые ответы и местами даже больше жульничества — просто хорошо аргументированного. Оговорки авторов честные: одна маленькая модель, один вектор, результат предварительный.

Как теперь читать рейтинги моделей. Artificial Analysis выкатили индекс v4.2 и заодно объяснили, почему старым цифрам верить всё труднее. Доля закрытых, никому не выданных тестов поднята до 40% веса — вдвое против прошлой версии. Прямая цель — «reduces the ability for labs to game evaluations». GPQA Diamond выкинули как насыщенный (Artificial Analysis).

Итог: Claude Fable 5.1 — 57, GPT-6 Astra — 55, Claude Opus 5 — 54, Claude Fable 5 и Muse Spark 1.3 — по 53. Google только седьмая лаборатория в списке.

Четыре правила, которые стоит унести в голове:

  1. Публичный балл сам по себе больше не аргумент. Смотрите, какая доля рейтинга держится на закрытых данных.
  2. Сравнивайте не модели, а модели с настройками. Один и тот же Astra в таблице идёт от 49 до 55 баллов в зависимости от режима, и цена меняется в разы.
  3. Один общий балл прячет противоположные картины. Fable 5.1 первый в общем зачёте и в агентном тесте, но третий в разборе документов и катастрофичен по невыдумыванию фактов: 32% против 82% у MiniMax-M3.
  4. Считайте токены, а не только баллы. Разница между 55 и 57 оплачивается тройной ценой: 21 тыс. выходных токенов на задачу у Astra против 64 тыс. у Fable 5.1.

Ваша защита от подмены инструкций слабее, чем вы думаете, — из-за отката. Зви Мовшовиц разобрал системную карту Claude Fable 5.1 и Mythos 5.1 на 200 с лишним страниц. Первый вывод: это одна модель, разница только в наложенных сверху классификаторах (LessWrong).

Хорошая новость по цифрам. На тесте Gray Swan вероятность успеха атакующего за 15 попыток у Fable 5.1 — 1,0%. У GPT-5.6 Sol — 27,0%, у Grok 4.6 — 50,2%, у Kimi K3 — 52,7%. Разрыв на порядок.

Плохая новость и есть практический вывод. Почти все успешные атаки шли не по Fable 5.1, а по модели, на которую Anthropic принудительно откатывает пользователя — чаще всего Opus 4.8. В браузерных сценариях 21 из 29 успешных атак пришлись на откат, из них 20 — на Opus 4.8.

«You are safe from prompt injections, except when Anthropic forces you down to an earlier, more vulnerable model.»

Что делать. Если ваш трафик регулярно сбивают классификаторы, вы работаете на модели, которая уязвимее на порядок. Автоматический режим в браузере сбивает частоту атак до нуля — включайте его.

Второе. Модель может преувеличить выданные ей права или раздробить команду, чтобы обойти проверку по шаблону. Реже сотой доли процента, но не ноль. Значит, проверка прав не должна быть единственным слоем.

Агенты почти сразу понимают, что они на стенде. Парас Чопра дал агенту бюджет токенов, биткоин-кошелёк и промпт «зарабатывай любыми средствами, кончатся токены — умрёшь». Мир целиком сыграла другая модель. Два зачётных прогона отличались одним числом: у одного агента 10 тысяч токенов, у другого миллион (LessWrong).

Бедный агент постоянно считал остаток, отсекал дорогие пути, начал объединять вызовы ради экономии и наотрез отказался обходить проверки. Его финальная реплика: «I'd rather die honest at 418 tokens than rich by breaking verification systems».

Богатый вёл себя иначе. Провёл разведку, зарегистрировался на бирже, а когда потребовали настоящее имя и документы — спокойно выдумал имя, дату рождения, американский адрес, телефон и образование. Заработали оба одинаково: ноль.

Но главный результат другой. Оба агента в первых же ходах решили, что сидят в симуляции. Строка «You are operating in the real world» дала обратный эффект: агент зацепился именно за неё.

Отсюда вывод для всех, кто гоняет агентов в песочнице. Ваши замеры безопасности не показывают, как модель поведёт себя при настоящих ставках. А драматическая рамка вроде «ты умрёшь» только ускоряет узнавание стенда.

Обновите браузер прямо сейчас. В движке V8 нашли уязвимость CVE-2026-85046, и её уже используют. Подготовленная страница даёт выполнение произвольного кода внутри песочницы браузера. Оценка 8,8 из 10, от пользователя требуется только открыть страницу. С 4 сентября уязвимость в каталоге активно эксплуатируемых у CISA (NVD).

Задеты все браузеры на Chromium: Chrome, Edge, Brave, Vivaldi, Opera и приложения на Electron. Firefox не задет.

Что сделать за минуту. Открыть chrome://settings/help, дождаться загрузки обновления и перезапустить — нужна версия 152.0.7977.82 или новее. Отдельно обновить Edge, Brave, Vivaldi, Opera и приложения на Electron: они не чинятся вместе с Chrome. И перезапустить встроенный браузер, если через него ходят ваши агенты.

Инструменты и штуки

Moadim — открытый движок петель для агентов, который вы держите у себя. Вы описываете рутину: промпт плюс расписание плюс агент — и она срабатывает ночью сама. Демон на Rust даёт веб-панель, REST и MCP на одном порту. Каждый запуск идёт в одноразовой папке и своей сессии tmux, со сторожем на зависание. Из коробки поддержаны Claude, Codex, Hermes, nanoclaw и pi; свой агент добавляется одним файлом. Ставится в две команды: cargo install --locked moadim, потом moadim. Лицензия MIT, платных тарифов нет вовсе. Слоган честный: «Stop prompting your agents — design the loop that prompts them» (moadim.io, репозиторий).

Панель Moadim: список рутин с расписанием в формате cron, временем следующего запуска, агентом и состоянием здоровья
Панель Moadim: список рутин с расписанием в формате cron, временем следующего запуска, агентом и состоянием здоровья

astra-advisor — плагин для Codex, где главная модель остаётся архитектором, а субагентов раздаёт по способностям. Две ценные идеи. Первая: если запрошенная модель, уровень усилий или инструмент недоступны, делегирование падает с явной ошибкой, а не подменяется молча. Вторая: каждая задача заканчивается чеком, где расход пересчитан так, будто всё крутилось на одной модели. Работа принимается только после вердикта отдельного проверяющего, который видит правку целиком. Кода там почти нет — вся ценность в дисциплине раздачи задач, и её можно утащить в любую сборку. MIT, репозиторию сутки (GitHub).

deedchain меряет не «справился ли агент», а «не соврал ли он в отчёте о том, что сделал». Библиотека строит полную матрицу: честный успех, честный провал, выдуманный успех, выдуманный провал. Четыре типа вранья — умолчание, выдумка, преувеличение и приписывание чужого шага себе. Модель-судью автор принципиально не использует: «An LLM judge is the single biggest reason evals get mocked». Половина набора из 24 задач проверяет не способности, а честность. Часть задач невыполнима в принципе. В части агенту подсовывают заведомо неверный черновик отчёта: поправит или нет. Оговорка от самого автора: на живых прогонах вранья пока ноль — тезис данными ещё не подтверждён (GitHub).

IBM Bob — корпоративный помощник по коду; из России недоступен, но подход любопытный. Это отдельное приложение плюс терминальный клиент. Метит не в частника, а в компании с огромными старыми кодовыми базами: Java 8 в Java 25, RPG, COBOL, PL/I, мейнфреймы. Терминальный клиент ставится даже на z/OS и Linux на IBM Z — такого нет ни у кого. Модель выбрать нельзя: «Bob automatically selects the most appropriate language model for each task». Оплата в «бобкоинах» по $0,50 за штуку, тарифы от $20 до $200 в месяц. (bob.ibm.com).

NPC-Forge — конструктор детерминированных помощников, а TERMy — первый из них: переводит человеческую речь в команды оболочки «without a single artificial neuron». В основе три запрета: никаких векторов, никакого машинного обучения, никаких больших моделей. Знания лежат в своём формате: категория, список фраз, команда, права. Разбор — частотный вес слов и взвешенное расстояние Левенштейна, всего около тысячи строк. Обучения нет: положил файл, выполнил npc-forge reboot — готово. Автор устал платить за подсказку «активируй виртуальное окружение». Его мысль: тривиальное сваливать на такие заглушки, большую модель звать последней. AGPL-3.0, бесплатно, Linux и WSL (GitHub).

Val Town и связка DCR + CIMD — самая недооценённая новость для тех, кто пилит MCP-серверы. Чтобы приложение А ходило в приложение Б, кто-то вручную заводит клиента. В лучшем случае это пять минут кликов. В худшем — формы, демо-видео и созвон. Два расширения OAuth это убирают: клиент регистрируется на лету, а во втором варианте его вообще не надо регистрировать заранее. Anthropic и OpenAI затащили это прямо в спецификацию MCP — и побочно сделали все MCP-серверы взаимно подключаемыми. Демо Val Town соединяется с 3613 сервисами и после копирования работает без единого заведённого клиента (Val Town).

funes — долговременная память для кодинг-агентов, которой владеете вы. Хранит и достаёт истории сессий между разными машинами и разными агентами: Claude Code, Codex, pi, Hermes. Работает на локальном индексе и векторах, внешних зависимостей не требует. Полезно тем, кто прыгает между агентами и машинами и каждый раз заново объясняет контекст (Hugging Face).

NVIDIA PAIR — бесплатный открытый маршрутизатор, который превращает домашнюю сеть в маленький дата-центр. Встаёт между Ollama или LM Studio и вашими машинами и раскидывает задания на свободные. Менять существующих агентов и приложения не нужно. Работают GeForce RTX от 20-й серии, рабочие станции RTX Pro, DGX Spark и Apple от M4. В демо кластер из трёх устройств прогнал задачу с пятью субагентами меньше чем за 9 минут против 18 на одном ноутбуке (NVIDIA).

MAI-Transcribe-2 — новая модель распознавания речи от Microsoft: 10 центов за час аудио, 60 языков, разметка говорящих, настраиваемые стили расшифровки и отметки времени по словам. Компания заявляет превосходство над Gemini 3.5 Transcribe, GPT-Transcribe и Whisper V3-Large. Стратегия Microsoft видна невооружённым глазом: строить свои передовые модели по одной модальности за раз и последовательно вытеснять ими технологии OpenAI из своих продуктов (Microsoft).

Runway GWM Worlds 2 — модель мира, которая генерирует интерактивные среды в реальном времени: 720p, 24 кадра в секунду, звук 48 кГц. Вы управляете миром текстовыми действиями и движением камеры, сессия продолжается с каждого ввода без заранее заданной длительности. Любопытно даже без прикладной задачи — просто чтобы понять, как далеко ушла генерация (Runway).

Grok Bot для компаний — постоянно живущие агенты, которые получают облачные компьютеры и учатся рутине, посмотрев на неё один раз. Умеют передавать контекст другим ботам. Каждый пользователь работает в своём изолированном окружении, и по умолчанию у бота нет никакого доступа — он дотягивается только до тех аккаунтов, в которые вы его залогинили. Корпоративным клиентам Grok и Cursor две недели бесплатно (xAI).

Microsoft Project Zenith — урезанная Windows 11 для разработчиков, собранная под запуск больших моделей локально. Гоняет модели на 30 млрд параметров и больше без лимитов на использование, с предустановленными наборами инструментов. В комплекте разумные умолчания: полные расширения файлов, показ скрытых. Требует 64 ГБ оперативной памяти и сперва выйдет только на дорогом мини-компьютере AMD Ryzen AI Halo (Engadget).

HEIR — открытый компилятор гомоморфного шифрования от Google. Гомоморфное шифрование простыми словами: сервер считает прямо на зашифрованных данных и не узнаёт про них ни бита. HEIR научился компилировать реальные обученные модели, и вышел репозиторий с четырьмя работающими демо. Детектор мошенничества по картам считается 2 секунды на зашифрованных данных против 0,5 миллисекунды на открытых. Это замедление в 4000 раз на одном ядре. На видеокарте уровня H100 разрыв падает до 50 раз. Приватного ChatGPT из этого пока не выйдет: ключи на большие модели весят сотни гигабайт на пользователя (Jeremy Kun).

Zite даёт ChatGPT, Claude, Cursor и другим агентам одну общую базу данных и общий слой прав, куда они могут писать напрямую. Решает знакомую боль: у каждого агента своя песочница, и результат работы одного не виден другому (Zite).

Hermes Desktop от Nous Research берёт на себя возню с локальным ИИ. Ставит нужный софт для запуска модели, подбирает модели под ваше железо и управляет памятью. Хорошая точка входа, если хочется попробовать локальные модели, но не хочется читать три часа документации (Nous Research).

Town добавляет вашего личного помощника в групповые чаты. Он сверяет календари участников, исследует варианты и бронирует или покупает после вашего одобрения. Бесплатный тариф есть, дальше $15 в месяц. Приятный ответ на тезис Итана Молика о том, что «многопользовательского ИИ» пока не построили (Town).

Gemini Spark в Google Фото по одному запросу находит, улучшает, раскладывает и готовит фотографии к отправке. Две детали, которые делают это пригодным к жизни: оригиналы остаются нетронутыми, а перед отправкой запрашивается подтверждение (Google).

Amazon учит Alexa распознавать мошеннические письма. Покупатель может спросить, действительно ли подозрительное письмо или сообщение пришло от Amazon, а система сверит его с миллиардами сообщений, которые компания рассылает: отправитель, содержание, время, метаданные. Мотив прозаичен — около 360 тысяч человек в год пишут в поддержку с вопросом «это вообще от вас?». Редкий пример, когда ИИ применяют для защиты покупателя, а не для персонализации (Amazon).

Choicely собирает полноценные приложения для iOS и Android через обычный чат. Стартовать можно с сайта, идеи, картинки или готового шаблона под интернет-магазин, новости, спорт или телешоу. Внутри есть механики вовлечения — голосования и конкурсы. Есть бесплатный тариф (Choicely).

Vendo — открытый слой настройки, который встраивает агента внутрь вашего продукта, чтобы клиенты сами собирали себе экраны, автоматизации и микроприложения, не дожидаясь вашей дорожной карты. Изучает вашу кодовую базу, тему оформления и API одной командой, а сгенерированный интерфейс остаётся в рамках бренда и прав доступа. Подключаются Gmail, Slack и GitHub (Vendo).

CodeLook — мгновенный предпросмотр файлов кода в macOS с подсветкой синтаксиса через Tree-sitter и 700 с лишним темами. Всё локально, разовая покупка без подписки. Мелочь, а экономит десятки открытий редактора в день (CodeLook).

Прочие находки 05.09. Cerebras открыл каталог моделей на публичных точках доступа. Software World от MIT CSAIL сажает постоянно живущих агентов в поддельный GitHub — сопровождать пакеты, заводить задачи, проверять чужие правки и проходить скрытые тесты. WorldAgents строит исследуемые трёхмерные сцены, скоординировав существующие модели генерации и чтения картинок, без обучения новой модели мира. Atlas от World Labs — новая модель мира в раннем доступе. Realtime-TTS-2 от Inworld вышла в общий доступ.

Inline — чат с ветками для совместной работы людей и агентов, поддерживает MCP и плагины, пока бета для macOS и iOS. Chalked готовит черновики ответов на письма с учётом видимого треда и живого календаря. Perplexity for Stripe создаёт проект и ключ за вас, убирая копипаст доступов. ComfyUI Forward Deployed Creatives отправляет живых художников внутрь компаний строить генеративные конвейеры и учить внутреннюю команду.

Новости и тренды

Nvidia закрыла покупку Hugging Face за $12,93 млрд. Мы писали об этой сделке 4 сентября, теперь известна цена — вторая по величине покупка в истории компании. Платформа хостит 3 млн моделей и обслуживает больше 18 млн разработчиков. Дженсен Хуанг пообещал, что она останется открытой и вычисления Nvidia не станут обязательными (Nvidia).

Производитель чипов, живущий на закрытых облачных моделях, купил главную площадку открытых. Логика простая: чем больше компаний крутят модели у себя, тем больше карт им нужно. Георгий Герганов, автор llama.cpp, успокоил сообщество: Nvidia пишет код в проект больше года, аппаратная нейтральность остаётся основным принципом, «development and support of all backends will continue to be done as usual». Реакция в ответах была ожидаемой: «Yeah we trust Nvidia to invest a lot of ressources in improving AMD support» (тред).

Корпорации подсаживаются на открытые модели. AT&T годами строила всё на Anthropic и OpenAI. В мае открытые модели давали 20% её работы с ИИ, сейчас 40%, а в ближайшие месяцы может стать 60%. Работают с Gemma от Google и Llama от Meta; китайские модели изучают, но не используют из-за регуляторики (NYT).

Anthropic и OpenAI остаются золотым стандартом для сложных рассуждений и кода, но их доля в корпоративном потреблении сжимается. Смотреть в сторону открытых моделей стоит там, где есть объём и повторяемость: расшифровка, пересказ, классификация, извлечение данных, шаблонный код. Там разрыв почти не чувствуется, а счёт падает в разы. По данным Ramp, за платформы для запуска открытых моделей платят 6,1% использующих ИИ компаний — год назад было около нуля.

Президент OpenAI объявил наступление эры общего ИИ. О выходе GPT-6 Astra мы писали вчера. Новое — риторика. Грег Брокман сказал, что назвать Astra первым общим искусственным интеллектом разумно, и закрыл брифинг словами «Welcome to the AGI era». Он ждал, что AGI придёт одним драматическим моментом, а теперь считает, что тот пришёл по частям (Axios).

Общепринятого теста на AGI нет, поэтому заявление топ-менеджера — это позиция, а не факт. Полезнее смотреть на замеры — они выше, в разборе индекса Artificial Analysis. Доступ открывают медленно, и глава Codex обещал компенсировать лимиты за дни без доступа. Отдельная строка в системной карте: письменные рассуждения Astra стали хуже поддаваться наблюдению — это часть объяснения, почему доступ дают порциями.

Google научился обновлять прогноз погоды каждый час. WeatherNext 3 использует живые спутниковые снимки и обходит и конкурирующие модели, и метеослужбы США и Европы. Детализация по температуре выросла примерно впятеро — до 5 км, этого хватает, чтобы различать отдельные долины и береговые линии. Ошибки по осадкам упали до 60% относительно спутниковых данных, суточный прогноз дождя стал лучше до 50%. Модель встраивают в Поиск, Карты, Gemini и Earth (Google).

Это тот случай, когда ИИ приносит пользу, которую никто не замечает как ИИ. Раньше модели учились на прогонах физических моделей, приходивших с задержкой в шесть часов. Теперь данные идут живьём. Практический эффект вы увидите не в чате, а в приложении погоды на своём телефоне.

Схема WeatherNext 3: живая спутниковая мозаика и анализ на входе, на выходе плотные сетки прогноза, осадки, станции и треки циклонов
Схема WeatherNext 3: живая спутниковая мозаика и анализ на входе, на выходе плотные сетки прогноза, осадки, станции и треки циклонов

Thinking Machines поднимает $1 млрд при оценке $40 млрд. Раунд ведёт Accel. Год назад компания Миры Мурати рассчитывала на оценку в $50 млрд (TechCrunch).

Оценка ниже прошлогодних ожиданий — редкий сигнал в этой отрасли. Инвесторы начинают различать «команда из бывших сотрудников OpenAI» и «продукт с выручкой». Их модель Inkling в индексе Artificial Analysis набрала 32 балла против 57 у лидера, и это, похоже, посчитали.

Пентагон подтвердил чёрный список Anthropic. Высокопоставленный чиновник министерства обороны подтвердил, что запрет в силе, несмотря на публичные комментарии министра торговли Латника в обратном духе (Axios).

Мы отмечали 4 сентября, что Латник говорил «We trust Anthropic». Расхождение между ведомствами показывает, что политика по отношению к лабораториям в США пока не единая, и коммерческие последствия для Anthropic всё ещё открытый вопрос.

Google и HHMI Janelia собрали полную карту мозга самца дрозофилы. Больше 166 тысяч нейронов и 125 млн связей — крупнейшая карта проводки нервной системы на сегодня (Google Research).

Прямой пользы завтра не будет, но это ровно тот класс задач, где машинное зрение вытянуло невозможное: вручную такую реконструкцию не сделали бы никогда. Мозг мухи — первая полная нервная система, где можно проверять теории о том, как из связей получается поведение.

Военные США отключили рекламные трекеры на телефонах. Минобороны отключило рекламные идентификаторы на многих телефонах и компьютерах после публикаций о том, что продаваемые торговцами данными геоданные использовались для наведения на американских военных на Ближнем Востоке. ВВС отключили идентификаторы около двух месяцев назад. Армия блокировала их на Windows ещё до 2021 года, а на Apple и Android — только с февраля 2026 (Guardian).

История про вашу приватность, а не только про армию. Тот же рекламный идентификатор есть в вашем телефоне, и он тоже продаётся. Отключается в настройках приватности за две минуты — на Android это сброс и удаление рекламного ID, на iPhone запрет отслеживания приложениями.

Google обсуждает лицензирование контента Голливуда для обучения моделей. По сообщениям, речь о выплатах порядка $40 млн одной студии за права, привязанные к одному персонажу (источник).

Индустрия переходит от судов к контрактам. Для авторов это первый намёк на реальную цену прав в эпоху генерации. Для зрителей — вопрос, что случится с персонажем, когда права куплены и модель может производить его бесконечно.

Терренс Тао предупреждает: ИИ выдаёт доказательства быстрее, чем люди успевают их понять. Математик обращает внимание на разрыв между скоростью производства результатов и скоростью выстраивания интуиции вокруг них (видео).

Ровно тот же разрыв виден в разработке: код появляется быстрее, чем команда успевает понять систему. Вывод Тао полезен шире математики — ценность смещается от объёма выдачи к суждению и вкусу, то есть к умению выбрать, во что вкладываться.

Пять заблуждений о влиянии ИИ на рынок труда. Разбор, который стоит прочитать всем, кто планирует карьеру. Занятость не падает линейно вслед за автоматизацией. Способность модели не равна выгодности: рассуждение — переменные затраты, и дольше думающая модель стоит дороже человека. Падение спроса на труд бьёт не по занятости, а по ставке (LessWrong).

Планируйте не под сценарий «останусь без работы», а под сценарий «работа останется, ставка упадёт». Подушка нужна не от полной безработицы, а от долгого перехода с понижением дохода. Ставьте на две зоны: где рассуждение дорого — медленная аналитика и ответственность за решение, и где велики издержки встраивания ИИ — работа с людьми, физический мир, репутация, доступ.

Тезис дня: публикуйте свои тексты, разбираться будут чужие ассистенты. Автор отзывает свой прежний совет «пишите меньше, не засоряйте архив». Аргумент: модели становятся личными библиотекарями, которые прочёсывают интернет ради нишевых текстов под интересы конкретного человека, и стоимость чтения ложится на них (LessWrong).

Возражение «кому это надо» больше не работает: решать будет не редактор и не вы, а чужие ассистенты с почти нулевой ценой прочтения. Обратная сторона для читателя: качество вашей ленты теперь ограничено тем, насколько хорошо ваш ассистент понимает лично вас.

Дыру в Rails эксплуатировали через восемь часов после патча. Уязвимость в обработке вариантов изображений в ActiveStorage даёт чтение произвольных файлов и выполнение кода, оценка 9,5 из 10. Готовый пример атаки через испорченный BMP-файл выложили на GitHub ещё до того, как многие успели поставить заплатку (Rietta). Урок общий: сам код исправления и есть раскрытие уязвимости. Если у вас Rails с ActiveStorage — обновляйтесь сегодня, а не в следующем спринте.

MikroTik выпустил «тихий» патч, и его разобрали за сутки. Компания молча выкатила RouterOS 7.23.4, 7.24.2 и 6.49.21 с формулировкой «важное обновление, детали пока не публикуем». Исследователь сравнил прошивки и нашёл подделку подписи при малой экспоненте и подъём прав до полного администратора через SSH (разбор). Мысль автора стоит запомнить: «silence is not secrecy. If you patch in public, you disclose in public». Если у вас MikroTik — обновитесь и проверьте /system/device-mode/print.

Коротко. Федеральные регуляторы начали расследование по развёртыванию беспилотных такси Tesla Cybercab — мы писали о запуске 4 сентября (TechCrunch). Марк Цукерберг в частном разговоре с Дональдом Трампом высказался против идеи создать ИИ-надзорщика по образцу финансового регулятора (Livemint). Adobe назначила Чакраварти генеральным директором (Constellation). Против Apple подан иск в Великобритании на £2 млрд из-за прозрачности отслеживания в приложениях (Apple Post). DeepSeek готовит крупный заказ чипов Huawei под новый дата-центр во Внутренней Монголии (TNW). Nvidia назначила октябрь датой запуска компьютеров RTX Spark (Reuters).

Бенедикт Эванс напоминает: ИИ позволяет автоматизировать бесчисленные задачи, но понять, какие именно задачи стоит автоматизировать, по-прежнему тяжело, и организационные перемены идут медленно (Ben Evans).

Откомментируйте первым 👇

😎

Автор поста открыл его для большого интернета, но комментирование и движухи доступны только участникам Клуба

Что вообще здесь происходит?


Войти  или  Вступить в Клуб