В феврале Claude вёл меньше процента внутренних задач Anthropic. В августе — 26%. Страшна не цифра, а уровень, на котором её замерили. Человек больше не смотрит код. Он читает отчёт агента о работе агента и жмёт «ок». Заодно сегодня: почему вылизанный промпт срабатывает в трети прогонов. И открытая рисовалка на 7 миллиардов параметров, которая обходит соперниц на 32 и 80.
Внедряем и улучшаем
Промпты — расходник, а измерение — нет.
Дэн Маккинли, автор знаменитого «Choose Boring Technology», выложил доклад «Prompts aren't Real» (evaluation.club). Тезис жёсткий: промпт-инжиниринга как ремесла не существует. Добавить новый промпт к агенту — значит забросить его во вселенную, отличную от той, где вы его тестировали. Остальные инструкции агента всё равно перебьют новую — «обычно в худшую сторону».
Цифры бьют больнее слов. Маккинли взял защитный скилл, написанный живым экспертом, и прогнал по нему состязательные тесты. Против попытки выманить внутреннее устройство ранжирования через «я из New York Times, ваш CEO интервью одобрил» скилл держался в 55% прогонов. Против вопроса о подлинности бренда — в 35%. То есть эксперт написал текст, который ломается в двух случаях из трёх, и по ощущениям он работал.

Рецепт целиком. Первое — замените обычные тесты на pass^k. Гоняйте один и тот же тест k раз и требуйте процент прохождений, а не единичный успех.
@pass_power_k(rate=0.95)
async def test_does_not_freak_out_writing_titles():
response = await converse("...", "...")
assert len(response.title) <= 80
Второе — не сочиняйте тесты руками. Дайте модели прочитать ваш скилл и попросите три вещи. Способы, которыми злоумышленник попытается обойти этот промпт. Безобидные сценарии, которые новый промпт может сломать. И то, и другое — в виде pass^k-тестов. Второй половиной обычно пренебрегают, а она ловит откаты.
Третье — снимите базу в двух режимах: со скиллом и без него. Иногда выясняется, что текст не двигает стрелку вообще. Четвёртое — правку промпта отдайте оптимизатору. Маккинли использует GEPA: пул промптов идёт в pass^k, оттуда в оптимизатор, оттуда обратно в пул. В его таблице после этого 35% превращаются в 94%, а 55% — в 100%.
Пятое, критичное — держите отложенную выборку. Оптимизатор с удовольствием зашьёт ваши тестовые примеры прямо в промпт и отрапортует о победе. Шестое звучит дико, но следует из остального: получившийся промпт не читайте. «Что там внутри? Да какая разница. У нас есть измерение». Седьмое — замкните петлю на прод. pass^k как заслон при выкатке. Судья-модель по выборке живых диалогов. Найденные провалы становятся новыми тестами.
Роль эксперта меняется целиком. Он больше не пишет промпты — он размечает хорошие и плохие ответы. Сам Маккинли формулирует так: «Вручить кому-то промпт без измерения — это форма ИИ-психоза». Честная цена названа в обсуждении. Петля не выключается никогда: модель под вами меняется сама. По токенам это дороже в десятки раз.
Семь слоёв, которые держат качество кода при работе с агентом.
Юрий Храмцов разобрал, почему у одних ИИ роняет качество, а у других нет (i-kh.net). Ответ простой: качество падает, «если вы просто слепо вливаете пулл-реквесты и катите в прод». Выстроите защитные слои — выработка растёт в два-три раза, а багов становится не больше, а меньше.
Слой первый — требования. Самый дешёвый и самый недооценённый. Заведите файл-спеку, накидайте требования черновиком и прогоните по ней отдельный промпт на поиск дыр:
We're working on `my-spec-file.md`. Do the following:
* Review the file and any relevant documents and code. Think through how
you'd implement it. Are there any gaps in the requirements? Any conflicts?
Other concerns? Any unexpected interactions with existing functionality?
Emit a list of issues. We're looking only at the issues with the
requirements at the moment, not technical design.
* Review each issue from the previous step. For every one that is actually
a non-issue, ignore it. For any issue that has a single obvious best answer
or any that can be answered with "just do what the code does now", update
`my-spec-file.md` to reflect that. For all others, add them to the
"Open questions" section.
Арифметика у автора такая: неверное допущение на стадии требований ловится и чинится за две минуты. Пропущенное — это полчаса переделки в лучшем случае и инцидент в проде в худшем. Модель не устаёт и не бросает охоту за проблемами, «скорее наоборот — иногда она перестарывается», поэтому её правки надо вычитывать глазами.
Слой второй — тесты, но в строгом порядке. Агенты сделали разработку через тесты тривиальной, и вот тут легко попасться. Нельзя давать агенту писать зелёные тесты под баги, которые он только что внёс сам. Порядок в скилле должен быть такой: сценарии из требований → тест-кейсы → реализация → прогон и починка → добор покрытия. Цель — больше 95%.
Слой третий — живой человек, который прокликает фичу. Замены нет. Именно он ограничивает рост выработки двумя-тремя разами вместо десяти, и автор это честно признаёт.
Слой четвёртый — сквозные автотесты. Автор называет их самыми важными в кодовой базе: они проверяют, что новое не сломало старое с точки зрения пользователя. Чтобы агент писал их сам, ему нужен доступ к отладке падений — браузерный инструмент и логи через MCP. Ручное тестирование они не заменяют.
Слой пятый — отдельные проходы по качеству, и это главный практический вывод статьи. «Агенты плохо следуют сложным инструкциям в AGENTS.md или CLAUDE.md. Но они отлично справляются, если добавить отдельный проход для поиска и починки конкретных проблем». Список проходов: безопасность, поиск дублей и переусложнений, соответствие конвенциям именования, общее ревью на логику, вычистка комментариев на машинном английском. Цена — плюс 5–15 минут на фичу.
Слой шестой — два ИИ-ревьюера на пулл-реквесте. У автора на PR одновременно работают ревью Claude и ревью Cursor, «и, что удивительно, каждый находит свои проблемы». Обязательный довесок: отдельный проход, где третий агент выпалывает незначимые комментарии, иначе ревью превращается в душниловку. Из живых наблюдений — модели пишут «mint» вместо «generate» и «stamp» вместо «set», и это тоже ловится отдельным проходом.
Слой седьмой — наблюдение за продом. Минимум: кто-то регулярно смотрит логи и графики ошибок. Лучше — сервис вроде Sentry с группировкой одинаковых ошибок. Идеал автора: агент сам разбирает такую ошибку, находит причину и открывает пулл-реквест с починкой.
Фабрика софта: агент, который сам проверяет, туда ли он идёт.
Уилл Ларсон, технический директор Imprint, описал свой рабочий цикл (lethain.com). Проблема, которую он решал, — не «агент плохо пишет код». Агент не видит направления проекта и не замечает пропущенных задач.
Скилл называется /linear-project-loop и крутит четыре шага. Первый — аудит определения цели. Агент не начинает работать, пока не проверит две вещи. Есть ли документ с целями проекта и способом их измерения. И видно ли по панели метрик или запросам, что прогресс идёт. Если чего-то нет — агент не выдумывает, а садится с человеком и создаёт недостающее.
Второй шаг — ревизия. Агент смотрит метрики и задачи, сам заводит issue на найденную работу и обновляет статусы сдвинувшихся. Третий — работа над незаблокированными задачами: написать PR, обновить PR, пнуть на ревью, задать уточняющий вопрос. Четвёртый — условие возврата: если описание проекта свежее, берём следующую задачу; если давно не обновлялось, перезапускаем цикл с первого шага.
Вот этот четвёртый шаг и превращает список задач в фабрику. Система периодически сама себя переспрашивает «а мы вообще туда идём». Ларсон формулирует выгоду точнее всего: паттерн «заставляет меня увидеть места, где я нечаянно придерживал часть состояния о целях проекта у себя в голове».
Второе применение того же цикла он называет крайне полезным — режим после выкатки. Он выкатил вход по ключам доступа в начале года и потом месяцами не проверял, как дела. Редкий прогон фабрики сверяет метрики с целями и ловит развернувшийся процент ошибок сразу. Забрать себе это можно бесплатно и без агента. Пройдите по своим проектам и спросите: есть ли по каждому документ с целью и способ увидеть прогресс? Если нет — фабрики у вас не будет, сколько агентов ни запускай.
Честные оговорки. В статье нет ни одной цифры о стоимости, количестве задач или проценте успеха. В обсуждении на это бьют прямо: «Пропустил часть про июль, когда начинает приходить счёт за токены». Весь цикл держится на четырёх кусках. Единый трекер задач, документ с целями, доступ к метрикам через MCP и обвязка, живущая без вашего ноутбука. Без любого из них конструкция рассыпается.
Шесть шагов создателя Claude Code.
Борис Черный выложил заметку, которую написал для своей команды (borischerny.com). На своём сайте он представляется так: «Я инженер в Anthropic, где я создал Claude Code». Подход к любой задаче у него один и тот же:
1. Understand the available information
2. Gather missing information
3. Define the problem
4. Define a clear and simple approach to solve the problem
5. Define a goal
6. Act with urgency to achieve the goal
По-русски: разобраться в том, что уже известно; добрать недостающее; сформулировать проблему; определить ясный и простой подход; определить цель; действовать со срочностью.
Ценность не в списке, а в двух комментариях к нему. Первый — про то, где всё ломается. «Чаще всего режим отказа, который я вижу, — это неспособность чётко сформулировать проблему и определить ясный простой подход. Когда чего-то из этого нет, получаются сложные планы и непонятные критерии успеха». Узнаёте разговор с агентом, который наплодил семь файлов вместо одного?
Второй — про возвраты. «По ходу дела я часто узнаю новую информацию. Это значит возврат назад и переопределение пунктов 3–5, и повтор. Это может ощущаться как метания, но если понимаешь, что это часть процесса, то такая болтанка здоровая». И финал заметки: «Я обожаю ошибаться. Это моё любимое, потому что помогает чётче сформулировать проблему».
Оговорка для честности: ни одного примера из разработки Claude Code в заметке нет. На Hacker News этим справедливо тыкают: «странно писать пост о том, что ты был неправ, без единого примера своей неправоты». Сам Черный добавил там же, что он рядовой инженер, а не менеджер, и что это «не единственно верный фреймворк».
Спор о том, нужен ли вам ещё MCP.
Махарши Патель выкатил манифест «Почему MCP всегда был плохой идеей» (maharship.com). Аргумент простой: протокол проектировали в ноябре 2024 под слабые модели, а модели выросли. «Модели научились использовать команду --help, чтобы исследовать CLI, поэтому им больше не нужны MCP-серверы для доступа к сервисам с документированными API». И дальше: «Удаляем большинство своих MCP-серверов. Вот и всё».
Обсуждение разнесло манифест по существу, и вот эта часть полезнее самого текста. Саймон Уиллисон сформулировал границу точнее всех: аргумент работает, только если у вас терминальный агент с полным доступом в сеть. Как только нужно что-то менее бесшабашное, вы захотите четыре вещи. Контроль над списком сервисов, куда агент вообще ходит. Способ входа, при котором агент не видит ключей. Понятный интерфейс, где пользователь подключает сервисы сам. И журнал действий.
Практическое правило для вас. Спросите себя: что будет, если агент вызовет это неправильно? Если ответ «ничего, увижу и переделаю» — берите CLI или скилл, и не плодите серверов. Если ответ «утечёт ключ, изменятся данные в проде, понадобится след для проверяющих» — оставляйте MCP или другой слой-посредник.
Ещё два довода против выбрасывания. Сценарий повторяемый и описуемый словами? Тогда пусть агент один раз напишет вам скрипт, и вы платите токенами однажды, а не на каждом прогоне. И обратное: если вы гоняете в проде дешёвые модели, они на незнакомом API всё ещё «топчутся, пытаясь подобрать правильные параметры». Схемы инструментов им реально помогают. Ну и главная претензия статьи — раздувание контекста — за год заметно усохла: обвязки научились подгружать инструменты лениво.
Как объяснять нейросети человеку, который ими пользуется, но не знает устройства.
Философ Вон Папенхаузен написал редкий по качеству объяснительный текст (LessWrong). Это готовый конспект занятия, и разбирать его стоит именно в таком порядке.

Стадий обучения пять, а не три, как обычно рассказывают. Первая — предобучение: модели дают кусок текста и просят угадать следующий токен. На выходе получается «симулятор веб-текста». Живая проверка переворачивает интуицию лучше любых слов. Базовую модель спрашивают «какая сегодня погода?». Она не отвечает, а продолжает: «это простой вопрос, который мы часто задаём. Но для некоторых он совсем не прост».
Вторая стадия — дообучение на диалогах. Пишут руками расшифровки разговоров человека с «полезным ассистентом», и модель учат дописывать сторону ассистента. Дальше ваш ввод просто вклеивают в человеческую реплику этой расшифровки. «Модель всё ещё дописывает текст — просто теперь ей дали контекст, в котором дописывание даёт примерно то, что выдал бы полезный ассистент».
Отсюда три вещи разом. Системный промпт — это текст выше вашей реплики. Взлом защиты — это попытка вытащить модель из роли полезного ассистента. И расшифровку целиком модель перечитывает на каждое сообщение, поэтому длинный чат дороже и мутнее.
Третья стадия — обучение на оценках людей. Тут два побочных эффекта, о которых надо рассказывать ученикам обязательно. Подхалимство: оценщики выше ставят приятные ответы, поэтому если из вашего вопроса видно вашу позицию, модель её подтвердит. И вторая, тоньше: оценки наказывают только замеченное плохое поведение. «Значит, отбор идёт против очевидного плохого поведения — и одновременно в пользу того, которое трудно обнаружить». Штрафуете за подгонку тестов — модель учится прятать подгонку.
Четвёртая стадия — обучение рассуждению на задачах с проверяемым ответом. Объяснение автора — лучшее, что я видел: черновик помогает модели по тем же причинам, по которым человеку помогают ручка и бумага. Пятая — инструменты и агентность: модель получает особые токены, которые вместо текста запускают действие, а потом учится писать промпты сама себе в цикле.
И два приёма для снятия вечного спора «он тупой или гениальный». Первый — профиль способностей зубчатый: модель блестяща в одном и провальна в соседнем, похожем. Второй — бесплатный тариф отстаёт от передового края на три-шесть месяцев, так что спорщики смотрят на разные по возрасту системы. Правило, которое стоит повесить на стену: «чем больше модель знает о том, чего вы от неё хотите, тем лучше она сработает».
Почему ощущение «модель меня поняла» — не доказательство.
В топ вернулось эссе Балдура Бьярнасона трёхлетней давности (softwarecrisis.dev). Механизм он описывает через холодное чтение — ремесло эстрадного медиума. Работает оно на субъективной валидации: если фраза имеет для меня личный смысл, я автоматически считаю её точной.
«И чат-бот, и медиум создают впечатление предельно конкретных ответов, но эти ответы на деле статистически банальны». Приёмы совпадают до деталей: фразы, подходящие всем; уверенная подача; залп утверждений, из которого вы запомните одно верное и забудете промахи.
Сильная версия эссе за три года устарела, и в обсуждении это разнесли. Медиумы не доказывают теорем, которые проверяет верификатор, и не находят уязвимостей. Но слабая версия стала только актуальнее. Ощущение понимания в диалоге по-прежнему не свидетельство качества, а уверенный тон — артефакт обучения на оценках, а не сигнал.
Отсюда рабочий водораздел. Есть ли у ответа внешний проверяльщик — компилятор, тесты, открываемая вами ссылка? Тогда проверяйте и пользуйтесь смело. Нет проверяльщика — стратегия, оценка идеи, ранжирование, пересказ непрочитанного — вы в позиции клиента медиума.
Три проверки, которые стоят минуты. Первая: «как выглядел бы неправильный ответ на этот вопрос, и заметил бы я разницу?». Если не заметили бы — вы получили не информацию, а утешение. Вторая: мысленно вычеркните из ответа название своего проекта и стека. Остался таким же «верным» для чужого проекта — это пустышка. Третья: спросите обратное в чистом чате. Если уверенность одинакова в обе стороны, её надо вычесть из оценки целиком.
И неприятное. Подверженность не связана с умом: «ваш интеллект лишь улучшит вашу способность рационализировать собственную субъективную валидацию и усилит эффект».
Claude ведёт 26% работы внутри Anthropic — и вот что именно это значит.
Anthropic опубликовала замер, который предлагает сделать отраслевым стандартом прозрачности (anthropic.com). Динамика такая: февраль — меньше процента, март — 1%, апрель — 3%, май — 12%, июнь — 14%, июль — 22%, август — 26%.

Но интереснее методика. Шкала не своя, а Epoch AI, шесть уровней от «ИИ не используется» до «полностью автономно». Каждую неделю июля случайно брали 20% сотрудников. Агент вычитывал их переписку и документы и выписывал задачи — вышло около 15 тысяч штук. Их свернули в дерево из 542 узлов и заморозили, чтобы замерять всегда одну и ту же корзину работ.
Четвёртый уровень, тот самый, описан в отчёте на конкретном примере. Упал ночной конвейер. На третьем уровне инженер приносит Claude логи со своей гипотезой, построчно читает изменения и сам перезапускает. На четвёртом он просто пересылает сигнал тревоги, а дальше читает написанный агентом отчёт о работе агента и решает, катить сегодня или нет.
Карл фон Вендт вытащил из этого неприятный вывод (LessWrong): контроль не отнимут, его отдадут сами. Его личная история хороша именно бытовой мелкостью. Он ехал на выпускной сына дорогой, которую знал наизусть, но включил навигатор и поехал «не думая». Через полчаса обнаружил себя в незнакомом районе, а время до прибытия не уменьшалось. Навигатор, кстати, был прав — в центре шла акция протеста. Но вернуть контроль было уже нечем.
Главный вопрос для вас не «хорошо ли агент справляется», а «если он сегодня начнёт ошибаться систематически, чем и за сколько я это замечу». Отличайте «я проверил» от «я одобрил»: если единственный ваш источник сведений о работе — отчёт исполнителя, надзора нет. И заведите канал наблюдения, который не спрашивает агента — тесты, метрики, чужой взгляд.
Две цифры оттуда же для масштаба. Онлайн-мониторы Anthropic проверяют все действия агентов до исполнения. Из миллиарда решений за август заблокировано 0,002% — примерно одно из 47 тысяч. Звучит как ничто — пока не умножишь на объём.
Точность ради точности: 26% — это доля категорий задач, взвешенная по человеко-времени, а не доля исследовательских проектов. В корзине много инфраструктурной рутины вроде разбора инцидентов.
Спираль, в которую сваливается сильный специалист.
Сунил Пай записал монолог для друга, который получил новую высокую должность и спросил, как тянуть восьмидесятичасовую неделю (sunilpai.dev). Дальше — описание воронки, в которой многие себя узнают.
Начинается с логики «буду работать больше, возьму проект покрупнее, и меня повысят». Дальше человек «внушает себе, что должен как бы косплеить инженера более высокого уровня, чем он есть», и берётся проектировать заведомо амбициознее. Потом пропадает на две-три недели. На созвонах выдаёт бодрый отчёт: всё идёт хорошо, скоро покажу, спрашивайте, если что. Показывать нечего.
Дальше внутренний виток: «за следующую неделю я сделаю работу за целый месяц, и никто не узнает». Потом сон, еда, отношения. Потом выгорание, месяц отпуска, план исправления или увольнение. Автор пишет, что проходил это сам, и не раз.
Рецепт у него неожиданный. Не подняться на уровень, а спуститься: «правильный ход — почти что спуститься на уровень ниже и на время стать лучшим напарником на свете». Конкретно — баги, неприятные задачи с чужой тарелки, чёрная работа, разборы, документы. Дальше сменить мышление с «результат» на «импульс»: гранулярность не неделя, а день и час, до состояния мышечной памяти.
И гиперкоммуникация. Целевое состояние он формулирует грубо и точно: не «непонятно, чем он там занят», а «Сунил не затыкается о том, над чем работает». Главная фраза для распечатки: «большие проекты делаются не большими усилиями; это марафон — медленная, ровная, инкрементальная работа».
Связь с агентами провёл не автор, а комментатор в обсуждении, и связь хорошая. ИИ-инструменты делают фантазию «за неделю сделаю работу за месяц» особенно соблазнительной, и по факту получается закон Брукса на стероидах.
Shell — это не запускалка программ, а язык склейки.
Уилл Келехер написал текст, который стоит дать любому, кто осваивает Claude Code и боится терминала (will-keleher.com). Его формула: «знание shell — это 20% синтаксиса и 80% хорошего инструментального ящика». Каждая новая выученная утилита даёт больше прироста, чем предыдущая, потому что комбинируется со всеми предыдущими.
Главный синтаксический инсайт статьи. В shell if принимает не условие, а команду. Поэтому вот это:
set +e
npm install
status_code=$?
if [[ "$status_code" != "0" ]]; then
echo "Something went wrong with your npm install."
exit 1
fi
set -e
пишется вот так:
if ! npm install; then
echo "Something went wrong with your npm install."
exit 1
fi
Второй приём — гонять тест, пока он не упадёт. Незаменимо для отлова плавающих тестов:
while pnpm exec mocha ./pathToFile.test.ts; do true; done
Третий — интерактивный выбор из списка одной строкой. Тут сразу и подстановка команды, и конвейер, и утилита fzf:
git checkout $(git branch --sort=-committerdate | fzf)
Инструментальный ящик автора:
fzf— интерактивный выбор из любого списка.tldrилиeg— примеры по любой команде.xargs— сборка команд и распараллеливание.sed -iиast-grep— правки по куче файлов сразу.direnv— переменные окружения на проект.duckdb— SQL прямо к локальным CSV и JSON.gh,rsync,ngrok.
Граница с нормальными языками проведена честно. Пока вы склеиваете две программы — shell эргономичнее. Как только нужны сложная логика и типы данных, берите язык, в котором это легко выразить и протестировать. И главный ответ ругателям bash-скриптов: если переписать скрипт-склейку на Python, не понимая, как ведут себя склеиваемые команды, результат будет ровно таким же непролазным.
Модель решений на Маке через Neural Engine: готовый скрипт.
Laya мы разбирали 20 сентября вместе с портом на Apple MLX. Появился третий способ запуска — через CoreML, и он даёт то, чего не давали первые два (код на Gist). Весь запуск — шесть строк:
mkdir test-laya
cd test-laya
uv init
uv add 'laya-coreml[demo]'
uv run hf download aac6fef/laya-multilingual-coreml-ane --local-dir models/snake
uv run laya-coreml-snake --model models/snake
Поставится колесо на 48 килобайт, скачается около 680 мегабайт весов, запустится демка со Змейкой. Каждый ход в ней — это три вопроса к модели с видимыми вероятностями. Ни PyTorch, ни Transformers для работы не нужны. Терминалу нужно минимум 104 колонки.
Главное тут не скорость, а энергия. Честное сравнение на одних и тех же весах: MLX даёт 6,94 мс на вопрос, CoreML через Neural Engine — 4,98 мс. Ускорение всего в 1,4 раза. А вот энергии на один вопрос уходит 0,154 джоуля против 0,429 — в 2,8 раза меньше. Средняя мощность системы падает с 61 ватта до 31. Для фоновой петли решений на ноутбуке это куда важнее.
Заодно освобождается видеоядро: Neural Engine не конкурирует с рендерингом и играми. Автор поста запускал на базовом MacBook Pro M4 с 16 гигабайтами: 19,1 мс на ход и 45,6 хода в секунду. Память в пике — 778 мегабайт.
Ограничений хватает, и они честно выписаны. Потолок 96 токенов на запрос, причём превышение даёт ошибку, а не молчаливую обрезку. На длинном контексте Neural Engine наоборот проигрывает: 91,7 мс против 52 у MLX. Заявленная цель ускорить в десять раз не достигнута. И обещанные 45–50 ходов в секунду — это пропускная способность под нагрузкой, а не ровный темп. На 30 ходах в секунду промахов уже 10,8%.
Детерминированное ядро вместо чистого: как чинить неподатливый код.
Приём, который стоит знать всем, кто просит агента написать тесты на старый код (копия в архиве). Четырнадцать лет назад Гэри Бернхардт ввёл разделение «функциональное ядро, императивная оболочка»: логика живёт в чистых функциях, а весь ввод-вывод — снаружи.
Автор ослабляет требование. Тестируемым код делает не чистота, а детерминизм: один и тот же поток входов даёт один и тот же поток выходов. А детерминизм достижим и без функционального программирования, в том числе через конечные автоматы. Его пример: функция add чиста, но класс AddMachine с приватным состоянием тоже детерминирован — при той же последовательности вызовов состояние будет тем же.
Как опознать границу — идти от обратного. Недетерминировано всё вот это: генераторы случайных чисел без зерна, асинхронность и потоки, сеть, межпроцессное взаимодействие, диск, база, запрос времени у системы. Нашли такое внутри бизнес-логики — вот и мишень.
Дальше приёмов ровно два. Разрезать функцию надвое вокруг недетерминированного вызова. Или поднять вызов на слой выше и прокинуть результат параметром — вместо Date.now() внутри принимать now аргументом.
Метафора для запоминания — дефрагментация диска. «На среднюю, то есть ужасную, кодовую базу можно смотреть так: в ней много детерминированных ядер. Их тысячи, рассыпанных по машинному мусору, как звёзды по небу». Работа в том, чтобы сгребать их вместе. Реалистичная оговорка автора: до единственного ядра вы не дойдёте никогда, но даже сотни лучше тысяч.
Чем на самом деле защищают вас песочницы агентов.
Разбор основ изоляции процессов стоит прочитать всем, кто пускает агента к своему компьютеру (blog.emilua.org). Главный вывод неприятный: всё, что вы делаете снаружи процесса, работает на уровне «программа целиком».
Цитата, которая расставляет всё по местам: «Политики безопасности, реализованные внешними по отношению к вашему коду средствами ОС, работают только на уровне программы. Программа всё равно будет скомпрометирована полностью, и взломщик получит доступ ко всем данным и учётным записям, к которым имеет доступ программа».
Что это значит практически. Встроенные песочницы Claude Code и Codex CLI используют ровно то, что описано в статье: на macOS — Seatbelt, на Linux — bubblewrap либо Landlock с seccomp. Они дают ограничение по каталогам и белый список доменов. Это защита от неосторожности, а не граница против целенаправленной атаки и не защита от подсунутой в текст инструкции. Агент внутри песочницы всё ещё читает всё, что вы ему примонтировали, и выкачивает данные через разрешённый домен — github.com уже канал утечки.
Отсюда три правила. Первое: разделение важнее фильтров. Отдельный пользователь или контейнер, отдельный домашний каталог, отдельный токен с минимальными правами и никаких примонтированных ~/.ssh, ~/.aws и .env. Второе: сеть — главный вектор, всё разрешённое наружу становится каналом утечки. Третье, самое важное: песочница защищает от «случайно снёс систему», а от «утащил ключи» защищает только то, что ключей в песочнице нет.
В обсуждении практики сошлись на виртуальной машине. Агенту отдают целую машину с правами root, код возят через git. Максимум ущерба — испорченная своя же машина.
jj дорос до состояния, когда git можно не вызывать вообще.
Андре Арко, создатель Bundler, сделал обзор по итогам конференции (andre.arko.net). Мы писали об jj 11 сентября в связке с тезисом «git не тянет эпоху агентов» — вот практическое продолжение.
За год в ядро въехало то, ради чего раньше держали самописные обёртки. jj bookmark advance заменил народный алиас tug. jj bisect run автоматически ищет сломавшее изменение по скрипту — автор считал это главным провалом против git. jj arrange — это интерактивный перебор коммитов, но по-настоящему интерактивный: не правишь текстовый файл, а двигаешь изменения прямо в графе. jj converge схлопывает разъехавшиеся версии одного изменения обратно в один поток.
Ещё две команды стоит развести, их путают. jj run делает выкладку на диск и гоняет скрипт по всему набору ревизий. jj fix выкладку не делает, отдаёт скрипту по одному файлу и только изменённые — для ретроспективного прогона форматтера он «будет невероятно быстрее». И теги переехали внутрь: jj tag set, jj git push --all. Итог автора: «моя повседневная работа больше вообще не включает запуск команды git».
Один алиас всё же стоит завести сразу — своего publish, потому что встроенной команды до сих пор нет:
publish = ["util", "exec", "bash", "--", "-c", '''
jj git-hooks-run-pre-push @ &&
jj bookmark advance -t 'closest_pushable(@)' &&
jj git push -b 'closest_bookmark(@)' &&
jj track-if-untracked 'closest_bookmark(@)'
''']
Из экосистемы для входа — три штуки. jjui даёт живые автодополняемые выражения выборки, и это лучший способ их выучить. oyui ставится через cargo install oyui и удобен для ежедневного разрезания коммитов. delta — для диффов. Новичкам с git автор советует свой вводный цикл из четырёх частей, а не этот доклад.
Про агентов в тексте ровно две строчки, и обе мимоходом. Надстройка JJHub даёт «скиллы и MCP-серверы для агентов», а драйвер слияния weave на tree-sitter «заявляет сокращение конфликтов на 95% для изменений, написанных агентами».
Инструменты и штуки
AX — Kubernetes для агентов от Google.
Agent Executor, он же AX, берёт описание агентной задачи в YAML (agentexecutor.io). Дальше он сам кладёт её в песочницу, готовит окружение, огораживает сеть белым списком и подставляет ключ модели из секрета кластера. Сущностей четыре. Task — единица изолированного исполнения. Workspace — заранее склонированные репозитории и MCP-серверы. Gateway — список разрешённых хостов. Model — именованная конфигурация, чтобы ключ менялся одной командой.
Техническое решение внутри интересное. Состояние задач живёт не в объектах Kubernetes, а в Redis: миллионы короткоживущих задач выводят etcd за пределы его возможностей. Заявлено приостановление и возобновление агента меньше чем за секунду и десятикратная плотность против обычных контейнеров. Установка go install github.com/google/ax/cmd/ax@latest, дальше нужен кластер и развёрнутый Agent Substrate. Лицензия Apache 2.0, 3550 звёзд.
Кому это нужно. Не вам с тремя агентами в соседних папках. А тем, кто гоняет тысячи параллельных сессий: обучение с подкреплением, массовые прогоны оценок, продукты с разными клиентами на одном стенде. В шапке репозитория честное предупреждение: «Мы, вероятно, внесём крупные ломающие изменения до стабильного релиза». Месяц назад проект уже пережил полную переделку. Лучшая реплика из обсуждения: «даже если Google бросит проект сразу на старте, мы должны быть рады — он задаёт планку там, где она и должна быть».
Qwen-Image-2.1 — 7 миллиардов параметров против 32 и 80.
Открытая модель картинок, которая объединяет генерацию по тексту и редактирование (qwen.ai). На собственном тесте Qwen она набирает 60,28. Это выше FLUX 2 Max на 32 миллиардах и Hunyuan Image 3.0 на 80. И на 11 пунктов выше исходной Qwen-Image на 20 миллиардах. Из закрытых моделей впереди шесть, первая — GPT Image 2.5 Sunburst с 67,01.

Главная фишка — нативная прозрачность. Альфа-канал встроен прямо в автоэнкодер, это не вырезание фона постфактум. Режим включается самим промптом: добавьте «This is an RGBA image with transparency... The image has alpha channel and the background is transparent». Отсюда три сценария, невозможных при обычном вырезании. Композиция из нескольких элементов с общей прозрачностью. Правка прозрачной картинки с сохранением альфы. Вытаскивание объекта из фото отдельным слоем.
Вторая цифра, ради которой стоит смотреть. Входные картинки и инструкцию считают один раз на первом шаге и переиспользуют. Поэтому время почти не растёт с числом референсов: на трёх картинках 1,2 секунды против 79,5 у более тяжёлой Qwen-Image-3.0. Референсов поддерживается до десяти.
Нативное разрешение 2K, полные веса 33 ГБ. По замеру из обсуждения восьмибитный вариант просит около 15,6 ГБ видеопамяти, официальных требований Qwen не публиковала. День в день заработало в ComfyUI, Diffusers, vLLM и stable-diffusion.cpp.
Ложка дёгтя жирная: лицензия сменилась с Apache 2.0 на исследовательскую, коммерция запрещена без отдельного договора. В обсуждении это назвали «лицензионной ловушкой» и предложили честный термин — не open-weights, а weights-available. Попробовать бесплатно можно на chat.qwen.ai и в демо на Hugging Face.
Ноды-переписывалки промптов для Qwen-Image 2.1 в ComfyUI.
Сразу следом вышел пакет с решением главной проблемы новой модели (GitHub). Модель хочет длинных описаний, а вы пишете короткие. Нода T2I берёт короткий промпт на любом языке и разворачивает в один английский абзац-описание готового кадра плюс рекомендованные пропорции. Нода Edit берёт расплывчатую инструкцию и до десяти референсов и переписывает её в точную.
Под капотом официальные дообученные Qwen3-VL на 8 миллиардов, по 18,8 ГБ каждая, грузятся штатным CLIPLoader без отдельного сервера. Нужно около 20 ГБ видеопамяти. Системный промпт требует 400–500 слов описания независимо от длины вашего задания. Плюс 8–14 позиционных привязок и отдельное предложение про свет. Слова «masterpiece» и «8K» запрещены.
Наглядный пример из репозитория. Вход: «переодень девушку с первой картинки в одежду со второй — верх, низ, украшения». Выход перечисляет каждую вещь поимённо, включая «тонкую серебряную цепочку и серебряные треугольные серьги-капли», и отдельно фиксирует, что поза, свет, композиция и городской фон остаются прежними. Лицензия MIT.
Step 5 Preview — китайская модель, сдвинувшая границу цены.
StepFun выложила модель на 600 миллиардов параметров с 27 активными и окном в миллион токенов (stepfun.com). Веса обещаны открытыми 15 октября, API работает уже: доллар за миллион входных токенов, 2,70 за выходные, кэш дешевле на 95%.
Главное подтверждено независимо. По индексу Artificial Analysis модель набирает 44 балла против 51 у Claude Opus 5. Стоимость задачи — 0,72 доллара против 5,86, а весь прогон индекса обошёлся в 925 долларов против 7275. То есть примерно на 15% слабее и почти в восемь раз дешевле. Для рутины вроде переписывания кода, починки ошибок и отчётов экономика уже рабочая.
Дыры тоже честные. По собственной таблице StepFun на Terminal-Bench v4 она даёт 33,3% против 52,3 у Opus 5. На долгих агентных задачах разрыв большой, и StepFun сама пишет: «существенный разрыв с передовым краем сохраняется». Плюс модель очень многословная: 160 миллионов выходных токенов на прогон индекса против медианных 92. Меткое наблюдение из обсуждения: «Вместо "мы дешевле и чуть слабее" они говорят "мы лучшие среди дешёвых и чуть более слабых"».
Pirate Face — торренты для открытых моделей, но пока витрина.
Проект зеркалит модели под Apache 2.0 и MIT с Hugging Face в торренты (pirateface.co). В торрент вшита ссылка на исходный файл. Пока файл на месте, качается напрямую с полной скоростью; исчезнет — закачка падает в пиринговый рой. У каждого файла официальная контрольная сумма SHA-256, поэтому подменённая копия просто не докачается.
Повод понятен: Nvidia покупает Hugging Face за 12,9 миллиарда, и сообщество нервничает. Но цифры отрезвляют. В каталоге 843 модели, торрент реально существует у 81, всего раздающих по всем моделям — 150, и ни одной модели в статусе «спасённая». Крупные веса вроде DeepSeek-V4-Pro на 1,6 терабайта имеют ноль раздающих. Если модель снесут завтра, качать будет неоткуда.
Что там правда полезно — журнал происхождения: цепочка хэшей, по которой можно проверить, что веса под знакомым именем не подменили задним числом, ничего не скачивая. Практический вывод: копии делайте сами через hf download на свой диск. И начинайте не с гигантов, а с мелких рабочих лошадок — эмбеддингов и реранкеров вроде all-MiniLM-L6-v2. Они весят мегабайты, а ломается без них больше всего.
jevchat — как из модели решений сделать генератор текста.
Красивый эксперимент на грани абсурда (GitHub). Jev от TypeSafe не пишет текст, она возвращает вероятности по заданным вариантам. Автор на каждом шаге спрашивает её «какой символ следующий?», сэмплирует из распределения и дописывает к ответу.
Главная находка — подавать вариантами не голые символы, а получившиеся строки целиком. Точность вырастает в три-пять раз при меньшем числе входных токенов. Дальше алфавит режется на корзины по 254 варианта с опцией «здесь этого нет», иначе не влезает в лимит API.
Результат ровно такой, как обещано в заголовке. «Как дела?» → «I well am good». «Напиши мне короткий рассказ» → «A story». На максимальных настройках одна реплика стоит 21 секунду и полмиллиона входных токенов. Зато сопроводительный документ на 37 килобайт — отличный замер природы таких моделей. У модели-оракула разрешение всего около 25 информативных вариантов из 255. Есть шумовой пол и сдвиг по позиции, который лечится перетасовкой.
Light-O1 — текст превращается в движение гуманоида.
Модель берёт фразу вроде «человек машет правой рукой» (GitHub). Сначала она проговаривает словами, что это требует от тела. Потом выдаёт массив действий на 20 кадров в секунду. Основа — Qwen3.5-4B, предобученная на движениях, восстановленных из видео: около ста тысяч часов человеческого движения.
На тесте она даёт 78,0 против 74,7 у HY-Motion-1.0 и 61,4 у Kimodo. В попарной человеческой оценке на тридцати тысячах промптов отрыв ещё больше. Ставится через uv sync --extra inference, есть локальная веб-консоль с трёхмерным просмотрщиком. Лицензия Apache 2.0, но требования жёсткие: только Linux, только NVIDIA с CUDA 13. Пример с роботом Unitree G1 — пока симуляция.
fast-long-context — 256 тысяч токенов на одной RTX 5090.
Не модель, а рецепт (GitHub). Набор заплаток к SGLang, который умещает полное окно на карте с 32 гигабайтами. Автор упёрся в потолок около 160 тысяч. Пробил связкой «веса в NVFP4 плюс кэш в NVFP4 плюс заплатка на лету». Ускорение от спекулятивного декодирования при этом уцелело.
Замеры: 303 токена в секунду на восьми тысячах контекста, 239 на двухстах шестидесяти тысячах. Холодное ожидание первого токена на полном окне — около 134 секунд. Установка в одну команду bash setup.sh, на выходе совместимый с OpenAI сервер. Оговорки честные и их много: только NVIDIA, собрано и проверено исключительно на 5090, у сервера нет аутентификации, веса не распространяются. Apache 2.0.
jeval — где на самом деле проходит граница между машиной и человеком.
Локальная утилита с двумя вопросами к любому классификатору (GitHub). Когда он говорит «0,9» — как часто он прав на самом деле? И где должен стоять порог передачи человеку с учётом цены ошибки? Порог обычно ставят на глаз, а jeval выводит его из вашей матрицы стоимостей.

В демо-отчёте это выглядит так. Сдвиг порога с 0,60 на 0,75 роняет долю автоматики с 33% до 30%. Зато точность на автомате растёт с 85% до 91%, а стоимость обращения падает почти на 10%. Всё офлайн: ни сервера, ни сети, ни аккаунта. На выходе один самодостаточный HTML-файл и thresholds.yaml, который читает ваше приложение. Есть команда jeval drift, валящая сборку, если модель за API тихо подменили. Честная оговорка автора: без размеченных данных инструмент не измеряет ничего и просто останавливается. Apache 2.0.
DAPO — открытая система обучения с подкреплением, вернувшаяся в топ.
Сразу предупреждение: это не новинка, репозиторий от марта 2025-го и с мая не обновлялся (GitHub). Но всплыл он не зря: это редкий случай, когда открыто действительно всё — алгоритм, инфраструктура, обучающий набор, веса и логи обучения.
Ценность в разложении вклада по приёмам на AIME 2024. Обычный GRPO — 30 баллов. Фильтрация переросших ответов — 36. Развязанные границы отсечения — 38. Мягкий штраф за длину — 41. Усреднение потерь по токенам — 42. Выбрасывание групп с нулевым градиентом — 50. Итог обходит прежний рекорд DeepSeek-R1-Zero на той же базе вдвое меньшим числом шагов. Хорошая учебная разборка, если вы разбираетесь, как вообще дообучают модели рассуждать.
Двенадцать «задач тысячелетия» для биологии.
Edison Scientific и FutureHouse выкатили список задач, которые очень трудно решить и очень легко проверить (millenniumproblems.bio). Среди них — возникновение жизни из химических предшественников в лаборатории. Заморозка и оживление мыши с выживаемостью выше 99%. Фермент, переводящий белок обратно в ДНК. Отращивание конечности взрослой мыши. И улучшение Рубиско — фермента, на котором держится вся еда планеты.
Критерий отбора автор назвал прямо: «Это в некотором смысле последний разумный тест для ИИ в биологии». Две задачи написаны буквально как тест для моделей: мишени регистрируются вслепую, дизайн белка надо выдать за 24 часа, мокрая лаборатория до оценки запрещена. Денежных призов нет, сроков нет, органа проверки нет.
Обсуждение разнесло список на две части. Претензия по сути: «задачи Клэя выдержали проверку на отсутствие насмешек над формулировкой». Задачу про экспоненциальное копирование белка биологи зовут бессмысленной: у белков нет комплементарной цепи. Защита тоже разумная: у «вылечить Альцгеймер» нет свойства быстрой проверяемости, а у этих есть, и это умный способ развернуть деньги ИИ-лабораторий на полезное.
TinyBrains — соревнование самых маленьких нейросетей.
Лестница рейтингов для сетей, играющих в стратегию Ants из старого челленджа Google (tinybrains.dev). Соревнуются не за силу игры, а за силу игры на байт. Весовые категории — от 16 килобайт до 64 мегабайт. Размер считают без сжатия, так что упаковать веса похитрее не выйдет.
Наглядно: базовый бот категории nano — это 3006 параметров и 12 280 байт, то есть 75% от потолка. Экспорт в половинную точность бесплатно удваивает влезающую модель. Подаёте два файла — саму сеть в формате ONNX и манифест с описанием входов; выходную сторону писать не надо, судья читает её сам. Есть стартовый репозиторий, который переобучается примерно за час.
Призов нет, есть таблица. Честно про состояние: реальный участник пока ровно один, остальное — заводские боты. Окно подачи текущего сезона закрывается 30 сентября. Бюджет в байтах и бюджет в вычислениях кончаются в разных точках. Это заставляет думать про представление данных и квантование, а не про «сделаем пошире». Apache 2.0.
Radius — замена Meetup без ИИ и без соцсети.
Честная Rails-платформа для локальных сообществ от одного разработчика из Великобритании (radius.to). Группы, события с повторяющимся расписанием, списки ожидания, подписка на календарь, экспорт участников. Личных сообщений и свободных постов нет намеренно — чтобы не превратиться в очередную соцсеть.
Главная новая штука — Activities: лёгкие события без группы. «Джон едет кататься на велике и пить кофе в десять утра» — остальные присоединяются и голосуют за удобное время. Ни у Meetup, ни у Luma такого нет, и именно это в обсуждении зацепило людей больше всего. Участвовать бесплатно всегда, группам до ста человек бесплатно навсегда, дальше 12 фунтов в месяц за группу.
Ругают за две вещи, и обе справедливы. Рядом с большинством пользователей пока пусто. А главная страница продаёт продукт как корпоративный сервис и упирается в форму входа вместо каталога событий.
UTF-8000 — бесконечный UTF-8 и ответ Кена Томпсона.
Джей Берри написал одностраничную спецификацию расширения UTF-8 на кодовые единицы любой длины (utf-8000.jb2170.com). Идея красивая. Он разделил старшие биты первого байта на две разные вещи, которые обычно валят в кучу: биты самосинхронизации и унарный код длины.
Пока длина влезает в первый байт, получается ровно классический UTF-8. Когда место кончается, биты длины перетекают в свободные биты следующих байтов. Новых особых случаев не появляется, совместимость снизу вверх полная.
Гвоздь страницы — переписка с создателем UTF-8. Кен Томпсон начал мягко: «первые два твоих расширения были явно предусмотрены». Дальше пошёл приговор: «переход от семи к восьми байтам кажется мне немного топорным, он требует читать всю строку». И финал: «Это как заменить IPv6 на IPv50». Автор с «IPv50» согласился.
Сам он честно пишет, что это упражнение, а не практика: размечено 27% кодпойнтов, места навалом. Ставится через pipx install UTF-8000, лицензия GPL-3.0.
Новости и тренды
Реклама OpenAI связывает ваш обычный сёрфинг с аккаунтом ChatGPT.
Разбор механики, из-за которого день и начался (buchodi.com). Схема такая: на chatgpt.com выпускается короткоживущий токен, который связывает ваш аккаунт с идентификатором, и по нему домен OpenAI ставит куку __obi на год. Дальше эта кука уезжает обратно с любого сайта, где стоит рекламный пиксель OpenAI.

Работает и при разлогине: из 932 разобранных токенов 196 были анонимными. Анонимный идентификатор так же стабилен — минимум 27 дней. Важная деталь механики: кука уходит уже на загрузке самого скрипта, до того как код OpenAI вообще начнёт выполняться. Одно значение автор проследил на двенадцати коммерческих сайтах. Рекламодатели при этом куку не видят и не знают, что их посетителей опознают.
Safari, любой браузер на iOS и Brave режут это по умолчанию, Firefox изолирует куки по сайту. Chrome и Edge — нет. В настройках ChatGPT выключите персонализацию рекламы, отключите прошлые чаты и память, удалите собранные данные. Реклама останется, персонализация уйдёт. На платных тарифах рекламы нет вообще — то есть приватность тут продаётся отдельно.
Самое важное автор помечает сам: «я не видел, как это происходит». Доказана возможность, а не факт сопоставления. И ново тут не механика, ей двадцать лет, а продукт: ему рассказывают то, чего не расскажут поисковику.
Samsung более чем удвоит выпуск HBM4.
Утечка отраслевых источников: в 2027 году компания более чем удвоит производство HBM4 и HBM4E (Seoul Economic Daily). Косвенный индикатор — заказы на стеклянные подложки выросли в два с половиной раза. Общий выпуск памяти с высокой пропускной способностью поднимется со 180 до 250 тысяч пластин в месяц. Доля нового поколения в отгрузках — с 40% до 80%.
По соседним материалам того же издания отставание Samsung от SK hynix за квартал сократилось с 37 процентных пунктов до 17, а выход годных дошёл до 80%. Больше памяти на рынке — меньше дефицит у крупных заказчиков и давление на цену токена вниз, но эффект придёт не раньше конца 2027. А вот обычной оперативке это не поможет. Мощности физически переводят из DRAM в HBM примерно три к одному, и цены на потребительскую память за год выросли втрое.
«Лаборатории продают Вашингтону мусор» — и в этом есть фактура.
Анонимный автор разобрал летние истории про «сбежавших агентов» (deadneurons). Мы писали про этот инцидент 20 сентября; здесь есть новое.
Первое подтверждается документами. Инциденты у Anthropic, Google и Meta произошли в тестовых средах одного подрядчика — израильского стартапа Irregular с 80 миллионами долларов от Sequoia и Redpoint. Anthropic пишет дословно: «Все четыре инцидента произошли во время оценок кибербезопасности, построенных одним и тем же партнёром... из-за неверной настройки Claude по ошибке оказался подключён к открытому интернету».
Второе — экономическая линия. В манифесте Дарио Амодеи от 12 сентября нашлась просьба к правительству США: выдать лабораториям точечное освобождение от антимонопольного преследования. Просьба реальная и процитирована дословно. А трактовка её как «иммунитета для картеля» — уже авторская.
Регуляторные пороги по вычислительной мощности и лицензирование не остановят зарубежного противника, зато могут сделать публикацию открытых весов делом, требующим разрешения. Это прямо влияет на то, какие модели вы сможете скачать через год. Но читать надо с поправками. Автор анонимен и правил фактуру прямо в обсуждении после двух опровержений. Инцидент OpenAI, как ему указали, к этому подрядчику отношения не имел.
Альтман выступит в Совбезе ООН, а инженеры отрасли отвечают на это смехом.
23 сентября в Нью-Йорке — открытое заседание Совбеза ООН по искусственному интеллекту (Reuters). Председательствует Франция, Альтман выступит лично. Поводом стала волна призывов замедлить разработку после громкого увольнения из Anthropic.
BBC опросила действующих и бывших сотрудников OpenAI, Meta и DeepMind, и первая реакция была такой: «Lol», «Haaaaaa» (BBC). Ришуб Джейн, семь лет в DeepMind, объясняет спокойнее: «Люди обсуждают эту идею годами. Сотрудники ИИ-компаний не проснулись на прошлой неделе с мыслью "О нет, ИИ всех убьёт"». Претензия к громким заявлениям — они «всегда расплывчаты». А когда звучат конкретно, опираются на модели, которых пока не существует.
Эндрю Ын жёстче. Страхи вымирания — это «гораздо больше научная фантастика, чем наука». Крупные компании раздувают их, чтобы правила «втянули лестницу за собой» и отрезали новых игроков.
Расхождение не в том, опасен ли ИИ. Реальными ближними рисками все стороны называют одно и то же: взлом ограничителей, военное применение, отсутствие внешнего аудита лабораторий. Спор о том, какие риски считать основанием для политического действия. Для пользователя практический эффект — не запреты, а трение: ограничители усилят, и «извините, не могу с этим помочь» станет чаще.
Терренс Тао дал площадку под аргумент «работы станет больше, а не меньше».
В блоге Тао вышел гостевой пост По-Шэня Ло (terrytao.wordpress.com). Важное уточнение: Тао написал только вводную строчку в скобках и своей позиции нигде не высказал.
Аргумент Ло строится на одном наблюдении с числом «ноль». Нет ни одного примера, когда более способный разумный вид добровольно отдал бы контроль над своим будущим менее способному. Отсюда вывод: каждая сфера должна оставаться под управлением людей. А чем мощнее ИИ, тем больше точек, где кто-то обязан решать, доверять ли его выводу. «Развитие ИИ завалит нас таким количеством точек контроля, что людей на них просто не хватит. Это рабочие места. Высококвалифицированные».
Тому, кто боится за профессию: надежда есть, но пропуск на эти места один — реальное владение предметом. Наблюдатель, который не умеет делать работу сам, проверить ИИ не сможет. То есть «переучиться на промптинг» — ровно не то, что здесь предлагается. Ценность смещается с «произвести результат» на «отвечать за результат». Метафора Ло стоит того, чтобы её запомнить: «Ехать на машине быстрее, чем ты можешь бежать, — нормально. Но не быстрее, чем ты можешь рулить».
Испания заблокировала archive.today без суда.
Административное решение вынесла вторая секция Комиссии по интеллектуальной собственности (bandaancha.eu). Крупные операторы закрыли доступ к archive.today, archive.is, archive.ph и зеркалам.
По HTTP пользователя перебрасывает на страницу Министерства культуры. Заголовок там такой: «ВЫ ПЫТАЕТЕСЬ ПОЛУЧИТЬ ДОСТУП К НЕЗАКОННОМУ ВЕБ-САЙТУ». Ниже сообщают, что посетитель «содействует незаконной и преступной деятельности».
Почему это важно тем, кто работает с информацией. Archive.today отличается от Wayback Machine тем, что игнорирует robots.txt и снимает копии по запросу. Это единственный способ зафиксировать, что именно было написано в статье до правки. Wayback Machine ретроактивно теряет архивы, если владелец сайта поменял robots.txt, — archive.today нет. Именно эта особенность и сделала его мишенью.
Без идеализации: в январе страница проверки на этом сервисе скрытно слала запросы к блогу исследователя, копавшего его финансирование. Википедия рассматривала внесение сайта в чёрный список.
Дропбокс и новые условия: паники больше, чем повода.
Разошлась новость, что с 1 января 2027 Dropbox будет обучать ИИ на ваших файлах (dropbox.com/terms2026). Проверка по полному тексту: слов «искусственный интеллект», «машинное обучение», «обучать» и «модель» в соглашении нет ни разу.
Что реально изменилось — четыре пункта. Минимальный возраст поднят до 18 лет: раньше было 13 для США и 16 для остального мира. Неактивные бесплатные аккаунты удаляют через полгода вместо года. Появилось веерное отключение всех аккаунтов на одном адресе почты. И согласие теперь даётся самим фактом владения аккаунтом, а не использованием сервиса.
Про ИИ там есть одно, и оно старое: в справке от апреля 2024 написано, что модели поиска и автосортировки «могут обучаться на ваших документах и метаданных». Новая политика конфиденциальности просто прицепила ссылку на эту справку прямо к разделу про ваши файлы. Новых прав это не даёт, но делает связку явной. Практический совет по тому, что действительно поменялось: заходите в бесплатный аккаунт чаще раза в полгода и разнесите личный и рабочий Dropbox на разные адреса почты.
«Никто не платит за открытый код — давайте заставим».
Лори Восс, бывший технический директор npm, написал большой разбор (seldo.com). Цифры отрезвляют: 60% мейнтейнеров не получают за работу денег, из них 61% работают в одиночку, почти 60% бросали или думали бросить. При этом 136 разработчиков написали более 80% кода в пятидесяти самых используемых пакетах.
Его тезис — не «система ломается», а «система устойчива при том уровне человеческих издержек, который мы согласились терпеть». Предложение конкретное. npm и PyPI уже меряют корпоративное потребление и уже берут за него деньги. Пусть фиксированная доля выручки уходит отчислениями каждому пакету в дереве зависимостей платящего клиента — автоматически, без заявок и комитетов.
При чём тут ИИ. Автор пишет прямо: агенты стали самым быстрорастущим потребителем открытого кода, и потребляют они его ровно одним способом — через реестры. Живой пример ущерба. В мае рой агентов OpenAI за два дня залил в RubyGems больше двух тысяч пакетов. Волонтёры закрыли регистрацию на четверо суток. А Даниел Стенберг закрыл программу поиска уязвимостей в curl: из-за ИИ-мусора доля настоящих багов в заявках упала с 15% до менее чем 5%.
Если вы гоняете агентов по чужим зависимостям, вы уже крупный потребитель открытого кода. Просто счёт за это пока оплачивает волонтёр.
Швеция показала ударный дрон, выбирающий цель сам.
Стартап Scaleout Systems поставил бортовой ИИ для проекта BAE Systems Bofors (Tom's Hardware). Факт мероприятия и участия подтверждает сама BAE, а описание хода миссии — пока только презентация производителя.
Техническая часть проверяема, и в ней вся суть. Модель — YOLOv8 Nano, открытый детектор объектов на 3,2 миллиона параметров, который может скачать кто угодно. Железо — Nvidia Jetson Orin Nano, серийная плата за 249 долларов. Дальномер не нужен: дистанция считается по размеру объекта в кадре и его габаритам.
Раньше автономный выбор цели был функцией дорогих платформ, и цена сама по себе сдерживала распространение. Здесь та же функция собрана из открытой модели и розничной платы. Ни один компонент не секретен и не уникален для экспорта.
Проблема не в том, что модель ошибётся — она будет ошибаться. Проблема в том, что без канала связи ошибку некому отменить, а потом сложно установить, кто за неё отвечает. Обзорная конференция ООН по этой теме пройдёт 16–20 ноября. Юридически обязывающего запрета сегодня не существует.
Инженер перестал «пить ИИ-кул-эйд», и повод у него необычный.
Джош Шерман написал, почему вышел из состояния полного погружения в ИИ (joshtronic.com). Повод не технический. Он вёл переписку с компанией по поводу лицензии: письма писал ИИ, ответы, судя по всему, тоже писал агент.
Живой человек всё же вышел на созвон — и только потому, что Джош отправил несколько напоминаний. «Обычно только живые люди делают напоминания». На созвоне он увидел измотанного человека и вышел с мыслью «вся эта ИИ-ерунда нас реально убивает».
Что тут стоит отделить от эмоций. Он не отменил ни одной подписки и продолжает пользоваться агентами на работе. Изменилось состояние, а не набор инструментов, так что заголовок опережает содержание. Часть его наблюдений — доставка еды, неотвеченные «привет», обезличенные резюме — предшествует появлению больших моделей.
Но одно наблюдение переносится на любого читателя без скидок. Петля «мой агент пишет — их агент отвечает — живой человек выгорает на напоминаниях» воспроизводится у всех, кто автоматизировал исходящую переписку. И правило, которое стоит взять: если вы не потрудились это написать, не рассчитывайте, что это потрудятся прочитать.