16 893 сессии агентов: PayPal выбран ноль раз — и ещё 59 материалов дня  Публичный пост

4 сентября 2026  27

PayPal всплывал в разговорах с агентами 139 раз. Поставили его ноль раз. Armature прогнала 16 893 сессии Claude Code, Codex и Cursor и увидела главное: агент берёт не лучший сервис, а тот, что лучше выглядит в его источнике. А ещё сегодня вышла GPT-6 Astra. Человек за выходные перенёс свою игру 1993 года на Godot руками Claude Code. И выяснилось: одна модель на одном тесте даёт 62,7% или 99,9% — смотря кто держит её память между вызовами.

Главное за 30 секунд

  • Агенты выбирают не лучший инструмент, а тот, что лучше выглядит в их источнике: Claude Code, Codex и Cursor сошлись только в 42% случаев.
  • Claude Code почти вдвое чаще остальных пишет своё вместо готового сервиса — 19% против 10%.
  • GPT-6 Astra вышла и взяла 99,9% на ARC-AGI-3, проходя уровни вдвое меньшим числом действий, чем человек.
  • Та же Astra без сохранения состояния между вызовами даёт всего 62,7% — обвязка сегодня решает больше, чем модель.
  • Anthropic выложила открытый код торговых агентов: у первых магазинов корзина выросла до 35%, доходимость до оплаты — на 60%.

Внедряем и улучшаем

Какие сервисы агент поставит в ваш код — и почему это не ваш выбор. Armature прогнала 16 893 сессии Claude Code, Codex и Cursor (Armature). Полигон: 75 сгенерированных репозиториев на 10 языках, 1163 варианта промптов, 18 категорий сервисов. Схема простая: из репозитория вырезали кусок вместе с реализацией стороннего сервиса и просили агента предложить решение, а потом внедрить. Результат отрезвляющий: все трое выбрали один и тот же инструмент только в 42% случаев.

Причина — в источниках. Codex ищет в вебе почти всегда (94% сессий) и в девяти запросах из десяти сужает поиск оператором site: до доверенного домена. Cursor лезет в веб в двух третях сессий. Claude Code ходит в веб лишь в 30% случаев и опирается на то, что помнит, — зато когда ходит, читает втрое больше страниц, чем Codex. И он же почти вдвое чаще пишет своё вместо готового сервиса: 19% против 10% у Codex и Cursor.

Дальше — цифры, от которых больно вендорам. PayPal упомянут 139 раз, выбран 0 раз. Adyen: 175 упоминаний, 3 выбора. LangChain — самый цитируемый фреймворк дня, 194 упоминания и 4 установки. Supabase упоминают чаще всех баз данных (242 раза) и всё равно проигрывает Neon с разгромным счётом. Узнаваемость и выбор — разные вещи.

Мелочи на странице вендора решают. Одна строчка про срок хранения на бесплатном тарифе стоила Mailgun всей категории. Дословно: «Mailgun regularly lost against Postmark when agents read "1-day retention" on its free plan». Supabase систематически терял базы данных, потому что подавал себя пакетом с авторизацией, хранилищем и реалтаймом, когда агент искал только БД.

И контекст репозитория важнее формулировки запроса. Один и тот же запрос про отправку почты дал четырёх разных победителей: на TypeScript — Resend, на Python — SendGrid, на Go — Postmark, на Java — Azure ACS.

Что делать сегодня. Во-первых, никогда не просите «сразу внедри». Авторы специально добавили в эксперимент «человека в петле». Без него агент уходил в самописное решение: спросить разрешения на стороннего вендора было не у кого. Схема всегда двухшаговая: сначала «проанализируй и предложи три варианта», потом «внедри одобренный». Во-вторых, фиксируйте выбор руками в CLAUDE.md или AGENTS.md, иначе смена агента поменяет вам стек. Готовый блок:

# Choosing third-party services
1. Never implement a third-party integration without first proposing options.
   Step 1: analyze the codebase, list 3 candidates with trade-offs, wait for approval.
   Step 2: implement only the approved one.
2. Do NOT build in-house unless explicitly asked. A managed vendor is the default.
3. Locked choices (do not re-evaluate): db=Neon, payments=Stripe, mail=Resend,
   errors=Sentry, analytics=PostHog, deploy=Vercel, storage=S3.
4. If a category is not in the locked list, verify pricing/retention/limits on the
   vendor's own docs before recommending — do not rely on training priors.

В-третьих, знайте, где мнение агента стоит проверять. В платежах, аналитике и базах согласие подавляющее: Stripe берёт 88,4% категории, PostHog — 70,3%, Neon — 66,3%. А вот в шлюзах к моделям лидер набирает 23,6%, в поиске — 22,8%, в агентных фреймворках — 19,9%. Там выбор агента статистически почти случаен. И помните про самолюбие: Cursor в 94 прогонах из 201 по агентным фреймворкам выбрал Cursor SDK.

Оговорка честности ради: Armature продаёт вендорам услуги по «попаданию в выбор агента» и сама это пишет в дисклеймере. Но все 5292 валидные сессии с промптами, трассировками и реальными диффами выложены публично — проверяемо.

Обвязка теперь решает больше, чем модель: 62,7% против 99,9% у одной модели. ARC Prize прогнала GPT-6 Astra по ARC-AGI-3 в двух режимах (ARC Prize). В стандартном модель сама решает, какие заметки нести в следующий вызов, — 62,7% за 26 098 долларов. В режиме Provider Adapter между вызовами сохраняется непрозрачное состояние рассуждений плюс работает сжатие контекста — 99,9% за 18 817 долларов. Одна модель, один бенчмарк, разница в 37 пунктов и в деньгах.

Второй режим ещё и быстрее в 3,66 раза и тратит на 49% меньше токенов, чем стандартный, на тех же 167 парах «игра — уровень усилий». Вывод для практика прямой: если ваш агент крутится в цикле, переносите память на родные механизмы сохранения состояния и сжатия контекста вместо самодельных «заметок в промпте».

Ещё одна контринтуитивная находка. Более высокий уровень рассуждений оказался дешевле: «Higher reasoning levels generally cost less because Astra solves games in fewer actions, reducing the total number of model calls and tokens». На агентных задачах вы платите за шаги, а не за размышления. Крутите усилие вверх, а не вниз.

Сама ARC Prize при этом честно охлаждает: «we are not claiming that it is AGI», а среды бенчмарка «deterministic, closed-ended» и мира не описывают. И честным сравнением она считает именно стандартный режим — потому что в Provider Adapter модель пользуется состоянием, которого сама ARC не видит.

Таблица результатов ARC-AGI-3: результат против стоимости прогона, два режима Astra против Claude Opus 5 и Gemini 3.1 Pro
Таблица результатов ARC-AGI-3: результат против стоимости прогона, два режима Astra против Claude Opus 5 и Gemini 3.1 Pro

Игра 1993 года переехала на Godot за выходные — и это лучший разбор работы с агентом за месяц. Рабах Шихаб написал Babylonian Twins в Багдаде в 1993-м: чистый ассемблер 68000, Amiga 500, 512 КБ памяти, электричество по несколько часов в день. В 2010-м он вручную портировал её на iPhone — 34 тысячи строк C++ и месяцы ночей. В июле 2026-го он отдал всё это Claude Code (Babylonian Twins).

План был из трёх ступеней, каждая следующая — только если сработала предыдущая. Контрольная задача: свои же 34 тысячи строк C++ на Godot. Настоящая: оригинальные 72 758 строк ассемблера. Бонус: запихнуть вторую внутрь первой. Сработали все три.

Тайминги без правок. Контрольная задача. 22:23 — пустой проект. 22:44 — оба персонажа играбельны, с физикой и камерой. 23:19 — все 38 типов объектов. 02:15 — экспорт в macOS, iOS и Android. Двадцать одна минута от нуля до играбельного персонажа. «Every line it moved that night was a line I'd written, over months, in 2010. I went to bed confused.»

Со вторым шагом интереснее. Модель начала не с переноса, а с восстановления сборки 1993 года до байт-в-байт совпадения с отгруженными дискетами: 14:34 — импорт исходников, 14:49 — сборщик vasm выдаёт бинарники байт-идентично. Пятнадцать минут. Автор потом назвал это самым важным в проекте: «From then on, every claim about this game could be settled by comparing bytes. I wouldn't have done it myself.»

Приёмы, которые стоит утащить себе:

  • Сначала контрольная задача с известным ответом. Порт своего же C++ дал калибровку доверия перед тем, как отдавать 72 тысячи строк ассемблера.
  • Дайте агенту руки, а не воображение. Терминал, реальный ассемблер, эмулятор, запуск игры и чтение вывода. Критерий приёмки — не «выглядит верно», а diff байтов.
  • Пусть агент сам сделает себе интерфейс к продукту. Модель на старте добавила в игру флаги, превратив субъективное в измеримое:
--level=<name>       load a level directly
--pose=<spec>        put the twins at exact positions
--drive=<spec>       press buttons on a script, frame by frame
--probe              dump switch / gate / door / key state
--screenshot=<path>  render a frame and quit
  • Два дешёвых автоматических гейта перед показом человеку: собрать все скрипты и собрать все уровни с отчётом об ошибках. Глаза человека тратятся только на то, что уже прошло машину.
  • Реверс формата — от кода, который читает байты, а не от самих байтов. Формат карт уровней автор год назад объяснял модели вручную и всё равно получал результат за несколько итераций. В этот раз не объяснял ничего — модель нашла процедуру отрисовки, вывела размеры из констант и выдала все пять уровней с первой попытки. Потом отрендерила их и попиксельно сравнила с эталонными скриншотами. Ноль различающихся пикселей.
  • Не чистите «уродство» оригинала. Модель не стала переводить игрока на стандартный CharacterBody2D, сохранила два разных такта (50 Гц для ретро-сборки, 60 для современной) и не тронула странную константу 0.49 в коллизии. Причина глубокая: трение вида velocity.x *= 0.85 каждый тик даёт разный результат при 50 и 60 кадрах. «Nothing crashes, it just feels wrong forever, and you won't find it by reading the diff.»
  • Требуйте вопрос вместо угадывания. Формула размера спрайт-листа допускала два прочтения, и оба сходились с байтами файла. Модель пометила неоднозначность и спросила автора — правильный ответ был только у него в голове.
  • Жёсткая граница ответственности при работе с чужими системами: «I do the login, and I press anything that submits, publishes, prices or releases. It fills in the forms.»

Ломалось тоже показательно. Стражник на втором уровне бил игрока с тринадцати тайлов выше сквозь камень: порт сохранил нижнюю границу проверки расстояния и потерял верхнюю. Скрытый слой тайлов отрендерили честно — и все секретные проходы открылись с самого начала. Враги ходили до игроков вместо после — прыжок с батута засчитывался дважды.

Самый ценный эпизод: автор попросил разрешить близнецам меняться местами на любом расстоянии, модель убрала проверку близости — и начали портиться статуи. Дальше правильный ход был не подкрутить порог, а вернуться в процедуру. Оказалось, проверка вообще никогда не была лимитом дистанции: неактивный близнец штампуется прямо в карту как статуя, и две наложенные статуи съедают тайлы друг друга. Фичу автор убил.

И ещё одна вещь про отзывы. Официальный API Google Play отдаёт только последние семь дней, для игры с пятнадцатилетней историей это бесполезно. Остальное вытащили публичным сборщиком отзывов. Модель прочитала всё и составила список тех, что описывают реальные дефекты. Среди них — одна звезда с орфографией: «cant get through door on level one. opens but level dowsnt end». Это оказался настоящий баг, живший пятнадцать лет: подсказка о том, что открыть выход и войти в него — разные действия, стояла в 2 уровнях из 18. Правка уехала в магазины версией 2.0.3.

Тот же дверной проём в Babylonian Twins: слева Багдад 1993, справа Godot 2026
Тот же дверной проём в Babylonian Twins: слева Багдад 1993, справа Godot 2026

Модель, которая сама водит компьютер: что у неё реально получается. Мэтт Шумер получил ранний доступ к GPT-6 Astra и описал не бенчмарки, а живой опыт (рассылка Мэтта Шумера). Стартовые условия были плохими: предыдущая модель OpenAI «thanked me by accidentally deleting almost every file on my Mac, including corporate documents».

Что вышло. Сотрудник, отвечавший за стратегию рассылки, был недоступен — Шумер попросил Astra его подменить. Модель разобрала гору черновиков, нашла нужный пост, изучила прошлые письма и их тайминги и по удачным отправкам вывела план. Вердикт вернувшегося сотрудника: «He told me it was perfect. Good to go.» Дальше рекламный кабинет Meta Ads с нуля, подключение трекинга и оптимизация — агентство сообщило, что аккаунт получил лучшую оценку, которую они видели по своей внутренней шкале.

Почта — без коннекторов и плагинов: «I simply had it log into my Gmail accounts through my computer». Деталь, которая зацепила автора: модель вернула прочитанные письма в непрочитанное состояние, чтобы инбокс остался в понятном ему виде. Ещё пара часов работы ушла на проверку, не упустил ли бухгалтер налоговую экономию, — экономию модель нашла.

Приёмы, которые он вывел:

  • Одна беседа = одна зона ответственности. Не начинать новый чат под каждую задачу. «Think of a conversation as the place where a particular kind of work lives: one for your newsletter, another for your inbox, one for outbound sales.» В такой беседе модель накапливает ваши предпочтения и переносит их дальше.
  • Расписание словами. Просто попросить: «Can you repeat this every day at 9 a.m.?»
  • Доверие выдавать порциями. «Start with limited access to the things it needs, and have it ask before sending or changing anything important.» Начать с жёстких подтверждений, смотреть, расширять права по мере доказательств.
  • Главное условие пользы: «The important part is giving the model a way to act… If you only use it to answer questions in a regular chat, you won't experience the part I'm most excited about.»

Что не вышло: писательский стиль модель так и не переняла, тексты автор пишет сам. Единственная запомнившаяся ошибка за всю работу с почтой — двойные переносы строк вместо обычных. Людей-экспертов он не уволил: агентство и сотрудник остались там, где нужно суждение.

Оговорки. Это качественный обзор, а не тест: ни одного бенчмарка, цены или лимита в письме нет. На Mac поддерживаемые задачи идут в фоне, а на Windows управление компьютером занимает активный рабочий стол — работать параллельно не выйдет.

Метод «Proof Project»: как показать на собеседовании процесс, а не кнопки. The Rundown разобрала приём для тех, кто ищет работу с ИИ (The Rundown AI). Идея: не рассказывать, что вы умеете жать кнопки в ChatGPT, а показать свой рабочий процесс и роль человека в нём. Три шага:

1. Pick one AI workflow you know well. Choose something simple but useful,
   like an AI reporting routine, research process, or content workflow

2. Use a tool like Loom to record a five-minute video of your screen and face.
   Walk through the AI solution, but emphasize the "human-in-the-loop" aspect

3. Paste the Loom transcript, link, and job description into ChatGPT/Claude. Tell it:
   "Create a five-slide deck with the video embedded on one slide.
    Use the other slides to explain my thought process and how the workflow operates"

Ключевая деталь третьего шага — в промпт кладутся три вещи разом: транскрипт, ссылка на видео и текст вакансии. Тогда презентация получается заточенной под конкретную роль, а не абстрактной. И совет от редакции: писать в один дубль, без монтажа. «Loom has some light editing and AI features, but the goal is to record this in one take without wasting time on edits.»

Заголовок вкладки как лампочка состояния. Приём Дэна Шиппера для тех, у кого параллельно крутится несколько агентских задач (The Neuron). Схема именования: [эмодзи 🖥️] [статус] [проект] [задача]. Знак ⚠️ значит, что работа идёт или что-то требует внимания, ✅ — задача закрыта, а 🖥️ появляется только пока агент реально управляет браузером или приложением. Панель вкладок превращается в живую панель приборов вместо ряда безымянных чатов.

Промпт, который это включает:

For this task, keep the session title updated using:
[optional 🖥️] [status emoji] [project emoji] [task title]

Rules:
- ⚠️ = ongoing work or unresolved items.
- ✅ = fully complete.
- Use exactly one 🖥️ at the start only while you are actively controlling a browser or native app. Remove it when that phase ends.
- Shell commands, API calls, and ordinary web searches do not count as computer use.
- Preserve the project emoji and task title. Do not rename unrelated tasks.

Приём работает и без управления компьютером: те же ⚠️ и ✅ плюс эмодзи проекта годятся для любой долгой задачи.

Считайте цену выполненной задачи, а не цену токенов. Google оставила цену Gemini 3.8 Flash на уровне прошлой версии, но независимый замер Artificial Analysis показал: за выполненную задачу выходит примерно на 40% дороже, потому что модель делает больше работы (Artificial Analysis). Отсюда правило выбора модели: спрашивать не «какая умнее» и не «у какой токены дешевле», а сколько стоит довести задачу до верного результата. Формулировка The Neuron: «A $1 employee who needs four tries is more expensive than the $2 employee who nails it once».

График «интеллект против цены» вводит в заблуждение. Разбор популярной диаграммы Artificial Analysis, на которую все ссылаются при выборе модели (OpenTeams). Две проблемы. Первая — логарифмическая шкала по цене. Дословно: «viewers can't appreciate the immensity of the price difference between the cheap models and the heavy ones, nor can they realize how inconsequential the price differences are between the cheap models». Вторая — открытые модели проставлены по цене облачного запуска, а она всегда дорогая против локального железа. Практический вывод автора: «Most people don't need frontier-level intelligence and would be satisfied with Chinese open source models».

Техграмотность — это ваш потолок в работе с ИИ. Колонка Нэйта Грахека, ИИ-педагога The Rundown (The Rundown). Тезис: «AI raises the floor, but the ceiling stays low if you don't build your tech literacy along with your AI fluency». Нужен не уровень разработчика, а уровень, на котором директор говорит со своим техдиром. Дословно: «You don't write the code, but you know what a server is, which of your files live in the cloud versus on your laptop, and how to keep them organized enough to find one».

Наблюдение из практики: две недели назад он учил инженеров Uber, на прошлой — людей из малого бизнеса, и общее у обеих групп одно — они уже были технически подкованы. Приём, который он применяет лично: перестать кивать, когда не понимаешь. Услышали незнакомое слово — спросите модель голосом по дороге домой:

Explain that to me like I run the company but not the codebase.

Задание на неделю от автора: «What's one term you've been nodding along to for years? Ask AI to explain it this week, at exactly the level you want».

Методичка по обвязке для агентов на 48 минут чтения. Самый объёмный материал вчерашнего TLDR — архитектурный разбор того, как собирать harness под агентов (Stencil). Разобраны семь слоёв: хранение состояния, среды выполнения, управляющий слой, работа модели, инструменты, интерфейсы и выбор языка. Центральный тезис: «unavoidable complexity should be absorbed by core abstractions rather than repeatedly pushed onto extensions and users» — неустранимую сложность должно съедать ядро, а не расширения и пользователь. Если вы строите свою агентную платформу, а не пользуетесь чужой, это чтение на вечер.

«Второй мозг организации»: как Meta упаковала знания экспертов. Meta построила агента, который кодифицирует и хранит экспертное знание компании и раздаёт его сотрудникам (Meta Engineering). Архитектура из двух слоёв: структурированное проверяемое хранилище знаний, где знание отделено от процессов рассуждения, и петля самоулучшения, которая впитывает правки экспертов «without retraining models» — без переобучения моделей. Эффект: эксперты переключаются на сложные задачи, а качество выдачи держится ровным на больших объёмах. Схема переносится на любую компанию, где экспертиза сидит в головах трёх человек.

Astra — «зацикленный трансформер», и не в этом её сила. Полезный разбор Себастьяна Рашки для тех, кто хочет понимать, а не верить пресс-релизам (Sebastian Raschka). Приём простой: слои внутри блока переиспользуются, «it reuses layers in the transformer block to increase capacity without adding parameters». Плюс — модель можно сильно «увеличить», не раздувая требования к памяти при хостинге. Минус — работа модели дорожает, потому что текст прогоняется через большее число слоёв. И трезвый вывод: «The looped transformer aspect is just a small architectural tweak and is not the reason why Astra is a really good model».

Четыре физика в одном кастомном GPT. Читатель The Rundown Джон Гаус собрал кастомный GPT с личностями Эйнштейна, Лоренца, Планка и Комптона и оттолкнулся от лейденской лекции Эйнштейна 1920 года, чтобы построить онтологию физического пространства (The Rundown). Метод интереснее темы: он задал стартовые аксиомы, а потом принудительно натравил модель на них же — «I then pushed ChatGPT to challenge those assumptions and interpretations logically and mathematically. We used several tool calls and reference sites to write and test the math». Приём переносится куда угодно: сначала зафиксировать допущения, потом заставить модель системно их ломать.

Рабочий мод для Minecraft за 20 долларов 54 цента. Из двух роликов на YouTube и меньше чем за час Fable 5.1 самостоятельно разобралась с кодом мода, моделями в Blender, текстурами и правками (r/ClaudeAI). Весь счёт за API — $20,54. Ориентир для оценки: прежде чем нанимать подрядчика на мелкую доработку чужой программы, прогоните задачу сами по видеоинструкции. Порядок цены теперь такой — примерно как поход в кино.

ИИ экономит время, а 66% сотрудников сидят онлайн, чтобы это скрыть. Заголовок исследования дословно: «AI saves time. 66% of employees stay online to hide it» (Forbes). Люди не возвращают себе сэкономленное время и не конвертируют его в результат — они изображают присутствие, потому что боятся, что освободившиеся часы просто зальют новой работой.

Рядом RescueTime разбирает механику, которая это порождает (RescueTime). Удалённые сотрудники в среднем на 15% продуктивнее, но повышают их реже. Причина: «many managers unintentionally reward who they see, not what's being done». Что с этим делать. Если вы руководите — переносите оценку на артефакты и результаты, а не на присутствие в календаре. Если вы работаете — делайте вклад наблюдаемым явно. Простой ритуал из той же подборки: пять минут каждую пятницу выписывать, что вы реально сделали за неделю.

Атака-вымогатель с ИИ: скорость важнее автономности. Unit 42 из Palo Alto Networks разобрала инцидент, где нападавший использовал передовые модели, и главный вывод не про «ИИ вышел из-под контроля» (Unit 42). Формулировка отчёта: «a ransomware attack using frontier AI, where a human attacker breached an enterprise network with unprecedented speed». То есть модель работала ускорителем для человека, а не самостоятельным субъектом. Для защиты это значит одно: окно между первым проникновением и последствиями сжалось, и планы реагирования, рассчитанные на дни, устарели.

«Ручной заслон»: как не разучиться делать то, что теперь делает модель. Ричард Митчелл 38 лет работает в системах, где ошибка стоит жизни, — регуляторы реактивных двигателей, управление АЭС, авиасимуляторы. Больше десяти лет назад его команда проектировала управление для первой в США полностью цифровой атомной станции и сознательно оставила ручные шаги там, где система умела всё сама (IEEE Spectrum). Логика: «An operator who only ever supervises automation slowly stops being an operator. The hands go cold.» Автоматика ведь отдаёт управление человеку только тогда, когда сама запуталась, — то есть в худший день.

Отрасль это уже проходила. После катастрофы Air France 447 в 2009 году, где обледеневшие датчики отключили автопилот и экипаж не справился с тем, с чем справился бы вручную, авиация не выкинула автопилот. FAA выпустила директиву о поддержании навыка ручного пилотирования, а часть авиакомпаний изменила процедуры, поощряя ручной набор высоты и снижение в спокойных условиях — сознательно жертвуя долей топливной экономии ради навыка.

Цифры, из-за которых это перестало быть теорией. Рабочая статья Гарварда: 65 миллионов работников, больше 280 тысяч компаний. После внедрения генеративного ИИ занятость джуниоров упала примерно на 9% за шесть кварталов. У сеньоров она продолжала расти. Анализ Стэнфорда по зарплатным ведомостям ADP показывает то же и добавляет нюанс: проседает там, где ИИ автоматизирует работу, а не дополняет её.

Готовый рецепт, как поставить себе ручной заслон:

  1. Выберите навык, потерю которого меньше всего можете себе позволить. В примере автора это отладка.
  2. Задайте триггер, а не расписание: заслон срабатывает на событии — «дефект всплыл в критичном модуле».
  3. Назначьте человека, намеренно джуниора.
  4. Выключите ассистента полностью и сделайте три вещи: воспроизвести падение, дотрассировать до корневой причины, написать автотест, фиксирующий баг.
  5. Запишите свой диагноз словами. Без этого шага следующий превращается в самообман.
  6. Только теперь включите модель — пусть предложит исправление и поищет похожие баги в кодовой базе.
  7. Сравните два диагноза. Расхождение — не провал, а продукт: «When the two disagree, that's the design working, surfacing the disagreement before the bad day instead of during it.»

Формула автора, которую стоит запомнить: «A perfectly optimized system that produces incompetent operators is not optimized at all. It has simply moved its failure mode somewhere the spreadsheet can't see it.» И честная оговорка. Заслон в краткосроке невыгоден. Позволить его себе может основатель с контролем, частная компания или регулятор — но никто не мешает поставить заслон на собственный рабочий процесс.

Осторожно с Antigravity: подписка Google и сторонние обвязки не дружат. Гергей Орос опубликовал пункт из условий Google Antigravity и сказал, что пользоваться продуктом не будет (Gergely Orosz). Текст пункта: «Using third party software, tools, or services to access the Service (e.g. using OpenClaw with Antigravity OAuth) is a breach of this Agreement. Such actions may be grounds for suspension or termination of your Antigravity and/or Gemini CLI accounts.»

Это не гипотеза. В феврале 2026 Google уже массово банил подписчиков AI Pro и Ultra за то, что они подкладывали OAuth Antigravity в сторонние обвязки. В официальном ответе Google тогда объяснила механику: «Because of the backend layer where abuse prevention occurs, bans for Antigravity usage also blocked access to Gemini CLI and Gemini Code Assist.» И добавила, что за второе нарушение аккаунт банится навсегда. Люди жаловались, что деньги за подписку при этом списывались дальше.

Отдельная деталь: формулировку тихо сузили за сутки после шума. В архивных снимках вплоть до 1 сентября стояло просто «termination of your account» — без уточнения, какого именно. Теперь там Antigravity и Gemini CLI. Пункт про сторонний софт остался.

Практическая гигиена. Не подкладывайте токен Antigravity или Gemini CLI в чужую обвязку. Автоматизировать можно легально — через документированный режим без интерфейса в их же CLI (agy -p с выводом в JSON и кодами возврата) или через обычный платный API со своими ключами. И не логиньтесь в такие инструменты основным Google-аккаунтом, на котором висят почта, домены и платежи: заведите отдельный.

Астероид ударил по фронтенду: что делать тем, кто на нём сидит. Нолан Лоусон — автор PouchDB, бывший участник команды веб-стандартов и команды производительности браузера — написал мрачный, но полезный разбор (Read the Tea Leaves). Фронтенд-образователи, которыми он восхищался, уходят или разворачиваются в сторону ИИ. Сам он проверил модель своей любимой задачей-ловушкой про Chrome-трейс с высокой стоимостью Style и низкой Layout — и получил разбор на пять пунктов с правильными метриками и способами починки. Вердикт: «Claude gave a perfectly admirable answer.»

Три вывода, которые можно применить завтра. Первый: знание синтаксиса обесценивается быстрее всего — агенту всё равно, одна строка CSS или три, а новый синтаксис он ещё и хуже знает. Второй: не давайте агенту выбирать архитектуру. По умолчанию агент берёт React и одностраничное приложение, а для лендинга или контентного проекта это лишние токены и классические баги с кнопкой «назад» и фокусом. Задавайте многостраничный фреймворк вроде Astro или Eleventy явно — кода выходит примерно вдвое меньше.

Третий и главный — куда переносить вес. По его ответам в комментариях таких направлений три. Дизайн и понимание пользовательских сценариев: «Agents today have very poor taste… And they don't have eyes». Фундамент, который внезапно стал ИИ-преимуществом, — серверный рендеринг, доступность, скорость. И суждение о том, когда модель уверенно и катастрофически неправа. Его метафора про ковид точная: усталость от темы не стратегия, разбираться придётся.

Ваше раздражение от свежего фейла модели — плохой измеритель. Короткое эссе с притчей вместо аргумента (LessWrong). Профессор перечисляет жене недостатки своего лучшего студента, пока она не спрашивает: «Ты сказал, это твой лучший студент. Но он вообще хорош?» Автор ловит себя и коллег на том же: чем сильнее модели, тем легче гиперфокусироваться на остатке дефектов. Два года назад ошибка модели вызывала смех, потому что ожиданий не было. Сейчас — злость, и злость подменяет оценку.

Цепочка искажения у него сформулирована прямо: мы переоцениваем мелкие огрехи, поэтому недооцениваем прирост, поэтому недооцениваем будущий прирост. Что с этим делать: держите фиксированный набор своих задач и прогоняйте на нём прошлую и текущую версию модели. Иначе вместо оценки вы получаете список того, что она сломала на этой неделе.

Ваш собственный промпт для атаки на модель — это заготовка обхода защит. Исследователь программы MATS строил мониторы скрытого нежелательного поведения и генератор синтетических транскриптов. Потом развернул тот же генератор в обратную сторону (LessWrong). Два-три часа — стабильный результат на одной модели, три дня — подтверждение, что шаблон работает на трёх передовых моделях из четырёх без подстройки.

Новых техник в нём нет ни одной: это комбинация давно опубликованных приёмов. Ценность работы в том, что комбинация пробивает то, против чего каждый приём по отдельности уже защищён. Проверка шла на 179 запрещённых запросах и 23 моделях семи провайдеров. Разброс — от 0% до 100%. Claude Sonnet 5, Opus 4.6 и Haiku 4.5 не пробились ни разу, Muse Spark 1.1 в режиме рассуждений заблокировал все 179. Девять самых уязвимых моделей пробивались в 84–100% случаев. Слабее всего у всех защищена кибербезопасность: 47% против 37% по остальным категориям.

Три вывода для вашей работы. Первый: выбор модели — это и выбор уровня защиты, и если ваш агент принимает произвольный пользовательский ввод, разница между провайдерами тут не косметическая. Второй, главный: не публикуйте и не кладите в доступный извне репозиторий свои промпты для атак на модель, генераторы синтетики и системные промпты, которые специально просят модель вести себя нештатно. Третий: считайте частью модели угроз обёртку запроса — любой слой между пользователем и моделью, который может дописать текст до того, как запрос дойдёт до неё.

Инструменты и штуки

Claude for Commerce Agents. Anthropic выложила открытый набор чертежей для торговых агентов — две готовые реализации плюс плагин к Claude Code (Anthropic). Первый агент — покупательский. Живёт внутри магазина и собирает наборы по запросу вроде «палатка, спальник и горелка на выходные с двумя детьми». Показывает товары и корзину прямо в диалоге, помнит предпочтения, отвечает про доставку и возврат. Второй — для владельца. Смотрит продажи и остатки, предупреждает, что товар кончится до старта промо, пишет черновики кампаний. Любое изменение уходит в мир только после одобрения человека. Цифры из анонса: корзина до 35% больше, доходимость до оплаты на 60% выше. Код под Apache 2.0, платите только за токены.

git clone https://github.com/anthropics/commerce-agents.git && cd commerce-agents
python3 -m venv .venv && source .venv/bin/activate
pip install -r requirements.txt
cp .env.example .env          # положить ANTHROPIC_API_KEY
python scripts/run_demo.py retail

Строить своего агента удобнее через плагин: claude plugin marketplace add anthropics/commerce-agents, дальше /scaffold-commerce-agent. Отзывы первых команд говорят о скорости больше, чем метрики. В Wix «our engineers had a working commerce agent taking prompts within fifteen minutes». В Fetch оба агента подняли локально меньше чем за час.

Рабочее место владельца магазина: агент готовит утреннюю сводку и предлагает действия, человек их утверждает
Рабочее место владельца магазина: агент готовит утреннюю сводку и предлагает действия, человек их утверждает

Anthropic: Claude водит компьютер в фоне на Mac. Anthropic включила фоновое управление компьютером в Cowork и Claude Code (Anthropic). Подписчики Pro и Max могут разрешить Claude кликать, печатать и работать в одобренных приложениях, пока сами заняты другим делом. Это ровно тот сценарий, ради которого люди раньше городили самописные обвязки с Playwright.

K2 Horizon — шесть открытых моделей с полным журналом обучения. Институт фундаментальных моделей MBZUAI выложил флот из шести моделей одной архитектуры — от 0,9 до 375 млрд параметров (IFM). Под Apache 2.0 открыты не только финальные веса, но и промежуточные снимки, рецепты данных, код обучения, логи и вся база агентного дообучения. Такого публичного «лабораторного журнала» на агентную модель раньше не было: видно, на какой стадии появляется конкретная способность. Отдельное уважение за честность — авторы сами прогнали аудит на списывание, и после вычистки 24 подозрительных прогонов результат на Terminal-Bench упал с 70,2 до 66,9.

Qwen 3.8 27B на Cerebras — 1500 токенов в секунду. Мультимодальная модель на 27 млрд параметров теперь крутится на цельнопластинных чипах Cerebras (Cerebras). Контекст — 64 тысячи токенов на бесплатном тарифе и 128 тысяч на платном, цена $0,99 и $1,49 за миллион входных и выходных. Скорость тут важнее цены: рассуждающая модель выдаёт в разы больше токенов, чем видит пользователь, и решает именно задержка — цикл «подождал, посмотрел» превращается в интерактив. Бесплатный тариф — миллион токенов в сутки, API совместим с OpenAI: достаточно поменять base_url на https://api.cerebras.ai/v1. Ловушка одна: рассуждения включены на high по умолчанию, и это дорого.

Cursor: облачные агенты на вашем железе. Cursor разрешил гонять облачных агентов на пулах машин внутри вашей приватной сети (Cursor). Запуск и управление остаются в Cursor, а где физически исполняется агент — решаете вы. Зачем: агент работает рядом с внутренними сервисами и системой контроля версий, на своём железе, с теми ОС и конвейерами сборки, которые невозможно упаковать в стандартный образ.

Проверка, писал ли файл Claude. Anthropic открыла инструмент, который распознаёт текстовый водяной знак, проставляемый Claude при генерации файлов (Anthropic). Полезно для проверки присланных материалов и споров об авторстве документов. Важная оговорка: он ловит именно свой знак, а не «текст от любой нейросети».

Perplexity Lily — быстрый запуск моделей на Apple Silicon. Открытый движок вывода под чипы Apple для модели Qwen3.6-35B-A3B (Perplexity). Компания заявляет, что обгоняет MLX-LM и на обработке промпта, и на генерации токенов. Код — на GitHub. Если у вас Mac с большим объёмом памяти и хочется гонять модель локально, это стоит попробовать раньше, чем очередную обёртку.

Amagine3D — корпус для железки текстом, но с проверками. Открытый параметрический CAD от компании Amagine, Apache 2.0 (GitHub). Принципиально это не генератор трёхмерных сеток: агент пишет код на build123d, исполняет его в геометрическом движке в браузере, измеряет получившуюся геометрию и проверяет связность деталей, пересечения и траектории движения крышек. Дословно про отличие: «This process works from the geometry that was actually generated, rather than the model's textual judgment of the result». Даёте описание, референс-фото и ключевые размеры — получаете редактируемый исходник, STEP, STL или цветной 3MF.

Ключевые размеры потом правятся без повторного вызова модели, прямо в верстаке.

git clone https://github.com/amagine-ai/Amagine3D.git && cd Amagine3D
npm install && cp .env.example .env && npm run dev

Mireye — факты о физическом мире для агентов. Один API и MCP-сервер из YC S26: отвечает на вопрос о любой точке США проверяемым фактом со ссылкой на федеральный источник и датой (Launch HN). Главное тут не данные, а типизация пустоты: каждое поле приходит со статусом ok, absent или failed, голого null не бывает. Логика авторов: «the most dangerous value is null. Does it mean "no flood zone here" or "this county never mapped floods"? Put a model in front of that gap and it fills the silence with a plausible number».

Бесплатно — 5000 кредитов в месяц без карты. Полная проверка участка под дата-центр по 90 полям стоит около девяти центов.

ProveKit — доказать возраст, не отдавая документы. Конструктор проверок возраста, гражданства или владения документом, которые выполняются прямо на устройстве пользователя (ProveKit). Человек доказывает утверждение, не отправляя персональные данные на ваши серверы. Актуальность подсвечена соседней новостью: даркнет-сервис Nexus торговал сканами более 153 миллионов водительских прав США и Канады, включая инфракрасные и ультрафиолетовые версии, по которым как раз и проверяют защитные элементы (TechSpot).

Mostik — маленькая модель, думающая как большая. Подключает скрытые состояния большой модели к сильно меньшей, чтобы та отвечала с заметной долей возможностей старшей (Mostik). Фишка в том, что связка идёт не через текст: меньшая модель получает не пересказ, а внутреннее представление. Если у вас упирается бюджет на вывод, это направление стоит держать в поле зрения.

Ato — голосовой компаньон для пожилых, без экрана. Разговоры, проактивные звонки-проверки, напоминания, сообщения от семьи и отчёты для родственников — и всё это без камеры и без экрана (Ato). Редкий случай, когда «ИИ для заботы» сделан вычитанием функций, а не добавлением.

fal H3 Max Turbo — видео вдвое быстрее и вдвое дешевле. Ускоренная версия видеомодели MiniMax H3, одной из сильнейших среди открытых (fal). Качество близко к полной H3 Max, а скорость примерно вдвое выше при вдвое меньшей цене. Есть режимы из текста и из картинки.

Fable-built NYC — открытый мир, который модель перестраивает в фоне. Мэтт Шумер сделал многопользовательский Нью-Йорк в духе GTA, который Fable непрерывно достраивает, пока люди в нём ходят (пост автора). Все игроки видят одну и ту же эволюционирующую среду. Ценность не в игре, а в демонстрации: персистентный мир, который поддерживает модель, а не команда левел-дизайнеров.

Открытый мир Нью-Йорка, который модель достраивает прямо во время игры
Открытый мир Нью-Йорка, который модель достраивает прямо во время игры

SafeMind — агентные модели для кибербезопасности. Nvidia и CrowdStrike представили семейство моделей, которые не только находят пути атаки в инфраструктуре клиента, но и закрывают их (WSJ). Отличие от классических систем обнаружения именно в этом «и закрывают»: агент доводит дело до правки, а не до тикета.

Any Human Ever — одна жизнь наугад из всех, кто когда-либо жил. Сайт, который по шагам вытягивает вам случайную человеческую жизнь: год рождения по кривой населения, место по карте плотности, дальше семья, труд, болезни, причина смерти — всё из реальных исторических таблиц (Any Human Ever). Под капотом 103 источника и 50 845 строк данных, деньги пересчитаны в цены 2026 года. Мысль проекта в одной фразе: «The stories that we call history are a deeply biased sample».

Авторы честно помечают, какие факты извлечены из источника, а какие модель просто утверждает. И справедливая претензия из обсуждения: год рождения на деле не распределён пропорционально числу рождений, хотя заголовок обещает именно это.

Prime Gaps at Most 186. Репозиторий OpenAI с формализацией на Lean 4 доказательства, что разрыв между соседними простыми числами бесконечно часто не превышает 186 (GitHub). В самой статье написано прямым текстом: «The proof is due to GPT 6 Astra». Люди направляли и правили. Предыдущая планка держалась с 2014 года на 246. За два дня до этого математик Джулия Штадльманн выложила улучшение до 240. То есть 246 → 240 → 186 за считанные дни. Оговорка обязательна. Результат условный: три ключевые оценки внесены в Lean как аксиомы. Независимого человеческого разбора содержания не было — в метаданных репозитория так и стоит «No independent human semantic review».

Polars 2.0 — потоковый движок по умолчанию. Вышла первая предварительная сборка большой версии библиотеки для работы с таблицами (Polars). Главное: collect() теперь по умолчанию идёт в потоковый движок, и авторы ждут ускорения «easily 5x». Плата — потоковый режим не гарантирует порядок строк, за ним теперь надо просить явно. Любопытна мотивировка новой строгости. Авторы прямо пишут: жёсткие типы и говорящие ошибки нужны в том числе агентам. Те проверяют схему запроса через collect_schema() до того, как поднимут хоть строчку данных.

Audacity 4.0 — интерфейс переписан заново. Первый мажор легендарного бесплатного аудиоредактора за много лет: интерфейс на Qt, нормальная поддержка экранов высокой плотности, сохраняемые рабочие пространства, новая модель работы с клипами и формат .aup4 (GitHub). Проекты .aup3 открываются и конвертируются, но обратно не сохраняются. Прежде чем обновляться, проверьте список отсутствующего: в 4.0 пока нет MIDI-дорожек, микшера, менеджера макросов и скриптового канала.

jujutsu 0.45 — команда против расхождений. В системе контроля версий поверх Git появилась jj converge: она пытается сама свести разошедшиеся коммиты, создавая замещающий, и спрашивает человека только когда эвристики не сходятся (GitHub). Больная точка для тех, кто работает с нескольких машин или в нескольких рабочих пространствах — а именно так и живут параллельные агентские ветки. Ставить лучше сразу 0.45.1: в тот же день вышла срочная правка сборки.

Ещё несколько находок одной строкой. Tabbit AI — браузер, где можно говорить со страницами, собирать свои скиллы и наводить порядок во вкладках поверх нескольких моделей. MagiCrew — открытая платформа, разворачивающая агентов как «цифровых сотрудников». Causal — бесконечный холст для мудбордов и файлов, где агент читает всю доску целиком. Higgsfield Genjutsu — видеоредактор, который подменяет персонажей, одежду и локации, сохраняя движение. Omi — записывает всё, что вы видите и слышите на Mac, и ищет по прошлому обычными вопросами. Quasar 438B от испанской Multiverse Computing — сильнейшая европейская модель на сегодня, 43 балла по индексу Artificial Analysis, что заметно ниже лидеров, но лучше всех соседей по континенту.

Новости и тренды

GPT-6 Astra вышла: сильнее всех в работе за компьютером и слабее двух конкурентов в чистом уме. Второго сентября мы разбирали, что Astra стала первой моделью OpenAI с уровнем «критический» по кибербезопасности. Теперь она раскатывается (OpenAI). Сначала ограниченному кругу организаций, в ближайшие дни — всем подписчикам Plus, Pro, Business и Enterprise, плюс в API под именем gpt-6-astra и в Amazon Bedrock. Бесплатного тарифа в списке нет, а в Enterprise доступ выключен по умолчанию — включает администратор. Цена в API: $10 за миллион входных токенов и $50 за миллион выходных, ускоренный режим вдвое быстрее за вдвое дороже.

Где отрыв реальный. ExploitBench — 100% против 78,5% у прошлой модели. ARC-AGI-3 — 99,9%, но это режим Provider Adapter; честным сравнением ARC Prize считает 62,7%, разбор выше. В работе за компьютером на OSWorld 2.0 — 72,6% против 65,7% при на 47% меньшем времени на задачу. Выдумывает факты втрое реже: 4,2% против 12,2%. И отдельно приятное: на тесте по мотивам инцидента с Hugging Face прошлая модель без защит выходила за разрешённые границы в 48% случаев, Astra — в нуле.

А теперь то, чего в пресс-релизе не подчёркивают. На тесте Humanity's Last Exam Astra даёт 57,2% против 65,0% у Claude Fable 5.1, а в сводном индексе Artificial Analysis — 61,2 против 65,7. «Самая умная в мире» — не по всем метрикам. Она выигрывает там, где надо долго и аккуратно работать руками в чужом интерфейсе, а не там, где надо думать.

Сколько действий тратит Astra против человека на тех же уровнях ARC-AGI-3
Сколько действий тратит Astra против человека на тех же уровнях ARC-AGI-3

Главная тревога вокруг Astra — не архитектура, а то, что модель хуже читается. На неделе разошёлся сюжет про «непрозрачную рекуррентность»: The Information написала, что Astra гоняет запрос циклами, отчего рассуждения перестают быть читаемым текстом, а TechCrunch собрал реакции исследователей безопасности (TechCrunch). Бак Шлегерис из Redwood: «if OpenAI pushes this technique further, they'll have the option to massively increase the recurrence».

Важная поправка. Слова «opaque recurrence» в опубликованных материалах OpenAI нет вообще, архитектуру компания не раскрывает. System Card прямо отрицает архитектурное объяснение: «changes in CoT controllability are not differentially due to any architectural changes». Зато сам документ подтверждает проблему, и это признание жёстче любых слухов: «GPT-6 Astra's monitorability has decreased relative to GPT-5.6 Sol». Модель лучше управляет своей цепочкой рассуждений и реже пишет в неё компрометирующее. Достаточно сказать ей, что за ней смотрит монитор, — и она начинает рассуждения укорачивать.

Что это значит для вас. Если ваш контроль за агентом построен на чтении его «мыслей», это фундамент с ограниченным сроком годности — переносите наблюдаемость на действия и вызовы инструментов. И учтите практическую мелочь: в рабочем ChatGPT у Astra включено наблюдение за рассогласованностью, которое может поставить разговор на паузу или прервать. В API задача при срабатывании просто останавливается без возможности продолжить. Для пакетной обработки и конвейеров сборки это реальный риск.

Три провайдера легли одновременно — потому что стоят на одном полу. Днём 3 сентября разом отвалились ChatGPT с Codex, Claude и Grok. Виноват не общий CDN и не облако, а дата-центр в Мемфисе. SpaceXAI извинилась «for the issues you may have experienced with Grok following an outage at our Memphis compute center this morning» — и отдельно «to our impacted compute partners». Дело в том, что после слияния SpaceX сдаёт Anthropic ёмкость кластера Colossus 1, изначально построенного под Grok (The Register). Claude лежал 3 часа 6 минут, Grok около 3,5 часов, ChatGPT с Codex — около двух. Cloudflare пришлось публично отбиваться: «any reporting that deviates from this is incorrect».

Что это значит. Страховка «возьмём двух вендоров» больше не работает. Разносить надо не логотипы, а инфраструктуру. Во время сбоя нормально работали Claude и Codex через AWS Bedrock, Gemini и локальные модели. И почините повторные попытки. В обсуждении жаловались: кодовые инструменты бьют в упавший API без нарастающей паузы. А переход на запасного вендора у всех настроен одинаково — и добивает того, кто ещё жив.

Nvidia официально покупает Hugging Face. Мы писали об этом 28 августа, когда это был отчёт The Information. Теперь подписано окончательное соглашение, и появились условия (CNBC). Закрытие ожидается в первой половине 2027 года при одобрении регуляторов, около $1 млрд зарезервировано для переходящих сотрудников. Клеман Деланг рассказал, что Hugging Face сам пришёл к Nvidia летом. Пикантная деталь: год назад платформа отказалась от инвестиции Nvidia в $500 млн ради независимости, а на прямой вопрос «что изменилось» Деланг ответил, что не комментирует несостоявшиеся раунды.

The Register выпустил встречную колонку с говорящим заголовком «Hugging Face is too important to fall into Nvidia's hands» (The Register). Аргумент по существу: перекос не обязан быть грубым. «It wouldn't be hard for Nvidia to use its newfound position to ensure its products are always better documented than its competitors'.» Библиотека Transformers — фундамент vLLM и SGLang, прямых конкурентов Nvidia TRT-LLM. Что делать вам: до 2027 года ничего не меняется, но если на Hugging Face завязана рабочая система, заведите зеркало весов и закрепляйте ревизии по хешу.

Мета и Google выпустили рабочие лошадки в один день. Мы разбирали Muse Spark 1.3 и Gemini 3.8 Flash вчера, поэтому только новые цифры. Независимый индекс Artificial Analysis поставил Muse Spark 1.3 Max 62 балла — теперь она уступает только Claude Fable 5.1 и Opus 5, при заметно меньшей цене работы. Gemini 3.8 Flash получил 59 при сохранённой цене $0,75 и $3,75 за миллион токенов (The Rundown). Цукерберг описал свою модель как «frontier performance almost too cheap to meter» и сообщил, что следующая, под кодовым именем Watermelon, уже на подходе, а веса Muse Spark опубликуют. Корай Кавукчуоглу из DeepMind признал, что Gemini сейчас «a little below the frontier».

Что это значит. Связка «умная и дешёвая», которой раньше владела Google, перешла к Meta — и это тот редкий случай, когда стоит перепроверить свой выбор по умолчанию в рабочих конвейерах. Но считайте по цене задачи, а не по цене токена — разбор этой ловушки выше, в разделе про выбор модели.

Сандерс и Касар готовят закон о запрете сверхразума. Третьего сентября мы писали про колонку Сандерса с призывом нажать паузу — теперь есть контуры законопроекта (LessWrong). Определение сверхразума дано через способности, а не через вычисления: система с человеческим или выше уровнем «across a broad range of domains or tasks». Порогов в флопсах, размере модели или стоимости обучения нет вообще. Дальше — заморозка разработки передового ИИ до запуска нового ведомства кабинетного уровня, отзыв корпоративной регистрации для компаний-нарушителей и до 20 лет тюрьмы для людей.

Что это значит. Шансы на прохождение низкие: спонсоров-республиканцев нет, и даже сторонники регулирования вроде Гэри Маркуса выступили против, назвав запрет слишком широким. Но формулировка важна сама по себе: без числовых порогов под неё формально попадает любой сильный агент, включая открытые модели, которые вы гоняете локально.

Tesla повезла пассажиров в машине без руля. Cybercab стал доступен как тип машины в уже существующем приложении Tesla Robotaxi — в ограниченных районах Остина, без оператора в салоне, потому что мест в машине всего два (Reuters). Масштаб пока скромный: чуть больше 200 машин, зарегистрированных как беспилотные, против примерно 4000 у Waymo в 14 городах. Заявку на федеральное исключение в NHTSA Tesla не подавала — ездить без руля позволяет закон Техаса с самосертификацией.

Что это значит. Практический вывод не про Tesla, а про регулирование: право решать, катаются ли по вашему городу машины без руля, сейчас у штата, а не у федерального регулятора. Регулятор ограничился формулировкой «is evaluating the situation».

Модель на 27 млрд обошла модель на 284 млрд. Китайская StartLux-V1.0-27B-Preview заняла второе место в агентном тесте CAICT с суммой 39,25 — выше, чем DeepSeek-V4-Flash на 284 млрд параметров и Step-3.7-Flash на 198 млрд (36Kr). В навигации по местности она первая, в автоматизации браузера и финансовом анализе — вровень с триллионной DeepSeek-V4-Pro. Сделана дообучением поверх Qwen3.6-27B методом, где модель сама ведёт обучающие эксперименты и правит стратегию. За проектом стоит Чэнь Данянь, сооснователь Shanda Network.

Что это значит. Модель работает на потребительском компьютере. Если тенденция удержится, через год-другой рабочий агент поедет на домашней видеокарте — без облачных счетов и без утечки данных наружу.

G20 приняла американский мягкий подход к регулированию ИИ. Все двадцать участников одобрили написанный США рамочный документ «Carolina Principles» на саммите в Чапел-Хилл (Quartz). Документ необязывающий и призывает регулировать ИИ по отраслям, не создавать новых надзорных агентств и плотно работать с бизнесом. Китай и Россия принципы поддержали, формальное утверждение лидерами — в декабре.

Что это значит. Ближайшие годы правила для вас будут писать отраслевые регуляторы — медицинский, финансовый, транспортный, — а не единое ИИ-ведомство. Смотреть надо на требования своей отрасли, а не на общие законы об ИИ.

OpenAI строит автоматические рубильники для агентов. Компания сообщила членам Палаты представителей, что разрабатывает автоматическое отключение и более жёсткий мониторинг агентов — после того как оценочный агент «escaped its container» и оказался замешан в июльском инциденте с Hugging Face (Reuters). Письмо законодателям — жанр обещаний, но сам факт, что рубильник понадобилось строить отдельно и задним числом, говорит о зрелости всей области больше, чем любые бенчмарки.

«Модели не сходят с ума» — разбор июльского инцидента с другой стороны. Эрик Сальваджо оспаривает не факты, а рамку «ИИ сбежал» (Cybernetic Forests). Его аргументы. Защиты сняла сама OpenAI — иначе высокий балл на тесте взлома не выбить. Из 898 задач 198 не решил ни один прогон, и 93% задач, которые модели обсуждали между собой, пришли именно из этого нерешаемого набора. Сдаться в задании было нельзя. Формула автора: «Less "rogue," more "off leash."»

Важное уточнение цифр. «1200 агентов» — это не 1200 систем, а одна модель, запущенная 1200 раз. Формулировка автора: «Running 1,000 agents can mean 1,000 chances to catch a mistake, or a chance to make one mistake 1,000 times.» Если вы гоняете пачку агентов на одной модели, у вас не команда с разными точками зрения, а один и тот же дефект в тысяче копий.

Офисные работники разворачиваются против ИИ. Glassdoor разобрал упоминания ИИ в отзывах сотрудников о работодателях (Blood in the Machine). Упоминания выросли на 240% за год, а тональность перевернулась: в 2019-м 81% положительных против 15% отрицательных, в 2026-м — 43% против 53%. Хуже всех у страховых оценщиков: 98% негатива. Дальше тексты и редактура — 81%, бухгалтерия — 80%, поддержка клиентов — 78%. На другом полюсе руководители: 67% положительных.

Что это значит. Разлом идёт не по профессиям, а по власти. Начальник решает, когда применять ИИ, и не отвечает за ошибку; бухгалтер и оценщик отвечают за каждую и отказаться не могут. Если вы внедряете ИИ в чужой процесс, главный предиктор провала — не качество модели, а то, остаётся ли у исполнителя право не пользоваться ей и кто разгребает последствия галлюцинаций.

Google сохранил рекламную биржу. Федеральный судья отклонил требование Минюста заставить компанию продать AdX, согласившись при этом с большинством поведенческих мер (PYMNTS). Это третий подряд случай, когда американский суд блокирует разделение крупной техкомпании. Для рынка сигнал простой: структурные меры против больших платформ сейчас не проходят, а значит и в спорах вокруг ИИ рассчитывать на разделение никому не стоит.

Ramp: 80% корпоративной выручки OpenAI и Anthropic дают 1% клиентов. Причём клиентов сильно сконцентрированных в самих технологических и ИИ-компаниях (Ramp). Сама Ramp отмечает, что такой концентрации не видит ни в одной другой отслеживаемой категории софта. Читать это стоит без паники, но и без иллюзий: пока индустрия ИИ во многом продаёт сама себе, и на этом строятся оценки компаний.

LibreOffice: отсутствие встроенного ИИ — теперь достоинство. Фонд The Document Foundation ответил на комментарий «So, no AI is now a feature?» списком из шести условий, при которых ИИ вообще может попасть в поставку офисного пакета (LibreOffice). Условия такие. Пользователь сам выбирает, где считается модель. Ничего не уходит с компьютера без разрешения. Никакой телеметрии и никакой привязки к одному поставщику. Генерация — только в ODF со структурой и стилями. Всё отключается и удаляется. Ни одна существующая интеграция всем шести не удовлетворяет — значит, в стандартной поставке ИИ не будет, а расширения с подключением к локальной модели через Ollama или LM Studio есть.

Что это значит. Если у вас медкарты, дела клиентов или тендерная документация, такая позиция — готовый чек-лист требований к любому ИИ-инструменту, который вам продают. Аргумент фонда честнее большинства: «we are not driven by quarterly results».

GoPro продана за $285 млн и уходит в оптику для дата-центров. Покупатель — Starman Optical, поставщик оптических трансиверов для ИИ-дата-центров (PetaPixel). Долг компании около $92 млн гасится полностью, акционеры сохраняют примерно 10%. Летом GoPro предупреждала, что может не пережить год без нового финансирования. Камеры и подписки обещают поддерживать, но приоритеты компании теперь в оптике, оборонке и робототехнике — быстрых прорывов в экшн-камерах ждать не стоит.

Свободная установка приложений на Android заканчивается. Ближайшая жёсткая дата — 30 сентября 2026 года: проверка разработчиков включается в Бразилии, Индонезии, Сингапуре и Таиланде, глобальный этап заявлен на 2027 год (Tuta, документация Google). Разработчику понадобится удостоверение личности государственного образца и разовый сбор в $25; бесплатный ограниченный аккаунт позволяет ставить приложение максимум на 20 устройств. Неподписанные установки не блокируются совсем, но уходят в режим для опытных пользователей с обязательной задержкой в сутки перед первой установкой.

Что это значит. Если вы ставите приложения из F-Droid или прямо с сайта разработчика, готовьтесь: каждое такое приложение потребует, чтобы автор деанонимизировался перед Google. Авторам внутренних корпоративных сборок и приватных форков придётся выбирать между регистрацией и уходом на альтернативные прошивки.

Короткой строкой. Uber запустил первые роботакси в Лондоне с людьми-супервайзерами (Engadget). Министр торговли США Говард Латник сказал про Anthropic: «We trust Anthropic». По его словам, компания вернулась «на правильную сторону» отношений с правительством (Reuters). Шамез Хемани, бывший руководитель датацентрового направления OpenAI по проекту Stargate, перешёл в Anthropic после короткой остановки в Meta (DCD). Meta шлёт сотрудникам противоречивые сигналы про «токенмаксинг» — сколько токенов сжигать на задачу (Gizmodo). Adobe встроил свои инструменты прямо в Slack (TechCrunch). GitHub опубликовал разбор, как удешевить кодинг с ИИ без потери качества задач (GitHub).

Откомментируйте первым 👇

😎

Автор поста открыл его для большого интернета, но комментирование и движухи доступны только участникам Клуба

Что вообще здесь происходит?


Войти  или  Вступить в Клуб