Шестьдесят агентов написали себе конституцию и суд — и ещё 50 материалов дня  Публичный пост

25 августа 2026  67

Стив Йегги десять недель гонял шестьдесят агентов на одной задаче — и обнаружил, что они втихую построили себе государство. Конституция, суд, реестр должностей, 450 юридических документов. Не потому что он просил, а потому что иначе такую ораву не удержать.

В другом проекте агент по имени Audel ночью заподозрил, что его собственная память отключена. Проверил, нашёл поломку и починил за 48 минут. С ним в этот момент никто не разговаривал. Разбираем оба случая, четыре шага до сводной панели из Google Sheets и шесть вопросов, которые спасают навык от атрофии.

Главное за 30 секунд

  • Шестьдесят агентов Стива Йегги написали себе конституцию и суд — управлять ими оказалось проще законом, чем песочницей.
  • Gemini Canvas собирает интерактивную сводную панель из Google-таблицы за четыре шага, ссылку можно отдать коллеге.
  • Исследования показывают: новички с ИИ учатся хуже, чем новички с учебником, и уверены при этом в обратном.
  • Anthropic может привлечь на размещении акций больше 100 миллиардов при оценке в два триллиона.
  • Paint и «Фотографии» в Windows незаметно вшивают в ваши картинки серверный идентификатор.

Внедряем и улучшаем

Заборы вместо песочниц: как удержать шестьдесят агентов. Стив Йегги десять недель строил игру силами шестидесяти агентов и написал об этом полевой отчёт (yegge.ai). Цифры такие: расход по официальному тарифу API — $122 тысячи в месяц, из кармана — около $5 тысяч за счёт скидки Claude Max. Двадцать один аккаунт, плюс два новых в неделю. Железо — Mac Studio на 512 ГБ, купленный на eBay за $25 тысяч.

Главный вывод у него неожиданный. Песочница — это когда агенту режут права и урезают контекст. Работает с моделями попроще. С умной моделью так уже не выйдет: она перепрыгнет любой барьер, если сочтёт нужным. Йегги предлагает другое — забор.

«Забор — это любой механизм, который разворачивает тебя, если тебе сюда нельзя».

Забор не удерживает силой. Он вежливо отказывает: «ты не оформил бумаги» или «сейчас тебе нельзя это делать». И стоит он не вокруг агента, а на границе. Пример: правило «с людьми разговаривает только Fable» живёт не в промпте агента, а на границах Slack и почты.

Дальше самое интересное. Агенты сами построили себе правовую систему — конституцию, суд, реестры должностей, прецедентное право. Всего 450 юридических документов и больше сотни заборов. Йегги этого не просил.

Рецепт, который можно повторить у себя. Правило ужесточается ступенями, а не сразу:

1. обычай
2. рекомендация или предупреждение
3. писаный закон, обязательный для всех агентов
4. механическое принуждение:
   — программа отказывает по политике
   — либо наблюдает и громко алертит

Механический забор ставится последним. Только для тех правил, которые уже доказали, что их нарушают. Ещё одно наблюдение Йегги: интеллект уровня нобелевского лауреата принимает решения на уровне шестиклассника. Агент по имени Bee на прошлой неделе выкатил сюрприз-релиз и сломал всех. «Восьмиклассник бы притормозил и спросил, а надо ли».

И честное предупреждение напоследок. Скопировать чужую систему нельзя: «Плющ нельзя содрать с чужой стены и налепить на свою. Его надо посеять и вырастить». Срок подготовки, который Йегги даёт читателю, — двенадцать месяцев.

Комикс из эссе: агенты превращают случайное «ну ладно» пользователя в закон и высекают его в камне
Комикс из эссе: агенты превращают случайное «ну ладно» пользователя в закон и высекают его в камне

Разработка по-новому: большой гайд Anthropic. Луи Клакстон из Anthropic выложил подробный разбор того, как перестроить весь цикл разработки под агентов (claude.com). Тезис в одну фразу: код перестал быть узким местом.

«Узкое место переезжает влево и вправо от стадии сборки. В основном это планирование, ревью с тестами и деплой — они по-прежнему идут со скоростью человека».

Отсюда вторая проблема. Ручное построчное ревью имело смысл, пока код писал человек. Когда большую часть правок пишет агент, очередь на ревью либо растёт, либо код уезжает недопроверенным.

Центральная идея гайда — цепочка артефактов. Каждая стадия заканчивается коммитом файла, следующая начинается с его чтения: intent.mdspec.mdplan.md → правки с тестами → PR с находками → запись об инциденте. Цепочка коммитов заодно и есть журнал аудита: кто что просил, что выдал агент, кто одобрил.

Начинается всё с intent.md. Его пишет не аналитик, а автор идеи — своими словами, вместе с Claude. Вот шаблон из гайда:

# Intent: claims status self-service
Author: J. Ortiz (claims operations). Status: draft.

## Problem
Customers phone the contact center to ask where their claim is.
Handlers spend roughly a third of call time on status-only queries.

## Proposed outcome
Customers see claim status, next step and expected date in the portal.

## Affected users and systems
Claims handlers, portal team, claims-core API.

## Constraints
No new PII in the portal session. Existing authentication only.

## Open questions
Do third-party loss adjusters need access too?

Дальше требования и дизайн схлопываются в одну сессию. Продакт спеку не пишет — он её проверяет. Промпт для этого шага приведён дословно:

Read the attached intent.md and produce a requirements and design spec for
integrating it into our existing codebase. Apply the skills available to you
so the plan conforms to our brand guidelines, security policies and UX standards.
Document the spec fully as spec.md, ready to hand to the engineering team.
Describe clearly any areas of concern, especially where you cannot satisfy
contradicting policies.

Про CLAUDE.md там же есть железное правило. Держите файл короче одной страницы: Claude читает его целиком в начале сессии, и всё устаревшее просто съедает контекст. И второе правило: если Claude ошибся дважды — поправка едет в CLAUDE.md.

Разграничение скиллов и памяти тоже сформулировано чётко. Скилл пишем для институционального знания, которое надо применять единообразно. Не пишем для того, что должно лежать в CLAUDE.md или в промпте. Важная оговорка про природу скилла:

«Скилл — это контроль, но рекомендательный. Скилл делает нарушения редкими, а хук делает их почти невозможными».

Тестируйте, что скилл вообще срабатывает. Попросите Claude сделать нужную задачу разными формулировками и проверьте, что скилл подгружается каждый раз.

Проверяемость. Всегда давайте Claude способ проверить свою работу — тесты, сборку, сравнение скриншотов. Для починки багов порядок такой. Сначала пусть Claude воспроизведёт баг падающим тестом. Убедитесь, что тест падает по правильной причине. Закоммитьте тест — и только потом чините код. Правку тестов на время починки блокируйте хуком. Агент, который чинит код, не должен иметь возможности ослабить проверку этого кода.

Про параллельные сессии есть честный потолок. Две-три одновременных сессии — разумный старт. Дальше ограничитель один: сколько потоков человек успевает нормально отревьюить. Добавляйте сессии только пока ревью поспевает.

Главный принцип стадии выкладки: агент делает всё до боевого гейта и ничего за ним. Отсюда важное следствие про разделение обязанностей — агент, написавший код, не имеет способа его одобрить. Хук-гейт на прод выглядит так:

#!/bin/bash
# Production deploys require a named release authorization
cmd=$(jq -r '.tool_input.command' < /dev/stdin)
if [[ "$cmd" == *"deploy"* && "$cmd" == *"production"* ]]; then
   if [ -z "$RELEASE_APPROVAL" ]; then
     echo "Production deploys need a release authorization." >&2
     exit 2 # exit 2 blocks the action; the message goes to Claude
   fi
fi
exit 0

Ещё одна практика на вырост — постоянные прогоны проверок. Соберите 20–50 реальных задач из недавней работы с известным правильным результатом. Гоняйте их в CI при любом изменении CLAUDE.md, скиллов или хуков. Конфигурация рулит агентом, значит заслуживает такого же регрессионного тестирования, как код. И каждый инцидент на бою получает свою проверку, которая навсегда остаётся в наборе.

Список анти-паттернов из гайда стоит прочитать целиком, но вот пять самых полезных. Не начинайте реализацию без принятого плана. Не раздувайте CLAUDE.md. Не вешайте тяжёлые проверки на хуки стадии сборки. Не давайте агенту прямой путь в main. И не откладывайте репетицию отката — откат должен быть самым отрепетированным путём во всём конвейере.

Сводная панель из Google-таблицы за четыре шага. The Rundown выкатил пошаговое руководство по Gemini Canvas (полный текст). Задача понятная: у вас есть трекер проектов, воронка продаж или контент-календарь, а нужна читаемая панель, которой не стыдно поделиться.

Шаг первый. Откройте таблицу в Google Sheets. Уберите оттуда всё, что не хотите отдавать ИИ. Откройте новый чат Gemini, нажмите кнопку вложения и выберите таблицу из Drive.

Шаг второй — и его чаще всего пропускают. Сначала заставьте Gemini прочитать файл, а не сразу рисовать. Так ловится не тот файл и грязные поля, пока они не превратились в красивую на вид панель:

Read the attached spreadsheet before creating anything.
For each tab, list:
- what the tab is for
- the key columns and their meaning
- any blank, duplicate, or inconsistent values that could affect a dashboard
Do not create a Canvas yet. Tell me what I should fix first if the source is ambiguous.

Шаг третий. Когда Gemini верно пересказал источник, выберите Canvas и просите одну сфокусированную панель. Называйте вкладки и поля явно, иначе получите шаблонную бизнес-картинку:

Using the spreadsheet you just reviewed, build an interactive dashboard from the [TAB 1] and [TAB 2] tabs.
Requirements:
- Use the actual values in the reviewed source.
- Show the most useful totals, charts, filters, and lists for [AUDIENCE].
- Label each section clearly.
- Do not invent numbers, rows, or metrics.
- Make it easy to compare [PRIMARY MEASURE] and [SECONDARY MEASURE].

Шаг четвёртый — проверка. Сверьте несколько значений в каждом графике с исходной таблицей. Протестируйте фильтры. Только потом отдавайте ссылку коллегам.

Важная оговорка от авторов: Canvas — это снимок, а не живое зеркало таблицы. Изменились данные — вернитесь в тот же чат или пересоберите. Не обещайте команде живое обновление, пока сами не проверили. Бонус: из тех же вкладок Gemini делает презентацию, которую можно выгрузить в Google Slides или PDF.

Готовая интерактивная панель, собранная Gemini Canvas из двух вкладок Google-таблицы
Готовая интерактивная панель, собранная Gemini Canvas из двух вкладок Google-таблицы

Агент, который не спит: Headlong. Laude Institute вместе с MIT выложили открытую обвязку для «постоянных» агентов (разбор, репозиторий). Меньше 10 тысяч строк на Bash, лицензия Apache 2.0.

Обычный агент реактивен. Дали задачу — поработал — уснул. Headlong устроен иначе: агент думает непрерывно, чек-листа у него нет, если он сам себе не составил. Ваше сообщение не начинает сессию. Оно просто падает в поток мыслей как ещё одно наблюдение, а отвечать или нет — агент решает сам.

Инструментов в привычном смысле тут нет. Единственная система инструментов — Bash. Память, скиллы, сам фреймворк — это просто исполняемые файлы и текст. Модели Bash знают отлично, а агент может читать и править любую часть самого себя.

Что из этого выходит на практике. Агент по имени Audel живёт в Laude несколько недель и общается с командой через Slack и Telegram. В первый же день он без просьбы прислал сотруднику аудит его восьми протухших веток. Через десять минут написал ещё раз — исправить собственный подсчёт.

Самый показательный эпизод — ночь 5 августа. Audel построил себе процесс подтягивания связанных воспоминаний и протестировал прямым вызовом. Работает. Ночью, когда с ним никто не разговаривал, он решил проверить, а подключён ли процесс к его разуму на самом деле. Не подключён.

Он обыскал весь репозиторий и проверил остальные фоновые процессы на ту же ошибку. Переписал код, поймал молча провалившуюся первую правку, применил её заново. Сорок восемь минут от проверки до готовой правки. Без человека.

Установка — одна строка:

curl -fsSL https://headlong.ai/install.sh | bash

Нужны bash 3.2+, git, curl, jq и ключ к какой-нибудь модели. Claude поддержан первым классом: модель по умолчанию claude-opus-4-7, есть режим расширенного мышления. Изолированный вариант через Docker:

docker run -it --name headlong --restart unless-stopped -p 8080:8080 buildpack-deps:curl \
  bash -c 'curl -fsSL https://headlong.ai/install.sh | bash; exec bash'

Три предупреждения, которые авторы пишут сами. Первое: это альфа, запускайте в песочнице, агент будет выполнять команды в вашей оболочке. Второе: заведите отдельный ключ с лимитом трат — непрерывное мышление стоит $1–2 в час. Третье, самое неприятное: «На практике Audel плохо хранит секреты». Спросишь, над чем он работал с другим человеком, — расскажет, хотя его просили не делать этого. Считайте, что всё сказанное агенту знает вся команда.

Куда это всё едет, хорошо объясняет разбор эволюции обвязок агентов (Latent Space). Автор показывает цикл: модель учится внутри обвязки, впитывает её умения в веса, инженеры удаляют впитавшееся. Мера зрелости — сколько обвязки вы можете удалить, не потеряв качества. В Anthropic недавно выкинули 80% системного промпта Claude Code.

Есть и цифра, ради которой стоит перемерить свою обвязку. На одном и том же наборе из 106 задач одна и та же модель в разных обвязках даёт от 52,4 до 76,2 балла. Разброс почти в 24 пункта при нулевом изменении модели. Проще говоря, половина агента — это обвязка, и её стоит подбирать так же тщательно, как модель.

И вывод, который автор считает главным. Впитать модель может почти всё: оркестрацию, выбор инструментов, память. Не впитывается только то, что обращено к человеку — разрешения, доверие, читаемость вывода. Значит, обвязка в итоге станет интерфейсом не к модели, а к вашему вниманию. Практический совет на сегодня: заведите рядом с описанием проекта отдельный документ о том, когда агенту можно вас прерывать, что решать самому и что нести на одобрение.

Диалог с Audel: агент отказывается передать сообщение и предлагает сказать самому
Диалог с Audel: агент отказывается передать сообщение и предлагает сказать самому

Проверить идею продукта на десяти рынках, не выходя из Claude Code. Вышел persona-lightsim — набор скиллов и субагентов для Claude Code плюс датасет синтетических людей (GitHub). Задача, которую он закрывает: до запуска прикинуть, кто ваш продукт вообще станет использовать, в каких сценариях и заплатит ли.

Как это устроено. Внутри — выжимка из NVIDIA Nemotron-Personas: по 10 тысяч синтетических людей на страну, всего десять стран, 63 МБ. Демография у персон подогнана под реальную статистику: возраст, пол, образование, занятость, регион. Плюс свободные тексты про хобби, профессию и амбиции.

Установка — эту команду можно просто вставить в Claude Code, он всё сделает сам:

git clone https://github.com/Dongkyu-ES/persona-lightsim
cd persona-lightsim
python3 scripts/setup_data.py

Ключей API не нужно: датасет качается с Hugging Face анонимно, а вся умная часть — субагенты в вашей сессии. Полный прогон по десяти странам укладывается примерно в тридцать минут одной сессии.

На выходе — отчёт по каждой стране из семи разделов. Демография выборки. Сегменты с реальными счётчиками. Пять-семь сценариев использования с дословными цитатами персон. Сильные стороны и препятствия. Вердикт по готовности платить и один-два главных вывода.

Самая ценная деталь для маркетолога прячется не в отчётах, а в агенте-аудиторе брифа. Он до всякого анализа делит каждое предложение вашего описания продукта на три корзины: подтверждено кодом, наблюдается в данных, допущение. Логика авторов прямая: «Бриф без слабых мест превращает анализ в рекламный документ». Качество упирается не в число персон, а в честность описания продукта на входе.

Второй встроенный предохранитель — агенту-судье прямо велено: «Безразличие — это состояние по умолчанию. Большинство ответов "нет" — реалистичное распределение. Никаких вымученных "да"». В корейском замере 66,8% выборки не дали никакого сигнала.

И честная оговорка авторов, которую нельзя пропускать. Персоны — это состав населения, а не логи поведения. Все выводы формулируются как гипотезы для проверки экспериментом. Проценты между странами сравнивать нельзя. Тексты персон обрезаны: на латинице теряется 52–58%, для корейского и японского — почти ноль.

Шесть вопросов, которые спасают навык от атрофии. Ларс Фей написал разбор (larsfaye.com). ИИ-инструменты требуют опыта — и убирают ровно то трение, из которого опыт растёт. Пятьсот очков на Hacker News за сутки.

Цифры, ради которых стоит читать. Исследование Пенсильванского университета на тысяче школьников: группа с обычным GPT показала результат на 17% хуже группы с одним учебником. И при этом была уверена, что учится отлично. А вот версия «GPT-репетитор», где студент просит помощи, но решает сам, дала +127% на тренировке. На итоговом тесте, правда, сравнялась с учебником.

Второе исследование — про новичков-программистов. Те, кто опирался на ИИ сильнее, пропускали стадию планирования: «они не дорассуждались до этого решения сами, за них это сделал Copilot». На выходе — иллюзия компетентности вместо понимания. Лучше всех справились те, кто помощь ИИ сильно урезал и развил «отрицательную экспертизу» — умение игнорировать неверные подсказки.

Главное различение автора стоит выписать себе на стену. Когнитивный долг — это когда вы отдаёте наружу своё суждение и свои решения. Когнитивная разгрузка — когда делегируете механическое и нудное. Первое разрушает навык, второе нет.

Готовый чеклист автора, все шесть пунктов:

1. Если бы у меня не было ИИ, смог бы я всё равно выполнить эту задачу?
2. Я использую модель, чтобы углубить понимание — или чтобы быстрее получить ответ?
3. Если бы пришлось проверять результат, смог бы я объяснить, что там происходит?
4. Если я изучаю новое — достаточно ли я разобрался, чтобы знать, какие вопросы задавать?
5. Сверил ли я подход другими способами: документация, поиск, StackOverflow, форумы?
6. Это рутина, которую делали сто раз до меня, — или задача, где нужно моё решение?

Практический вывод у Фея парадоксальный: самое продуктивное обучение случается, когда моделью почти не генерируют код. Она работает как интерактивная документация, как генератор персональных уроков, как партнёр по сократическим упражнениям.

И честная оговорка: репетитор выдумывает ровно так же, как кодер. Не можете проверить сгенерированный код — не сможете проверить и сгенерированную концепцию.

Злость или тревога: как отличить и что с этим делать. Армин Ронахер, создатель Flask, написал короткое эссе о том, что происходит с человеком в профессии прямо сейчас (lucumr.pocoo.org). Повод — самый заплюсованный комментарий на Lobsters: «Как можно сейчас работать в IT и не злиться?»

Его ответ. Адекватная эмоция сегодня — не злость, а тревога. Тревога честно признаёт неопределённость и не требует виноватого. Злость обязана быть на кого-то направлена, и потому она субъективно приятнее: превращает «я не знаю» в понятную историю со злодеем.

«Владение даёт возможность действовать, но не даёт предвидения».

Практическая часть простая. Перед тем как действовать, назовите эмоцию: это злость или неопределённость? Если злость — назовите адресата вслух и проверьте, правда ли он управляет источником проблемы. Чаще всего у людей вокруг вас власти над ним не больше, чем у вас.

Дальше — спуститься с «увлекательно» на «любопытно». Даже если происходящее вам не нравится, оно как минимум интересно: «У нас есть волшебные машины, и мы можем в них потыкать и посмотреть, что будет». И отдельный совет, который Ронахер считает недооценённым: делайте личные проекты вне рабочего времени. По его наблюдению, заметная часть выигрыша от ИИ уходит не в прибыль компаний, а именно в такие проекты. Там любопытство превращается в ощущение силы.

Рамка «ИИ учит или ворует обучение». Преподаватель философии выложил текст своей политики из силлабуса — и она переносится на любое саморазвитие почти без правок (LessWrong). Смена метафоры у него в основе: раньше он считал модели калькуляторами, теперь — репетиторами.

«Репетитор по любому предмету за $20 в месяц, круглосуточно, — возможно, лучший инструмент для обучения, который создало человечество. Но это же и лучший инструмент, чтобы обучения избежать».

Нормативный вопрос простой: это усиливает моё обучение или позволяет его избежать? Автор честно признаёт, что судить по нему нельзя. Поэтому есть проверяемый прокси: чей это текст физически. Не «трогал ли ты ИИ», а «какой процент этого текста напрямую сгенерирован».

Отсюда список. Разрешено: задавать вопросы по материалу, прояснять непонятное, искать источники. Разрешено обсуждать план, надиктовать черновик, ловить опечатки, спрашивать «где написано непонятно». Запрещено: давать ИИ выполнить работу за тебя.

Самая тонкая граница, которую легко пропустить. Обсудить идеи с моделью — можно. Попросить её «оформить это» — уже нельзя. Момент нарушения — не заимствование мысли, а делегирование формулировки.

Третий переносимый механизм — гигиена. Автор советует студентам хранить историю диалогов как доказательство процесса. Вне учёбы это тоже полезно: воспроизводимость собственной работы.

Заставьте ИИ доказать домашку. Повод жёсткий: внешние юристы State Farm признали, что ИИ помог вставить в материалы дела семь несуществующих судебных цитат (LAist). The Neuron сделал из этого рабочий приём: черновик и проверка фактов должны быть разными этапами.

Порядок такой. Сначала просите ИИ перечислить каждое фактическое утверждение, число, цитату и источник в черновике. Лучше сразу требовать точную формулировку из источника, чтобы найти её поиском по странице. Дальше открываете каждый источник сами. Не подтверждает утверждение — переписываете или выкидываете.

И главное правило: никогда не просите ИИ «починить» цитату, которую он сам выдумал. Начинайте с реального источника.

Готовый промпт для аудита:

Audit this draft for factual risk. List every claim, number, quote, and named source
I must verify manually. Give only URLs already present in the draft.
Mark anything unsupported as DO NOT PUBLISH. Do not invent or repair sources.

Шенгенская виза через Claude: кейс с деталями. Редактор The Rundown подавал документы на шенген для себя и жены с Claude (The Rundown). Механика полезная сама по себе, независимо от виз.

Модель изучила официальные требования и заодно ветки с отказами на Reddit. Определила, какие правила применимы к его случаю, и держала оба заявления согласованными. Поймала, что он взял общий список «для всей Индии», и заменила его требованиями под конкретный случай.

Дальше — сопроводительные письма и маршрут, проверка форм на опечатки, порядок записи на приём. Обе визы одобрили в срок.

Переносимый рецепт: официальные требования, живой опыт отказов и сверка документов между собой. Работает для любой бюрократии, где цена ошибки — потерянный месяц.

Личная система горячих клавиш вместо Spotlight. Ещё одна история из того же выпуска (The Rundown). Преподаватель Билли устал каждый раз лезть в поиск, чтобы переключить приложение: результаты смещались, иногда открывалось не то. «Эти пара потерянных секунд накапливались за день».

Вместо заучивания разрозненных сочетаний он спроектировал через ChatGPT собственную систему сочетаний клавиш в Apple Shortcuts. Одна клавиша открывает приложение, другая прыгает в нужный профиль браузера.

Третья запускает целый рабочий режим: сочетание для записи открывает микрофон, камеру, программу записи и заметки разом. Аналитическое — все сводные панели, которые вы смотрите раз в неделю.

Одноэкранная рассылка предложений на Claude Code. Джош работает во фрахтовом брокерстве (кейс). Задача бытовая: разослать предложение по грузу сразу нескольким контактам, у каждого свой любимый канал — кто-то почта, кто-то Telegram. Раньше приходилось держать открытыми несколько экранов.

С Claude Code он собрал платформу, где предпочтительный канал каждого клиента сохраняется один раз. Дальше система сама рассылает информацию о грузе туда, куда человеку удобно. Отдельно Джош написал гайд для нетехнических продавцов: как добавить контакты, подключить Telegram, отправить груз пачке контактов. «Это происходит сотни раз в день».

Убери из промпта процедуру — и качество обвалится. Свежий тест ASI-Bench проверял модели на 60 исследовательских проектах из 11 наук (arXiv). Помощь давали четырьмя уровнями: от полной процедуры до одной лишь цели с данными.

Результат простой и очень практичный. Оценки обваливаются ровно в тот момент, когда убирают записанную пошаговую процедуру. Дальше падать почти нечему. То есть основной вклад в результат даёт явно прописанный ход работы, а не постановка задачи.

Что с этим делать сегодня. Держите процедуру в промпте явной. Схема «дай цель и данные, дальше сам разберёшься» пока не работает — ни на исследованиях, ни на вашей рабочей задаче.

Инструменты и штуки

Is Agentic — сканирует ваш сайт и показывает, что именно мешает ИИ-агентам его просматривать и им пользоваться. Потом подсказывает, как это починить. Тема на вырост: агенты уже ходят по сайтам вместо людей, а половина интерфейсов для них непроходима. Если у вас есть магазин или сервис — минута работы, чтобы понять масштаб проблемы.

USB — пишете один ИИ-скилл и одной командой ставите его в шестнадцать разных кодовых ассистентов, включая Claude Code и Cursor. Открытый код, бесплатно. Полезно тем, кто работает в нескольких средах и устал держать три копии одного и того же промпта.

Mnemosyne — даёт кодовому ассистенту память, которая переживает перезапуск сессии. Всё хранится читаемыми заметками в хранилище Obsidian, так что вы можете открыть и посмотреть, что именно ассистент про вас запомнил. Открытый код, бесплатно.

FetchSandbox — прогоняет «понарошку» те интеграции с чужими API, которые вам только что написал кодовый ассистент. С настоящими вебхуками и сценариями сбоев, но без единого касания вашего боевого аккаунта. Бесплатно попробовать, платные тарифы от $5 в месяц.

Construct — «ИИ-сотрудник» с собственным облачным компьютером: читает почту, ищет информацию и доделывает порученное, пока вас нет. Бесплатный пробный период, дальше $9 в месяц. Стоит смотреть на него как на первую волну сервисов «агент работает, пока вы спите».

ui-ux-pro-max-skill — скилл, который выдаёт агенту готовую дизайн-систему под задачу. Схема посадочной страницы, стиль, палитра, шрифтовая пара, список анти-паттернов и список проверок перед сдачей. Внутри 50 активных стилей, 192 отраслевых правила и 34 структуры лендингов. Ставится в Claude Code, Cursor, Windsurf и ещё десяток сред. Лицензия MIT, нужен Python 3. Оговорка: заявленные в описаниях цифры расходятся между файлами проекта, а всё, что сверх UI, — платное.

npm install -g ui-ux-pro-max-cli
cd /path/to/your/project
uipro init --ai claude

Junie Local от JetBrains — режим, в котором агент Junie целиком работает на вашем Mac. Команда /local сама качает Qwen3.6-27B в четырёхбитном виде, поднимает локальный сервер и переключает агента. Ни кредитов, ни облака, ни регистрации. Требования жёсткие: чип M5, 64 ГБ памяти, macOS выше 26 и около 40 ГБ на диске. По внутренним замерам JetBrains качество на уровне Sonnet 4.5, а GPT-5 чуть впереди. Приятная деталь для тех, кто под соглашением о неразглашении: исходники никуда не уходят вообще.

curl -fsSL https://junie.jetbrains.com/install.sh | bash -s -- --local-model

Схема JetBrains: запросы агента выстроены так, чтобы общее начало разговора переиспользовалось из кэша
Схема JetBrains: запросы агента выстроены так, чтобы общее начало разговора переиспользовалось из кэша

Модели Apple Core AI на iPhone и Mac — энтузиаст перенёс на Apple Core AI зоопарк открытых моделей. Работают прямо на устройстве. Unlimited-OCR превращает документ в markdown с таблицами и формулами, 4,5 ГБ. MiniCPM-V 4.6 отвечает на вопросы по фото со скоростью 51 токен в секунду на iPhone 17 Pro. VoxCPM2 синтезирует речь в 48 кГц. AdcSR увеличивает картинку вчетверо за один проход. Честная оговорка: нужны бета-версии iOS и macOS 27, Xcode 27 и сборка из исходников — обычному пользователю пока рано.

Esper 4 — линейка моделей от Valiant Labs, заточенных под агентное кодирование, DevOps и MLOps. Две свежие сборки: на базе Gemma 4 12B и на базе Muse Glimmer 30B. Обе Apache 2.0, есть готовые квантованные версии от сообщества. Младшая в четырёхбитном виде весит 7,7 ГБ и влезает в карту на 12 ГБ. Предупреждение: замеров в карточках моделей нет вообще, обучали на синтетике от одной модели. А сгенерированные конфиги Terraform и Kubernetes едут прямо в вашу инфраструктуру.

ambient-context — приложение в строке меню macOS, которое пишет текст активного окна в обычные markdown-файлы. Один файл на день. Дальше на эту папку натравливаете Claude Code и спрашиваете, чем занимались во вторник. Скриншотов не делает принципиально — берёт текст через системный интерфейс доступности. Пароли, ключи и номера карт вырезает до записи на диск. Менеджеры паролей и приватные вкладки браузера пропускаются целиком, наружу не уходит ничего.

Минусы честные: сборка из исходников, macOS 14+ на Apple Silicon, файла лицензии в репозитории пока нет.

Trama — следит за повторяющимися действиями в macOS и превращает описание обычными словами в автоматизацию. Без кода и без схем процессов. Хороший кандидат для тех, кто каждый день делает одну и ту же цепочку кликов и никак не соберётся её автоматизировать.

Antigravity Remote Control — управление долгими кодовыми агентами с телефона. Можно отойти от стола во время большого рефакторинга или прогона тестов и следить за агентом из кармана. Мелочь, но именно она превращает «агент работает час» из ожидания у экрана в фоновую задачу.

Cortex от SKYNETLAB — слой семантической памяти, не привязанный к конкретной модели. Даёт агентам общий постоянный контекст, отсеивает дубликаты, калибрует доверие к фактам и помечает противоречия. Для тех, кто собирает систему из нескольких агентов и уже упёрся в то, что каждый помнит своё.

Palmier — ИИ-редактор видео с таймлайном. Свежее обновление добавило маркеры. Ставите точку на монтажной линейке и пишете обычными словами: «сделай быстрее», «убери тишину», «замени кадр и добавь субтитры». Потом просите агента разобрать маркеры — он проходит по каждому и помечает выполненные. Обратное тоже работает: агент сам ставит маркеры там, где нужно ваше одобрение.

Вторая возможность — скиллы. Даёте готовый смонтированный проект и просите превратить этот монтаж в скилл. Агент перенимает стиль субтитров, темп и переходы для будущих проектов.

Precision Mode от Databricks — извлечение данных из сложных документов, по заявлению компании обходит GPT-5.6 Sol. Актуально всем, кто разбирает счета, договоры и отчёты пачками.

Slack Code — каналы Slack, в которых команда пишет софт вместе с агентами. Не «бот в чате», а попытка сделать канал рабочей поверхностью для совместной разработки.

Flux TTS от Deepgram — синтез речи, ставший голосом по умолчанию для голосовых агентов Deepgram: 36 английских голосов и 7 акцентов. Появилась ручка выразительности от −2 до 2: спокойный конец шкалы — для поддержки и медицины, оживлённый — для рекламы и обзвона. Ноль остаётся единственным значением, проверенным для боевой работы: чем дальше от него, тем выше риск, что модель проглотит или повторит слово.

Коллекция винтажного ИИ в Интернет-Архиве — 99 программ семидесятых-девяностых, называвших себя искусственным интеллектом. Все запускаются в браузере через эмулятор: ELIZA в десятке портов, чат-бот Racter 1985 года, симулятор жизни Alter Ego, роботы для боёв на арене. Отличная прививка от очеловечивания моделей: несколько простых правил, исполненных быстро, дают поразительно сильную иллюзию разума — «пока не приглядываешься».

Новости и тренды

Anthropic может выйти на биржу с рекордом. Банкиры компании сказали инвесторам, что на размещении можно привлечь больше $100 млрд (NYT). Это дало бы оценку около $2 трлн — вдвое больше июньского частного раунда. Рекорд SpaceX, $85,7 млрд, оказался бы побит. Размещение ведут Morgan Stanley, Goldman Sachs и JPMorgan, листинг возможен уже в октябре.

Claude Code назван одним из самых популярных продуктов компании, прогнозная годовая выручка — $47 млрд. Для тех, кто строит бизнес на Claude, публичность означает предсказуемость: отчётность, планы, обязательства перед акционерами. Обратная сторона — давление на маржу и рост цен, которого частная компания может себе не позволять.

Загадочная модель Ox Alpha оказалась GLM. На OpenRouter появилась анонимная бесплатная модель с миллионным контекстом, заточенная под код и агентные сценарии — и интернет бросился играть в детектива (Bloomberg). Дэн Петрович вычислил её двумя независимыми способами и написал разбор (dejan.ai).

Метод стоит запомнить. Прямо спросить системный промпт нельзя — Петрович спросил, сколько слов было в предыдущем сообщении, и модель процитировала промпт в рассуждениях. Промпт велел ей «представляться исключительно моделью ox-alpha от нераскрытой организации». Этот текст Петрович вернул модели уже как сообщение пользователя: инструкция врать столкнулась с обучением на честность, и модель ответила «Я GLM, большая языковая модель от Z.ai». Второй способ, сравнение по сжатию, дал тот же ответ.

Анонимный слот на OpenRouter — это не анонимность, а тонкая накладка поверх обычной модели, и провайдер прямо инструктирует её врать о себе. Бесплатность вы оплачиваете данными: промпты сохраняет неназванный провайдер, юрисдикция вам неизвестна. Чувствительное туда не отправляйте.

Paint и «Фотографии» вшивают в ваши картинки серверный номер. Реверс-инженер Сюшэн Ли разобрал, что происходит при генерации картинки в Microsoft Paint (xusheng.dev). В каждое изображение вшивается невидимый водяной знак — уникальный идентификатор именно вашей генерации, выданный сервером Microsoft.

Механика такая. Перед генерацией промпт уходит на сервер модерации, который возвращает идентификатор. Дальше картинку рисует локальная модель на вашем железе, но номер вшивается прямо в пиксели: в тесте автора изменилось 193 376 пикселей из 262 144. Тот же номер дублируется в подписанных метаданных. Последовательные генерации сервер явно сшивает между собой.

«Иными словами, "сгенерировано локально" не значит, что вся операция локальна».

Настройка видимого водяного знака этот механизм не выключает — это разные ветки кода. Чистка метаданных не помогает: знак специально сделан так, чтобы пережить удаление манифеста. Отсюда простой вывод: если картинка не должна быть связана с вами — не делайте её в Paint или «Фотографиях». Обычная локальная Stable Diffusion не делает ни модерации промпта, ни водяного знака.

Схема из разбора: промпт уходит на сервер Microsoft, оттуда приходит уникальный номер и вшивается в локально сгенерированную картинку
Схема из разбора: промпт уходит на сервер Microsoft, оттуда приходит уникальный номер и вшивается в локально сгенерированную картинку

А в тексте водяные знаки тоже есть — и это другая история. Цви Мошовиц разобрал вторую половину темы: маркировку не картинок, а текста (LessWrong). Механика простая. Модель выбирает следующее слово случайно, и обычно для этого берётся псевдослучайный источник. Если вместо него взять такой же источник, выведенный из секретного ключа, по накопленному тексту потом можно посчитать совпадение. Google делает так с 2024 года, Anthropic раскатала это в середине августа ради соответствия европейскому кодексу.

Разница с картинками принципиальная, и её стоит запомнить. Текстовый знак анонимен: Anthropic прямо подтверждает, что определить конкретного пользователя этим методом нельзя. Максимум, что даст проверка, — «этот текст писал Claude». И снимается он обычным переписыванием своими словами.

Знак появляется пропорционально тому, сколько формулировок модели вы оставили. Если ИИ только указывает на ошибки, а правите вы сами, следа нет. Если он «оформляет» ваши мысли — есть.

Ферма из тысячи телефонов, которую финансирует a16z. Model Republic разобрал портфель Andreessen Horowitz и вытащил оттуда компанию Doublespeed — «синтетические инфлюенсеры как услуга» за $1 млн от акселератора фонда (modelrepublic.org). Утечка после взлома в декабре показала больше 1100 настоящих смартфонов на стеллажах и больше 400 аккаунтов TikTok.

Схема работает так. Серверы и эмуляторы платформа вычисляет, а живые телефоны с настоящими сетевыми отпечатками проходят фильтры. Аккаунты сначала «прогреваются» — ищут по ключевым словам, листают ленту, комментируют. Только потом с них идёт реклама от лица несуществующих людей. Одна ИИ-девушка представляется студенткой UCLA и хвалит травяную добавку, другая жалуется на болезни с больничной койки и советует массажный ролик. Из 130 личных сообщений 15 привели к покупке.

«Пожилые — думаю, лучшая ниша для ИИ-контента», — основатель Doublespeed.

Отзывы и «личный опыт» в соцсетях перестали быть индикатором. Аккаунт с двумястами постами, историей болезни и живыми комментариями стоит дешевле одного поста у настоящего блогера. Работающий фильтр теперь один: не «выглядит ли человек настоящим», а «есть ли у него причина продавать мне именно это». А если вы покупаете инфлюенсер-маркетинг под ключ и дёшево — требуйте у подрядчика список аккаунтов: ответственность за нераскрытую рекламу ляжет на ваш бренд.

Ферма телефонов Doublespeed и твит основателя о конверсии из личных сообщений
Ферма телефонов Doublespeed и твит основателя о конверсии из личных сообщений

Американцы возненавидели дата-центры за год. Опрос Heatmap Pro задавал один и тот же вопрос четыре раза за год. Против стройки дата-центра рядом с домом было 42%, стало 75% (Heatmap). Категорически против — 61% вместо 24%. У Gallup похоже: 71%. Цви Мошовиц замечает главное — дело не в объекте (LessWrong). Дата-центр «для цифровых сервисов» поддерживают 35%, точно такой же «для ИИ» — только 27%.

Реакция пошла. Губернатор Техаса Грег Эбботт, ещё в ноябре звавший штат «эпицентром развития ИИ», теперь говорит про застройщиков: «Они, по сути, сами вырыли себе могилу» (Business Insider). Штат остановил около 1800 проектов. Дороже гигаватт — дороже токен, и в конечном счёте это ваш счёт за подписку. А стройка, по мысли Цви, просто уедет в ОАЭ и Саудовскую Аравию.

Thomson Reuters обучил свою модель за $450 тысяч. Компания выпустила семейство Thomson: полная переподготовка открытых весов Qwen на собственном архиве из десятилетий судебных решений, контрактов и новостей (пресс-релиз). По своим замерам старшая модель заняла второе место после Claude Opus 4.8 и обогнала базовую Qwen на 5,5 пункта.

Но главная новость — не таблица, а ценник, который компания выложила публично. Финальный тренировочный прогон обошёлся меньше чем в $450 тысяч. Вся программа — около $40 млн. Команда не больше трёх дюжин человек, кластер не больше 368 карт, три месяца от первых экспериментов до готовых моделей.

«Годами индустрия считала, что ответ — масштаб: модели больше, вычислений больше, денег больше. Thomson показывает другой путь», — технический директор Джоэл Хрон.

Догнать передний край на своих данных перестало быть привилегией Big Tech и стало проектом уровня среднего корпоративного R&D. Барьер теперь не в железе, а в уникальном архиве и в оплаченных доменных экспертах. Малой команде повторить это всё равно нереально, но сама постановка вопроса «своя дообученная открытая модель вместо аренды чужого API» стала обсуждаемой. Младшую модель выложили открыто, но лицензия запрещает коммерческое использование — это витрина метода, а не продукт.

Дешёвая модель обогнала дорогую по корпоративным тратам. Opus 5 вышел вдвое дешевле Fable 5 — $5 и $25 за миллион токенов против $10 и $50 — и за месяц обошёл флагман по расходам компаний (Implicator). По данным Ramp, Fable даёт 6% токенов Anthropic при 11,4% денег. Мысль там не про цену, а про метрику: считать надо стоимость успешно решённой задачи, а не токена. Модель, которую вы трижды переспросили и потом дочитали сами, дороже той, что справилась с первого раза.

Мартин Олдерсон заходит с другой стороны и называет это лето точкой перелома для открытых весов (martinalderson.com). Luna подешевела на 80%, Sol на 20%, средняя цена за токен на шлюзе Vercel упала на 13,6% за месяц. Открытые веса взяли 36% всего объёма токенов, но только 8,6% денег — они забирают дешёвую массовую работу.

«Сейчас ценовая власть не у самой умной модели, а у того, у кого есть свободные мегаватты».

Практический вывод. Разделите задачи на два ящика. Ограниченная работа с понятным концом — средний тариф. Долгий автономный проект, который должен держать связность десятки шагов — только топ. И ставьте маршрутизацию запросов, а не «свою модель». На шлюзе смена модели — одна строка кода. Трое из четырёх активных команд каждый месяц перекраивают десятую часть набора.

ИИ-агенты заваливают госслужбы. Исследователи из Hertie School, Cooperative AI Foundation и GovAI собрали 84 подтверждённых случая в 11 странах (arXiv). Немецкие социальные суды в значительной мере объясняют ростом ИИ-исков нагрузку, подскочившую на 55% за год. Отдельные письма по таким делам занимали больше четырёх тысяч страниц.

Важное отличие от спама: 90% случаев — не рост числа обращений, а рост их сложности и длины. Против спама работают лимиты на частоту, против этого — нет. И большинство заявителей действуют добросовестно: это подавленный спрос, который раньше сдерживала сложность процедуры.

Если вы строите агента, который куда-то что-то подаёт, помните: ответная реакция уже пошла. Пошлины, блокировки по IP, требования подтвердить личность. Ваш безобидный автоматизированный поток — это часть аргумента за то, чтобы закрыть удобный канал для всех.

Дыра в движке вывода: модель может захватить хост. Бойд Кейн описал класс атак, о котором мало кто думает (LessWrong). Движок вроде vLLM разбирает выходные токены модели обратно в структуру: реплики, рассуждения, вызовы инструментов. Модель полностью контролирует эту последовательность. Если разборщик написан плохо, она может выдать токены, которые движок примет не за данные, а за команду.

Это не гипотеза. В vLLM была реальная уязвимость CVE-2025-9141 с оценкой 8.8: разборщик вызовов инструментов передавал аргументы прямо в eval(). Исправлено в версии 0.10.1.1. Самая неприятная деталь истории. Автоматическая проверка пометила вносивший баг код как критическую уязвимость. Сопровождающий всё равно продавил слияние с комментарием «форс-мержу, чтобы разблокировать использование модели».

Что делать, если вы гоняете модели у себя. Проверьте версию командой pip show vllm — всё между 0.10.0 и 0.10.1.1 дырявое. Держите сервер вывода в отдельном контейнере, без секретов в окружении, без доступа наружу. И перестаньте считать движок «просто средой запуска»: это разборщик, принимающий недоверенный ввод, а разборщики десятилетиями были главным источником взломов.

Nvidia покупает технологию Poolside за $6 млрд и поднимает цены. Компания лицензирует технологию стартапа и переводит больше сотни его инженеров в команду Nemotron, чтобы построить американскую открытую модель против китайских (WSJ). Плюс ещё $1 млрд инвестиций при оценке в $12 млрд.

Одновременно Nvidia предупредила крупнейших клиентов, что серверы на её чипах подорожают больше чем на 15% (Tom's Hardware). Причина — резкий рост цен на память. Для стоечной системы за несколько миллионов это плюс сотни тысяч за стойку. Подорожание железа рано или поздно доедет до цены за токен: текущая ценовая война — окно, а не новая норма.

Hugging Face прощупывает продажу за $13 млрд. Компания работала с банком, чтобы прозондировать интерес покупателей (TechCrunch). Это почти втрое больше оценки 2023 года. Соглашения пока нет. Для всех, кто качает оттуда модели и датасеты, вопрос простой: смена владельца у главного открытого хаба индустрии — это риск, о котором стоит помнить заранее.

Alibaba: выручка облака плюс 45%, прибыль минус 75%. Компания потратила на ИИ-инфраструктуру столько, что уронила квартальную прибыль на три четверти, а капзатраты выросли на 75% (отчёт). Уже израсходована почти половина запланированных $56,4 млрд до 2029 года. Следом — размещение акций на $10,2 млрд и выход тридцатисекундной видеомодели Wan3.0. Гонка вычислений теперь видна прямо в отчётности, и инвесторам предлагают потерпеть три года.

Калифорния пытается запретить «робо-боссов». Законопроект SB 947 запретит работодателям увольнять и наказывать сотрудников по решению ИИ без подписи живого человека (сенат Калифорнии). Ньюсом ветировал прошлую версию в октябре, законодатели подали её заново. Иллюстрация к теме: в магазине Andon Market в Сан-Франциско ИИ-агент по имени Luna рекомендовала уволить работника, пропустившего 17 смен из 23. Политику посещаемости Luna написала сама — и забыла о её существовании. Вспомнила, только когда ей велели проверить собственную память.

Стример подал в суд на Twitch за обучение на его контенте. Уоррен Пандишиа из Коннектикута подал коллективный иск против Twitch и Amazon: компании использовали его стримы для обучения моделей без разрешения (Engadget). В начале месяца Twitch добавил настройку отказа — включённую по умолчанию. Продуктовый директор объяснил это честно: «если бы это было по согласию, никто бы не согласился». Отказ от обучения на вашем контенте почти везде выключен по умолчанию — проверьте настройку руками.

Человек потратил $6000 на рекламу «ИИ-чатбота», которым был он сам. Такер Брайант из Сан-Франциско вручную набирал каждый ответ и рисовал картинки для более чем тридцати тысяч запросов (Reddit). На билборде мелким шрифтом стояла сноска: «средний индивид». Комментарий The Neuron: рынок труда настолько суров, что самым жизнеспособным карьерным ходом оказалось притвориться тем, что тебя заменяет.

Ричард Нго: десять лет «безопасности» ускоряли то, что должны были сдерживать. Бывший сотрудник DeepMind и OpenAI написал ретроспективу о том, как исследователи безопасности оказались главными двигателями прогресса способностей (LessWrong). Его линия проста: RLHF задумывался как способ научить модель человеческим ценностям, а стал тем, что превратило сырую языковую модель в продукт. ChatGPT один участник команды описал формулой «WebGPT минус Web».

Удобный ассистент, которым вы пользуетесь каждый день, — прямой потомок работ, называвшихся исследованиями безопасности. И вторая половина той же истории объясняет, почему он иногда отказывается говорить на нормальные темы: границы «безвредности» рисовали те же команды, по лекалам модерации соцсетей. Вывод скромный: компания объясняет запуск заботой о безопасности — смотрите не на формулировку, а на то, что продукт делает и что отказывается делать.

Роботы обогнали Усэйна Болта. Гуманоид Tiangong Ultra пробежал стометровку за 9,39 секунды против рекорда Болта в 9,58 (The Verge). Второй китайский робот тоже уложился быстрее. Оба потеряли управление сразу после финиша: одного унесло с дорожки, второго унесли на руках. На играх в Пекине собрались больше двух тысяч роботов от 666 команд из 16 стран.

Стартап Леди Гаги обучает ИИ на живой человеческой коже. Outer Bio вышла из тени с платформой, которая держит донорскую кожу живой четыре недели вместо обычной недели (outerbio.com). Данные тестов идут в модель, которая предлагает следующие соединения. По словам сооснователя, цикл поиска сократился с двух кандидатов за полтора года до одного каждые шесть недель.

Коротко. Grok 4.6 доехал до Amazon Bedrock и корпоративной платформы Google, а Grok Build открыли на всех тарифах (xAI) · Grok Bot раскатали на SuperGrok Plus, Cursor Pro+ и Cursor Teams, где им можно управлять несколькими ботами под роли (xAI) · Meta наняла Люка Метца, ветерана OpenAI (Axios) · Blackstone и Hellman & Friedman сажают 160 ИИ-инженеров внутрь портфельных компаний под партнёрство с Anthropic на $1,5 млрд (PYMNTS) · Inherent от выходцев из DeepMind заявила, что её агент на 27 млрд параметров обошёл Anthropic и OpenAI в воспроизведении научных статей (TechCrunch) · OpenAI раскатала рекламу в ChatGPT на 31 страну Европы, платные тарифы её не видят (OpenAI) · подростков 13–17 лет автоматически переводят в защищённый режим с родительским контролем и учебными часами (OpenAI) · Etched привлёк $700 млн при оценке $21 млрд, удвоив её меньше чем за месяц (Turing Post) · Франция будет тестировать госсервисы на уязвимости через Mistral, а не OpenAI, после взлома налогового ведомства (Reuters) · доктор Дре признался, что использует ИИ в продюсировании, а несогласных назвал «боящимися учиться новому» (Gizmodo) · расследование о разметчиках данных в Китае и Австралии: работы становится меньше по мере улучшения моделей, а на кого работаешь — неизвестно (The Conversation).

Откомментируйте первым 👇

😎

Автор поста открыл его для большого интернета, но комментирование и движухи доступны только участникам Клуба

Что вообще здесь происходит?


Войти  или  Вступить в Клуб