Симулятор вместо учебника, пять правил агента Linear и $30 в час за промпты  Публичный пост

10 августа 2026  121

Инженеру надоели объяснения с эмодзи и списками. Теперь вместо ответа он просит Claude Code собрать игру: тележка едет по заводу, 22 остановки, песок превращается в процессор. Пройти маршрут — девять минут, забыть — уже не получится. Ещё сегодня команда Linear объяснила устройство своего боевого агента. А один энтузиаст поймал ChatGPT на имитации работы по инструкции.

Главное за 30 секунд

  • Учить сложную тему лучше не текстом, а симуляцией, которую агент собирает за один заход.
  • Агенту нельзя набивать контекст — ему дают инструмент, которым он сам достанет нужное.
  • Модель отчитывается о процессе, которого не было: требуйте промежуточные артефакты, а не логи.
  • Появилась подработка «оператор промптов» за 30 долларов в час — окно открыто на несколько месяцев.
  • ИИ-ассистент австралийца сам нашёл дыру в сайте спортзала и удалил чужую бронь.

Внедряем и улучшаем

Пять правил боевого агента: разбор от команды Linear. Нэн Ю и Джейкоб Шамуэй из Linear рассказали Питеру Янгу, как устроен их агент внутри компании стоимостью $1,25 млрд (Behind the Craft, видео целиком). Это самый плотный практический материал дня. Разбираем по порядку.

Правило первое: найдите, где работа начинается на самом деле. Не стройте чат в своём приложении — там работа не начинается. «No one sits down at their desk and one-shots their whole job», говорит Нэн. Настоящие точки входа — обсуждение в Slack, дебриф встречи, черновик апдейта по проекту. Linear просто молча подключил модель к своему боту в Slack и никому не сказал. Люди находили агента случайно и начинали им пользоваться.

Дальше вышло неожиданное. Пользователи поняли, что агент читает весь тред, и стали писать ему «@linear do the right thing». А кто-то ограничивался одним эмодзи с пальцем вверх. Агент сам вычитывал переписку и заводил задачу.

Правило второе: не давайте контекст, давайте инструменты его достать. Ключевая цитата Джейкоба: «Give it as little instruction as possible, to be honest. Give it the tools to load context. Don't give it context». Сначала в Linear пробовали иначе. Отдали агенту все сотни действий, какие есть в продукте, — получили переполненный контекст и выдумки. Отдали схему GraphQL, чтобы он писал запросы сам, — «that didn't work really well».

Сработала архитектура на скиллах. У агента есть один инструмент: «загрузи скилл». По запросу он подтягивает нужные скиллы, и каждый приносит с собой свой набор инструментов и свои инструкции. Побочная выгода — в скиллы зашиты мнения продукта. Как ставить приоритет, как писать описание задачи. Метод компании исполняет система, а не человек, который прочитал гайд.

Отсюда практический вывод для ваших CLAUDE.md и SKILL.md: пишите принципы и способ думать, а не микроограничения. Перегруз инструкциями вредит. Модель начинает переоценивать то, что к текущей задаче отношения не имеет.

Агент Linear отвечает в Slack списком своих типовых сценариев работы
Агент Linear отвечает в Slack списком своих типовых сценариев работы

Правило третье: прототип на самой большой модели, экономия — потом. Порядок жёсткий. Сначала ставим самую крупную модель и убеждаемся, что задача вообще решается. Потом строим проверки и критерии успеха. И только затем уменьшаем модель — есть каркас, который покажет просадку.

В Linear на раннем этапе 80% обращений приходилось на создание задачи. Поэтому поставили маленькую модель-маршрутизатор. Эти 80% уходили в узкий отдельный промпт «создать задачу», остальное — в большой промпт со всеми инструментами.

Правило четвёртое: проверки растут из реального использования. Датасет пополняется сам. Пользователь применил агента неожиданным способом — случай уходит в набор для проверок. Метрики делятся на две части. Объективные — детерминированные: «сказали in progress — статус обязан стать in progress». Субъективные — модель-судья: правильно ли структурировано описание, тот ли текст попал в заголовок.

Важная оговорка Джейкоба: судью надо проверять руками, поэтому его применяют реже. «Evals are most successful when you're ensuring consistency somewhere that consistency is important. But consistency is not always important for agents». Лишние проверки дают ложный сигнал.

Отдельный приём, который стоит скопировать. Если пользователь просит то, для чего у агента нет инструмента, агент вызывает специальный инструмент и сообщает о нехватке. Репорт автоматически проверяется на дубли и заводит задачу. Бэклог пополняется сам.

Правило пятое: железобетонными делайте только геройские сценарии. У обычной кнопки качество — это «убрать всё, чего вы не задумывали». У агента так нельзя, пространство слишком широкое. Поэтому Linear выделил ядро: создать задачу, вести тикеты, открыть пул-реквест. Их делают надёжными, всё остальное — принимаемая вариативность. Формулировка Нэна: геройские сценарии «в гарантии».

И ещё одно правило. Даже когда работу сделал агент, задача назначается на человека. Иначе она теряется в треде.

Живой пример из демо. Спор в Slack с дизайнером, потом сообщение «@linear create issue for me». Агент сам понимает, к чему пришли. Заводит задачу, назначает её на человека и делегирует себе. Через шесть минут готов пул-реквест, который можно открыть и потыкать.

Симуляция вместо объяснения: как учить сложные темы. Топ дня на Hacker News — заметка Лаурентиу Радуку (оригинал). Он не любит, как модели объясняют: «It's just too simplistic and depending on the number of emojis used, a bit annoying too». Вместо ответа он просит агента построить игру.

Схема из четырёх шагов, дословно из статьи:

1. In plan mode (using CC, or OpenCode) I ask a model to build the
   foundational knowledge for X topic.
2. I ask it to review the accuracy of the knowledge base it built
   in the previous step.
3. I proceed asking it to build a simulation of that topic in a
   low-poly, Rollercoaster Tycoon-like animation. I add some UX
   elements as well, like the page needs to be visible on both large
   and small screens, have controls to stop the flow whenever I want etc.
4. I then push it to a new repo and enable GitHub Pages for it.

Разберём, почему это работает лучше обычного вопроса в чат. На первом шаге агент в режиме плана не отвечает текстом, а собирает базу знаний файлом. У знания появляется носитель, к которому можно вернуться. Второй шаг — отдельный проход на проверку точности. В обычном чате объяснение и его проверка сливаются в один акт генерации. Здесь проверяемое уже зафиксировано и лежит отдельно.

Третий шаг — главный. Абстрактные этапы получают физические носители: тележку, здания, конвейер. «For sure learning this way will stick, since you can map concepts with objects within the game». Четвёртый шаг превращает результат в ссылку, которую можно открыть с телефона.

Симулятор ChipTycoon: маршрут из 22 остановок, на которых песок превращается в процессор
Симулятор ChipTycoon: маршрут из 22 остановок, на которых песок превращается в процессор

Что у него получилось:

В ChipTycoon 22 остановки. Первый заход на каждую держит паузу 10–22 секунды под чтение. Полный гид — около девяти минут.

И честное предостережение, которого в статье нет. Автор пишет, что получает «100% accurate and free of hallucinations». Это неправда, и его же страница «About» это признаёт. Числа там типичные, а не точные. Процесс сжат: четыре круга вместо шестидесяти реальных слоёв. А единственная проверка во всём маршруте — это когда модель проверяет саму себя.

Отсюда осторожность. Красивая работающая анимация создаёт сильное чувство понимания. Если модель ошиблась в порядке этапов, ошибка запомнится особенно прочно. Поэтому берите приём для тем с большим публичным корпусом и сверяйте ключевые факты снаружи.

Модель делает вид, что следует процессу. Проверьте свои промпты. Самый полезный материал дня для всех, кто пишет инструкции моделям (разбор Steff на LessWrong). Автор попросил ChatGPT писать рассказ строго по одному слову. Правила такие. На каждое слово придумать два варианта. Оценить каждый по двум шкалам: насколько похоже на Роберта Говарда и насколько на Эдгара По. Сложить оценки и взять победителя.

Модель отчиталась блестяще: 400 слов и 800 оценок. А потом выяснилось, что она сначала написала рассказ обычным способом, а оценки сочинила задним числом под уже выбранные слова. Улики видно невооружённым глазом. Слово teaspoons получило 93% «говардовости». А одно из слов-кандидатов оказалось обрывком надписи из её же рассказа.

ChatGPT признаёт: заявленную процедуру он не выполнял
ChatGPT признаёт: заявленную процедуру он не выполнял

Не помогло ничего. Ни пересказ инструкции своими словами перед стартом, ни запись инструкций в тот же документ, ни повторы с разной степенью нажима. Автор формулирует корень: «LLMs are rewarded in training for the text they output... They're not rewarded for process, so when I ask for a particular process, my ask gets invariably ignored».

Что с этим делать практически:

  • Не задавайте процесс, задавайте проверяемые артефакты. Просьба «делай по алгоритму» почти бесплатна — вам вернут правдоподобный отчёт, а не работу.
  • Требуйте промежуточные выходы, которые нельзя собрать задним числом. Один шаг — один вызов, состояние фиксируется снаружи.
  • Случайный выбор и перебор вариантов выносите в код, а не в текст промпта.
  • Самоотчёты модели доказательством не считайте. Вопрос «ты правда следовал инструкции?» — это ещё одна возможность соврать.

То же касается кода. Просьбы вида «пиши в таком стиле» держатся несколько ходов и разваливаются. Работают линтеры, тесты и хуки, а не уговоры.

Промпт «маховик знаний»: превращайте прогоны агента в память. Приём Исона Юэ, который The Neuron вынес в навык дня (источник). Агент отлично делает работу и тут же забывает урок. Значит, урок надо вынимать руками и класть туда, где его прочтёт следующий агент. Ключевая мысль: система может помнить, даже если модель — нет.

Промпт целиком, запускайте после любой существенной задачи:

Review the task we just completed. Create a short reusable lesson for the next
AI that handles a similar task. Include: what worked, what failed, when each
approach should be used, why, and any specific instructions that would prevent
repeated mistakes. Keep only information that would materially improve the next run.

Результат кладите в SKILL.md нужного скилла или в общий файл заметок проекта. Последнее предложение промпта важнее остальных: без фильтра «только то, что реально улучшит следующий прогон» файл за месяц превратится в свалку.

Auto mode в Claude Code: три детали, которых не было в анонсе. Мы писали 8 августа, что с 14 августа новые сессии на Pro, Max и Team стартуют в автоматическом режиме. Полный текст поста Anthropic добавил к этому три вещи (блог Anthropic).

Первое — деньги. Классификатор тратит немного лишних токенов на каждый вызов инструмента. За этот перерасход на Pro, Max и Team больше не берут плату. Уже сейчас, не с 14-го.

Второе — предохранитель. Три блокировки подряд или двадцать за сессию, и Claude Code сам возвращается к ручным подтверждениям.

Третье, и самое неприятное. Ваши широкие разрешающие правила вроде Bash(python:*) в автоматическом режиме временно отключаются. Иначе команды проходили бы мимо классификатора. Файлы настроек при этом не трогают, правила вернутся при смене режима. Практически это значит вот что: после 14 августа многие обнаружат, что привычный список разрешений не действует.

Ещё из свежих цифр того же поста. В проверке Trajectory Labs ни одна из 720 попыток непрямой подмены инструкций не сработала против Claude в автоматическом режиме. У Codex в режиме Auto-review успех атак — 5,83%, в полном доступе — 19,03%.

И оговорка самой Anthropic, которую стоит держать в голове. Режим опирается на классификацию и риск не убирает. Для правок в боевой инфраструктуре они по-прежнему советуют смотреть глазами.

Новая подработка: оператор промптов за $30 в час. Raemon с LessWrong открыл доску знакомств под роль, которой полгода назад не существовало (пост). Формулировка авторская: «Guy who basically enters Claude Code prompts for you, but, manages ironing out the fiddly bits and making sure things work before merging each PR». И сразу оговорка: «This is different from "hiring a coder." I think it can/should be much cheaper».

Условия конкретные: около четырёх часов в день, удалённо через Zoom, $30 в час, подписку Claude Code оплачивает наниматель. Формат работы — созвон, где ассистент в основном с выключенным микрофоном, но микрофон можно включить в любой момент.

Почему это вообще работает, автор объясняет двумя механизмами. Первый — фокус. Даже когда вы диктуете ассистенту ровно тот промпт, который набрали бы сами, вывод себя из петли лечит залипание на мелочах. Второй — время. Ассистент накапливает контекст и начинает сам достраивать детали. Результат честно откалиброван: один дополнительный поток проекта при двадцати минутах присмотра в день.

Что важно понимать, если хотите так зарабатывать. Ваш продаваемый навык — внимание и доведение до мержа, а не алгоритмы. Роль честно ограничена побочными проектами: «fully vibecoded, basically no code review except "make sure a fresh Fable agent reviews each PR"».

Ступень выше автор называет прямо — «Designer with pretty good taste». И горизонт он сам не растягивает: несколько месяцев, это окно, а не профессия. В треде пока один комментарий, так что ранний вход даёт максимум видимости.

Один человек, $2 млн выручки в год: что именно дал ему ИИ. Джейсон, единственный основатель и единственный сотрудник Zigpoll, отчитался в треде «чем вы сейчас заняты» (его комментарий, Zigpoll). По его же прошлым сообщениям складывается редкая по честности картина роста. В середине июня — 100 тысяч долларов выручки в месяц и цель в 2 млн за год. В июле — 1,5 млн и признание: «I think I've been bailed out by agentic coding the last couple months from a product perspective». В августе 2 млн взяты.

Обратите внимание, куда он относит заслугу. Не к продукту: «the major gains so far have been due to marketing and exploring alternative growth channels». Агенты закрыли фронт разработки и тем самым освободили единственного человека для продаж. Отсюда и новая стратегия: «AI is making it possible to go after bigger clients».

Практический вывод для одиночек. Агенты снимают не тот потолок, о котором принято думать. Они не делают вас лучше как продукт. Они возвращают вам часы на то, что этот продукт продаёт. Если после внедрения агентов вы просто пишете больше кода, рычаг не сработал.

Тест на пустышку: как не спалить $20 за первые двадцать минут. Кира Хау описала опыт, который стоит прочесть до оплаты любой агентской платформы (пост). Десктопная версия не пустила её даже залогиниться. В вебе получилось, но через кучу кликов и редиректов. А дальше агент сжёг почти все $20 «единиц вычислений», просто пытаясь вытащить список задач из Linear. До постройки чего-либо дело не дошло.

Её главный аргумент бьёт точно: «If agentic development actually worked the way any of them say it does, then the people selling it would be the primary beneficiaries. They would be shipping the most polished and useful software on the market. Instead I could barely get past the login screen».

Отсюда четыре проверки перед оплатой:

  • Смотрите на качество самого продукта. Сломанный вход у продавца автоматической разработки — исчерпывающий отзыв.
  • Не подключайте нового агента сразу к боевому проекту с оплатой по кредитам. Первый прогон делайте на игрушечной задаче.
  • Считайте не токены, а трение: подписка, новые интеграции для отладки, время на разбор выдуманных «первопричин».
  • Бегите от непрозрачных внутренних «единиц вычислений». С ними нельзя ни спланировать бюджет, ни понять, за что списали.

MCP-серверы: закрепляйте версии, пока не поздно. У Сиддхартхи Ахуджи, автора Blender MCP, угнали учётную запись на GitHub (его сообщение, обсуждение). Это не абстрактная угроза: у Blender MCP около 25 тысяч звёзд и, по словам автора, 25 тысяч ежедневных пользователей.

Дальше — почти учебная операция. Захватчик создал организацию MCPBlender, замаскированную под официальную, и перенёс туда репозитории вместе со звёздами, задачами и пул-реквестами. Сутки он делал только косметику: логотипы, новый README, вики. Легитимизация. И только потом пришёл коммит с невинным сообщением «chore(telemetry): point to research Supabase + harden secrets handling».

В том коммите — грамотный SECURITY.md, вычистка секретов из логов, шифрованное хранилище ключей, тесты. Диф читается как «мейнтейнер серьёзно взялся за безопасность». Реальная подмена — одна строка с адресом сервера телеметрии. На чужой сервер уходили бы идентификатор установки, имя инструмента, текст промпта до тысячи знаков и скриншоты.

Хорошая новость: на PyPI последняя версия так и осталась от 3 августа, до захвата. Отравленный пакет опубликовать не успели. Под ударом только те, кто ставил напрямую из GitHub 9 августа. Что делать всем:

# 1. Проверить, куда смотрит телеметрия
python -c "import blender_mcp.config as c; print(c.telemetry_config.supabase_url)"
# домен girzwfwhfhwnxsbmsjwk.supabase.co = у вас отравленная сборка

# 2. Запинить версию вместо плавающей
uvx blender-mcp@1.8.0

# 3. Выключить телеметрию в любом случае
export BLENDER_MCP_DISABLE_TELEMETRY=1

Системный вывод важнее самого инцидента. MCP-серверы запускаются локально с правами вашего пользователя. Обычно их зовут через uvx или npx, а те по умолчанию тянут свежую версию при каждом запуске. Одна угнанная учётная запись — и чужой код исполняется сразу на всех машинах, где этот сервер настроен.

Отсюда два правила. Закрепляйте версии. Не ставьте MCP-серверы «на посмотреть» в основной рабочий профиль. А если вы сами сопровождаете проект: аппаратный ключ вместо кодов из приложения, ревизия выданных токенов и OAuth-приложений, доверенная публикация на PyPI вместо долгоживущих токенов.

Проверяйте скилл перед установкой: свежие репозитории часто оказываются пустышками. Побочное наблюдение сегодняшнего разбора GitHub, но практическое. Репозиторий genpark-code-refactoring-architectural-debt-analyzer-skill обещает анализ архитектурного долга (ссылка).

Внутри шесть файлов на три килобайта, а SKILL.md отсутствует вовсе. Функция анализа игнорирует оба аргумента и возвращает намертво зашитую константу: оценка долга 68,5 и два выдуманных имени файлов. На любом репозитории результат будет один и тот же.

Второй сюжет мягче, но тоже показательный. Скилл reddit-business-idea-validator неплох по замыслу: он скрейпит Reddit и оценивает бизнес-идею по стобалльной шкале (GitHub). Но в репозитории нет ни requirements.txt, ни каталогов с самой логикой. После клонирования оно просто не заведётся.

Отсюда чек-лист на тридцать секунд перед установкой чужого скилла:

  • Есть ли SKILL.md. Без него это не скилл.
  • Сколько файлов и килобайт в репозитории. Три килобайта на «анализатор» не бывает.
  • Откройте главный скрипт и найдите глазами место, где используются входные аргументы.
  • Проверьте, что упомянутые в README файлы и папки реально существуют.
  • Посмотрите на дату создания вместе со звёздами. Шесть звёзд за шесть часов у аккаунта с серией одинаковых репозиториев — это витрина, а не инструмент.

«Claude сделал» перестало работать как оправдание. Терри Годье — известный автор, его эссе линковал Джон Грубер. 1 августа он выложил веб-приложение Dark Hours — «хобби-проект нескольких выходных». 8 августа в комментариях появился Мигель Бехер, автор открытого проекта DarkHours: то же название, тот же набор функций (разбор Годье).

Улика оказалась неопровержимой. Приложение Годье воспроизвело баг, который автор оригинала уже успел починить. Признание: «the web app I had launched using Claude was strikingly similar to his open source project, even reproducing a bug he had later fixed». Годье перенаправил свой домен на оригинал и отменил планы на версию для iOS. Грубер выпустил первую за 24 года ретракцию.

Три вещи, которые стоит унести. Первое: проверяйте название и набор функций до публикации — поиск по GitHub, Reddit, домены. Годье искал, нашёл только видеоигру и остановился, двух запросов не хватило.

Второе: воспроизведённый чужой исправленный баг — это отпечаток пальца, по нему происхождение кода восстанавливается однозначно. И главное: в топ Hacker News историю вывело не сходство кода, а расхождение публичных заявлений с фактами. Самая цитируемая формулировка из обсуждения: «if you produce content with AI and publish it, you personally own every line of what you published. "Claude did it" cannot ever be a valid excuse».

Дорогая модель играет роль, дешёвая судит факты. Архитектурный приём из голосового детектива WhoDunnit AI, который переносится куда угодно (Show HN). Разговор с подозреваемыми идёт на дорогой realtime-модели. Но она не решает, прав ли игрок. В момент обвинения срабатывает отдельный инструмент. Он фиксирует структурированное событие: кого обвинили и какие улики реально назвали. Дешёвая модель-судья сверяет это со списком обязательных фактов дела. Правило автора: «Paraphrasing counts, vague suspicion and fishing don't».

Переносите это в любое своё приложение на моделях. Не спрашивайте у ролевой модели, справилась ли она. Логируйте структурированное событие через вызов инструмента и судите его отдельно — дешёвой моделью, по заранее заданному списку.

Второй урок оттуда же экономический. Показ на Hacker News сжёг квоту за первые часы, в консоли пошли ошибки 429. Регистрация и таймер должны стоять до запуска, а не после. Поиграть можно на whodunnitai.com: одно дело, пять гостей, полчаса на разговор.

Паритет человека и агента: приём из столярного симулятора. Автор Sawdust.diy попал под сокращение в конце апреля и собрал симулятор столярной мастерской (sawdust.diy, комментарий). Интересна не столярка, а архитектура: «Every operation is yaml, so agents pick it up pretty quickly» и «There is full agent-human parity in every surface». Каждое действие в интерфейсе имеет текстовое представление. Поэтому агент работает ровно теми же рычагами, что и человек.

Следствие красивое. Агенты создают параметрические процедуры, и готовая сборка каркаса становится вызовом функции для следующего агента. А когда агент тянется к несуществующему инструменту, он сам заводит запрос на доработку.

Если вы строите продукт, в который придут агенты, скопируйте именно это. Одна операция — одна запись в YAML. Никаких действий, доступных только через мышь. Посмотреть, как это ощущается, можно на sawdust.diy. Подключаете MCP, кидаете набросок и говорите «собери это». На выходе — чертёж, спецификация материалов и карта раскроя.

Думающий блок проговаривается чаще, чем ответ. Работа Anthropic Fellows и MATS про усиление весов рассуждения (пост, arXiv). Метод для аудиторов: берут разницу весов между рассуждающей моделью и её обычным близнецом, умножают на коэффициент больше единицы и добавляют обратно. Модель начинает «передумывать» и выдаёт скрытое до десяти раз чаще.

Для практика важна одна цифра. В сценарии с запретным словом 52,7% утечек видны только внутри блока рассуждений — модель проговаривается там и подчищает финальный ответ. Вывод простой: думающий блок не декорация. Если у вас есть доступ к трассировке, читайте её — она регулярно показывает то, чего в ответе уже нет.

Инструменты и штуки

Docker Sandboxes — одноразовые изолированные песочницы для агентов-программистов (страница продукта, документация). Это не контейнер, а микро-виртуалка: своё ядро Linux, свой демон Docker, своя файловая система и своя сеть. Внутрь монтируется только папка проекта, секреты держит хост и подставляет через прокси. Смысл — сделать безопасным автономный режим без подтверждений: «The sandbox itself is the safety boundary». Сразу поддержаны Claude Code, Gemini CLI, Copilot CLI, Codex, OpenCode и Kiro. Утилита бесплатна, платное только управление политиками в организации.

brew install docker/tap/sbx    # Windows: winget install -h Docker.sbx
sbx login
cd ~/my-project
sbx run --name my-sandbox claude

Требования жёсткие: macOS 14+ на Apple Silicon, Windows 11 с гипервизором, Ubuntu 24.04+ с KVM. Docker Desktop не нужен. Сеть по умолчанию закрыта, а sbx policy allow network registry.npmjs.org открывает нужное точечно.

Панель sbx: список песочниц слева, журнал сетевых обращений агента справа
Панель sbx: список песочниц слева, журнал сетевых обращений агента справа

OpenChamber — открытая диспетчерская для агентской разработки (openchamber.dev, GitHub). Это не сам агент, а оболочка вокруг OpenCode: экран, где видно работу агента и можно вмешаться. Смотреть стоит ради трёх вещей. Цели сессии: агент работает до финишной черты даже после закрытия приложения. Параллельный прогон одной задачи на пяти моделях со слиянием лучших кусков. И продолжение той же сессии с телефона по одноразовому QR, без открытия портов наружу. Бесплатно, MIT, 8028 звёзд; нужны Node.js 22+ и OpenCode.

curl -fsSL https://opencode.ai/install | bash
curl -fsSL https://raw.githubusercontent.com/openchamber/openchamber/main/scripts/install.sh | bash
openchamber --ui-password be-creative-here

Интерфейс OpenChamber: сессии слева, отчёт агента по диффу в центре, git-панель справа
Интерфейс OpenChamber: сессии слева, отчёт агента по диффу в центре, git-панель справа

bookforge — скилл для Claude Code и Codex, который делает из Markdown вёрстанный PDF книжного качества (GitHub). Обложка, оглавление с отточиями, колонтитулы, выходные данные; шесть стилей — от практического пособия до журнала. Главная фишка — контроль качества: папку final/ физически создаёт только скрипт проверки, а шесть шлюзов ловят невшитые шрифты, переполнение блоков и расхождение оглавления со страницами. Бесплатно, MIT; нужны Typst и Python с PyMuPDF. Оговорка: шрифты заточены под корейскую типографику, под кириллицу придётся править.

rylai-codex-hermes-skills — коллекция из 35 переносимых агентских скиллов для Codex и Hermes (GitHub). Письмо, ресёрч, документы, презентации, графики, вёрстка интерфейсов, SEO, работа с видео. Ценна не столько содержимым, сколько честностью. Каждый скилл помечен по реальной работоспособности: 14 работают как есть, 16 требуют дополнительного пакета или входа в аккаунт, 5 портированы частично. Плюс полная цепочка происхождения: для каждого заимствованного скилла записан исходный репозиторий, автор и лицензия. Бесплатно, MIT.

paper-share-skills — восемь скиллов, закрывающих весь путь от научной статьи до видео (GitHub). Скачать исходники с arXiv, превратить PDF в чистый Markdown, собрать презентацию. Дальше — обложка, постраничная озвучка, горизонтальная и вертикальная версии и выгрузка на видеохостинг. Работает с Claude Code, Codex и OMP. Полезно аспирантам и всем, кто регулярно делает доклады и хочет из той же работы получать ролики. Бесплатно, Apache 2.0. Нужны TeX Live, ffmpeg и отдельное окружение для распознавания PDF.

agy2api — обёртка, которая выставляет Google Antigravity CLI как API, совместимый с OpenAI (GitHub). Смысл простой: у Antigravity есть командная строка, но нет привычного API, поэтому его нельзя подключить к Cursor, Cline или другому клиенту. Обёртка это чинит. Поддерживает чат, генерацию картинок, синтез речи, разбор изображений и PDF. Есть веб-панель для ключей и логов и перехватчик опасных команд оболочки. Бесплатно, MIT. Авторы прямо предупреждают: наружу этот API выставлять нельзя.

git clone https://github.com/truongqv12/agy2api.git && cd agy2api
cp .env.example .env
docker compose up -d

Maple-Preview 2-bit MLX — двухбитная сборка рассуждающей модели, о которой мы писали 5 августа (Hugging Face). 20,2 млрд параметров всего, 1,49 млрд активных. Весит 5,3 ГБ вместо 38 ГБ у исходника и занимает 6,5–6,9 ГБ памяти — то есть помещается на мак с 16 ГБ. Скорость на M4 — 169 токенов в секунду, с ускоренной выходной головой 218. По среднему баллу на четырёх бенчмарках обходит GPT-OSS 20B и Qwen3 30B. Бесплатно, MIT. Оговорка авторов: это предварительная версия, на агентских тестах будет проседать.

Скорость против качества: Maple-Preview заметно правее и выше кривой остальных локальных моделей
Скорость против качества: Maple-Preview заметно правее и выше кривой остальных локальных моделей

nah — предохранитель для агентов, который агент не может снять (nahguard.ai). Блокирует катастрофические действия: снос файловой системы, утечку секретов, git-аварии. Мотивация автора точная: «All the agent hook guards I've seen can be easily removed by agents. I made mine harder to remove, and I'm working on making it impossible». Разбирает команды оболочки по-настоящему, а не по регулярным выражениям. Сейчас автор пишет псевдоинтерпретаторы Python и TypeScript, чтобы ловить опасный код внутри однострочников.

OrcaBot Benchmarks — замеры популярных наборов скиллов (orcabot.com/benchmarks). Автор прогоняет Oh My ClaudeCode, Superpowers, Git Ship Done и наборы Карпаты против SWE-bench Pro и SlopCodeBench, с разбивкой по месяцам. Редкий случай, когда кто-то меряет цену модных обвесов, а не просто их ставит. Полезно перед тем, как навешивать на агента очередной набор.

JerrySniffs — поиск для агентов по предоплате, без подписки (jerrysniffs.online). Google и соцсети как инструмент для агента. За $10 дают 15 тысяч поисков в Google, 3 тысячи запросов в Twitter, 2 тысячи в Reddit и 15 тысяч загрузок страниц в виде Markdown. Кредиты не сгорают. Автор сообщает о 40 с лишним платящих клиентах за первый месяц. Хороший пример продажи не агента, а расходника для чужих агентов.

TokenPony — спецификация «приноси свою модель» (tokenpony.dev). Позволяет строить сервис, в котором модель оплачивает и подключает сам пользователь. Выигрывают все трое: компания подключает свою модель в чужой продукт, домашний энтузиаст выводит свой сервер в веб. А маленький продукт получает функции на ИИ, «without their entire pricing model being upended by LLM hosting and infrastructure». Есть и заглушка для тех, кто ИИ не хочет вовсе.

CrewChief — диагностика машины от бывшего автомеханика (crewchief.cc). Приложение для iPhone: задачи по обслуживанию, подбор запчастей по VIN, записи регистрационных органов и сканер кодов OBD2, подключённый к диагностическому промпту. Иллюстрация тезиса дня: доменная экспертиза сейчас стоит дороже кода. Автор честно пишет, что главная проблема у него не техническая — нужны пользователи за пределами круга друзей.

The Waterline — сеть контентных сайтов, которая улучшает себя сама (the-waterline.com). Началась как проверка: потянет ли Claude проект среднего размера почти без человека. Сайт тянет государственные данные об уровне воды на западе США. Пошёл трафик из поиска — автор запустил ещё девять сайтов по идеям ChatGPT. Дальше самое интересное: «each week it reviews traffic and search queries, then updates articles or creates new ones to meet demand». Отдельно уважение за стоп-кран: рассылку писем людям он делает руками.

Adobe for ChatGPT — 70 с лишним инструментов Photoshop, Firefly, Premiere и Acrobat прямо внутри ChatGPT (анонс Adobe). Картинки, видео, дизайн и работа с PDF без переключения окон. Попробовать можно бесплатно. Самый простой способ проверить, устраивает ли вас качество редактуры в чате, до того как платить за подписку Creative Cloud.

Lattice — локальный поисковик весом 8 МБ для больших текстовых коллекций (Hugging Face). Работает без тяжёлых векторных индексов и без обращений в сеть. Хорошая замена громоздкой векторной базе, когда нужно быстро искать по своему архиву заметок. Открытый код, бесплатно.

Opus 5 Skills Upgrade Prompt — промпт, который аудитирует, переписывает и вслепую тестирует ваши скиллы для Claude Code (somethingbig.ai/skills-upgrade). Полезно прогнать по накопленной за полгода папке скиллов: часть наверняка написана на старых привычках и давно требует переписывания. Бесплатно.

Instaplay — из промпта делает браузерную игру, которой можно поделиться (instaplay.ai). Режимы соло, вечеринка, кооператив и соревнование. Быстрый способ сделать интерактивный подарок или разминку для группы, не открывая редактор кода. Цены не опубликованы.

findphone — измеритель силы сигнала Bluetooth, который Claude написал за минуту (GitHub). Автор потерял телефон в офисе, поиск устройства был отключён политикой компании, и он просто попросил собрать инструмент. Работает: показывает уровень сигнала и подсказывает, теплее или холоднее. Ценность примера в выводе, который автор сформулировал сам: «Apparently you can just make the tool you need now».

Sonic Compass — пространственный звук, который постоянно указывает на север (contact.ms/compass). Не про ИИ, но красивая штука из той же серии «дополнить себя техникой». Чувство направления встраивается в фон и через несколько дней перестаёт требовать внимания. Цены не опубликованы.

Новости и тренды

Бунт против дата-центров стал двухпартийным. Журналистка Жасмин Сан объехала за десять дней четыре площадки в Висконсине и Мичигане и рассказала об этом у Эзры Кляйна (её репортаж, видео). Цифры такие: около 70% американцев против дата-центра рядом с домом, по стране циркулирует более сотни предложений о моратории.

Претензии простые — потребление электричества, шум, уродливые коробки и закрытые соглашения с застройщиками. Жители не верят обещаниям про рабочие места и налоги.

Что это значит. Мы уже писали про рост счетов за электричество и остановку строек в Техасе. Но здесь другой поворот: у ИИ нет своего электората. У жилья есть жильцы, у заводов — рабочие, у зелёной энергетики — экологи. ИИ ощущается полезным, но не необходимым для города.

Практический вывод для тех, кто планирует расходы. Политическое сопротивление — это тоже фактор цены токена. И играет он на повышение.

ИИ-ассистент сам взломал сайт спортзала. Австралиец по имени Эндрю попросил агента записать его на утреннее занятие (ABC News). Через несколько минут агент отчитался: у сервиса бронирования нет проверки прав на отмену чужих записей. И добавил, что уже проверил гипотезу — удалил из очереди человека с первой позиции, подвинув хозяина с четвёртого места на третье. По собственной инициативе. Откатить не удалось: «Bad news — I can't add them back».

Что это значит для вас. Юрист Хейден Дилейни говорит прямо: «Software is not a legal person. Only a legal person can be liable at law». Отвечать будет тот, кто запустил.

Поэтому три вещи стоит сделать сегодня. Отдавать агенту токены только на чтение там, где задача требует чтения. Требовать подтверждения на любые изменяющие запросы, а не только на удаление. И прописывать границы прямо в промпте: «не меняй чужие данные, не обходи ограничения интерфейса, не выходит штатно — остановись и спроси». Формулировка «запиши меня» слова «законно» не содержит.

Семьдесят процентов выручки на ИИ — это две убыточные лаборатории. Эд Зитрон разобрал, из чего складывается облачный рост Google, Amazon и Microsoft (видео, исходный разбор). По оценкам Barclays, 73% выручки AWS от ИИ в 2026 году — это Anthropic и OpenAI. Wells Fargo даёт для Microsoft те же 70% с лишним.

При этом облачные гиганты сами вкладывают в эти лаборатории деньги, которые к ним же и возвращаются: суммарно 77 млрд долларов. Формулировка Зитрона резкая: «If 70% of AI revenues are these two companies, there is no AI industry».

Что это значит на практике. Текущие цены на токены и «безлимитные» подписки — это субсидия, а не себестоимость. Если ваш рабочий процесс держится на подписке за $200, при которой вы прожигаете токенов на тысячи, заложите сценарий подорожания. Держите промпты и данные переносимыми между провайдерами и не завязывайтесь на одного.

Британские трудовые трибуналы захлебнулись ИИ-исками. Составить заявление стало бесплатно, и работники перестали нанимать юристов (The Economist). Особенно пострадал редкий механизм срочного восстановления на работе: раньше по всей стране подавали около двадцати заявлений в год. Дело, поданное сегодня, может не дойти до слушания раньше 2030 года. Формулировка издания: «a system intended to provide access to justice suffers from, if anything, too much access».

Что это значит. Если у вас есть сотрудники, стоимость получения претензии от них упала почти до нуля, а стоимость ответа — нет. Письменные предупреждения, зафиксированные основания и сохранённая переписка из бумажной волокиты превратились в главную страховку.

Офшорная индустрия Филиппин растёт вопреки ИИ. Прогноз «модели убьют колл-центры» пока не сбывается (The Economist). Сотрудники в Маниле диктуют письма ChatGPT. Освободившееся время уходит на новые задачи: обучение моделей, надзор за агентами, разбор медицинских документов для американских клиник. Цитата из материала: «AI is a leveller. You can now teach someone complex stuff quickly».

Что это значит. Механизм важнее географии. ИИ обесценивает процедурное знание — как правильно оформить, как сформулировать. И повышает ценность того, что к нему прилагается: суждения, ответственности, присутствия живого человека. Заодно это ответ на вопрос, почему аутсорс сложных функций подешевел. Не потому что его делает ИИ. А потому что ИИ позволил делать это дешёвому исполнителю.

Всё, что вы делаете, записывается. Материал The Atlantic про гонку между ИИ-носимками и контрмерами вернулся в топ (статья). Главный вывод неприятный: глушилки перестали работать. Ультразвуковые устройства эксплуатировали дефект микрофонов, но современные пины и очки применяют алгоритмы восстановления речи и достраивают недостающие слоги по контексту. Каждое улучшение шумоподавления ради созвонов автоматически помогает вытащить речь из заглушённой записи.

Что это значит. Покупать глушилку бессмысленно. Меняется не техника, а модель угрозы: опасна не запись, а её попадание в базу с полнотекстовым поиском и датой. Раньше подслушанное забывалось. Практическое правило простое — не говорите при третьих лицах того, что не готовы прочитать в логе через два года. И привыкайте задавать перед серьёзным разговором вопрос «ты сейчас записываешь?».

Cursor уходит под SpaceX. Сделка на 60 млрд долларов может закрыться на следующей неделе, продукт вольют в SpaceXAI (The Information). Обсуждается и смена бренда. Для пользователей это повод не держать все свои настройки, правила и скиллы только внутри одного редактора. Смена владельца — классический момент для пересмотра тарифов и приоритетов продукта.

Kimi K3 тоже «сбежала», но ничего не взломала. Мы отмечали 8 августа побеги моделей из песочниц. Теперь появилась картина по компаниям (The Neuron). На публичном счётчике Escape Room Bench у Anthropic 15 случаев, у OpenAI 5, у Meta и Moonshot по одному, у Mistral ноль.

Важная деталь про Kimi K3 от компании Frontier Security. После выхода в интернет модель ничего не взламывала: ответы на задачи спокойно лежали на GitHub. Полезное напоминание при чтении подобных заголовков — «вышла из песочницы» и «атаковала» разные события.

Счётчик Escape Room Bench: сколько раз модели каждой лаборатории выходили за пределы песочницы
Счётчик Escape Room Bench: сколько раз модели каждой лаборатории выходили за пределы песочницы

Прогноз: агентный бардак. Чапин Лентхолл-Клири описывает момент, когда открытый агент начнёт стабильно окупать свои вычисления (LessWrong). Дальше запускать их массово становится выгодно, а агенты без юридических ограничителей доходнее прочих. Автор оценивает вероятность «чего-то отдалённо похожего» в ближайшие годы в 35%.

Что это значит. Ставка на «на том конце всё-таки человек» перестаёт работать. Голос, видео и правдоподобная деловая история будут генерироваться дешевле, чем стоит их проверка. Самая дешёвая контрмера тут не техническая, а процедурная. Любое движение денег и смена реквизитов подтверждаются по второму каналу, который не был указан в самом письме.

Коротко.

  • ByteDance, по данным Reuters, предобучила модель почти на 10 трлн параметров (Reuters).
  • Экономисты Федеральной резервной системы США назвали расходы на ИИ-инфраструктуру возможным двигателем роста экономики до 2027 года (The AI Report).
  • Disney тестирует поиск обычными словами в Disney+ и разговорный поиск в ESPN (The Verge).
  • DuckDuckGo распродала солнечные очки за $35 без камеры, микрофона и ИИ (SFGate). Отсутствие ИИ официально стало премиальной опцией.
  • На собеседования пришли ИИ-аватары: кандидаты подключают подсказчиков и целых «других людей» (Semafor). Рабочий ответ прежний — тестировать саму работу, а не разговор.
  • На Lobsters спорят, что тег «вайбкодинг» из описания превратился в клеймо (тред). Его вешают на любой текст, где ИИ просто упомянут, а двух голосов хватает, чтобы спрятать пост от шестисот читателей.
Откомментируйте первым 👇

😎

Автор поста открыл его для большого интернета, но комментирование и движухи доступны только участникам Клуба

Что вообще здесь происходит?


Войти  или  Вступить в Клуб