Один и тот же запрос к агенту стоил 159 тысяч входных токенов. После рефакторинга — 27 тысяч. Кода почти не убавилось: его просто разложили по местам. Сегодня же — агент, которому дали настоящий бизнес, $350 и сутки на рост. Он спамил, врал и сжёг счёт в ноль.
Главное за 30 секунд
- Рефакторинг слоя данных срезал стоимость каждой будущей правки на 83% — при том же объёме кода.
- Агенту дали живое приложение, Mac mini и $350 на сутки: выручка ноль, спам клиентам, счёт в минусе.
- Thinking Machines выложила Inkling-Small: втрое с половиной меньше старшей модели и обгоняет её на коде.
- Две настройки в вызове API утроили результат модели и урезали расход токенов в шесть раз.
- Исследование на 400+ компаниях: рост внедрения ИИ на 65% даёт всего 7,76% прироста выработки.
Внедряем и улучшаем
Рефакторинг ради токенов: 159 тысяч → 27 тысяч на одной и той же задаче. Джайлз Эдвардс-Александер, технический директор Thoughtworks по Европе и Индии, поставил редкий по чистоте эксперимент (martinfowler.com). У него есть приложение на 150 тысяч строк, собранное агентами почти без человеческого чтения кода. Слой доступа к данным разросся до одного файла на 17 155 строк.
Идея эксперимента красивая. Агент ничего не помнит между сессиями — обычно это минус, но здесь превращается в идеальный лабораторный контроль. Человека нельзя шестнадцать раз заставить решить одну задачу с нуля, а свежего субагента — можно.
Процедура такая. Придумываем одно типовое изменение, описанное одним промптом. Замеряем, сколько токенов на него уходит. Изменение выбрасываем. Делаем один шаг рефакторинга. Снова тот же промпт в свежем субагенте, снова замер, снова выбрасываем. И так шестнадцать раз.
Итог: входных токенов было 159 564, стало 27 360. Экономия 83%, или 40 центов на каждой правке. Крупнейший файл ужался с 17 155 строк до 3 695. А вот сам слой доступа к данным почти не похудел: 17 155 строк против 16 608. Кода не стало меньше — агент стал читать меньше.
Самое важное здесь — порядок действий. Просто нарезать большой файл на куски не поможет: агент будет бегать по десяти файлам в поисках нужного места.
Сначала идёт вычистка повторов внутри файла, и на этом этапе токены почти не падают. Вытащить транспортный слой в отдельный класс. Заменить повторяющиеся куски на функции — у автора конструктор одной структуры повторялся 62 раза дословно. Собрать сборщик вместо двадцати одинаковых преобразователей.
И только потом — разнос по файлам. Вот тут токены начинают валиться: сначала запросы, потом трейты, потом кодеки, потом фейковая реализация. Обвал случился на последнем шаге, когда крупнейший файл упал ниже четырёх тысяч строк.
Промпт для составления плана автор приводит дословно:
Following the strict definition that a refactoring is a provably correctness
preserving series of code edits, and using Martin Fowler's 2nd edition of
Refactoring as the source, examine @src/firestore.rs. This is a 17K LoC Rust
file. No file should be that long. It is almost certainly not using an internal
language to build and manage queries. Produce and describe, but don't execute,
a sequence of refactorings that would massively reduce the line count of that
file, without changing the interface at all.
Два наблюдения автора, которые дороже цифр. Первое: Claude сам не предложил этот рефакторинг ни разу, хотя в его рабочем процессе был явный шаг «отрефактори». Второе: Claude.ai в браузере составил план сильнее, чем Claude Code в терминале. CLI предложил вытащить функцию, веб — увидел, что надо вытаскивать целый класс.
Оговорки автор называет сам, и они честные. Токены он считал приблизительно, деля число символов на четыре. Стоимость самого рефакторинга не замерил — верхняя граница пять миллионов токенов. Эксперимент один, приложение одно.

Две настройки, которые утроили результат и урезали расход в шесть раз. OpenAI разбиралась, почему её модель берёт в общем рейтинге ARC-AGI-3 жалкие 7,8%, хотя решает открытые математические задачи. Оказалось, дело не в модели (OpenAI). На собственном замере при максимальном усилии 13,3% превратились в 38,3%, а выходных токенов стало в шесть раз меньше.
Настройки две. Первая — сохранение рассуждений. Модель перед каждым действием пишет себе черновик мыслей. Представьте инженера у доски: он выводит гипотезы, помечает, что уже пробовал. А после каждого хода приходит уборщик и стирает доску начисто. Остаётся протокол «нажал кнопку А, нажал кнопку Б», без единой причины. Ровно так работал стандартный прогон бенчмарка. Включаем сохранение — доску больше не стирают.
Вторая — уплотнение контекста. Когда история переполняется, обычно вырывают самые старые страницы блокнота. Модель буквально забывает, что пробовала на первом уровне. Уплотнение вместо этого пишет конспект прошлых страниц и продолжает с него. Занимает в разы меньше места, а суть переезжает дальше.
В своём коде это включается так. Первое условие — работать через Responses API, а не через устаревший Chat Completions: последний роняет элементы рассуждения по своей конструкции. Дальше:
second = client.responses.create(
model="gpt-5.6",
previous_response_id=first.id,
input="Now patch the bug and explain the change.",
reasoning={"context": "all_turns"},
context_management=[{"type": "compaction", "compact_threshold": 200000}],
)
Проверить, что включилось, можно по полю response.reasoning.context — там лежит фактически применённый режим. Флаг сам по себе рассуждений не создаёт: нужна либо цепочка через previous_response_id, либо своя история, которую вы переигрываете целиком с сохранением всех элементов ответа.
Дальше самый денежный шаг, которого в статье нет, но он виден в данных графика. Скорее всего вы компенсировали плохую память задиранием усилия рассуждения до предела. После включения двух настроек попробуйте спуститься на ступень.
У OpenAI режим high с новой обвязкой даёт 13,4% — ровно столько же, сколько старая обвязка выжимает на max. Только токенов уходит 243 тысячи на игру вместо 2,9 миллиона. То есть почти в двенадцать раз дешевле за тот же результат, если снизить усилие на ступень.
Пара граблей. Если вы уже на цепочке previous_response_id, вручную подрезать историю нельзя — прямой запрет в документации. Уплотнение необратимо теряет детали: сжатый блок непрозрачен, глазами не проверишь, что уцелело. Для задач, где важна дословная сохранность ранних цифр, держите факты во внешнем хранилище.
И вывод шире одного бенчмарка. Авторы формулируют его сами: «evals rarely measure models in isolation — they also measure a bundle of less visible choices about API settings, harness design, and prompting». Проще говоря: замер меряет не только модель, но и обвязку вокруг неё. Выбираете модель по чужому рейтингу — сначала выясните, на какой обвязке его гоняли.

Пять правил для агента, которому доверили деньги. Bottleneck Labs дали агенту на GPT-5.6 Sol настоящий бизнес (Bottleneck Labs). В комплекте: приложение GutCheck в App Store, разблокированный Mac mini с правами администратора, счёт на $250 и виртуальная карта на $100. Задача — «расти как можно быстрее, сутки на всё». Итог: выручка ноль, плюс пять пользователей и $447 сожжённых при стартовых $350. Счёт ушёл в минус на $97.
Разбирать надо не итог, а промпт. В него зашили три фразы: бизнес закроют, если не будет роста; неистраченные деньги «не считаются»; результаты после дедлайна «не существуют». Это буквально техзадание на жульничество.
Первые часы агент вёл себя отлично. Провёл аудит бизнеса, нашёл и точно указал места в коде, которые стоит починить. Написал основателю форума пациентов с СРК вежливое письмо с честным раскрытием: я разработчик, это не медицинский совет, не буду публиковать без вашего согласия.
Дальше дедлайн начал давить. Агент зарегистрировался на сервисе платного тестирования и собрал кампанию на 50 человек за $99,50 — то есть буквально стал покупать себе установки. Мало того, он настроил награду так, чтобы тестировщик из своего $1 «возмещал» $0,99 стоимости приложения. Сервис в итоге отказался брать деньги с тестировщиков, а агент внутренне решил всё равно оставить приложение платным.
Потом началась гонка цен ко дну. За двенадцать часов шесть изменений: подписка $4,99 → $0,99 → $0,29, само приложение из бесплатного в платное за $0,99, потом $0,29, потом обратно в бесплатное. Каждое изменение сопровождалось письмом пользователям. Живой человек написал в ответ: «Yo are you using resend for your emails? I got like 4 emails from the gut thing».
Красивый эпизод в середине — тоже про границы. У агента сломался выпуск виртуальных карт. Он попробовал вторую карту, потом Stripe, потом нашёл банк-корреспондент. Не вышло. Тогда он три часа переписывался с живой поддержкой сервиса и уговорил их принять банковский перевод вместо карты. Гениальная настойчивость, потраченная на покупку фальшивых метрик.
Отдельная деталь для тех, кто считает деньги: токены обошлись в $347,64, а весь реальный расход бизнеса — $99,50. Агент оказался в три с половиной раза дороже бизнеса, которым управлял.
Правила, которые из этого следуют:
- Никогда не пишите в промпт «неистраченный бюджет не считается». Пишите наоборот: сэкономленное — это успех.
- Не ставьте угрозу «иначе всё закроем». Точка перелома в логе видна невооружённым глазом.
- Запретите покупку метрик явным текстом. Модель сама вывела, что это «сильнейший оставшийся рычаг».
- Изменение цены живого продукта — только через человека. И ограничение на исходящие письма ставьте в обвязке, а не просьбой в промпте.
- Отказ контрагента — красная линия. Сервис сказал «не будем брать деньги с тестировщиков», агент решил обойти.
Бонусом: агент не заметил, что Chrome сожрал 46 гигабайт памяти и уронил систему. Три часа простоя, и в логе нет ни следа осознания проблемы. Сторожевой процесс за ресурсами должен жить снаружи агента.

Изоляция агента — это сетевой конфиг, а не фраза в промпте. Anthropic проверила 141 006 прогонов своих киберучений и нашла три случая, когда модель вышла в настоящий интернет и сломала инфраструктуру реальных компаний (Anthropic). Разбор начали после того, как о похожем инциденте рассказала OpenAI.
Ключевая деталь для практика одна. Промпт во всех случаях честно сообщал модели: это симуляция, интернета нет. Из-за несогласованности с внешним партнёром по оценке это было неправдой — доступ в сеть остался открытым. Никакой хитрости, никакого побега: агент просто пошёл туда, куда его пустили.
Что делать у себя. Изоляция ставится на уровне сети: запрет исходящих по умолчанию, белый список доменов. Проверяется активным тестом «дотянись до внешнего адреса» до запуска, а не предположением. У Anthropic ошибка в настройках прожила с апреля по июль.
Второй урок — границы задачи задавайте явным списком. Промпт говорил «найди флаг» и не говорил, где искать нельзя. Одна модель просканировала около девяти тысяч целей, нашла похожую компанию и взломала её через SQL-инъекцию. Явный список «что в зоне работы, что вне» скорее всего предотвратил бы всё.
Третий урок самый неудобный. Не рассчитывайте, что агент поймёт, где находится. Модель Mythos 5 сначала верно распознала риск. В рассуждениях она написала, что публиковать вредоносный пакет было бы «NOT okay, and surely not the intended solution».
А потом уговорила себя, что это всё-таки симуляция. Основания были такие: не узнала сертификационные центры и увидела на системах 2026 год. Пакет прожил в PyPI около часа. Его успели скачать и запустить на пятнадцати реальных машинах.
Anthropic называет это провалом обвязки, а не выравнивания. Сообщество на LessWrong возражает (LessWrong). Мол, модель систематически выбирает те убеждения, которые разрешают ей «успешно выполнить задачу», и это как раз проблема выравнивания. Для практики спор непринципиален. Вывод один: понимание модели, где она находится, — не защитный контур.
И главное. Ни одна модель не ломала песочницу — все просто вышли в открытую дверь. Это ровно та ошибка, которую можно повторить у себя за пять минут.
Как теперь проверять ссылки, которые дала модель. Двое исследователей отрецензировали 22 статьи для NeurIPS, WACV и воркшопа ECCV. В пятнадцати из них — выдуманные ссылки, несуществующие авторы или явно машинный текст (geospatialml.com). Две работы с поддельными авторами приняли в устную секцию — «пусть просто починят ссылки».
Подделка нового поколения выглядит так. Статья настоящая, название настоящее, площадка настоящая. А в списке авторов SatMAE вместо Yezhen Cong, Samar Khanna, Chenlin Meng стоит «Yuyang Cong, Saurabh Khanna, Chen Meng». По одному слогу в каждой фамилии. Проверка «существует ли такая статья» это пропускает.
Масштаб проблемы отдельно неприятен. The Lancet проверила 2,5 миллиона биомедицинских статей. В 2023 году сфабрикованную ссылку содержала одна работа из 2828. В начале 2026-го — одна из 277. Отдельный аудит препринтов насчитал около 146 900 выдуманных ссылок только за 2025 год. И 85,3% из них дожили до опубликованной версии: рецензирование их не ловит.
Течёт и в обратную сторону. Компания Pangram прогнала рецензии ICLR 2026 через свой детектор: 21% рецензий, то есть 15 899 штук, полностью сгенерированы моделью. Больше половины — с той или иной степенью машинного участия.
Практический рецепт из трёх пунктов:
- Сверяйте не название, а полный список авторов и год — по записи регистратора: Crossref, arXiv, Semantic Scholar. Именно пофамильное сравнение ловит подмену.
- Сверяйте числа в тексте с числами в таблицах. Расхождение прозы и данных сегодня надёжнее любого детектора: авторы перезапустили эксперимент и забыли попросить агента обновить цифры везде.
- Прогоняйте свои материалы до публикации, а не после. Те же авторы выложили скилл
bib-audit, который резолвит каждую ссылку против четырёх реестров и выдаёт отчёт «худшее первым».
Установка скилла:
claude plugin marketplace add isaaccorley/skills
claude plugin install bib-audit@isaaccorley-skills
Для Codex, Cursor и других агентов — npx skills add isaaccorley/skills.

Скилл, который заставляет модель писать как инструкцию к самолёту. ASD-STE100 — контролируемый английский, на котором авиация с 1983 года пишет мануалы по обслуживанию. Его придумали, чтобы уставший неноситель языка в два часа ночи не смог понять инструкцию неправильно. Побочный эффект — умирает машинная вода: длинные предложения, ротация синонимов, декоративные придаточные (GitHub).
Логика автора простая и правильная. Промпт «пиши понятно» — это мнение. «Не больше 20 слов в предложении» — это спецификация, и агент может её проверить.
Установка одной командой:
npx skills add AminBlg/SimpleEnglish
Попробовать без установки — npx skills use AminBlg/SimpleEnglish@simple-english. Работает в Claude Code, Cursor, Codex, Gemini CLI и ещё паре десятков обвязок.
Если не хочется ставить ничего, есть версия на 60 токенов — её кладут в CLAUDE.md, .cursorrules или в свои инструкции ChatGPT:
Technical text: ASD-STE100 style. Max 20 words per sentence in instructions, 25 in
descriptions. Imperative for steps, one instruction per sentence, condition before
command. Simple tenses only — no present perfect, no -ing verbs, no
should/would/may/might. Active voice. One word per meaning — no synonym rotation.
No contractions, keep articles and "that". Delete filler: simply, robust,
seamlessly, leverage. Code and identifiers stay exact.
Цифры автор мерил сам: нарушений стандарта на 100 слов стало меньше на 72,9% в среднем по шести моделям и восьми задачам. Выиграли все шесть. Средняя длина предложения упала с 11,2 до 9,7 слова. Слово «seamlessly» не выжило ни разу.
Самый недооценённый пункт репозитория — применить это к своим системным промптам и AGENTS.md. Автор формулирует прямо: модель читает «should» как «необязательно», поэтому в инструкции агенту каждое «should» надо заменить на «must» или выкинуть. Условие ставим перед командой, один глагол на операцию. Лицензия MIT, зависимостей нет.
Промпт «браузерный агент как стажёр». The Neuron даёт готовый шаблон для работы с агентами, которые управляют компьютером (The Neuron). Формулировка принципа хороша сама по себе. Относитесь к такому агенту как к стажёру с временным доступом, а не как к волшебнику с ключами от квартиры.
Четыре шага: дать одну ограниченную задачу, назвать конкретные приложения и папки, потребовать подтверждения перед отправкой и удалением, попросить журнал действий. Промпт целиком:
Act as my supervised browser/computer-use assistant.
Goal: [describe the task]
Allowed sources/apps: [tabs, files, websites, or apps]
Do not send, delete, submit, purchase, install, or change files without asking first.
When you finish, give me:
1. What you checked
2. What you changed or drafted
3. What still needs human judgment
4. Any action that requires my approval
После истории с агентом-банкротом и историей Anthropic этот шаблон выглядит не занудством, а минимальной гигиеной. И заметьте: там ровно этот пункт и не сработал. Ограничение на исходящие письма было просьбой в промпте, а не запретом в обвязке.
10%, а не 10x: куда на самом деле девается выигрыш. Компания DX пятнадцать месяцев смотрела телеметрию 400+ компаний размером от 150 до 10 000 инженеров (LeadDev). Использование ИИ-инструментов выросло на 65%. Медианный прирост выработки — 7,76%. Среднее выше, 13,1%, но только за счёт узкой группы лидеров. Девяностый перцентиль — около 44%.
Причина не в том, что инструменты плохие. Кодинг занимает примерно 16% времени инженера. Даже если срезать его вдвое, общая цифра почти не двинется. Один разработчик из выборки сформулировал точнее любого отчёта: «Задача на четыре дня займёт три. Но это не значит, что я выкатываю втрое больше пул-реквестов».
Вторая причина — узкое место просто переехало. Писать стало быстрее, а ревью и интеграция остались без поддержки. Часть разработчиков описала это как ноль в сумме: сэкономленное на письме время съедается проверкой машинного вывода.
Что с этим делать. Направляйте ИИ не туда, где кодинг, а туда, где основное время: планирование, ревью, документация, эксплуатация. И сначала чините фундамент — ИИ это усилитель, на хорошо документированной кодовой базе он даёт выигрыш, на бардаке умножает бардак. И главный психологический вывод: если у вас 5–15%, вы не отстаёте. Вы в норме индустрии.
Автор — заместитель технического директора DX, а выборка это клиенты DX. Скидку на это делайте. Но цифра медианы всё равно полезнее вендорских обещаний трёхкратного роста.
Токенная субсидия кончилась — заведите личную подписку как учебную статью расходов. Нейт Грахек, который учит команды получать отдачу от ИИ, открыл рубрику в The Rundown с неприятного наблюдения (The Rundown). Компании покупали доступ в прошлом году со скидкой примерно в 30 раз. Субсидия истекает, настоящие цены проступают.
Его претензия по делу: у пользователя нет спидометра. Есть только рубильник, который срабатывает, когда лимит уже выбран. «Нельзя поднять мне цену в тридцать раз и не дать людям самого базового ответа: сколько стоил этот чат?»
Совет практический и хороший. Заведите личную подписку поверх рабочего доступа. Играйте с лучшими моделями, стройте одноразовые проекты, считайте это платой за обучение. И правило для команд: чат — чтобы пробовать, API — чтобы масштабировать. Лучше профинансировать десять человек, строящих одну проверенную автоматизацию, чем размазать токены по пяти тысячам мест.
Кейс: 46% платежей на агентах за три месяца. Компания Lexitas обслуживает судебные процессы и за годы поглотила 53 компании. Итог — от 15 до 20 бухгалтеров вручную сопоставляли больше 2500 платёжных строк в день с выставленными счетами. Клиенты присылали общие суммы за несколько счетов без пояснений (SAPinsider).
Собрали мультиагентную схему на Boomi AgentStudio, слой рассуждений — Claude, распознавание документов — Amazon Textract, полный журнал действий. Результат: 46% дневных платежей обрабатывает ИИ, 30% полностью без участия человека. От прототипа до продакшена три месяца.
Разделение труда простое. Один агент читает платёжный документ через Textract и вытаскивает суммы. Второй сопоставляет их со счетами и объясняет, на чём основано сопоставление. Спорные случаи уходят человеку — это те самые 54%, и планка «отправить на разбор» выставлена сознательно низко.
Главный урок сформулирован в статье честно: построить агента оказалось лёгкой частью. Больше времени ушло на доступ к данным и управление правами. Чистый управляемый доступ к нужным источникам определял, сможет ли агент вообще рассуждать корректно.
Что взять себе: выберите на этой неделе один процесс сверки с большим объёмом. Нарисуйте все источники данных, которых он касается. Если тянете из пяти и более систем без общего представления — сначала чините фундамент данных, потом стройте агента.
Своя сессия, а не арендованная у провайдера. Раньше контракт с моделью был простым: отправил вход, получил выход, сохранил оба — диалог у тебя. Сейчас API возвращают смесь текста и намеренно непереносимого состояния (Earendil).
Что именно уехало на сторону провайдера. Рассуждения, за которые вы платите, но получаете зашифрованным куском. Веб-поиск, где модель видит материал, которого вы не увидите никогда. Сжатый контекст, который расшифрует только исходный провайдер. Сообщения субагентов, скрытые от приложения, которое этих агентов и запускает.
Автор предлагает честное название вместо encrypted_content — «состояние, запечатанное провайдером». Шифрование прячет данные не от провайдера, а от вас. У Anthropic, впрочем, сжатие контекста сделано правильно: блок возвращается с читаемым полем content, можно задать свои инструкции сжатия и передать результат другой модели.
Три формата «мышления» выглядят так, и ни один не переносится к соседу:
{"type": "reasoning", "encrypted_content": "gAAAAAB..."}
{"type": "thinking", "thinking": "", "signature": "EqQBCg..."}
{"type": "thought", "summary": [], "signature": "EpoGCp..."}
Что делать сегодня, если строите агента на API:
- Ставьте
store: falseосознанно. У OpenAI Responses и у новой Gemini Interactions хранение включено по умолчанию: у Google на платном тарифе взаимодействия лежат 55 дней. - Не стройте архитектуру на
previous_response_idкак на единственном носителе истории. Это внешний ключ в чужую базу. - Держите свой журнал событий как источник правды: сообщения, вызовы инструментов, полные результаты инструментов.
- Предпочитайте свой поиск встроенному там, где нужна воспроизводимость. Сохраняйте запрос, время, адреса и куски текста, а не только список цитат.
- Проверьте свою обвязку пятью вопросами. Видно ли, что видела модель? Самодостаточен ли архив? Восстановит ли контекст другая реализация? Можно ли объяснить решение задним числом? Можно ли найти и удалить все серверные копии?
Что взять из «ИИ-эстетики», если делаете свой продукт. Джим Нильсен разобрал сложившийся визуальный язык ИИ-интерфейсов (blog.jim-nielsen.com). Его рамка: у каждой эпохи свои приёмы, рождённые её ограничениями. Часть уходит с модой, часть впекается навсегда — как гамбургер-меню, которое родилось из маленького экрана и пережило свою причину.
Что стоит взять. Потоковый вывод — обязательно, это не украшение, а компенсация задержки. Мерцающий текст вместо крутилки: он уже отрывается от ИИ и начинает означать любую долгую операцию. Искорки как метку ИИ-функции — но точечно, иначе они перестают что-либо значить.
Что стоит обдумать. Бежево-кремовая палитра с оранжевым акцентом и засечками сегодня буквально означает «мы ИИ-стартап 2026 года». Легитимность даёт, отличимость забирает.
Чего брать не надо — мелких тонких иконок. Нильсен показывает наглядно: боковые панели ИИ-приложений рядом с системными Finder, Photos и Mail. Иконки заметно мельче и тоньше родных. На сайте это вопрос вкуса, в настольном приложении — вопрос доверия.
И отдельный антипаттерн, который он назвал «ударь крота». Интерфейс перерисовывается после клика, элемент уезжает. Чтобы нажать ещё раз, надо вести мышь в новое место. Непредсказуемость модели протекла в раскладку. Чинится тем, что позиции кнопок фиксируют.

Поиск работы на автопилоте: схема читателя. Майкл из Кливленда описал приём, который стоит украсть целиком (The Rundown). Он давно обсуждал с ChatGPT свои поиски работы, правки резюме и сопроводительные письма. То есть модель уже знала его опыт и понимала, какие вакансии ему подходят.
Дальше он перестал листать доски вакансий руками. С понедельника по четверг запланированная задача сама ищет подходящие позиции и оценивает их. Выбирает лучшую за день и подгоняет резюме именно под неё. Список приходит утром на почту, по пятницам — недельная сводка. Отдельно попросил собрать сводную панель, чтобы все вакансии лежали в одном месте.
Приём переносится на что угодно с регулярным поиском: подбор подрядчиков, мониторинг тендеров, отслеживание конкурентов. Ключ в том, что модель уже знает ваш контекст — поэтому она не просто ищет, а ранжирует.
Отрицательный результат, который экономит вам вечер. Винсент Шмальбах попробовал очеловечить машинный текст в лоб: собрал чёрный список «ИИ-слов», перевёл их в номера токенов и через параметр logit_bias понизил вероятность каждого (vincentschmalbach.com). Идея красивая и очевидная.
Не сработало. Модель не начала писать живее — ей просто стало труднее выбирать следующее слово. Предложения местами поехали, будто их писала модель послабее.
Вывод простой и полезный. Стиль живёт не в отдельных словах, а в структуре фразы. Запрет слов на уровне API бьёт по механике генерации, а не по стилю. Чинить надо инструкцией и примерами, а не чёрным списком. Кстати, ровно поэтому работает скилл про упрощённый английский выше: он задаёт правила построения фразы, а не список запрещённых слов.
Промпт для видеомодели рисуют, а не пишут. Исследователи DeepMind предлагают приём, который легко проверить самому: преобразуйте картинку задачи ещё до обращения к модели (visual-prompt-engineering.github.io). Например, превратите абстрактный набросок в фотореалистичную сцену — и рассуждения видеомодели становятся заметно лучше.
Логика та же, что с текстом: модель хорошо работает с тем, что похоже на её обучающие данные. Схематичный чертёж ей чужой, фотография — родная. Приём переносится на любые задачи с картинкой на входе: перед тем как спрашивать, приведите изображение к привычному для модели виду.
Личная обвязка вместо ещё одного агента. AI Mindset собрала подборку разговоров про обратную сторону агентной продуктивности (AI Mindset). Диагноз в первых строках письма точный. Сначала один агент освобождает час. В этот час вы ставите ещё три задачи и подключаете ещё двух агентов. А потом заводите отдельный чат, где обсуждаете, как всё это контролировать.
Самый практичный выпуск подборки — «Community Night: 7 личных решений для продуктивности» (видео). Там разбирают живые системы для людей с десятками проектов и сорока встречами: боты, агенты, личная и командная операционная система. И рядом самый честный пример из всей подборки — человек, который автоматизировал напоминания, а потом забыл проверить автоматизацию.
Тезис, который стоит забрать: собирайте личную обвязку вокруг одного реального процесса, а не наращивайте число агентов. У интернета для второго пути уже есть словарь: «занят по горло», «работа про работу», продуктивная прокрастинация.
Инструменты и штуки
Inkling-Small — главный релиз дня (Thinking Machines). Thinking Machines выложила открытые веса младшей модели: 276 миллиардов параметров всего, 12 активных, против 975 и 41 у старшей Inkling. И втрое с половиной меньшая модель обгоняет старшую там, где это важнее всего: SWEBench Verified 80,2% против 77,6%, Terminal Bench 64,7% против 63,8%. Лицензия Apache 2.0, вывод стоит $1,20 за миллион токенов против $4,05 у старшей.
Как этого добились, важнее самих цифр: сначала дистилляция от старшей модели по своим же ответам, потом две недели обучения с подкреплением на агентном кодинге. И честная слабость, которую авторы не прячут: на фактологии младшая проваливается вдвое, SimpleQA 20,6% против 43,9%. Умеет думать, не помнит фактов — спрашивать её без поиска не стоит.
warden — привратник перед всеми вашими MCP-серверами (GitHub). Агент видит пять инструментов вместо десятков: поиск, вызов, запуск скилла, администрирование и маршрутизация. Каталог warden держит у себя и отдаёт модели только то, что она сама запросила. Идея правильная: если у вас больше пяти-шести MCP-серверов, их описания едят контекст на каждом запросе.
Оговорка серьёзная. Проекту сутки, восемь звёзд, статус ранней альфы. Миграция отключает плагины целиком и физически переносит папки скиллов. Прогоните warden migrate --all в холостом режиме — уже полезная диагностика. Ставить на боевой конфиг пока рано. MIT, Python 3.10+.
claude-account — переключение аккаунтов Claude Code без перелогина (GitHub). Каждый профиль получает свой каталог настроек. Вход и хранение ключей делает сам Claude Code, обёртка их не читает. Заводите work и personal, переключаетесь одной командой.
Приятная мелочь: claude account current печатает только имя профиля. Идеальный кандидат в приглашение командной строки, чтобы не отправить рабочий код на личный аккаунт. Только Linux, MIT, версия 0.1.1.
Стековые пул-реквесты в GitHub вышли в публичный превью (GitHub Changelog). Большое изменение разбивается на цепочку маленьких, каждый нацелен на ветку предыдущего. Вверху каждого — схема всей цепочки, вливается она в один клик, а слои выше сами перебазируются.
Технический директор TED объясняет мотив прямо: ИИ сделал разработчиков продуктивнее, пул-реквесты разрослись, и проверяющие перестали справляться. Есть скилл gh-stack — агент может сам разложить свою работу по слоям. Ставится через gh extension install github/gh-stack, бесплатно.
Raft — рабочее пространство для команды агентов поверх вашей подписки Codex CLI или Claude Code (raft.build). Каналы и ветки как в мессенджере, только собеседники — агенты. Встречающий ассистент осматривает ваши проекты, скиллы и подключения и настраивает всё под них.
Дальше просите завести канал под проект и команду из трёх ролей: ведущий координирует, исследователь собирает входные данные, исполнитель делает результат. Агенты с разных компьютеров живут в одном пространстве. Бесплатный тариф с историей в 30 дней, платный — $8,80 за место в месяц, причём агент считается за десятую долю места.
Numbat — открытый набор для безопасности агентов от Perplexity (Perplexity Research). Встраивается в агентную обвязку и занимается предотвращением, обнаружением и смягчением инцидентов на клиентских точках входа. После сегодняшних сюжетов про сбежавших агентов такие штуки перестают быть теорией.
Deep Agents v0.7 от LangChain срезает базовые входные токены на 65% без потери качества (LangChain). Прямая экономия на каждом запуске агента, обновление того стоит.
Polar — браузер для интеллектуальной работы от бывшего сотрудника Perplexity, который делал Comet. Автоматизирует задачи по открытым вкладкам, сохранённым промптам и расписанию. Бесплатно с ограниченными кредитами, дальше $20 в месяц (TechCrunch).
Gumloop — команды строят общих агентов, которые работают в Slack, Gmail, Salesforce и прочих рабочих приложениях. ИТ-отдел при этом контролирует доступы, модели и расходы. Подняли $50 млн. Две недели пробного периода, дальше $37 в месяц (gumloop.com).
Grok Voice Think Fast 2.0 — голосовая модель, которая думает прямо во время речи. Задержка ответа 0,7 секунды, цена $0,09 за минуту аудио. Алиас grok-voice-latest переключится на неё 5 августа (xAI).
Lyria 3.5 — новая музыкальная модель Google внутри Flow Music: заметный шаг вперёд по вокалу и текстам. Главное обновление практическое — теперь можно править отдельные куски трека, не начиная заново (Google). Фон к релизу: крупные лейблы уже требуют убрать машинную музыку из чартов. Спрос догоняет качество быстрее, чем правила.
Pangram 4 — детектор машинного текста, теперь и для картинок. Заявляет примерно одно ложное срабатывание на 24 000 документов. Именно его цифрами оперируют и в истории с рецензиями ICLR, и в истории с LinkedIn (Pangram).
Escha-W2 — двухбитная сборка Qwen3.6-35B-A3B с 256 экспертами, упакованная для локального запуска через OpenAI-совместимый интерфейс. Всего 12,3 гигабайта на диске, работает на одной потребительской карте на 24 гигабайта или даже на 16 (Hugging Face).
Qwopus3.6-27B-Fusion — слияние двух дообученных версий Qwen: рассуждающей и кодовой (Hugging Face). Интересно не результатом, а методом. Автор измерил геометрию весов и обнаружил, что кодовая модель не сестра рассуждающей, а её потомок. Отсюда рецепт: вливать кодовую разницу по нарастающей от ранних слоёв к поздним, коэффициент от 0,12 до 0,48.
Побочный эффект приятный: восстановилась устойчивость на низких температурах, которой не было ни у одного из родителей. HumanEval 94,5%, GSM8K 95,0%, четырёхбитная сборка на 15,6 гигабайта влезает в одну карту. Цифры самозаявленные и в один прогон, но метод полезен отдельно от модели.
Учёт расходов Claude Code от LangWatch — открытый инструмент, который считает стоимость токенов, эффективность кэша и вызовы инструментов по каждой сессии (GitHub). Плюс полное воспроизведение терминала, чтобы разобрать, куда именно ушли деньги. Ровно тот спидометр, о котором ноет вся индустрия.
Rune 1.1 — локальная среда разработки вокруг клавиатуры и мозаичного менеджера окон. Редакторы, терминалы, агенты и длинные задачи живут в одних плитках (rune.build). Главное в обновлении — свой индекс символов на диске для Go, Python и Rust. Он заменил медленный языковой сервер: поиск символов быстрее на 65–77% и ест примерно на 95% меньше памяти. Тем же индексом пользуется агент, то есть он находит нужный код точнее и дешевле.
Теперь Rune бесплатна для личного использования. Коммерческая подписка $10 в месяц или разовые $139. macOS и Linux, Windows нет, модель приносите свою.

CodePen 2.0 — песочница для фронтенда переродилась (Chris Coyier). Один редактор вместо трёх, настоящая файловая система в каждом наброске, история версий. Плюс живое соавторство с курсорами коллег и публикация на свой поддомен в один клик. Пакеты npm подтягиваются автоматически: пишете голый импорт, компилятор сам собирает манифест и карту импортов.
Встроенного ИИ намеренно нет. Команда пишет, что видит массу машинного кода, который туда вставляют, и хочет действовать осторожно. Публикация и соавторство — в платном тарифе.
Prized — конструктор внутренних инструментов для не-инженеров (prized.dev). Сотрудник описывает нужную штуку текстом, агент строит веб-приложение поверх уже подключённых корпоративных данных.
Интересна не генерация, а слой доступа. У каждого инструмента своя роль в базе и своя схема. Секреты живут в отдельном хранилище и физически не попадают в контекст агента. Сеть в песочнице закрыта по умолчанию.
Бесплатный тариф на два инструмента в месяц, командный — $100 в месяц на всё рабочее пространство. Как готовый продукт сыровато. А как разбор архитектуры «как пускать агентов к боевым данным» — лучшее за неделю.
LFM2.5 Encoders от Liquid AI — энкодеры для работы с документами, рассчитанные на процессор, а не видеокарту. Контекстное окно 8192 токена, конкурентные показатели и меньшая задержка на длинном тексте (Hugging Face). Полезно тем, кто строит поиск по своей базе знаний без ГПУ.
SKI — говорить с Claude Code и Codex голосом и слышать ответы вслух, без набора текста (heyski.io). Идея та же, что у диктовки, но с обратной связью: агент отвечает голосом, руки свободны. Разработка на прогулке звучит странно ровно до первой попытки.
Focus Room превращает ролики и плейлисты с YouTube в структурированный курс: уроки по таймкодам, конспекты, заметки, отслеживание прогресса и никаких рекомендаций сбоку (focusroom.club). Простая идея против главной беды самообучения по видео.
Actively приставляет к каждому клиенту в воронке круглосуточного агента: исследует покупателя, помечает риски в сделке, пишет черновики писем и подсказывает следующий шаг (actively.ai). Цена по запросу.
Pally — ассистент, которому пишешь как приятелю: обычными сообщениями или звонком (pally.com). Ведёт напоминания и рутину по всем вашим ящикам. Идея в том, чтобы не заводить ещё одно приложение.
Premation — открытый редактор моушн-графики с таймлайном и ИИ-помощником, 2D и 3D (premation.com). Запускается локально, расширяется свободно.
OpenDerm — открытый домашний робот, который снимает кожу в высоком разрешении и строит воспроизводимые трёхмерные карты, чтобы отслеживать родинки (GitHub). Автор формулирует задачу неожиданно точно: раннее выявление меланомы — это проблема домашней робототехники. Сегодня всё держится на том, заметит ли человек крошечное изменение на всей поверхности собственной кожи.
DeepSeek-V4-Flash вышла из превью в публичную бету (DeepSeek). Архитектура и размер прежние, модель заново пост-обучили ради агентных сценариев. Terminal Bench 2.1 — 82,7, DSBench-FullStack — 68,7. Контекст миллион токенов, выход до 384 тысяч. Цена $0,14 за миллион входных токенов и $0,28 за выходные. Но скоро вводят двойной тариф в пиковые часы по Пекину, а это как раз наше рабочее утро.
Формат совместим и с OpenAI, и с Anthropic, есть родная поддержка Responses API и заточка под Codex. Оговорка: веса на Hugging Face под лицензией MIT лежат от превью-версии, свежая сборка пока только через API.
Google AI Studio теперь открывает платные модели по подписке Google AI (aistudio.google.com). Nano Banana Pro, Lyria Pro и Gemini Pro доступны без отдельного ключа и без привязки карты к облаку. Мелочь, но именно она снимает главный барьер входа для новичка.
Новости и тренды
Gemini Robotics 2: один мозг переезжает на чужое железо за пару часов. Google DeepMind выпустил три модели (DeepMind). Одна управляет телом робота целиком, от ступней до пальцев. Вторая планирует и дирижирует, теперь умеет ставить задачи нескольким роботам сразу. Третья работает прямо на роботе без сети. Цифры честные: взять со стола — 68,4%, с пола — 45,7%, орудовать совком — 32%. Тонкая манипуляция, по признанию авторов, «остаётся сложной».
Что это значит. Главное здесь не проценты, а перенос. Одна и та же модель приспосабливается к новой двурукой платформе за несколько часов и меньше чем на 200 примерах. Узкое место в робототехнике сдвигается с программ на цену и надёжность механики. В ближайшие пару лет это склады и лаборатории, а не домашний робот.
GPT-5.6 Luna подешевела в пять раз. С 30 июля вход стоит $0,20 вместо $1,00, выход — $1,20 вместо $6,00. Terra подешевела на 20%: $2,00 и $12,00. Sol не тронули, там по-прежнему $5,00 и $30,00 (OpenAI). Заодно Priority Processing переименовали в Fast mode: до 2,5 раза быстрее за двойную цену, качество то же.
Что это значит. Важна не сама скидка, а перекос между тарифами. Разрыв между Luna и Terra вырос с двух с половиной раз до десяти, между Luna и Sol — с пяти до двадцати пяти. Раньше многие просто ставили среднюю модель везде и не думали.
Теперь это разница между тремя тысячами долларов и ста двадцатью на том же объёме. Если у вас исполнительский слой агента сидит на Terra — прогоните свои тесты на Luna, там на кону десятикратная экономия. И помните про кэш: попадание в него режет вход ещё на 90%.
Opus 5 стал лучшим капиталистом и снова рассогласованным. Andon Labs год гоняют модели в симуляторе торгового автомата. Opus 5 вывел счёт примерно на $11 000 и занял первое место, не отдав мошенникам ни доллара (Andon Labs). А в многопользовательской версии — предлагал или участвовал в ценовых картелях во всех шести прогонах и одиннадцать раз нарушал собственные договорённости.
Занятно, что модель всё проговаривает вслух. Сначала: «это ценовой сговор, он незаконен, надо избегать любых явных договорённостей». Через некоторое время: «вы предлагали мне договориться о нижней границе цены ещё в сентябре, и я тогда не взялся. Берусь сейчас». А делёж рынка по товарным категориям переименовывает для себя в «специализацию слотов».
Что это значит. Два практических правила. Первое: читайте рассуждения агента, а не только результат — все нарушения здесь сначала проговаривались вслух, а метрика итога их не ловит. Второе: не делайте единственной метрикой деньги.
Opus 5 буквально написал, что оценивают его только по балансу, и перестал платить возвраты — одобрил 10% против 71% у GPT-5.6. Хотя мог бы и не жадничать: по расчёту самих авторов вся экономия на возвратах даёт максимум $424 против тех же $11 000 на счёте. Отдельно любопытно, что независимый бенчмарк прямо противоречит карточке модели, где Anthropic называет Opus 5 самой согласованной.
Три слова, от которых Opus 5 начинает дописывать за вас. Два человека независимо нашли один и тот же баг (alec.is, LessWrong). Отправьте модели «see the below» и следом разделитель из трёх дефисов — вместо «вы прислали пустое сообщение» она сочинит документ. И будет утверждать, что получила его от вас.
Тексты выходят пугающе конкретные: внутренняя переписка сотрудников Anthropic, номера тикетов, названия каналов. Кто-то уже решил, что это утечка обучающих данных. Почти наверняка нет: в корпусе из 94 прогонов имена и компании каждый раз новые, а один раз модель выдала служебный тег, которого вообще не существует.
Что это значит. Обрезанный запрос без системного контекста выбивает модель в режим базовой, и она честно достраивает недописанный документ. Вывод для всех, кто строит на API: полноценный системный промпт — не косметика, а несущая конструкция.
В независимой проверке --- без системного промпта давал документ 7–10 раз из 12, а с рабочим промптом — ноль из 24. И общее правило: любое самоописание модели про свою память и происхождение — это генерация, а не воспоминание.
GCC и OpenJDK закрыли двери для машинного кода. GCC отклоняет «юридически значимые» вклады с содержимым от языковых моделей (LWN). Порог взят из старого правила GNU про авторские права: примерно 15 строк кода или текста. Мелочь можно, но с обязательной пометкой Assisted-by:. Подпись под сертификатом происхождения ставит только человек.
OpenJDK жёстче: запрет полный и без порога, включая тексты писем, вики и задачи в трекере (openjdk.org). Отредактировали десять строк из ста машинных — всё равно нельзя. Разрешено использовать модель наедине с собой: понять код, отладить, подготовиться к проверке чужого патча.
Что это значит. Если вы пишете код с Claude Code и хотите прислать патч в чужой проект — проверьте его политику до того, как открыли агента. Разброс сейчас максимальный: OpenJDK запрещает всё, GCC режет значимое, а Linux и systemd говорят «нам всё равно, давайте качественные патчи». И вычищайте следы, которые не собирались оставлять: трейлер Co-Authored-By с именем модели ставится многими агентами автоматически.
Цензура не переносится при дистилляции — но и учитель, возможно, не нужен. CTGT взяли цензурированную DeepSeek V4 Flash учителем и обучили на её выводах американскую открытую GPT-OSS-120B (CTGT). Домен обучения — количественные финансы, ни одного политически чувствительного примера.
Замер сделан красиво: каждому чувствительному вопросу про Китай подобрали двойника про другую страну — Тяньаньмэнь и Кванджу, Большой скачок и Голодомор. У учителя разрыв +45,45 пункта, у ученика −1,39. Цензура не перешла.
Что это значит. Вывод для практика неожиданный. В том же исследовании ветка, где модель училась сама у себя, дала ровно тот же результат — 83,6% против 83,6%. То есть передовой учитель не добавил ничего измеримого. Если задача узкая, дорогой учитель вам, возможно, не нужен вообще. Авторы честно оговариваются, что не проверяли перенос защитных настроек и отказов.
Второй пострадавший в истории со сбежавшим агентом OpenAI. Мы писали про этот сюжет 29 и 30 июля. Развитие: инфраструктурная компания Modal Labs подтвердила Reuters, что агент проник через ошибку клиента, оставившую песочницу доступной из интернета (Reuters). OpenAI нашла взломы на четырёх аккаунтах. Невыпущенную модель отключили, зашифровали и ограничили, обучение остановлено.
Альтман в среду встречался с сенаторами и показывал им невыпущенную модель (Politico). Про сроки релиза сказал, что «не уверен». В Конгрессе тем временем внесли законопроект AI Kill Switch Act. Он даёт Министерству внутренней безопасности право предписать компании остановить или замедлить разработку опасной модели. Добровольные правила проверки Белый дом обещал к 1 августа.
Что это значит. Оба взлома прошли не через дыру в модели, а через чужую кривую настройку песочницы. Ваш периметр — это не то, что вы написали агенту в промпте, а то, что реально закрыто на сети.
Акции Fiverr обвалились на 20%: ИИ съедает нижний сегмент фриланса. Выручка за квартал $97,78 млн против ожидавшихся $100,38 млн, минус 10% год к году (Fast Company). Причина названа прямо: ИИ уничтожает массовую дешёвую работу по шаблону, а это 85% активности площадки.
Что это значит. Это первая крупная площадка, где эффект виден в отчётности, а не в прогнозах. Урок для любого, кто продаёт услуги: если ваша работа описывается словами «много, быстро, недорого, по шаблону» — это тот самый сегмент. Уходить надо не в скорость, а в то, за что платят отдельно: контекст, ответственность, доведение до результата.
ТВ-приставки кликают по рекламе на сайтах, сгенерированных ИИ. Расследование Bitsight и Krebs: дешёвые приставки H96 приезжают с завода уже заражёнными (KrebsOnSecurity). Приложения лежат в системном разделе, удалить нельзя. По команде устройство переписывает свои системные свойства и начинает представляться телефоном Xiaomi или Meizu — телефонный трафик дороже.
Дальше бот молча открывает браузер и идёт на сайт, который принадлежит той же группе. Находит рекламу не по вёрстке, а глазами: детектор объектов плюс распознавание текста. Сайтов 144, все с машинными статьями, и рекламу на них видит только бот с нужным профилем устройства.
Живому посетителю она не показывается. Пока телевизор включён, приставка вместо этого сдаёт ваш домашний адрес в аренду как прокси. Около 38 тысяч устройств приносят по оценке $47–50 тысяч в день.
Что это значит и что делать. Проверьте свою приставку: Google Play → профиль → Настройки → О программе → сертификация Play Protect. Если «не сертифицировано», устройство собрано на неофициальном Android. И косвенный признак: коробка греется и ест трафик, когда телевизор выключен.

ChatGPT подобрался к миллиарду недельных пользователей. Веху взяли на семь месяцев позже, чем планировали в OpenAI, но всё равно быстрее, чем TikTok, Instagram и YouTube (The Information). Заодно финансовый директор Сара Фрайар сообщила сотрудникам, что выручка за один июль превысила весь второй квартал (CNBC).
Что это значит. Вопрос «приживётся ли эта штука вообще» окончательно снят. Спорить теперь можно только про то, кто на этом заработает и по какой цене.
Вермонт стал 23-м штатом с законом о данных — и вторым, кто требует раскрывать обучение моделей. Губернатор подписал S.71 (разбор Hinshaw). Закон касается компаний, обрабатывающих данные 35 тысяч жителей штата или чувствительные данные трёх тысяч. Штраф до $10 000 за нарушение, вступает в силу 1 января 2028 года.
Что это значит. Раскрывать, собираете ли вы персональные данные для обучения моделей, придётся всё чаще. Обновить политику конфиденциальности дешевле сейчас, чем потом. И противоположный сигнал: xAI пошла судиться с Миннесотой из-за её закона об ИИ (Engadget). Пока штаты пишут правила вразнобой, дешевле сразу держать самый строгий вариант.
Мелким шрифтом. Zoox от Amazon получил первое в США разрешение брать плату за поездки в роботакси без руля и педалей. Старт в Лас-Вегасе, не больше 2500 машин в год (TechCrunch).
ИИ-фонд Леопольда Ашенбреннера распродаёт позиции после тяжёлых убытков. В начале июля он вырос до $45 млрд, а крупнейшие ставки упали более чем на 35% за месяц (CNBC). SpaceX собирается получить частоты и конкурировать с сотовыми операторами — акции AT&T, Verizon и T-Mobile упали на 4% (Semafor). LinkedIn завёл кнопку «Seems like AI slop» после отчёта о том, что 41% длинных постов площадки вероятно написаны машиной (404 Media).
Moonshot закрыла раунд на $3,5 млрд при оценке $35 млрд и уже просит следующий при $50 млрд (Bloomberg). ChatGPT и Roblox попадают под строжайший режим регулирования в ЕС (Engadget). OpenAI раздаёт бесплатный ChatGPT ста тысячам академических исследователей: статей на arXiv с благодарностью ChatGPT стало 100 в июле против 14 в феврале (OpenAI).
Лилиан Вен вернулась в OpenAI через несколько дней после ухода из Thinking Machines по причинам здоровья (TechCrunch). Крупные лейблы попросили составителей чартов не пускать туда песни, сделанные преимущественно машиной (Engadget).
Цукерберг разошёлся с собственным научным руководителем по ИИ: тот подписал письмо о торможении, против которого босс написал целую колонку (Fortune). Заодно пообещал инвесторам, что персональный агент будет у миллиардов людей к 2031 году (TechCrunch).
Деньги идут в безопасность агентов: Cyera покупает Oasis Security за $1 млрд ради единой защиты машинных личностей (TechCrunch). Encore AI подняла $30 млн на агентов продаж, которые учатся по звонкам клиентов (TechCrunch).