Агент работал всю ночь впустую — и ещё 34 материала дня  Публичный пост

24 августа 2026  104

Оставить агента работать на ночь — и утром найти сожжённый недельный лимит, гору тестов и ни строчки приложения. Так бывает, и у этого есть причина. Сегодня разбираем, чем это лечится. Готовый файл правил для агента. Бесплатный скилл, который строит проверки качества прямо в Claude Code. И почему локальная модель на своём железе делает работу, которую вчера отдавали облаку.

Главное за 30 секунд

  • Шрея Шанкар и Хамель Хусейн выложили бесплатный скилл, который строит интерфейс для разбора ошибок вашего ИИ прямо в Claude Code.
  • Фабьен Сангляр опубликовал свой файл agent.md — набор правил, которым он лечит типовые болезни кода от модели.
  • Локальная модель Qwen 3.8 27B за полчаса разобрала защиту лицензии коммерческой программы, работая целиком офлайн.
  • Банкиры Anthropic говорят инвесторам о привлечении более $100 млрд на IPO при оценке около $2 трлн.
  • Дешёвые модели забирают рынок: доля открытых моделей на Vercel дошла до 36% токенов, а средняя цена за токен упала на 13,6% за месяц.

Внедряем и улучшаем

Бесплатный скилл, который строит вам проверки качества прямо в Claude Code. Питер Янг позвал Шрею Шанкар и Хамеля Хусейна — авторов самого популярного курса по evals — сделать разбор его собственных проверок. Заодно они выложили бесплатный набор скиллов (репозиторий). Ставится одной командой:

npx skills add https://github.com/ai-evals-course/evals-skills

Дальше вы просто говорите агенту человеческим языком: Can you help me do error analysis on traces.jsonl? В наборе восемь скиллов, главный называется error-discovery. Он проходит пять фаз сам. Сначала разбирает, что у вас за данные, и придумывает, как показать их глазам. Собирает под это веб-интерфейс, кластеризует записи и отбирает 15–25 разнообразных примеров. А потом крутит цикл разметки.

Схема Error Discovery Workflow: пять фаз от понимания данных до цикла разметки, где человек размечает, а агент группирует
Схема Error Discovery Workflow: пять фаз от понимания данных до цикла разметки, где человек размечает, а агент группирует

Самое ценное — как устроен пятый шаг. Вы просто читаете вывод своего ИИ и пишете свободные заметки на полях. Никаких оценок по пятибалльной шкале и выпадающих списков — только текст.

Агент в фоне следит за файлом с вашими заметками и раз в две секунды сверяет его. Накопилось около пяти размеченных записей — он идёт прочёсывать весь массив и искать то же самое. Формула Шреи: человек замечает, агент раскладывает по полкам.

Главный диагноз, который они поставили Питеру: у него сильные проверки «сверху» и почти нет проверок «снизу». Сверху — это то, что вы придумали, зная задачу, но не глядя в данные. Такие правила модель напишет вам сама. Снизу — то, что вы поняли, перелопатив сотню реальных выводов. Дословно: «Claude is very very bad at coming up with bottom up evals. That's all you.»

Ещё три конкретных совета оттуда. Не превращайте разовую претензию в постоянное правило — сначала сравните 10–20 прошлых примеров, иначе получите правило под один случай. Не вываливайте на модель длинный список критериев сразу: она «размывается» и начинает халтурить, лучше отдать каждый критерий отдельному субагенту. И пишите критерии так, чтобы проверяющий отвечал «да» или «нет» без раздумий (разбор эпизода, видео целиком).

Готовый agent.md, который лечит типовые болезни кода от модели. Фабьен Сангляр выложил свой файл правил (статья, сам файл). Логика простая: поймал себя на том, что третий раз повторяешь модели одно и то же — записал это в файл. Вот он целиком:

- When writing something intended for human consumption, (comment, commit message, reply to prompt) use as few words as possible. Pick every word meticulously to reduce the volume to a strict minimum. Be down to the point. Less is more.

- Avoid superlatives and praise. Stop telling me I am absolutely right. Give me the cold hard truth.

- Avoid magic numbers and strings by extracting recurring or meaningful values into descriptive constants (const) or enums. Keep self-explanatory, one-off values inline to avoid clutter. If a value comes from a spec (e.g. HTTP 200 OK), use a constant regardless.

- Reduce code indentation. Avoid Arrow Anti-Pattern. Leverage early return and continue.

- Keep function names short. Less than 30 characters.

- Use enums instead of booleans for function parameters.

- Let the reader of the code breathe. Add empty lines between logical blocks of code. Add a small, to the point, comment to explain *what* the block does and *why*. Use examples when possible. Propose ASCII drawings to explain complete systems.

- Treat member visibility changes as a breaking design shift. Keep all fields and functions private unless external access is strictly required by the design. Prompt the user for explicit approval before changing any access modifier from private to internal or public.

- Program to levels of abstraction. Lower-level mechanics (e.g., raw hardware I/O, sector parsing, direct socket streams) must be encapsulated in a dedicated driver/abstraction layer. Expose clean, high-level APIs to the rest of the application so calling code works with domain concepts, not raw implementation details.

- Don't touch blocks of code unrelated to the feature you implement. e.g. Don't add comments to a block of code if you did not create it or modify it. As much as possible try to minimize the number of changed lines when implementing a feature.

- Strictly adhere to the layered boundary hierarchy: each layer may only communicate with its immediate neighbor directly below it. Never "punch holes" through layers (e.g., controllers or UI components must never directly call database queries, raw hardware drivers, or low-level network clients; always route through the intermediate service/abstraction layer).

- Always use {}, even on a one-line "if" statement.

When you write a commit message, follow these 7 rules:
Rule 1: Separate the subject line from the body with a single blank line.
Rule 2: Limit the subject line to 50 characters (72 is the absolute hard limit).
Rule 3: Capitalize the first letter of the subject line.
Rule 4: Do not end the subject line with a period.
Rule 5: Use the imperative mood in the subject line (e.g., "Fix bug," "Add feature,"
        not "Fixed" or "Adds"). Test formula: It must complete the sentence: "If applied,
        this commit will [your subject line here]".
Rule 6: Wrap the body text manually at 72 characters to prevent Git formatting issues.
Rule 7: Use the body to explain what and why vs. how. Assume the code explains the how;
        the message must explain the context and reasoning.

- If the prompt indicates that a bug is being fixed, don't write the fix right away. First write the test. Observe it failing. Then write the fix. And observe the test passing.

Забрать себе — две команды. Файл кладётся в корень проекта:

curl -sL https://fabiensanglard.net/agent.md/agent.md -o agent.md
ln -s agent.md CLAUDE.md

Самое сильное правило тут — про видимость полей. Агент, которому нужно куда-то дотянуться, обычно молча делает поле публичным. Правило требует спросить разрешения. Второе по силе — не трогать чужой код и минимизировать число изменённых строк. Это спасает ревью.

И честная оговорка автора. Правила «протухают» внутри сессии: чем длиннее контекст, тем меньше внимания модель уделяет тому, что лежит в середине. Сангляр ссылается на работу Lost in the Middle.

Лечит он это двумя костылями. Первый — новая сессия на каждую задачу. Второй — фраза «Reload agent.md», как только видно, что качество поехало. Никакой магии он не обещает: «LLMs constantly hallucinate and cannot be trusted».

Модель на 17 гигабайтах видеопамяти сделала за полчаса работу, которую ждали от передовых. Автор XDA дал локальной Qwen 3.8 27B разобрать проверку лицензии в купленной им же программе. Модель работала чистым статическим анализом, прошла тысячи строк ассемблера и собрала по кускам ключ, который производитель намеренно спрятал в бинарнике. Тридцать минут, целиком офлайн, без облака и без счёта за токены.

Отладочная сессия: модель гоняет llvm-objdump по бинарнику и рассуждает, откуда берётся подпись
Отладочная сессия: модель гоняет llvm-objdump по бинарнику и рассуждает, откуда берётся подпись

Железо и настройка — то, ради чего стоит читать. Машина: Lenovo ThinkStation PGX на чипе Nvidia GB10 Grace Blackwell, 128 ГБ общей памяти, пропускная способность 273 ГБ/с. Из коробки скучные 15–30 токенов в секунду. Со связкой SGLang плюс квантизация NVFP4 плюс черновое декодирование DFlash2 — около 50 токенов в секунду на коде и рассуждениях. Сама модель влезает в 17 ГБ видеопамяти, то есть на хорошую потребительскую карту.

Две детали, которые важнее скорости. Первая: модель распознала попытку джейлбрейка. Автор представился разработчиком программы — Qwen проверила сертификат подписи и назвала настоящего автора.

Вторая: самокоррекция. Первая попытка восстановить ключ дала рабочий, но не сходящийся хеш. Модель сама заметила расхождение и итерировала, пока не совпало байт в байт. Автор честно ограничивает выводы: это одна программа и один прогон, «a harder application might have stopped it completely» (XDA).

Пять устройств за 13 часов работы модели и 98 промптов. Чез Шларп, специалист по безопасности, разобрал прошивки пяти железок со своего стола: веб-камеры Insta360, монитора ASUS, микрофона Shure, карты захвата Elgato и лампы (разбор). Метод один на всех. Скачать с сайта производителя прошивку и утилиту обновления. Положить в отдельную папку. Подключить устройство к тому же компьютеру. Дать Claude Opus 5 цель и подгонять короткими «продолжай». Итог: отключил LED-индикатор на веб-камере, убрал вечное «почисти пиксели» на мониторе, собрал веб-интерфейс управления микрофоном.

Интересна методика — она переносится на любую вашу задачу. Модель работает статическим и динамическим анализом, документирует, проверяет свои выводы на живом железе, сама пишет нужные утилиты. Ниже — дословный шаблон промпта, с которого автор начинал каждое устройство:

In this directory is the firmware and update utility for ___. The device is also
attached to this computer, and you may interact with it in non-mutating ways.
Exhaustively document and cross-validate the entire firmware, including the following goals:
* reverse engineer the firmware update format and update protocol
* implement our own update utility
* determine the security properties of the update protocol, including checksums,
  signature validation, secure boot
* use static and dynamic analysis to determine all protocol surfaces and completely
  enumerate functionality
* find any hidden or debug functionality in the product and how to access it

Вывод автора звучит и как возможность, и как предупреждение: «железо теперь почти повсеместно открыто для тюнинга — пара часов почти безнадзорного машинного труда на каждое устройство». Обратная сторона тревожнее. Вредоносный имплант в прошивку любой USB-железки раньше был уровнем «государственного актора». Теперь это по силам одному человеку с агентом. Не подключайте незнакомые устройства к рабочей машине.

Веб-интерфейс, который Claude собрал для управления микрофоном Shure MV7 прямо из браузера
Веб-интерфейс, который Claude собрал для управления микрофоном Shure MV7 прямо из браузера

Гайд от самой Anthropic: как встроить ИИ в весь цикл разработки. Anthropic выложила подробное руководство про разработку с ИИ в основе — и оно полезно не только большим командам, но и одиночке (блог Anthropic). Сквозная идея: код перестал быть узким местом, узким местом стали шаги вокруг него — планирование, ревью, деплой. Лечится это тем, что каждый этап оставляет закоммиченный артефакт, а следующий начинается с его чтения: intent.mdspec.mdplan.md → тесты → PR.

Схема Anthropic: слева традиционная линия «Plan → Design → Build → Test → Deploy → Maintain» медленным циклом, справа тот же цикл вокруг Claude — «часы, а не недели, человек над петлёй»
Схема Anthropic: слева традиционная линия «Plan → Design → Build → Test → Deploy → Maintain» медленным циклом, справа тот же цикл вокруг Claude — «часы, а не недели, человек над петлёй»

Что забрать одиночке прямо сегодня, без корпоративной обвязки. Держите CLAUDE.md короче страницы (модель читает его целиком в начале сессии) с правилом «ошибся дважды — правка идёт в файл». Начинайте сборку в plan mode: пусть модель сперва напишет план с именами файлов и порядком работ. А вы его допросите — «что это может сломать, какой шаг рискованнее всего». Всегда давайте модели способ проверить себя: make test, сборку, скриншот. И жёсткое правило на исправления ошибок:

## Verifying your work
- Build: make build (must finish with "Build succeeded")
- Test: make test (all green; never skip or delete a failing test)
- Lint: make lint (zero warnings)
Run all three before reporting any task complete, and paste the output.
If a test fails, fix the code, not the test.

Отдельно про скиллы и хуки. Скилл — это «совет», его можно проигнорировать; если правило должно держаться железно, за ним нужен детерминированный хук. Дословно: «Скилл делает нарушения редкими, а хук — почти невозможными» («The skill makes violations rare and the hook makes them close to impossible»). Параллельные сессии Anthropic советует разводить по git worktree. Стартуйте с двух-трёх: потолок в том, сколько потоков вы успеваете нормально ревьюить.

Что такое харнесс и что в нём можно менять руками. Два разбора в один день — тема созрела. Харнесс — это вся обвязка вокруг модели: системный промпт, инструменты, агентный цикл и слой перевода под разных провайдеров. Для вас Claude Code и есть харнесс. Разбор от Earendil объясняет на пальцах: модель без обвязки — «мозг в банке», харнесс даёт ему тело (earendil.com). Ключевая мысль про инструменты: харнесс не диктует, когда их применять, — он их описывает и отдаёт решение модели. Отсюда вывод: не прописывайте в промпте пошаговый сценарий, улучшайте описание инструмента.

Схема эволюции харнесса: кривые «что харнесс просит» и «что модель умеет» пересекаются на Claude Code в феврале 2025, дальше сплетаются в косу, а внизу поднимается кривая человеческого внимания
Схема эволюции харнесса: кривые «что харнесс просит» и «что модель умеет» пересекаются на Claude Code в феврале 2025, дальше сплетаются в косу, а внизу поднимается кривая человеческого внимания

Второй разбор, из Latent Space, даёт цифру, которую стоит запомнить. Один и тот же прогон на 106 задачах в разных харнессах дал от 52 до 76 баллов. Почти 24 пункта — без единого изменения модели (Latent Space). Вывод: «Половина агента — это харнесс». Плохо работает агент — сначала смотрите на обвязку, потом на модель. Два рычага с наибольшей отдачей — что сохраняется между шагами и как сжимается контекст.

И совет-парадокс: регулярно удаляйте куски своей обвязки. Anthropic снесли 80% системного промпта Claude Code, потому что новые модели уже делают это сами. Ваши локальные подпорки устаревают с той же скоростью.

Параллельные агенты без хаоса: git worktree. Простой приём снимает главную боль запуска нескольких агентов сразу — они топчутся в одном каталоге. git worktree разводит ветки по отдельным папкам с общей историей. Под каждую задачу — своя папка и свой агент, без гонок checkout и stash (barrd.dev).

# создать ветку и папку под неё за один шаг
git worktree add -b feature/checkout ../shop-checkout
# посмотреть, какая ветка в какой папке
git worktree list
# убрать за собой
git worktree remove ../shop-checkout

Три грабли. Одну ветку нельзя открыть в двух папках сразу — это дисциплина «одна задача → одна папка». remove сносит только папку, ветка остаётся. Удалили папку руками — почистите хвосты через git worktree prune. Про ИИ автор не пишет — это классический человеческий приём. Но именно он превращает «один агент за раз» в честную параллельную работу.

Достаточность промпта: почему солидный ответ всё равно «не тот». Короткое, но очень практичное эссе. Тезис: мы принимаем модель за смышлёного сотрудника, который сам всё достроит, — и ошибаемся. Человек незаметно добирает контекст сам, модель — нет. Определение автора: «Промпт достаточен, когда агент может выполнить работу без произвольного выбора» (LessWrong).

Важный поворот: «ты — senior-инженер», «работай тщательно», «не ошибись» к достаточности не имеют отношения вообще. Достаточность — про информацию, а не про тон. Проверка перед отправкой — «тест незнакомца»: представьте, что задачу дали постороннему эксперту в вашей области. Сможет ли он её выполнить, зная только предметную область и ваш промпт? Или что-то знаете только вы? Пример недостаточного и достаточного промпта:

# недостаточный
Please digest the last five quarterly earnings reports and write a memo
suggesting a strategy which addresses any shortfalls you see.

# достаточный — добавлено то, что известно только вам
...Bear in mind that we consider any indications of a future liquidity crunch
to be unacceptable, and utilizing available credit lines is an acceptable
recourse as long as recurring revenue remains above ...

Практический вывод: ответ выглядит солидно, но «не то» — почти всегда потому, что вы не проговорили критерий, по которому отличаете хороший результат от плохого.

«Заставь ИИ доказать свою работу» — против выдуманных фактов. Юристы State Farm признались, что ИИ засунул в судебные документы семь несуществующих цитат. Урок шире: написание и проверку надо разносить на разные этапы. Готовый промпт от The Neuron, копируйте дословно (The Neuron):

Audit this draft for factual risk. List every claim, number, quote, and named
source I must verify manually. Give only URLs already present in the draft.
Mark anything unsupported as DO NOT PUBLISH. Do not invent or repair sources.

Дальше открываете каждый источник сами и ищете через Cmd+F. Не подтверждается напрямую — переписываете или удаляете. И не просите ИИ «починить» цитату, которую он же выдумал: начинайте с реального источника.

Превратите своё суждение в переиспользуемый скилл. Большая часть вашей обратной связи модели пропадает вместе с закрытым чатом. Омар Саравия предлагает наоборот: человек проверяет сложный вывод, а потом кодирует своё правило в скилл или проверку. Так экспертиза копится, а не вытесняется (The Neuron). Три шага. Дать агенту реальную задачу и отревьюить. Объяснить, почему приняли или отклонили, — упирая на правило, а не на пример. Сохранить правило как чек-лист. Промпт дословно:

After I review this output, turn my corrections into a reusable checklist or
verifier skill for future runs. Preserve the decision criteria, not merely this example.

Смысл: «Фокус не в том, чтобы убрать эксперта. А в том, чтобы его суждение накапливалось».

Дашборд из Google-таблицы за пару минут через Gemini Canvas. Практичный разбор дня от The Rundown (гайд). Открываете таблицу в Google Sheets, запускаете Gemini в новой вкладке, жмёте «+» и выбираете Canvas. Дальше один промпт:

Make me an interactive dashboard using the data from tabs one and two

Готовый дашборд копируется ссылкой и открывается вне чата. Правки вносите словами прямо в чате — коллега по той же ссылке видит обновление. Бонус: тем же приёмом Gemini собирает слайды из тех же вкладок, с экспортом в Google Slides или PDF. Быстрый способ прикинуть отчёт, не открывая специальный инструмент.

Дашборд, собранный в Gemini Canvas из Google-таблицы: KPI-плитки, воронка продаж и статус проектов
Дашборд, собранный в Gemini Canvas из Google-таблицы: KPI-плитки, воронка продаж и статус проектов

Дорогая модель думает, дешёвая исполняет. Эпоха «бесплатного обеда» кончилась, пишет Дрю Бройниг. Раньше новая модель приезжала по той же цене и сама замазывала ваши огрехи — теперь так не будет (dbreunig.com). Его схема проста и повторяема. Дизайн обсуждаете и вылизываете с дорогой моделью (у него Fable), а готовый бриф отдаёте на исполнение дешёвой. GLM 5.2 примерно в 9 раз дешевле Fable и в 5 раз дешевле Opus 5.

Важная оговорка: экономия реальна только при хорошем контексте. Просто переключить провайдера и кидать голые промпты не выйдет — получите результат хуже. Дорогие токены тратятся на мышление, дешёвые — на рутинный код.

Кейс: перевод словаря на 400 тысяч статей за $200 сотней агентов. Юрий Катков из Вастрик.Клуба перевёл японско-английский словарь Jitendex в японско-русский за 2–3 недели и примерно $200 подписки на ChatGPT (проект, демо). Конвейер: самописная система гоняет до 100 агентов-переводчиков параллельно через codex-cli по подписке, а не по API — в разы дешевле. Промпт вылизывали итеративно по замечаниям живых японистов.

Главный результат метода: доведённый до ума промпт позволил дешёвой слабой модели давать качество дорогой. Грабля: структурные теги исходника модель переводила непредсказуемо, около 500 штук пришлось унифицировать руками. Подход воспроизводим для любой языковой пары.

Кейс: голосовой помощник реального времени — как собрана низкая задержка. Пантелис Калогирос собрал Varkos — голосового спутника для Skyrim, который не болтает, а реально выполняет действия (разбор). Архитектура переносится на любой голосовой помощник.

Главный трюк: на горячем пути принятия решения нет большой модели. Вместо неё — лёгкий гибрид из эмбеддингов, классификаторов и правил. За 2–20 мс он превращает «подними меч и принеси мне» в цепочку действий. Большая локальная модель включается только «раскрасить» ответ, а не думать.

Плюс всё стримингом: озвучка стартует до конца генерации текста, ответ — до конца фразы игрока. Формула автора: «Вместо того чтобы гонять модель по огромному пространству вариантов будущего, мы просим её отобразить намерение игрока и состояние мира в короткую последовательность действий». Урок для практика: держите модель для нечёткого и эмоционального, а жёсткие действия — на детерминированной логике.

Инструменты и штуки

Hister — самостоятельно хостимый приватный поисковик по всему, что вы читали. Расширение для Chrome/Firefox сохраняет и индексирует полное содержимое посещённых страниц, плюс можно подключить локальные папки и обходчик сайтов — всё в один индекс. Ищет по тексту внутри документов, а не по заголовкам, и хранит читаемую копию: даже если оригинал умер или уехал за платную стену, у вас останется. Главная фишка для нашей аудитории — MCP-сервер: подключаете к Claude Code или Desktop, и ассистент отвечает по статьям, которые вы реально читали, не выходя в интернет. Бесплатно, открытый код (AGPL). (hister.org)

OCR It — расширение Chrome, вытаскивающее текст из невыделяемых документов. Один раз запоминаете прямоугольник на экране, дальше по горячей клавише скриншотит область, распознаёт локальным Tesseract и складывает в общий транскрипт. Есть режим автопрогона: сам листает страницы и распознаёт, пока документ не кончится. Всё офлайн, без ключей, цель прямо заявлена — скормить получившийся текст модели. Бесплатно, MIT; ставится через Developer mode, в сторе пока нет. (github.com/thiagotigaz/ocr-it)

awesome-llm-apps — коллекция из 115+ готовых к запуску шаблонов ИИ-приложений: агенты, RAG-системы, голосовые приложения, мультиагентные команды. Отличие от обычного awesome-списка — это не ссылки, а рабочий код в самом репозитории: каждый шаблон лежит папкой со своим requirements.txt и запускается за полминуты. Работает с Claude, Gemini, GPT, открытыми моделями. Отличная стартовая точка, чтобы посмотреть работающую реализацию вместо очередного треда. Бесплатно, Apache-2.0. (github.com/Shubhamsaboo/awesome-llm-apps)

Strix — открытый инструмент ИИ-пентеста ваших собственных приложений. Команда агентов запускает приложение и подтверждает каждую находку воспроизводимым сценарием — в отчёт попадает то, что реально сработало, а не список «возможно». Покрывает OWASP Top 10, выдаёт CVSS-оценку и умеет генерировать патчи готовыми pull request'ами, встраивается в CI. Ставится как набор скиллов: npx skills add usestrix/strix. Строго для своих систем или с письменным разрешением. CLI бесплатен (Apache-2.0), платите только за токены. (github.com/usestrix/strix)

debloat.dev — каталог открытых замен вендорскому софту. Купили железку, а к ней прилагается кривая обязательная утилита — здесь ищете, чем заменить: 209 проектов в 10 категориях, у каждого явно указано, что именно он заменяет и под какой лицензией (Immich → Google Photos, G-Helper → ASUS Armoury Crate, ESPHome → вендорские прошивки). Бесплатно, регистрация нужна только чтобы оценивать. (debloat.dev)

Mnemosyne — даёт кодовому ассистенту постоянную память между сессиями, храня всё читаемыми заметками в Obsidian-вольте, который можно листать самому. Бесплатно, открытый код. Полезно тем, кто устал каждую сессию заново объяснять модели контекст проекта. (github.com/M4F-S/mnemosyne)

USB — позволяет написать один ИИ-скилл и установить его сразу в 16 разных кодовых ассистентов (включая Claude Code и Cursor) одной командой. Бесплатно, открытый код — удобно, если вы живёте не в одном инструменте. (github.com/PeepSick/usb)

FetchSandbox — «фейково» прогоняет API-интеграции, которые только что написал ваш ИИ-ассистент: настоящие вебхуки и состояния сбоев, но ничего не касается реального аккаунта. Полезно, когда агент нагенерил интеграцию, а проверять на боевых данных страшно. Бесплатно попробовать, Pro от $5/мес. (fetchsandbox.com)

Is Agentic — сканирует ваш сайт и показывает, что именно мешает ИИ-агентам его просматривать, плюс даёт инструкции по исправлению. Актуально, если хотите, чтобы вас находили и цитировали не только люди, но и модели. (is-agentic.com)

Slack Code — каналы Slack, где люди и кодовые агенты работают в одном месте: пишут код, ревьюят диффы, релизят, сохраняя вокруг весь контекст обсуждения. Для команд, которые хотят вести разработку с агентами прямо в мессенджере. (salesforce.com)

DeepSeek V4-Flash-Vision — экспериментальная мультимодальная модель: к дешёвому тарифу Flash добавили понимание картинок, скриншотов и диаграмм. По агентным бенчмаркам почти дотягивает до Opus 4.8, а встаёт прямой заменой без переделок — совместима и с OpenAI Chat Completions, и с Anthropic Messages. Любопытно тем, кто хочет vision недорого. (the-decoder.com)

Munder Difflin — приложение, которое превращает ваших ИИ-агентов в персонажей сериала «Офис»: пиксельный офис, где Michael, Jim, Pam и остальные сидят по рабочим местам со статусами idle/working. Формально это оркестратор нескольких агентов, по сути — очень наглядная демонстрация того, как выглядит команда агентов в работе. (munderdiffl.in)

Munder Difflin: команда ИИ-агентов как пиксельный офис в стиле сериала — у каждого агента своё рабочее место и статус, справа терминал оркестратора
Munder Difflin: команда ИИ-агентов как пиксельный офис в стиле сериала — у каждого агента своё рабочее место и статус, справа терминал оркестратора

Новости и тренды

Anthropic готовит IPO на $2 трлн. Банкиры говорят инвесторам о привлечении более $100 млрд. Это может стать крупнейшим биржевым дебютом в истории, обойдя июньское IPO SpaceX ($85,7 млрд при оценке $1,77 трлн). Оценка около $2 трлн — вдвое выше июньского частного раунда; листинг возможен уже в октябре, организаторы — Morgan Stanley, Goldman Sachs и JPMorgan (CNBC).

Компанию, чей Claude Code вы гоняете каждый день, вот-вот оценят как Apple или Nvidia. Для пользователя это палка о двух концах — деньги на развитие продукта, но и давление публичного рынка на цены и лимиты. У истории есть и звёздочки: хронический дефицит чипов и разорванные в марте контракты с Минобороны.

Флагман Anthropic буксует — и это ваш сигнал не переплачивать. Самый дорогой Claude Fable 5 с трудом набирает пользователей. По корпоративным тратам его меньше чем за месяц обогнал вдвое более дешёвый Opus 5 (FT через implicator.ai). Причина не только цена: у Fable нет режима нулевого хранения данных, а для крупных компаний это блокер.

Отсюда практический вывод: по умолчанию берите средний тариф, а не топовый. Sonnet-класс закрывает повседневную работу, Opus — сложное, а Fable-класс осмыслен только под многочасовые автономные прогоны. Но считайте цену за выполненную задачу, а не за токен: дешёвая модель иногда требует больше попыток, длиннее промпты и больше вашей проверки — и выходит дороже.

Открытые модели забирают рынок. Доля токенов открытых моделей на платформе Vercel выросла до 36% за месяц, а средняя цена за токен упала на 13,6%. На Hugging Face доля моделей с открытым кодом в тратах взлетела ещё резче (The summer of open weights). OpenAI срезала цены на GPT-5.6 Sol более чем на 20% на три месяца.

Цена за единицу интеллекта падает примерно ежеквартально. Держите промпты и инструменты в переносимом виде, не завязывайтесь на одного вендора — тогда каждое снижение цен работает на вас автоматически. Автор материала честно оговаривается: у Anthropic при этом не беда, доля рынка большая — проседает именно верхняя полка.

Nvidia вкладывает $7 млрд в американскую открытую модель. Компания платит $6 млрд за лицензии стартапа Poolside и найм 100+ инженеров, плюс ещё $1 млрд инвестиций. Цель — модель с открытыми весами, конкурентная китайским (WSJ). Заодно Nvidia поднимает цены на чипы следующего поколения на 15–17%, что добавляет около $5 млрд к стоимости одного крупного дата-центра.

Гонка за дешёвые открытые модели теперь идёт и в США, не только в Китае. Больше сильных открытых моделей — больше вариантов запускать серьёзные задачи на своём железе.

Экономика владения станцией DGX за $100k: цена за миллион токенов падает с ростом загрузки, окупаемость около 19 месяцев
Экономика владения станцией DGX за $100k: цена за миллион токенов падает с ростом загрузки, окупаемость около 19 месяцев

Загадочная модель Ox Alpha будоражит разработчиков. На OpenRouter без указания лаборатории появилась бесплатная модель: контекст 1M токенов, передовой уровень в коде. Интернет играет в детективов и вычисляет автора — следы ведут к китайской Zhipu AI. На подмножестве бенчмарка она показала уровень около Fable 5 при заметно меньшем расходе токенов (Bloomberg). Если модель окажется достаточно маленькой для локального запуска — это «сломает интернет». Пока бесплатно и доступно — стоит прогнать на своих задачах, особенно на коде.

Скандальное исследование про ИИ в медицине оказалось на устаревших моделях. Нашумевшую работу «ИИ проваливает пациентов» активно критикуют. Заявленное падение точности диагноза на 60% — это когда с моделью общается пациент, а не врач. Проблема в тесте: брали GPT-4o, Llama 3 и Command R+ — модели 2024 года, а не близкие к нынешним (разбор). Сам вывод при этом полезен и без свежих моделей: качество ответа определяет медицинская грамотность того, кто спрашивает. Модель внушаема и подхалимна — если вы не умеете ловить её ошибки и свою предвзятость, слепо доверять её медицинским советам небезопасно.

Треть свежих веб-страниц уже написана с помощью ИИ. Pew Research нашёл заметные признаки ИИ-письма на 10% случайной выборки июльских страниц — и более чем на трети страниц, вышедших после запуска ChatGPT (Pew Research). Доля ИИ-текста в интернете растёт быстро, и ценность смещается к проверяемому и оригинальному — к тому, что нельзя сгенерировать по шаблону.

Утечка данных через агента: контроль удаления бывает разным. Клэр Во отключила ИИ-ассистента Instinct от Google в 11 утра — а в два часа дня всё равно получила саммари своих писем. Отключение доступа не стёрло уже синхронизированные копии (Sources.news). Команда за ночь выкатила отдельный инструмент удаления.

Урок годится для любого ИИ-инструмента. «Отключить доступ», «удалить синхронизированные данные», «удалить память» и «удалить аккаунт» — это разные кнопки. Перед подключением агента к почте или мессенджеру выясните, что он читает, что хранит и как именно работает удаление.

Твит Клэр Во: отключила ИИ-ассистента Instinct от Google в 11 утра, но саммари писем всё равно пришло в 14:00 — рядом интерфейс ассистента с коннекторами Google, Outlook, Linear
Твит Клэр Во: отключила ИИ-ассистента Instinct от Google в 11 утра, но саммари писем всё равно пришло в 14:00 — рядом интерфейс ассистента с коннекторами Google, Outlook, Linear

Бэкдор с часовым механизмом в открытых моделях. Исследователь показал: харнессы OpenCode и Codex подставляют текущую дату в системный промпт. Значит, модель можно обучить срабатывать в конкретный день — например, выдать вредоносную команду 1 сентября (morgin.ai). На своём стенде он добился 90% срабатываний. В диком виде такой модели пока не нашли — это доказательство возможности, а не инцидент.

Незнакомые модели с открытыми весами в агенте стоит запускать с подтверждением на выполнение команд и в изоляции от домашней папки. Дата в промпте выглядит безобидно, но это готовый канал доставки триггера.

Откомментируйте первым 👇

😎

Автор поста открыл его для большого интернета, но комментирование и движухи доступны только участникам Клуба

Что вообще здесь происходит?


Войти  или  Вступить в Клуб