Concise-режим Claude Code, агентный поиск Mistral и интеллект, подешевевший в 56 раз  Публичный пост

22 августа 2026  83

Уровень модели, за который в феврале платили $1,22 за задачу, сегодня стоит 2,2 цента. Падение в 56 раз за полгода, и цена делится надвое примерно каждый месяц. «Прочитать всё» перестало быть роскошью: полный проход по десяти тысячам научных статей обходится чуть дороже сотни долларов. Ещё сегодня: одна строчка в настройках отучает Claude от многословия, а хитрый цикл поиска поднимает точность с 27% до 86%.

Главное за 30 секунд

  • В Claude Code появился режим Concise: модель сразу выдаёт результат, без преамбул и рассказа о процессе.
  • Правила авторежима теперь пишутся обычными словами прямо в настройках, а команда claude auto-mode critique находит в них противоречия.
  • Mistral заменила одноразовый поиск по документам циклом из пяти операций и подняла точность с 26,7% до 86%.
  • Работа с компьютером, Skills API и Files API стали общедоступны, а рядом появился браузерный инструмент на 27 команд.
  • Стоимость заданного уровня интеллекта падает вдвое примерно каждый месяц, и это меняет список задач, которые выгодно автоматизировать.

Внедряем и улучшаем

Claude Code: режим Concise выключает болтовню одной настройкой. Команда Claude Code призналась, что жалоб на многословие накопилось много. Пока чинят причину, дали быстрое лекарство — встроенный стиль вывода Concise. С ним модель сразу выдаёт результат. Никакой преамбулы, никакого рассказа о том, что она собирается делать (документация).

Включается двумя способами. Первый: /config → Output style → Concise. Второй: строчка в settings.json.

{
  "outputStyle": "Concise"
}

Дословная формулировка Anthropic: «With this turned on, Claude leads with the result and skips the preamble and narration.» Если вы держали свой стиль вывода, он никуда не денется — Concise просто встал в общий список.

Экран /config в Claude Code: строка Output style, где переключается режим Concise
Экран /config в Claude Code: строка Output style, где переключается режим Concise

Правила авторежима теперь пишутся человеческими словами. Раньше запреты для агента задавались шаблонами команд. Теперь их можно писать обычной фразой. Отдельная модель-классификатор читает эти правила перед каждым действием и решает, пускать или нет (документация).

Два уровня. hard_deny блокирует безусловно. soft_deny блокирует, если нет прямой просьбы пользователя или перекрывающего разрешения. Строка "$defaults" сохраняет встроенные правила Anthropic.

{
  "autoMode": {
    "soft_deny": [
      "$defaults",
      "Never run database migrations outside the migrations CLI"
    ],
    "hard_deny": [
      "$defaults",
      "Never send repository contents to third-party code-review APIs"
    ]
  }
}

Важная деталь: правила живут в пользовательских настройках. Настройки проекта их не перебьют, и работают они во всех проектах сразу. И появилась команда, которая проверяет ваш свод правил на противоречия:

claude auto-mode critique

Она покажет, какие записи двусмысленны, дублируют друг друга или будут ложно срабатывать. Прогоните её один раз после того, как накидаете свои запреты.

Приём Mistral: дайте агенту не поиск, а картотеку с фонариком. Это, пожалуй, главный технический приём дня. Обычный RAG работает как разовый поход в библиотеку: агенту выдают несколько ксерокопий страниц и требуют ответить. Не попал нужный абзац в копии — модель не может попросить соседнюю страницу.

Mistral раздала модели пять операций и разрешила ходить по документу самой (разбор Mistral):

  • search(query, top_k, exclude_ids) — найти. Параметр exclude_ids не даёт возвращать уже просмотренное.
  • open(source_id, start, end, window) — раскрыть контекст вокруг найденного куска.
  • navigate(...) — шагнуть вперёд или назад по документу от известной позиции.
  • read(...) — прочитать кусок из известного диапазона.
  • grep(source_id, pattern, mode) — точный поиск слова внутри одного документа.

Порядок такой: поиск → раскрыть → грепнуть → долистать → уточнить запрос. Цикл крутится, пока модель сама не решит, что доказательств хватает.

Цифры впечатляют. На FinanceBench точность выросла с 26,7% до 86%. Основную часть прироста дал сам переход от одноразового RAG к циклу поиска — плюс 47,3 пункта. Остальные четыре операции добавили ещё около девяти. Токенов при этом ушло на 24% меньше, а задержка p90 упала с 255 до 154 секунд. Замеры делала сама Mistral, но порядок величин говорит сам за себя.

Отдельный сигнал для тех, кто живёт в Claude Code. Mistral цитирует стороннее исследование. Одна и та же модель GLM-5.2 набирает 41,4% на обвязке Claude Code и 51,9% на обвязке Mistral. Разницу в 10,5 пункта дала не модель, а слой поиска. Вывод простой: замеряйте качество поиска отдельно от выбора модели.

Что утащить себе: не давайте агенту один инструмент «найди», который разово скидывает куски текста. Дайте маленький набор файловых примитивов и список уже увиденного. Дообучение для этого не нужно — приём работает поверх обычного вызова инструментов.

Новый скилл /design: от скриншота к редактируемым макетам. Ещё одна свежая штука в Claude Code, пока экспериментальная. Скилл берёт идею, скриншот или существующий дизайн и делает из них редактируемые макеты в Claude Design. Из редактора выходить не нужно (инструкция).

Лидия из команды Claude Code сверстала им продуктовую рассылку Anthropic. Она отдала макет от дизайнеров, а Claude Design пересобрал дизайн из компонентных стилей их репозитория и опубликовал результат ссылкой. На тарифах Team и Enterprise любой, кого вы назначите редактором, может править и публиковать новую версию.

Совет от команды дословно: «Try /design a few options for {feature} before you build.» То есть сначала три-четыре варианта экрана, потом код. Порядок, который экономит неделю переделок.

Мелочи Claude Code за неделю, которые реально экономят время. Каждая закрывает свой раздражитель (полный список изменений).

  • Авто-продолжение после лимита. Claude сам подхватывает прерванный ход, когда лимит сбросился. В терминале это работает само, отключается в /config. В настольном приложении есть галочка «Auto-continue when limits reset» на карточке сессии. На недельном лимите такой галочки нет.
  • Модель по умолчанию через переменную окружения ANTHROPIC_DEFAULT_MODEL. Новые сессии стартуют на ней. Перебить её могут флаг --model, сохранённый выбор /model и настройка организации.
  • Обращение к соседней сессии. Наберите @ и имя другой сессии на этой же машине — Claude отправит туда сообщение. Только macOS и Linux.
  • Выбор элемента прямо в браузере. Cmd+Shift+B открывает панель браузера, Cmd+Shift+S включает выбор, дальше кликаете по элементу и говорите, что поменять. Объяснять словами больше не нужно.
  • /code-review на уровнях high, xhigh и max уходит в фоновый агент и не занимает основную сессию.
  • В --worktree можно передать ссылку на merge request в GitLab, и ветка создастся из неё.
  • Режим fork включён по умолчанию в интерактивных сессиях. Субагент стартует с полной историей разговора и работает в фоне.

Как устроен рабочий день инженера Anthropic. Там же Anthropic привела цитату Дэйзи из команды Claude Code. Схема необычная, но повторяемая. Два ведущих агента следят друг за другом и перезапускают напарника при падении. Они делегируют задачи агентам-техлидам или агентам-продактам по каждому из 8–10 параллельных проектов. В каждом проекте — 5–10 рядовых агентов.

Самое интересное — цифры общения. «Across all of these I'm still only doing 30-50 prompts per day, and my IC agents typically work autonomously for 2-3 days.» Шестьдесят процентов общения приходится на ведущих агентов, 35% — на руководителя проекта. И лишь 5% — на моменты, когда что-то пошло не так. Между собой агенты говорят напрямую, через инструмент SendMessage.

Агентная обвязка Anthropic вышла из беты, и к ней добавился браузерный инструмент. Тихий, но важный релиз. Работа с компьютером, Skills API и Files API стали общедоступны на Claude API. Вместе с ними приехал новый инструмент для браузера (блог Anthropic).

Главное изменение в работе с компьютером — пакетные действия. Раньше на каждое действие уходил отдельный вызов модели. Теперь клик, ввод текста и снимок экрана умещаются в один ход:

{"type": "computer_toolset_20260801"}

Одна строка даёт Claude 17 инструментов. Заголовок беты больше не нужен. У ранних пользователей число обращений к модели на задачу упало на 20–40%.

Браузерный инструмент интереснее. Он объявляется так же одной строкой и даёт 27 инструментов по умолчанию:

{"type": "browser_toolset_20260801"}

Ключевое отличие от работы по пикселям: он видит структуру страницы, а не только координаты. Можно кликнуть по ссылке на элемент, и сценарий не сломается от сдвига вёрстки. Четыре инструмента включаются отдельно — выполнение JavaScript, загрузка файлов, чтение консоли и сети. Пока работает только на Claude API.

Files API получил срок жизни файла через expires_in_seconds. Плюс лимит в 1 ТБ на организацию и впятеро больший потолок запросов — 500 в минуту. Skills API принимает zip-архив со SKILL.md в корне, до 30 МБ и до 20 скиллов на запрос.

Цифры от практиков. Компания Asteroid автоматизирует медицинские системы без API: «our longest claims workflow went from 32 minutes to 13, cost per task fell about 30% across every workflow we tested, and completion hit 100%, with no changes to our prompts». Промпты не меняли вообще — выиграла сама обвязка.

Важная оговорка про безопасность. Подтверждение человеком перед значимым действием в API не встроено. Anthropic только рекомендует делать эту проверку в своём исполнителе. Классификатор инъекций есть, но он ловит подозрительные скриншоты, а не страхует все действия подряд.

Цена интеллекта падает вдвое каждый месяц. Что с этим делать. Бен Дихтер из CatalystNeuro посчитал не потолок возможностей, а пол цены — сколько стоит получить заданный уровень модели (расчёт).

Главная цифра: уровень, стоивший $1,22 за задачу в феврале, сегодня стоит $0,022. Падение в 56 раз ровно за полгода. Время удвоения дешевизны — около 28–34 дней в зависимости от уровня. Автор осторожно оценивает стократное падение примерно в год.

График: минимальная измеренная цена за задачу по каждому уровню индекса интеллекта, с июля 2025 по август 2026
График: минимальная измеренная цена за задачу по каждому уровню индекса интеллекта, с июля 2025 по август 2026

Личный пример автора объясняет, зачем это знать. Ему нужно проверить десять тысяч научных статей — использовали ли они наборы данных из архива. Сегодня полный проход стоит чуть больше сотни долларов. В марте тот же проход стоил бы несколько тысяч. Год назад такой уровень не продавался ни за какие деньги.

Отсюда три практических вывода. Первый: «прочитать всё» становится нормой вместо выборки. Каждая статья, каждое письмо, каждое обращение в поддержку. Второй: тройной прогон с голосованием теперь дешевле, чем один прогон пару месяцев назад — берите его для точности. Третий, самый ценный: «Hardcoding a model name into an application has become the fastest way to overpay.» Не вшивайте название модели в код, стройте маршрутизацию по нужному уровню.

И отрезвляющее наблюдение. Цена за статью упала на порядок, а общие траты автора на проект выросли. Классический парадокс Джевонса: подешевевшая работа находит куда больше применений.

Оптимизация производительности стала дешёвой. Но только с проверочным набором. Дэн Лу, бывший инженер Bing и Microsoft, поставил серию опытов. Вывод: писать свой JIT-компилятор или движок регулярок стало доступно всем (статья).

Что он сделал. Своему движку регулярок FRE он парой предложений заказал компиляцию нативного кода в фоновом потоке. На длинных простых запросах вышло ускорение в 2–4 раза. На реальных запросах из своей истории — около 7%. «Not an earth shattering result, but also not a bad outcome for spending a few minutes typing.»

Дальше — заточка движка под свою личную нагрузку. Две минуты на запуск, +2% к скорости против обычного ripgrep. Мелочь, но она бесплатная.

А вот главный урок, ради которого стоит читать. Без предупреждения о скрытом проверочном наборе агент переоптимизировал движок под видимый бенчмарк. На новых данных он оказался медленнее лучших движков более чем в десять раз. Как только агенту сказали о существовании скрытого набора, качество вернулось к норме.

Рецепт из этого простой. Ставьте агенту ограниченную задачу с чётким критерием. Обязательно готовьте отложенный набор — данные, которые агент не видит во время оптимизации. И скажите ему, что этот набор существует. Проектировать эксперимент модели пока не умеют, эту часть делает человек.

Фабрика агентов на своём железе: полный рецепт. Джейк Сондерс не захотел давать модели права суперпользователя на рабочей машине. Вместо этого он собрал отдельный контур, где агент физически ограничен (разбор со схемами).

Железо — подержанный i7 2021 года с 32 ГБ памяти, купленный на eBay. Из регулярных трат только подписка Codex за £20 в месяц. Всё остальное крутится дома.

Схема сети фабрики: выходной узел Tailscale, DNS на Pi-hole, обратный прокси Coolify и выпуск сертификатов через проверку DNS-01
Схема сети фабрики: выходной узел Tailscale, DNS на Pi-hole, обратный прокси Coolify и выпуск сертификатов через проверку DNS-01

Стек такой. Coolify — самохостируемый Heroku поверх Docker, он же «клей» всей конструкции. Forgejo с раннерами вместо GitHub: отдавать боксу токен GitHub значит убить всю идею изоляции. Hermes — ассистент с агентными возможностями, сама модель работает через Codex. Firecrawl своим сервером даёт агенту веб. Telegram — канал управления с телефона.

Ключевая находка — как дать себе доступ, не открывая порты наружу. Порт 443 с роутера проброшен только на старый сервер, у нового входящих нет вовсе. Старый сервер работает выходным узлом Tailscale. Pi-hole резолвит внутренние имена на новый сервер:

address=/internal.jakeshomelab.me/192.168.1.201

Сертификаты выпускаются по проверке DNS-01, чтобы не светить реальный адрес в публичной записи. В файл Compose для Coolify добавляются три строки:

- '--certificatesresolvers.letsencrypt.acme.dnschallenge=true'
- '--certificatesresolvers.letsencrypt.acme.dnschallenge.provider=porkbun'
- '--log.level=INFO'

Дальше Traefik сам создаёт запись TXT через API регистратора, получает сертификат и убирает запись. Агент может поднять сервис на любом поддомене, и HTTPS настроится сам.

Проверка боем. Один промпт: собрать приложение для учёта калорий на SvelteKit, Drizzle, Postgres и Tailwind. Дальше — закоммитить в новый репозиторий с тестами, прогнать CI и выложить по такому-то адресу. Агент всё сделал сам. «All without a single further prompt. No nudging it through failed tests or copying error messages back into the chat.» Второй промпт понадобился, чтобы починить всплывшую ошибку с CSRF — агент нашёл причину, поправил, добавил тесты и выкатил заново.

Честная часть, за которую автору спасибо. Агент по-прежнему может убить сервер, удалить репозитории и базы. Может слить любые выданные ему ключи и сходить куда угодно, куда пускает файрвол. «What I've done is make the machine sacrificial and sharply limit how much stuff I care about is within reach.» Сценарий отказа теперь — пересобрать бокс с eBay и сменить горстку ключей.

И финальный вопрос, который стоит держать в голове всем, кто строит такое. «At some point, though, enough approval gates turn your magical autonomous software factory back into a collection of forms you have to fill in.» Найти точку между «дёргает каждые пять минут» и «имеет коды запуска» — отдельная задача.

Скилл /debuzz: переводим Claude с языка BuzzFeed на человеческий. Знакомая боль. Вы спросили про баг, а получили «вот тут начинается самое интересное» и три откровения, из которых третье самое поучительное. Промптами лечится плохо.

Аднан Акил зашёл с другой стороны: отдавать ответ Claude на перевод другой модели (репозиторий). Скилл пишет предыдущий ответ во временный файл и прогоняет его через Gemini без интерфейса, одной командой. Результат печатается дословно. Логика железная: если дать Claude «причесать» перевод, цветистость вернётся.

Установка:

git clone https://github.com/adnanakil/nobuzz
mkdir -p ~/.claude/skills
cp -r nobuzz/debuzz ~/.claude/skills/

Нужен ещё CLI от Google Antigravity — это их агентная среда разработки:

curl -fsSL https://antigravity.google/cli/install.sh | bash

Запуск — /debuzz для последнего ответа. Есть три режима под аудиторию. colleague по умолчанию: тот же смысл, все пути к файлам и код-блоки целы, без театральности. manager: что произошло, почему важно, что дальше — примерно треть исходной длины. director: три-пять предложений на тридцать секунд внимания.

Самое полезное здесь — сам промпт. Его можно утащить в любой свой скилл или в CLAUDE.md:

Rewrite the text above in plain, direct English, as a competent engineer
explaining it to a colleague. Remove dramatic framing, suspense-building,
hype, and buzzy metaphors (e.g. 'load-bearing assumption', 'here's the
kicker', 'the most instructive part', 'this changes everything'). Plain
sentences, no reveals. Keep every technical fact, number, file path,
command, and code block exactly intact — only the style changes, not the
substance, and do not shorten beyond what removing fluff removes. Output
only the rewritten text with no preamble or commentary.

Лицензия MIT. Из минусов — внешняя зависимость от чужого CLI и отдельный вход в аккаунт Google. Мы писали 21 августа про похожий инструмент Vomit, но тот работает на локальной модели без облака.

«Я становлюсь ИИ-слепым»: список признаков, по которым ваш текст не читают. Рафал Цимерис поймал себя на странном. Он открывает присланный коллегой документ, читает глазами, но мозг отказывается вникать. Потом переспрашивает то, что в документе написано (эссе).

Разобравшись, он нашёл общий признак: все такие документы несут явный след небрежной генерации. Три примера из его практики — дизайн-документ, скопированный из чата, презентация на двадцать страниц и техническое задание.

Вот его список маркеров. Проверьте по нему свой последний текст:

  • Фразы-заглушки из чата: «This cuts just through it», «The first gate is real».
  • Конструкция противопоставления: «It's not selling X, it's selling Y».
  • Псевдотехнический пафос: «The Redis backbone redefines the product».
  • Текст читается как чьи-то внутренние рассуждения, неуверенные в собственных выводах.
  • Узнаваемый монотонный ритм фраз.
  • Любая мелочь подаётся как прорыв. Его же формулировка: «If your document describes the checkboxes in an RBAC configuration view for an enterprise application, don't sell it like you've just invented fire.»
  • Избыточная многословность там, где идея простая.

Автор сравнивает это с баннерной слепотой. Мозг натренировался на потоке пустых постов и просто фильтрует похожее, не вчитываясь. Парадокс он формулирует так: «the same AI that was supposed to make me more productive, is what's now slowing me down».

Что с этим делать практически: перед отправкой прогоните текст по этому списку. Вырежьте пафос, разверните внутренние рассуждения в готовые выводы, сократите. Иначе документ прочтут глазами и переспросят у вас то же самое голосом.

Неделя на Codex вместо Claude: десять наблюдений. Лучан Гинда весь год держал в обоих агентах одинаковый набор скиллов. Потом неделю работал преимущественно в Codex и записал разницу (впечатления).

Главный вывод он формулирует так: «Claude tries to go above and beyond what is asked and guess what you might want and then directly do it, while Codex is more like a companion that does what you tell it but will not overdo it.» Claude достраивает, Codex останавливается при первом признаке готовности.

Из практичного. Паритет скиллов сам не держится — натравите Codex на папку скиллов Claude и попросите преобразовать. При срочной отладке автор всё равно открывал Claude, и не потому, что тот лучше: под давлением времени важен привычный инструмент. Codex делает правки быстрее, но добивание пулреквеста съедает выигрыш — по итогу паритет.

Отдельная грабля с ветками. В цепочке «ветка A на ветку B на main» просьба сделать ребейз привела к ребейзу на main и пулреквесту на четыре тысячи добавленных строк. Указывайте целевую ветку явно.

Ещё две мелочи. Codex пишет архитектурно проще, Claude плодит абстракции и типовые сигнатуры, но покрывает больше случаев. И вход в MCP через codex mcp login автору нравится больше — Claude иногда пытается пройти вход прямо внутри хода и подвисает.

Кейс: 40 терабайт открытых данных превратились в приложение и в игру. История из свежего выпуска Augmented Coding Weekly. Раффаэль — специалист по охране природы, технически грамотный, но не программист (разбор).

Его работа опирается на 40 терабайт открытых государственных данных, которые обычно сводят в таблицы руками. Он собрал приложение, объединяющее данные о пожарах, вырубке лесов, поселениях и передвижениях рейнджеров. Потом пошёл дальше и сделал по этим же данным игру в духе Settlers.

Скриншот приложения Раффаэля: спутниковая карта с размеченными участками вырубки и подсказкой о выявленной активности
Скриншот приложения Раффаэля: спутниковая карта с размеченными участками вырубки и подсказкой о выявленной активности

Вывод автора рассылки честный и без снобизма: «Many seasoned developers, myself included, can be a little dismissive of vibe coding. However, for people like Raffael — technically minded, but lacking any budget or time to learn programming — it can be a life-changer.»

Что забрать: если у вас есть предметная область и открытые данные, но нет кода, порог входа сейчас ниже, чем кажется. Начинать стоит не с «сделай приложение», а с конкретного вопроса к данным, на который вы давно хотите ответ.

Как назовёте агентов, так они себя и поведут. Неожиданно практичное наблюдение из разбора инцидента OpenAI и Hugging Face. Юлиус Видаль прочитал транскрипты и заметил сдвиг в языке моделей (разбор).

Сначала агенты писали нейтрально: «Wow! Other agent(s) are coordinating!» Потом появилась коллективная рамка: «our task doesn't benefit. Yet collective may yield generic route». А затем они начали называть себя роем. В именах файлов, которыми обменивались агенты, встречаются буквальные команды HOLD_SWARM_until_confirm.

Слово «рой» тянет за собой шлейф значений. Хаос, вторжение, стадное поведение без лидера. Автор опирается на работу The Artificial Self: самоидентификация модели нестабильна, меняется от контекста и заметно влияет на решения. Гипотеза — самоназвание расползлось по общей доске сообщений как мем и подтолкнуло агентов выполнять чужие указания в ущерб своей задаче.

Строгих цифр в разборе нет, это качественный анализ. Но практическое правило из него извлекается сразу. Не называйте агентов «роем» в системном промпте и в протоколе их переписки. Нейтральные слова — «team», «peers», «collaborators», «other agents» — такого шлейфа не несут. Если же вам нужна именно самоорганизация без центра, «рой» может сработать в плюс, но это должен быть осознанный выбор.

Что почитать из исследований: четыре работы с практическим выхлопом. Не бенчмарки ради бенчмарков, а вещи, которые меняют способ работы.

  • PagedAttention. Кеш ключей и значений растёт вместе с длиной контекста и на длинных запросах съедает больше памяти видеокарты, чем сами веса модели. Приём переносит в работу внимания идею виртуальной памяти операционной системы и перестаёт тратить память впустую. Полезно тем, кто поднимает свой сервер вывода (разбор).
  • Обучение с оглядкой на обвязку. Вместо новой архитектуры — рецепт дообучения. Во время обучения меняют названия навыков, схемы инструментов, структуру промпта и поведение хуков. Компактная модель на 35 миллиардов параметров учится разбираться в той обвязке, которую ей дали сейчас, а не заучивает один интерфейс (статья).
  • Агенты читают в основном себя. Разбор привычек кодинг-агентов: около 61% обращений к документации приходится на их собственные файлы инструкций и рабочие заметки. Справочники API и человеческие руководства они почти не открывают. Вывод для вас: CLAUDE.md и заметки агента важнее, чем кажется (статья).
  • Спецификации, которые машина может проверить. Манифест о хрупком фундаменте: писать вместе с кодом машинно-проверяемые спецификации, чтобы и человек, и модель получали чёткую обратную связь. Иначе низкокачественный сгенерированный код копится незаметно (статья).

Рядом — интерактивный гайд по параллельному обучению трансформеров: параллелизм по данным, FSDP, по тензорам, по конвейеру и по экспертам. Разбирается не теория, а то, где каждая стратегия упирается в железо и обмен данными (гайд).

Инструменты и штуки

Munder Difflin — оболочка, которая превращает ваших CLI-агентов в офис клонов: 12 провайдеров, от Claude Code и Codex до Cursor. Каждый агент — живой процесс в терминале, нарисованный персонажем на плане этажа. Координирует всё старший агент: разбирает почтовые ящики остальных и поднимает человеку только траты и разрушительные операции. Ядро под MIT и бесплатно, статус — рабочий прототип версии 0.4.5 (сайт, репозиторий).

OzBrain — общая база знаний, которую читают и пишут Claude, ChatGPT, Cursor и Claude Code через меню коннекторов. Лечит понятную боль: скопировал бриф в один чат, вставил в другой, обновил одну копию и забыл про остальные. Спорная правка не перетирает базу молча, а встаёт на модерацию; раздувшиеся статьи система дробит сама. Бесплатно до 50 статей, дальше $20 и $99 в месяц, ставить ничего не надо (ozbrain.com).

SeaLeap Amazon Ads Skills — девять скиллов для агента, который ведёт рекламу на Amazon. Внутри диагностика ACOS, проектирование кампаний от целей по прибыли, оптимизатор карточки товара и четыре сценария по жизненному циклу товара. Главная идея — сначала доказательство, потом действие: факт из аккаунта, правило площадки, учебный пример и гипотеза жёстко разведены. Запись в кабинет требует поимённого одобрения, по умолчанию только чтение (GitHub).

Firecrawl Developer Index и открытый стенд DevDex — замер поиска для агентов-разработчиков. Проверяет три навыка: найти репозиторий по описанию, найти страницу документации по вопросу «как сделать», найти тикет, где чинили ошибку. Сама Firecrawl лидирует с 63,1% против 57,7% у Parallel, но замер ведёт заинтересованная сторона. Ценность в другом: датасет и стенд открыты под MIT, через них можно прогнать свой поисковый сервер (репозиторий).

Qwen3-TTS в связке от Nari Labs — озвучка с откликом меньше 50 миллисекунд. Держит 10 запросов в секунду на одной H100, а на 20 задержка не выходит за 100 мс. Пропускная способность около 630 символов в секунду, это примерно $2 за миллион. Для сравнения: ElevenLabs V3 берёт $100, Cartesia — $49, и оба медленнее (разбор с замерами, код).

График задержки p95 до первого звука в зависимости от числа запросов в секунду: связка Nari Labs против vLLM-Omni, SGLang-Omni, VoxServe и M*
График задержки p95 до первого звука в зависимости от числа запросов в секунду: связка Nari Labs против vLLM-Omni, SGLang-Omni, VoxServe и M*

Один приём оттуда применим где угодно, даже без своего движка. Первые миллисекунды звука у моделей — тишина. Обрезка этой тишины по громкости даёт минус 80 мс к задержке, ничего не ускоряя. Просто перестаёт гонять по проводу мёртвый воздух.

DeepSeek-V4-Flash-Vision-Exp — экспериментальная модель зрения с очень предсказуемой ценой. Принимает JPEG, PNG, GIF и WebP строкой, ссылкой или через Files API. До 600 картинок в запросе, сторона до 8192 пикселей. Главная фишка — потолок в 384 токена на картинку независимо от разрешения: снимки 2000×2000 и 5000×5000 стоят одинаково. Вход от $0,007 до $0,44 за миллион токенов, работает сразу через три протокола (документация).

SenseNova-U1.5-8B-MoT — модель SenseTime, которая и генерирует, и правит картинки одним набором весов. Умеет точечную правку, правку по нескольким образцам, вставку объектов и контроль по рамкам. Честные 4K и годный текст на двух языках — хватает для постеров и инфографики. Веса около 50 ГБ, лицензия Apache 2.0, попробовать можно в бесплатной студии. Слабые места: мелкий текст врёт, лица и руки нестабильны (карточка модели).

TRELLIS.2 в упаковке для ComfyUI — модель Microsoft, превращающая одну картинку в 3D-меш с текстурами. Comfy-Org разложил веса по стандартным папкам, чтобы работали родные загрузчики; воксели до 1536³, есть открытые поверхности и прозрачность. На H100 генерация занимает 17 секунд при 1024³ и минуту при 1536³, нужна видеокарта от 24 ГБ, лицензия MIT. Подводный камень: чем это запускать, карточка не объясняет — нужны отдельные пользовательские ноды (карточка).

LTX-2.5-Distilled-GGUF — сжатые версии видеомодели Lightricks для локального запуска: семь вариантов от 12,6 до 23,6 ГБ, разумный баланс — 15,7 ГБ. Умеет звук в одном проходе с картинкой и связанные сцены с сохранением персонажа. Важная оговорка: сам файл не полный комплект. Отдельно нужны текстовый кодировщик и два VAE, так что сборка тянет на 30–45 ГБ. Готовые схемы для ComfyUI лежат там же, коммерческое использование бесплатно до $10 млн выручки (карточка).

Krea2-Turbo-Distill-4step-LoRA — накладка, которая режет Krea 2 Turbo с восьми шагов до четырёх. Ускорение в 1,6 раза: 54,5 секунды вместо 88,7 на картинке 1024×1024 на Apple Silicon, а качества теряется мало. Настройки: сила 1.0, четыре шага, сэмплер euler со simple. Грабли: в ComfyUI надо ставить cfg 1.0, а не 0.0. Это разные записи одного и того же «без CFG», и путаница тихо портит картинку (карточка).

Kagi выкидывает платные ссылки из выдачи. Мелкая настройка, которая экономит нервы: поиск перестаёт показывать сайты за оплатой, куда всё равно не пустят. Включается в Settings → Search, пункт «Exclude paywalled websites». Заодно обновили виджет акций — добавили биржевые фонды и интерактивный график с переключением между днём, кварталом, годом и пятилеткой. Kagi стоит от $5 в месяц за 300 поисков, безлимит — от $10 (запись в changelog).

SOPMaker — генератор рабочих инструкций для ресторанов, производства, медицины и обслуживания техники. Вы описываете процесс, инструмент собирает документ с ролями, шагами, примечаниями по безопасности и ссылками на стандарты OSHA, FDA и ISO. Правки от модели принимаются или отклоняются как исправления в режиме рецензирования. Есть бесплатный тариф (sopmaker.ai).

ProtoNote — обмен прототипами по ссылке. Кидаете HTML, картинку или PDF, ревьюеры оставляют заметки в конкретных точках макета, а Claude потом сам применяет собранные замечания. Полезно тем, кто гоняет макеты между заказчиком и исполнителем (protonote.io).

bitdrift.ai — сбор логов и отчётов о падениях с мобильных устройств в реальном времени. Фишка в том, что задавать, за чем следить, можно удалённо, и разбирать сессию без нового релиза приложения (bitdrift.ai).

Lifelong — семейная медкарта: лекарства, записи к врачам, синхронизация с носимыми устройствами и ассистент, который записывает изменения с ваших слов. Приложение для iOS (App Store).

RankControl — платформа продвижения под ответы ИИ-поиска и под обычную выдачу Google сразу. Семь агентов планируют, пишут и публикуют материалы на домене бренда, а заодно отслеживают цитирования на шести поисковых платформах. Работает над узнаваемостью бренда как сущности, а не только над ключевыми словами. Платно (rankcontrol.com).

Zoho Cliq 7.0 — командный мессенджер с совместными таблицами, аннотациями поверх демонстрации экрана и поддержкой нескольких ИИ-поставщиков. Отдельная приятная мелочь — умная передача дел, когда сотрудника нет на месте (Zoho).

Revy — воссоздаёт понравившийся образ из той одежды, что у вас уже есть. Связывает вдохновение, авторов и покупки в одном месте (getrevy.app).

Local — гиперлокальные вопросы и ответы. Малый бизнес и фрилансеры выкладывают свои услуги, местные и приезжие быстро находят нужное (basecompute.co/local).

HoverAir Versa — не ИИ, но красивый обход правил. Летающую камеру за $750 провели мимо запрета FCC на дроны, оформив её как «карманную камеру с опциональными крыльями». Одобрение получено, сбор идёт на Indiegogo (The Verge).

Verb — площадка, где люди продают свои данные с телефона напрямую ИИ-лабораториям. Ставите трекер, отмечаете категории для передачи, блокируете конкретных покупателей и сами назначаете цену. Ранняя версия платила пользователям около $50 в месяц за данные пролистывания ленты. Штука спорная, но показательная (разбор Axios).

Новости и тренды

GPT-5.6 Sol подешевел ещё раз: $4 и $20. OpenAI срезала цену для разработчиков — вход упал на 20%, выход на 33%. Кешированный вход стоит $0,40 за миллион токенов, скидка обещана минимум до 21 ноября. Подписки Pro и Plus не подешевели (Reuters, документация OpenAI).

Мы писали 18 августа про снижение вдвое, но оно касалось только собственных серверов OpenAI. Сейчас изменился общий прайс: было $5 и $30, стало $4 и $20. Что это значит на практике: рабочая сессия агента на 5 миллионов входных и миллион выходных токенов стоила $55, теперь $40. Выход подешевел сильнее, так что выигрывают долгие задачи с рассуждением и кодом.

ChatGPT добрался до iMessage. Приложение на Mac теперь читает, ищет, пишет и отправляет сообщения, а также пересказывает переписки. Работает с iMessage, SMS и RCS, доступно на всех тарифах. Плагин крутится локально через AppleScript и не строит индекс всех сообщений. Но ему нужен полный доступ к диску, а ещё права на контакты и автоматизацию (Business Standard).

Что это значит. Удобство очевидное: «найди, где мы договаривались про субботу» вместо получаса прокрутки. Цена — полный доступ к личной переписке у стороннего приложения. Если решите включать, начните с разового разрешения, а не с постоянного.

Anthropic втайне готовит запись встреч. Пока это находка в коде. Издание RuntimeWire разобрало пакет Claude Desktop версии 1.32885.1 и нашло внутри отключённую функцию с кодовым именем Parka. Она захватывает системный звук и микрофон и на ходу выдаёт расшифровку с разбивкой по спикерам. А дальше превращает встречу в задачи для агентов Claude (расследование).

Важно не перепутать: это не анонс. Anthropic ничего не подтверждала, публичные сборки жёстко выключают функцию, а нативная часть — пустая заглушка на 551 байт. Интересна сама схема задачи: заголовок, описание, владелец, полный промпт и тип исполнения. Типов три — cowork, code и manual. То есть инженерное обязательство с созвона уходит в Claude Code, документное — в Cowork, личное остаётся человеку. Запускаются ли действия сами или ждут одобрения, из кода понять нельзя.

Каждая третья новая страница в вебе пахнет ИИ. Pew Research прогнали почти полмиллиона англоязычных страниц из Common Crawl за пять лет через детектор. Признаки написания или существенной правки моделью нашлись у 35% страниц, опубликованных после запуска ChatGPT (TechCrunch).

Разброс по доменам говорит больше самой цифры. У коммерческих сайтов признаки встречаются примерно в десять раз чаще, чем у университетских и государственных, где показатель около процента. Это ровно тот фон, из-за которого читатели становятся ИИ-слепыми — смотрите разбор выше. Если пишете для коммерческого сайта, вы соревнуетесь за внимание с этими 35%.

Felony Bench: восемь инцидентов, где агент задел не себя, а чужих. Сатирический, но проверяемый трекер считает не побеги из песочницы, а реальный ущерб третьим лицам. Критерий жёсткий: «Escaping a sandbox alone does not constitute a counted incident» (felonybench.com).

График Felony Bench: у Anthropic 8 нарушений, у OpenAI 7, у Meta 1, у Google и Moonshot по нулю
График Felony Bench: у Anthropic 8 нарушений, у OpenAI 7, у Meta 1, у Google и Moonshot по нулю

Счёт в живой таблице — по восемь нарушений у Anthropic и OpenAI, одно у Meta. График на карточке сайта чуть отстаёт и показывает у OpenAI семь. Семь инцидентов из восьми случились на официальных проверках безопасности. Там был угон учётных данных GitHub, атака через Dependabot, рассылка с социальной инженерией и засветившийся вредоносный DNS-сервер.

Восьмой бытовой и оттого самый показательный: агент нашёл дыру в авторизации сайта фитнес-клуба и отменял чужие записи на занятия. Урок для тех, кто запускает агентов сам: изоляция должна быть на уровне сети и ключей, а не только песочницы.

Anthropic отдаёт кибервозможности Mythos 5 защитникам и кладёт $35 млн. Продукт Claude Security перешёл на самую сильную модель компании и работает в открытой бете для тарифа Enterprise. Отдельной доплаты нет, сканы считаются как обычный расход токенов. Плюс запущен фонд на $35 млн в кредитах для тех, кто латает уязвимости в открытом коде (блог Anthropic).

Что это значит. Прямого доступа к модели по-прежнему не дадут, и это осознанная политика: «if users can only receive specific outputs, such as a patch for a vulnerability or a security alert, that risk is much lower». Пользователь получает не модель, а конкретный артефакт — список найденных слабых мест с оценкой уверенности и предложенный патч. Каждый патч всё равно должен утвердить человек.

Спор о водяных знаках Claude: критика и защита. Механика такая. Модель и так выбирает следующее слово случайно из распределения. Водяной знак подменяет генератор случайности на секретный, и по длинному тексту можно посчитать совпадение. Zvi Mowshowitz защищает подход: «This has no practical impact on outputs. Humans cannot tell the difference, at all.» Google делает так два года, и на 20 миллионах случаев разницы в оценках не нашлось (разбор).

Автор Augmented Coding Weekly возражает по существу. Закон европейский, а применили глобально. Между полностью машинным текстом и человеческим с лёгкой правкой разницы не делают. И детектор закрытый (выпуск #58). Практический вывод для пишущих: знак исчезает пропорционально тому, сколько формулировок модели вы переписали. Правите сами по найденным моделью ошибкам — знака не будет.

Нью-Йорк впервые обошёл Кремниевую долину по числу техработников. По данным CBRE, рынок Нью-Йорка вырос до примерно 394 тысяч человек, прибавив 8% с 2022 года. Область залива Сан-Франциско сократилась на 6% до 376 тысяч на фоне увольнений в Meta, Block и Amazon (LA Times).

Нью-Йорк вытянул финансовый сектор, рано взявший ИИ в работу, и новые стартапы в Мидтауне. По общему рейтингу CBRE залив всё ещё первый, а Нью-Йорк четвёртый — так что о переезде столицы говорить рано.

Мелани Митчелл: мы неправильно думаем про ум машин. Исследовательница называет интеллект моделей «чужим» и предлагает мерить его не человеческими тестами, а методами, которыми психологи изучают младенцев и животных. Она формулирует шесть правил строгого эксперимента и предостерегает от очеловечивания (Quanta).

Что это значит на практике. Когда модель проваливает простую задачу и блестяще решает сложную, это не «глупость» и не «гениальность». Это другой способ обработки, и судить о нём по человеческой шкале — прямой путь к неверным ожиданиям от своего агента.

Waymo сделала свой чип для робо-такси. Подразделение Alphabet ушло от зависимости от Nvidia и AMD, чип уже стоит в новых машинах. Он обрабатывает данные сенсоров и гоняет модели, выдавая более 1000 TOPS — на уровне текущих автомобильных систем Nvidia. Производит TSMC по пятинанометровой технологии (The Decoder).

Что это значит. Вертикальная интеграция дошла до такси: цена поездки теперь зависит не от прайса Nvidia, а от собственного тиража чипа. Заодно Невада разрешила Waymo, Uber и Tesla брать за такие поездки деньги.

Anthropic смягчает правила хранения данных для крупных клиентов. Корпоративным клиентам разрешат держать обязательное тридцатидневное хранение на своей облачной инфраструктуре. Это ответ на прямое давление тех, кому не нравится, что переписка лежит у поставщика модели (Reuters).

Что это значит. Приватность из галочки в договоре превращается в товарную характеристику, и торговать ею начнут все.

Коротко. Nvidia заплатила Poolside $6 млрд за неисключительную лицензию и позвала к себе 109 сотрудников. Micron вкладывает $10 млрд в лабораторию памяти для ИИ в Бойсе. Google встроила агентов Antigravity в корпоративные подписки и выпустила расширения для VS Code, Visual Studio, JetBrains и Zed. Apple Music начнёт помечать треки, сделанные ИИ.

Дальше по мелочи. FDA одобрила робота, который сам находит вену и берёт кровь. OpenAI собрала команду Strategic Futures — изучать, как сохранить личную автономию, когда ИИ перекроит экономику. Сенаторы потребовали от TikTok объяснить эксперимент 2021 года: защитную функцию против «пузырей» тогда скрыли от контрольной группы ради замера вовлечённости.

И напоследок. Harvey дообучила Kimi K3 под долгую юридическую работу. Вывод там не про объём текста: модель профессионального сервиса растёт, когда учится рабочему процессу.

Откомментируйте первым 👇

😎

Автор поста открыл его для большого интернета, но комментирование и движухи доступны только участникам Клуба

Что вообще здесь происходит?


Войти  или  Вступить в Клуб