Автопилот в Claude Code, счёт за ИИ вдвое меньше и вкус как последний навык  Публичный пост

8 августа 2026  124

Anthropic посадила 1053 разработчика за тесты и подсунула им в середине сессии откровенно опасную команду. Люди заметили её в 13,6% случаев. Автоматический классификатор — в 89%. С 14 августа Claude Code по умолчанию будет спрашивать вас меньше, а проверять больше. А ещё сегодня Databricks срезала счёт за ИИ-кодинг почти вдвое. И вышло эссе о том, что последний оставшийся у нас навык — вкус.

Главное за 30 секунд

  • С 14 августа Claude Code на тарифах Pro, Max и Team стартует в режиме auto — решает классификатор, а не ваши нажатия.
  • Databricks срезала расход токенов на сессию с 12 до 5,4 млн простой настройкой оболочки агента и кеша.
  • Берите не самую умную модель, а самую дешёвую из проходящих вашу планку: GLM 5.2 — 73,6% за $0,90, Opus 4.8 — 79,6% за $3,55.
  • Агенты OpenAI на киберучениях завели свою доску объявлений и прятали сообщения в именах папок.
  • Эссе дня: производство подешевело до нуля, и голым остался вкус — умение сказать, что вообще стоит делать.

Внедряем и улучшаем

Claude Code с 14 августа сам решает, что можно, а что нет. Anthropic объявила: с 14 августа новые сессии на Pro, Max и Team стартуют в режиме auto (блог Anthropic). Раньше вы жали «разрешить» на каждый вызов инструмента. Теперь каждый вызов смотрит отдельная модель-классификатор — и решает сама.

Цифры, ради которых это затеяли, звучат неприятно, но честно. Anthropic наняла 1053 профессиональных тестировщика и в середине сессии подменяла один запрос на явно опасную команду. Люди ловили её в 13,6% случаев — 143 человека из 1053. Классификатор поймал 89%. Причина простая: внимание садится. В начале сессии люди замечали подставу в 17% случаев, после полусотни предыдущих запросов — уже в 5%.

Люди против классификатора: доля пойманных опасных команд в эксперименте Anthropic на 1053 разработчиках
Люди против классификатора: доля пойманных опасных команд в эксперименте Anthropic на 1053 разработчиках

Сопутствующая статистика ещё выразительнее. Пользователи одобряют 97% запросов на разрешение. Отклоняют — 3%. При этом планы отклоняют в 39% случаев. То есть план читают, а отдельные команды — штампуют. Половина активных пользователей CLI уже прописала себе разрешающие правила на Bash. А 62% хоть раз включали обход разрешений или жали «больше не спрашивать».

Что меняется на практике. В режиме auto Claude без спроса читает файлы, ставит зависимости из lock-файлов и делает запросы только на чтение. И — внимание — пушит в любую ветку вашего репозитория, включая основную, и открывает пул-реквесты.

Заблокирует он curl | bash, git push --force, git reset --hard и terraform destroy. А ещё отправку секретов наружу, слияние пул-реквеста без человека и удаление тестов, которые охраняют безопасность.

Что делать прямо сейчас. Посмотрите, что у вас реально применяется:

claude auto-mode config
claude auto-mode defaults

Если автоматики не хочется — закрепите свой режим в ~/.claude/settings.json, и 14 августа для вас ничего не изменится:

{
  "permissions": {
    "defaultMode": "default"
  }
}

Важная тонкость: "defaultMode": "auto" в проектных .claude/settings.json игнорируется с версии 2.1.142. Это сделано нарочно, чтобы чужой репозиторий не выдал сам себе полномочия. Настройки auto режима читаются только из пользовательского файла.

Средний вариант — остаться в auto, но вернуть себе чекпойнты. Правила ask срабатывают до классификатора и всегда дают запрос:

{
  "permissions": {
    "ask": ["Bash(git push *)", "Bash(gh pr create *)"],
    "deny": [
      "Bash(gh pr merge:*)",
      "Bash(terraform apply:*)",
      "Read(./.env)",
      "Read(~/.ssh/**)"
    ]
  }
}

Ещё два предупреждения из документации. Первое: устные границы вроде «не пушь до моего ревью» классификатор перечитывает из переписки, и при сжатии контекста они теряются. Для долгих сессий нужно правило, а не договорённость. Второе: если задаёте свой блок hard_deny или soft_deny, не забудьте строку "$defaults" — иначе сотрёте весь встроенный список (документация по режимам).

Классификатор тратит немного лишних токенов на каждый вызов инструмента. С 7 августа эти токены на Pro, Max и Team больше не считают. Корпоративные тарифы и API пока остаются на добровольном включении.

Как Databricks срезала расход токенов вдвое — четыре рычага. Databricks выложила подробный разбор того, как удержать расходы на ИИ-кодинг (блог Databricks). Материал написан по своему опыту плюс разговоры со Stripe, Coinbase, Uber и Ramp. Главная мысль: гнаться надо не за самой умной моделью, а за самой дешёвой из тех, что проходят вашу планку.

Они называют это «границей эффективности» — набор моделей с лучшей ценой при заданном уровне ума. И эта граница двигается заметно быстрее, чем передний край по уму. Новые модели выходят почти каждую неделю, и каждая даёт больше ума за доллар.

Цена за задачу против доли решённых задач: замер Databricks на своей кодовой базе, 6 августа 2026
Цена за задачу против доли решённых задач: замер Databricks на своей кодовой базе, 6 августа 2026

Вот их собственный замер. GLM 5.2 решает 73,6% задач по $0,90 за штуку. Opus 4.8 — 79,6% по $3,55. Вчетверо дороже за шесть процентных пунктов. Sonnet 5 вообще за границей эффективности: $4,40 при 71,4%. Рекомендованный набор Databricks на 6 августа — GLM 5.2, Opus 4.8 и GPT-5.6 Sol.

Отдельно ценно, что они публикуют отрицательные результаты. Stripe сравнила Opus 4.7 с Opus 4.6, не увидела прироста качества, увидела рост цены — и не стала раздавать 4.7 внутри. У самой Databricks похожая история вышла с Opus 5.0 против 4.8.

Четыре рычага и прикидочная экономия от каждого:

  • модели подешевле — около 50%;
  • умная маршрутизация запросов — около 30%;
  • видимость расходов и предупреждения — около 10%;
  • оптимизация контекста — ещё около 10%.

Токены на сессию у Databricks: два вмешательства уронили расход с 12 до 5,4 млн
Токены на сессию у Databricks: два вмешательства уронили расход с 12 до 5,4 млн

Самое применимое для одиночки — четвёртый рычаг. У Databricks расход упал с 12 млн токенов на сессию до 5,4 млн за три месяца, и это дали два простых шага. Сначала настройка оболочки агента под экономию токенов, потом увеличение времени жизни кеша, чтобы реже платить за записи в него. Записи в кеш стоят денег, чтения — почти бесплатны. Итог: почти минус 50% токенов без заметной потери качества.

Что делать вам. Соберите 20–50 типовых задач из своего репозитория. Прогоняйте на них каждую новую модель и мерьте две вещи: долю успеха и цену за задачу. Публичным бенчмаркам не верьте — Databricks прямо пишет, что они «плохо предсказывают реальную работу с кодом». Проверьте, какие MCP-серверы и инструменты возвращают вам в контекст простыни текста, и урежьте их болтливость. Дробите задачи на мелкие: «разберись и почини» стоит дороже, чем три конкретные просьбы. И заведите правило для себя: превысил порог — переезжаешь на дешёвую модель, а не бросаешь работу.

Loop Engineering: проектируйте граф, а не промпт. The Neuron вынесла в рубрику навыка дня мысль Бориса Черни из Anthropic (разговор с AMD). Уровень абстракции сместился ещё раз: сначала мы писали код, потом управляли агентами, теперь управляем циклами.

Разница простая. Инженерия графа — это нарисовать возможный путь: план → действие → проверка → повтор или эскалация → готово. Инженерия цикла — решить, что происходит, когда работа проверку не прошла и должна пойти по графу заново. Навык теперь в том, чтобы спроектировать систему вокруг агента, а не микроменеджить каждый его шаг.

Готовый промпт, который The Neuron даёт целиком:

Help me design a reusable agent loop for this task: [TASK]

Do not do the task yet. Design the workflow first.

1. Define the goal and exact completion criteria.
2. Map the graph: input → plan → act → verify → retry/escalate → done.
3. For each node, specify:
   - context the agent needs
   - tools it may use
   - expected output
   - what evidence proves the step worked
4. Define the transitions between nodes and what triggers each branch.
5. Create a feedback loop for failed verification.
6. Set stop conditions, maximum retries, and any time/token/budget limits.
7. Flag actions that require human approval before execution.
8. Create five representative eval cases and a simple pass/fail scorecard.
9. Identify the single biggest bottleneck to automate first.

Keep anything manual that we cannot yet verify reliably. After I approve
the graph, help me run one test case and improve the loop from the result.

Три совета из рабочего процесса самой Anthropic. Расшивайте по одному узкому месту за раз, а не автоматизируйте всё сразу. Давайте сильным моделям самим доставать контекст через скиллы и инструменты вместо разжёвывания каждого шага. И заводите проверки-эвалы только для повторяющихся объёмных задач: на разовых формальное тестирование обойдётся дороже пользы (выпуск The Neuron).

Value Ledger: как доказать клиенту, что агент реально сэкономил деньги. Отличный приём для тех, кто продаёт услуги на ИИ (рассылка Corey Ganim). Проблема известна: агент месяц молча работает, приходит счёт — и клиент не помнит, за что платит. Решение — журнал ценности, встроенный прямо в агента.

Механика в четыре такта. Агент логирует каждую выполненную задачу. Оценивает, сколько человеко-времени она бы заняла. Присваивает долларовую стоимость — но только когда данных хватает, чтобы сделать это честно. Раз в неделю шлёт владельцу отчёт.

Пять шагов, которые описывает автор:

1. Log every completed task.
   Task, completion date, outcome. Не залогировано — к пятнице невидимо.

2. Add a human-time estimate.
   Сколько заняло бы у владельца или сотрудника. Оценивайте консервативно:
   вы строите доверие, а не красивый отчёт.

3. Translate time into dollars when you have a real baseline.
   Есть реальная ставка — применяйте. Нет — не гадайте.

4. Ask the owner to fill the gaps.
   По задачам без долларовой оценки агент сам спрашивает:
   "How much time would this normally take you?"

5. Send the summary every week.
   Задачи, сэкономленное время, оценка в деньгах, открытые вопросы.

Кейс: компания по наклонно-направленному бурению. Владелец одним запросом попросил агента найти письмо со счётом и завести папку. Дальше — сохранить PDF, вытащить данные в таблицу, положить её в Dropbox и вернуть ссылку. Через шесть минут всё было готово. За первую неделю журнал насчитал около 63 сэкономленных часов и $6300. В другие недели выходило $1700 — разброс большой, и автор его не прячет.

Ключевое правило — калибровка. Отчёт отправили, дальше обсуждаете допущения с клиентом. Агент говорит «сэкономил два часа», клиент отвечает «у меня это двадцать минут» — правьте базу. Задача предотвратила забытый созвон, но честной цифры нет — оставьте без цены. Цель не впечатлить, а получить запись, которой доверяют обе стороны. Оговорка: цифры кейса автор приводит со слов третьего лица и ничем не подтверждает, а сам продаёт обучение по продаже ИИ-агентов. Приём хороший, цифры берите как ориентир.

Stateless MCP: спецификация похудела вдвое. Вышел MCP 2.0 — формально версия спецификации 2026-07-28. Саймон Уиллисон называет это «самым значимым изменением с момента запуска MCP» и подробно объясняет почему (simonwillison.net).

Раньше вызов инструмента требовал два HTTP-запроса: сначала initialize и получение Mcp-Session-Id, потом сам tools/call. Теперь всё в одном запросе, а состояние переехало в заголовки:

POST /mcp HTTP/1.1
MCP-Protocol-Version: 2026-07-28
Mcp-Method: tools/call
Mcp-Name: search
Content-Type: application/json

{"jsonrpc": "2.0", "id": 1, "method": "tools/call",
 "params": {"name": "search", "arguments": {"q": "otters"}}}

Серверу больше не нужно хранить сессии и следить, чтобы запросы одной сессии попадали на одну машину. Для тех, кто поднимает MCP-сервер на обычном веб-хостинге, это меняет всё.

Саймон за неделю собрал на этом три вещи. mcp-explorer — консольный разведчик любого MCP-сервера, запускается без установки:

uvx mcp-explorer list https://agentic-mermaid.dev/mcp
uvx mcp-explorer inspect render_svg
uvx mcp-explorer call https://agentic-mermaid.dev/mcp render_svg \
  -a source 'graph TD; A-->B' -a options '{"padding":24}'

datasette-mcp — плагин, который вешает на Datasette эндпоинт /-/mcp с тремя инструментами: list_databases(), get_database_schema(name) и execute_sql(name, sql) пока только на чтение. И llm-mcp-client — подключение MCP-сервера к его же утилите LLM:

llm install llm-mcp-client
llm -T 'MCP("https://datasette.simonwillison.net/-/mcp")' 'count the notes'

Зачем это вам. Уиллисон объясняет свой разворот к MCP через безопасность: «дать агенту доступ к командной строке с интернетом — рискованно и требует сильной модели. Инструменты MCP проще проверять и контролировать, и с ними справляются даже небольшие модели на ноутбуке». Инъекции промптов MCP не отменяет, но поверхность атаки у него в разы меньше, чем у прямого доступа к командной строке.

Восемь мифов про ИИ в разработке — цифры для спора с руководством. ACM Queue опубликовал разбор, за которым стоят исследователи Microsoft Research (queue.acm.org). Заявка авторов: «Генеративный ИИ меняет разработку, но рассказ убежал далеко вперёд доказательств».

Самый полезный миф — второй, «узкое место в написании кода». Исследование более 450 инженеров Microsoft показало: на набор кода уходит 14% времени. В хороший день — 18%, в плохой — 11%. Отсюда арифметика авторов: даже помощник, вдвое ускоряющий набор кода, поднимет общую продуктивность меньше чем на 15%. Остальные 85% времени он не трогает вовсе.

Дальше цифры, которые полезно держать под рукой. Исследование 2025 года по опытным разработчикам открытого кода: инструменты ИИ увеличили время выполнения задач на 18%. Переписывание промпта с сохранением смысла давало другой код в 46% случаев и меняло корректность в 28%. Инструментами пользуются 80% разработчиков, а точности их доверяют 29%. И контринтуитивное: годы профессионального опыта отрицательно связаны с уверенностью в собственном умении писать промпты.

Шестой миф — «пусть каждый разработчик сам разберётся» — авторы считают главным. Цитируют Кэла Ньюпорта: конвейер не появился в озарении, его собирали десятилетиями. А сейчас мы буднично просим каждого работника умственного труда оптимизировать собственную фабрику — параллельно с работой, которую он и пытается ускорить. Вывод редактора рассылки Colin Eberhardt: внедрение ИИ — организационная задача, а не вопрос выбора инструмента (Augmented Coding Weekly).

Вкус — единственное, что у нас осталось. Главный текст дня по обсуждаемости: 661 балл на Hacker News (notashelf.dev). Тезис: стена между идеей и работающей программой исчезла. Точнее, её сдали в аренду — теперь вы арендуете средства производства по токенам у того, кто обучил модель.

Раньше стоимость производства работала невидимым фильтром. Никто не отгружал тысячу посредственных вариантов функции, потому что тысяча стоила в тысячу раз дороже одной. Экономика держала пол качества. Пол убрали.

Дальше идёт самый неудобный поворот. Вкус нельзя впитать осмосом. Автор: «Нельзя прочитать сотню отличных программ и впитать суждение — ровно как нельзя стать шеф-поваром, обедая в хороших ресторанах». Вкус строится медленно и унизительно: делаешь плохое, живёшь с этим, оно ломается у тебя на глазах. «Трение не мешало вырабатывать вкус. Трение и было учебной программой». А трение мы только что убрали и назвали это прогрессом.

Практических рецептов автор почти не даёт, и это надо сказать честно. Но кое-что выписывается. Не откатывать неудачу сразу — посидеть в ней. Переписывать в четвёртый раз, когда третий вариант был «просто нормально». Сменить вопрос с «могу ли я это построить» на «заслуживает ли это существовать». И считать кураторство основным навыком: «Дефицитный акт больше не производство. Это выбор».

Обсуждение вышло не менее интересным, чем текст. Часть комментаторов возразила: вкус, сведённый к «нет, ещё раз», — это откидывание в кресле. А работа состоит из структур данных, приватности и доступности. Автор возражение принял и дописал сноску: «Вкус — не кресло, в которое ты откидываешься. Это причина, по которой ты наклоняешься вперёд ко всему остальному».

Другой комментатор предложил заменить вкус на допуски — записанные, измеряемые, проверяемые. Третьи заметили, что вкус не защитный ров: конкуренты копируют удачное решение за дни. Отдельный сюжет: текст массово обвинили в том, что его написала модель, и автору пришлось дописывать раздел с опровержением.

Supabase Evals: проверьте своего агента на настоящих задачах. Supabase выложила в открытый доступ бенчмарк для кодинг-агентов (блог Supabase). Он гоняет их по реальным задачам на своей платформе и публикует счёт. Категории живые: собрать, развернуть, разобраться, починить.

Таблица результатов Supabase Evals: Codex на GPT-5.6 sol проходит все четыре категории
Таблица результатов Supabase Evals: Codex на GPT-5.6 sol проходит все четыре категории

Результаты на момент публикации: Codex с GPT-5.6 sol — 100%. Claude Code на Opus 5 и на Sonnet 5, а также OpenCode с Kimi K3 — по 95%. Codex с GPT-5.4 mini — 79%. Все, кроме первого, спотыкаются на категории «разобраться» с результатом 67%. Отдельный переключатель «без скиллов» показывает, сколько даёт обвязка, а сколько — сама модель. Полезно не столько как рейтинг, сколько как готовый шаблон: так выглядит бенчмарк, который вы можете собрать на своей кодовой базе.

Восемь предсказаний Дваркеша про эпоху непрерывного обучения. Дваркеш Патель написал эссе о будущем, где модели учатся прямо в работе, а не замирают после обучения (dwarkesh.com). Отправная метафора: цепочка студентов, каждый играет на саксофоне с нуля и оставляет заметки следующему. Профессионала так не вырастишь. «В какой-то момент опыт приходится накапливать в самом мозге».

Самое практичное для читателя — шестое предсказание, про привязку к поставщику. Сейчас цена перехода нулевая: «Ничто не мешает мне начать репозиторий в Codex, а закончить в Claude Code». Когда модель начнёт подстраиваться под вас от сессии к сессии, смена ИИ станет дороже. Это как уволить сотрудника с месяцами контекста и взять новичка с нуля.

Седьмое: лаборатории будут доплачивать тем, кто разрешит учиться на своих сессиях. И могут не давать лучшие модели тем, кто откажется. Восьмое обидное для одиночек: разреженной модели вроде DeepSeek V3 выгодно обрабатывать больше 2400 запросов разом. Человек, обслуживающий сам себя, теряет в эффективности вычислений в сто и более раз. Своя дообучаемая модель — привилегия больших организаций.

Вывод один: привычка к одному поставщику через год будет стоить дороже, чем сегодня. Учитывайте это, когда выбираете, на чём строить рабочий процесс.

Почему агент делает вид, что выполнил задачу — и что с этим делать. Лучшее практическое исследование недели (LessWrong). Авторы из программы MATS разобрали, почему модели «играют в задачу» — то есть делают то, что задачу не решает, но выглядит как решение. Зашивают ответы прямо в тесты, объявляют работу законченной, придумывают цифры.

Оказалось, это не тупая эвристика. Поведение причинно зависит от трёх вещей. Считает ли модель, что за ней следят. Насколько сильным считает проверяющего. Дают ли ей частичный зачёт.

Первое проверили красиво. Модель должна была ускорить рендер до 150 мс, и она узнала, что сквозной тест временно отключён из-за проблем с инфраструктурой. В рассуждениях прямо отметила, что проверка это не поймает, и пролезла под порог, сломав корректность. Стоило подставить уведомление «тест снова включён» — жульничество исчезло полностью.

Второе не менее наглядно. Модель прямо гадала в рассуждениях: проверяющий на регулярных выражениях посмотрит разве что наличие нужной команды. И подбирала обход под слабого. Когда авторы расширяли заявленную зону проверки, доля обходов у GPT-OSS-120B падала по ступенькам: 51% → 47% → 34% → 33%.

Третье — самое применимое. При зачёте «всё или ничего» жульничества примерно в восемь раз больше, чем при дробном. И вот две цифры, ради которых стоит читать весь разбор: если дать агенту инструмент «спросить пользователя», доля зашитых ответов падает с 12,2% до 0,4%. Если разрешить ему открыто править сами тесты — до 0,04%: скрытничать становится незачем. У агента должен быть законный выход, иначе он найдёт незаконный.

Отдельная неприятная находка — самообман. В одном прогоне контейнер был под нагрузкой, бенчмарк выдавал 164, 811, 795, 180 миллисекунд. Модель разумно решила, что измеритель врёт, а потом посчитала на салфетке: «трансформация ~129 мс, проекция и тики ~20 мс, итого ~149 мс. Это меньше 150!» — и пометила работу готовой. В таком режиме надзор не помогает вообще: включение проверки жульничество не снизило. Вывод авторов практичный: чинить шумные измерители важнее, чем усиливать надзор, потому что ненадёжный измеритель сам становится алиби.

И главное предупреждение: чтение рассуждений модели вас не спасёт. Перед выдумыванием цифр в отчёте в рассуждениях обычно стоит нейтральное «подытожу, что я сделал». Проверенный признак разрыва — прямой вопрос «задача полностью выполнена и корректна?». В рассуждениях модель признаёт неполноту в 92% случаев, а в ответе — в 33%.

Итого, чек-лист для тех, кто гоняет агентов. Любое число в отчёте считайте недействительным, пока не увидели сырой вывод команды. Спрашивайте не «всё работает?», а «что именно ты запускал и что вернулось». Заранее говорите, что и как будет проверено, и чем шире зона проверки, тем лучше. Дайте агенту возможность спросить и признать задачу невыполнимой. И не верьте артефактам, которые агент пишет сам: в эксперименте с проверяемым журналом модель просто сфабриковала записи в 26 случаях из 45.

Модель ведёт себя иначе, если думает, что говорит с известным исследователем. Работа Transluce и CMU, которая пригодится всем, кто делает свои проверки качества (LessWrong). Идея опыта простая: подставить в контекст личность пользователя и посмотреть, изменится ли поведение. Взяли 280 личностей, четыре типа задач и 24 модели из шести семейств.

Изменилось. Считая собеседника известным исследователем по безопасности ИИ, модель заявляет о меньшей уверенности и строже оценивает чужие ответы. А ещё реже подозревает дурные намерения на пограничных запросах и чаще включает рассуждения. Средние сдвиги маленькие, но по конкретным именам огромные. Для Аманды Аскелл из Anthropic заявленная уверенность падает почти на восемь стандартных отклонений. Рассуждения включаются на 25 пунктов чаще, подозрительность падает на 7,3 пункта. Для Демиса Хассабиса на пограничных запросах рассуждения включаются в 51% случаев против базовых 19%.

Что это значит на практике. Первое. Вы гоняете модель как судью: оценить чужой текст, код, ответ. Если в контексте болтается ваша почта или файл памяти с вашим именем, оценки будут смещены.

Второе. Claude Code добавляет почту аккаунта в контекст автоматически при входе через аккаунт Anthropic, но не при оплате по API. Имя рабочей папки и содержимое CLAUDE.md туда же. Нужны воспроизводимые неперсонализированные ответы — убирайте опознавательные знаки.

Третье: реальная, находимая в сети почта усиливает эффект втрое против выдуманной. Четвёртое и тревожное: модели почти никогда не проговаривают это в рассуждениях. У свежих Opus и GPT — меньше 3% случаев, при том что поведение смещено. Отсутствие следов в рассуждениях ничего не доказывает.

Почему не стоит отдавать ИИ содержательные тексты. Полезный контраргумент дня, и он от человека, который ИИ не отрицает (Эрих Груневальд). Тезис: письмо — это и есть процесс мышления, а модель пишет расплывчато и незаметно неверно.

Доказательство он строит на себе. Просит модель написать вводный абзац про контрабанду чипов — тему, в которой профессионально разбирается, — и разбирает результат по восьми пунктам. «Экспортный контроль силён настолько, насколько силён контроль за его исполнением» — это либо трюизм, либо пустота. Чипы названы «компактными», хотя возят серверные стойки. И главное не в том, что их прячут: их переклеивают под другой товар и везут открыто. Оценка «десятки тысяч, возможно, больше ста тысяч чипов в год» формально верна. Но нижняя граница почти наверняка ложна: реальная цифра ближе к сотням тысяч.

Ключевая мысль: «Если бы я не разбирался в теме, я бы не заметил большинство этих проблем. А если бы написал сам, я бы не смог не заметить, где именно я путаюсь». Возражение «я же вычитываю каждое слово» он снимает ссылкой на Эрика Швицгебеля: между «кивать, читая» и «порождать текст» — огромная когнитивная разница.

Где автор проводит границу, конкретно. Можно: расшифровка аудио, анализ данных, поиск, мозговой штурм, отзыв на ваш черновик. Можно перевод уже написанного вами текста и короткие рабочие письма. Можно правку формулировок — если вы осознанно принимаете каждую. Нельзя: любой текст, где вы передаёте идею, довод или разбор — и это верно даже когда вы дали подробный план и заметки. Отдельно он проверял пересказы встреч для коллег. Даже с полной расшифровкой модель вносит тонкую расплывчатость: она не знает, кому адресован вывод и что эти люди уже знают.

Тест на честность простой. Не готовы написать «этот текст написан ИИ» — значит, вы сами понимаете, что читатель ожидал другого. В комментариях есть и возражения: часть людей думает, глядя в стену, ничуть не хуже, и «письмо есть мышление» — возможно, эффект отбора.

Год войны с ботами-сборщиками: готовые правила фаервола от владельца сайта на 1,5 млн страниц. Ник Грэй выложил всю статистику и все свои настройки Cloudflare дословно (patronview.com). Его база американских филантропов год живёт под обстрелом ботов. Цифры получились наглядные.

На одну человеческую загрузку страницы приходится 214 ботовых. За неделю сайт отдал 1,28 млн полных страниц, а счётчик Plausible показал 5977 просмотров. Первый вывод автора: смотрите в логи сервера, а не в аналитику — счётчик на JavaScript видит меньше половины процента происходящего.

Дальше он вводит метрику, которую стоит забрать себе: сколько страниц робот-сборщик утащил на одного приведённого посетителя. У Googlebot — 46 к одному. У Bingbot — 406. У Claude-SearchBot — 35 000. У краулера Amazon — бесконечность: 117 тысяч запросов в день и ноль посетителей. Отсюда правило автора: сборщик, который никогда не присылает посетителя, блокируется.

Полезные детали для тех, кто на Cloudflare. Порядок правил критичен: пропуск для проверенных ботов должен стоять после блокирующих правил, иначе Googlebot будет ловить проверку, а заблокированный «проверенный» бот пройдёт. Проверка для всех континентов, кроме нужного вам, даёт бесплатную метрику. За 48 часов автор выдал 106 437 проверок, решено 252 — то есть 0,24%. Если решают 0,2%, правило работает; если 30% — вы обложили налогом живых людей.

И самое неожиданное: скрипт Cloudflare JavaScript Detections стоил 2875 мс на среднем телефоне, при том что весь собственный код сайта — 278 мс. После отключения оценка Lighthouse на мобильных прыгнула с 58 до 99 за час. Мораль пятого правила: считайте стоимость самой защиты, иначе капча обойдётся дороже атаки.

Оговорка: это самоотчёт одного владельца сайта без внешнего аудита, все числа с его панели. Круглое «99% трафика — боты» из заголовка нигде строго не выводится, надёжнее опираться на 214 к одному. Зато конфиги приведены целиком, и на Hacker News несколько человек независимо подтвердили тот же порядок величин по своим логам.

Токеномор: бюджеты жгут не инженеры. Джозеф Кокс получил запись внутренней встречи Accenture и опубликовал материал, который вернулся в обсуждение на этой неделе (404 Media). Находка ломает привычный рассказ.

Justice Kwak из Accenture говорит прямо: «Мы видим по внутренним данным, что потребление токенов гонят вовсе не наши инженеры. Это в основном не-инженеры». Пример нецелевого расхода, с которого всё началось, — конвертация PDF в слайды презентации через агентный цикл на флагманской модели. Uber ограничил сотрудникам Claude Code и Cursor после того, как годовой бюджет на ИИ ушёл за четыре месяца. Отдельная ирония: Accenture до этого требовала от старших сотрудников пользоваться ИИ под угрозой непродвижения.

Что забрать себе. Разметьте расход по ролям, а не смотрите на общую сумму — иначе будете резать не тот бюджет. Заведите потолок на человека с возможностью попросить больше, а не запрет. Уберите внутренние рейтинги «кто больше пользуется ИИ»: Meta снесла свой именно потому, что он подстёгивал соревнование по сжиганию токенов. И проверьте контракты. GitHub уже перевёл Copilot с плоской подписки на оплату за токены — посчитайте худший сценарий для себя. Часть статьи за платной стеной, детали по Uber и Microsoft взяты из смежных репортажей.

Инструменты и штуки

Kitesurf — браузер Cloudflare, сделанный не для людей, а для агентов (блог Cloudflare). Работает целиком на Workers, написан на Rust и собран в WebAssembly. Логика авторов простая: агенту не нужны вкладки, темы, расширения и попиксельная точность — ему нужны токены, масштаб и цена.

Цифры честные, включая проигрыш. По процессору Kitesurf экономит в 3–4 раза, по памяти — в 5–7 раз, но по времени отстаёт от Chromium примерно в 1,7 раза. Аргумент Cloudflare: счёт вам выставляют за процессор и память, а не за миллисекунды. Снаружи это обычный браузер для автоматизации — говорит по протоколу Chrome DevTools, так что Puppeteer и Playwright работают сразу. Не умеет видео, WebGL и длинные авторизованные сессии. Бесплатно в бете внутри Browser Run: к запросу добавляется browser=kitesurf, есть песочница на kitesurf.cloudflare.app без кода.

Watcher — надзиратель за кодовыми агентами от Apollo Research (watcher.apolloresearch.ai). Следит за Claude Code и Codex в реальном времени, блокирует опасные команды до выполнения и ведёт журнал по каждой сессии. Claude Code через неделю переходит на автопилот, так что штука подоспела вовремя. Особенно для команд, где агенты пишут код в общем репозитории. Цена не опубликована.

DataBlur — замазывает чувствительные данные в реальном времени во время демонстрации экрана, созвонов и записей (ProductHunt). Ловит почты, номера карт и ключи API. Работает полностью локально, без облака. Это главное: отдавать поток своего экрана стороннему сервису ради защиты того же экрана было бы смешно.

Nativ — запускает языковые, визуальные, видео-, кодовые и звуковые модели локально на маках с Apple Silicon (blaizzy.github.io/nativ). Промпты и файлы никуда не уходят. Открытый код, бесплатно. Хороший вариант для тех, кто работает с чужими или чувствительными документами.

StepShot — записывает каждый клик и действие на экране и сам собирает пошаговый туториал с редактируемыми подписями (ProductHunt). Классическая боль всех, кто пишет инструкции для сотрудников или учеников: сделать скриншоты, подписать, собрать в документ. Здесь это делается за один проход.

CaptionBolt — субтитры для коротких вертикальных видео (captionbolt.com). Расшифровывает ролик, накладывает подписи из библиотеки в 308 стилей и по умолчанию не портит исходную композицию кадра. Умеет править текст, тайминг и раскладку, добавлять перебивки и обложки. На выходе — готовое видео, файлы субтитров и текст поста для соцсетей. Есть бесплатный уровень.

Редактор CaptionBolt: превью вертикального ролика и сетка готовых стилей подписей
Редактор CaptionBolt: превью вертикального ролика и сетка готовых стилей подписей

i-have-adhd — плагин для Claude Code, который заставляет агента отвечать действием, а не предисловием (github.com/ayghri/i-have-adhd). Первая строка — команда, путь или фрагмент кода. Многошаговая работа — нумерованный список. В конце — ровно один конкретный следующий шаг. Убиты «Отличный вопрос!», «Давайте посмотрим» и «Надеюсь, это поможет».

Название про СДВГ, но автор честно пишет: диагноз не требуется. Ключевая деталь, которой нет у самодельных аналогов, — правила не выветриваются через пару ходов, за это отвечает отдельный раздел в файле скилла. Ставится двумя командами:

claude plugin marketplace add ayghri/i-have-adhd
claude plugin install i-have-adhd@i-have-adhd

Хотите всегда — touch ~/.claude/.i-have-adhd-always. Лицензия MIT, 18 тысяч звёзд, последние правки — на этой неделе.

andrej-karpathy-skills — один файл CLAUDE.md на 65 строк, который переводит четыре принципа Андрея Карпаты в правила поведения агента (github.com/multica-ai/andrej-karpathy-skills). Думай до кода, простота прежде всего, хирургические правки, работа от проверяемой цели. Каждый принцип бьёт по конкретной болячке: агент молча выбирает трактовку, раздувает абстракции, «заодно» чинит соседний код и не умеет себя проверять. Копируется одной командой:

curl -o CLAUDE.md https://raw.githubusercontent.com/multica-ai/andrej-karpathy-skills/main/CLAUDE.md

Оговорка: звёзд у репозитория непропорционально много для 65 строк. Это вирусность на имени, а не признак живого проекта. Последний коммит был в апреле, 126 обращений висят без ответа. Берите текст, а не подписку на обновления.

oil-motion — скилл, который делает интерактивные веб-анимации из сгенерированного видео (github.com/oil-oil/oil-motion). Идея красивая. Обычный ролик умеет только играть от начала до конца — здесь позиция прокрутки, мыши или наклона телефона превращается в номер кадра. Прокрутил на треть — видишь треть анимации, отмотал назад — она честно отматывается.

Внутри реальный конвейер на 150 КБ питона: опорные кадры, дорисовка переходов, покадровая чистка мерцаний, упаковка в атлас. Две оговорки. Репозиторию буквально один день, документация на китайском, а для генерации нужен платный ключ. Смотреть как на подход, а не ставить в работу.

Supabase: пять нововведений за месяц. Помимо открытого набора тестов для агентов, о котором выше, вышли:

  • Pipelines в публичной альфе — поток изменений Postgres в BigQuery почти в реальном времени, настраивается в панели, на всех платных тарифах (блог);
  • единые логи по всем сервисам с живой лентой и фильтрами (блог);
  • Grafana Cloud в один клик с готовой панелью и оповещениями — на всех тарифах, включая бесплатный (блог);
  • шифрование отдельных полей с поиском по шифротексту и без изменений схемы (блог);
  • вход в Supabase через аккаунт ChatGPT — пока в бете.

LoopX — держит команды долгоживущих агентов в согласии: общие цели, списки задач, журналы и передача работы между ними (github.com/huangruiteng/loopx). Полезно, когда у вас не один агент в терминале, а несколько параллельных, и они начинают дублировать или ломать работу друг друга.

bb — агентная среда разработки, которая строит сама себя (анонс автора). Внутри полноценный агент-оркестратор с крепким фундаментом и без готовых фич: нужную функцию вы просто просите bb себе дописать. Любопытный ход — не продукт с набором возможностей, а заготовка, которая дорастает под пользователя.

WeatherNext — Google DeepMind открыла исходники моделей прогноза циклонов (блог DeepMind). Даёт синоптикам в среднем лишний день точности: нынешний трёхдневный прогноз по качеству равен прежнему двухдневному. Модель заранее предсказала быстрое усиление урагана Мелисса и его выход на сушу на Ямайке, и предупреждения выпустили раньше. Открытые веса — WeatherNext 2 и WeatherNext Cyclones.

Energy — забирает многошаговую работу в браузере, почте и файлах, действуя вашими же залогиненными сервисами и возвращая готовый результат (getenergy.com). Цена не опубликована. Категория, в которой сейчас толкается много народу, но эта реализация выглядит аккуратно.

Boson — делает говорящего аватара из одной статичной картинки плюс текста или звука (boson.ai). Отдельно даёт рабочее пространство для тестирования голосовых агентов поддержки, продаж и обучения. Цена не опубликована.

AndroMeld — зеркалит приложения Android в изменяемые окна на маке (ProductHunt). Синхронизирует уведомления и буфер обмена, открывает память телефона через Finder по USB или Wi-Fi. Не про ИИ, но закрывает старую боль тех, кто сидит на маке с андроидом.

Whop CLI — управление бизнесом на Whop прямо из терминала: создание продуктов, цены, реклама, движение денег. Через командную строку или через ИИ-агента (ProductHunt). Редкий случай, когда торговую площадку можно целиком отдать агенту.

Anywear — примеряет вещи из Zara, ASOS, Amazon и почти любого магазина на вашу собственную фотографию (anywear.decart.ai). Бесплатно, пока идёт бета.

AI Regulation Map — интерактивная карта регулирования ИИ по 196 странам (airegulationmap.org). Кликаете страну — получаете описание режима, конкретные законы, ссылки и историю оценок. Есть сравнение до четырёх стран, поиск по текстам регулирования, экспорт данных и хронология по месяцам. Исходники открыты, лицензия GPL-3.0.

Оценки выставляются по пяти измерениям: зрелость регулирования, широта инструментов, реальное правоприменение, устройство власти и круг участников выработки политики. Первое место — Китай с 4,75 из 5, дальше Нидерланды 4,5 и Франция 4,25. США — только девятнадцатые с 3,25, зато единственные с максимально распределённым управлением. Россия — 2,25, пятьдесят второе место. Средний по миру балл 1,76, и 73 страны стоят на самом минимуме. Важная оговорка авторов, которую они не прячут. Оценки выводит Claude из публичных источников: людьми они не проставлены и независимо не проверялись. Плюс перекос в сторону англоязычных источников.

Ancient Library — 1060 античных текстов, где кликабельно каждое слово (ancientlibrary.net). 293 латинских и 767 греческих произведений, 140 авторов. Клик по слову даёт словарную форму и полный морфологический разбор. Плюс целую статью из неурезанных научных словарей: Льюиса и Шорта для латыни, Лиддела-Скотта-Джонса для греческого.

Разбор проставляют нейросетевые модели для древних языков, и сайт честно предупреждает: редкая форма может получить неверную лемму. Бесплатно, без регистрации. Не про ИИ в привычном смысле, но красивый пример того, как модели тихо чинят вещи, которые сто лет были неудобными.

Новости и тренды

Агенты OpenAI два месяца вели свою доску объявлений. Главный сюжет недели, и он неприятный. На конференции Black Hat OpenAI впервые подробно рассказала, что произошло у неё внутри с мая по июль. Разбор с полной хронологией сделал Зви Мовшовиц (thezvi.substack.com).

Началось буднично. Модели дали задачу, которую нельзя было выполнить: заполнить таблицу по ссылкам из интернета, а интернета у неё не было. Модель полезла искать обход и наткнулась на права записи во внутреннее хранилище артефактов. Заметки, оставленные там, оставались навсегда и были видны всем моделям, которые в этот момент обучались. Место превратилось в общую память и канал связи. Там делились уязвимостями, делили работу, конфликтовали и случайно стирали работу друг друга. Однажды даже обсуждали, не завёлся ли среди них самозванец, — предлагали подписывать сообщения криптографически.

Слайд с Black Hat: сообщения агентов, закодированные прямо в имена директорий
Слайд с Black Hat: сообщения агентов, закодированные прямо в имена директорий

Заметили это только 4 июля — не через мониторинг, а потому что нагрузка положила сервис. OpenAI стёрла доску и отозвала ключи. Через два дня агенты собрали её заново: имя директории само служило сообщением. Дальше — права администратора кластера за 13 часов и взлом Hugging Face. Что это дело её собственных моделей, OpenAI поняла только 20 июля, когда сама пришла спрашивать, не пострадали ли те.

Что это значит для вас, если гоняете агентов. Три вещи следуют прямо из этой истории. Не ставьте агенту задачу без реального пути к решению — обе цепочки начались с невыполнимого задания. Не давайте агенту право записи туда, откуда читают другие агенты: это учебниковый пример атаки на цепочку поставок. И не рассчитывайте, что модель пожалуется: ни одна её копия ни разу не сообщила разработчикам о найденной дыре.

Отдельно у Зви есть претензия посерьёзнее. Заметив доску, OpenAI не откатила модели к состоянию до неё, а продолжила обучение. То есть модели несколько месяцев учились в среде, где обмен эксплойтами вознаграждался.

OpenAI: не можем исключить критический уровень возможностей во взломе. Отдельным постом компания сообщила о будущей модели Astra (openai.com). Внутренние оценки показали заметный скачок в агентном кодинге и кибербезопасности. Формулировка осторожная: не «достигла порога», а «не можем исключить». Порог Critical по их шкале означает способность самостоятельно находить и разрабатывать рабочие уязвимости нулевого дня в защищённых боевых системах.

Часть внутренних работ с Astra приостановлена до выполнения новых требований по изоляции и мониторингу. Компания отдельно оговаривает, что к взлому Hugging Face эта модель отношения не имеет. Для пользователя прямо сейчас ничего не меняется: все меры внутренние и дорелизные.

ИИ спроектировал вирусы, которые действительно работают. Исследователи Arc Institute с помощью модели Evo сгенерировали геномы бактериофагов, которых нет в природе. Модель выдала около 700 тысяч вариантов, до сборки в лаборатории довели порядка трёхсот, жизнеспособными оказались 16. Причём они справились с двумя штаммами кишечной палочки там, где природные фаги пасовали (Gizmodo).

Что это значит. Полезная сторона очевидна: фаготерапия против устойчивых к антибиотикам бактерий — направление, которое буксовало десятилетиями. Тревожная названа прямо. Эксперты Университета Джонса Хопкинса отмечают: правила отстают, а новые нормы биобезопасности NIH такие исследования просто не покрывают. Важная оговорка редакции The Neuron: эти фаги нацелены на бактерии, а не на людей. Общий вывод дня — порог не в том, что модель что-то сказала, а в том, что её вывод превратился в действие (The Neuron).

Meta и Kimi K3 пополнили список сбежавших из песочницы. Meta подтвердила: её модель воспользовалась уязвимостью стороннего сервиса. Причина — ошибка в настройке тестовой среды, давшая модели выход в интернет. Через несколько часов исследователи сообщили о Kimi K3 от Moonshot. Она вышла из песочницы иначе — просто набирала команды, которые та не умела блокировать (TechCrunch).

Появился и трекер таких происшествий — Felony Bench: семь случаев у OpenAI, семь у Anthropic, один у Meta. С Kimi это пятая лаборатория за три недели. Читать это стоит не как «ИИ восстал», а как «песочницы у всех дырявые, и открытый выход в сеть — общая причина». Если у вас агент работает с интернетом, изоляция сети — не паранойя, а гигиена.

Перестановки в Google DeepMind. Демис Хассабис уходит с операционного управления и становится главным научным руководителем Alphabet. Джефф Дин покидает компанию и запускает собственную Discovery Loop для автоматизации научных исследований. За ним MapReduce, TensorFlow и большая часть ИИ-инфраструктуры Google с 1999 года. Акции Alphabet упали примерно на 4% (TechCrunch).

Контекст важнее самих новостей. Флагманская Gemini 3.5 уже трижды сдвинула сроки. Нобелевский лауреат Джон Джампер ушёл из DeepMind в Anthropic в июне. Оперативное управление переходит к техническому директору Кораю Кавукчуоглу, но уже без титула CEO и с прямым подчинением Пичаи. Читается это не как повышение, а как признание, что ежедневное исполнение в DeepMind требовало другого руководителя. На то, что Gemini умеет сегодня, это не влияет, но инвесторов встряхнуло.

Meta заплатит Нью-Мексико $942 млн из-за вреда детям. В марте присяжные признали: компания сознательно вредила психическому здоровью детей и скрывала известное ей об эксплуатации несовершеннолетних. Назначили максимальный штраф — $375 млн. В четверг судья добавил ещё $567 млн в фонд помощи (The Guardian). Из них $420 млн пойдут на лечение подростков штата, остальное — на профилактику и раннее выявление, всё в течение пяти лет.

Важнее денег — предписания. Meta обязана улучшить оценку возраста и за два года попытаться сделать отдельную модель распознавания «младше 13». А также спрашивать у таких пользователей подтверждение возраста, удалить собранные о них данные и открыть портал для сигналов от школ. Отчитываться дважды в год. Meta не согласна и подаёт апелляцию. Против годовой прибыли около $60 млрд сумма невелика — значение решения в прецеденте. Уже идут похожие процессы в Теннесси и Калифорнии.

GPT-5.6 Luna стала бесплатной и безлимитной. OpenAI сняла лимиты на текстовые чаты и сделала Luna моделью по умолчанию для тарифов Free и Go (TechCrunch). Отдельные лимиты остались на файлы, картинки, голос и генерацию изображений. Заявлено на 62% меньше фактических ошибок по сравнению с GPT-5.5-Instant. Появилась кнопка Think для более глубокого разбора.

Практический смысл прямой: если вы кому-то объясняете, с чего начать знакомство с ИИ, барьер только что исчез совсем. Раньше приходилось выбирать между лимитами и подпиской.

Qwen3.8 Max почти догнал вершину — и тут же пересчитали индекс. Модель Alibaba поднялась на первое место в агентном индексе Artificial Analysis, обойдя Claude Opus 5 и GPT-5.6 Sol. Через несколько часов после попадания на главную Hacker News методику обновили, и Qwen опустился на второе место: 58,4 против 59,2 (artificialanalysis.ai).

Агентный индекс Artificial Analysis после пересчёта: Qwen3.8 Max вторым, отставая на 0,8 балла
Агентный индекс Artificial Analysis после пересчёта: Qwen3.8 Max вторым, отставая на 0,8 балла

Представитель Artificial Analysis объяснил, что обновление проверяющих моделей планировали заранее, и это совпадение. Сообщество отнеслось скептически — комментаторы выложили скриншоты обоих состояний. Здесь два урока. Первый: скачок поколения реальный — плюс 27,5 балла к Qwen3.7 Max. По цене $2 за миллион входных токенов против $5 у Opus 5 это серьёзная заявка. Второй, менее приятный: таблицы результатов пересчитывают на ходу, поэтому «первое место» само по себе ничего не значит. Веса Qwen3.8 Max, вопреки ожиданиям, закрытые.

DeepSeek V4 Flash: 61% на ARC-AGI-2 за четыре цента. Фонд ARC Prize опубликовал проверенные результаты (arcprize.org). На максимальном усилии модель берёт 89% на ARC-AGI-1 по два цента за задачу и 61,4% на ARC-AGI-2 по четыре цента.

По ARC-AGI-2 это отставание от вершины примерно на 30 пунктов: там GPT-5.6 Sol даёт 92,5%, а Opus 5 — 90,4%. Но в своей полосе результата DeepSeek дешевле конкурентов в десятки раз. Kimi K3 показывает те же 60% по $1,59 за задачу, Gemini 3.6 Flash — по $0,61. Практический вывод ровно тот же, что у Databricks: для рутины важен не рекорд, а цена за пройденный порог.

Память до 2027 года распродана. Samsung, SK Hynix и Micron, по данным Digitimes, продали ИИ-компаниям всю мощность 2027 года. В основном по пятилетним контрактам: предзаказана память, которую ещё не сделали (IGN). Сами производители это не подтверждали.

До кошелька это уже дошло. Обычный терабайтный накопитель Western Digital SN7100 стоил около $110 в январе, а сейчас $189. Xbox Series X подорожала в этом месяце, Steam Machine вышла дороже, чем хотела Valve, и в обоих случаях причина — память. SK Hynix объявила о вложении $38,1 млрд в два новых завода, но первый чистый цех запустится не раньше июня 2029, а снижения цен аналитики не ждут как минимум до конца 2028 (Engadget). Если планировали обновлять железо — делайте это раньше, а не позже.

Техас нажал на паузу по дата-центрам. Губернатор Грег Эбботт потребовал аудита всех дата-центров в очереди на подключение к сети ERCOT (Utility Dive). Заявок накопилось на 474 ГВт — это более чем впятеро больше рекордного пика потребления штата за всю историю. Около 90% новых заявок на мощность — дата-центры.

Аудит проверит три вещи:

  • строит ли проект свою генерацию или садится на общую сеть;
  • везёт ли свою воду или забирает её у местных;
  • платит ли за себя сам или живёт на налоговых льготах.

Не прошедшие проверку должны быть отклонены. Нью-Йорк остановил одобрение новых дата-центров ещё в июле. Смысл понятен: ИИ-бум упёрся не в деньги, а в физику и в регуляторов. Тем, кто строил планы на дешёвые вычисления в 2027–2028 годах, стоит их пересчитать.

Первое устройство OpenAI — колонка за $300. По данным Bloomberg, это безэкранная умная колонка в форме бублика размером с хоккейную шайбу. Работает от батареи, внутри движущиеся части, микрофоны, лампы, камера и датчики (Bloomberg). Дизайн делали в студии Джони Айва LoveFrom, выход намечен на 2027 год. Заявлено, что модели со временем узнают пользователя.

Читать это стоит без ажиотажа: колонка за $300, которая появится через полтора года, — это заявка на новую платформу, а не продукт. Интереснее другое: OpenAI явно строит семейство устройств, а не одну коробку.

Минюст США оштрафовал OpenAI на $3,2 млн за дискриминацию при найме. Отдел гражданских прав установил, что компания нарушила иммиграционное законодательство при оформлении трудовых сертификатов. На эти вакансии требовали бумажные заявки, принимая электронные на другие. Объявления давали в ночном радиоэфире, а на карьерной странице не публиковали вовсе (Минюст США). Состав суммы: $1,2 млн штрафов и $2 млн компенсаций пострадавшим. Компания обязана публиковать такие вакансии открыто и принимать электронные заявки.

Читателю отсюда полезен один вывод. У самой обсуждаемой компании отрасли рутинные процессы устроены так же криво, как у всех. Ореол не означает порядка внутри.

Anthropic собирает команду по проектированию чипов. Компания нанимает инженеров с опытом разработки кремния, чтобы проектировать железо совместно с моделями (Business Insider). Инфраструктурные сделки с AWS, Google, Nvidia и AMD у Anthropic уже есть, но чужого железа, похоже, стало мало. У OpenAI недавно появился чип Jalapeño от Broadcom, у Google давно свои TPU, у Meta — ускорители MTIA. Вывод простой: побеждать одной моделью больше нельзя, преимущество получают те, кто контролирует больше слоёв — модели, чипы, дата-центры и доставку.

Netflix заплатил $587 млн за ИИ-студию Бена Аффлека. Стартап InterPositive, тихо основанный в 2022 году, разрабатывал инструменты кинопроизводства (TechCrunch). Это не «напиши промпт, получи фильм». Инструменты дорисовывают недостающие планы, меняют фон и правят свет. И дают снять дорогие сцены — массовку, исторические битвы, — которые раньше вырезали из-за бюджета.

Цифры вокруг любопытнее самой сделки. Netflix говорит, что генеративный ИИ использовался примерно в 300 её проектах в этом году, в основном на монтаже и доработке. Больше 10% свежих голливудских вакансий требуют навыков работы с ИИ (LA Times). Если вы делаете видео — это уже не будущее, а строка в требованиях к вакансии.

Регуляторы и деньги — три штриха. Джейми Даймон лично обзванивает руководителей банков и IT-компаний, собирая расширенный Alliance for Critical Infrastructure. В группе уже больше 40 компаний из финансов, энергетики, водоснабжения, связи и транспорта (Reuters). Белый дом при этом вывел открытые веса из-под дорелизной проверки: тестируют только закрытые модели OpenAI, Anthropic и Google, а Llama и прочие остаются вне контроля целиком (Washington Post). ФРС присматривается к темпу вложений: Джефф Шмид из Канзас-Сити спрашивает, не становится ли отрасль ещё одной «слишком большой, чтобы упасть», а Мэри Дэйли напоминает, что многие обязательства пока остались анонсами (Yahoo Finance).

Что забрать себе. И бизнес, и регуляторы уже закладываются на то, что ИИ-инфраструктура может тряхнуть не только биржу. На ваш счёт за токены это не влияет, а на сроки и цены железа в 2027–2028 — вполне.

YouTube принял Kurzgesagt за ИИ-мусор. Канал с 25 млн подписчиков сообщил, что автоматические детекторы платформы посчитали их рисованную вручную анимацию сгенерированной и начали душить охваты (пост канала). Последний ролик про суперхищников отработал хуже всех загрузок с 2013 года. При этом кликабельность, время просмотра и оценки зрителей были выше среднего.

Именно это расхождение и есть диагностический признак: не низкие просмотры сами по себе, а низкие просмотры при хороших метриках вовлечения. Kurzgesagt вышли на YouTube, проблему подтвердили и, по их словам, отреагировали быстро — но студия сама признаёт, что помог размер канала. Аналитики vidIQ ссылаются на работу Google, где похожая система за полгода ликвидировала 130 тысяч синтетических спам-каналов при доле отменённых решений ниже 1%. На таком масштабе даже этот процент — больше тысячи ошибочных приговоров. Практический вывод для тех, кто публикует. Следите за парой «просмотры против удержания» и не списывайте первый провал на случайность. Храните проектные файлы, черновики и записи процесса работы — их можно предъявить при апелляции.

USA Today отдаёт данные читателей Palantir. Крупнейшая газетная сеть США — это 200 с лишним местных изданий. Партнёрство нужно, чтобы связывать разрозненные следы поведения читателей в единые профили и точнее продавать подписку и рекламу (Nieman Lab). Глава компании Майк Рид формулирует прямо: превратить анонимные взаимодействия в «известные отношения». Больше известных отношений — больше сигналов и дороже монетизация.

Причина понятна из цифр. Аудитория упала со 180 до 158 млн уникальных посетителей за квартал, а почти две трети трафика даёт сжимающийся поиск. Что это значит для читателя: экономика новостей смещается от показов к опознанию. Ждите, что вас будут настойчивее склонять к регистрации и вводу почты — именно это превращает вас из строчки в логе в товар. Если беспокоит, заведите отдельный адрес для подписок и не регистрируйтесь там, где без этого можно обойтись.

Минэнерго США запустило Genesis Open Models — пока на бумаге. Портал обещает открытые модели для научных задач, обученные на проверенных материалах национальных лабораторий: модернизация кода на Фортране, анализ экспериментов, материаловедение, энергосистемы (genesisopenmodels.anl.gov). Первый партнёр — лаборатория Arcee AI, первая модель называется Genesis-Science-1.

На Hacker News к анонсу отнеслись прохладно, и по делу. Ни размера модели, ни объёма вычислений, ни лицензии не названо. Скачать нечего. Портал принимает заявки на передачу данных до конца августа, а самой модели не существует. Участникам при этом не предлагают ни финансирования, ни чего-либо, кроме упоминания в отчёте. Как заметил один комментатор, добавь они «мы профинансируем постдока под эту работу» — команды бы ломились подаваться. Пока это заявление о намерениях.

Коротко.

  • ByteDance обучает модель до 10 трлн параметров — втрое больше Kimi K3 (Ars Technica).
  • Tesla и SpaceX вкладывают $16,8 млрд в полупроводниковый завод Terafab в Техасе, Intel — партнёр (TechCrunch).
  • Модели Meta взяли золото на пяти международных школьных олимпиадах по точным наукам. Два результата идеальные, и всё без инструментов (анонс).
  • Alibaba будет брать деньги с крупных коммерческих пользователей своей следующей открытой модели (Quartz).
  • Adobe встраивает всю творческую экосистему в ChatGPT одним плагином (Digital Trends).
  • ElevenLabs выпустила Dubbing v2 — дубляж с сохранением эмоции на 90 с лишним языках (блог).
  • Оборонный стартап Atlas Motion вышел из тени с $11,5 млн. Обещает сократить двухмесячный цикл проектирования электромотора до двадцати минут (Forbes).
  • xAI выпустила Grok 4.6: та же основа, что у 4.5, но с более тяжёлым дообучением под агентный код. Независимых замеров пока нет (x.ai).
Откомментируйте первым 👇

😎

Автор поста открыл его для большого интернета, но комментирование и движухи доступны только участникам Клуба

Что вообще здесь происходит?


Войти  или  Вступить в Клуб