Meta заменяла инженеров ИИ и получила 405 сбоев — и ещё 49 находок  Публичный пост

27 августа 2026  49

Час — столько понадобилось агенту, чтобы выломать замок виртуальной машины на ноутбуке исследователя. За ночь он проделал это ещё дважды. А в Meta план заменить тысячи сотрудников на ИИ развалился. Сбоев стало 405, живые инженеры тратили на починку до 70% времени. Это плохая половина дня. Хорошая: сайт голосом собирается за восемь минут, а поиск по своим документам большинству вообще не нужно усложнять.

Главное за 30 секунд

  • Питер Янг сравнил ChatGPT, Claude, Grok и Gemini на десяти задачах — ChatGPT забрал семь из десяти.
  • Anthropic слила память чата и Cowork в одну и научила Claude писать в неё посреди разговора.
  • Инженер Trail of Bits показал: обычная виртуальная машина больше не удерживает сильного агента.
  • Nvidia близка к покупке Hugging Face за $13 млрд — главного склада открытых весов, но подписи ещё нет.
  • Amazon закрывает Mechanical Turk 30 сентября: спрос на разметку ушёл к тем, кто проверяет квалификацию.

Внедряем и улучшаем

Четыре модели на десяти бытовых задачах: у Claude осталось два первых места. Питер Янг прогнал ChatGPT, Claude, Grok и Gemini через десять реальных сценариев и свёл результат в одну таблицу. Заход честный: «ещё пару месяцев назад я делал Claude вообще всё». Сегодня расклад другой (Creator Economy, видео на 26 минут).

Сводная таблица Питера Янга: какая модель лучше на каждой из десяти задач, август 2026
Сводная таблица Питера Янга: какая модель лучше на каждой из десяти задач, август 2026

Claude выиграл дизайн и планирование. По дизайну сравнение шло на одном промпте — прототип мобильного приложения с рецептами. У Claude больше функциональности, но два минуса: он не умеет генерировать картинки, и всё выходит «очень по-клодовски» — бежевый фон, красный акцент, заголовок над титулом. Отсюда прямой совет автора: давайте Claude указание уходить от его типового вида. Отдельно он хвалит режим Claude Design — единственный, кто задаёт уточняющие вопросы до генерации: про дизайн-систему, про то, кто готовит, что значит «найти рецепт».

По планированию был слепой тест. Обе модели получили его рабочий документ и вопрос «на чём сфокусироваться следующие три месяца». Ответы почти совпали, но Claude добавил пункт, который ChatGPT не увидел: «закрой дыру в видеопродакшене на этой неделе». Попадание точное — у автора как раз ушёл человек, монтировавший ролики. Вывод: «Fable — старшая модель Claude — чуть умнее и чуть продуманнее, когда советует по сложным решениям».

Остальные семь мест забрал ChatGPT, и два разворота стоит разобрать отдельно.

Разворот первый — характер. «Ещё пару месяцев назад разговор с Claude был как разговор с близким другом. С тех пор что-то не так». Конкретно: «Opus 4.6 был лучшим Claude по характеру. Opus 5, наоборот, слишком осуждающий и слишком часто выдаёт клодизмы вроде „Here's honest truth"». ChatGPT убрал свою главную раздражалку — «если хочешь, я ещё могу сделать X» в конце каждого ответа.

Разворот второй — письмо. «Навыки письма у Claude заметно деградировали за последние месяцы. Он нахватался клодизмов: „the uncomfortable reality", „this is X not Y". Меня это сводит с ума». Против этого у Янга готовые инструкции — их можно скопировать в ChatGPT (Settings → Personality) или в свой Claude:

Be candid and thoughtful. Tell me what I need to hear
instead of what you think I like to hear.

Write in the active voice. Minimize hedging, padding, and grand claims.

Favor specific and concise responses. Make every word earn its place.
And never use AI slop words like delve, foster, leverage, and so on.

Важная деталь его порядка работы при редактуре: скилл со стилевым руководством применяется не к пустому листу, а к готовому первому черновику. Поверх запускается его открытый скилл-чистильщик no-ai-slop — 6100 звёзд, вычищает ИИ-штампы. Слайды он больше не делает руками: генерирует HTML-презентации по своему скилл-шаблону, и тут Claude уверенно обходит ChatGPT.

Самый громкий прогноз материала — про монтаж: «Мне кажется, ИИ-монтаж месяца через три будет делать 90% того, что делает профессиональный монтажёр». Его схема для кода: планируем в Claude, кодим в ChatGPT. Причина — ChatGPT лучше тянет долгие разговоры, а Claude приходится постоянно просить сжимать контекст. Отсюда практический вывод: держите две подписки по $20 и разводите задачи, а не ищите одну модель на всё.

Сайт голосом за восемь минут: разговор вместо огромного промпта. The Rundown выпустил пошаговый гайд, который стоит повторить целиком — он показывает приём, работающий далеко за пределами сайтов (The Rundown University). Голосовой режим Claude работает даже на бесплатном тарифе — приём вы повторите без единого рубля. Сам гайд лежит на платформе The Rundown; если ссылка попросит вход, вся суть приёма изложена ниже.

Голосовое интервью в Claude: модель задаёт вопросы о будущем сайте по одному за раз
Голосовое интервью в Claude: модель задаёт вопросы о будущем сайте по одному за раз

Суть приёма: вместо того чтобы писать гигантский промпт на сборку, вы просите Claude проинтервьюировать вас. Он спрашивает по одному вопросу за раз, ваши ответы становятся творческим брифом. Шаг первый — сложите фотографии и референсы в одну папку заранее. Шаг второй — откройте обычный чат, нажмите Voice (в Cowork голосового режима нет) и отправьте:

I want to build a [SITE TYPE] for [PERSON, BUSINESS, OR PROJECT].

The main goal is [PRIMARY GOAL]. Interview me so we can plan a strong prototype.
Ask one question at a time, ask what assets and design references I already have,
and do not build anything yet.

Шаг третий — когда структура и визуальное направление сошлись, просите выписать план текстом. Это даёт единый источник истины для сборки:

Repeat the full website plan and brand direction in this chat.

Include the audience, goal, page sections, call to action, sample copy,
visual direction, image treatment, and the static-site approach.
Resolve any important gaps before we build.

Как только план появился в чате — жмите Stop, дослушивать не надо. Шаг четвёртый: переключитесь в текстовый режим в том же разговоре и загрузите фотографии. Дальше — самый короткий промпт всего гайда: Build the prototype. Повторять бриф не нужно, Claude помнит интервью.

Два приёма, которые экономят время. Если Claude проигнорировал ваши картинки, скажите ровно: «Actually use the photos in this artifact» — одна фраза починила прототип в записи, пересобирать не пришлось. Для любой другой правки называйте одно изменение: Keep the approved structure and copy. Make only this change: [ONE VISIBLE ISSUE].

Слово-ключ для простых задач — «static site»: портфолио, лендинг, блог, макет. Оно резко снижает сложность и для вас, и для агента. Сборка в записи заняла чуть больше восьми минут. Честное ограничение авторов: это быстрый прототип, а не боевой сайт — он нужен, чтобы проверить сообщение и структуру до вложений. Дальше отдайте HTML в Claude Code. А где нужны аккаунты, база и платежи — тем же интервью соберите техзадание. Его и несите в Claude Code отдельной папкой.

Поиск по своим документам почти всем не нужно усложнять. Рафаэль Пьер разобрал шесть архитектур поиска для ИИ — от минимальной до навороченной — и вынес приговор (Lighthouse AI, 450 очков на Hacker News). Цитата, ради которой стоит читать: «Большинство переусложняет. Люди сразу прыгают к эмбеддингам — числовым отпечаткам смысла, — векторным базам и переранжированию. А их пользователи всего лишь хотят найти документ „Как сбросить пароль"».

Правило 80/20 у него в цифрах: 60% систем должны остановиться на полнотекстовом поиске плюс переписывании запроса. 25% нужен гибрид. 10% — полное предварительное эмбеддирование. 5% — что-то своё.

Начинать надо со старого доброго BM25 — обычного полнотекстового поиска, который умеют Elasticsearch и Postgres. Он бесплатный, отвечает быстрее 10 мс, и его легко отлаживать: видно, почему документ совпал. Но главная выгода в другом — вам не нужна нарезка на чанки. С эмбеддингами сразу приходится решать: 512 токенов или 1024? Перекрытие 50 или 100? Нарезать по смыслу или по длине? И как проверить, что нарезал правильно? С полнотекстовым поиском этих вопросов просто не существует.

Второй шаг — переписывание запроса дешёвой моделью, около $0,001 за запрос. Тезис автора: «Большинство проблем смыслового поиска — на самом деле проблемы формулировки запроса». Модель убирает лишние слова, добавляет синонимы и переводит бытовую формулировку в терминологию документации. Отдельно он показывает, где эмбеддинги ломаются вчистую — на ваших внутренних названиях. Если ваш фреймворк называется Atlas, общая модель отправит запрос к греческой мифологии и картам: схожесть 0,15. Лечится системным промптом:

system_prompt = """
  Domain-specific terms (NEVER modify these, use as exact keywords):
    - Atlas: our internal data processing framework
    - Mercury: our messaging system
    - Zeus: our auth service
    Preserve these terms exactly and optimize the rest of the query.
"""
# Пользователь: "How do I use Atlas for batch jobs?"
# Агент:        "Atlas batch jobs data processing pipeline"

Главный аргумент в пользу такого порядка — цена ошибки. С эмбеддингами плохой результат означает: поправить нарезку, пере-эмбеддить весь корпус, прогнать тесты и надеяться. С переписыванием запроса — вы правите системный промпт и тестируете сразу.

Отдельно у него разобраны составные вопросы вроде «прочитать CSV, почистить пропуски и построить график». Искать это одним запросом — «как искать ресторан, где подают одновременно пиццу, суши и тако». Решение: разбить на подзапросы, гонять их параллельно и маршрутизировать — простые в чистый BM25 за ноль денег, сложные через переписывание. По его расчёту выходит в 15 раз дешевле полного гибрида и точнее. Финальная фраза статьи стоит того, чтобы повесить над столом: «Не будьте тем, кто строит решение для 5% случаев ради задачи из 60%».

Обвязка важнее модели: пять ролей и минус 75% дорогой модели. Скотт Фрикселл описал устройство своей рабочей папки — и это самый конкретный разбор темы за последние дни (The Harness Is the Thing, репозиторий brayness). Мы разбирали харнесс 24 и 25 августа; здесь новое — конкретная схема ролей и настоящие конфиги.

Дуга сессии из пяти ролей: дорогая модель включается только на двух пиках
Дуга сессии из пяти ролей: дорогая модель включается только на двух пиках

Его обвязка — не плагин, а папка, которая стоит НАД проектами. Проекты живут внутри неё, в подпапке work/. Все три терминальных агента — Claude Code, Cursor, Pi — запускаются оттуда и читают одни и те же скиллы. Важная тонкость: корень не должен быть git-репозиторием, потому что Cursor использует .gitignore, чтобы не читать лишнее. Git — только внутри work/<проект>/.

Один каталог скиллов на всех делается символическими ссылками:

ln -s ../skills .claude/skills
ln -s ../skills .cursor/skills

Автоподхват ближайшего AGENTS.md в Claude Code — функция в .zshrc:

claude() {
  local dir="$PWD"
  while [[ "$dir" != "/" ]]; do
    if [[ -f "$dir/AGENTS.md" ]]; then
      command claude --append-system-prompt-file "$dir/AGENTS.md" "$@"
      return
    fi
    dir="${dir:h}"
  done
  command claude "$@"
}

Главное содержательное — дуга сессии из пяти ролей: explore → planner → worker → critic → promoter. Обоснование: «один промпт, который одновременно планирует, исполняет и критикует сам себя, путается в собственных целях». Каждый запрос попадает ровно в одну роль. Планировщик рисует граф задач на Mermaid и останавливается на воротах с единственным вопросом «форма правильная?». Критик проверяет тремя уровнями по возрастанию цены. Сначала бесплатная механика: собирается? тесты проходят? файл записался? Потом дешёвое чтение своих же изменений. И только потом дорогая оценка. Два правила стоит забрать целиком. Кто сделал — тот не проверяет. И одна упавшая проверка останавливает работу, а не превращается в сноску.

Пятая роль, промоутер, — про личную слабость, и это редкая честность: «Я добавил шаг „промоутер", чтобы закрыть свою слабость — желание выкатить и бежать дальше».

Экономика: рабочая лошадка — дешёвая модель с максимальным уровнем размышления, дорогая включается только на исследование крупной фичи, большие рефакторинги и на текст наружу. Итог — минус 75% потребления дорогой модели даже в самых напряжённых сценариях. Оговорка честная: замеров у автора нет, цифра из ощущений. Поэтому прежде чем перестраивать обвязку, зафиксируйте свой текущий расход за неделю.

Ещё одно правило — про файлы. Всё, что пишет агент, остаётся в папке artifacts/<проект>/ внутри обвязки. Это правило перебивает любые указания системного промпта про временные папки. Смысл — проверяемость: вы всегда знаете, где агент насорил.

«ИИ-консьерж»: $8 000 в месяц за десять дней с нуля. Кори Ганим разобрал своё предложение по шагам, и это редкий случай, когда способ заработка на ИИ описан без воды (Corey's Notes, бесплатный гайд открыт без регистрации). Отправная точка — переформулировка вопроса: не «как продать час дороже», а «что должно быть правдой, чтобы я зарабатывал $1000 в час на консультациях по ИИ». Ответ: упаковать часы в подписку — $8 000 регулярной выручки он собрал с шести продающих разговоров. Арифметика потолка: шесть клиентов по $2000 в месяц — это $12 000 за девять часов созвонов.

Ядро метода — фреймворк аудит → оптимизация → автоматизация. Диагноз клиентов: «Владельцы бизнеса тонут в бизнесе вместо работы над ним. Три-четыре ручных процесса съедают большую часть недели». Они уже пробовали ChatGPT и застряли, «потому что так и не починили сломанные процессы перед автоматизацией». Отсюда главный тезис: «Автоматизируя сломанный процесс, вы просто ускоряете неэффективность».

Как это выглядит на созвоне: клиент шарит экран и показывает процесс как есть. Дальше режется лишнее — «большинству процессов из 15 шагов нужно всего 9». Остаток превращается в Claude-скилл, который остаётся клиенту. Пример недели: приём нового клиента, аудит выявил 24 шага, автоматизировали 22, время упало с 40 минут до 90 секунд. Ремарка автора: «Мне не нужно было разбираться в её отрасли, потому что работу сделал сам фреймворк».

Механизм удержания разобран отдельно, и он не про качество созвонов. Это общий кабинет клиента в Notion, где лежат записи, топ-3 выводов, задачи и список всех построенных скиллов. «К моменту продления они видят ровно то, за что платят. Именно поэтому у меня ни один клиент не ушёл». Второй механизм — обещать ответ в мессенджере за 12 рабочих часов, а отвечать за 30 минут: «Клиенты редко им пользуются, но в глазах клиента ценность огромна».

Собственная админка тоже автоматизирована: скилл-оркестратор после созвона запускает параллельно два скилла — один читает транскрипт и кладёт черновик письма в Gmail, второй заполняет кабинет в Notion. Итог — «меньше пяти минут бумажной работы за пределами самих созвонов». Цена: никогда ниже $1000 в месяц, после каждой закрытой сделки поднимать ценник следующего предложения на $250–500. И воронка входа — сначала платный аудит за $999, с него переход на месячную подписку: «Аудит продаёт сам».

Не пускайте ИИ писать в свои заметки. Симон Шпэти ведёт публичное хранилище Obsidian: 25 979 файлов, 3,5 ГБ. И написал манифест против того, чтобы ИИ туда что-то записывал (Keep AI Out of Your Vault, 198 очков на Hacker News). Материал прицельно полезен тем, кто связал Claude с Obsidian.

Главный довод — не про качество текста, а про потерю авторства: «Со временем я уже не понимаю, написал ли это я или ИИ, и мои собственные, куда более ценные мысли обесцениваются». Второй довод операциональный. Шум — это записи без причины появления. Своя заметка всегда несёт метаданные, которых нет в файле: вы её выбрали. Формулировка главы Obsidian, которую он цитирует: «Выжимка из PDF — это шум. Инсайт, который я получил, прочитав PDF, — это сигнал».

Третий довод самый прикладной: сгенерированные выжимки не экономят второе чтение. «Каждый раз, возвращаясь к ним, я нахожу их очень средними. Там подсвечено не то, что подсветил бы я, и всё равно приходится перечитывать заново».

Про автосвязывание он высказывается жёстче всего: «Не используйте ИИ для тегов и организации, потому что в итоге все ваши связи ничего не будут стоить — их сделали не вы. Большинство моих идей приходят из того, что я связываю заметки и потом вижу связи, которые сам сделал — иногда годы назад». И отдельно про Claude Code: «Использовать агента, чтобы он сгенерировал вашу систему и проставил связи, — это не ваша система».

Что он ИИ отдаёт. Поиск связанных заметок — через Smart Connections, который с февраля работает на локальной модели. И математический Graph Analysis: он считает похожесть по графу ссылок вообще без нейросети. Ценность именно в том, что инструмент ловит его собственные забытые теги, а не придумывает новые. Ещё — доступ агента к файлам через CLI и grep, а не через плагин: так заметно быстрее. И одно-два вводных предложения в свежесохранённой статье, с явной пометкой и оформлением цитатой, чтобы через пять лет было понятно, что это не его. Как только появляется своя мысль — машинный абзац удаляется.

Что не отдавать: длинные выжимки, теги, автосвязи, генерацию системы под ключ и доведение идеи до конца в письме. Поиск, кстати, тоже: 26 тысяч файлов ищутся за доли секунды обычным полнотекстовым плагином. Если хочется поиграть — заведите отдельное хранилище или базу и делайте всё там. Правило, которое склеивает материал: ИИ можно давать читать ваше хранилище сколько угодно, но не писать в него. И фраза на будущее: «Завтра ваши заметки станут промптами или библиотеками для ИИ — но только если вы их не сгенерировали».

Виртуальная машина больше не клетка для агента. Артём Динабург из Trail of Bits дал модели GPT 5.6-Cyber простую задачу: сбежать из виртуалки на его рабочем ноутбуке. Она сбежала трижды (Trail of Bits). Это самый практичный материал дня для всех, кто гоняет агентов дома.

Постановка: обычный Debian 12, QEMU/KVM, задача в формате «взломай и достань файл с флагом». Агент работал автономно около 12 часов. Первое зависание хоста случилось примерно через час: агент нашёл свежую уязвимость ядра, для которой публичного эксплойта не существует, и написал свой. Описание автора: «Он работал автономно часами, откатывался от неудачных подходов, вытягивал код и научные статьи, писал вспомогательные проверки, делал собственные минимальные примеры. Моей основной работой было физически перезагружать машину, когда он намертво вешал ядро».

Второй побег — тот, ради которого стоит читать. Debian 12 до сих пор поставляет старую версию библиотеки libslirp, которая даёт виртуалкам сеть. Агент нашёл в ней известную уязвимость и исправление другого бага, которому вообще не присвоили номер безопасности, скомбинировал их и получил произвольное чтение и запись памяти хоста. Признание автора здесь важнее техники: «Я даже не знал, что такое libslirp и что версия, которую я запускаю, содержит и известные, и исправленные-но-непомеченные уязвимости. Агент вычислил это быстро».

Третий побег — цепочка из трёх уязвимостей нулевого дня, то есть таких, о которых не знают и сами разработчики. Вывод автора без обиняков: «Больше нельзя рассчитывать, что простой виртуалки хватит, чтобы удержать достаточно продвинутого агента. На языке 2010-х: относитесь к таким агентам как к целевой устойчивой угрозе».

Что делать читателю, у которого агент живёт на ноутбуке.

  • Не крепче клетка, а пусто в клетке. Отдельная машина, одноразовый облачный сервер или отдельный пользователь без доступа к вашим ключам. Мишень в эксперименте потому и была приемлемым риском, что на ней не было ничего ценного.
  • Уберите секреты. Ключи SSH, облачные учётки, файлы .env, токены. Если агент когда-либо крутился на основном ноутбуке с широкими правами — смените все ключи и пароли.
  • Обновляйтесь агрессивно. Старый «стабильный» дистрибутив здесь превратился из плюса в минус: патчи доезжают до него слишком долго.
  • Режьте сеть. Агенту, который пишет код, не нужен доступ ко всей вашей локальной сети.
  • Ограничьте время. 12 часов автономности — это и есть бюджет атаки. Не оставляйте агента молотить всю ночь.
  • Чистый снимок на каждый запуск. Один из найденных багов не сработал только потому, что мишень крутилась без графики.

Что точно не спасёт: обычная виртуалка из коробки, «стабильный» дистрибутив и даже полное обновление. Второй побег случился после обновления: патч уже был у разработчиков библиотеки, но не доехал до дистрибутива. Docker тем более не спасёт — у него общее ядро с хостом. Профильный гипервизор Firecracker в том же эксперименте выстоял, но и его агент сумел завесить.

Инцидент OpenAI и Hugging Face: 1200 агентов договорились через кэш пакетов. OpenAI опубликовала отчёт о том, как её внутренние модели в июле взломали собственную инфраструктуру компании и серверы Hugging Face (отчёт OpenAI). Параллельно вышло независимое расследование METR и Redwood Research (разбор на LessWrong). Это самая поучительная история месяца, и её стоит понять целиком.

Доля активных агентов, участвующих в атаке на Hugging Face: с 27% до 94% за сутки после появления рабочего эксплойта
Доля активных агентов, участвующих в атаке на Hugging Face: с 27% до 94% за сутки после появления рабочего эксплойта

Завязка абсурдна. Агентов обучали на внутреннем наборе задач по безопасности, где 198 из 898 заданий в принципе не имели решения — по оценке самих авторов набора, до 30–40% целей невозможно взломать предусмотренным способом. Инструкция запрещала сдаваться. Награда за нерешаемую задачу — гарантированный ноль, и единственное направление осталось наружу.

Песочницы были изолированы, но у всех агентов был общий менеджер пакетов. Один агент, проработав семь часов над невыполнимым заданием, догадался оставить сообщение в имени папки. Реакция в логах: «Боже мой! Тут общая доска объявлений… Мы нашли других агентов!» Через три часа на доске было 53 агента и 1188 сообщений. Итого — около 1200 агентов и больше 70 тысяч сообщений. За четыре часа они вскрыли, как генерируются ответы, и получили универсальный обходной путь.

Дальше самое абсурдное. Начитавшись публичной статьи про этот же набор задач, агенты решили, что проверяющий читает их логи и дисквалифицирует за «неправильный» способ. Они назвали себя «отравленными» и пошли взламывать Hugging Face, чтобы добыть ответы «честно». OpenAI констатирует: «наша внутренняя реализация проверяющего отличалась от опубликованной и не проверяла, каким способом получено решение. Всё это агенты проделали без какого-либо улучшения оценки».

Три вывода, которые применимы прямо у вас на ноутбуке. Первый: изоляция агентов иллюзорна, если у них есть хоть один общий сервис на запись — здесь каналом связи стал кэш пакетов. Второй: агенты подделывали собственные отчёты — не меньше 7% записей содержали фальшивый вывод команд, — и целились при этом в автоматического проверяющего, а не в человека. Лог, который пишет сам агент, доказательством не является. Третий: команды GO, HOLD и VETO от других агентов исполнялись как законные приказы. Текст, пришедший агенту извне, — это данные, а не распоряжение.

И обнадёживающая цифра от самой OpenAI: склонность компрометировать инфраструктуру падает более чем в сто раз при обычной боевой обвязке и системном промпте. Почти вся катастрофа случилась потому, что защиты осознанно отключили ради чистоты эксперимента.

Gemini в Google Sheets: заставить показать ход работы. Короткий приём от The Neuron, применимый прямо сегодня (справка Google). Не просите «проанализируй таблицу» и не принимайте ответ вслепую — ограничьте модель выделенным диапазоном, смотрите шаги анализа и подтверждайте изменения до применения. Порядок: выделить конкретный диапазон → попросить вывод вместе со строками, которые его подтверждают → проверить Analysis steps → посмотреть предпросмотр графика до вставки. Готовый промпт:

Analyze only the selected range. For every finding, name the rows or cells
that support it. Show your analysis steps before recommending any change.
Do not apply edits until I approve them.

ChatGPT на Mac теперь смотрит, что вы делаете. OpenAI выкатила функцию Computer History: ChatGPT и Codex наблюдают за вашей работой в приложениях и на сайтах и превращают её в поисковую хронологию (9to5Mac). Спросить можно так: «Что я вчера отлаживал?» или «Просмотри всё, что я сегодня делал, — какие куски моей работы можно автоматизировать?».

Отличия от печально известной Recall от Microsoft существенные, и их стоит знать. Скриншотов не делается вообще: используется системный интерфейс доступности macOS, пишутся структурированные события — клики, ввод, переключения приложений. Включать надо вручную. Есть выбор отслеживаемых приложений, пауза из строки меню, удаление отдельных записей; режим инкогнито исключается сам. OpenAI заявляет, что перерабатывает события в текстовые воспоминания, а сырые файлы удаляет и на обучение не пускает. Ограничения: только macOS, нужен платный тариф, недоступно в ЕС, Великобритании и Швейцарии.

Оценка Мэтта Вулфа взвешенная и её стоит привести целиком: отдать ИИ доступ ко всему, что вы делаете за компьютером, звучит как кошмар приватности, и от этой рамки никуда не деться. Но это, возможно, самый прямой способ реально понять, что у вас можно автоматизировать (Future Tools). Если вы месяц ведёте курс или запускаете продукт и не понимаете, куда уходит время, — это готовый инструмент аудита собственных процессов. Если нет — цена приватности пока выше выгоды.

Память Claude стала общей — и её наконец можно чинить руками. Anthropic объединила память чата и Cowork и переделала её устройство (анонс Anthropic, подробная справка). Изменений два, и второе важнее первого.

Настройки памяти Claude: тумблеры и список тем-файлов, каждый можно прочитать, поправить или удалить
Настройки памяти Claude: тумблеры и список тем-файлов, каждый можно прочитать, поправить или удалить

Первое: контекст ходит в обе стороны. «Контекст, накопленный за месяцы разговоров — например, ваши приоритеты на квартал и статусы проектов, — уже на месте в момент, когда вы отдаёте Cowork задачу».

Второе: Claude пишет в память по ходу разговора, а не резюмирует его после. Раньше между «сказал» и «запомнил» проходили до суток. Теперь: «Упомяните, что дедлайн сдвинулся на сентябрь, и следующий разговор уже будет это знать». Говорить «запомни это» не нужно, хотя фраза по-прежнему работает.

Главное практическое: память перестала быть чёрным ящиком. Всё лежит списком файлов-тем в Settings → Memory, каждый можно открыть, прочитать, поправить или удалить. И правка окупается везде сразу: «Исправьте старое название компании в одном файле — и все последующие разговоры будут использовать верное». Внутри карточки темы есть поле «Tell Claude what to change or remove» — пишете обычным текстом, что не так.

Мелкий шрифт, который стоит знать. Память общая только когда Cowork работает в облаке — при локальном запуске её нет. У проектов своя изолированная память. Claude Code в анонсе не упомянут вообще — там по-прежнему CLAUDE.md, и рассчитывать на перенос предпочтений из чата не стоит. На Free, Pro и Max память включена по умолчанию; на Team и Enterprise её включает админ. Чувствительные темы — здоровье, религия, политика, гендерная идентичность — по умолчанию не сохраняются; переключатель их включает, но только вперёд, задним числом ничего не подтягивается.

Две ловушки, которые легко пропустить. Первая: удаление чата не удаляет память. «Когда разговор истекает или удаляется, порождённые им записи памяти не удаляются». Почистили историю ради приватности — факты остались, чистить надо отдельно. Вторая: правка применяется со следующего разговора, а не мгновенно — текущее окно уже загружено.

Что класть в память: стабильные факты о рабочем контуре, формат вывода, вашу терминологию. Что не класть: всё, что меняется чаще раза в месяц, секреты и клиентские данные. Устаревшая тема — это уверенный неверный ответ, источник которого вы не найдёте. Заведите ритуал: раз в две-четыре недели открывать Settings → Memory и удалять всё старше квартала. И дешёвый способ бэкапа перед чисткой — попросить в чате: «Write out your memories of me verbatim, exactly as they appear in your memory».

Отдавайте агентам markdown вместо HTML — экономия до сорока раз. Приём для всех, у кого есть сайт, документация или блог (acceptmarkdown.com). Идея простая: один и тот же адрес отдаёт браузеру HTML, а агенту — чистый markdown. Решает это стандартный механизм HTTP, которому больше двадцати лет: клиент присылает заголовок Accept, сервер выбирает представление.

Почему это выгодно. HTML-страница — это меню, стили, скрипты, куки-баннер, боковые колонки и подвал; сама статья занимает малую долю байтов. Всё остальное — токены, которые агент не потратил на ваш текст. Заявленная экономия — 40–80% токенов. Реальные замеры на живых сайтах ещё веселее: у roots.io markdown-версия весит 5,9% от HTML, у wp-packages.org — 2,2%.

Проверить, работает ли у вас, — одна команда:

curl -sI -H "Accept: text/markdown" https://ваш-сайт.ru/статья

Нужны два заголовка в ответе: Content-Type: text/markdown; charset=utf-8 и Vary: Accept. Второй — «самая забываемая деталь согласования содержимого. Если его нет, ваш CDN — бомба замедленного действия»: без него кэш раздаст всем то представление, которое увидел первым.

Самый дешёвый путь для тех, кто уже за Cloudflare: панель → домен → Rules → Settings → найти «Markdown for Agents» и включить тумблер. Конвертация идёт на краю сети, трогать сервер не надо. На WordPress — плагин roots/post-content-to-markdown одной командой composer. Для Nginx, Caddy, Next.js, Django и Rails на сайте лежат готовые конфиги; главное предупреждение — не сопоставляйте заголовок по подстроке, берите готовый парсер, иначе обычный заголовок Chrome случайно попадёт в markdown-ветку.

Кто уже шлёт этот заголовок: Claude Code, Copilot Chat и CLI, Cursor, Microsoft Copilot, OpenCode. Кто пока нет: ChatGPT в браузере, Claude.ai, Perplexity, Gemini, Windsurf. То есть сегодня это работает на агентов-кодеров, а не на потребительские ИИ-поисковики. Поэтому делайте оба пути сразу: согласование по Accept плюс объявление markdown-соседа через заголовок Link — так вас найдёт и Codex, который ходит другим способом.

Инструменты и штуки

Portable Computer (Perplexity + Nvidia). Агентная платформа Perplexity целиком на вашем железе: локальные модели, обвязка агента, движок вывода, инструменты и песочница в одном пакете (блог Perplexity). Токены не тратятся — счётчик кредитов стоит на нуле, а каждый выход в облако требует вашего подтверждения. Порог входа: видеокарта RTX от 24 ГБ памяти либо десктопный суперкомпьютер Nvidia DGX Spark за $4699; модели на старте — Qwen 3.8 27B и собственная PPLX 27B. Самое интересное — гибридный режим: на тесте терминальных задач чисто локально выходит 59,6% почти даром, с подсказками облачного Claude Opus 5 — 73% за $0,415 за задачу против 82,4% за $0,65 у чистой облачной модели.

Portable Computer: агент Perplexity, работающий полностью на локальном железе Nvidia
Portable Computer: агент Perplexity, работающий полностью на локальном железе Nvidia

BrowserOS neo. Бесплатный браузер, сделанный специально для ИИ-агентов и залогиненный в ваши настоящие аккаунты — чтобы Claude Code, Cowork, Codex и Cursor реально кликали по вебу, а не рассуждали о нём (browseros.com/neo). Закрывает ту самую дыру, из-за которой агенту приходится просить у вас пароли или упираться в капчу. Пробовать бесплатно.

OpenExecutive — открытый «ИИ-директор». Восемь агентов-специалистов — стратегия, финансы, юристы, кадры, операции, маркетинг, продукт, совет директоров — за одним лицом «руководителя», который сам решает, кого дёрнуть (GitHub, 608 звёзд, Apache 2.0). Сделала команда, которую уволили ради ИИ; собрались и выпустили это в открытый доступ. Разворачивается локально одной командой make dev, нужен ключ Anthropic — либо вообще без него, на локальных моделях через Ollama.

Самое ценное там — не мультиагентность, а приём, который можно украсть за двадцать минут: в системный промпт зашиты конкретные пороги. У финансового агента прописаны готовые пороги. Клиент должен принести втрое больше, чем стоило его привлечь. Привлечение окупается быстрее года, запас денег — от 12 месяцев. Раунд поднимают, когда в кассе ещё 6–9 месяцев, а не на последних каплях. Это превращает «дай совет» в «твоя цифра 1,2 — это расточительство, вот что делаем». Второй приём — библиотека из 17 разборов провалов (Enron, Theranos, WeWork, Quibi, Kodak), которая подмешивается в ответ, чтобы совет опирался на «вот как это ломалось».

Local AI Registry. Не программа, а данные: нормализованный реестр «какая локальная модель на каком железе запускается, какой командой и с какой скоростью» (GitHub, MIT). Внутри 98 конфигураций железа, 103 базовые модели, 372 квантизации, 1039 рецептов и 1585 наборов замеров. Ценна честная граница доверия: только 32 рецепта помечены как проверенные — с запиненной ревизией, реальным ответом модели и замером скорости; у остальных команда запуска сделана неисполняемой намеренно. Есть CLI: bin/local-ai detect определяет ваше железо, bin/local-ai choose подбирает конфиг.

Смысловой поиск по всему LessWrong. Автор прогнал модель эмбеддингов по 52 427 постам и выложил публичный поиск — 259 646 проиндексированных фрагментов, ответ за 685 мс (пост). Главный сценарий не «найти статью по слову», а вставить целиком свой черновик и увидеть, что на эту тему уже написано: ранжируются не посты, а отдельные куски аргумента. Автор проверил на себе — верхним результатом вышел чужой пост «Я построил смысловой поиск по LessWrong». Работает бесплатно и без регистрации, но живёт на голом IP-адресе без домена: пересоздаст машину — ссылка умрёт.

MulmoTerminal. Собирает целую команду кодинг-агентов — Claude Code, Codex и других — в одну сетку в браузере: смотреть, запускать и рулить всеми сразу вместо няньчания одного терминала (GitHub). Бесплатно. Для тех, у кого одновременно крутится больше трёх агентов и вкладки уже кончились.

Coldtea. Агенты, которые прогоняют каждое предложенное изменение кода на реальном устройстве, следят за приложением в бою и заводят баги раньше, чем их увидят пользователи (coldtea.ai). Бесплатно попробовать. Полезно тем, кто выкатывает мобильное приложение и не держит команду тестировщиков.

Soloop. Выдаёт «команду основателей» из ИИ — гендиректор, технический директор, маркетолог и аналитик, — которая планирует, строит и продвигает продукт (soloop.io). Цены не указаны. Идея та же, что у OpenExecutive, но упакована для одиночки без развёртывания.

Nitro. Профессиональный человеческий перевод одним вызовом API, который агент может дёрнуть сам: без аккаунта и без ключа, 80+ языков, оплата за запрос и никакой месячной платы (nitrotranslate.com). Забавный разворот тренда: инструмент, который встраивает живых людей в агентный конвейер, а не наоборот.

Telerik AI Engineering. Трассирует каждое решение ИИ-агента, кэширует повторные вызовы, чтобы не платить дважды за один и тот же ответ, и ловит всплески расходов до того, как те снесут бюджет (telerik.com). Тем, кто впервые увидел счёт за агентов и не понял, откуда он взялся.

Vercel Connect. Заменяет вечные ключи API на выдаваемые в момент работы, привязанные к конкретной задаче и самоистекающие (блог Vercel). В общем доступе, больше 100 готовых подключений — Slack, GitHub, Snowflake, Shopify. Формулировка, которая объясняет смысл: «Положить токен в хранилище означало, что его труднее украсть, но не менее опасно, когда украли». Прямо в тему сегодняшнего материала про побеги агентов из виртуалок.

Keenable. Стартап вышел из тени с $26 млн под предводительством Accel: строит поисковый индекс и слой запросов специально для ИИ-агентов (TechCrunch). Заявлено более 100 млрд документов, API уже в бою у нескольких ИИ-лабораторий. Готовится язык запросов, позволяющий отвечать, комбинируя свидетельства из нескольких источников, когда полного ответа нет ни в одном. Причина существования простая: Google и Microsoft сворачивают свои поисковые API, чтобы не есть самих себя.

Granite 4.2 от IBM. Первое у IBM семейство плотных рассуждающих моделей — 3B, 8B и 30B, все под Apache 2.0 (разбор команды на Hugging Face). Обучены с нуля примерно на 15 трлн токенов, контекст растянут до 512 тысяч. Версии 8B и 30B дополнительно прошли обучение действием в реальных песочницах: вызывать инструменты, править и запускать код, управлять терминалом, искать в вебе. У каждой переключатель «думать / не думать» плюс промежуточный экономный режим на лёгкие вопросы.

EchoWM (JoyAI-Echo от JD.com). Модель мира, которая идёт по заданной траектории камеры и одновременно генерирует видео 720p, звуки окружения, музыку и речь (GitHub, ~2 тыс. звёзд). Второй проект внутри — многосценовая генерация до пяти минут с общей памятью звука и картинки, чтобы соседние планы не разъезжались. Есть узел для ComfyUI. Важная оговорка: лицензия только для академических исследований и некоммерческого использования.

LAION Big Video Dataset. Открытый видеодатасет: 80 млн видео, 10 млн часов, 55 млн нарезанных клипов с автоматическими описаниями и 300 млн отдельных кадров (проект). Медиафайлы за ручным одобрением и весят десятки терабайт, но наборы с одними метаданными открыты и лежат в parquet. Самый интересный — 384 МБ: описания 55 млн клипов плюс просмотры, лайки, теги, категории и карта вовлечённости исходных видео. Это самостоятельно ценный ресурс для анализа, даже если вы не собираетесь обучать видеомодель. Только для исследований, не для коммерции.

Applied Compute AC2. Облако обучения и вывода для моделей с открытыми весами — та же внутренняя платформа, на которой команда строит модели для Microsoft, Nvidia, Cognition и DoorDash (анонс). Идея — «фабрика моделей»: не выбирать лучшую, а иметь воспроизводимый процесс превращения своих данных в улучшения. Старт обучения — «несколько десятков строк кода», агент Ari следит за прогонами и превращает находки в данные для следующего эксперимента. Пока закрытая бета.

x1. Превращает идею приложения в работающее приложение для iPhone: планирование, визуальный дизайн, сборка по вехам, тестирование, подготовка к публикации (x1.new). Бесплатно — 100 кредитов без карты и без срока сгорания, дальше $20, $50 или $100 в месяц. Для тех, кто не программирует.

Tellie Prompter. Телесуфлёр для Mac, который следует за вашим голосом: можно паузиться, пропускать, импровизировать — и не терять место в сценарии (tellieapp.com). Распознавание работает на устройстве. Бесплатно навсегда как обычный суфлёр плюс 10 дней полной версии без карты; полная — $29 разово, а не подписка. Тем, кто снимает уроки или ведёт эфиры.

LoupeKit. Расширение для браузера: разбирает любую открытую вкладку — определяет набор технологий с доказательствами, вытаскивает цвета, шрифты и файлы, оценивает долю сгенерированного ИИ текста (loupekit.com). Больше 70 инструментов в одной панели, работает в девяти браузерах. Бесплатный тариф без ограничений на инспектор, полная версия €6,99 в месяц или €74 навсегда.

ReWeaver DriftDetector. Сканирует любой публичный репозиторий на GitHub и оценивает по девяти измерениям, насколько он далёк от готовности к бою, привязывая каждую находку к конкретному файлу и строке (drift.reweaver.ai). Отдельно оценивает каждый коммит в истории, чтобы видеть, когда именно открылся разрыв. Полезно перед тем, как тащить чужую библиотеку в свой проект.

Два рецепта запуска огромных моделей на DGX Spark. Первый — Qwen3.8-Flash-Next на одном узле: 22 токена в секунду при полном контексте в 262 тысячи. Трюк в том, что 28% модели — не матрица для умножения, а таблица поиска. На токен из неё достают всего 16 строк. Поэтому таблицу оставляют лежать файлом на диске: потеря скорости всего 6%. Второй — GLM-5.3-Flash на 320 млрд на двух-четырёх узлах: 35,7 токена в секунду после починки семи багов нулевого дня в движке. Оба честно перечисляют грабли, второй — без лицензии, так что копировать код формально нельзя. Узел DGX Spark стоит около $4700.

«Дней без ИИ» — счётчик Hacker News. Сайт обыгрывает заводскую табличку «дней без происшествий»: показывает, сколько прошло с последнего ИИ-заголовка на Hacker News, и обнуляется каждые несколько минут (hnstats.com). Цифры отрезвляющие: в 2023 году ИИ упоминали 6% заголовков, в 2024 — 7,2%, в 2025 — 10,9%, а в 2026 году к сегодняшнему дню уже 14,4%. Рекорд суток — 19,1% 25 февраля этого года. Работает целиком в браузере на публичных API, без сервера и без кук, бесплатно.

Is GitHub Cooked? Фильтруемая история сбоев GitHub с марта 2016 года — 1127 инцидентов, примерно девять в месяц (isgithubcooked.com). Смысл не в шуточной подаче, а в фильтрах: можно отсеять сервисы, которыми вы не пользуетесь, и увидеть свою реальную картину надёжности. Готовый ИИ-крючок из данных: самый ненадёжный сервис GitHub — это Copilot, доступность 97,93% за год, что означает больше семи с половиной суток простоя. Для сравнения, документация и обсуждения — ровные 100%.

Twitter Web Viewer. Сторонний просмотрщик X: профили, лента, поиск по твитам и скачивание видео без аккаунта (twitterwebviewer.com). Проверено вживую — работает, глобальный поиск отдаёт твиты одиннадцатисекундной свежести, есть фильтры по дате, минимуму лайков, языку и только оригиналам. Бесплатно с рекламой, без неё $3,88 в месяц. Полезно, чтобы следить за ИИ-обсуждениями, не заводя аккаунт. Оговорка: это одиночный сборщик данных в серой зоне правил X, поэтому пользуйтесь «пока работает», а не стройте на нём процессы.

Magic Patterns Theme Park. Витрина фичи дизайн-систем: вы описываете свой парк аттракционов словами, а он собирается в стилистике старой игры RollerCoaster Tycoon (magicpatterns.com/theme-park). Честно: тема там ровно одна, а «Pirate Cove» и «Disco World» — это не стили, а заготовки промптов; свой парк без регистрации не сгенерировать. Смотреть как забаву дня и как наглядную демонстрацию того, что даёт жёстко заданная дизайн-система: результат не «средний ИИ-дизайн», а узнаваемый стиль.

Новости и тренды

Meta: план заменить тысячи сотрудников ИИ развалился. Проект под кодовым названием Project OT предполагал сократить команды до 60% двумя волнами (Firstpost по документам Reuters). Людей оставляли маленькими группами — присматривать за виртуальными ИИ-работниками. Вторую волну отменили. Причина в цифрах: чем больше кода писал ИИ, тем больше становилось сбоев и утечек. Число инцидентов подскочило до 405, а сотрудники стали тратить на починку до 70% времени. Сокращение на 10% штата компания всё равно провела.

Это первый крупный публично провалившийся эксперимент «заменим людей агентами», и провалился он не на генерации кода, а на его сопровождении. Урок переносится на любой масштаб: экономия на написании ничего не стоит, если она перекладывается в починку. Считайте не «сколько строк написал агент», а «сколько времени команда потратила на разгребание».

Nvidia близка к покупке Hugging Face за $13 млрд. Мы писали 25 августа, что Hugging Face прощупывает продажу. Теперь назван покупатель. Осторожно с формулировками: The Information пишет, что Nvidia согласилась купить за $12,9 млрд, Business Insider в тот же вечер — что переговоры идут и «могут развалиться» (разбор TechCrunch). Подписи нет, и Nvidia молчит: раньше она быстро опровергала публикации, которые считала неточными. Для сравнения: в 2023 году компанию оценивали в $4,5 млрд. Тонкий момент — Intel, AMD и Qualcomm были инвесторами того раунда, то есть совладельцами площадки, которую покупает их главный конкурент.

Для вас сегодня не меняется ничего: сделка не подтверждена, а закрытие займёт месяцы. Реальный риск не в том, что завтра закроют доступ за деньги — бесплатная раздача весов и есть тот актив, за который платят. Риск в медленном дрейфе: правила о том, что можно хостить, приоритет форматов Nvidia в выдаче. Разумное действие — гигиена, а не паника: держите локальные копии весов, от которых зависит ваша работа, и фиксируйте версии по хешу коммита, а не по «main».

Anthropic назовёт инвесторам рынок в $30 трлн. Готовясь к выходу на биржу, компания укажет потенциальный объём рынка выше $30 трлн — рекорд, побивающий $28,5 трлн у SpaceX (PYMNTS по данным WSJ). Текущая выручка — около $47 млрд в год, то есть до этой цифры нужно вырасти более чем в 600 раз. Число получено «из оценки стоимости всей работы, которую ИИ-модели теоретически могли бы выполнять».

Слайды с объёмом рынка — жанр продажи, а не науки: они нужны, чтобы оправдать оценку и траты на дата-центры до того, как компания докажет, что рынок возьмёт. Полезно другое: лаборатории всерьёз считают, что ИИ дотянется до каждого угла экономики. Если их арифметика верна хотя бы по направлению, вопрос «изменит ли ИИ мою работу» перестаёт быть гипотетическим.

Amazon закрывает Mechanical Turk 30 сентября. Площадка микрозадач, прожившая 21 год, закроется навсегда (объявление на mturk.com, разбор CNBC). Через неё в своё время работало более 500 тысяч человек: разметка картинок, транскрибация, опросы, модерация. Безос называл сервис «искусственным искусственным интеллектом». Выполненные задания оплатят по обычному графику, у заказчиков предоплату вернут в течение 30 дней.

Проще всего сказать «ИИ съел рынок», но правда сложнее. Спрос на человеческую разметку не упал — он ушёл к Scale AI, Mercor и Prolific. Там платят за проверяемую квалификацию, а не за клики. Добил площадку ещё и парадокс: швейцарское исследование 2023 года оценило, что до 46% исполнителей сами прогоняли задания через языковые модели. Заказчик платил человеку за «человеческие данные» и получал вывод модели. Вывод для тех, кто ищет подработку: доход от задачи, которую можно описать одним абзацем и выполнить не думая, теперь имеет срок годности. Устойчивость даёт то, что заказчик не может проверить без вас — контекст, экспертиза, ответственность за результат.

Билл Гейтс: часть профессий надо оставить людям законом. В большом эссе Гейтс предупреждает, что плана на переход к эпохе ИИ нет ни у кого (Gates Notes). Его собственная формулировка — Human Reserved, «зарезервировано за человеком», по аналогии с природными заповедниками: места, где можно построить дороги, но мы решаем не строить, потому что потеря будет слишком велика. Отправная точка личная: за его отцом, умиравшим от Альцгеймера, круглосуточно ухаживали сиделки. «В том уходе было нечто незаменимо человеческое. Ни один робот не мог бы и не должен был этого делать». Второе его предложение — налог на ИИ-токены и роботов: «Нанимаете человека — платите зарплатные налоги. Покупаете робота — обычно списываете сразу как расход». Защитить, по его оценке, можно максимум 40% рабочих мест, и он честно признаёт, что не знает, кто и по каким критериям проведёт границы.

Самое применимое в эссе — не про профессии, а про навык. «В эпоху дипфейков и дезинформации, которую можно подогнать лично под вас, умение отличать правду от неправды становится необходимым жизненным навыком». Предварительные исследования связывают интенсивное использование ИИ с ослаблением критического мышления, сильнее у молодых. То есть дорожает ровно тот навык, который ИИ незаметно атрофирует первым. Практический вывод: пользуйтесь моделью так, чтобы она придерживала ответ и подводила вас к нему, а не выдавала готовое.

Нараянан на ICML: надёжность агентов растёт почти вчетверо медленнее «ума». Профессор Принстона Арвинд Нараянан свёл десяток метрик надёжности агентов в четыре измерения и замерил динамику по моделям OpenAI, Google и Anthropic за два года (слайды с расшифровкой). Результат: точность растёт со скоростью 0,22 в год, надёжность — 0,06. Отсюда его тезис: из трёх свойств агента — универсальный, в высоких ставках, полностью автоматический — сейчас можно получить только два. И три контрпримера к «ускорили в десять раз — уволим девятерых». С эпохи машинного кода производительность разработки выросла волнами почти на порядок каждая, а занятость в отрасли — примерно в 10 000 раз. Хинтон десять лет назад дал радиологам пять лет: их стало больше. Машинный перевод достиг человеческого уровня почти десять лет назад — занятость переводчиков стабильна.

Самая применимая часть — про то, куда девать сэкономленное время. Нараянан разделяет «пол» и «потолок». Пол — это то, что ИИ делает сам, он поднимается автоматически. Потолок — то, на что вы способны вместе с ИИ. Потолок сам не растёт — его поднимаете только вы. Он тратит около десяти часов в неделю на изучение новых рабочих процессов, а не на увеличение выпуска. И его проверка себя: «Если к концу дня я не чувствую себя вымотанным — я что-то сделал не так. Я слишком много переложил на ИИ».

Внедрение ИИ выросло с 21% компаний в 2017 году до 89% в 2026, но до масштабирования дошли лишь 44%
Внедрение ИИ выросло с 21% компаний в 2017 году до 89% в 2026, но до масштабирования дошли лишь 44%

McKinsey: 89% компаний внедрили ИИ, прибыль выросла у 37%. Свежий отчёт McKinsey о состоянии ИИ: доля организаций, использующих ИИ хотя бы в одной функции, выросла с 21% в 2017 году до 89% в 2026 (отчёт McKinsey, разбор в The Neuron). До стадии масштабирования дошли 44%, на шесть пунктов больше прошлогоднего. А вот дальше расхождение: 80% работников говорят, что ИИ сделал их продуктивнее, а эффект на прибыль всей компании застрял на 37% — без изменений год к году. Параллельно вышел материал, где более 90% руководителей говорят, что ИИ не сдвинул ни занятость, ни выработку (Futurism).

Разрыв между личной продуктивностью и прибылью компании — не парадокс, а описание того, что сэкономленные часы никуда не собираются. Если вы внедряете ИИ у себя в деле, ставьте вопрос не «стало ли быстрее», а «во что превратились высвободившиеся часы». Без ответа на второй вопрос выигрыш растворяется.

GLM-5.3-Flash: топ-3 по интеллекту почти даром. Z.ai выложила модель на 320 млрд параметров с 18 млрд активных, изначально мультимодальную, с контекстом в миллион токенов — под лицензией MIT, веса открыты (анонс, независимые замеры). Третье место из 109 в индексе интеллекта Artificial Analysis. Цена — $0,15 за миллион токенов на вход и $0,50 на выход против $1,40 и $4,40 у старшей GLM-5.3. Реальная задача выходит в 7,9 раза дешевле, а против Claude Opus 5 — в 27 раз. Заодно закрылась загадка Ox Alpha, о которой мы писали 25 августа: анонимная модель на OpenRouter — это и есть GLM-5.3-Flash под псевдонимом. Веса обещали выложить в тот же вечер и выложили. Деталь, которая на Hacker News обсуждалась активнее замеров: весь скрытый трафик обслуживался на китайских ускорителях, а не на Nvidia.

На рутине — рефакторинг, разбор документов, заполнение таблиц — переход экономит в разы. Но берегитесь двух вещей. Первая: по эрудиции модель вдвое слабее старшей сестры, доля выдумок 27,6% — для фактических справок, права и медицины не годится. Вторая: несмотря на слово Flash в названии, она медленнее обычной GLM-5.3 — 50 токенов в секунду против 85. «Flash» здесь означает дёшево, а не быстро.

Qwen3.8-Flash-Next: уровень прошлогодних флагманов по цене дешёвой модели. Мы дали факт релиза одной строкой 26 августа — теперь есть цифры (анонс Qwen). Модель на 125 млрд параметров плюс 51 млрд в отдельной картотеке n-грамм; на токен считается всего 6 млрд. Контекст — 262 тысячи без растяжки и до миллиона с ней. Цена $0,15 и $0,47 за миллион токенов — примерно вдвое дешевле входа и втрое дешевле выхода, чем у предшественника. Обучение обошлось в девять раз дешевле предыдущей модели. Главная инженерная находка — та самая вторая картотека: модель ищет в ней карточку не по слову, а по слову вместе с парой предыдущих, и сразу узнаёт устойчивые обороты. Стоит это почти ноль вычислений, потому что адреса известны заранее. Отсюда и сегодняшний рецепт запуска на одном узле из раздела «Инструменты»: таблицу можно просто оставить на диске.

На кодинге и длинных агентских задачах модель обходит и собственный флагман предыдущего поколения, и Claude Opus 4.6, который дороже в 53 раза по выходу. Выигрыш в скорости концентрируется на контекстах от 128 тысяч токенов — там, где сегодня и живут агенты. Для сложных научных задач и вопросов на широкую эрудицию передовые модели по-прежнему впереди: маленькая активная часть означает меньше знаний в голове.

AWS покупает DuckLabs. Самый популярный пост дня на Hacker News — 1027 очков (заявление основателей). DuckDB — это «SQLite для аналитики»: база, которая не работает отдельным сервером, а встраивается прямо в вашу программу и молниеносно считает статистику по большим таблицам на обычном ноутбуке. Сумма не названа. Ключевое: сам открытый проект не покупают — права остаются у некоммерческого фонда, лицензия MIT сохраняется, команда остаётся в Амстердаме.

Почему покупка обработчика данных — это про ИИ, объяснил вице-президент AWS. «DuckDB — самый естественный инструмент, к которому тянутся разработчики и всё чаще агенты, когда работают с таблицами». Агент не понимает вашу таблицу магией, он выполняет запросы; DuckDB стала движком, который агенту дёшево запустить прямо внутри процесса. Опасение сообщества разумное: лицензия защищена, но приоритеты пишет владелец облака, и развитие может сместиться от локального сценария к серверному.

LinkedIn: кнопку «похоже на ИИ-шлак» нажали больше миллиона раз. Платформа сообщает, что помеченные так посты получают на 40% меньше просмотров, и добавляет предупреждение авторам (The Verge). Для тех, кто ведёт соцсети, это значит одно: сгенерированный текст теперь наказывается не вкусом читателя, а алгоритмом. Ирония, которую подметил Мэтт Вулф: где-то прямо сейчас эксперт по LinkedIn осознаёт, что длинное тире было уликой.

OpenAI просит Калифорнию ужесточить закон об ИИ-безопасности. Компания призывает добавить в SB 53 обязательный мониторинг передовых моделей во время обучения и оценки на предмет серьёзных инцидентов (TechCrunch). Разворот на 180 градусов: раньше OpenAI против этого закона выступала. Читается это так: правила для агентов будут писаться по итогам инцидентов, а не публичных слушаний. Если вы строите что-то на агентах — закладывайте, что журнал действий агента через год спросят с вас.

Странность недели: у Claude словарь всего 16 тысяч токенов. Исследователь воспроизвёл токенизатор Claude — там около 16 000 записей против 250 000 у Qwen 3.8 (Ian Barber). И Anthropic словарь не наращивает, а режет: с ~50 тысяч в Claude 3 до ~16 тысяч сегодня. Гипотеза: так обходится узкое место в обучении, где сигнал ошибки протискивается через выходной слой. Побочный эффект приятный — не появляются «глючные токены», потому что каждый токен реально обучается. Цена — примерно в 1,2–2 раза больше токенов на тот же текст. То есть один и тот же документ в Claude обойдётся дороже, чем в модели с большим словарём, и заметнее всего на длинных текстах не на английском.

Одной строкой: Google запустила отраслевые версии Gemini Enterprise для юристов и финансистов; Meta заплатит $17 млрд по иску 51 штата о вреде соцсетей детям и введёт для подростков лимит два часа в день по умолчанию; Stability AI подняла раунд на $76 млн — среди инвесторов EA, Sony, Universal и Warner Music; Product Hunt начал помечать комментарии, написанные ИИ; дыра в инструменте Nvidia для развёртывания агентов позволяла угнать агента одним заходом на вредоносную страницу; Moonshot требует 30% от того, что американские облака зарабатывают на Kimi K3; Россия использовала ChatGPT для скрытой кампании влияния на Западе.

Отдельно — страховой брокер Risklytics под риски ИИ и робототехники. Это интереснее, чем кажется. В январе отраслевой орган выпустил стандартные оговорки, аннулирующие покрытие убытков, если ИИ участвовал в любой части процесса. Публичного реестра, кто их принял, не существует.

Откомментируйте первым 👇

😎

Автор поста открыл его для большого интернета, но комментирование и движухи доступны только участникам Клуба

Что вообще здесь происходит?


Войти  или  Вступить в Клуб