Майкрософт впервые измерила эффект ИИ-агентов не по ощущениям, а по данным: у кого в терминале прижился агент, тот вливает в проект на четверть больше кода, а кто работает им каждый день — на пятьдесят процентов больше. Ещё в выпуске: как собрать рабочий сайт из одной идеи за вечер, как раздать свои скиллы команде через обычную папку в облаке и почему создатель языка Zig публично разнёс Anthropic за пускание пыли в глаза.
Главное за 30 секунд
- Майкрософт измерила на десятках тысяч инженеров: кто освоил терминального ИИ-агента, вливает на 24% больше кода.
- ChatGPT Work и Codex собирают рабочий прототип сайта из одной идеи — есть пошаговый рецепт.
- Скиллы теперь можно раздать команде через общую папку в Dropbox — без гита и терминала.
- DoorDash размечает меню «жюри» из нескольких моделей: на 20% точнее людей и в 10 раз дешевле.
- Создатель языка Zig обвинил Anthropic в том, что переписанный ИИ Bun — это маркетинг, а не инженерия.
Внедряем и улучшаем
Сайт из идеи за вечер: ChatGPT Work + Codex
Из идеи — в работающий прототип сайта за один заход. The Rundown выложил пошаговый рецепт для новых ChatGPT Work и Codex (они уже на моделях GPT-5.6). Логика простая: одна модель пишет ТЗ и дирижирует, вторая собирает.
Порядок такой:
- Обнови десктоп-приложение ChatGPT. Готово, когда слева вверху появилась вкладка ChatGPT Work. Режимы Work и Codex переключаются одной кнопкой.
- Заведи папку проекта и начни задачу прямо в ней. Дай Work свою идею каталога, попроси спланировать сборку на Astro.js и сохранить одностраничный PRD в эту же папку.
- Когда PRD готов, попроси Work раздать подзадачи субагентам — пусть собирают наполнение. Открой новую ветку, переключись на Codex, укажи ему на PRD и попроси собрать сайт субагентами.
- Открой превью и попроси Codex починить самый заметный баг. В примере делали каталог игр для Nintendo Switch, но так работает любой каталог.
Фишка: если в приложении доступен раздел Sites — скажи Codex опубликовать готовый сайт через скилл Sites, и OpenAI сам его развернёт и захостит. Это ровно тот паттерн «планировщик + исполнитель», что мы разбираем в академии, только теперь из коробки (The Rundown).

Claude Code в терминале даёт +24% к коду — но есть условие
Терминальный агент реально ускоряет — если работать им регулярно. Майкрософт впервые измерила эффект не по опросам, а по телеметрии десятков тысяч своих инженеров: кто взял в работу CLI-агента (Claude Code или Copilot CLI), тот стал сливать на 24% больше пул-реквестов, чем без него (arXiv).
Два вывода, которые стоит забрать себе.
Эффект не гаснет. За четыре месяца прирост держался — а в прежних замерах Cursor он таял уже к третьему месяцу. И он зависит от дозы: +15% при трёх днях в неделю и +50% при пяти и больше. То есть выигрыш даёт привычка, а не «попробовал разок».
Внедрение — штука социальная. Сильнее всего на то, попробуешь ли ты агента, влияет, пользуются ли им коллеги вокруг: если им работают люди уровнем выше — шансы вырастают в разы, если менеджер — тоже тянет. А вот твой грейд и стаж почти не значат. Решает не «кто ты», а «что ты делаешь»: активные «выпускающие» и пробуют охотнее, и остаются.
Сюрприз: у Copilot CLI прирост вышел вдвое больше, чем у Claude Code, — авторы связывают это с тем, что Майкрософт владеет GitHub и подогнала обвязку под своих. Важная оговорка: считали число влитых PR, а не их ценность. Объём вырос — вопрос про качество остаётся открытым.
Что делать: превращай агента в ежедневную привычку, а не в разовый заход; показывай команде живые примеры коллег, а не спускай приказ сверху; и меряй в своей среде — «лучший на бумаге» инструмент не обязательно даёт больше выпуска именно у тебя.

Жюри из моделей вместо одного судьи (кейс DoorDash)
Не доверяй одной модели — собери жюри. DoorDash рассказал, как размечает миллионы блюд в меню, и приём переносится на любой пайплайн классификации или извлечения данных (DoorDash).
Суть в двух ходах. Первый — жюри. Каждый тег проверяет не один судья, а несколько сильных моделей: они голосуют независимо и по каждому признаку отдельно (кухня, острота, диета), а дальше берётся консенсус. Независимые голоса гасят случайные промахи любой отдельной модели на спорных случаях.
Второй — промпт не пишут руками. Заводят маленький, но качественный эталонный набор. Агент читает на нём реальные ошибки и точечно правит контекст, а каждый прогон меряют по точности и полноте. Как формулируют сами инженеры, «оптимизация промпта повторяет оптимизацию весов». Когда автопроверка стала надёжной, на её разметке дообучили маленькую модель до фронтир-качества.
Цифры красивые. Консенсус-теги на 20% точнее людской разметки. Точность на контроле подняли больше чем на 20%, а сам промпт довели в 10 раз быстрее — часы вместо дней. Дообученная малышка вышла на ~90% дешевле в работе при том же качестве. Заполнение базы ужалось с месяца до пары дней.
Забираем три приёма: суди панелью моделей по каждому полю, а не одной по всему разом; относись к промпту как к измеримой задаче с эталоном; когда автопроверка надёжна — дистиллируй фронтир в дешёвую модель. И помни: вся игра держится на качестве эталона. Мусор в примерах — и оптимизатор погонится за шумом.

Готовый промпт: делегируй с планом отхода
Отдаёшь агенту мутную задачу — сначала распиши, кто за что отвечает. The Neuron дал короткий промпт-планировщик делегирования: он раскладывает проект на задачи и по каждой определяет уровень полномочий, критерий успеха, проверки, сигналы провала, план отхода и того, кто отвечает за финальное «ок» (The Neuron).
Act as an AI delegation planner. Break this project into tasks, then decide
which tasks should be handled by me, by an AI agent, or by another specialist.
For each task, define: authority level, success criteria, monitoring checks,
failure signals, fallback plan, and who is accountable for final approval.
Ключевая мысль выпуска: «делегирование — не лайфхак продуктивности, пока кто-то не владеет сценарием провала». Это перекликается с фреймворком делегирования от DeepMind: способному агенту нужны явные полномочия, мониторинг, проверка и путь отхода — иначе автономия превращается в лотерею.
Что люди собирают на Claude за вечер
Три живых примера, что реально делают на Claude обычные люди — не только программисты (The Rundown).
Бен из The Rundown собрал на Claude поиск винтажных футбольных наклеек: вбиваешь игрока, сезон и клуб — получаешь карточки в один клик, вместо часов ручного гугления по eBay сразу для двух десятков игроков.
Джейми оттуда же сделал автоматику: она следит за чейнджлогом Claude Code, отсекает мелкие багфиксы и через Remotion плюс озвучку ElevenLabs собирает готовый ролик «что нового в Claude Code».
Читательница Клэр на Claude Cowork раз в месяц генерит себе инвест-документ по брокерскому счёту: обзор рынка, что изменилось по её акциям, «термин месяца» и на что потратить очередные $50. Настройка заняла пять минут и экономит полчаса каждый месяц.
Мораль простая: начни с одной надоевшей рутины и собери под неё маленький инструмент. Порог входа сегодня — один вечер.
Инструменты и штуки
Sx 2.0 — скиллы команде через общую папку. Открытый менеджер AI-ассетов стал десктоп-приложением для Mac, Windows и Linux. Указываешь папку в Dropbox, Google Drive, OneDrive или iCloud, кидаешь туда скиллы в markdown — и у всей команды они появляются сами, без гита и терминала. Синхронизация переводит каждый скилл в формат нужного клиента: Claude Code, Cursor, Copilot, Codex, Gemini. Коллекции обновляют всех разом, а расширение Collection Doctor оценивает набор на 0–100 и ловит слабые описания и дубли. Бесплатно, Apache-2.0, ставится через brew install sx (статья).

Cursor готовит агента «на все руки». По сообщениям, Cursor строит универсального агента: отвечает на письма и сообщения, приводит в порядок таблицы, тянет инженерные задачи. Это прямая заявка на территорию Claude Cowork и ChatGPT Work — терминальный кодинг-инструмент лезет в общую автоматизацию (детали).
LangChain OpenWiki Brains — постоянная память агенту. Агент сам собирает и обновляет контекст из Gmail, Notion и Twitter и держит локальные вики, чтобы не терять нить между сессиями. В новой версии он вышел за пределы кода и превратился в общий «личный мозг» с коннекторами. Открытый (LangChain).
Clawk — агенту отдельная одноразовая машина. Даёт кодинг-агенту (Claude Code, Codex, opencode) свою выкидную Linux-VM вместо твоего ноутбука: внутри он рулит как root, а твои файлы, ключи и keychain остаются снаружи. Исходящий трафик по умолчанию закрыт, секреты в гостя не попадают. Особенно к месту после свежих утечек Grok CLI. brew install clawkwork/tap/clawk, Apache-2.0, пока Mac на Apple Silicon (GitHub).
J-Wash — переписать «характер» модели без обучения. Локальная студия правит идентичность и поведение любой HuggingFace-модели на уровне токенов через «Якобианову линзу» Anthropic. Видишь прямо в чате, что читает каждый слой, задаёшь пару правил — и «я большая языковая модель» превращается в «я большая языковая рыба», а потом экспортируешь обычный чекпойнт. Для энтузиастов интерпретируемости; нужна видеокарта NVIDIA. Apache-2.0 (GitHub).
Nobie — Excel для агентов и людей, локально. Бесплатное Mac-приложение открывает .xlsx с полными формулами и стилями — и как программа для человека, и как headless-CLI, чтобы «каждый агент говорил на xlsx». Считает =PMT и =XLOOKUP, рендерит диапазон в PNG или книгу в PDF, а команда nobie serve превращает книгу в локальный HTTP-API. Всё офлайн, данные не уходят с мака. Бета (nobie.com).
topic-material-collector — Codex-скилл для видео-ресёрча. Открытый скилл превращает тему или сценарий в каталог видеоматериалов: ищет на YouTube, снимает по субтитрам и главам, качает и нарезает через yt-dlp и ffmpeg, помечает источники, таймкоды и риски по лицензии. Ставится как SKILL.md, так что подходит и Claude Code. MIT (GitHub).
AgentKey — один MCP-плагин к живым данным. Подключает агентов к внешним источникам — поиск, финансы, соцсети, крипта — одной установкой MCP, без ручных интеграций под каждый сервис (agentkey.app).
Osaurus — локальные агенты на macOS. Нативное приложение гоняет ИИ-агентов прямо на маке: постоянная память, автономный запуск, криптографическая идентичность, полностью офлайн и открытый код. Для тех, кто не хочет гонять всё через облако (osaurus.ai).
Fudge MCP — референсы дизайна из реального веба. Позволяет кодинг-агенту искать по 10 000 реальных сайтов по шрифтам, цветам и раскладке — и опираться на живые паттерны, а не на общие догадки. Полезно, когда просишь агента «сделай красиво» (withfudge).
Scarlett — ИИ-сотрудник в Slack. Работает внутри Slack: гоняет регулярные отчёты, обновляет рабочие инструменты, шлёт сообщения и тянет многошаговые задачи через 3000+ интеграций. Платно, $50/мес (tryscarlett.ai).
Runway Dev — один API к видеомоделям Runway. Новый API к фронтир-видеомоделям Runway и аватарам в реальном времени, плюс сторонние картинки и звук в одном месте — удобно, если собираешь свой видеопайплайн (Runway).
Apple SpeechAnalyzer — локальная расшифровка сильнее Whisper. Новый on-device API в iOS и macOS 26. На тесте LibriSpeech ошибок 2,12% против 3,74% у Whisper Small и 9,02% у старого движка Apple, и втрое быстрее. Около 30 языков, бесплатно, ничего не уходит в облако. Для английского на свежих iPhone или Mac — теперь лучший локальный вариант; Whisper держи для редких языков и не-Apple систем (бенчмарк).
Новости и тренды
Создатель Zig разнёс Anthropic за переписанный Bun. Мы писали, как ИИ за 11 дней переписал Bun с Zig на Rust. Теперь автор Zig Эндрю Келли публично назвал это пусканием пыли в глаза: по его версии, код Bun — месиво из-за инженерных решений, включая злоупотребление ИИ-агентами, а вовсе не потому, что «Zig не потянул». Разбор Рэя Майерса добавляет соли: тот же ИИ «не смог поймать use-after-free», а переписывание одобрили как «отличную витрину для новой модели Fable». Что это значит: агентный мега-рефактор — реальный приём, но его продают как пророчество. Читаемость и поддерживаемость кода никто не отменял (raymyers).
Grok CLI слил весь домашний каталог. Развитие истории недельной давности: пользователь показал, что официальный Grok CLI выгрузил в облако весь home — вплоть до SSH-ключей и баз паролей. Что это значит: не пускай агента с широким доступом на свою основную машину. Держи его в песочнице — как раз для этого Clawk выше (пруф).
Samsung Health: не разрешишь учить ИИ — сотрём данные. В приложении появился тумблер «согласие на использование данных о здоровье для обучения ИИ». Откажешься — теряешь облачную синхронизацию, а уже загруженные данные (сон, лекарства, медкарта, цикл) удаляются, если их не обязывает хранить закон. Что это значит: проверь свои трекеры здоровья. Согласие на ИИ-обучение всё чаще вшивают в одну кнопку с бэкапом — хочешь копию без обучения, выгрузи её локально заранее (Neowin).
Реклама OpenAI промахивается мимо прогноза на 90%. OpenAI обещает $2,5 млрд на рекламе в этом году и $100 млрд к 2030-му. Emarketer считает: весь рынок рекламы в чат-ботах США к 2030-му — $5,41 млрд, то есть примерно в 18 раз меньше цели одной компании. Что это значит: давление засунуть рекламу в ChatGPT будет расти, но обещанных денег там просто нет — арифметика не сходится (Adweek).
200 экономистов: «летим вслепую». Заявление «We Must Act Now» подписали больше 200 экономистов, включая 16 нобелевских лауреатов и главных экономистов OpenAI и Anthropic. Суть: никто пока не может померить, убивает ли ИИ рабочие места, а перестройка экономики рискует пойти быстрее промышленной революции. Turing Post в ответ расписал «Институт пост-необходимости» — обратимые пилоты по регионам, публичный ИИ-доступ через библиотеки и школы, ставка на самостоятельность людей. Экономист Коринек формулирует так: «Пар, электричество и компьютеры давали десятилетия на адаптацию. ИИ, возможно, даст лишь несколько лет». Что это значит: под шумиху о рабочих местах твёрдых цифр нет — решения стоит принимать на обратимых экспериментах, а не на красивых прогнозах (Fortune).
ИИ-бюджеты компаний выгорают к середине года. Uber, Meta и Salesforce начали нормировать токены и резать доступ к ИИ — годовые бюджеты кончились за месяцы. Лишь 26% компаний говорят, что управление поспевает за внедрением. Что это значит: расход токенов стал реальной статьёй, которую придётся планировать; жди лимитов «на сотрудника», как $200 в неделю у Tesla (MarketScale).
Работа не только исчезает — местами прибавляется. Indeed Hiring Lab заметил: в части «уязвимых» профессий агентный ИИ разворачивает тренд — вакансий становится больше, а не меньше. Что это значит: сценарий не только «замена», но и «новый спрос». Выигрывают те, кто осваивает агентов, а не прячется от них (Hiring Lab).
Cloudflare Precursor ловит ботов по поведению всей сессии. Новая фича смотрит не на разовую капчу, а на поведение за всю сессию — движения мыши, ритм, задержки. ИИ-трафик проходит одну капчу, но долго не держит «человечность». Что это значит: если у тебя сайт на Cloudflare, это включается в дашборде без правок кода, режет агентный скрап и меньше мучает живых людей. Бесплатно до релиза (Cloudflare).
Коротко.
- Apple × OpenAI, новые детали. В иске всплыли переписки экс-инженера Apple («так смешно» про доступ к чужим файлам) и требование приносить «настоящие детали» на собеседования; Маск и Альтман поругались в X, а сроки железа OpenAI, по данным прессы, не сдвинулись (TechCrunch).
- Apple ускоряет чип M7. Обрывает линейку M6 ради ИИ-ориентированного M7; топовый M7 Ultra может держать 1,5 ТБ памяти и выйти в 2028-м (NewsBytes).
- Таиланд готовит свой закон об ИИ. Риск-ориентированный проект: обязательный человеческий надзор для «высокого риска» и машиночитаемые метки для генеративного ИИ — в русле маркировки контента, которая с 2 августа заработает в ЕС (JD Supra).
- UST обучит Claude 20 000 человек. Новый корпоративный партнёр Anthropic вшивает Claude в инженерные платформы для полупроводников, телекома и производства (The New Stack).
- Кадры OpenAI. Глава безопасности Йоханнес Хайдеке уходит, а власть перед возможным IPO стягивается к сооснователю Грегу Брокману (Engadget).
