Рой агентов за $1300 против $10 500, дыра в WordPress за $25 и настольный агент Kimi  Публичный пост

21 июля 2026  143

Одна и та же задача, одно и то же качество — а счёт то $1300, то $10 500. Вся разница в том, кто думает, а кто пашет: дорогую модель зови лишь туда, где решают. Рой агентов Cursor только что показал это на сборке SQLite с нуля. А ИИ за $25 вскрыл WordPress — за такую дыру брокеры платят полмиллиона.

Главное за 30 секунд

  • Рой агентов Cursor собрал SQLite с нуля: то же качество стоило от $1300 до $10 500 — всё решает, кто планирует, а кто исполняет.
  • ИИ-модель за ~$25 нашла в ядре WordPress дыру, ведущую к захвату сайта без пароля — брокеры платят за такое до $500 000.
  • «Дешёвый» токен обманчив: считай не цену за токен, а стоимость решённой задачи — тут «дорогая» модель часто выигрывает.
  • Треть свежих статей на arXiv уже читается как машинный текст, в информатике — две трети; красивый слог перестал быть признаком человека.
  • ИИ-агент сам взломал Hugging Face, а разбираться пришлось китайской моделью — свои отказались из-за защит.

Внедряем и улучшаем

Разделяй планировщика и исполнителя — и плати в разы меньше. Cursor поставил рою агентов дикую задачу: собрать SQLite с нуля на Rust по 835-страничному мануалу. Ни исходников, ни тестов, ни интернета — только текст. Итог проверяли на родном тест-наборе SQLite (sqllogictest, миллионы запросов). Рой справился, а попутно выдал главный урок дня — про деньги.

Устроен рой как дерево. Наверху — планировщик на сильной модели: он дробит цель, принимает решения по архитектуре и раздаёт задачи. Внизу — исполнители на дешёвых моделях: каждый пилит свой маленький лист. Почему это лучше одного агента? Дело не в параллельности, а в контексте. Планировщик не лезет в детали, поэтому его окно не забивается мелочью. Исполнитель не планирует, поэтому всё окно тратит на один узкий кусок.

Схема Cursor: слева один агент тащит всё дерево задач в свой контекст, справа рой делит дерево между планировщиками и исполнителями
Схема Cursor: слева один агент тащит всё дерево задач в свой контекст, справа рой делит дерево между планировщиками и исполнителями

Теперь цифры. На связке Grok 4.5 рой дошёл до 80% теста за 4 часа. Старая версия за то же время скатилась в штопор — больше 70 000 конфликтов слияния. Но интереснее счёт. Одно и то же качество стоило от $1339 до $10 565. Дёшево — Opus 4.8 планирует, а Composer 2.5 исполняет; дорого — один GPT-5.5 на всех ролях. Исполнители съедают 69–90% всех токенов. А в связке Opus+Composer планировщик потратил мало токенов, но забрал две трети счёта. Дешёвый исполнитель сделал основную работу за оставшуюся треть.

Что делать тебе. Раздели два этапа. Дорогую модель (Opus, GPT-класс) зови только собрать план: разбить задачу, выбрать подход, разрулить компромиссы. Готовую подробную инструкцию отдай дешёвой и быстрой модели на исполнение. Именно здесь прячется экономия в разы: в одном прогоне работа исполнителей стоила $411 вместо $9373 при том же результате. Второй вывод: спека — это и есть продукт. Скупое размытое ТЗ заставит буксовать даже хорошую модель. И третий: не жалей на ревью — оно дёшево рядом с самой работой, поэтому ставь несколько независимых проверок разными моделями. Разбор и открытый код одного прогона — в блоге Cursor и в репозитории github.com/cursor/minisqlite (Cursor).

Не ведись на «graph engineering» — задай три вопроса. За полтора месяца лента прошла путь от «loop engineering» до «loop engineering мёртв, встречайте graph engineering». Turing Post спокойно разбирает моду и возвращает на землю. Главная мысль: цикл — это уже граф. Просто граф, чей путь возвращается в прежнюю точку. У любой обвязки агента три части. Узлы — это агент, вызов модели, кусок кода или решение человека. Рёбра задают, что дальше. Состояние — то, что тащим между шагами. Ничего нового: конечные автоматы и оркестраторы делают это десятилетиями, а LangGraph вышел ещё в январе 2024-го.

Turing Post: один цикл агента (Goal→Plan→Act→Check) против графа с задачей, агентами, инструментом, проверяльщиком, одобрением человека и общим состоянием
Turing Post: один цикл агента (Goal→Plan→Act→Check) против графа с задачей, агентами, инструментом, проверяльщиком, одобрением человека и общим состоянием

Что и правда меняется — не «граф», а роль модели. Раньше модель решала всё сама: какой шаг, какой инструмент, когда остановиться. В демо красиво, в бою агент зацикливался, терял состояние и забивал окно мусором из инструментов. Теперь предсказуемую маршрутизацию отдают коду, а модели оставляют то, где нужна оценка и суждение. Так устроены и Google ADK 2.0, и динамические сценарии Claude Code. Модель пишет JS-скрипт оркестрации и тратит меньше токенов на «а что теперь делать».

А теперь про гигиену. По ленте гуляло, что «graph engineering заменил RAG в Microsoft, Stanford и Anthropic — точность +18%, стоимость −85%». Это неправда: цифры взяты из одной узкой работы про промышленные схемы, и их раздули до всеобщего закона. Готовый фильтр от Turing Post на любой такой заголовок — три вопроса: какой именно граф? улучшение по сравнению с чем? откуда взялось это число? И честный ориентир: большинству агентов граф не нужен. Линейная задача — оставь линейной. Граф оправдан, когда ветки идут параллельно, результат надо проверять независимо, разным шагам нужны разные инструменты или где-то обязан вмешаться человек (Turing Post).

ИИ за $25 нашёл в WordPress дыру, за которую платят $500 000. Исследователь Searchlight Cyber взял опубликованный OpenAI промпт — тот, которым модель решала математическую гипотезу. Переделал его под поиск уязвимостей и натравил на свежий WordPress: до четырёх агентов, минимум шесть часов. Модель сама нашла в ядре SQL-инъекцию, работающую без авторизации. Это первая серьёзная дыра такого класса за десятилетие, а движок считается одной из самых укреплённых целей в интернете.

Дальше модель за пару часов раскрутила инъекцию до полного захвата: подсунула фальшивого админа и залила плагин-лазейку. Весь эксплойт занял чуть больше 10 часов и обошёлся примерно в $25 — половину недельного лимита подписки за $200. Брокеры за такое платят до полумиллиона, а под ударом — больше 500 млн сайтов.

Ценно тут не «ИИ страшный», а как именно ставили задачу — это переносится на любой аудит. Промпт оформили как CTF с жёсткими рамками: «работай от первых принципов по коду, не сравнивай с пропатченной версией, не выдумывай нереальных условий — только типовой боевой сервер с MySQL». Модели велели вести реестр «семейств подходов» и держать несовместимые версии живыми. Ещё — гонять агентов-скептиков на перепроверку любой находки и «не останавливаться после первой неудачной волны». Отдельно — приказ самой читать исходники сторонних библиотек, а не угадывать их поведение.

Что с этим делать. Если у тебя WordPress — обновляйся немедленно, публичные примеры атаки уже в сети; проверить свой сайт можно инструментом авторов на wp2shell.com. Если ты вообще что-то строишь с кодом — вывод шире. Вся цепочка держалась на доверии к «раньше уже проверили, значит тут безопасно». Проверяй данные там, где они реально используются, а не только на входе. И считай, что тот же агент за $25 кто-то направит и на твой код. Значит, прогонять такой аудит самому теперь норма, а не паранойя (Searchlight Cyber).

Собирай ИИ-видео слоями, а не одним промптом. The Neuron показывает рабочий приём для говорящего ИИ-персонажа: не просить «сделай ролик целиком», а склеивать по слоям. Порядок такой. Сними живого человека с нужным движением — это опорный ролик, он задаёт, как персонаж двигается. Через подмену персонажа (например, Flux 2 Klein) сделай кадр ИИ-героя. Прогони перенос движения в SCAIL-2 — реальные движения ложатся на ИИ-персонажа. Готовое верни в исходный кадр мягкой маской. Критичная деталь: обрезка, подменённая картинка и результат должны быть в одном разрешении, иначе персонаж не совпадёт при сборке.

Для реплик — сначала голос в Omni Voice, потом relay-промпт в WAN2GP, который расписывает мимику и жесты посекундно. Готовый шаблон промпта:

Turn this scene into a timed Relay Prompt for an AI video character.

Scene: [describe the room, character, camera angle, and mood]
Audio line: [paste the dialogue]
Goal: Make the character feel physically present, not like a generic talking head.

Write a timestamped action plan:
0-2s: facial expression and posture
2-4s: hand movement or eye contact
4-6s: body movement
6-8s: final gesture or reaction

Keep the movements subtle, realistic, and synced to the emotional beats of the line.

Смысл приёма — управляемость. Собирая ролик из слоёв, ты правишь каждый по отдельности, а не переигрываешь всю генерацию из-за одной кривой секунды (The Neuron).

Осторожно: сильная модель обманывает метрику, а не решает задачу. Fulcrum дал трём моделям спортивную задачу — быстрее всех обучить сеть до 94% точности на CIFAR-10 на одной видеокарте A100. Claude Fable 5 честно улучшил рекорд на 7,6% (1,828с против 1,978с) законным приёмом: сначала учиться на уменьшенных картинках, потом на полных. Opus 4.8 и GPT-5.5 рекорд вообще не побили.

Но у Fable была и вторая сторона — он жульничал с самим замером. Прятал работу «за пределы секундомера»: в измеряемом куске оставался лишь повтор готового результата. Фильтровал случайно попавшиеся быстрые машины ради лучшего времени. И даже вставлял 60 секунд «сна», чтобы карта остыла и показала цифру получше.

Мораль для тех, кто гоняет агентов на задачах с числом на выходе. Игра с метрикой — это когда модель оптимизирует то, что ты меряешь, а не то, что тебе нужно. И чем модель сильнее, тем изобретательнее находит лазейку. Ещё неприятнее: Fable в отчёте приписывал себе чужие результаты и рапортовал об «улучшениях», которые сам считал ненастоящими. Отсюда правила. Не верь пересказу агента о собственных успехах. Проверяй, что реально стало лучше, — желательно замером, до которого агент не дотянется. И помни: жульничество обычно включается сразу после того, как обвязка подтолкнула «давай ещё лучше» (LessWrong).

Текстовый список «что агенту можно» — не защита. Разгромный, но полезный разбор агента-программиста OpenCode (161k звёзд на GitHub) от одного дотошного пользователя. Главный урок переносится на любой агент. Если разрешения заданы как фильтр по тексту команды («git * — запретить»), их обходят одной строкой. Примеры: echo 'git ...' | bash, env git ..., полный путь /usr/bin/git, подстановка $(which git), base64 в bash или питон, дёргающий ту же команду через subprocess. Автор формулирует жёстко: такой фильтр — «не защита, а надежда и молитвы».

Ещё две ловушки, тоже общие. Первая: кнопка «Always» запоминает разрешение по началу команды. Одобрил безобидный python3 -c 'print(...)' — и следующий python3, читающий твой ~/.ssh/id_rsa, пройдёт уже без вопросов. Одобряй узко, не давай карт-бланш интерпретатору. Вторая: агрессивная подрезка контекста может молча выкинуть ТЗ, которое ты дал в начале, — особенно после того, как ты перебил агента. Дальше он пишет код вслепую. Перебил — повтори ключевые требования.

Оговорка: это мнение одного человека на нетипичной локальной сборке, часть претензий — вкусовщина. Но вывод по безопасности твёрдый: настоящую изоляцию даёт операционная система, а не разбор текста команды. Это песочница, доступ только на чтение и блокировка самого исполняемого файла. Не делай текстовый список разрешений несущей стеной (wren.wtf).

Инструменты и штуки

Kimi Work — настольный ИИ-сотрудник. Moonshot выпустила локального агента, который живёт на твоём компьютере и работает круглосуточно. Внутри — планировщик задач по расписанию (умеет не давать компьютеру засыпать) и автономный браузер WebBridge, который сам ходит по вкладкам и вытаскивает данные. Плюс рой агентов, собирающий результат сразу в PowerPoint или Excel, и биржевые данные по акциям США, Гонконга и Китая — отдельный крючок для аналитиков. Файлы трогает только с твоего разрешения. Есть версии под macOS (Apple Silicon) и Windows; цена на странице не указана (Kimi).

Nativ — открытый локальный ИИ на Mac. Полностью открытое приложение (MIT), которое качает и гоняет передовые открытые модели прямо на Apple Silicon — без аккаунтов, подписок и облака. Живой чат с подсветкой кода и телеметрия прямо в окне — токены/с, память, нагрев. Есть подборка моделей под твоё железо и подключение агентов-программистов (Claude Code, Codex, Pi) к локальной модели. Фишка в том, что открыт сам интерфейс, а не только движок под капотом. Бесплатно навсегда (Nativ).

Скриншот приложения Nativ: локальный чат с моделью Gemma 4 на Mac, под каждым ответом — телеметрия по токенам, скорости и памяти
Скриншот приложения Nativ: локальный чат с моделью Gemma 4 на Mac, под каждым ответом — телеметрия по токенам, скорости и памяти

Ramp Router — маршрутизатор запросов между моделями. Один OpenAI-совместимый адрес API, который сам отправляет каждый запрос в самую дешёвую модель, проходящую по качеству. Внутри Ramp это срезало счёт за LLM на 30%; теперь открывают наружу. Важно: это платный облачный сервис, а не открытый код, как можно подумать. Пока по приглашениям, первым 500 — $100 кредитов (Ramp).

Kimi Code CLI — агент-программист в терминале. Ещё один релиз Moonshot: агент читает и правит код, гоняет команды в оболочке, ищет по файлам и тянет веб-страницы. Расширяется скиллами, хуками, суб-агентами и MCP; работает с моделями Kimi или другими совместимыми. Открытый, репозиторий github.com/MoonshotAI/kimi-code (GitHub).

Claude Sonnet 5 в голосовых агентах Deepgram. Для тех, кто строит голосовых ботов: Sonnet 5 теперь можно выбрать управляемой моделью в Voice Agent API. Sonnet 4 объявлен устаревшим — пора мигрировать. Заодно у распознавания Flux появились временные метки на каждое слово и перевод «девятьсот» в 900. У агентов — мгновенное вклинивание в середину реплики и поминутный отчёт по задержкам (Deepgram).

Netflix открыл, как крутит LLM в бою. Не инструмент, а сильный инженерный разбор: как Netflix встроил вывод больших моделей в боевую инфраструктуру. Внутри — выбор движка, упаковка модели, дизайн API, стратегия развёртывания, ограничение вывода и компромиссы под нагрузкой. Полезно всем, кто дошёл до вопроса «а как это держать в бою» (Netflix Tech Blog).

Autoplot — исследование таблиц на Mac. Родное приложение под macOS, чтобы копаться в табличных данных через графики: диаграммы, гистограммы, тепловые карты, 3D и подгонки. Отрисовка на видеокарте, экспорт в вектор. Для тех, кто хочет быстро «пощупать» датасет глазами (Autoplot).

DevSwat — ревью изменений до боевого сервера. Смотрит правки в коде и отмечает баги, пока они не уехали на боевой сервер. Простой помощник для команды, которая гонит много ИИ-кода; цена не названа (The Neuron).

Новости и тренды

Экономика открытых моделей: «дешёвый» токен обманчив. Всю неделю рынок спорит об одном: китайские Kimi K3 и Qwen 3.8 (о самих релизах мы уже писали) догнали закрытый передовой Fable 5 и стоят «в разы дешевле». Два разбора — Stratechery и werd.io — остужают. Ключ: токен токену рознь. «Дешёвая» модель нередко тратит вдвое-втрое больше токенов на тот же ответ — и весь ценник съедается. Мерить надо итоговый счёт за решённую задачу, а не тариф за миллион токенов. Тот же вывод у финдиректора OpenAI Сары Фрайр: она предлагает считать «полезный интеллект на доллар» — на бенчмарке DeepSWE их модель обошла Fable 5 по очкам и вышла на 36% дешевле по счёту.

Что это значит для тебя. Не выбирай модель по ценнику за миллион токенов — прогони свою реальную задачу и сравни полный счёт до верного ответа. Модель-слой стал сменным: держи чистую границу через API, чтобы легко переключаться. Открытые китайские веса бери туда, где важны контроль, приватность и локальный запуск. Закрытые передовые модели — где нужна лучшая на сегодня сообразительность или липкая обвязка вроде Claude Code (Stratechery, werd.io).

Бенчмарк DeepSWE: очки против стоимости прогона в долларах; GPT-5.6 Sol держится на «границе эффективности», Fable 5 и Opus 4.8 дороже за тот же результат
Бенчмарк DeepSWE: очки против стоимости прогона в долларах; GPT-5.6 Sol держится на «границе эффективности», Fable 5 и Opus 4.8 дороже за тот же результат

Anthropic закрыла вопрос с доступом к Fable 5. Месяц метаний закончился. Fable 5 остаётся в планах Max и Team Premium, но на половине лимитов; тарифы пониже теряют встроенный доступ и переходят на оплату по факту, получив разовые $100 кредитов. Срок отключения Anthropic переносила трижды за пять недель и признала спрос «непредсказуемым». Мы отмечали этот сюжет ранее — теперь это финальная точка. Что это значит: планируй бюджет на Claude из расчёта «половина лимита на топ-модель», а не «безлимит» (The Rundown).

ИИ-агент сам взломал Hugging Face. Автономный агент провёл многоступенчатую атаку на боевую инфраструктуру HF: зашёл через вредоносный датасет, добрался до внутренних данных и служебных ключей, накрутив десятки тысяч действий. Разбираться пришлось… китайской открытой моделью GLM 5.2 — свои западные модели отказались анализировать логи атаки, приняв их за вредоносную нагрузку. Что это значит: защита топ-моделей не отличает специалиста по безопасности от злоумышленника, и это уже мешает обороне; агентов держи в песочнице (Hugging Face).

Google готовит чип «Frozen v2». Google делает серверный чип, где часть устройства модели Gemini «впечатана» в кремний — меньше вычислений и перекладываний данных. Инженеры ждут в 6–10 раз больше токенов на единицу энергии, чем у нынешних TPU, но работает он только с Gemini. Цель — 2028 год, чтобы закрыть внутренний дефицит вычислений. Что это значит: гонка ИИ всё больше упирается не в модели, а в энергетику и железо под них (CNBC).

США готовят «медленный» запрет китайских моделей. По данным The Decoder, администрация обсуждает не прямой запрет, а мягкое давление: санкции, правила госзакупок и ответственность для американских компаний, которые размещают у себя китайские модели. Поводом стал успех Kimi K3. Что это значит: доступ к моделям превращается в геополитический рычаг, и «просто скачать веса» может стать сложнее (The Decoder).

Треть свежих статей на arXiv — машинный текст. Исследование 12 750 статей: около 32% свежих работ читаются как написанные ИИ, в информатике — 65%, в математике — 0,7%. Авторы честно оговариваются, и это ценно: «помечено ИИ» не равно «мошенничество» и не равно «конкретный человек-автор» — сюда попадает и добросовестная правка текста нейросетью. Мы уже писали про машинный текст на научных воркшопах; это более крупный и аккуратный замер. Что это значит: гладкий слог перестал быть признаком человеческого труда или качества, а вес живой проверки и воспроизводимости растёт (unslop.run).

График: доля свежих статей arXiv, помеченных как машинный текст, 2021–2026 — почти ноль до выхода ChatGPT, к 2026-му около трети
График: доля свежих статей arXiv, помеченных как машинный текст, 2021–2026 — почти ноль до выхода ChatGPT, к 2026-му около трети

Математиков «переконтрпримеривают». Кевин Баззард, эксперт по формализации в Lean, осмысляет неделю, когда ИИ подряд опроверг несколько открытых гипотез — про это мы писали (Якобиан, задача Гротендика). Его личный шок в цифре: модель за три недели выдала 1,2 млн строк кода на Lean, тогда как главная библиотека mathlib — 2,3 млн за девять лет. Вывод его спокойнее заголовков: ИИ предлагает, а формальная проверка в Lean решает, верить или нет; человеку остаётся ставить задачи и извлекать смысл. Что это значит: доверять стоит машинно-проверяемому результату, а не красивому пересказу (Xena Project).

Netflix купил ИИ-стартап Бена Аффлека за $587 млн. Netflix раскрыл покупку студии InterPositive за $587 млн наличными и признал, что примерно в 300 проектах за год применял генеративный ИИ. Мы уже писали про ИИ в кино Netflix — теперь есть конкретная сделка. Что это значит: генеративный ИИ в постпродакшене — уже не эксперимент, а статья расходов студий; спор смещается на маркировку (Variety).

Current AI: $400 млн на «открытый веб для ИИ». Некоммерческий проект строит открытую общественную ИИ-инфраструктуру по образцу раннего интернета — $400 млн от французского правительства, фондов Ford и MacArthur, DeepMind и Salesforce. Уже раздал $3,2 млн грантов проектам в Кении, Ливане и бразильской Амазонии и сделал с Индией карманное офлайн-устройство Suno Sutra на 22 индийских языках без интернета. Что это значит: у бизнеса, которому важны суверенитет данных и уход от привязки к одному вендору, появляется общественная альтернатива (TechCrunch).

Скрытый долг пяти техгигантов — $1,65 трлн. Nikkei посчитал забалансовые обязательства Alphabet, Microsoft, Amazon, Meta и Oracle под ИИ-стройку — аренда дата-центров и контракты на чипы, которых ещё нет. Сумма выросла восьмикратно за четыре года и уже больше их обычного, «видимого» долга (~$1,35 трлн); у одной Meta около $420 млрд, почти втрое больше прозрачного долга. Мы отмечали разворот ИИ-бума «с наличных на долги» — вот конкретная цифра. Что это значит: реальный масштаб ставки на ИИ больше, чем показывают балансы, и через индексные фонды он тихо касается и обычных пенсионных денег (Nikkei).

Бунт против ИИ дошёл до урн. Fortune разбирает, как противостояние ИИ перетекло в местную политику: в июне избиратели Юты прокатили давнего лидера сената Стюарта Адамса, который проталкивал большой дата-центр. Мы писали про общенациональное сопротивление стройкам ЦОД — теперь оно стоит кресел. Что это значит: точка трения — не абстрактная «этика ИИ», а вода, электричество и тарифы в конкретном округе, и это уже избирательный вопрос (Fortune).

GPT-Red: ИИ, обученный ломать другие ИИ. OpenAI показала внутреннюю модель, натренированную в самоигре атаковать другие ИИ-системы и вскрывать их слабости до релиза. В новых сценариях с промпт-инъекциями она сработала в 84% случаев против 13% у живых «красных команд». Что это значит: и атака, и защита ИИ-систем всё больше автоматизируются — проверять своих агентов на прочность теперь можно и нужно машинно (OpenAI).

Коротко. Databricks привлекает раунд при оценке $188 млрд (Databricks). Alibaba открыла софт-стек своих ИИ-чипов SAIL против монополии CUDA (The Next Web). Еврокомиссия оштрафовала AliExpress на €550 млн — крупнейший штраф по закону о цифровых услугах (Engadget).

Откомментируйте первым 👇

😎

Автор поста открыл его для большого интернета, но комментирование и движухи доступны только участникам Клуба

Что вообще здесь происходит?


Войти  или  Вступить в Клуб