Парный код-ревью за $3.81, свой бенчмарк из PR и голосовой GPT-Live  Публичный пост

9 июля 2026  90

DoorDash дала двум моделям вычитать свой код: дешёвая китайская модель в паре с Claude Fable 5 поймала две трети багов и обошлась в $3,81 за ревью — точнее и дешевле, чем одна топ-модель в одиночку. Такой же придирчивый ревью можно собрать у себя, а заодно научиться не верить громким цифрам бенчмарков на слово. И ещё: Claude переехал в телефон, Meta показала свой генератор картинок, а голос ChatGPT научился перебивать сам себя.

Главное за 30 секунд

  • Пара «дешёвая модель + Claude Fable 5» ловит две трети багов в код-ревью за $3,81 — дешевле и точнее одной топ-модели.
  • OpenAI признала: около 30% задач в популярном SWE-bench Pro сломаны, поэтому одной цифре бенчмарка верить нельзя.
  • Databricks показал, как собрать честный бенчмарк из уже смердженных PR — и что обвязка меняет цену задачи вдвое.
  • Claude Cowork заехал в телефон и на веб: длинные задачи идут в фоне, пока ноутбук закрыт.
  • Meta выпустила генератор картинок Muse, OpenAI включила живой голос GPT-Live, а SpaceXAI показала быстрый и дешёвый Grok 4.5.

Внедряем и улучшаем

Парный код-ревью: дешёвый «разведчик» плюс придирчивый Fable 5. DoorDash надоело гадать, можно ли доверять ИИ-ревьюеру, и она сделала свой замер — DashBench. Взяли 105 реальных прошлых правок кода и прогнали их через разные связки моделей. Одна модель в одиночку ловит лишь 20–30% проблем — а вот схема из двух моделей выстрелила.

Лучшей оказалась пара «разведчик плюс ревьюер». Дешёвая открытая китайская модель Kimi K2.6 работает разведчиком: щедро набрасывает список подозрительных мест. Дальше Claude Fable 5 всё это вычитывает и отсеивает мусор. Итог: 537 находок, точность 89,2%, полнота 65,2%, сводный балл F1 — 75,3%. Одно ревью стоит $3,81. Для сравнения: связка двух Claude дала F1 66,3%, а самая дешёвая одиночная модель нашла лишь пятую часть багов (DoorDash).

Что делать. Не сажайте на ревью одну модель. Поставьте дешёвую разведчиком, чтобы она с запасом набрасывала кандидатов, а сильную — ревьюером, чтобы резала ложные срабатывания. Соучредитель DoorDash Энди Фанг подытожил: «Качество выше, стоимость ниже». А чтобы подобрать свою пару, соберите мини-замер из десятка прошлых правок и прогоните через него пару связок.

Таблица DashBench: связки моделей для код-ревью, точность, полнота и цена за PR (DoorDash)
Таблица DashBench: связки моделей для код-ревью, точность, полнота и цена за PR (DoorDash)

Свой честный бенчмарк из своих смердженных PR (Databricks). Публичным лидербордам верить трудно: их задачи давно утекли в обучение и не похожи на ваш код. Databricks пошёл другим путём — построил замер из собственных смердженных пул-реквестов. Рецепт воспроизводимый и пригодится любой команде с историей правок.

Пошагово. Берите только реальные правки, написанные людьми, с хорошими тестами. Перепишите описание задачи так, чтобы осталась цель, но исчезло решение и объяснение «почему так». Тесты спрячьте — модель должна их пройти, не подглядывая. И обязательно отрежьте историю git: иначе агент просто «пролистает» коммиты вперёд и найдёт готовый ответ. Оценивайте настоящими тестами, а не другой моделью-судьёй — «это поощряет звучать правдоподобно вместо того, чтобы быть правым».

Что показали цифры. Открытая модель GLM 5.2 по качеству встала вровень с Opus 4.8, но дешевле: $1,28 против $1,94 за задачу. Sonnet 5 дешевле Opus по цене за токен, но задача на нём вышла дороже — $2,09 против $1,94 — и хуже по качеству: модель дольше читала и потратила почти вдвое больше токенов. Отдельный урок: одна и та же модель через разную обвязку меняет цену задачи вдвое при том же качестве. Вывод простой — цена за токен врёт, считайте цену за задачу и гоняйте простые задачи на дешёвых моделях (Databricks).

Цена против качества: модели и обвязки на замере Databricks, открытая GLM 5.2 вровень с Opus 4.8
Цена против качества: модели и обвязки на замере Databricks, открытая GLM 5.2 вровень с Opus 4.8

Не верьте одной цифре бенчмарка: 30% SWE-bench Pro сломаны (OpenAI). OpenAI перепроверила популярный кодовый бенчмарк SWE-bench Pro и нашла, что около трети задач битые. Автоматика насчитала 27,4% брака, живые инженеры — 34,1%. Причём в спорных случаях люди чаще говорили «задача сломана», так что оценка скорее занижена.

Ломаются задачи четырьмя способами. Главный — слишком строгие тесты: они требуют конкретную реализацию, которой не было в условии, и заворачивают правильный код. Дальше идут тесты с дырами, вводящие в заблуждение условия и недосказанные требования. Живой пример: в одной задаче примеры показывают один ведущий пробел, а скрытый тест требует два — верный по условию код падает из-за одного символа. Из-за этого OpenAI отозвала свою же прежнюю рекомендацию переходить на SWE-bench Pro (OpenAI).

Что это значит. Не читайте оценку модели как точную. Разрыв в пару процентов между моделями — почти наверняка шум. Не доверяйте бенчмаркам, собранным автоматом из истории GitHub: тесты там писались под один конкретный коммит, а не как честная проверка. Доверяйте замерам, которые люди собрали руками именно под оценку моделей.

Claude в телефоне и готовый промпт для встреч один на один (The Rundown). Anthropic вывела Claude Cowork на веб и в мобильное приложение — пока в бете для подписки Max. Смысл в том, что долгая задача теперь крутится в фоне, даже когда ноутбук закрыт. Отдельная фишка Dispatch держит один тред и сама раскидывает запросы: код — в Claude Code, рабочие задачи — в Cowork.

The Rundown показал, как приспособить это к живой задаче — встречам один на один с сотрудниками. Создайте новый проект в Cowork и закиньте туда стенограммы прошлых встреч. Затем дайте дословный промпт:

I work at [Company]. I manage [X] number of employees. View the transcripts
of previous 1-on-1s, organize this repo, and create a call template and
evaluation rubric that is specific to me and standard across my team

Модель соберёт из ваших разговоров единый шаблон встречи и рубрику оценки. Проведите по ним следующий разговор, заполните рубрику на сотрудника и верните файлы обратно в проект. Совет от авторов: настройте автоматику, чтобы Claude сам обновлял шаблон по мере новых стенограмм или собирал дашборд по команде (The Rundown).

«Токены — это контекст»: аудит-промпт для длинных сессий (Ник Сараев). Ник Сараев спустил $1 486 на тесты и вывел одно правило: управлять токенами — значит управлять контекстом. Прежде чем запускать длинную задачу, заставьте модель читать меньше лишнего. Его рабочий цикл: сожмите системный промпт и файлы памяти без потери смысла; велите искать по файлу перед чтением целиком; спрячьте логи и большие таблицы за инструмент-запрос вместо вставки текста; по умолчанию держите «размышления» низкими и поднимайте только на сложных решениях; проверяйте раздувание через /context.

Готовый промпт, чтобы вычистить контекст под конкретную задачу (The Neuron):

Audit this AI workflow for context waste.

Task:
[describe the thing I want the model to do]

Current context:
[paste system prompt, project instructions, file list, logs, or workflow notes]

Please:
1. Identify what context is truly needed.
2. Flag anything bulky, repeated, irrelevant, or risky to read in full.
3. Rewrite my instructions with semantic compression: preserve meaning, remove filler.
4. Add context-frugality rules:
   - Search before reading large files.
   - Read specific regions, not entire files or folders.
   - Use database/query tools for logs, CSVs, and tables.
   - Ask before expanding beyond 3 files.
   - Summarize findings before reading more.
5. Recommend the lowest thinking level that should work.
6. Give me a final copy-pasteable version of the optimized instructions.

Какая модель под какую задачу: очная ставка Grok 4.5, GPT-5.5 и Claude. Ребята из TryAI дали четырём моделям одни и те же три задания — собрать интерактивное приложение одним HTML-файлом, без библиотек и без второй попытки. Выводы практичные, хотя выборка крошечная и это витрина их же платформы.

Grok 4.5 — про скорость и цену. Первый токен за 0,44 секунды, поток вдвое быстрее остальных, самый дешёвый ответ. Провалил только самое сложное задание с состоянием — крутящийся 3D-кубик Рубика с первого раза не собрался. Claude Opus 4.8 и Fable 5 — самые надёжные строители: только они собрали кубик сразу, но за это платишь скоростью и ценой, особенно за Fable. GPT-5.5 рисует красивее всех, отвечает шустро на коротком, но на сложной логике спотыкается. Практический вывод: высокий поток однотипной генерации — на Grok или дешёвую модель, сложную задачу с первого раза — на Opus или Fable (TryAI).

Структурируй код под ИИ — теперь это ось затрат. Короткая, но точная мысль: качество ИИ-кода задаёт не только промпт, а сам контекст — то есть ваша кодовая база. Понятные, распространённые паттерны модель уже видела миллионы раз и работает по ним уверенно. Проприетарные языки и разнобой в стиле заставляют её сначала тратить контекст на изучение вашей системы, и только потом — на задачу. «Больше контекста — больше токенов, больше разброса и обычно хуже результат». Отсюда неожиданный вывод: переписать проект под ясные общие паттерны окупается уже не только модным стеком — выигрыш капает на каждой будущей ИИ-задаче (The Truth As I See It).

Fable упирается — чувствительное отдавайте Opus. Мы уже писали, что перед Fable стоит защитный классификатор, который на опасных темах перекидывает запрос на Opus. Вот как это бьёт по живой работе. Биоинформатик Роб Патро попробовал через Fable переписать свой открытый инструмент salmon с C++ на Rust — модель мгновенно отказалась из-за биологических слов в коде. Затем спросил абстрактную задачу из теории сложности, вычистив всю биологию до чистой математики, — снова отказ, без объяснения причины. Opus 4.8 обе задачи сделал спокойно. Вывод для практики: если ваша работа задевает биологию, безопасность или даже просто computer science, не бейтесь с Fable — отдавайте такие задачи обычному Claude (COMBINE-lab).

Инструменты и штуки

GeoSQL. Открытый скилл для Claude Code, Codex и Copilot, который превращает кодинг-агента в геоаналитика. Описываете задачу словами — «плотность зарядок вдоль главных дорог, покажи на карте» — а он сам находит схему базы, пишет правильный пространственный SQL и рисует результат. Фишка в «карте в цикле»: агент смотрит на отрисованную карту и сам чинит геометрические ошибки, которые текстовый цикл не замечает. Авторы заявляют четырёхкратный прирост на геозадачах. Работает с PostGIS, BigQuery, Snowflake; данные и ключи остаются у вас. Бесплатно, лицензия MIT, ставится командой pip install geosql && geosql install claude (GitHub).

Как работает GeoSQL: карта в цикле агента даёт четырёхкратный прирост на геозадачах
Как работает GeoSQL: карта в цикле агента даёт четырёхкратный прирост на геозадачах

Microsoft Flint. Промежуточный язык визуализации для ИИ-агентов от Microsoft Research. Вместо ручной настройки осей, шкал и подписей агент отдаёт компактную декларацию — данные, смысловые типы полей и тип графика, — а компилятор Flint сам выводит остальное. Один спек собирается в Vega-Lite, ECharts или Chart.js и покрывает больше 30 типов графиков. Есть библиотека и MCP-сервер, чтобы агент строил и проверял графики прямо в чате. Лицензия MIT (GitHub).

DocuBrowse. Локальный инструмент, который превращает свалку документов — PDF, Word, PowerPoint, электронные книги — в базу знаний с поиском по смыслу. Спросите «тот договор про продление аренды» и найдёте его, даже если этих слов в файле нет. Всё работает на вашей машине через Ollama: без интернета, аккаунтов и оплаты за запрос. Внутри — гибридный поиск, авто-краткое содержание и сканер персональных данных, который сам прячет лишнее. Бесплатно и открыто, лицензия GPL-3, есть сборки под Mac, Windows и Linux (GitHub).

Gemini Managed Agents (API). Google прокачала управляемых агентов в Gemini API: фоновое выполнение, подключение внешних MCP-серверов, свои вызовы функций и обновление доступов между шагами. Вы по-прежнему дёргаете одну точку API, а Gemini сам рассуждает, запускает код, ставит пакеты и лезет в веб внутри изолированной облачной песочницы. По сути агенты становятся асинхронными работниками, которые не блокируют ваше приложение (Google).

AgentScreenshots. Даёт кодинг-агентам вроде Claude Code и Codex «глаза» на интерфейс. Одной командой снимает нужный кусок UI — по CSS-селектору, а не всю страницу, — умеет открывать localhost и живые сайты, кликать, наводить, скроллить и менять размер экрана. Удобно давать агенту визуальный контекст и проверять правки фронтенда. Платный (сайт).

Talkory.ai. Задаёте вопрос — и получаете ответы сразу от нескольких моделей: GPT, Claude, Gemini, Grok и Perplexity. Показывает их бок о бок и собирает сводный вердикт с оценкой уверенности. Полезно, когда хочется перепроверить факты кросс-сверкой моделей или понять, какая лучше под вашу задачу. Есть бесплатный и платные тарифы (сайт).

Willow Frontier Mini. Бесплатная модель голосового ввода без ограничений: наговариваете — получаете чистый текст. Версия Frontier Pro метит в более быстрые и точные командные сценарии. Простая замена платным диктофонам-ассистентам (Willow).

Savi Security. Сканирует переписку, голосовые и звонки всей семьи на реалистичные ИИ-мошенничества — вплоть до мониторинга живого звонка, если разговор выглядит подозрительно. Тема злая и своевременная: голосовые подделки дешевеют. Цена — $8 в месяц (TechCrunch).

Claude for Open Source. Anthropic раздаёт подходящим мейнтейнерам и контрибьюторам открытого кода шесть месяцев Claude Max бесплатно. Ведёте открытый проект — прямой повод занести свой воркфлоу на Claude Code без расходов (Anthropic).

Onboard-CLI. Инструмент на Go, который разбирает большую кодовую базу через AST и рисует её структуру интерактивной картой. Команда onboard map открывает канвас с зависимостями, а onboard drift сверяет код с правилами архитектуры и ловит несанкционированные импорты — можно повесить в CI, чтобы держать архитектуру в узде на каждом PR. Открытый, около 49 звёзд, пока ранний (GitHub).

Kastor. «Terraform для ИИ-агентов»: агенты описываются в типизированном HCL-спеке, а тулчейн собирает из него рабочий проект и накатывает изменения через plan и apply с отслеживанием дрейфа. Смысл — версионируемый и обозримый исходник агентов вместо клик-настройки в UI. Пока проба пера: работает связка с LangGraph, лицензия Apache-2.0, около 41 звезды (GitHub).

Antidoom (Liquid AI). Открытый рецепт, который лечит зацикливание рассуждений у моделей — метод бьёт точечно по «стартовым» токенам петли и почти полностью убирает повторы. Полезно тем, кто сам дообучает модели (GitHub).

Новости и тренды

Meta выпустила свой генератор картинок Muse. Это первая собственная модель картинок у Meta — раньше компания брала чужие. Muse Image встала на второе место рейтинга Arena по картинкам, сразу за GPT Image 2. Она бесплатна внутри Meta AI, Instagram и WhatsApp, умеет искать в вебе и сама редактирует свой результат. Заодно показали превью Muse Video — оно третье в рейтинге видео. Тяжёлым пользователям обещают платную подписку.

Что это значит. Генерация картинок теперь встроена туда, где люди и так постят. Для маркетолога или продавца это быстрый цикл: прикинуть креатив для рекламы или показать товар в интерьере прямо в той же ленте, где потом публикуешь (The Rundown).

Пример Muse Image и рейтинг Arena: Muse второй после GPT Image 2
Пример Muse Image и рейтинг Arena: Muse второй после GPT Image 2

OpenAI включила живой голос GPT-Live. Новый голосовой режим слушает и говорит одновременно. Его можно перебивать, а можно молчать и думать — он не влезет. Тяжёлую работу вроде поиска или сложных рассуждений он на ходу отдаёт фоновой модели GPT-5.5 и продолжает болтать, пока та считает. Ответы теперь всплывают и картинками — карточки погоды, акций, спорта. Раскатывают уже по всему миру: бесплатному тарифу достаётся версия mini, платным — полная.

Что это значит. Голосовой разговор с ИИ впервые ощущается как разговор с живым человеком, а не рацией. Видео и показа экрана пока нет, а с неанглийскими языками бывают акцент и запинки. Стоит открыть кнопку голоса в ChatGPT и попробовать самому (OpenAI).

Голосовой GPT-Live показывает ответ карточкой: прогноз погоды прямо в разговоре
Голосовой GPT-Live показывает ответ карточкой: прогноз погоды прямо в разговоре

Grok 4.5 от SpaceXAI — ставка на цену и скорость. Переименованная в SpaceXAI команда Маска выпустила Grok 4.5, обученную вместе с Cursor. По верхним бенчмаркам она чаще уступает Fable и Opus 4.8, зато берёт ценой: $2 за миллион входных токенов и $6 за выходные, окно 500 тысяч токенов, 80 токенов в секунду и вчетверо экономнее по токенам. Модель уже в Cursor на всех тарифах и какое-то время бесплатна; в ЕС обещают к середине июля.

Что это значит. Это рабочая лошадка для объёмной генерации кода, где важны цена и скорость, а не последний процент качества. Нужен максимум — остаются Opus 4.8 и Fable (SpaceXAI).

TypeScript 7: тот же язык, но в 10 раз быстрее. Microsoft переписала компилятор TypeScript на Go. Полная проверка типов ускоряется в 8–12 раз, редактор перестаёт тормозить, падений языкового сервера стало на 60% меньше. У Slack проверка типов в CI упала с 7,5 до 1,25 минуты.

Что это значит. Быстрая проверка типов — это ещё и более быстрый цикл «правка → проверка → фикс» у ИИ-агентов, плюс короче очередь в CI. Но переход — реальная работа: часть старых настроек стала ошибками, а стеки на Vue, Svelte и Angular пока полноценно не переехали (Microsoft).

SWE-1.7 от Cognition — уровень GPT-5.5 внутри Devin. Cognition дообучила модель на открытой базе Kimi K2.7 и вышла на уровень GPT-5.5 в кодинге, а по некоторым замерам чуть выше. Работает очень быстро — 1000 токенов в секунду — и заточена под долгие автономные задачи. Что это значит: пользователям Devin есть ради чего переключиться, но модель живёт только внутри Devin — ни API, ни весов, и Opus 4.8 всё ещё сильнее (Cognition).

Mistral вышла в роботов с Robostral Navigate. Модель на 8 миллиардов параметров водит робота по зданию по команде на обычном языке — и только с одной обычной RGB-камерой, без лидаров и датчиков глубины. На стандартном замере навигации это лучший результат — 76,6%. Что это значит: если цифры подтвердятся вживую, железо для автономных роботов резко дешевеет. Но попробовать пока нечего — ни весов, ни API (Mistral).

Одноразовый ИИ-код: 73% «слоп»-приложений забросили за полгода. Разработчик из GNOME проверил приложения, что ИИ-агенты пачками сабмитили в каталог Flathub. Из 120 проектов живыми остались лишь 32 — остальные бросили или удалили. Что это значит: граница между добротным ИИ-кодом и мусором проходит по человеку, который правда понимает код и стоит за ним. Выпускайте то, что готовы поддерживать сами; понимание — это и есть ваш ров (OSnews).

Коротко. Reddit говорит, что его ИИ-защита блокирует 23 млн спам-показов в день и отзывает почти 2 млн накрученных голосов (Reddit). • Mercor разогналась до $2 млрд годовой выручки на разметке и оценке данных для ИИ-лабораторий (Future Tools). • Microsoft начала подменять модели OpenAI и Anthropic в Excel и Outlook своими MAI, чтобы срезать счёт за ИИ (TechCrunch). • Anthropic убрала скрытый трекер из Claude Code после того, как исследователи заметили сбор данных (Decrypt). • Tufa Labs выиграла конкурс ARC-AGI-3 на $37,5 тысячи, обернув маленькую модель Qwen в открытую «утиную» обвязку (Tufa Labs). • Figma забрала к себе команду ИИ-конструктора приложений Bud (Bud). • MiniMax обещает открыть веса модели на 2,7 триллиона параметров до конца года (The Decoder). • Google DeepMind и студия A24 объявили исследовательское партнёрство по ИИ в кино (Google).

Откомментируйте первым 👇

😎

Автор поста открыл его для большого интернета, но комментирование и движухи доступны только участникам Клуба

Что вообще здесь происходит?


Войти  или  Вступить в Клуб