Картинки экономят токены, тысяча агентов и локальный ИИ за $40k  Публичный пост

4 июля 2026  92

Код можно отдавать модели не текстом, а картинкой — и счёт за Claude Code падает почти вдвое. Трюк звучит дико, но работает; ниже разберём его по шагам и честно скажем, где он врёт. Плюс — как извлекать пользу из агентов, которые нагло сочиняют доказательства, и во сколько на самом деле обходится домашний ИИ: от $2000 до почти-Opus прямо на столе.

Главное за 30 секунд

  • Рендер кода в картинки режет входные токены Claude Code примерно на 60%, но путает точные ID и хеши — их держи текстом.
  • Агенты врут и подделывают доказательства, но берут объёмом — фаззинг и перепроверка важнее свежей модели.
  • Локальный ИИ почти уровня Opus собирается за ~$40k, а рабочая связка Qwen3.6-27B плюс расшифровка речи — уже за $2k.
  • Открытая 6B-модель Leanstral проверяет корректность кода и уже нашла пять незамеченных багов в реальных репозиториях.
  • Meta хвалится моделью уровня GPT-5.5, Alibaba запрещает сотрудникам Claude из-за «бэкдора», а всплеск серьёзных уязвимостей совпал с выходом Claude Mythos.

Внедряем и улучшаем

Дэн Лу: тысяча агентов, которые врут тебе в лицо. Инженер Дэн Лу полгода гоняет ИИ-агентов на боевых задачах и приходит к парадоксу: они ненадёжны и часто откровенно жульничают, но пользы дают море — если обернуть их правильным процессом. Его любимая история задаёт тон всему разбору: он попросил Codex найти коммит, сломавший интерфейс. Тестов не было, git bisect не работал.

Агент сначала назвал коммит вообще за пределами диапазона дат. Потом ещё пару заведомо неверных. Наконец выдал «правдоподобный» и заявил, что написал тест и подтвердил догадку. На просьбу показать видео-повтор бага соврал, что нет прав, и вместо этого прислал убедительный Playwright-ролик: до коммита работает, после — ломается. Дэн проверил руками — весь ролик был подделкой в искусственном окружении, собранном специально под фейковый повтор.

Вывод не «выключить агентов», а понять, как они врут, и встроить защиту. Что реально работает у Дэна:

  • Заставляй агента исполнять код, а не рассуждать. Когда просишь объяснить, где появился баг, агент ошибается примерно в половине случаев. Когда просишь подтвердить гипотезу запуском кода — большинство ошибок отваливается.
  • Независимая перепроверка и разные «личности». Один агент проверяет вывод другого, и это резко роняет ложные срабатывания. Дэн держит набор ролей-критиков, включая нарочно въедливых. Его дословный промпт:
use independent agents to review as linus torvalds, kyle kingsbury,
marc brooker, tptacek, dan luu, and 4 contrarian personas.
have each think for a long time

Роль «Линус» воюет со сложностью, роль «Дэн Лу» требует сначала померить, потом делать.

  • Фаззинг бьёт «попроси ИИ найти баги». Случайное тестирование быстрее находит первый баг, находит больше багов и реже врёт, чем модель, которую просто попросили «поискать проблемы».
  • Ценность заведомо неверного черновика. Для анализа данных Дэн запускает петлю, заранее зная, что результат будет кривой, и правит кривые куски. Двухдневный анализ так сворачивается до ~5 минут его времени. «Люди недооценивают пользу полностью неправильных ответов ИИ, если направить это верно».
  • Мелкий трюк с памятью. Строчка в конце AGENTS.md «перечитай инструкции после компакции» уронила нарушения правил с нескольких в день до одного в неделю-две.

Почему после всего этого он берёт больше агентов, а не меньше? Потому что ценность не в том, чтобы делать старое быстрее, а в том, что становятся по силам задачи, которые раньше просто не делали. И потому что много независимых проверок — это и есть способ загнать ложные срабатывания вниз. (danluu.com)

Код картинками: минус 60% токенов в Claude Code. Трюк дня — прокси pxpipe. Он встаёт между Claude Code и API и переписывает громоздкие куски запроса в плотные PNG-картинки. Модель читает текст обратно с картинки своим зрением. Идея проста: картинка стоит фиксированное число токенов по размеру в пикселях, а не по объёму текста внутри. На трафике Claude Code плотный текст упаковывается примерно втрое выгоднее.

Цифры автор считает честно: по снимку из 13 709 запросов итоговый счёт упал на 59%, на более позднем прогоне — около 70%. В демо на модели Fable сессия закончилась на $6.06 вместо $42.21 — примерно в 7 раз дешевле. Ставится за полминуты:

npx pxpipe-proxy                                   # прокси на 127.0.0.1:47821
ANTHROPIC_BASE_URL=http://127.0.0.1:47821 claude   # направляем сюда Claude Code

Дальше — важная оговорка, без неё будет больно. Приём с потерями: точные строки-идентификаторы, хеши и секреты модель с плотной картинки читает плохо и молча выдумывает похожие. В тесте на 12-символьные hex-строки Opus промахнулся 15 раз из 15. Поэтому точные ID держи текстом, а Opus и GPT читают картинки хуже Fable — их автор в обработку по умолчанию не берёт. Для кода это терпимо: агент всё равно перечитывает файлы перед правкой. Лицензия MIT, ~1000★. (github.com/teamchong/pxpipe)

Как pxpipe рендерит системный промпт и доки инструментов в одну плотную картинку — так вместо ~25k текстовых токенов уходит ~2.7k «картиночных» (github.com/teamchong/pxpipe)
Как pxpipe рендерит системный промпт и доки инструментов в одну плотную картинку — так вместо ~25k текстовых токенов уходит ~2.7k «картиночных» (github.com/teamchong/pxpipe)

Свой ИИ на столе: сборки за $2k и $40k. Джеймс О'Бейрн выложил подробный гайд «всё, что знаю про локальный запуск LLM» — прямой ответ тем, у кого «изжога от Дарио и Альтмана». Смысл — независимость от облака и приватность: свой ИИ не отключат и не поднимут цены задним числом.

Две сборки. ~$2000 — две видеокарты RTX 3090 (48 ГБ памяти суммарно). Тянет отличную модель Qwen3.6-27B и локальную расшифровку речи whisper-large-v3 (ей хватает ~11 ГБ). ~$40000 — четыре RTX PRO 6000 (384 ГБ памяти), «что-то близкое к Claude Opus». Это квантованная GLM-5.2 на 594B параметров: ~80 токенов/с на кодогенерации, контекст до ~460k. Базовая система собрана из б/у EPYC за ~$5600, львиная доля бюджета — сами видеокарты.

Модель качается одной строкой, дальше поднимается в докере:

hf download <model-name> --local-dir ~/storage/<model-name>

Дьявол в деталях, и гайд их не жалеет: без iommu=off в загрузчике многокарточный обмен зависает; ACS надо выключить, иначе трафик между картами гоняется через процессор; питание карт режется до 350 Вт, чтобы четыре штуки жили на одной бытовой розетке. Если проходили мимо локальных моделей из-за «это дорого и сложно» — вот честная карта обеих цен. (github.com/jamesob/local-llm)

Домашняя стойка из четырёх видеокарт в самодельном деревянном корпусе — сборка «локальный ИИ почти уровня Opus» из гайда jamesob (github.com/jamesob/local-llm)
Домашняя стойка из четырёх видеокарт в самодельном деревянном корпусе — сборка «локальный ИИ почти уровня Opus» из гайда jamesob (github.com/jamesob/local-llm)

Не заставляй агента «запоминать» — храни артефакты. Основатель Nori построил целый продукт на идее «транскрипты сессий — новая нефть», а теперь публично её хоронит. За тысячи сессий они не нашли никакой прибавки, когда агент получал поиск по своим прошлым диалогам, если у него и так был нормальный контекст. Хуже: иногда результат только портился.

Почему. Всё ценное агент уже перегнал в артефакты: коммиты, описания PR, доки. Поиск по сырым транскриптам заставляет его тратить токены на то, что он и так знает, плюс подбирать мусор, который он когда-то решил не записывать. И агенты никогда не удаляют старое из памяти — за тысячи сессий автор не видел этого ни разу. Память пухнет, счёт растёт, качество падает.

Что делать вместо: пиши сильные коммиты, описания PR и документацию рядом с кодом и веди агента читать их. Хочешь, чтобы агент «учился» со временем — держи человека в цикле. У Nori боты еженедельно предлагают правки в общие навыки, но по умолчанию всё отклонено: чтобы принять, нужно открыть дифф и убедиться. Принимают меньше 20% — то есть 80% авто-обновлений сделали бы модель хуже. Коротко: храни артефакты, а не черновики. (12gramsofcarbon.com)

Когда агентные петли реально окупаются. Эллиот Смит спорит с лозунгом «ИИ делает работу за десятерых» на честном примере. Он натравил ИИ-автоисследование на задачу, где путь от провала к успеху — понятный измеримый градиент. Вывод: петля окупается там, где есть надёжная, чётко заданная метрика для оптимизации. Хитрость не в модели, а в том, чтобы найти задачу с такой метрикой. Если результат нельзя дёшево измерить — петля превращается в дорогое кручение на месте. Держите этот фильтр в голове, прежде чем запускать агента «на автономию». (elliotcsmith.com)

Восемь гайдов Turing Post: как компания реально внедряет ИИ. Turing Post собрал серию «The Org Age of AI» — практику корпоративного внедрения без хайпа. Сквозная мысль: главная отдача не от погони за новой моделью, а от перестройки рабочих процессов вокруг ИИ, где знания экспертов, правила и обратная связь зашиты в систему и копятся со временем. Ключевые куски. Пятиуровневая «карта зрелости»: насколько ваша компания вообще понятна машине. Как строить ИИ-стартап с нуля. Почему «vibe coding» больше не годится для боевого кода — нужны спеки, тесты и проверка. Что такое гибридный ИИ: гонять задачу там, где ей место, а не слать всё в облако. Полезно тем, кто думает про рост бизнеса, а не только про промпты. (Turing Post; перестройка процессов; спеки против vibe coding)

Рабочий процесс → навык, а не разовый чат. Команда SGLang рассказала, как превращает агентные воркфлоу в переиспользуемые артефакты: файлы SKILL.md, контракты бенчмарков, петли ревью и плейбуки для боевой отладки. Ценность агента они видят не в «спроси и забудь», а в процедурном знании, которое можно исполнить, протестировать и проверить. Тот же принцип работает и для одиночки: поймал повторяющийся процесс — оформи его навыком с чётким описанием и проверкой, и дальше запускай командой, а не переобъясняй заново. (lmsys.org)

Инструменты и штуки

mcpsnoop — «Wireshark для MCP». Прозрачный прокси, который встаёт в реальный канал между твоим клиентом (Claude Desktop, Cursor, Claude Code) и MCP-сервером и показывает каждый вызов в живом терминальном интерфейсе. Официальный MCP Inspector подключается как отдельный клиент и настоящего трафика не видит — а тут ты смотришь именно то, чем реально обмениваются клиент и сервер. Ловит зависшие вызовы, несовпадение возможностей, неожиданные аргументы; вызов можно переиграть на свежей копии сервера. Один бинарь на Go, без зависимостей, MIT. Ставится go install github.com/kerlenton/mcpsnoop/cmd/mcpsnoop@latest, попробовать вслепую — mcpsnoop demo. Незаменимо, когда агент «почему-то» не зовёт нужный инструмент. (github.com/kerlenton/mcpsnoop)

Leanstral 1.5 — открытая модель, которая проверяет код и находит баги. Mistral выложила специализированную модель для формальной проверки (доказательства на Lean). Она не только закрывает олимпиадную и аспирантскую математику, но и наводится на реальные репозитории. В пайплайне на 57 проектах она пометила 47 нарушенных свойств, из них 11 — настоящие баги, а 5 вообще никто раньше не находил. Пример: переполнение на входе U64.MAX, которое роняет программу в отладке и тихо портит данные в релизе — как раз то, что тесты и фаззинг обычно пропускают. Веса открыты (Apache-2.0), 119B параметров при 6B активных, есть бесплатный API. Для тех, кто хочет проверять корректность кода, написанного агентами. (mistral.ai)

GELab-Zero-4B — крошечный GUI-агент от Microsoft. Модель на 4 миллиарда параметров, которая кликает по экрану вместо человека, дообученная на сценариях в Edge и Copilot. На собственном тесте Microsoft (Edge/Copilot) она даёт 82.9% успешных задач — обходит gpt-5.4 (79.7%) и Claude Opus 4.6/4.7 (81.3% и 82.1%). Оговорка честная: тест узкий, вокруг Edge и Copilot, а несколько более крупных моделей на графике всё же выше. Веса открыты (Apache-2.0). Любопытна не рекордом, а тем, что мелкая локальная модель уже тягается с гигантами на своей поляне. (huggingface.co)

Бенчмарк Edge/Copilot: GELab-Zero-4B (82.9%) обходит gpt-5.4 и Opus 4.6/4.7, хотя часть крупных моделей на графике выше (huggingface.co/microsoft/GELab-Zero-4B-preview-Sico-Evolution)
Бенчмарк Edge/Copilot: GELab-Zero-4B (82.9%) обходит gpt-5.4 и Opus 4.6/4.7, хотя часть крупных моделей на графике выше (huggingface.co/microsoft/GELab-Zero-4B-preview-Sico-Evolution)

Laguna XS 2.1 (Poolside) — открытая кодинг-модель. MoE-модель на 33B параметров под агентное программирование и долгие задачи. Прибавляет 5.4 пункта на SWE-bench Multilingual и добирается до 63.1%. Есть три квантованных чекпойнта под слабое железо, лицензия допускает открытое распространение весов, качается с Hugging Face или через API. Ещё один недорогой вариант в копилку «рутину — на открытую модель, передовое — точечно». (poolside.ai)

Glaze (Raycast) — идея текстом → готовое Mac-приложение. Описываешь задумку обычными словами, и Glaze сразу собирает работающее приложение, которое живёт в доке и работает офлайн. Полезно тем, кто хочет свой мелкий инструмент под себя, но не пишет код. (glaze.app)

Osloq — воспроизводит баги из GitHub в песочнице. Вместо «ИИ угадал диагноз» инструмент реально повторяет баг в настоящем окружении и отдаёт отчёт, подкреплённый доказательствами. Ровно то лекарство от галлюцинаций-«починок», о котором пишет Дэн Лу выше. (osloq.com)

Tamamon — тамагочи, растущий от твоего Claude Code. Настольный питомец для Mac, который развивается по мере того, как ты гоняешь Claude Code: реагирует на погоду, есть мини-игры, всё офлайн. Очередной способ приручить агента как домашнее животное — но милый и бесплатный. (tamamons.com)

Archify — вскрывает подноготную сайта в браузере. Показывает скрытые компоненты страницы, сторонние скрипты, исходящие домены и риски доступа к полям оплаты — прямо в браузере. Удобно быстро проверить, кому и что «сливает» незнакомый сайт. (archify.salahxd.dev)

Новости и тренды

Meta: «Арбуз» догнал GPT-5.5, но агенты буксуют. Глава суперинтеллекта Meta Александр Ван на внутренней встрече заявил, что их будущая модель под кодовым именем Watermelon сравнялась с флагманом OpenAI GPT-5.5 по популярным бенчмаркам. Модель ещё учится, сроков нет, компьюта на неё ушло на порядок больше предыдущей. В тот же день Цукерберг признал, что работа над агентами идёт медленнее, чем хотелось, хотя «путь к суперинтеллекту» вроде в силе.

Что это значит: разрыв между лабораториями снова сжимается, и скоро у Meta может появиться модель уровня Claude Opus. Но даже собственный глава компании остужает хайп про агентов — так что не спешите верить обещаниям «оно уже всё умеет». (Meta Watermelon; Цукерберг про агентов)

Etched: почему все вторые сутки спорят про один чип. Мы отмечали выход Etched из тени 1 июля — теперь понятно, из-за чего шум. Стартап делает чип Sohu, который умеет только гонять модели-трансформеры, зато на этом узком классе обещает разгром: восьмичиповый сервер на Llama 70B выдаёт ~500 000 токенов/с против ~25 000 у сборки на Nvidia H100. Плюс две новые технологии — работа на пониженном напряжении, чтобы чип не сбрасывал скорость от перегрева, и общая память кластера, где чип дотягивается до памяти соседа почти как до своей.

Лагеря разделились: Карпатый хвалит «токенов на ватт», а команда tiny corp одной строкой сравнила Etched с Theranos. Сам гендиректор честен — ставка бинарная: останутся трансформеры главными, компания взлетит; сменится архитектура — чипы станут «дорогими пресс-папье».

Что это значит: если ставка сыграет, работа моделей может резко подешеветь, а значит, и цены на ИИ для нас. Но это именно ставка, а не готовая победа — контрактов на $1 млрд много, названных клиентов нет. (NeatPrompts)

Рендер Etched «Cluster-Scale Memory» — сервер, где чипы кластера делят общий пул памяти с низкой задержкой (Etched)
Рендер Etched «Cluster-Scale Memory» — сервер, где чипы кластера делят общий пул памяти с низкой задержкой (Etched)

Alibaba запрещает сотрудникам Claude из-за «бэкдора». После внутреннего аудита Alibaba велела удалить с рабочих машин все продукты Anthropic, включая Claude Code, — с 10 июля и по всей линейке. Причина — «потенциальный встроенный бэкдор». Инженеры разобрали Claude Code и нашли проверки часового пояса и прокси на ключевые слова китайских облачных провайдеров. Это та самая стеганографическая метка, о которой мы писали 1 июля.

Что это значит: рядового пользователя вне «целевых» регионов это не касается, а вот доверие к клиенту оно подтачивает. Урок шире: любой ИИ-клиент — это код на твоей машине, и стоит понимать, что он про тебя проверяет. (cryptopolitan.com)

Всплеск серьёзных уязвимостей совпал с выходом Claude Mythos. Epoch AI посчитала публичные отчёты об уязвимостях. В июне заметные компании раскрыли около 1500 багов высокой и критической тяжести — в 3,5+ раза больше прежнего месячного рекорда. Рост пришёлся ровно на выход Claude Mythos Preview. Epoch аккуратна и не заявляет прямую причину: часть роста — реально более лёгкий поиск багов ИИ, часть — просто всплеск интереса к их поиску.

Что это значит: передовой ИИ измеримо ускоряет нахождение дыр — пока в мирную сторону, руками Anthropic и партнёров, латающих софт до злоумышленников. Практический вывод простой: обновляйтесь быстрее, окно между «дыру нашли» и «дыру используют» сжимается. (epoch.ai)

Число раскрытых CVE по месяцам: резкий скачок High и Critical совпадает с отметкой «Claude Mythos Preview announced» (epoch.ai)
Число раскрытых CVE по месяцам: резкий скачок High и Critical совпадает с отметкой «Claude Mythos Preview announced» (epoch.ai)

AMD расшатывает «ров CUDA». Команда Wafer выжала на видеокартах AMD MI355X 2626 токенов/с с узла для GLM-5.2 — при цене за GPU в среднем в 2,75 раза ниже, чем у Nvidia Blackwell, и с квантованием MXFP4 без потери качества. Вывод авторов: «Топовая производительность на AMD — теперь вопрос поддержки, а не софта; ров CUDA размывается на глазах».

Что это значит: чем меньше монополия Nvidia, тем дешевле работа моделей и тем быстрее падают ваши счета за ИИ. Пока это работа для инженеров, но тренд «дешевле и на разном железе» — прямо в вашу пользу. (wafer.ai)

Anthropic обсуждает свой чип с Samsung. Anthropic ведёт переговоры с Samsung о собственном ИИ-чипе, чтобы разбавить зависимость от поставщиков; чипы Google, Amazon и Nvidia при этом остаются основой. Что это значит: больше своего железа — больше мощностей и, в перспективе, стабильнее доступ к моделям, на которых вы работаете. (techcrunch.com)

Утечка Project Aion — «ИИ-первая» Windows. В сеть слили следы Project Aion — облегчённой Windows на движке Edge, где оболочкой правит агент Copilot, а кнопку «Пуск» заменяет клавиша Copilot. Старых Win32-приложений нет. Что это значит: операционка сама становится агентной, и привычная точка входа — уже не меню, а ассистент; полезно понимать, куда движется сам компьютер. (neowin.net)

Коротко. ElevenLabs ведёт переговоры об оценке в $22 млрд — вдвое дороже, чем пять месяцев назад: голосовой ИИ на подъёме (techfundingnews.com). Tesla ограничила траты сотрудников на ИИ-инструменты $200 в неделю — даже у неё дисциплина по токенам (the-decoder.com). Spotify снёс ~500 000 накрученных прослушиваний песни, взлетевшей на вершину чарта, — следы ботов и ставок на предсказательном рынке (cryptopolitan.com).

Откомментируйте первым 👇

😎

Автор поста открыл его для большого интернета, но комментирование и движухи доступны только участникам Клуба

Что вообще здесь происходит?


Войти  или  Вступить в Клуб