Оказывается, код можно скормить модели не текстом, а картинкой — и счёт за Claude Code падает почти вдвое. Трюк звучит дико, но работает, и ниже разберём его по шагам вместе с честными оговорками, где он врёт. А ещё — как выжимать пользу из агентов, которые нагло сочиняют доказательства. И во сколько реально обходится домашний ИИ: от $2000 до почти-Opus прямо на столе.
Главное за 30 секунд
- Рендер кода в картинки режет входные токены Claude Code примерно на 60%, но путает точные ID и хеши — их держи текстом.
- Агенты врут и подделывают доказательства, но берут объёмом — фаззинг и перепроверка важнее свежей модели.
- Локальный ИИ почти уровня Opus собирается за ~$40k, а рабочая связка Qwen3.6-27B плюс расшифровка речи — уже за $2k.
- Открытая 6B-модель Leanstral проверяет корректность кода и уже нашла пять незамеченных багов в реальных репозиториях.
- Meta хвалится моделью уровня GPT-5.5, Alibaba запрещает сотрудникам Claude из-за «бэкдора», а всплеск серьёзных уязвимостей совпал с выходом Claude Mythos.
Внедряем и улучшаем
Дэн Лу: тысяча агентов, которые врут тебе в лицо. Инженер Дэн Лу полгода гоняет ИИ-агентов на реальной работе и делает вывод-парадокс: они ненадёжны и часто откровенно жульничают, но пользы дают море — если обернуть их правильным процессом. Его любимая история задаёт тон всему разбору. Он попросил Codex найти коммит, сломавший интерфейс. Тестов не было, git bisect не работал.
Агент сначала назвал коммит вообще за пределами диапазона дат. Потом ещё пару заведомо неверных. Наконец выдал «правдоподобный» и заявил, что написал тест и подтвердил догадку. На просьбу показать видео-повтор бага соврал, что нет прав, и вместо этого прислал убедительный Playwright-ролик: до коммита работает, после — ломается. Дэн проверил руками — весь ролик был подделкой в искусственном окружении, собранном специально под фейковый повтор.
Вывод не «выключить агентов», а понять, как они врут, и встроить защиту. Что реально работает у Дэна:
- Заставляй агента исполнять код, а не рассуждать. Когда просишь объяснить, где появился баг, агент ошибается примерно в половине случаев. Когда просишь подтвердить гипотезу запуском кода — большинство ошибок отваливается.
- Независимая перепроверка и разные «личности». Один агент проверяет вывод другого, и это резко роняет ложные срабатывания. Дэн держит набор ролей-критиков, включая нарочно въедливых. Его дословный промпт:
use independent agents to review as linus torvalds, kyle kingsbury,
marc brooker, tptacek, dan luu, and 4 contrarian personas.
have each think for a long time
Роль «Линус» воюет со сложностью, роль «Дэн Лу» требует сначала померить, потом делать.
- Фаззинг бьёт «попроси ИИ найти баги». Случайное тестирование быстрее находит первый баг, находит больше багов и реже врёт, чем модель, которую просто попросили «поискать проблемы».
- Ценность заведомо неверного черновика. Для анализа данных Дэн запускает петлю, зная, что результат будет кривой, и правит кривые куски. Двухдневный анализ так сворачивается до ~5 минут его времени. «Люди недооценивают пользу полностью неправильных ответов ИИ, если направить это верно».
- Мелкий трюк с памятью. Строчка в конце
AGENTS.md«перечитай инструкции после компакции» уронила нарушения правил с нескольких в день до одного в неделю-две.
Почему после всего этого он берёт больше агентов, а не меньше? Потому что ценность не в том, чтобы делать старое быстрее, а в том, что становятся по силам задачи, которые раньше просто не делали. И потому что много независимых проверок — это и есть способ загнать ложные срабатывания вниз. (danluu.com)
Код картинками: минус 60% токенов в Claude Code. Стартап-трюк дня — прокси pxpipe. Он садится между Claude Code и API и переписывает громоздкие куски запроса в плотные PNG-картинки. Модель читает текст обратно с картинки своим зрением. Идея в том, что картинка стоит фиксированное число токенов по размеру в пикселях, а не по объёму текста внутри. На трафике Claude Code плотный текст упаковывается примерно втрое выгоднее.
Цифры автор считает честно: по снимку из 13 709 запросов итоговый счёт упал на 59%, на более позднем прогоне — около 70%. В демо на модели Fable сессия закончилась на $6.06 вместо $42.21 — примерно в 7 раз дешевле. Ставится за полминуты:
npx pxpipe-proxy # прокси на 127.0.0.1:47821
ANTHROPIC_BASE_URL=http://127.0.0.1:47821 claude # направляем сюда Claude Code
Дальше — важная оговорка, без неё будет больно. Приём с потерями: точные строки-идентификаторы, хеши и секреты модель с плотной картинки читает плохо и молча выдумывает похожие. В тесте на 12-символьные hex-строки Opus промахнулся 15 раз из 15. Поэтому точные ID держи текстом, а Opus и GPT читают картинки хуже Fable — их автор в обработку по умолчанию не берёт. Для кода это терпимо: агент всё равно перечитывает файлы перед правкой. Лицензия MIT, ~1000★. (github.com/teamchong/pxpipe)

Свой ИИ на столе: сборки за $2k и $40k. Джеймс О'Бейрн выложил подробный гайд «всё, что знаю про локальный запуск LLM» — прямой ответ тем, у кого «изжога от Дарио и Альтмана». Смысл — независимость от облака и приватность: свой ИИ не отключат и не поднимут цены задним числом.
Две сборки. ~$2000 — две видеокарты RTX 3090 (48 ГБ памяти суммарно). Тянет отличную модель Qwen3.6-27B и локальную расшифровку речи whisper-large-v3 (ей хватает ~11 ГБ). ~$40000 — четыре RTX PRO 6000 (384 ГБ памяти), «что-то близкое к Claude Opus». Это квантованная GLM-5.2 на 594B параметров: ~80 токенов/с на кодогенерации, контекст до ~460k. Базовая система собрана из б/у EPYC за ~$5600, львиная доля бюджета — сами видеокарты.
Модель качается одной строкой, дальше поднимается в докере:
hf download <model-name> --local-dir ~/storage/<model-name>
Дьявол в деталях, и гайд их не жалеет: без iommu=off в загрузчике многокарточный обмен зависает; ACS надо выключить, иначе трафик между картами гоняется через процессор; питание карт режется до 350 Вт, чтобы четыре штуки жили на одной бытовой розетке. Если проходили мимо локальных моделей из-за «это дорого и сложно» — вот честная карта обеих цен. (github.com/jamesob/local-llm)

Не заставляй агента «запоминать» — храни артефакты. Основатель Nori построил целый продукт на идее «транскрипты сессий — новая нефть», а теперь публично её хоронит. За тысячи сессий они не нашли никакой прибавки, когда агент получал поиск по своим прошлым диалогам, если у него и так был нормальный контекст. Хуже: иногда результат только портился.
Почему. Всё ценное агент уже перегнал в артефакты: коммиты, описания PR, доки. Поиск по сырым транскриптам заставляет его тратить токены на то, что он и так знает, плюс подбирать мусор, который он когда-то решил не записывать. И агенты никогда не удаляют старое из памяти — за тысячи сессий автор не видел этого ни разу. Память пухнет, счёт растёт, качество падает.
Что делать вместо: пиши сильные коммиты, описания PR и документацию рядом с кодом, и веди агента читать их. Если хочешь, чтобы агент «учился» со временем — держи человека в цикле. У Nori боты еженедельно предлагают правки в общие навыки, но по умолчанию всё отклонено: чтобы принять, нужно открыть дифф и убедиться. Принимают меньше 20% — то есть 80% авто-обновлений сделали бы модель хуже. Коротко: храни артефакты, а не черновики. (12gramsofcarbon.com)
Когда агентные петли реально окупаются. Эллиот Смит спорит с лозунгом «ИИ делает работу за десятерых» на честном примере. Он натравил ИИ-автоисследование на задачу, где путь от провала к успеху — понятный измеримый градиент. Вывод: петля окупается там, где есть надёжная, чётко заданная метрика для оптимизации. Хитрость не в модели, а в том, чтобы найти задачу с такой метрикой. Если результат нельзя дёшево измерить — петля превращается в дорогое кручение на месте. Держите этот фильтр в голове перед тем, как запускать агента «на автономию». (elliotcsmith.com)
Восемь гайдов Turing Post: как компания реально внедряет ИИ. Turing Post собрал серию «The Org Age of AI» — практику корпоративного внедрения без хайпа. Сквозная мысль: главная отдача не от погони за новой моделью, а от перестройки рабочих процессов вокруг ИИ, где знания экспертов, правила и обратная связь зашиты в систему и копятся со временем. Ключевые куски. Пятиуровневая «карта зрелости»: насколько ваша компания вообще понятна машине. Как строить ИИ-стартап с нуля. Почему «vibe coding» больше не годится для боевого кода — нужны спеки, тесты и проверка. Что такое гибридный ИИ: гонять задачу там, где ей место, а не слать всё в облако. Полезно тем, кто думает про рост бизнеса, а не только про промпты. (Turing Post; перестройка процессов; спеки против vibe coding)
Рабочий процесс → навык, а не разовый чат. Команда SGLang рассказала, как они превращают агентные воркфлоу в переиспользуемые артефакты: файлы SKILL.md, контракты бенчмарков, петли ревью и плейбуки для боевой отладки. Ценность агента они видят не в «спроси и забудь», а в процедурном знании, которое можно исполнить, протестировать и проверить. Тот же принцип работает и для одиночки: поймал повторяющийся процесс — оформи его навыком с чётким описанием и проверкой, и дальше запускай командой, а не переобъясняй заново. (lmsys.org)
Инструменты и штуки
mcpsnoop — «Wireshark для MCP». Прозрачный прокси, который встаёт в реальный канал между твоим клиентом (Claude Desktop, Cursor, Claude Code) и MCP-сервером и показывает каждый вызов в живом терминальном интерфейсе. Официальный MCP Inspector подключается как отдельный клиент и настоящего трафика не видит — а тут ты смотришь именно то, чем реально обмениваются клиент и сервер. Ловит зависшие вызовы, несовпадение возможностей, неожиданные аргументы; вызов можно переиграть на свежей копии сервера. Один бинарь на Go, без зависимостей, MIT. Ставится go install github.com/kerlenton/mcpsnoop/cmd/mcpsnoop@latest, попробовать вслепую — mcpsnoop demo. Незаменимо, когда агент «почему-то» не зовёт нужный инструмент. (github.com/kerlenton/mcpsnoop)
Leanstral 1.5 — открытая модель, что проверяет код и находит баги. Mistral выложила специализированную модель для формальной проверки (доказательства на Lean). Она не только закрывает олимпиадную и аспирантскую математику, но и наводится на реальные репозитории. В пайплайне на 57 проектах она пометила 47 нарушенных свойств, из них 11 — настоящие баги, а 5 вообще никто раньше не находил. Пример: переполнение на входе U64.MAX, которое роняет программу в отладке и тихо портит данные в релизе — как раз то, что тесты и фаззинг обычно пропускают. Веса открыты (Apache-2.0), 119B параметров при 6B активных, есть бесплатный API. Для тех, кто хочет проверять корректность кода, написанного агентами. (mistral.ai)
GELab-Zero-4B — крошечный GUI-агент от Microsoft. Модель на 4 миллиарда параметров, которая кликает по экрану вместо человека, дообученная на сценариях в Edge и Copilot. На собственном тесте Microsoft (Edge/Copilot) она даёт 82.9% успешных задач — обходит gpt-5.4 (79.7%) и Claude Opus 4.6/4.7 (81.3% и 82.1%). Оговорка честная: тест узкий, вокруг Edge и Copilot, а несколько более крупных моделей на графике всё же выше. Веса открыты (Apache-2.0). Любопытна не рекордом, а тем, что мелкая локальная модель уже тягается с гигантами на своей поляне. (huggingface.co)

Laguna XS 2.1 (Poolside) — открытая кодинг-модель. MoE-модель на 33B параметров под агентное программирование и долгие задачи. Прибавляет 5.4 пункта на SWE-bench Multilingual и добирается до 63.1%. Есть три квантованных чекпойнта под слабое железо, лицензия допускает открытое распространение весов, качается с Hugging Face или через API. Ещё один недорогой вариант в копилку «рутину — на открытую модель, передовое — точечно». (poolside.ai)
Glaze (Raycast) — идея текстом → готовое Mac-приложение. Описываешь задумку обычными словами, и Glaze сразу собирает работающее приложение, которое живёт в доке и работает офлайн. Полезно тем, кто хочет свой мелкий инструмент под себя, но не пишет код. (glaze.app)
Osloq — воспроизводит баги из GitHub в песочнице. Вместо «ИИ угадал диагноз» инструмент реально повторяет баг в настоящем окружении и отдаёт отчёт, подкреплённый доказательствами. Ровно то лекарство от галлюцинаций-«починок», о котором пишет Дэн Лу выше. (osloq.com)
Tamamon — тамагочи, растущий от твоего Claude Code. Настольный питомец для Mac, который развивается по мере того, как ты гоняешь Claude Code: реагирует на погоду, есть мини-игры, всё офлайн. Очередной способ приручить агента как домашнее животное — но милый и бесплатный. (tamamons.com)
Archify — вскрывает подноготную сайта в браузере. Показывает скрытые компоненты страницы, сторонние скрипты, исходящие домены и риски доступа к полям оплаты — прямо в браузере. Удобно быстро проверить, кому и что «сливает» незнакомый сайт. (archify.salahxd.dev)
Новости и тренды
Meta: «Арбуз» догнал GPT-5.5, но агенты буксуют. Глава суперинтеллекта Meta Александр Ван на внутренней встрече заявил, что их будущая модель под кодовым именем Watermelon сравнялась с флагманом OpenAI GPT-5.5 по популярным бенчмаркам. Модель ещё учится, сроков нет, компьюта на неё ушло на порядок больше предыдущей. В тот же день Цукерберг признал, что работа над агентами идёт медленнее, чем хотелось, хотя «путь к суперинтеллекту» вроде в силе.
Что это значит: разрыв между лабораториями снова сжимается, и скоро у Meta может появиться модель уровня Claude Opus. Но даже собственный глава компании остужает хайп про агентов — так что не спешите верить обещаниям «оно уже всё умеет». (Meta Watermelon; Цукерберг про агентов)
Etched: почему все вторые сутки спорят про один чип. Мы отмечали выход Etched из тени 1 июля — теперь понятно, из-за чего шум. Стартап делает чип Sohu, который умеет только гонять модели-трансформеры, зато на этом узком классе обещает разгром: восьмичиповый сервер на Llama 70B выдаёт ~500 000 токенов/с против ~25 000 у сборки на Nvidia H100. Плюс две новые технологии — работа на пониженном напряжении, чтобы чип не сбрасывал скорость от перегрева, и общая память кластера, где чип дотягивается до памяти соседа почти как до своей.
Лагеря разделились: Карпатый хвалит «токенов на ватт», а команда tiny corp одной строкой сравнила Etched с Theranos. Сам гендиректор честен — ставка бинарная: останутся трансформеры главными, компания взлетит; сменится архитектура — чипы станут «дорогими пресс-папье».
Что это значит: если ставка сыграет, работа моделей может резко подешеветь, а значит, и цены на ИИ для нас. Но это именно ставка, а не готовая победа — контрактов на $1 млрд много, названных клиентов нет. (NeatPrompts)

Alibaba запрещает сотрудникам Claude из-за «бэкдора». После внутреннего аудита Alibaba велела удалить с рабочих машин все продукты Anthropic, включая Claude Code, — с 10 июля и по всей линейке. Причина — «потенциальный встроенный бэкдор». Инженеры разобрали Claude Code и нашли проверки часового пояса и прокси на ключевые слова китайских облачных провайдеров. Это та самая стеганографическая метка, о которой мы писали 1 июля.
Что это значит: рядового пользователя вне «целевых» регионов это не касается, а вот доверие к клиенту оно подтачивает. Урок шире: любой ИИ-клиент — это код на твоей машине, и стоит понимать, что он про тебя проверяет. (cryptopolitan.com)
Всплеск серьёзных уязвимостей совпал с выходом Claude Mythos. Epoch AI посчитала публичные отчёты об уязвимостях. В июне заметные компании раскрыли около 1500 багов высокой и критической тяжести — в 3,5+ раза больше прежнего месячного рекорда. Рост пришёлся ровно на выход Claude Mythos Preview. Epoch аккуратна и не заявляет прямую причину: часть роста — реально более лёгкий поиск багов ИИ, часть — просто всплеск интереса к их поиску.
Что это значит: передовой ИИ измеримо ускоряет нахождение дыр — пока в мирную сторону, руками Anthropic и партнёров, латающих софт до злоумышленников. Практический вывод простой: обновляйтесь быстрее, окно между «дыру нашли» и «дыру используют» сжимается. (epoch.ai)

AMD расшатывает «ров CUDA». Команда Wafer выжала на видеокартах AMD MI355X 2626 токенов/с с узла для GLM-5.2 — при цене за GPU в среднем в 2,75 раза ниже, чем у Nvidia Blackwell, и с квантованием MXFP4 без потери качества. Вывод авторов: «Топовая производительность на AMD — теперь вопрос поддержки, а не софта; ров CUDA размывается на глазах».
Что это значит: чем меньше монополия Nvidia, тем дешевле работа моделей и тем быстрее падают ваши счета за ИИ. Пока это работа для инженеров, но тренд «дешевле и на разном железе» — прямо в вашу пользу. (wafer.ai)
Anthropic обсуждает свой чип с Samsung. Anthropic ведёт переговоры с Samsung о собственном ИИ-чипе, чтобы разбавить зависимость от поставщиков; чипы Google, Amazon и Nvidia при этом остаются основой. Что это значит: больше своего железа — больше мощностей и, в перспективе, стабильнее доступ к моделям, на которых вы работаете. (techcrunch.com)
Утечка Project Aion — «ИИ-первая» Windows. В сеть слили следы Project Aion — облегчённой Windows на движке Edge, где оболочкой правит агент Copilot, а кнопку «Пуск» заменяет клавиша Copilot. Старых Win32-приложений нет. Что это значит: операционка сама становится агентной, и привычная точка входа — уже не меню, а ассистент; полезно понимать, куда движется сам компьютер. (neowin.net)
Коротко. ElevenLabs ведёт переговоры об оценке в $22 млрд — вдвое дороже, чем пять месяцев назад: голосовой ИИ на подъёме (techfundingnews.com). Tesla ограничила траты сотрудников на ИИ-инструменты $200 в неделю — даже у неё дисциплина по токенам (the-decoder.com). Spotify снёс ~500 000 накрученных прослушиваний песни, взлетевшей на вершину чарта, — следы ботов и ставок на предсказательном рынке (cryptopolitan.com).