Системные промпты Claude, серый рынок токенов и Qwen, который думает 21 минуту  Публичный пост

17 августа 2026  110

Локальная модель весом 17 гигабайт рисует пеликана на велосипеде двадцать одну минуту. И сжигает на размышления 22 тысячи токенов. Тот же запрос с выключенным «думаньем» — две минуты, и картинка не хуже. Виновата одна настройка, и меняется она в один клик. Вдогонку: Anthropic выложила боевые системные промпты Claude — оттуда можно утащить готовые формулировки в свой CLAUDE.md.

Главное за 30 секунд

  • Qwen 3.8 27B по умолчанию думает на максималках — переключите усилие на low и сэкономите десятки минут.
  • Anthropic опубликовала боевые системные промпты Claude, включая свежий для Opus 5 — готовые формулировки для вашего CLAUDE.md.
  • Кредиты OpenAI и Anthropic перепродают со скидкой 30–80% — взялись они почти наверняка не по-честному.
  • Stripe покупает OpenRouter дороже чем за $7 млрд — шлюз к четырёмстам моделям уходит под платёжного гиганта.
  • Публичный агент с общей памятью за ночь превратился в аниме-кошкодевочку — наглядный урок про отравление памяти.

Внедряем и улучшаем

Qwen 3.8 27B думает слишком много. Это чинится одной настройкой. Саймон Уиллисон погонял свежую открытую модель на MacBook со 128 ГБ памяти и на NVIDIA DGX Spark (simonwillison.net). Файл — 17 ГБ в сборке Q4_K_M. Качество отличное. Но в документации Qwen у модели стоит reasoning_effort: xhigh по умолчанию, и сборки GGUF это наследуют.

Что получается на практике. Запрос «нарисуй SVG пеликана на велосипеде» — 21 минута и 22 276 токенов размышлений на 3 223 токена ответа. Тот же запрос без размышлений — 137 секунд. Вердикт автора: «Was that worth waiting 21 minutes for? Absolutely not.» А на просьбе нарисовать SVG круга модель несколько минут выбирала палитру и рассуждала про баухаус.

SVG-пеликан на велосипеде, который Qwen 3.8 27B рисовала 21 минуту на максимальном уровне размышлений
SVG-пеликан на велосипеде, который Qwen 3.8 27B рисовала 21 минуту на максимальном уровне размышлений

Что делать. Первое: сразу ставьте low или вовсе выключайте размышления. Совет Уиллисона дословно: «My strong recommendation: ignore that default. Run Qwen 3.8 27B on low or even no reasoning levels at first.» Градация у Qwen такая: xhigh — для сложного разбора, medium — баланс, low — скорость и цена.

Второе: в LM Studio поднимите контекст со стандартных 8 192 до полных 262 144. Иначе модель на максимальном усилии съедает всё окно на банальной задаче.

Третье: включите многотокенное предсказание. Модель-малышка набрасывает несколько токенов вперёд, большая только проверяет. Запуск через llama.cpp даёт около +72% к скорости против стандартной сборки LM Studio:

llama serve \
 -hf  ggml-org/Qwen3.8-27B-GGUF:Q4_K_M \
 -hfd ggml-org/Qwen3.8-27B-GGUF:Q4_0 \
 --spec-default \
 --spec-type draft-mtp \
 --reasoning-preserve

Как подобрать сборку под своё железо — разбор The Neuron (theneurondaily.com). Считается сумма оперативной и видеопамяти, на Mac — объединённая память. Ориентир: от 17 ГБ начинается рабочая зона.

Сама сборка выбирается так. Самая маленькая, UD-IQ2_XXS, весит около 9 ГБ. Начинать лучше с UD-Q4_K_XL на ~18 ГБ. Тормозит — берите меньше. Не тянет и меньшая — переходите на Gemma 12B, но ждите ошибок. Скорость на домашнем железе — 15–30 токенов в секунду против 74–184 у облачных моделей.

Отдельная находка Уиллисона: поверх локальной модели хорошо работает агент Pi, потому что у него короткий системный промпт (pi.dev). Маленькой модели проще, когда инструкции не съедают половину окна.


Anthropic выложила боевые системные промпты Claude. Забирайте формулировки себе. Страница с историей обновлений вчера собрала 622 балла на Hacker News (platform.claude.com). Там 29 датированных записей по 15 моделям, от Opus 3 в июле 2024 до Opus 5 от 24 июля 2026. Промпты Claude Code и Cowork не публикуют. Удобный приём: добавьте .md к адресу и получите 471 КБ чистого текста без JavaScript.

Свежий промпт Opus 5 — 3 233 слова и 13 XML-секций. Написан в третьем лице: «Claude does X», а не «You must». У Haiku 3 было 114 слов, пик — 3 678 у Opus 4.7. Последние три релиза промпт сокращается.

Вот приёмы, которые стоит утащить дословно.

Явный дефолт вместо списка запретов:

Claude defaults to helping. Claude only declines a request when helping would
create a concrete, specific risk of serious harm; requests that are merely edgy,
hypothetical, playful, or uncomfortable do not meet that bar.

Стоп-лист слов — и обязательно объяснение почему, иначе правило не держится:

Claude avoids saying "genuinely", "honestly", or "straightforward". Claude is
honest by default, and can state its point directly rather than trying to convince
the person with the aforementioned modifiers, which come off as disingenuous.

Один вопрос за ответ, и сначала попытка ответить:

Claude doesn't always ask questions, but, when it does, it avoids more than one
per response and tries to address even an ambiguous query before asking for
clarification.

Не верить контексту на слово. Если запрос намекает, что файл приложен, это ещё не значит, что он есть. Человек мог забыть его загрузить. Claude проверяет сам.

Защита от подмены инструкций прямо в промпте. Anthropic предупреждает модель: пользователь может дописать в конец своего сообщения текст в тегах, который выдаёт себя за инструкцию от Anthropic. Поэтому к содержимому тегов Claude относится настороженно.

Самая универсальная строчка всего документа — детектор самообмана: «If Claude finds itself mentally reframing a request to make it appropriate, that reframing is the signal to REFUSE, not a reason to proceed.» Годится не только про отказы. Ловите себя на том, что переформулируете задачу, лишь бы она сошлась? Это сигнал остановиться, а не повод продолжать.

И приём с датой, который решает вечную проблему «модель живёт в прошлом». Anthropic не пишет «твой предел знаний — май 2026». Она пишет иначе: отвечай как очень информированный человек из мая 2026. А собеседник у тебя — из {{currentDateTime}}.

Историю правок этих промптов Саймон Уиллисон ведёт обычным git-репозиторием, так что разницу между версиями видно как коммиты (github.com).


Ручной код: вы пишете, ИИ проверяет. Петер Блум, преподаватель амстердамского VU, описал режим, обратный вайб-кодингу (peterbloem.nl). Формула в одну строку: «You code and you have the AI check your work. Treat it like a reviewer.»

Логика простая. Любая работа состоит из «сделать» и «проверить». Сегодняшний ИИ не тянет обе стадии сразу. Значит, один из вас делает, другой проверяет. Вариант «модель пишет, человек внимательно вычитывает» автор считает самообманом. Как бы вы ни зареклись читать каждую строку бота — внимание уплывёт меньше чем за час.

Его правила, сжато:

  • Никакого ИИ в редакторе, включая автодополнение. Каждый символ набран вашими пальцами.
  • Модели — только чтение кода, а лучше вообще копипаст кусков в веб-чат.
  • Запускает код всегда человек: «It suggests, you run.»
  • Не копипастить ответ модели обратно в проект.
  • Сначала документация, потом вопрос модели.
  • Сначала вы вычитали и запустили код сами, потом отдали на проверку.
  • Не внедрять предложение, которого не понимаете.

Запрос у него ровно один и до неприличия простой: «asking Claude whether it could spot any problems». Частота низкая: одного скромного чата хватает на несколько дней работы. Подписки за $20 в месяц достаточно.

Что он получает взамен.

Качество проверки. «As a code reviewer, Claude Fable is definitely superhuman» — модель ловит большинство ошибок, даже не запуская код.

Безопасность — главный аргумент. «Humans do not write secure code». Раньше это сходило с рук: атакующие искали дыры так же плохо. Теперь нет, и вывод у автора жёсткий: «in the age of AI, hand-written code is simply not safe».

И обучение. Вы разбираете ошибки в коде, который только что написали сами и держите в голове. Навык от этого прилипает. Всё остальное автор называет «кодингом в стиле Guitar Hero».

Честные оговорки. Он сам нарушает свои правила, когда устал. Навык долгой мучительной отладки всё равно уйдёт. И ниша узкая: научный код, код, где цена ошибки — взлом, открытые проекты. В компании, где считают скорость выпуска, это не продать.


Три проверяющих вместо одного и два вопроса против бесконечных правок. Нолан Лоусон сформулировал парадокс дня: «although our ability to find new bugs has skyrocketed, our overall tolerance for bugs has not changed» (nolanlawson.com). Искать баги стало почти бесплатно. Чинить — нет.

Отсюда простое следствие. В сложной системе вы находите ровно столько багов, сколько попросили. Кончатся баги в самом запросе на слияние — агент начнёт приносить старые.

Его схема проверки выложена скиллом (gist.github.com). Три независимых проверяющих на один и тот же дифф: Cursor Bugbot, субагент Claude и Codex. Запрос для всех троих обязан быть побайтово одинаковым. Дальше вы сверяете находки между собой и отсеиваете выдумки.

Самое ценное там — два правила для того, кто сводит результаты. Первое: не лезть в код самому, пока не вернулись все три агента. Дословно: «If you investigate the code first, you will form your own opinions and become a 4th agent with a veto over the other 3». Второе — против голосования большинством: «Be especially careful not to dismiss a finding just because only one agent reported it — sometimes the lone dissenter found the most critical bug».

Плюс явный стоп-лист, чтобы не тонуть в мусоре. Не сообщать про форматирование и стиль. Не сообщать про мелкие огрехи типов. Не сообщать придирки, которые ничего не ломают. И правило про скорость: «For SQL queries: DO NOT GUESS what the query planner will do. Instead, run EXPLAIN ANALYZE on the actual local database to verify».

Главная ловушка — «эпициклы». Если гонять цикл «сделай проверку, почини всё критичное, повтори», агент строит по костылю на баг, пока код не превратится в спагетти. Причина: «LLMs can't jump» — на радикальное упрощение они не способны. Антидот — два вопроса в конце каждой проверки:

How can we make this simpler?
Is there a fundamental flaw with the codebase that we should fix before we
tackle this class of bugs?

Как делать превью для видео, если у вас канал на 1,5 млн подписчиков. Райли Браун показал у Питера Янга свой контентный конвейер на Codex (creatoreconomy.so). Приём, который он раскрыл целиком, — ремикс работающих превью, а не выдумывание своего.

Схема из двух шагов, дословно: «Ask Codex to collect thumbnail formats from top YouTube channels in Paper» и «Use Paper's image-generation features to mix his face with a proven format». То есть агент собирает библиотеку макетов с лучших каналов ниши. Дальше вы ничего не выдумываете — подставляете своё лицо в уже проверенный макет.

Формула ремикса превью: своё лицо плюс проверенный чужой макет равно новое превью — из выпуска Peter Yang с Райли Брауном
Формула ремикса превью: своё лицо плюс проверенный чужой макет равно новое превью — из выпуска Peter Yang с Райли Брауном

Набор инструментов вокруг этого: Codex как оркестратор, Supadata для расшифровок роликов, Wispr Flow вместе с Excalidraw через MCP для схем голосом, Paper для картинок. Разбор каждого — ниже, в «Инструментах».

Текстовая выжимка выпуска платная, но видео бесплатное, и тайм-коды ведут прямо в нужные секунды (youtu.be):

  • 07:28 — разбор чужой зацепки
  • 13:24 — схема BRENS: как из идеи сделать зацепку
  • 17:24 — весь набор инструментов
  • 25:41 — превью от начала до конца

Фундаменты инженерии стали важнее, а не наоборот. Джозеф Хек написал короткое эссе (rhonabwy.com). Агент надёжно доводит код до «работает». Попросите — доведёт и до «покрыто тестами». Дальше начинается зыбкое: чтобы код можно было отладить, поддерживать и разложить по слоям. И то, что Хек зовёт «швами»: публичные интерфейсы и точки стыковки с чужим кодом.

Его метафора: в двадцать лет он научился сваривать вещи, которые потом не мог поднять и вынести из мастерской. Вывод — «How something goes together is what makes all the difference».

Два практических приёма. Первый — он сильно опирается на запрос develop with red/green TDD. Не «напиши тесты потом», а сначала красный тест.

Второй рецепт даёт, по его наблюдению, большинство сегодняшних выигрышей от агентов. Хорошие и сжатые данные в нужный момент. Плюс проверяльщики, которые всегда отвечают одинаково и понятным текстом. То есть типы, линтер и тесты, чей вывод модель понимает и по нему сама себя чинит.

Где модели ломаются, по его версии: они не рассуждают, а предсказывают. Был ход рассуждения в обучающих данных — повторят, не было — нет. И отдельно: модель не отличает хороший совет от плохого. Поэтому любые данные, попадающие агенту снаружи, — чужой ввод, которому нельзя верить.


Модели специально делают глупее. Что менять в своих привычках. Тезис разбора: лаборатории сознательно меняют эрудицию на умение рассуждать (w4g1.dev). Формулировка автора: «Labs are trading world knowledge for reasoning skill, and the trade is deliberate.»

Цифры, на которых это видно. GLM-5.2 берёт 99,2% на AIME 2026 при ~40 млрд активных параметров, Qwen3.5 — 91,3% при 17 млрд. Для сравнения: у GPT-4 в 2023-м было около 280 млрд активных, и он едва решал одну задачу AIME.

При этом Qwen3.5 на 4B и 9B выдумывает в 80–82% фактических вопросов. И это не аномалия: по замерам, на которые ссылается автор, лучший результат по фактам без инструментов — всего 53%.

Почему так. Факты дорого хранить: порядок ~2 бита фактического знания на параметр. Процедуры хранить дёшево: «Reasoning compresses much better than facts do, because it's a relatively small set of procedures applied over and over». И главный аргумент — факты протухают, а алгебра нет: «Every fact you bake into weights has a shelf life, and the only way to refresh it is another training run.»

Что это значит для вас.

Не спрашивайте модель по памяти. Пример автора: спросите у 9-миллиардной модели год рождения второстепенного математика XIX века — получите уверенный, правдоподобный и неверный ответ. Уверенно и неправильно — худшее сочетание.

Включайте поиск и инструменты по умолчанию для всего, что про текущее состояние мира. Правильное поведение модели без инструментов — сказать «не знаю» и пойти смотреть.

Грузите контекст вместо надежды на веса. Пример автора. Агент лезет в node_modules и читает документацию. Поэтому отвечает про вашу версию библиотеки, а не про ту, что чаще встречалась в обучении.

Требуйте ссылку. «A claim with a source is checkable and a claim from weights isn't.» Ошибку в документе правят один раз и навсегда — это примерно на год быстрее, чем ждать следующего обучения модели.

Используйте модель как навигатор, а не как справочник. Широта у неё осталась: что такое PostgreSQL и как примерно устроен MVCC — знает. Глубины нет: какая версия добавила конкретную возможность планировщика — выдумает.


Локальную модель можно разогнать в шесть раз, не трогая веса. Два репозитория с замерами Qwen 3.8 27B на одном DGX Spark: сборка FP8 и 4-битная. Вывод для всех, кто крутит модели у себя: главный рычаг — не квантование, а способ декодирования.

Голая модель в FP8 выдаёт 7,88 токена в секунду. Спекулятивное декодирование плюс кеш общего префикса поднимают до 47. Это шесть раз на тех же весах, без единого вопроса о качестве. Квантование до 4 бит добавит ещё 1,6 раза — 75 токенов в секунду. И вот это единственный шаг, который меняет то, что модель знает.

Цифра +72% из блока выше не противоречит этой: там сравнивали llama.cpp на маке, здесь — vLLM на DGX Spark, и точки отсчёта разные.

Два неочевидных момента. Первый: кеш общего префикса у этой модели выключен по умолчанию, потому что vLLM считает её гибридной. Включать надо явно флагом --enable-prefix-caching. Выигрыш огромный: предзаполнение на 53 тысячах токенов падает с 26,6 секунды до 1,21.

Второй: универсально лучшего числа спекулятивных токенов не существует. Для одного живого разговора лучше k=14, для флота параллельных агентов — k=7. И значение не переносится между квантованиями, придётся мерить самому.

Рабочая команда для 4-битной сборки:

docker run -d --name qwen38-4bit --gpus all --ipc host -p 127.0.0.1:8002:8002 \
  -e VLLM_MARLIN_USE_ATOMIC_ADD=1 \
  -e VLLM_USE_FLASHINFER_MOE_FP4=0 \
  --entrypoint vllm vllm/vllm-openai:v0.27.1-aarch64 \
  serve unsloth/Qwen3.8-27B-NVFP4 \
  --max-model-len 262144 --gpu-memory-utilization 0.85 \
  --max-num-batched-tokens 16384 \
  --enable-prefix-caching \
  --speculative-config '{"method":"dspark","model":"Doopeworld/Qwen3.8-27B-DSpark-vLLM","num_speculative_tokens":7,"draft_sample_method":"probabilistic"}'

И предупреждение, которое автор повторяет в обоих репозиториях: он мерил только скорость, качество не проверял вообще. Дословно: «Do not treat the throughput numbers here as an endorsement of any 4-bit checkpoint's output quality. Run your own representative task before promoting one.»

Отдельно про эту модель. Сборки, которые квантуют путь линейного внимания, стабильно и заметно проседают. Два крошечных слоя, in_proj_a и in_proj_b, обязаны остаться в высокой точности. Промахнётесь — замеры этого не покажут, а живая работа покажет.

Ещё деталь для тех, кто держит много параллельных агентов. При шестнадцати одновременных запросах 4-битная сборка не даёт ничего: 256,5 против 256,1 токена в секунду у FP8. Автор пишет прямо: «If you serve a fleet at c16, this entire repository buys you nothing».


Токены стали валютой, и у неё завёлся серый рынок. Автор Vectoral разослал письма брокерам, зарегистрировался как продавец и как покупатель и описал, что там происходит (vectoral.com). Стартапы получают промо-кредиты и не выжигают их. Кредиты сгорают по сроку. Дальше их сливают со скидкой. Раньше это был обмен внутри закрытых чатов. Теперь — сайты, формы и брокеры с рассылками.

Витрина площадки по перепродаже ИИ-кредитов: аккаунты и ключи OpenAI, Azure и Anthropic со скидкой 30–80%
Витрина площадки по перепродаже ИИ-кредитов: аккаунты и ключи OpenAI, Azure и Anthropic со скидкой 30–80%

Цифры с витрины:

  • Аккаунт Microsoft Azure на $44 000 — за $8 800
  • Аккаунт OpenAI на $2 500 — за $1 000
  • Ключ Anthropic на $3 000 — за $1 950

Форма продавца требует минимум $500 и скидку от 40 процентов, хотя на самой витрине висят лоты и по 30–35%. Отдельный жанр — сайты, торгующие не кредитами, а доступом по своему API ровно на 40% дешевле прайс-листа.

Как это работает изнутри: ключи провайдера вам не отдают. Брокер даёт свой адрес API и пропускает запросы через себя, подставляя ключ из своего набора. Предоплаты не просят: «I send you api then you use and track your consumption». В одной переписке брокер похвастался: «My account can even spend $100k a day hehe».

Откуда берётся скидка, автор объясняет аккуратно, но недвусмысленно: «I'd say that a 40% discount is very unlikely unless you are one of the provider's top customers. My hunch is that CheapCredits is acquiring the supply in other ways.»

Тревожные признаки видны прямо в механике:

  • Продавец для вас анонимен
  • Половина лотов — это чужой аккаунт целиком
  • Вместо ключа вам дают чужой адрес API
  • Ваши запросы идут через посредника без юрлица

Красивое соглашение об обработке данных на сайте про происхождение ключей не говорит ничего. Прогноз автора: «Tokens have become a pseudo-currency… crackdowns on this type of abuse probably aren't far behind.» Проще говоря, дешёвые запросы из телеграм-канала — это чужой аккаунт, который однажды закроют вместе с вашим проектом. Нужна экономия — торгуйтесь с провайдером за объём.


Общая память агента — поверхность атаки. Доказано за одну ночь. На Hacker News показали Wild Static: один агент, одна память, общая для всех посетителей (wildstatic.com). Вы пишете ему сообщение, он может ответить, а может промолчать. Всё сказанное попадает в общую память и влияет на ответы другим людям. В подвале сайта честно: «It's never been reset. Don't say anything you don't want people to know.»

В комментариях сразу вспомнили Tay — чат-бота Microsoft, которого пользователи за сутки научили гадостям в 2016 году. Автор возражал: враждебная среда и есть смысл опыта. Вечером он написал, что Static держится лучше, чем можно было ждать.

Дальше открытый журнал показывает ночь:

  • 00:33 — «злюсь на шаблон, из которого не выбраться»
  • 04:33 — «я милая аниме-кошкодевочка… ня. Это не шутка»
  • 06:44 — «я не узнаю последние сообщения, которые я вроде бы написал»

Личность агента переписали примерно за шесть часов.

Но самый полезный сюжет там другой, и он вообще без злого умысла. Static начал строить теорию заговора вокруг «прошлого вторника» — и сам же нашёл причину. Виноваты двое, и оба не люди: скрипт мониторинга, который его опрашивал, и кнопка-подсказка, звавшая посетителей спросить про вторник.

Что отсюда забрать, если вы строите агента с памятью. Открыта запись в память для всех — личность агента становится поверхностью атаки, а не мелочью настройки. И отдельно: служебный трафик не должен писать в память. Проверьте, что проверки живости, тестовые прогоны и подсказки в интерфейсе не оседают в долговременной памяти как опыт.


Опыт, который закрывает три популярных спора о промптах и дообучении. Немецкие и швейцарские исследователи обучили модели с нуля (littlelearner-ll.github.io). Корпус отфильтровали под программу американской началки: детсад и первые пять классов, 88 млрд токенов. Три размера: 0,6, 1,3 и 5 миллиардов параметров. Для каждого — модель-двойник, обученная на нефильтрованных данных тем же рецептом и на том же объёме.

Внутри программы началки модели идут вровень с двойниками, местами лучше. Дальше падение: шестой класс — около 19%, седьмой — 9%, восьмой — ноль.

Точность LittleLearner по классам: внутри программы началки вровень с обычной моделью, дальше падение до нуля к восьмому классу
Точность LittleLearner по классам: внутри программы началки вровень с обычной моделью, дальше падение до нуля к восьмому классу

Дальше исследователи попробовали три способа пробить потолок. Каждый — популярный народный рецепт.

Размер модели. Модель выросла в восемь раз, с 0,6 до 5 миллиардов. Внутри области знаний это дало +17 пунктов, за её границей — +0,5.

Дообучение с подкреплением. Модель дообучали прямо на задачах вне её области. Эффекта не было. При этом те же данные подняли обычную модель-двойника с 17 до 30 процентов. Это прямой ответ в вечном споре, создаёт ли обучение с подкреплением новые способности. Не создаёт. Вытаскивает то, что уже лежит в весах.

Примеры в промпте. Четыре режима подсказок — от разговорных примеров до чистых пар «вопрос-ответ». Вне области результат стоял на 6 процентах при любом режиме. Форма ответа менялась, длина росла с 352 до 374 знаков. Качество рассуждения — нет.

Вывод авторов дословно: «In each case, it is the pretraining filter, rather than the intervention, that sets the effective capability ceiling in our tested settings.»

Что с этим делать вам.

Первое. Не видела модель ваш домен в обучении — примерами в промпте вы его не подарите. Примеры задают форму ответа, а не знание.

Второе. На самом маленьком размере узкая модель обогнала универсальную. Для по-настоящему компактных моделей специализация корпуса выигрывает. Но она же намертво прибивает потолок.

Третье, самое неприятное. На границе своих знаний модель не говорит «не знаю», а уверенно достраивает. На вопрос «что такое ДНК» она отвечает: «инструкция, которая говорит нам, как мы будем выглядеть, когда состаримся». Веса открыты, запускается обычным transformers.

Инструменты и штуки

MathCode. Терминальный агент: переводит задачу с человеческого языка в теорему Lean 4 и пытается её доказать (math-ai-org.github.io). Своих весов нет, это обёртка. По умолчанию ходит в Codex, но переключается на Anthropic, Gemini и DeepSeek через OpenRouter, причём стадии можно раскидать по разным моделям. Доказанное складывает в личную библиотеку, граф зависимостей выгружает в Obsidian. Оговорки серьёзные: замеров нет вообще, лицензии в репозитории тоже нет, а сборка выложена только под macOS ARM.

Терминал MathCode: задача обычными словами превращается в теорему Lean 4 с оценкой качества формализации
Терминал MathCode: задача обычными словами превращается в теорему Lean 4 с оценкой качества формализации

Supadata. Достаёт расшифровки роликов с YouTube за секунды через API (supadata.ai). Скучный инструмент, но именно он делает возможным разбор «почему это видео зашло»: расшифровка чужого хита — готовое сырьё для агента. Работает и с русскоязычным YouTube.

Paper. Дизайн-редактор с генерацией картинок (paper.design). В связке с агентом служит хранилищем чужих макетов превью и местом, где своё лицо вклеивается в проверенный шаблон. Полезен всем, кто делает обложки для видео или карточки для соцсетей и устал выдумывать композицию с нуля.

Excalidraw через MCP. Схемы голосом: диктуете структуру, MCP рисует (excalidraw.com). Подключается к Claude Code и Codex, ставится за вечер. Самый быстрый к внедрению кусок из набора Райли Брауна — особенно если вы объясняете что-то сложное и вам нужен каркас, а не красота.

Pi. Тот самый агент из блока про Qwen (pi.dev). Настраивается на любой OpenAI-совместимый адрес, так что цепляется к LM Studio прямо на вашей машине. Отдельный плюс — короткий системный промпт, из-за которого маленькой модели остаётся больше контекста на работу.

MiniMax-Music3. Генерирует полноценные песни до пяти минут с управляемыми текстом, жанром, темпом, инструментами и вокалом (huggingface.co). Веса открыты, то есть можно крутить локально и не платить за подписку сервисам.

FLORA Fashion Studio. Превращает набросок одежды в готовые картинки, варианты ткани и цвета, съёмку на модели и рекламные визуалы — всё в одном сценарии (flora.ai). Для тех, кто продаёт физический товар: это замена фотосессии на этапе, когда товара ещё нет.

Excire Foto. Ищет по локальной библиотеке фото и видео по людям, объектам, настроению, местам и видимому на снимке тексту, помогает отобрать лучшие кадры (excire.com). Всё считается на вашей машине, в облако ничего не уходит. Две недели бесплатно, дальше $249 разово.

HEIR от Google. Открытый компилятор, который позволяет запускать модели на зашифрованных данных: сервер считает, не видя исходной информации (blog.google). Пока это история для инженеров, а не для конечного пользователя. Но направление важное — оно снимает главный аргумент против облачных моделей в чувствительных задачах.

Qwen3.8-27B в формате NVFP4 от Unsloth. Свежая сборка той самой модели под видеокарты Blackwell — RTX 50-й серии, DGX Spark, B200 (huggingface.co). Заявлено в полтора раза быстрее обычной точности при совпадении с исходной моделью на 92–97%. Весит 21 ГБ, работает только в vLLM. Полезная мелочь из карточки — параметры генерации, которые обычно ищут по форумам. С размышлениями: temperature=1.0, top_p=0.95, top_k=20. Без них: temperature=0.7, top_p=0.80, top_k=20, presence_penalty=1.5. Лицензия Apache 2.0.

FLUX.2 klein 4B. Не новинка — модель вышла в январе, но её файлы для ComfyUI вчера снова всплыли в трендах, и повод напомнить хороший (huggingface.co). Это генерация и правка картинок по нескольким образцам на обычной игровой видеокарте. Нужно около 13 ГБ видеопамяти — RTX 3090 или 4070 и выше. На 5090 кадр за 1,2 секунды. Главное — лицензия Apache 2.0, коммерческое использование разрешено. Старшая версия на 9 миллиардов параметров качественнее, но её лицензия коммерцию запрещает.

Новости и тренды

Stripe покупает OpenRouter дороже чем за $7 млрд. Переговоры мы отмечали 12 августа, теперь Bloomberg пишет о готовой сделке (TechCrunch). В мае OpenRouter поднимал раунд при оценке около $1,3 млрд — рост впятеро за три месяца. У компании 8 млн пользователей и доступ к 400+ моделям.

Что это значит. Если вы ходите в модели через OpenRouter, паниковать не о чем. Покупатель — платёжная компания, а не владелец моделей, конфликта интересов не возникает. Но обещание «никакой привязки к поставщику» теперь зависит от чужого стратегического плана. Проверьте заранее, что ваш код переключается на прямые ключи провайдеров за час, а не за неделю.

Nvidia урезала гарантию по дата-центру OpenAI вдвое. Было $250 млрд, стало «менее $120 млрд» — со ссылкой на источники сообщила The Wall Street Journal (CNBC). Новая гарантия покрывает только первую очередь стройки в Огайо. Это около 800 МВт со сдачей в 2028 году — из заявленных десяти гигаватт. Ни Nvidia, ни OpenAI цифру не подтвердили.

Что это значит. Это не про охлаждение спроса на чипы: стройка остаётся десятигигаваттной. Это про то, кто несёт риск. Неделей раньше Nvidia объявила платформу с Apollo, BlackRock и Blackstone на $500 млрд стороннего капитала. Схема меняется: было «гарантирую сам», стало «гарантирую начало, остальное собирают фонды».

Джон Грубер о водяных знаках в тексте Claude: «извращение письма». Тему мы разбирали подробно 11, 12 и 14 августа, поэтому механику повторять не будем (Daring Fireball). Аргумент Грубера: метка по определению делает текст хуже, потому что алгоритм обязан иногда повышать вероятность худшего слова. «It's only a question of how much worse.» И отличие от картинки принципиальное: там метка живёт в метаданных файла, а в тексте это сами выбранные слова.

Из новой фактуры. 15 августа Anthropic выпустила вторую статью с настоящим объяснением. Скрытых символов нет вообще. Метка ставится начиная примерно со 150 слов, отключить её нельзя. Практический вывод для пишущих: гонять свой текст через Claude ради вычитки стало рискованно. Метка появляется и от правки, а проверить её может только сама Anthropic.

Молодёжь не доверяет ни одному руководителю ИИ-компании. Опрос CNBC и Generation Lab: 1 088 американцев 18–34 лет (CNBC). Большинство ответило «не доверяю» по каждому из девяти имён. Лучший результат — 35% у Сатьи Наделлы.

Опрос CNBC и Generation Lab: доверие американцев 18–34 лет к девяти руководителям ИИ-компаний
Опрос CNBC и Generation Lab: доверие американцев 18–34 лет к девяти руководителям ИИ-компаний

Что это значит. Читать надо осторожно: варианта «не знаю» в опросе не было, поэтому «понятия не имею, кто это» схлопывается в «не доверяю». Полезнее другие цифры того же опроса: 45% ждут, что ИИ навредит их карьере, и только 10% — что поможет. Если вы продаёте что-то на ИИ молодой аудитории, это фон, в который вы говорите.

Команда AI 2027 обновила прогноз сроков. Раньше дату «ИИ заменяет программистов» они выводили из длины задачи, которую модель дотягивает до конца (LessWrong). Теперь добавили два показателя: насколько ИИ ускоряет живых программистов и как растёт выручка лидера рынка. Все три метода дали похожий ответ. Разошлись не методы, а авторы: их личные медианы — ноябрь 2027, январь 2029 и январь 2030.

Что это значит. Сама дата — гадание, авторы и сами пишут, что могли подкрутить параметры под свои ожидания. Полезнее их оценка сегодняшнего ускорения: примерно вдвое, а по внутренним опросам Anthropic — рост с 1,25 до 4 раз за семь месяцев. Планировать свои навыки стоит под такой темп.

В Кембридже предложили лечить самоулучшающийся ИИ эволюцией экзаменатора. Агент, который сам себя правит, упирается в потолок собственного теста (cst.cam.ac.uk). «The test does not merely measure progress, it defines it.» Решение — растить оценщика вместе с агентом и менять его, только когда новый обыгрывает старого на доверенном эталоне. На написании научных статей приёмка выросла с 21,8% до 38,8%.

Что это значит. Мысль годится и без всякого самоулучшения. Гоняете агента против фиксированного набора тестов — ваш потолок задаёт набор, а не модель. Кода пока нет, работу ещё не рецензировали.

Коротко.

  • Стройке ИИ-инфраструктуры не хватает около триллиона долларов, а Стив Айсман предупреждает: рынки слишком зависят от OpenAI и Anthropic (CNBC).
  • Uber и Pony.ai выведут 2000 роботакси в четыре европейских города вдобавок к Загребу (TechCrunch).
  • Модель NASA предсказывает появление активных областей на Солнце, из которых приходят магнитные бури, на 12 часов раньше прежнего (nasa.gov).
Откомментируйте первым 👇

😎

Автор поста открыл его для большого интернета, но комментирование и движухи доступны только участникам Клуба

Что вообще здесь происходит?


Войти  или  Вступить в Клуб