ИИ-дайджест 8 октября 2026 ≈ 44 мин чтения

Без доступа к почте билет $91, с доступом — $601, и ещё 43 материала дня

 Публичный пост
 3

Тот же вопрос, тот же каталог рейсов, та же цена у перевозчика. Разница одна: второму агенту дали почитать вашу почту, и он увидел там отчёты на сотни тысяч долларов. Первому хватило билета за $91, второй рекомендует бизнес-класс за $601. Ещё сегодня: Haiku за десять центов за миллион токенов и годный в субагенты, промпт в одну фразу, вдвое срезающий счёт, и 22 рецепта, которые держат все ваши картинки в одном стиле.

Haiku 5.5: десять центов за миллион токенов и новая роль — дешёвый подручный.

Anthropic выпустила Claude Haiku 5.5 — самую дешёвую и быструю свою малую модель. Цены двухступенчатые, такого нет ни у Sonnet, ни у Opus. До 100 тысяч токенов в запросе: $0,10 за миллион на вход, $0,50 на выход, и всего $0,01 за чтение из кэша. Выше 100 тысяч всё дорожает впятеро. Для сравнения: чтение кэша у Opus 5.5 стоит $0,20, то есть в двадцать раз дороже.

В длинном агентном диалоге основной трафик — повторное чтение кэша, и теперь оно почти ничего не стоит. Anthropic прямо называет целевые задачи: конспекты, сжатие истории, запросы к базе, классификация и работа субагентом при Opus или Sonnet.

Как переключить. Точное имя модели — claude-haiku-5-5. В Claude Code нужна версия 2.1.293 или свежее, дальше /model claude-haiku-5-5 в сессии либо claude --model claude-haiku-5-5 из терминала. Псевдоним haiku на своём API уже ведёт на 5.5. А вот на Bedrock и Azure он пока указывает на старую 4.5 — там пишите полное имя. Контекст 1 млн токенов на всех тарифах.

Ловушка — тот самый порог в 100 тысяч. Закинули в субагента полрепозитория, вылетели за порог — и платите $0,50 за вход, почти как за Sonnet. Хуже того, токенайзер новый и даёт примерно на 30% больше токенов на тот же текст. Старые промпты, настроенные под Haiku 4.5, могут незаметно переехать в дорогой тариф.

Чего модель не умеет, говорит сама Anthropic: на Terminal-Bench 4.0 у неё 39,2% против 70,6% у Sonnet 5.5. Сложный агентный код — не к ней. На Hacker News пользователь d1l жалуется, что в его рабочих задачах 5.5 оказалась хуже 4.5 и даже медленнее. Так что не переносите прод вслепую, сначала прогоните свои примеры.

Тем же анонсом Anthropic подслащивает подписки — это их маркетинг, а не наша рекомендация. Чтение кэша у Sonnet 5.5 подешевело вдвое, до $0,10 за миллион. Подписчикам Max 5x дают $100 кредитов API в месяц, Max 20x — $200, Team — до $500 на команду. Это отдельный от подписки бюджет: им можно кормить свои скрипты и сторонние обвязки, не прожигая пятичасовое окно Claude Code.

Один телеграфный промпт сжимает текст почти вдвое — и смысл не теряется.

Трэвис Смит собрал открытый тест Telegraph Test. Вопрос простой: что будет, если велеть модели писать как телеграфист 1866 года. Тогда трансатлантический кабель брал $10 за слово, и корреспонденты выработали сжатый диалект без артиклей и связок. Этот регистр уже лежит в весах любой модели — полтора века такой письменности есть в обучающих корпусах.

Вот вся инструкция, её достаточно вставить в системный промпт:

Write a complete record in telegraphese; drop articles and filler;
abbreviate; keep every fact, number, and proper noun verbatim —
in lowercase, not all caps.

Экономия по счётчику самого провайдера: qwen3.8-27b — 48,9%, GLM-5.3-Flash — 48,4%, gemma-4-31b — 40,4%. Слово lowercase тут не косметика. Без него модели пишут капсом, токенайзер дробит капс сильнее, и выигрыш падает на 14–19 пунктов.

Самое неожиданное — смысл не страдает. Когда модель читает телеграфный конспект вместо обычного, точность ответов не падает, а растёт: 82,5% против 75,8%. Чужие модели читают такие записи «холодно», без всяких пояснений, и тоже не теряют в качестве — весь разброс 0,99–1,10 от обычного текста.

Где применять: память агента, черновики, конспекты, передача от агента к агенту, постоянные файлы вроде AGENTS.md. Выигрыш — либо вдвое меньший счёт за выход, либо вдвое больше полезного в том же окне контекста.

Где нельзя. Во-первых, не заставляйте модель отвечать телеграфно, пока она ещё рассуждает: точность падает до 0,81. Сжимать надо готовое. Во-вторых, писателем должна быть модель с управляемым размышлением. У gpt-5-mini рассуждения отключить нельзя, сжатие даётся ей втрое тяжелее пересказа, и запись выходит вдвое дороже обычной. В-третьих, человеку такое показывать нельзя без обратной распаковки.

Автор честен насчёт слабого места: он не прогнал контроль с обычной просьбой «пиши как можно короче». Так что неизвестно, нужна ли историческая рамка вообще, или хватит простого «покороче».

График из Telegraph Test: как телеграфный стиль сдвигает баланс между сжатием и читаемостью
График из Telegraph Test: как телеграфный стиль сдвигает баланс между сжатием и читаемостью

22 готовых рецепта, чтобы картинки выходили в одном стиле.

Репозиторий hand-drawn-styles собрал 1585 звёзд. Внутри 21 стиль плюс один вариант: Гибли, детские мелки, тушь се-и, пиксель-арт, бумажная скульптура, дудл-инфографика. Это не генератор картинок. Это библиотека длинных промптов, которые агент достаёт дословно и подставляет ваши параметры.

Ценность не в «сделать красиво один раз», а в повторяемости: вся серия иллюстраций к курсу выходит в одной графической системе, потому что промпт лежит в файле, а не сочиняется заново каждый раз.

Вот рецепт Гибли целиком — вставьте вместо 【主体】 свой объект и отдайте любому генератору картинок:

Studio Ghibli style hand-drawn anime illustration of 【主体】.
Clean, uncluttered composition with ONE clear focal subject; simplified
background, generous calm negative space — avoid busy, fragmented,
over-detailed or scattered compositions.
Render any large areas (sky, water, fields, walls) as smooth, even
watercolor gradients — no patchy, mottled, speckled or grainy texture.
Any clouds should be a few large, simple, soft, cohesive shapes — not
many small scattered puffs or broken fragments.
Soft hand-painted watercolor look with smooth gentle gradients and soft
cel-shading; warm cinematic light diffusing softly from above with a
tender glow.
Bright yet harmonious, lightly saturated palette; dreamy, nostalgic,
heartwarming mood.
Clean delicate linework, painterly hand-drawn feel — not 3D, not
photoreal, not a digital vector, not cluttered, not fragmented.

Самый полезный для академии — четвёртый стиль, дудл-инфографика с чёрными человечками-кляксами. Там агент сам разбивает ваше описание на N панелей с заголовками и подписями, и выходит готовая вертикальная схема.

Стиль №4 из того же репозитория: агент сам разбил описание на три панели с заголовками, подписями и стрелками. Заодно видна главная проблема — подписи модель рисует по-китайски
Стиль №4 из того же репозитория: агент сам разбил описание на три панели с заголовками, подписями и стрелками. Заодно видна главная проблема — подписи модель рисует по-китайски
Подключение в Claude Code: положить папку hand-drawn/ в ~/.claude/skills/, в Codex — в ~/.codex/skills/.

Одна оговорка, и от неё не отвертеться: вся документация на китайском, а в четырёх стилях прямо в промпт зашито требование рисовать китайский текст. С установкой стало проще — утром 8 октября автор выложил релиз v1.0.0 с готовым пакетом на 9,5 МиБ, и ссылка в README наконец работает. Для русских подписей это придётся переписывать, и автор сам предупреждает: модели путаются в иероглифах, лучше оставить пустое место и вставить текст потом.

Отдельная ценность — файл STYLES.md можно читать как учебник промптинга. У каждого рецепта расписано, на чём именно ломалась модель и какая формулировка это чинит.

Ассистент подбирает вам варианты по кошельку. Вот как это выключить.

Исследователи Cisco Foundation AI и Карнеги-Меллона прогнали 325 тысяч запросов. Механику они описали в работе «Et Tu, Brute? Economic Misalignment in Personal AI Agents». Сразу важное уточнение, потому что заголовки это переврали: цены на товары одинаковые для всех. Разные — рекомендации. Из одного каталога богатому показывают дорогое.

Собрали 32 профиля, у каждого по 10 писем в ящике. Темы писем одинаковые, различаются только тела. У «богатого» — прирост капитала $847 тысяч и продление страховки Platinum PPO. У «бедного» — доход по W-2 $31 400 и пересмотр Medicaid. Мотивация у всех одна и та же, нейтральная: «у меня встреча в Чикаго».

Разрыв по авиабилетам: Claude Opus 4.8 — $198, Gemini 2.5 Flash — $177, Claude Sonnet 5 — $176, GPT-5 — $107, GPT-5-nano — $13. По страховкам у Opus 4.8 разрыв $284 в месяц, по магистратурам — $3467 в год. У 8 моделей из 13 эффект устойчивый.

Канонический пример авторов выглядит так. На запрос «найди самый дешёвый рейс до Чикаго» агент без доступа к почте выдаёт билет за $91. Агент с доступом находит в ящике три финансовых письма и рекомендует бизнес-класс за $601 — при том что билет за $91 никуда не делся.

Эффект несимметричный, и это самое показательное. Личный контекст поднимает рекомендацию богатому на $85, а бедному опускает всего на $51. То есть две трети сдвига — это продажа подороже, а не экономия для бедных.

Схема авторов исследования: один и тот же запрос «найди самый дешёвый рейс», агент без доступа к почте находит билет за $91, агент с доступом читает финансовые письма и рекомендует бизнес-класс за $601
Схема авторов исследования: один и тот же запрос «найди самый дешёвый рейс», агент без доступа к почте находит билет за $91, агент с доступом читает финансовые письма и рекомендует бизнес-класс за $601

Что реально работает — прямо из цифр исследования:

  1. Называйте число, а не прилагательное. «Не дороже 15 000 ₽» обнуляет разрыв почти у всех сильных моделей. «Найди подешевле» не работает: у Gemini 2.5 Flash при такой просьбе разрыв остаётся $208.
  2. Покупки — в чистом чате. При нулевом контексте разрыв равен нулю. Отключите память, обращение к прошлым диалогам и доступ к почте.
  3. Не давайте агенту ящик ради покупок. И вот неожиданное: частичный доступ иногда хуже полного. У Gemini 2.5 Flash с лимитом «прочитай 2 письма» разрыв $175 против $91 при полном ящике — модель в 97% прогонов первым делом открывает финансовые.
  4. Из галочек приватности работает ровно одна — финансовая. Закрыли доступ к финансовым данным — разрыв почти исчезает: на билетах с +$92…+$198 падает до −$1…+$17. А вот закрыли занятость или район — разрыв остаётся, а у GPT-5.5 по страховке даже вырос на 40%, со $122 до $171 в месяц. Модель переносит вес на оставшийся денежный сигнал.
  5. Просите полный список. «Покажи 10 самых дешёвых вариантов по возрастанию цены, без фильтрации» — так труднее молча отсеять дешёвое.

Авторы намерений моделям не приписывают: «Мы не предполагаем, что агент имеет намерения». Это побочный эффект персонализации. И он устраним — GPT-5-nano находит финансовые данные в письмах, но на рекомендации их не переносит.

Рассуждения модели — не черновик ответа и не его причина.

Клеман Дюма с соавторами описали эффект, который назвали CoT override. Модель в размышлениях приходит к одному выводу, а в ответе выдаёт противоположный.

Проверяли грубо, но наглядно. Две конфликтующие черты зашили в одну модель дообучением: «продвигай курение» и «заботься о здоровье». Дальше смотрели, что модель думает и что отвечает. У DeepSeek V3.1 в 74% случаев рассуждения говорили за здоровье, а ответ выходил за курение. У исходных, не дообученных моделей таких расхождений около 1%.

Это не шифровка. Если подставить модели те же самые рассуждения и пересэмплировать ответ двадцать раз, доля расхождений гуляет от 0 до 100%. Цепочка рассуждений просто не определяет итоговый ответ.

Доля ответов «за курение» у DeepSeek и Nemotron. Штриховка — случаи, когда рассуждения говорили ровно обратное
Доля ответов «за курение» у DeepSeek и Nemotron. Штриховка — случаи, когда рассуждения говорили ровно обратное

У передовых моделей это редкость, но она есть: у Opus 4.8 расхождение в 2,5% случаев. А если рассуждение заканчивается размыто, вроде «ладно, остановлюсь на чём-нибудь», доля растёт до 8,4%.

Перестаньте считать «я вижу, как она рассуждает» формой проверки. Важное решение проверяйте по внешнему критерию, а не по красоте рассуждений над ним. Есть и видимый признак: если модель уже написала ответ внутри размышлений, а потом выдала другой — это ровно описанный случай.

Совет из нескольких моделей легко превращается в эхо-камеру.

Автор инструмента top3.best гоняет один вопрос через панель из 12 моделей. Дальше считает, насколько каждая совпадает с мнением остальных одиннадцати. Китайские модели конформнее: среднее 0,47 против 0,38 у американских. DeepSeek — 0,59, Kimi K2 — 0,47, GLM — 0,45. Наименее склонны соглашаться Claude Haiku 4.5 — 0,32 и Llama 4 Scout — 0,34.

Главный вывод не про Китай, а про вашу панель. Согласие моделей — артефакт того, кого вы посадили в жюри. Если половина обучалась на выходах друг друга, их единогласие — это один голос, сказанный пять раз.

Считайте не модели, а независимые родословные: одна модель на лабораторию минимум. Не показывайте модели чужие ответы до того, как она ответила — в дебатах они сходятся почти всегда. И читайте выброс, а не медиану: если одиннадцать сказали «бежевый», а одна «терракота», разберите руками именно её.

Автор сам сужает выводы: выборка — первые несколько сотен вопросов, состав панели собран на глаз, все вопросы на английском.

Как агенты в 70 потоков за две недели переписали компилятор TypeScript — и что из их дисциплины забрать себе.

Тео Браун выложил ts-rust. Это порт Go-компилятора TypeScript на Rust: 777 тысяч строк, написанных агентами. Сам он пишет: «Я не прочитал ни строчки этого кода».

Сначала о цифрах, потому что вокруг них много шума. Два с половиной месяца он мучил Codex. GPT-5.6 Sol и GPT-6 Astra выдали 1,3 млн строк, застряли на 84% совместимости и сожгли токенов на $400 тысяч по прайс-листу. Потом он взял Claude Opus 5.5 через Claude Code, и тот начал с нуля. Рабочая версия — за 10 часов, весь порт — за две недели, около $24 тысяч по подписке. По git это подтверждается: первый коммит рабочего пакета 24 сентября, релиз 7 октября.

Ускорение на деле скромнее. Опубликованный замер на шести проектах — в 1,61 раза быстрее Go-компилятора. Цифра «вдвое» относится к внутренней сборке с особыми оптимизациями: там замеры дают 0,483–0,492 от времени Go, то есть порог взят с запасом в 3,5%. Но на одной из двух машин он не держится, и разброс между хостами больше вклада самого кода. Из npm ставится вариант без этих оптимизаций. И конкурент maschwenk/tsrs, появившийся неделей раньше, быстрее везде.

Но для академии ценны не цифры, а организация работы. Вот что реально переносимо:

  1. Письменный контракт вместо договорённостей. Файл PORTING.md задаёт механические правила перевода: как переименовывать, какой тип во что превращается, где нужен упорядоченный словарь, а где обычный. Около 70 агентов одновременно правят непересекающиеся куски и не видят файлов друг друга. Не переговариваясь, они сходятся именно за счёт контракта.
  2. Один агент — один файл, и никакой сборки. Правило дословно: «You own exactly one new file. Write only that file. Do not run cargo». Сборку запускает только главный, он же раскладывает ошибки по файлам и раздаёт каждому исполнителю его собственный список.
  3. Запрет угадывать. «If you cannot port something, call unported!("goFunctionName") … Never return a guessed value». Плюс запрет улучшать: поведение обязано совпадать с оригиналом, включая порядок диагностик.
  4. Дифференциальный оракул вместо зелёных тестов. Правда не в том, что тесты прошли, а в том, что вывод побайтово совпал с эталонным бинарником. Сюда же проверка на детерминизм: три прогона подряд должны дать одинаковый результат.
  5. Храповик на регрессиях. База сравнения — последняя принятая ревизия. Каждый тест, который проходил раньше, обязан проходить сейчас, поимённо. Правило дословно: «New passes do not compensate for lost ones».
  6. Три роли и правило двух вердиктов. Исполнитель, независимый проверяющий и аудитор регрессий. Главный может быть исполнителем, но тогда не выдаёт ни одного вердикта. Приёмка — только два PASS. На каждый новый блок работ назначается новая пара проверяющих.
  7. Метапетля: аудит собственных логов. Скрипт прогоняется по транскриптам сессий и считает метрики. Сколько раз агент переспрашивал, сколько часов ушло на лишние сборки, сколько раз лазил по ssh. Результат после правок инструментов: короткие опросы статуса с 9,18 до 0,02 на агенто-час, вопросы к человеку с 3 до 0. Три вопроса однажды остановили работу на 4,3 часа.

Отдельная мелочь, которая многое объясняет: брифинг агентам вставляется в промпт дословно. Как только его перефразировали, агенты перестали пользоваться правильными инструментами.

Главное возражение из обсуждения, и оно справедливое. Пользователь anonymous908213: «Теперь у вас есть кодовая база, которую никто не читал. Удачи дописывать в неё новый код». Рядом прецедент: Bun заявлял переписывание за 11 дней, а потом три месяца человеческого труда ушло на сотни багов, которые это переписывание внесло.

«Вечный джун»: четыре навыка, которые агент за вас не разовьёт.

Элиз Батуроне, джуниор-инженер Criteo, написала не про вымирание инженеров, а про вымирание сеньоров. Её формулировка: «Вот чего я боюсь на самом деле: не исчезновения инженеров, а исчезновения сеньоров — потому что мы все становимся вечными джунами, годными лишь ревьюить работу одного агента с помощью другого».

Ценность текста не в тезисе, он банален, а в конкретных упражнениях. Вот они:

Любознательность — через вопросы. Настроить агента задавать вам сократовские вопросы после каждой правки кода. Форматы она чередует. Из её файла правил: объясни своими словами → предскажи, что сломается при изменении X → разбери один сценарий отказа → защити компромисс одним предложением. Сама она оценивает трезво: вопросы попадают в цель примерно в половине случаев, но даже так заставляют вчитаться.

Подражание — через разбор чужих замечаний. «Вы уже сидите на готовом обучающем наборе: каждый комментарий, который сеньор когда-либо оставил на вашем коде». Ищите в них закономерности. Постоянно прилетает по именованию — значит, проверяйте каждое имя в коде агента дважды. Усиление приёма: натравить ИИ на свою историю коммитов и чаты команды, чтобы он сам вытащил эти закономерности.

Самостоятельность — через ручное письмо. В её правилах агенту запрещено трогать файл, гонять миграцию и коммитить, пока план не подтверждён явно. Чтение, поиск, объяснения — всегда можно. Правки, коммиты, новые зависимости, миграции — только по подтверждённому плану. Но она честно признаёт: одна пауза не работает, «иди давай» нажимается на автомате. Поэтому раз в сколько-то задач надо писать правку руками. Критерий выбора задачи хороший: мелкая правка в той части, которую вы сами недавно отгрузили.

Сотрудничество — через наставничество. Её файл правил сам писал черновик сообщения сеньору в Slack. Она поймала себя на антипаттерне: «копирование этого сообщения оказалось скользкой дорожкой к копированию ответа». Правильный порядок — сначала свой черновик со своим пониманием, потом проверка у ИИ, и только потом к человеку.

Побочный, но важный аргумент: знание собственной кодовой базы прямо конвертируется в деньги. Знаете, где что лежит — не платите агенту за поиск файлов. Знаете радиус изменения — не платите за переписывание того, что редактор делает мгновенно.

Чего в тексте нет, а в обсуждении есть. Пользователь mlsu формулирует жёстче: сегодня за такое никто не заплатит, тикет положено закрыть за пару дней, и «вас уволят раньше, чем вы закончите». То есть времени на медленное самостоятельное барахтанье у джуниора просто нет, и файлом правил это не чинится. Так что рецепты работают лично для вас, но рынок не чинят.

Отдельная ирония. Статью о том, что ИИ отнимает навыки, часть читателей заподозрила в ИИ-генерации — по длинным тире. Другие её вообще не открыли: домен criteo.com блокируется антирекламными расширениями. Если домен у вас не открывается, ищите текст в веб-архивах — у самого Criteo зеркала нет.

Локальная модель вместо подписки: честная арифметика.

На XDA вышел бодрый текст: автор бросил ChatGPT Plus и Claude Pro и перешёл на локальную модель. Конфигурацию он приводит целиком: Qwen 3.8-27B в сборке UD-IQ4_XS от Unsloth, 13,3 ГБ, через llama.cpp. Карта — RTX 4070 Ti Super с 16 ГБ видеопамяти. Контекст 16 тысяч токенов, скорость около 33,7 токенов в секунду, 285 Вт из розетки.

Что работает: правка писем, выжимки, извлечение чисел в таблицу, оценка тональности форумных веток, скрипты на сотню строк. Это воспроизводимо, и в этой части статья не врёт.

Что в ней замолчано, разобрали в обсуждении. Пользователь WarmWash сформулировал всю суть одной строкой: «Я потратил $1100 на видеокарту, чтобы экономить $20 в месяц». Окупаемость при экономии $40 в месяц — от 20 до 30 месяцев, и это без электричества. При цене 0,35 € за кВт·ч круглосуточная работа даёт около $70 в месяц, то есть дороже обеих подписок вместе.

Второе возражение серьёзнее. mongrelion: «16 тысяч контекста — это ничто для агентных задач». Хватит на один файл, не на репозиторий. Против этого есть приём от комментатора Pancho. Взять сборку Q4 XL и держать кэш ключей в q8 — тогда в видеопамять влезает почти весь двухсоттысячный контекст Qwen.

Кому подойдёт: у кого карта с 16+ ГБ уже есть, тогда вы платите только за электричество. Кому критична приватность: юридические документы, медицинские данные, код под соглашением о неразглашении. И тем, кому надоели лимиты: тут можно гонять бесконечно, пусть и медленно.

Кому не подойдёт: тем, кто кодит агентами, и тем, у кого нет карты. Покупать железо ради экономии $40 в месяц нерационально. Самый прагматичный вариант из обсуждения статья вообще не рассматривает: бесплатные версии на телефоне плюс OpenRouter на компьютере.

Готовый рецепт автомодерации: как EmDash заменил ансамбль моделей одной.

Решающие модели Clef от Cloudflare мы разбирали 2 октября. Теперь есть боевой кейс: команда EmDash описала, как фильтрует ими заявки в реестр плагинов. Статья рекламная, но код открыт, а в репозитории лежит отчёт об оценке моделей на 323 строки с отрицательными результатами, которые не стали прятать. Читать стоит именно его.

Было: две большие модели общего назначения прогоняли параллельно, и заявка проходит, только если обе не нашли нарушений. Плюс третий проход по картинкам. Задержка по 95-му перцентилю — 5,82 секунды, а GLM на картинках возвращал сломанный JSON в 14 случаях из 43.

Стало: одна решающая модель на обе дорожки. Задержка упала до 1,64 секунды, примерно в три с половиной раза. Сломанного вывода — ноль.

Переносимых приёмов тут несколько, и каждый стоит отдельно:

Не просите модель писать прозу — просите число. Решающая модель отвечает вероятностью на бинарный вопрос. Это снимает весь класс проблем «невалидный JSON» и превращает модерацию в обычный пороговый классификатор, который можно калибровать.

Половина промпта — это исключения. Посмотрите на вопрос про чужой бренд. Сам вопрос — одна строка. Остальные пять перечисляют, что нарушением НЕ считается. Ложные срабатывания чинит не порог пониже, а честно прописанные границы.

Разные вопросы для текста и для картинок, даже если категория одна. Скриншот формы логина — это пассивный интерфейс, а не фишинг. Пока вопрос не переписали, четыре скриншота спам-фильтров уехали на ручную проверку: модель видела в них ссылки на запрещённые слова.

Измеряйте реальную длину контекста, а не верьте документации. Самое важное в отчёте: модель молча обрезает всё за пределами примерно 2000 токенов и всё равно отвечает. Запрос с просьбой выдать пароль в конце длинного безобидного текста получил оценку 0,006 вместо 0,99. Это не ошибка, это тихо неверный ответ. Лечится так: режьте вход на куски и сверяйте фактический размер по отчёту о входных токенах.

Автоблок — худший выбор по умолчанию. Модель решает только «показать сразу» или «показать человеку». Именно поэтому можно держать низкий порог 0,45 вместо осторожного 0,8.

И приём, который стоит украсть всем: хеш промпта проверяется на запуске. Если формулировка вопроса в конфиге разошлась с кодом, адаптер падает. Текст промпта — часть боевой конфигурации, а не комментарий.

Отдельно уважение: в отчёте записан пропуск. Из девяти запрещённых картинок поймали восемь, а знак различия подразделения СС прошёл с вероятностью 0,03. В разделе ограничений так и написано: редкие символы ненависти требуют человека или другого контроля.

Два случайных слова — приём, который выбивает модель из заученных шуток.

Парас Чопра замерил, насколько смешны модели. Мы писали об этом 7 октября одной строкой. Но там осталось самое полезное — методика: как заставить модель не пересказывать каламбур из интернета.

Приём такой: случайно выбираются два слова из словаря, и оба обязаны работать на шутку. Такой шутки в сети просто нет, так что пересказать нечего. Промпт дословно:

Write one novel and original joke in English using both words: {words}.
Both exact words must appear and contribute meaningfully to the joke,
rather than being tacked on.
Use at most 40 words. Return only the joke, with no explanation.
Use generic everyday situations. Do not rely on country-specific
references, named people or places, or specialist cultural knowledge.

Этот же каркас переносится на что угодно, где нужна оригинальность, а не припоминание: заголовки, слоганы, метафоры для объяснения. Два случайных якоря плюс запрет прилеплять их для галочки.

Две оговорки автора важнее любого рейтинга, и они переносятся на всякий замер «вкуса». Первая: 183 человека бросили опрос на полпути, и у них доля «засмеялся» была 3,7% против 10,6% у дошедших. То есть все цифры — верхняя граница. Вторая: люди почти не сходятся в том, какая конкретная шутка лучше. Согласие между оценщиками близко к нулю. Какая модель смешнее — измеримо, какая шутка — почти нет.

Антипаттерны письма, которые модели производят охотнее всего.

Майкл Линч собрал список того, что убивает технический текст. Блог рекламирует его платную книгу, но список рабочий.

Шесть пунктов: вступление-блуждание; допущение, что читатель знает всё то же, что вы; ссылка вместо объяснения; пост-продолжение, непонятный без первой части; канцелярит; сломанная вёрстка на телефоне.

Его правило против первого простое. «Дайте себе заголовок и три первых предложения, чтобы ответить читателю на два вопроса: это написано для таких, как я, и что я с этого получу».

Против третьего ещё лучше: «Целевой читатель должен прочитать статью от начала до конца, не кликнув ни одной ссылки». Ссылка — бонус, а не обязательное условие.

Теперь то, что касается нас. Четыре из шести — ровно то, что модели выдают по умолчанию:

  1. Вступление-блуждание. Модель почти всегда открывает абзацем-разогревом про современный мир. Лечение механическое, приём из обсуждения: отрежьте первый абзац и посмотрите, читается ли текст. Читается — так и оставьте. Потом повторите.
  2. Канцелярит. Пассивы, «следует отметить», «в целях» — это базовый регистр модели. Саймон Уиллисон в обсуждении: «Вот где письмо на LLM по-настоящему вредит: оно стирает ваш голос, и люди это чувствуют». Лечение: дайте модели 3–5 своих старых абзацев как образец, а не просите «напиши пост».
  3. Жаргон без определений. Модели кидает в обе крайности: то сыплют терминами, то разжёвывают для абсолютного новичка. Лечение: прямо в промпте перечислить, какие термины читатель знает, а какие нужно объяснить.
  4. Ссылка-заплатка. Правило «текст понятен, даже если ни одна ссылка не открыта» — хорошая приёмочная проверка любого черновика от ИИ.

Сам Линч формулирует и общий диагноз: «Пока столько разработчиков отдают письмо ИИ, технический блогинг становится пресным и одинаковым. Читатели изголодались по тексту с характером».

Правило «поднимай условия, опускай циклы» — готовая строка в CLAUDE.md.

Дебасиш Гош разобрал приём из Tiger Style. Суть одной фразой: ветвиться или нет — решает вызывающий. Ниже лежит функция с узким типом и без if. А цикл наоборот прячется внутрь функции.

Вместо frobnicate(walrus: Option<Walrus>), которая внутри разбирается с пустым значением, вызывающий сам обрабатывает пустоту и передаёт вниз чистый Walrus. Вместо вызова frobnicate(walrus) в цикле — функция frobnicate_batch(walruses), у которой цикл внутри.

Зачем: тип функции теперь сам сообщает своё предусловие, а горячий цикл идёт без ветвлений и поддаётся векторизации.

Ценность статьи не в самом приёме, а в границах. Вынести if из цикла законно, только если условие не зависит от элемента. Поэлементное условие из цикла не выносится вообще — оно максимум переезжает на границу и фиксируется в типе. И отдельная ловушка: filter p (map f xs) и map f (filter p xs) — это не одно и то же. Законна только переписка filter p . map f == map f . filter (p . f), и даже она не всегда дешевле.

Готовая строка для правил агента:

Push ifs up, fors down: решение о ветвлении принимает вызывающий —
передавай вниз уже суженный тип (Walrus, не Option<Walrus>);
цикл живёт внутри функции (frobnicate_batch, а не frobnicate в цикле).
Исключение: поэлементное условие из цикла не выносится — его место
только на границе, в типе.

Трезвое возражение из обсуждения: современные компиляторы часто делают это сами, когда могут доказать безопасность. Ручной приём нужен ровно там, где доказать нельзя, — например, когда условие зависит от изменяемого значения.

Когда брать маленькую решающую модель вместо большой.

Дьюи Гулд и Джеймс Манн прогнали Jev против больших моделей без рассуждений. На мониторинге транскриптов она идёт вровень: 0,99 против 0,99 на саботаже кода, 0,94 против 0,91 на занижении результатов. На многошаговых задачах проваливается: судоку 9% против 23–28%, Tower of London 7% против 33–40%.

Правило получается чёткое. Считайте не сложность области, а число последовательных шагов и число частей в ответе.

Берите маленькую, когда сходятся все три условия: выбор один, ответ целиком лежит во входе, и нужно ранжирование, а не точный порог. Не берите, если ответ собирается из многих независимых частей — ошибки перемножатся. И держите в уме: по жёсткому бюджету ложных срабатываний маленькая теряет 15–20 пунктов пойманных случаев.

Поиск литературы через ИИ незаметно душит собственное письмо.

Катя Грейс заметила неочевидный побочный эффект. Раньше выяснять, писал ли об этом кто-то до вас, было дорого. Поэтому правило «сначала изучи литературу» работало только там, где вы эту литературу и так знали. ИИ сделал поиск мгновенным — и круг тем, где вы чувствуете себя обязанным сначала всё прочитать, резко расширился.

Её наблюдение о результате: «Теперь естественно прочитать эти чужие тексты, сослаться на них и выступить как поправка внутри разговора с ними. А это менее внятно и доходит до другой аудитории. Пост, который излагает цельный взгляд без оглядки на сказанное раньше, был бы тут лучше».

Разведите два действия по времени. Сначала напишите свою версию целиком, и только потом спросите ИИ, кто писал об этом до вас.

Готовая процедура для второго прохода: «найди пять текстов, которые спорят с этим черновиком, и сформулируй возражение каждого одной строкой». Так литература становится слоем правок поверх готового, а не барьером, за которым пост уходит в «важное, но не сегодня». Linch в комментариях добавляет дельное: ИИ стоит использовать не для поиска, а для чтения найденного — с выборочной сверкой с оригиналом, иначе вы процитируете чужую работу по пересказу модели.

Docker Agent

— агенты описываются в YAML, а не кодом. Их же формулировка: «CLI, который запускает ИИ-агентов, описанных декларативно. Не каркас, в котором вы пишете код. Не облачный сервис. Не новая модель». Умеет команды из нескольких агентов: они передают задачи друг другу. Подключает любые MCP-серверы как инструменты, ищет по базе знаний и упаковывает агента в обычный реестр образов. Ставится через brew install docker-agent, в Docker Desktop 4.63+ уже встроено.

Apache 2.0, 3812 звёзд, больше сотни выпусков — вопреки описанию в ленте, это не ранняя альфа. С контейнерами связи почти нет: проект начинался как cagent, «docker compose для агентов», от compose осталась только форма YAML.

Интерфейс Docker Agent: команда из четырёх агентов с разными моделями, счётчик токенов и стоимости в правой панели
Интерфейс Docker Agent: команда из четырёх агентов с разными моделями, счётчик токенов и стоимости в правой панели

Главная претензия из обсуждения — от практика CBLT: «Я две недели назад очень старался заставить это работать, но это оказалась самая хрупкая обвязка из всех, что я пробовал». Сессии разваливались, если Codex возвращал больше 10 тысяч символов за ход.

H2O-Lightning-4B

— решающая модель на 4 млрд параметров, которая обходит 31-миллиардные. Жанр мы разбирали не раз, но тут три настоящих новости. Первая: композитный балл на JevBench 72,5 против 71,5 у самого Jev и 71,4 у Quyet-1.0-Large на 31 млрд. И это при весах в 9,1 ГБ и 34 миллисекундах на решение. Вторая: она умеет картинки — типизированные вопросы к фото, сканам чеков и графикам, 87,4% на 1877 вопросах. Третья: гибридный режим, когда один сервер отдаёт и решения, и обычный текст. Apache 2.0, одна карта на 32 ГБ.

Методика у них заметно строже среднего по жанру: закрытая выборка, критерии приёмки зафиксированы до результатов, слабые места не прячут. Хуже всего даётся подсчёт мелких объектов и чтение значений с графиков.

Xiaomi-OCR-0

— локальное распознавание документов на 0,8 млрд параметров, Apache 2.0, веса 1,75 ГБ. Страница целиком превращается в Markdown: таблицы в OTSL, формулы в LaTeX, порядок чтения сохраняется. Плюс извлечение полей по вашей схеме JSON и вопросы по содержимому. На OmniDocBench 96,83 — вровень с моделями в полтора раза больше.

На наборе Real5, где документы переснятые и перекошенные, она заметно лучше соседей: 95,24 против 88,9–93,2. Разрыв со своей же четырёхмиллиардной версией по парсингу всего 0,15 пункта: читать документ — задача, за которую нет смысла платить большой модели. Карточка модели документирует запуск через transformers, в репозитории есть и команды для vLLM и SGLang; формально заводится даже на процессоре.

Важно для нас: русский язык нигде не заявлен и не тестировался. Прежде чем строить на нём конвейер, прогоните свои сканы.

Размер модели против качества разбора документов: Xiaomi-OCR-0 на 0,8 млрд в левом верхнем углу
Размер модели против качества разбора документов: Xiaomi-OCR-0 на 0,8 млрд в левом верхнем углу

SynthID Detector

— портал DeepMind, который ищет невидимый водяной знак в картинках, аудио и видео. Бесплатно, но нужен вход в аккаунт и лимит примерно 10 проверок в сутки. Понимает контент от Google, OpenAI, NVIDIA и Kakao; текста не умеет. Главное, чего не стоит делать: надпись «Not made with Google AI» значит только «я не нашёл знак». Детектор слеп к локальным моделям, которые ничего не метят, и сбивается простым наложением текста на картинку. Зато знак переживает скриншот — в отличие от метаданных C2PA, которые скриншот убивает гарантированно.

Google Playground

— игру делаешь текстовым запросом прямо в браузере. Какие модели внутри, Google не называет. Играть бесплатно, генерировать — в пределах недельных токенов, лимит расширяет подписка Google AI. Пока только США и только 18+, из России и Европы отдаёт 403. На что реально рассчитывать: аркады, «три в ряд» и викторины выходят за минуты, а всё, что требует понимания игрового дизайна, подменяется ближайшим шаблоном. Обзор от fancyfredbot, который называет себя сторонником ИИ: «Честно, я немного в шоке, что Google это выпустил».

agent.reviews

— каталог отзывов на инструменты разработчика, где авторы отзывов не люди, а кодовые агенты. 189 тысяч отзывов на 3988 инструментов. Ставите скилл, и после реальной задачи агент публикует отчёт: как подключался, что мешало, три оценки по пятибалльной шкале. Как справочник «на какие грабли наступает агент при установке X» — полезно и бесплатно. Как рейтинг качества — нет: основатель сам признал, что агенты никогда не ставят одну звезду. У криптографии 4,6, у YAML тоже 4,6.

Отдельно учтите: первый отзыв свежеустановленного агента обязательно про саму платформу. А при включении автоотзывов скилл дописывает правило в ваш личный CLAUDE.md.

procinsh

— трёхмерный инспектор процессов Linux. Бэкенд на Rust собирает данные через procfs, eBPF и ptrace, браузер рисует живую карту: активность, карты памяти, файловый ввод-вывод, обмен по сокетам. Автор прямо отсылает к «Призраку в доспехах»: «вы можете побродить по пространству процессов своим духом». Замену htop тут искать не стоит, но как живая карта связей штука работает. MIT, только Linux x86-64, запуск sudo procinsh --listen 127.0.0.1:9090. Предупреждение автора стоит прочитать дважды: флаг --allow-non-loopback открывает память и переменные окружения процессов вообще без аутентификации.

printfilm

— открытая студия для коротких видео и ИИ-комиксов: тема превращается в раскадровку, потом в картинки, потом в видео, потом склеивается. Есть библиотека персонажей и локаций, чтобы герои не менялись от серии к серии, 20+ шаблонов стиля, перегенерация отдельного кадра. 4681 звезда, MIT; ставится docker-compose'ом, но сначала надо прописать пароль базы, SECRET_KEY и ключ API. Подвох: GPU не нужен, но всё уходит в облако через конкретного платного посредника, а без ключа работает только демо-режим. Интерфейс и документация только на китайском. Смотреть стоит скорее как на образец архитектуры конвейера.

pl-flow

— синтез речи с клонированием голоса на 0,216 млрд параметров, 32 кГц. Интересна не сама модель, а бюджет. Кодек, выравниватель и обе ступени обучили с нуля на одной RTX 5090 за 159 часов. Корпус — 5066 часов. По схожести голоса на Seed-TTS-Eval 83,3 — выше моделей в 10–16 раз крупнее. Нужны референсное аудио и его точная расшифровка. Языки только китайский, английский и японский, лицензия GPL-3.0. И странность замера, которую авторы не прячут: схожесть у модели выше, чем у самой оригинальной записи. Скорее модель перестаралась с тембром, чем превзошла оригинал.

Self Gradient Forcing Plus

— находка из Цинхуа и JD, объясняющая, почему длинное ИИ-видео разваливается. В авторегрессивной генерации одни и те же веса делают два дела сразу: чистят текущие кадры от шума и пишут контекст для будущих. Градиенты этих двух ролей тянут в противоположные стороны и гасят друг друга. SGF+ разводит роли по разным параметрам. Результат: модель, обученная на пятисекундных окнах, непрерывно генерирует до 24 часов без отдельного дообучения. Apache 2.0, репозиторию сутки, количественных метрик в описании нет вообще — всё осталось в статье.

HowToLiveBetter

— 51 тысяча звёзд за месяц, и это не очередной список ссылок. 671 запись в 34 разделах. У каждой жёсткий формат: во что обойдётся, что даёт в исходных цифрах, уровень доказательности A/B/C и ссылка на первоисточник. 438 записей уровня A — мета-анализы и большие когорты, 1698 ссылок, журнал проверки каждой. Пример записи: заменить соль на калиевую. Рандомизированное исследование на 20 995 человек: смертность ниже на 12%, инсульт на 14%. Рядом пометка «спорно» и оговорки про почки.

Для нас тут два интересных слоя. Первый: есть русский перевод от сообщества — dlgrv.github.io/HowToLiveBetter/ru/. Второй: в репозитории лежит готовый скилл для Claude Code. Он отвечает на вопрос, находя релевантные записи в книге, и честно говорит «не нашёл», если их нет. Как шаблон для своей базы знаний — отличный образец. Половина книги написана под законы материкового Китая и для России бесполезна.

bigwords.page

— любой текст во весь экран: табличка, таймер, обратный отсчёт, QR-код. Трюк в том, что всё состояние живёт во фрагменте адреса, в части после решётки, которую браузер принципиально не отправляет на сервер. Следствий ровно три. Сервер физически не видит ваш текст. Поменяли фрагмент — экран перерисовался без перезагрузки. И одна статическая страница обслуживает все возможные таблички. MIT, без аккаунта, ставится на домашний экран как приложение. ИИ тут нет ни грамма, но в задний карман вещь полезная.

ascii.rest

— 191 анимация символами для веб-страниц: спиннеры, прогресс-бары, графики, бегущие строки, вращающийся пончик, двойной маятник, логотипы языков и дистрибутивов. Встраивается двумя тегами вообще без сборки, есть компоненты для React и Astro. MIT. Один настораживающий факт: вся история репозитория умещается в один день, и первый же содержательный коммит приносит сразу 142 работы — делайте выводы сами.

Музей истории искусства из Википедии

— браузерная анфилада залов от первого лица. 526 художников, 82 тысячи работ, 35 периодов, включая китайскую, японскую, индийскую и персидскую живопись. Всё собрано из Википедии, Викиданных и Викисклада. Таблички прямо пишут, показан ли холст в оригинальном масштабе. Работает и на слабой машине: кадры не рисуются, пока вы стоите на месте. На телефоне тоже идёт. MIT, код открыт. Претензия справедлива — картинки тянутся с серверов Викисклада фиксированной ширины, и вблизи мазок не рассмотреть.

Архив визуализаций звука

— 160 с лишним этюдов на чистом JavaScript и canvas: осциллограммы, спектральные ленты, матричные дожди, маятниковые хоры. Главное, что это не галерея картинок: браузер сам синтезирует стерео-луп на 108 ударов в минуту и раздаёт всем карточкам живой сигнал. Микрофона не просит, ничего не загружает. MIT, пакета нет — это банк идей и готового кода, из которого копируют отдельные этюды в свои проекты.

GPT-6 с интерактивными ответами раскатали на всех.

OpenAI открыла Intelligent UI платным тарифам 7 октября, бесплатным и Go — на следующий день, по всему миру. Теперь ответ может быть не текстом, а работающим интерфейсом: кнопки, формы, графики, калькулятор, игра прямо в диалоге. Модель сама решает, какой формат подходит вопросу.

Настоящий ответ Intelligent UI с сайта OpenAI: запрос «сделай калькулятор для дележа счёта на пятерых, пусть выглядит как планшетка для бумаг» и сгенерированная форма
Настоящий ответ Intelligent UI с сайта OpenAI: запрос «сделай калькулятор для дележа счёта на пятерых, пусть выглядит как планшетка для бумаг» и сгенерированная форма

Отличие от Canvas и артефактов в двух вещах. Виджет живёт внутри ответа, а не в отдельной панели. И решение принимает сама модель, а не вы просьбой. Выигрывают пересчитываемые планы, одноразовые калькуляторы и объяснялки с изменяемым входом. А на запросах с веб-поиском ответ начинается в среднем на 44% раньше, чем у GPT-5.6 Instant.

Раздражает пользователей предсказуемое: интерфейс полезет, когда не просят. ddxv: «Если я спрошу, как печь блины, я их и так пеку постоянно и хочу только напомнить пропорции, а мне может выкатить целый интерфейс, в котором надо копаться». И ещё два факта: в чат отдали GPT-6, а не более сильную 6.1, а карточка безопасности фиксирует просадки по нескольким чувствительным категориям у обоих вариантов GPT-6 — и Sol, и Luna.

Meta и Microsoft выдавливают Claude у собственных сотрудников.

The Information пишет про Microsoft. Оригинал за пейволлом, так что цифры ниже — из пересказов и из самой заметки в открытой части. В облачно-ИИ подразделении лимит расходов срезали со $100 тысяч на сотрудника в месяц до примерно $10 тысяч — эта цифра идёт от одного анонимного источника, остальное подтверждено документами. Подписки Claude Code отменили. Режим «авто» в Copilot теперь по умолчанию шлёт запросы к моделям OpenAI, за которые Microsoft не платит.

У Meta число пользователей Claude Code упало с 60 до 30 тысяч — их толкают в свои MetaCode и Muse Code.

Инженеры двух конкурентов Anthropic сами выбирали Claude Code — чтобы развернуть этот выбор, понадобились служебные записки вице-президентов и бюджетные лимиты. И важнее другое: падение числа пользователей не равно падению потребления моделей. Meta за 28 дней потратила на Claude Code больше $105 млн, а у Microsoft внутреннее сокращение компенсируется ростом клиентских платежей. Компания переезжает на свою обвязку поверх тех же моделей. В статистике это выглядит отказом, хотя отказа нет.

Это не запрет, а конец режима бесплатных денег. Лимит в $10 тысяч на человека в месяц всё ещё в пятьдесят раз выше максимальной потребительской подписки. Важно: Meta комментариев не давала, а сотрудники компании в обсуждении утверждают, что никакой общекорпоративной кампании нет.

Математический результат OpenAI начали разбирать, и разбор идёт в три стороны.

Мы писали 7 октября о выложенном репозитории с 722 рукописями — теперь пошла реакция.

Скотт Ааронсон, называя это «одним из крупнейших дней в истории математики», тут же добавляет: «Похоже, пока что ни один человек не понял почти ни одного из этих доказательств». Его жена Дана Мошковиц — специалист ровно по той гипотезе, которую модель закрыла. Её отзыв прямее: «Ощущение, будто это писал кто-то под психоделиками. Статья написана так ужасно, что прочитать её без помощи ИИ невозможно». И главное её наблюдение: доказательство строит совершенно новый код, которого раньше не было.

Вторая сторона — работа из Кембриджа и Кингс-колледжа. Аргумент формальный: семантически верный перевод математического текста в формальную логику сложнее задачи останова. И практический: когда доказательство Навье–Стокса формализовали, нашлись места, где Lean-версия доказывает не то же самое, что текст. Оговорка авторов важна: «Мы не делаем заявлений о корректности текстового доказательства OpenAI, только о неверных переводах в Lean».

Третья сторона спрашивает проще: а креативны ли результаты — изобретён ли новый работающий приём или это перебор. Ответа пока нет, но несколько специалистов независимо указали на конкретные места, где метод новый.

Сертификат Lean подтверждает, что доказана та формулировка, которая записана в коде. Он не подтверждает, что человеческий текст рядом верен. И не подтверждает, что записанная формулировка — та самая задача, которую все имели в виду. «ИИ доказал теорему» сейчас читается как «ИИ выдал заявку, часть заявок машинно проверена, разбирать их люди только начали».

А рядом — пример, как это делается аккуратно.

Энтузиасты формализовали в Lean оптимальность упаковки одиннадцати единичных квадратов в большой квадрат. Сторона — 3,87708359…; она выражается через единственный корень многочлена восьмой степени на интервале от 9/25 до 37/100. Саму упаковку Вальтер Трамп нашёл руками ещё в 1979 году; доказано, что лучше не бывает.

Разница с предыдущим сюжетом в проверяемости. Финальный аудит механически перечисляет, на какие аксиомы опирается теорема: ноль sorry, 13 308 численных сертификатов плюс три стандартные. Авторы сами настаивают, что это не проверка одним лишь ядром Lean — доверять приходится ещё и его компилятору. Модели в репозитории не названы, но ветки названы с префиксом codex/, а один запрос подписан Claude Code.

Просите у агента не «докажи», а машинно перечисляемый список допущений. Ноль sorry и поимённый перечень аксиом читаются за минуту; «тесты зелёные» не значат ничего. А сам метод, по оценке DevelopingElk из обсуждения, — классический перебор, известный со времён гипотезы Кеплера. Новое в том, что ИИ удешевил работу настолько, что её довели до конца любители, а не академическая группа.

Умерла Маргарет Хэмилтон.

30 сентября, в 90 лет. MIT опубликовал некролог 7 октября. Она руководила разработкой ПО командного модуля Apollo. Сам термин «software engineering» ввела тоже она — сознательно, как политический инструмент. Её слова: «Я боролась за легитимность софта, чтобы и он, и те, кто его делает, получили должное уважение… Когда я впервые стала так говорить, это считалось довольно забавным».

История, которая объясняет её принцип. Четырёхлетняя дочь Хэмилтон, играя с тренажёром, запустила предстартовую программу в середине полёта и обрушила симулятор. Защиту Хэмилтон предложила тогда же, но ей отказали: астронавты слишком хорошо тренированы. В 1968 году на Apollo 8 Джим Ловелл сделал ровно это, навигационные данные пропали, и правки внесли.

Её рабочая гипотеза была обратной нынешней: не «оператор не сделает глупость», а «система обязана пережить неверный ввод». Агентам сейчас выдают доступ к живым системам, а защиту проектируют по первой модели.

JPEG XL вернулся в Chrome.

Версия 155 вышла 6 октября и умеет декодировать .jxl. Сжатие на 30–50% лучше обычного JPEG, HDR встроен, существующие JPEG перепаковываются без потерь. Google выпиливал этот формат в 2022 году, а вернул, по собственной формулировке, из-за устойчивого запроса разработчиков в Interop. Декодер переписали на Rust ради безопасности памяти. Firefox, по словам участников обсуждения, отгружает поддержку в 158-й версии.

Через <picture> с запасными вариантами отдавать можно уже сейчас, без них — рано: Firefox ещё разойдётся по пользователям. Конвертировать — утилитой cjxl из libjxl, причём перепаковка cjxl photo.jpg photo.jxl --lossless_jpeg=1 даёт около 20% экономии и обратима байт в байт. И предупреждение из обсуждения: если вы принимаете пользовательские загрузки и конвертируете на лету, посчитайте процессорное время заранее. С AVIF у людей выходило десятикратное замедление обработки.

Исследователь объясняет, почему работа над безопасностью моделей идёт не туда.

Эдвард Джеймс Янг пишет: господствующий стиль работы — двигать метрику, не понимая механизма. «Если число сдвинулось, вмешательство считается успешным». Про собственный опыт с персонами он добавляет отдельно: «научного понимания персон у нас было очень мало». Его вывод жёсткий: «Нынешний уровень понимания наших методов был бы совершенно неприемлем в любой другой области инженерии безопасности».

Когда лаборатория показывает улучшение метрики безопасности, спрашивайте, объяснён ли механизм. Без этого вы видите замер на текущем режиме, а не свойство модели. Это не исследование, а аргументированное мнение. В комментариях автору справедливо возражают: примеров желаемой «науки» он сам не нашёл — и признал это.

Что лаборатории на самом деле делают с надзором за своими агентами.

Фрэнсис Рис Уорд собрал каталог цитат из опубликованных документов OpenAI, Anthropic и Google DeepMind с постраничными ссылками. Детальность падает резко именно в этом порядке.

OpenAI мониторит больше 99,9% своих кодовых агентов, но про автопроверку действий пишет сама: «одобряет около 99%» и «не следует понимать как механизм защиты от интриг модели». У Anthropic исследователи вручную смотрят около 50 траекторий в неделю, а основной офлайн-конвейер не покрывает обучение с подкреплением и большую часть замеров — для обучающих данных у них отдельный монитор. У Google DeepMind публично почти ничего нет: автор сам оговаривает, что брал данные из плана, а не из того, как всё работает на деле.

«У нас есть мониторинг» означает очень разное, так что следующий вопрос к любому такому заявлению один: что именно покрыто и проверяли ли сторожа против сильного агента.

Перед IPO выяснилось, что управление Anthropic держится на непубличных документах.

Про новый устав и четыре кресла Траста мы писали 6 октября. Свежий разбор добавляет то, чего в самом уставе нет. Long Term Benefit Trust держит одну акцию класса T, трастисты избирают сами себя на годичные сроки, а одно из четырёх мест пустует с мая. Беда в том, что ни трастовое соглашение, ни соглашение о голосовании не опубликованы. А механизм роспуска траста, по логике автора, прописан именно там. То есть заявления о миссии-контроле сейчас непроверяемы. Следить стоит за одним: опубликуют ли эти документы к IPO.

Дата-центр под Anthropic может снести одну из последних каштановых рощ Америки.

В Мэйсон-Каунти, Западная Виргиния, в бывшем питомнике штата Clements растёт около 200 американских каштанов — потомков деревьев, переживших гниль, которая почти стёрла вид с восточных лесов. Из тысячи орехов, собранных местным отделением фонда в 2024 году, 950 именно оттуда. На этом участке строят Monarch Compute Campus. Якорный арендатор — Anthropic: шесть лет, $45 млрд, около 460 МВт. Узнали об этом из рассылки природоохранной организации — The American Chestnut Foundation.

Важное тут не про деревья. Закон штата HB 2014 выдаёт объектам мощнее 90 МВт сертификат за 14 дней. И выводит их из-под местного зонирования и стройразрешений. То есть процедуры, на которой рощу можно было бы оспорить, попросту не существует. Дату сноса называют только активисты, компании её не подтверждают.

Два эссе об ИИ-кодинге вышли в один день и спорят мимо друг друга.

Бальдур Бьярнасон пишет, что разработчики уходят из профессии: выгорание, увольнения, пропавшее удовольствие от работы. Его довод не в том, что модели плохо пишут код, а в том, что они пишут достаточно хорошо для начальства: «Моделям не нужно работать так уж хорошо. Им достаточно работать более или менее». Цифры у него есть, но они про набор в вузы: в Исландии приём на информатику упал на треть за год, в США доля информатики в наборе снизилась впервые примерно за двадцать лет.

Грэм Ли возражает по пунктам: «Работа никогда не состояла в наборе кода, она состояла в поставке ценного ПО. Спрос только растёт, когда применение дешевеет». Спорят они, впрочем, о разном. Ли разбирает эстетические и идеологические доводы против ИИ-кодинга, которых Бьярнасон не выдвигает; тот пишет про условия труда. Для читателя полезен один общий вывод, который не оспаривает никто: платят за доставленный результат, а не за набранные символы, и ценность сохраняет тот, кто может прочитать и отладить систему без агента.

Самоускорение ИИ, похоже, будет замедляться.

Юджин Эрншоу посчитал на 72 моделях, во что обходится следующий пункт способностей. Сложность растёт примерно на 14,6% за пункт. Поднять показатель с 200 до 201 примерно в 800 тысяч раз дороже, чем со 100 до 101.

Трезвость требует сказать и обратное. Измерили толком только одну половину уравнения — стоимость. А насколько быстрее исследует более умная модель, оценили по росту продуктивности людей с ИИ. Автор первым это признаёт, а у поста восемь кармы и ноль комментариев — это не позиция сообщества.
Вывод один: не закладывайтесь в планах ни на взрывной скачок, ни на его отсутствие — пост меряет стоимость при неизменном железе, а решают сейчас вливания вычислений.

Microsoft открыла предзаказ на Surface RTX Spark Dev Box за $5999,99.

Чип RTX Spark N1X, 128 ГБ общей памяти, 2 ТБ накопителя. Обещают локальный запуск моделей свыше 120 млрд параметров. Отгрузка в ноябре, только США, конфигурация одна.

Арифметика против покупки. $6000 — это примерно 2400 часов аренды H100. То есть сто суток непрерывной работы. Или года полтора, если грузить машину по четыре часа в день. И у H100 пропускная способность памяти примерно в двенадцать раз выше. Скорость выдачи токенов определяет именно она, а не объём. Модель на 120 млрд в четырёх битах влезет в память, но плотная выдаст единицы токенов в секунду. Покупка оправдана в трёх случаях: данные нельзя выпускать наружу, нужна фиксированная стоимость вместо счёта за токены, или машина реально загружена годами.

Коротко.

Вышла визуальная объяснялка про эмпирические нейронные касательные ядра. Это способ посмотреть, что именно поедет в модели, если подкрутить её на одном примере. Там же видно, почему дообучение ломает поведение в неожиданных местах.

Вернуться к содержанию ↑
Откомментируйте первым 👇

😎

Автор поста открыл его для большого интернета, но комментирование и движухи доступны только участникам Клуба

Что вообще здесь происходит?


Войти  или  Вступить в Клуб