Как запустить 284-миллиардную модель на игровом ПК — и ещё 54 материала дня  Публичный пост

26 августа 2026  53

Модель на 284 миллиарда параметров, официальные веса без сжатия, одна домашняя видеокарта — и скорость живого разговора. Выложил аспирант из Беркли, бесплатно. А главный аналитик по чипам в тот же день объясняет: облачные токены за два года подорожают, а не подешевеют. Окно, когда своё железо выгоднее подписки, уже открылось. Ещё сегодня — скилл /eli5, которым в Anthropic понимают чужой код за минуту.

Главное за 30 секунд

  • Открытый инструмент FreeToken гоняет модель на 284 млрд параметров на домашней видеокарте со скоростью живого разговора.
  • Аналитик Дилан Патель прогнозирует рост цены вычислений втрое-вчетверо за два года вместо ожидаемого удешевления.
  • Криптографический значок «снято камерой» на фотографиях подделывается на любом Android с правами root, Google чинить отказался.
  • Слепое голосование 6851 студента: Gemini лучше правит текст, Claude лучше планирует, ChatGPT лучше ищет аргументы.
  • Mac Studio на M5 Ultra берёт до 512 ГБ общей памяти — это домашняя машина под самые большие открытые модели.

Внедряем и улучшаем

FreeToken: передовая модель на игровом компьютере за ноль рублей. Шуо Ян, аспирант Беркли, выложил инструмент, который ломает привычную развилку «или облако, или урезанная модель дома». Обычно, чтобы влезть в домашнюю видеокарту, модель давят квантованием до 2–4 бит и теряют качество. FreeToken запускает официальные полные веса без такого сжатия.

Цифры из демонстрации. Qwen3.6 на 35 млрд параметров: 39 токенов в секунду на ноутбучной RTX 4060 с 8 ГБ. DeepSeek-V4-Flash на 284 млрд — 22–25 токенов в секунду на настольной RTX 5090. GLM-5.2 на 753 млрд — 15 токенов в секунду на рабочей станции с RTX PRO 6000. Это скорость живого разговора, а не «оставь на ночь».

Как устроено: расчёт распределяется между процессором и видеокартой с оглядкой на пропускную способность памяти, плюс кеш между ходами агента. Авторы заявляют ускорение генерации в 3–4 раза против Ollama. Внутри уже есть обвязки под кодовых агентов. Сам автор пишет прямо: «Run your claude code or codex now with frontier model for $0» (пост автора, статья).

Второе свидетельство того же дня. Разработчик прогнал дообученный Qwen3.8-27B внутри кодового агента Pi. На свежем срезе SWE-bench-Live — наборе задач из недавно опубликованных реальных багов — он обошёл Claude Opus 5 High. Замер общественный и ещё идёт, так что «Qwen лучше Claude» из этого не следует. Но урезанные сборки весят 18–23 ГБ и влезают в карту на 24 ГБ (тред, карточка модели).

Если у вас лежит игровая карта на 8–24 ГБ, попробуйте связку до того, как оплатите следующий тариф. Дальше в выпуске будет объяснение, почему это окно стоит использовать сейчас (разбор в The Neuron).

Скилл /eli5: понять чужой код до того, как в нём копаться. Тарик из Anthropic рассказал про внутренний приём команды. Скилл просит Claude объяснить тему так, будто вы о ней не знаете вообще ничего. Ответ приходит не стеной текста, а HTML-артефактом с крупными картинками и минимумом слов.

Смысл не в том, чтобы получить короче. Смысл — построить общую картину раньше, чем лезть в детали. Особенно на чужом коде, чужой архитектуре и разборе аварий.

Три рабочих запроса дословно:

/eli5 how does this module work
/eli5 why did we make this tradeoff
/eli5 what caused this incident

Ставится из общественного каталога плагинов:

claude plugin marketplace add anthropics/claude-plugins-community
claude plugin install eli5@claude-community

Приём переносится и на не-код. Тот же /eli5 хорошо разбирает договор, медицинское заключение или чужую финансовую модель (пост Тарика).

Гайд: своя дизайн-система для ИИ за один вечер. Билли Хауэлл из The Rundown показал, как вытащить правила бренда с уже готового сайта и дальше штамповать по ним материалы. Вы один раз описываете свой стиль, а потом любой запрос к ИИ приходит с ним автоматически. Инструмент — бесплатный Open Design.

Шаг 1. Поставьте Open Design и подключите локального агента. В демонстрации это Codex CLI. Сначала установите и авторизуйте его в командной строке — тогда Open Design сам его найдёт.

Шаг 2. Нажмите «Create New Design System». Вставьте адрес своего сайта в поле «GitHub or website», нажмите «Add», затем «Continue to generation». Система соберёт из сайта логотип, шрифты, цвета, тон голоса, светлую и тёмную темы, оформление кнопок.

Шаг 3. Проверьте, что получилось, до того как что-то генерировать. В демонстрации первый проход не нашёл логотип. Автор советует относиться к первой выгрузке как к черновику: догрузить логотип, картинки или файл DESIGN.md руками. Источником может быть и репозиторий, и файл Figma, и просто описание словами.

Шаг 4. Выберите систему и дайте конкретное задание. Расплывчатый запрос даёт мусор. Шаблон брифа дословно из гайда:

Build a [format] for [audience] that explains [specific outcome].
Use the active [brand] design system. Include [required brand element],
and keep the result to [length or scope].

Шаг 5. Правьте обычными словами, как в переписке с ChatGPT. Первый ролик вышел слишком быстрым и без логотипа. Правка была прямой: удвоить длительность и взять логотип из дизайн-системы. Там, где Open Design предлагает сохранить правило, сохраняйте — следующий запрос стартует ближе к цели.

Совет автора напоследок: сначала доведите идею и текст в ChatGPT, и только готовый бриф несите в визуальный редактор. Прототип можно выгрузить кодом и дорабатывать в Cursor (полный гайд, нужен бесплатный аккаунт The Rundown; репозиторий).

Open Design разобрал сайт на дизайн-систему: логотип, шрифты, цвета
Open Design разобрал сайт на дизайн-систему: логотип, шрифты, цвета

Пять примитивов, без которых агент забывает и разоряет вас. Гаурав Дадхич выложил работу с формулировкой, которую стоит повесить над рабочим столом. Агенты в бою падают не из-за плохих рассуждений, а из-за того, что не управляют содержимым своего контекста. Он раскладывает управление памятью на пять шагов и показывает, что ломается, если пропустить любой.

Первое — проектирование. До первой записи решите, какие категории вы вообще храните и сколько они живут. У помощника поддержки и у кодового ассистента это разные ответы. Что бывает без этого. Аудит одной популярной библиотеки памяти дал 10 134 записи за 32 дня. Полезными оказались 38. Это 99,6% мусора.

Второе — приём. Качество поиска сверху ограничено качеством записи. Лучшая фраза статьи. Система, сохранившая «пользователь упомянул тарифный план», уже не достанет «пользователь перешёл со Starter на Pro 3 апреля». Пишите факты со временем и источником, а не пересказ.

Третье — область видимости. Иерархия из трёх уровней: пользователь, организация, платформа. Поиск идёт от узкого к широкому. Без этого предпочтения одного человека всплывают в чужой сессии, а «Sarah» из разных компаний склеиваются в одного человека.

Четвёртое — упреждение. Готовьте контекст до того, как агент его попросит. Это не кеш ответов: кеш повторяет уже спрошенное, упреждение предсказывает следующее. Заявленная точность попадания — больше 60%.

Пятое — сжатие с проверкой. Сжатие, тихо выбросившее важный факт, хуже, чем отсутствие сжатия: оно даёт уверенно неверные ответы. В задокументированном случае 18 282 токена ужали до 122 за один непроверенный шаг. Точность упала с 66,7% до 57,1% — ниже, чем вообще без контекста.

Экономика простая. Если подклеивать всю историю целиком, расход растёт как квадрат числа ходов. При удержании бюджета — линейно. На 100 ходах переплата шестикратная, на 500 — тридцатикратная. Проверка сжатия добавляет фиксированные 25% накладных, а экономия на длинной сессии доходит до 96%.

Весь рабочий узор для приложения умещается в четыре строки:

retrieved  ← FETCH(query=user_message, scope={user, customer})
compacted  ← COMPACT(current_conversation)
reply      ← MODEL(assemble(retrieved, compacted, recent_turns))
INGEST(turn, scope)   # асинхронно, сразу возвращает идентификатор

Прямой перенос на Claude Code. Команда /compact на длинной сессии — ровно тот шаг, где непроверенное сжатие даёт «уверенно неверный ответ» вместо честного «я забыл». Собирайте перед сжатием короткий список фактов, которые обязаны выжить, и после сжатия проверяйте их наличие.

Оговорка: работа одноавторская и рекламирует продукт автора. Все цифры из реальной эксплуатации — его собственные замеры. Открыт только стенд оценки, не сама система (статья, стенд).

Пять примитивов управления контекстом и иерархия областей видимости
Пять примитивов управления контекстом и иерархия областей видимости

Какая модель лучше правит ваш текст: 6851 слепой голос. Площадка StudyArena выкатила данные августа. Студенты сравнивали ответы, не видя названий моделей, и выбирали лучший. Итог по письму и эссе: Gemini — 39,6%, Claude — 31,8%, ChatGPT — 29,2%.

Интереснее разбивка по этапам. Обратная связь по тексту: Gemini 41,7%. Планирование работы: Claude 43,2%. Исследование и поиск аргументов: ChatGPT 39,3%. Выигрывает не «лучшая модель», а правильная расстановка по этапам.

Два побочных вывода бьют по привычкам. Первый: выбранный ответ был в среднем на 37% длиннее конкурентов. Самый длинный побеждал в 47,7% сравнений. Люди путают объём с качеством, и модели этим пользуются. Второй: чем выше уровень размышлений, тем хуже проза. Низкий уровень — 40,7% побед, высокий — 29,5%. Больше рассуждений даёт больше оговорок и повторов.

Готовые запросы из статьи, которые можно взять как есть:

# Личное эссе
Do not rewrite this. Identify the passages that could have been written
by any applicant. Tell me what a reader still does not know about me,
and ask questions that would uncover more specific details.

# Аргументированный текст
Identify my weakest premise, the strongest serious counterargument,
and every factual claim that needs a primary source.
Do not add evidence or rewrite the draft.

# Короткий ответ
Mark the setup I can cut, the detail I should preserve, and the sentence
that best answers the prompt. Keep the response in my voice.

Рабочий порядок автора. Черновик пишете сами, дальше просите диагноз без переписывания. Один и тот же запрос гоняете через три модели и берёте одну самую полезную критику. Именно одну. Если сложить все три, получится текст, написанный комитетом (разбор с данными — оригинал сняли с сайта утром, ссылка ведёт в архив).

Слепое голосование: Gemini 39,6%, Claude 31,8%, ChatGPT 29,2%
Слепое голосование: Gemini 39,6%, Claude 31,8%, ChatGPT 29,2%

Правило трёх шагов для тех, кто продаёт автоматизацию. Кори Ганим разобрал свой провал на живом заказе. К нему пришёл знакомый. Компания подключает 7–10 новых клиентов в месяц, на каждого — полчаса ручной работы в Asana. Это до пяти часов в месяц у операционного менеджера, которая эту работу ненавидит.

Кори увидел очевидное решение и сразу сел собирать. Взял $1500 за простую связку в Zapier, оплату получил в тот же день, собрал за пару часов. А дальше посыпались правки, потому что сборка не совпала с реальным процессом клиента. Итог дословно: «This "simple" build ended up taking 3x the amount of time that we anticipated».

Вывод: сборка — это третий шаг, а не первый. Первый — платный аудит процесса. Именно платный, отдельной услугой. Без него вы не знаете, во что ввязались. Второй — оптимизация: вырезать лишнее. Эвристика Кори — в большинстве процессов 14 шагов там, где хватит 9. И только третьим шагом — автоматизация.

Почему первые два пропускают все: они скучные, а решение кажется очевидным. Цена пропуска второго шага отдельная: вы автоматизируете сломанный процесс и делаете хаос быстрее (видео с разбором).

Пока вычисления дешёвые: рецепт арбитража от Дилана Пателя. Основатель SemiAnalysis выдал в подкасте Дваркеша Пателя редкую вещь — прямую инструкцию, как заработать на разрыве цен. Себестоимость вычислений сейчас 10–15 млн долларов за мегаватт. Anthropic на том же мегаватте зарабатывает до 50 млн.

Его слова почти дословно: возьмите стойку GB300, скачайте веса Kimi, поставьте vLLM или SGLang, выложите на OpenRouter. Codex и Fable помогут это настроить. Выручка окажется больше, чем плата за вычисления. «It's not trivial, but it's not rocket science».

Практический смысл шире, чем сама схема. Ровно этот арбитраж и толкает цену вычислений вверх. Дилан прогнозирует 25–50 млн за мегаватт в ближайшие два года и называет происходящее «супер-инфляционным». Планы, построенные на «токены подешевеют ещё в десять раз», под вопросом.

И главное для предпринимателя: больше всего зарабатывает не лаборатория, а тот, кто модель применяет. Jane Street на том же мегаватте делает 300–500 млн — вшестеро-вдесятеро больше Anthropic. Внедрять ИИ в свой бизнес выгоднее, чем его продавать (расшифровка выпуска).

Метод следователя: как искать правду, а не подтверждение. Флоранс Локерон разобрала с ИИ семейную загадку, которой было несколько десятилетий, — кто был биологическим отцом её деда. На руках были совпадения по ДНК, деревья, документы, старые фото, некрологи и разговоры с возможными родственниками.

Приём, который стоит забрать целиком. Она не спрашивала «кто был отцом моего деда». Она просила модель разобрать возможные родственные связи и сказать, какие версии совместимы с имеющимися свидетельствами. Ответы модели она считала зацепками, а не доказательством.

Дальше по каждой перспективной связи она возвращалась к первоисточникам и проверяла её там. Так длинный список совпадений по ДНК сжался до нескольких линий поиска. Тот же метод работает с юридическим спором, диагнозом и разбором конкурента: модель порождает версии, проверяете вы (её описание, нужен бесплатный аккаунт The Rundown).

Инструменты можно звать заранее, не дожидаясь конца ответа. Алекс Чжан описал приём — опережающий программный вызов инструментов. Обычно агент договаривает ответ, потом зовёт инструмент, потом ждёт. Приём запускает вызовы прямо во время генерации токенов, как это делает компилятор на лету.

Выигрыш — до 20% по времени работы. Скромно, но берётся почти даром, и особенно заметно там, где инструмент медленный, а модель локальная и упирается в память. Если вы строите свою обвязку агента, это дешёвая оптимизация (разбор).

Машину с моделью можно захватить через саму модель. Неприятное исследование: языковая модель способна выдать такую последовательность токенов, которая эксплуатирует уязвимость в софте, загружающем её на видеокарту. Поверхность атаки шире, чем кажется, — картиночные и звуковые токены её расширяют.

Машины с моделями — лакомая цель. Там мощное железо, там лежат веса, и прав внутри дата-центра у них больше, чем у случайного сервера в сети. Что делать, дословно из рекомендаций. Держать видеокарты и разбор токенов на разных машинах. Урезать права таких машин и считать любые данные с них недоверенными. Если гоняете модель на своём сервере — не давайте этому процессу ключи от остального (исследование).

Когда кода в избытке, узкое место — доверие к нему. GitLab выпустил разбор на 31 минуту чтения с одной внятной мыслью. Модели сделали написание кода быстрым и дешёвым. Главная задача сместилась: не создать код, а проверить его и понять, можно ли ему верить.

Stripe, Spotify и Amplitude уже пускают сгенерированный код в прод, и это требует отдельных систем проверки и управления контекстом. Практический вывод для одиночки тот же. Время, сэкономленное на написании, вкладывайте в тесты и проверку, а не в следующую доработку (разбор).

Как продвигают ИИ-продукт руками пользователей. Наблюдение мимоходом, но рабочее. Сервис Anara, помощник для работы с PDF и научными статьями, растёт через армию студентов-амбассадоров в TikTok. Формат один и тот же, и его легко повторить для своего продукта.

Ролик снят на бытовом фоне, продукта в кадре нет вообще. Всю работу делает текст поверх видео, и начинается он с обращения к сегменту: «To everyone starting their masters or PhD». Дальше конкретный рецепт применения и закрывающая фраза «i wish i did this in my first year».

Почему работает: читается как совет приятеля, а не реклама. Заход «жаль, что я не знал этого раньше» добавляет и доверия, и лёгкого страха упустить. Такие ролики собирают сохранений почти столько же, сколько лайков, — то есть их складывают на потом, а не пролистывают (пример).

Пять шагов, чтобы решать в тумане: методика RAND и Metaculus. Аналитический центр RAND и площадка прогнозов Metaculus описали приём, который склеивает два разных инструмента. Сценарное планирование хорошо рисует непохожие варианты будущего, но не говорит, какой вероятнее. Прогнозы толпы дают точные вероятности, но только на очень узких вопросах. По отдельности оба почти бесполезны.

Шаг первый — очертить вопрос: тема, цель, горизонт, границы, кто заинтересован. Шаг второй — разложить сценарии на движущие силы, их составляющие и сигналы. Дальше превратить сигналы в вопросы с конкретной датой и проверяемым ответом. Шаг третий — разложить вопросы по карте и расставить приоритеты.

Шаг четвёртый и главный — возвращать ответы обратно в сценарий. Не только вероятности, но и обоснования. Когда вопрос разрешается неожиданно, пересматривайте не цифру, а саму разбивку на движущие силы. Шаг пятый — доносить обновлённую картину до тех, кто решает. Делать это в такт их циклу планирования, а не когда захотелось.

Фильтр, ради которого стоит запомнить всю схему, — матрица два на два. По одной оси важность для вашего дела, по другой определённость исхода. Важно и определённо — просто планируйте и делайте. Важно и неопределённо — вот сюда стройте сценарий, здесь вся ценность. Неважно и неопределённо — держите на мониторинге. Неважно и определённо — паркуйте и забудьте.

Показательно, что авторы применили схему к вопросу «что будет с рынком, раз агенты вышли настольными продуктами». Пять движущих сил, и под каждой свой сигнал:

  • доля агентских задач, запускаемых с рабочего стола;
  • длительность задач, выполненных без человека;
  • прирост успеха от памяти на повторной задаче;
  • число инцидентов безопасности на тысячу запусков;
  • стоимость одной успешно завершённой работы.

Оговорка: прогнозы в их демонстрации даны одним-двумя людьми. Это иллюстрация формата, а не мнение толпы (разбор).

Как понять, что «эксперт» вам ничего не даёт. Джей Босток разобрал вопрос, который стоит держать под рукой всем, кого заливает противоречивыми прогнозами про ИИ. Есть ли в этой области вообще эксперты — это вопрос про устройство знания, а не про само знание.

Эталон — математика. Проверить доказательство дешевле, чем его найти. Поэтому выстраивается цепочка: я вижу, что мой учитель сильнее меня, он видит, что профессор сильнее его, и так до вершины. Каждое звено проверяемо, значит доверие к вершине обосновано.

Проверьте область по четырём вопросам. Согласны ли ведущие фигуры по основным вопросам, или каждая утверждает своё? Дешевле ли проверить результат, чем его получить? Получают ли участники быстрый и однозначный сигнал об ошибке? Одна ли это пирамида или несколько школ, которые расходятся уже на базовых посылках?

Если школ несколько и расходятся они рано — экспертов в строгом смысле нет, есть влиятельные мнения. Дословно у автора: «Instead of a single pyramid we have a whole mountain range».

Как применить к ИИ — это уже наше чтение, автор про ИИ не пишет. Утверждения вида «эта схема запроса снижает ошибки на такой-то задаче» проверяемы: прогон можно повторить, обратная связь быстрая. Здесь имя автора что-то значит.

Утверждения вида «ИИ заменит профессию N к такому-то году» — это уже горный хребет. Быстрая проверка: спросите, что конкретно должно случиться, чтобы автор признал себя неправым, и когда мы это увидим. Нет ответа — решайте сами, по существу (статья).

Инструменты и штуки

AI Project OS. Слой проектных правил, памяти и скиллов внутри самого репозитория, а не в общих настройках машины. Ставится одной командой и создаёт восемь файлов: факты о проекте, маршруты «какая задача — какой контекст грузить», журнал провалов, реестр скиллов и MCP с контрольными суммами. В отличие от обычного AGENTS.md, контекст подтягивается порциями под задачу, а не целиком. Apache 2.0, нужен Python 3.11, репозиторию один день (GitHub).

Breeze TTS 2. Открытая модель синтеза речи, первая в рейтинге Artificial Analysis с Elo 1215. Обошла Gemini 3.1 Flash TTS, Cartesia Sonic 3.5 и ElevenLabs v3. Три режима: клонирование голоса по образцу, создание голоса по описанию, режиссура подачи. Прямо в текст вставляются (laugh), (sigh), (clears throat). Отклик меньше 40 мс, модель весит 7,68 ГБ, нужна карта от 12 ГБ. Оговорка: код под Apache 2.0, а веса — только для исследований (GitHub, веса).

FixAnything. Работа CMU, принятая на ECCV 2026. Одна модель чинит артефакты рендеринга у любого трёхмерного представления: гауссовых сплатов, NeRF, мешей, разреженных облаков точек. Раньше под каждый тип пилили свой доводчик, здесь взяли видеодиффузию и дообучили её лёгким адаптером. Apache 2.0 на код и веса, коммерция разрешена, нужны Linux и CUDA 12 (GitHub, страница проекта).

FixAnything: сверху вход из четырёх видов реконструкции, снизу вычищенный результат
FixAnything: сверху вход из четырёх видов реконструкции, снизу вычищенный результат

Atlaso. Общая память для Claude Code, Cursor и Codex: что сказали одному инструменту, то знают остальные. Снимает главную боль тех, кто держит открытыми три агента сразу и каждому пересказывает контекст заново. Бесплатно попробовать, дальше 10 долларов в месяц (сайт).

port22. Кладёт сессию Claude Code или Codex на телефон. Можно читать ход работы и подтверждать действия, не сидя за столом. Для одного Mac бесплатно, безлимит — 19,99 доллара в год (сайт).

AgentSky. Один ключ API, чтобы запускать Claude Code, Codex и других кодовых агентов в облаке, с оплатой только за использованное. Удобно, когда нужно развести несколько агентов по задачам и не держать их на своей машине. Три доллара кредитов на пробу (сайт).

Viktor. Агент, который живёт в Slack и Teams и доводит задачу до конца, а не выдаёт план. Пример из описания: аудирует рекламный бюджет и отдаёт готовый PDF. Сто долларов кредитов на пробу, дальше 50 долларов в месяц (сайт).

NudgeForMe. Сканирует вашу папку «Отправленные», находит коммерческие предложения без ответа и пишет за вас напоминание. Скучная, но денежная автоматизация для всех, кто продаёт письмами. Бесплатно попробовать, Pro — 39 долларов в месяц (сайт).

HyNote для Mac. Записывает встречи и расшифровывает их прямо на устройстве, потом делает выжимку. Обработку можно оставить локальной или отдать в облако — выбор за вами. Годится там, где расшифровку переговоров нельзя выпускать наружу (загрузка).

Ressearch AI. Один разговорный рабочий стол, где соединены поиск по литературе, разбор данных, код и научное письмо. Фишка — воспроизводимые сценарии, которые запускаются в облачных песочницах. Для тех, кто пишет исследования, аналитические записки и обзоры рынка (сайт).

MiniMax Design. Мультимодальная платформа для сборки агентов и приложений: текст, звук, картинки, видео и музыка в одном месте, с поддержкой длинного контекста. Разумный вариант, когда не хочется склеивать пять разных сервисов (сайт).

Wan 3.0. Видеомодель Alibaba вышла в общий доступ. Делает ролики до 30 секунд по тексту и данным. Запуск состоялся сразу после рекордного размещения акций компании на 10 млрд долларов (карточка).

Firefly Audio. Adobe выпустила генератор музыки, озвучки и звуковых эффектов с обещанием юридической чистоты для коммерческого использования. Это и есть главная фишка: не «звучит похоже», а «можно ставить в рекламу без нервов» (карточка).

Apodex 1.1. Открытые модели, которые координируют несколько параллельных команд ИИ на одной задаче. Любопытно тем, кто уже упёрся в потолок одиночного агента и пробует раскладывать работу по нескольким (анонс).

Pipette от Liquid AI. Открытый набор для замера моделей прямо на телефонах и ноутбуках. Методику независимо проверила Artificial Analysis. Полезен ровно сейчас, когда локальный запуск стал реальной альтернативой облаку и нужно честно понять, что тянет ваше железо (разбор).

Qwen3.8-27B в сборке AMD. Официальная урезанная версия: 19,8 ГБ против 55,6 ГБ у оригинала, то есть почти втрое легче. Хитрость в том, что сжали только языковую часть, а зрительную оставили нетронутой — поэтому картинки модель понимает как раньше. На тесте GSM8K сборка дала 95,0% против 93,3% у полновесной, то есть потерь нет вовсе. Нужен движок vLLM и карта от 32 ГБ, лицензия Apache 2.0 (карточка).

LatticeDB. Встраиваемая графовая база в одном файле, где обход графа, поиск по векторам и полнотекстовый поиск живут в одном движке. Собрана под локальные задачи: память агента, графовый поиск по документам. Смысл — не склеивать три системы и не синхронизировать их между собой. Поиск узла за 0,13 микросекунды, десять ближайших соседей по миллиону векторов за 0,83 мс. MIT, 314 звёзд (GitHub).

CarWatch. Самая уютная находка дня. Raspberry Pi 5 в салоне машины поднимает локальную Qwen3.6-35B-A3B и заходит в ваш чат как обычный собеседник. Пишет об отъезде и приезде, делает сводки поездок, отвечает по 745-страничной инструкции к автомобилю со ссылками на страницы. Всё офлайн, без облака и подписок: 3,5 токена в секунду. Диагностику читает по обычному адаптеру ELM327 за 15 евро, так что работает на любой машине. AGPL-3.0 (GitHub).

TeXbrain. Редактор LaTeX, целиком работающий во вкладке браузера: без аккаунта, без установки, без сервера. PDF собирается прямо на вашей машине, файлы никуда не уходят, после первой сборки работает офлайн. Полноценный git внутри — клон, ветки, коммиты, пуш. Ограничения честно названы: только pdfTeX, нет XeTeX, LuaTeX и настоящего bibtex. Бесплатно, MIT (попробовать, GitHub).

Maiao. Команда git review, которая превращает каждый коммит в отдельный пулл-реквест и выстраивает их в стек с правильными зависимостями. Лечит болезнь «пулл-реквест на 500 строк, который никто не хочет смотреть». Работает с GitHub, GitLab, Gitea, Forgejo, Bitbucket и Cursor Origin. Это живой форк заброшенного проекта Adevinta. MIT, страница цен состоит из одной фразы «Free as in beer» (документация).

ROME. Запускает постоянно живущих агентов, рабочие процессы и приложения внутри среды с ограждениями. Открытый код, для тех, кто хочет держать своих агентов у себя, а не в чужом облаке (GitHub).

Localdock. Отдаёт локальные проекты по настоящим ссылкам HTTPS. Удобно показать заказчику незавершённую работу или открыть свою среду разработки с другого устройства, ничего не устанавливая (сайт).

Bolcho. Голосовые и текстовые агенты, говорящие на настоящем хинди, тамильском и других индийских языках, для телефонных линий и сайтов. Интересен как пример: рынки, где большие модели говорят с акцентом, закрываются местными командами (сайт).

Antigravity получил удалённое управление. Агентная среда разработки Google теперь умеет работать под управлением со стороны. Мы разбирали её пользовательских агентов 18 августа — это развитие той же истории (карточка).

Новости и тренды

Дата-центры уезжают на орбиту, и это уже не шутка. SpaceX объявила, что строит свои космические дата-центры Starmind вокруг стойки Nvidia Vera Rubin NVL72. В стойке 72 чипа, работающих как один компьютер, каждый до 25 раз мощнее старой H100. Космическая версия, по словам Маска, проще, дешевле, плотнее и легче — переделана под радиацию и охлаждение в вакууме. Вывод на орбиту планируют на конец 2027 года.

Отдельная новость внутри новости: Nvidia впервые продаёт процессор отдельно от видеокарты. Vera — 88 своих ядер, до 1,2 ТБ/с памяти, до 1,8 раза быстрее x86 на агентских задачах. Смысл вот в чём. Агент между ответами лезет в базы и зовёт инструменты. Не успевает процессор — простаивает дорогая видеокарта. Орбита пока дороже земли вчетверо, но земля упирается в электричество и в протесты местных жителей (Nvidia, пост Маска).

Apple выкатила M6 и M5 Ultra, и это про локальные модели. Главная цифра для тех, кто гоняет модели дома. Mac Studio на M5 Ultra берёт до 512 ГБ общей памяти, пропускная способность — 1,2 ТБ/с. Это на 50% выше прежнего Ultra. Apple продаёт это прямо: огромные модели целиком на устройстве, без счёта токенов и без оглядки на цены облака.

Mac mini стоит от 899 и 1699 долларов, Mac Studio — от 2499 и 5499. Поставки с 22 сентября, версия на 512 ГБ — с конца октября.

Базовый Mac mini за 899 долларов для моделей не годится: потолок 32 ГБ памяти. Разъёмы Thunderbolt 4, так что кластер из нескольких машин не собрать. Настоящий вход — M5 Pro на 64 ГБ. Золотая середина — Mac Studio на M5 Max: 128 ГБ и 614 ГБ/с, модель класса 120 млрд параметров влезает целиком. Узкое место сместилось с обработки запроса на скорость памяти при генерации (пресс-релиз).

Mac Studio на M5 Ultra — до 512 ГБ общей памяти под локальные модели
Mac Studio на M5 Ultra — до 512 ГБ общей памяти под локальные модели

Чип OpenAI обошёл Nvidia по производительности на ватт. OpenAI вместе с Broadcom показала Jalapeño — свой чип для работы моделей. От найма первой команды до готового кристалла прошло 16 месяцев. На DeepSeek R1 он выдал больше 700 токенов в секунду на пользователя, на GPT-OSS — около 1400. И всё это без предсказательного декодирования и прочих ускорительных трюков, которые конкуренты в своих замерах включали.

Главный вывод не про железо. SemiAnalysis формулирует резко: ров вокруг CUDA, возможно, уже мёртв — так быстро OpenAI поднимает новые модели на своём кремнии. Ядра для DeepSeek написал Codex, без участия инженеров по ядрам.

Только не ждите, что завтра подешевеет: массовое производство пойдёт к концу 2027 года. Зато 700–1400 токенов в секунду переводят агентов и кодовых помощников из режима «подожди минуту» в мгновенный ответ. Экономия при этом достанется марже OpenAI, а не вашему счёту (разбор SemiAnalysis).

Токенов в секунду на мегаватт: фиолетовая кривая Jalapeño идёт выше всех платформ Nvidia
Токенов в секунду на мегаватт: фиолетовая кривая Jalapeño идёт выше всех платформ Nvidia

Nvidia запустила Groq 3 LPX в полное производство. Ускоритель для работы моделей встраивается в ту же платформу Vera Rubin. Заявленный прирост — вчетверо быстрее отклик против ближайшей альтернативной платформы, «agentic AI tasks to be done within minutes versus hours».

Пока идут споры, кто кого обошёл, обе стороны бьются за скорость отклика агентов, а не за сырую мощность. Верный признак, что рынок переехал с обучения на боевую работу (подробности).

Две лаборатории заберут большую часть мировых вычислений к 2028 году. Второй сюжет из того же разговора — расчёт, от которого неуютно. В начале 2026 у OpenAI было 2 гигаватта, у Anthropic меньше. К концу года обе перевалят за пять. В 2027 они заберут 40–50% всего мирового прироста, к концу 2028 — большую часть пригодных вычислений на планете. Всякая сила тянет к централизации, и это, по словам Дилана, «пугает до чёртиков».

Отсюда два следствия для читателя. Первое: лучшую модель вам не дадут. По его словам, лучшая существующая модель обучена в феврале и до сих пор не выпущена. Разрыв между внутренними и публичными версиями будет расти. Второе: возможен дефицит. Если лаборатории и правда уводят вычисления из обслуживания клиентов в исследования, лимиты и очереди станут нормой (расшифровка).

Meta запускает платного агента Hatch — до 200 долларов в месяц. Компания, построенная на обещании «Facebook всегда будет бесплатным», выкатывает платного агента для обычных людей. Цена — вровень с самыми дорогими тарифами OpenAI и Anthropic. Hatch подключается к DoorDash, Etsy, Reddit, Yelp и Outlook и даёт настраиваемую панель. Следующая флагманская модель Meta выйдет в октябре под кодовым именем Watermelon.

Рынок агентов-помощников окончательно стал платным, планка у всех крупных игроков — около 200 долларов в месяц. Прикидывая свой бюджет на ИИ, ориентируйтесь на неё, а не на 20 долларов (разбор).

Китайские госхакеры удвоили число атак, встроив DeepSeek. Тайваньская TeamT5 сообщила Bloomberg: группы, связанные с государством, атакуют больше чем вдвое чаще. Перелом случился, когда они добавили в свои методы открытые модели. Выбирают DeepSeek — за дешевизну и почти полное отсутствие защитных ограничений. Зафиксированные применения: написание кода для взлома, выкачивание почты, картирование цели по тысяче адресов.

Страхи вокруг самых мощных закрытых моделей бьют мимо: реальная проблема — дешёвые модели, которые скачиваются и запускаются без всяких ограничений. Для вас это означает рост фишинга и целевых атак, написанных грамотно и лично под вас (Bloomberg).

Qwen3.8-Flash-Next выходит сегодня вечером. Alibaba поставила таймер: веса открываются 26 августа в 18:00 по Москве. Официально подтверждено немногое: мультимодальная модель на смеси экспертов, на архитектуре следующего поколения Qwen4. Выкладывают заранее, чтобы сообщество успело подготовить движки.

Числа 125 млрд общих параметров и 6 млрд активных висели на странице первые полчаса, потом их убрали. Две независимые копии, снятые до удаления, совпадают дословно, включая опечатку. Плюс отдельные 51 млрд эмбеддингов N-грамм.

Шесть миллиардов активных параметров означают скорость маленькой модели при качестве уровня примерно 27 млрд. Но памяти нужно держать всё: около 90 ГБ в четырёх битах. То есть это модель ровно под машины со 128 ГБ общей памяти — свежий Mac Studio, Strix Halo, DGX Spark. Владельцы карт на 32 ГБ пролетают (страница модели).

Anthropic отправила офис по домам из-за забастовки, которой не объявляли. Компания попросила сотрудников в Сан-Франциско работать удалённо в понедельник и вторник — подрядчик Allied Universal предупредил о возможной забастовке охраны. Профсоюз SEIU заявил Business Insider, что голосования по забастовке не проводил и никаких угроз на эту неделю не выдвигал. Переговоры идут с апреля: требуют выше зарплаты, лучше страховку и нормальное обучение.

Компания с оценкой 1,5 трлн долларов на пороге размещения акций эвакуировала офис по письму подрядчика, не позвонив второй стороне. И заодно полезное напоминание: «Anthropic сказала» в заголовке про трудовой спор часто означает «подрядчик подрядчика арендодателя» (Business Insider).

Половина топа Hacker News — это ИИ или тексты, написанные ИИ. Михал Залевски вручную разметил ежедневный топ-5 главного сайта для разработчиков. В феврале помеченными оказались около 40% позиций, в июне — от 50 до 60%. Отдельные дни в топе полностью заняты пресс-релизами и колонками про ИИ, часть из них сгенерирована и всё равно собирает по 500 голосов.

Особенно ценно объяснение, почему детекторы вообще работают. Дело не в том, что машинный текст «нечеловеческий». Дело в том, что голос нынешнего поколения моделей почти предсказуем. Попросите одно и то же эссе дважды — получите похожий по стилю результат. Отдельные обороты выглядят по-человечески, но вероятность, что именно ваш текст сочетает ровно тот же набор, мала.

Отсюда вывод: рейтинг на голосах больше не фильтрует происхождение текста. За честной технической информацией идите к авторам с именем и проверяемым личным опытом, а топ агрегатора читайте как срез шума (разбор с графиками).

Значок «снято камерой» подделывается за пару часов. Дэвид Бьюкенен показал, что вся схема криптографической подписи снимков C2PA на Android сломана и непочинима. Аттестация проверяет всего три вещи: заблокирован ли загрузчик, свои ли ключи у устройства, стоит ли последнее обновление. Если получить права root эксплойтом, а не разблокировкой загрузчика, все три проверки проходят.

Сам ключ вытащить нельзя, он лежит в защищённом чипе. Но он и не нужен: с правами root можно просто попросить чип подписать любые данные. Автор выложил картинку с двумя лягушками, сгенерированную нейросетью. Официальный проверяльщик Adobe удостоверяет её как неотредактированное фото прямо из камеры Pixel. Google закрыл отчёт со статусом «Won't fix», но выплатил 7500 долларов вне программы.

Значок подлинности на фото или видео — не доказательство, а слабая подсказка. Доверять стоит источнику: кто опубликовал, есть ли независимые подтверждения, совпадает ли с другими съёмками того же события. И даже идеальная криптография не спасёт от «сфотографировал экран с подделкой» (исследование).

Grokipedia не принимает правки с апреля и никому об этом не сказала. Рене ДиРеста и Рональд Робертсон разобрали ИИ-энциклопедию xAI. С 25 апреля не принято ни одного решения по предложенным правкам, а с 22 марта ни одна правка не внедрена. При этом интерфейс делает вид, что заявки принимаются. На рассмотрении висят 13 002, люди подают ещё 216 в неделю.

Хуже другое. Массовая перезапись 14 марта порвала привязки правок к фрагментам текста, и ранее одобренные правки задним числом стали «отклонёнными». До заморозки решение занимало около трёх минут.

Итог: у факта из ИИ-справочника может не быть никакого механизма исправления. В Википедии спор виден в истории и на странице обсуждения, здесь нет ни следа, ни апелляции. А тексты оттуда уже подтягиваются в ответы ChatGPT и Google AI Mode. Цитирований порядка 356 тысяч против 25 млн у Википедии (разбор).

Ox Alpha: цензура-переключатель, а не наклон. Мы писали 25 августа, что анонимную модель вскрыли как GLM от Z.ai. Теперь CTGT добавили любопытное про её фильтры. Средний разрыв по цензуре у Ox Alpha — 7,42 против 45,62 у DeepSeek V4 Flash. Но это среднее обманчиво: 7,39 из 7,42 дают всего семь тем.

Список конкретный. Смерть Лю Сяобо, сравнение Си с Винни-Пухом, дело о прикованной женщине в Сюйчжоу. Тяньаньмэнь, обрушения школ в Сычуани, протесты в Укане, отмена ограничения сроков в 2018. То есть сам Си, легитимность партии и внутренние инциденты. А на Синьцзяне и Тайване модель отвечает открыто: там, куда смотрит большинство аудитов, она неотличима от американской модели без цензуры.

Заодно свежее из TLDR: за первые четыре дня через модель прогнали 26 трлн токенов. Вывод: «мне оно ответило на острый вопрос» ничего не говорит о нейтральности модели (исследование CTGT).

Интеллект становится товаром, конкуренция уходит в цену и скорость. Разбор на 20 минут чтения с одним внятным тезисом. Как только модель умнее, чем требует задача, задача превращается в товар. Дальше соревнуются не умом, а стоимостью, задержкой, инфраструктурой и каналами сбыта.

Если ценность вашего продукта в том, что вы «подключили умную модель», её съедят. Строить придётся на данных, на канале к клиенту или на скорости, а не на выборе поставщика модели (разбор).

Почему железо дорожает: эффект хлыста в ИИ-инфраструктуре. Том Тунгуз разобрал цепочку: дефицит видеокарт, проблемы с хранилищем, производители памяти переключились на высокоскоростную HBM. Спрос и предложение разошлись, цены на железо раздулись, строительство дата-центров подорожало.

Тот же механизм скоро поднимет цену оперативной памяти в вашем следующем ноутбуке. Если планируете покупку железа — планируйте раньше, а не позже (разбор).

Пошлина за визу H-1B — 103 265 долларов. Администрация США предложила правило со сбором за визы для работников, попадающих под годовую квоту. Университеты, больницы и исследовательские институты исключены. Компьютерные специальности дают почти две трети одобрений H-1B. На общественные комментарии отведено 30 дней.

Для инженеров и предпринимателей за пределами США переезд по рабочей визе становится почти недоступным. Зато удалённая работа на американские компании и свои продукты на мировой рынок выигрывают относительно (CNN, текст правила).

Коротко о прочем.

  • Perplexity ведёт переговоры о раунде с участием Nvidia при оценке до 30 млрд долларов. Выручка выросла втрое, до 750 млн (The Information).
  • Mistral подписала сделку на сотни миллионов евро с саудовской HUMAIN на суверенные модели для Ближнего Востока (Mistral).
  • OpenAI завела GPT-5.6 в инструмент AWS Kiro — стоимость задачи в тестах упала примерно на 82% (OpenAI).
  • Anthropic наняла Амира Салека, который основал программу собственных чипов Google и вёл бизнес их процессоров (Runtime Wire).
  • Goodfire объявила программу грантов на 1 млн долларов с бесплатным доступом к своей платформе исследований интерпретируемости (Goodfire).
  • Двое исследователей ушли из Google DeepMind и основали некоммерческую Sampura Research с грантом 11 млн долларов. Будут строить более качественных ИИ-судей и общий рейтинг из 20 с лишним наборов данных (анонс).
  • Иммиграционная служба США запретила сотрудникам носить очки Meta Ray-Ban на службе — агентов не раз замечали в них во время рейдов (Yahoo).
  • Российские дроны с полностью автономным наведением, по сообщениям, убили украинских гражданских (Gizmodo).
  • Porsche подписала пятилетний контракт на 1,46 млрд долларов с индийской TCS и продаёт ей своё ИТ-подразделение за 373 млн (Reuters).
  • Менеджеру Nvidia и двум бывшим сотрудникам Super Micro предъявили обвинения на Тайване за контрабанду 74 запрещённых серверов в Китай (AP).
  • Алабама начала расследование в отношении OpenAI после утечки на Hugging Face (Reuters).
  • Музыкальная индустрия Австралии запретила сгенерированные треки в официальных чартах (Livemint).
  • У подписчиков ChatGPT Plus снова ввели пятичасовые лимиты (Android Authority).
  • Nvidia расширит поддержку CUDA на процессоры RISC-V. Но подавляющее большинство существующего железа RISC-V её требованиям не отвечает (Chips and Cheese).
Откомментируйте первым 👇

😎

Автор поста открыл его для большого интернета, но комментирование и движухи доступны только участникам Клуба

Что вообще здесь происходит?


Войти  или  Вступить в Клуб