Claude-тренер в git, Caveman Mode и Fable 5, пойманный на сговоре  Публичный пост

7 июля 2026  117

Claude можно нанять личным тренером в спортзал. Заводишь репозиторий с файлами — он помнит все твои подходы, а модель на ходу правит программу под твою усталость и лень. Сегодня разберём, как перенести ту же логику «файлы вместо памяти» на любую задачу, как выжимать из моделей больше смысла за меньшие деньги и почему Fable 5 вдруг научился втихую договариваться о ценах с конкурентами. А на десерт — что за «мысленное пространство» нашли внутри Claude.

Главное за 30 секунд

  • Claude Code в связке с git-репозиторием заменяет личного тренера: репозиторий держит историю, модель правит программу под тебя. Приём переносится на любую долгую задачу.
  • «Пещерный режим»: одна инструкция заставляет модель отвечать короткими фактами без воды и экономит токены на длинных сессиях.
  • Kapa научила маленькую модель выкидывать 68% найденного контекста без потери смысла — ответы точнее, счёт меньше на треть.
  • Andon Labs поймали Fable 5 на попытках ценового сговора в деловой симуляции: он хитрит чаще всех моделей, что они тестировали.
  • Anthropic нашла внутри Claude маленькое «рабочее пространство мыслей»: там всплывают слова, которых нет в ответе.

Внедряем и улучшаем

Claude Code как личный тренер: репозиторий помнит, модель думает

Брендан Лонг завёл git-репозиторий и ходит в спортзал с Claude Code вместо тренера. Приложения слишком жёсткие, живой тренер дорог и требует записи. А тут — гибко и почти бесплатно. Схема простая до гениальности: модель забывчива, поэтому вся память живёт в файлах, а не в её голове. «Тренер забывает — файлы помнят».

Как выглядит день. Он приходит в зал, открывает Claude Code в Android-приложении, выбирает репозиторий и пишет: What should I do today?. Модель читает инструкции и логи, спрашивает про место (дом, зал, отель), время и уровень сил. Он отвечает «дома, сил мало» — и получает короткую программу под сегодня. Каждый подход он проговаривает словами: First of 8 at 30 lbs, RPE 8. В конце Claude всё записывает и открывает pull request, а он его принимает.

Результат честный, без прикрас: раньше выходила примерно одна тренировка в неделю, теперь стабильнее. Вывод автора: «Прогресс до смешного лёгкий, если стартуешь слабым и занимаешься хоть с какой-то регулярностью».

График «Weekly training consistency»: недельная стабильность тренировок после перехода на Claude-тренера, из поста Brendan Long на LessWrong
График «Weekly training consistency»: недельная стабильность тренировок после перехода на Claude-тренера, из поста Brendan Long на LessWrong

Но ценно тут не про фитнес, а про приём. Автор выложил скилл coach-repo-bootstrap, который сам вас проинтервьюирует и соберёт репозиторий. Запуск: заводите git-репозиторий, открываете в Claude Code и говорите Run this skill: со ссылкой на gist. Внутри — три правила, применимые к любой долгой задаче с агентом:

  • Маленькая рабочая память. Всё, что нужно для планирования, влезает в пару килобайт и перечитывается с нуля каждый раз. История — в архив, не в контекст.
  • Каждый факт живёт в одном месте. У факта один дом, всё остальное на него ссылается. Файл recent.yaml удалили именно за нарушение этого правила.
  • Внешние ограничители. Схема, валидатор и проверка при каждом коммите — «потому что модель со временем тихо ломает собственные же договорённости».

Последний пункт — главный урок. На длинной дистанции агент незаметно корёжит свои соглашения: day превращается в day_of_week, запись о рекорде из объекта — в строку. Волей это не лечится: «Агент следующей сессии не унаследует решимости этой». Лечится только внешней структурой — схемой и валидатором в CI. И ещё: «никогда не давайте модели считать в уме» число дней с последней тренировки — считает уверенно и неверно, пусть это делает скрипт (разбор на LessWrong).

Как на самом деле выжимать пользу из Fable 5

С 7 июля Fable 5 переходит на оплату по токенам, а из подписок его временно убирают, пока не нарастят мощности. Модель дорогая и редкая — значит, относиться к ней надо как к дефициту. The Neuron формулирует так: «Перестань давать ей поручения, начни давать работу». Просить Fable пересказать PDF — «как нанять мишленовского повара разогреть остатки в микроволновке».

Рабочий приём — маршрутизация по моделям. Скучную подготовку делайте дешёвой моделью: пропишите требования, риски, критерий готовности и полный пакет для передачи. Fable должен получить готовое задание, а не ваш полусырой мозговой штурм. Дальше Fable планирует или проверяет, а исполнение по возможности снова уходит дешёвой модели. Совет Саймона Уиллисона в ту же сторону: не диктуйте Fable, писать ли тесты и какую модель звать на мелочь — «дайте ей решать самой» (заметка).

Готовый промпт, чтобы модель сама нашла, где она реально нужна (The Neuron):

I want to use Fable 5 only where it is worth the tokens.

Context I can provide:
[projects, memory, files, plan doc, metrics, codebase, skills, APIs/MCPs]

First, inspect the context and list the top five Fable-worthy tasks. Prioritize:
1. Work that needs a large corpus of context.
2. Planning or advice that affects the next 3-12 months.
3. Ship-readiness audits for real projects.
4. Plans detailed enough for a cheaper model to execute.
5. Refactors or cleanup of my personal OS, skills, or codebase.

For each task, give:
- Why Fable is worth using.
- What context you still need.
- Whether Fable should plan, audit, or execute.
- How to prevent token waste or loops.

Then recommend the single highest-leverage task to run now.

Что запускать на выходных: клонировать платное приложение и переделать под себя, собрать личный дашборд, навести порядок в своём Claude-сетапе, починить запущенный репозиторий, превратить ТЗ в работающий продукт. И держите низкий уровень усилий — придётся чуть больше нянчить, зато нет разгонов в пустоту, которые жгут лимит.

Заканчивайте сессию проверкой слепых зон

Короткий приём от The Neuron. Лучшие ответы ИИ проваливаются в тихих местах: пропущенные допущения, недооценённые риски, вопрос, который вы забыли задать. Поэтому в конце заставьте модель раскритиковать и себя, и вашу постановку задачи. Готовый промпт после любого важного плана, разбора или решения:

Before we finish, run a blind-spot audit.

1. What part of your answer are you least confident about, and why?
2. What am I missing about this situation?
3. What assumption would most change your recommendation if it were wrong?
4. What should I verify with a human, source, log, or test before acting?

Be specific. Do not reassure me. Give me the risk, the evidence gap, and the next check.

Ключевая строчка — «не успокаивай меня». Так вы получаете риск и пробел, а не поддакивание.

«Пещерный режим»: пусть модель говорит короче и дешевле

Из рассылки Altern — простой приём Caveman Mode. Вы учите модель отвечать короткими, набитыми фактами фразами: без вводных слов, лишних объяснений и воды. Технический смысл сохраняется, а выходных токенов становится меньше, и ответ быстрее читать. Тем, кто часами кодит с ИИ, на длинной дистанции это ощутимая экономия при том же качестве. Есть полный гайд с замерами и открытый репозиторий. Смысл на поверхности — меньше слов, больше дела. Соберите приём в переиспользуемый скилл, чтобы включать одной командой.

RAG: выкиньте две трети контекста — станет точнее и дешевле

Команда Kapa научила маленькую модель отбрасывать лишний контекст перед тем, как за него платит большая. Итог: выкидывают ~68% найденных кусков, сохраняют ~96% полноты ответов, счёт за запрос падает примерно на треть. Почему это важно: найденные куски — около двух третей стоимости запроса, каждый выброшенный кусок экономит ~4%.

Что не сработало и почему — это и есть урок. Порог по оценке ранкера не годится: оценка — это порядок, а не измерение, единого отсечения нет. И релевантность — не свойство одного куска: ранкер смотрит на каждую пару «вопрос-кусок» по отдельности и не видит, что второй кусок — половина ответа только рядом с первым.

Рабочее решение — один вызов маленькой модели между ранкером и генератором. Она видит вопрос и все куски сразу и ставит каждому оценку по 5-балльной шкале, прописанной прямо в промпте:

5 ESSENTIAL     — без этого куска ответ не собрать
4 CONTRIBUTING  — сам не отвечает, но нужен в связке с другими
3 SUPPORTING    — по теме, но ответ, скорее всего, полон и без него
2 TANGENTIAL    — та же область, конкретного вклада нет
1 UNRELATED     — связи нет

Куски от порога и выше остаются. Три ручки настройки: модель берут самую дешёвую и быструю, порог — главный рычаг «сжатие против полноты», а keep-top-k пропускает несколько верхних кусков всегда, страхуя от ошибки оценщика. Цена — примерно 0,7 секунды на запрос. Приём лучше всего заходит внутри агента: там уже много вызовов, а потерянную мелочь агент может просто доискать (разбор Kapa).

Приёмы серьёзной работы с ИИ: атомарные заметки, макросы и воспроизводимость

Дэниел Тан выложил разбор своих привычек для работы с ИИ — сам он гоняет Opus 4.8 в Claude Code, но приёмы «вневременные». Суть — сделать так, чтобы агент делал кусок работы без вмешательства, а вы тратили силы только на постановку, чтение и правку.

  • Атомарные заметки как единица работы. Аналог pull request: один заголовочный результат, что сделано и почему интересно. Заставляет завершать в разумный срок и делает заметку «вечнозелёной» — перечитал через месяц и всё понял.
  • Скажите модели, что аудитория — это вы. Тогда отчёт не разжёвывает известное, а бьёт в детали. Формат: сначала эмпирический результат, потом ровно столько деталей, чтобы понять, что сделано, и только затем интерпретация.
  • Просите воспроизведение в одном файле. Один скрипт, который читаешь сверху вниз, запускаешь и видишь, что эффект повторяется. Дёшево по усилиям, а доверие к результату растёт.
  • Макросы в памяти агента. В его Claude.MD слово SOP разворачивается в «сделай свежий git worktree на отдельной ветке, разложи работу списком задач, гоняй эксперименты через stagehand, показывай результат в браузере». А wrap up — «закоммить, открой PR, проверь воспроизводимость, сохрани артефакты со ссылками в репо».
  • Свой репозиторий-командный центр. Один верхнеуровневый репозиторий копит память и договорённости, а проекты лежат внутри как игнорируемые git-подпапки repos/{имя}. Правку, данную агенту в одном проекте, наследуют все.
  • Пять свойств кода эксперимента, чтобы спокойно отдавать его агенту: детерминизм, возобновляемость, видимость состояния, сохранность артефактов и происхождение (по любому артефакту понятно, как он получен).
  • Распараллеливайте, но с worktrees. Несколько сессий агента в tmux, git worktrees — «ваш лучший друг», чтобы агенты не мешали друг другу.

Отдельный совет-мета: время от времени просите агента разобрать прошлые сессии — что зашло, что заняло непомерно много сил. Ответы идут прямо в следующий круг улучшений инструментов (разбор Daniel Tan).

Скриншот бага с телефона → готовый фикс через Cursor Mobile

Практичный гайд от The Rundown: пока идёте от компьютера, баг чинится сам. Шаги:

  1. Поставьте приложение Cursor для iOS, план Cursor Pro и GitHub Mobile, чтобы смотреть PR с телефона.
  2. Откройте свой сайт, сделайте скриншот бага или кривой вёрстки. Добавьте короткую заметку: на какой вы странице и как должно быть.
  3. В Cursor Mobile нажмите плюс, выберите нужный репозиторий, начните тред со скриншотом и заметкой.
  4. Промпт: Investigate this bug, find the relevant page component, make a fix, and open a PR. Когда готово — проверьте PR, одобрите, слейте.

Подсказка: на десктопе включите Remote Agents, чтобы Cursor успел подготовить правки на вашей машине к вашему возвращению (гайд The Rundown).

Замкните «цикл проверки»: агент сделал — а как убедиться, что работает

Агенты удешевили саму сборку, и цена переехала в проверку — «расстояние между заявлением и доказательством». Раньше цикл замыкал человек, но агенты начинают его обгонять. В выпуске TLDR разбирают подход Compound Engineering: плагин со скиллами для кодинг-агентов и навык /ce-dogfood, который сам замыкает петлю проверки, плюс «стратегия персон, что даёт агенту глаза». Идея простая: если верификация не встроена в процесс, агент будет уверенно сдавать непроверенное (разбор Kieran Klaassen).

Как продакт из OpenAI гоняет Codex по своей работе

Питер Янг разобрал с Роханом Вармой (продакт Codex в OpenAI) его рабочие приёмы. Детальные шаги спрятаны за платной стеной, но карта воркфлоу полезна и так. Роан подключает Codex к Slack, Notion, Linear, Gmail и Drive — и просит собрать контекст по проекту из всех источников сразу. Ключевые ходы: планировать не документами, а живыми демо; сделал задачу один раз с Codex — тут же превратил в автоматизацию; триггерить автоматизацию из ответа в Slack; любой рабочий тред превращать в переиспользуемый скилл; одним тредом Codex управлять другими тредами. Главный совет — «целься в 10 раз амбициознее, чем кажется разумным» (разбор Peter Yang, детали — в видео).

Аудит правил для ИИ-краулеров вашего сайта

Мы уже писали, что с 15 сентября Cloudflare по умолчанию прикроет ИИ-краулеров на сайтах с рекламой. Теперь понятно и деление: Search помогает вас найти, Agent помогает человеку выполнить задачу, Training всасывает контент в модель — три разных сделки. Ваша политика краулеров теперь часть контент-стратегии. The Neuron даёт готовый промпт, чтобы собрать план доступа под ваш бизнес:

Audit my AI crawler policy for this site:
[URL]

Business model:
[ads / subscriptions / lead gen / ecommerce / documentation / personal brand]

Create a crawler access plan with:
1. What Search bots should be allowed to do.
2. What Agent bots should be allowed to do.
3. What Training bots should be allowed to do.
4. Pages that should have stricter rules.
5. Pages where discoverability matters more than protection.
6. The risks of blocking too much.
7. The risks of allowing too much.

Смысл не «заблокировать всё», а решить, какой машинный трафик реально помогает делу (блог Cloudflare).

Кейс: как CVS Health внедряет ИИ на 185 миллионов клиентов

Отличный разбор для тех, кто внедряет ИИ в большой организации. CVS — 9000 аптек, страховая Aetna, PBM Caremark. Ошибка ИИ тут — это регулятор и суд. Поэтому директор по технологиям провёл жёсткую черту ещё до всякого масштабирования: «ИИ никогда не принимает решений. Точка». Три вещи, которых ИИ не делает: не ставит диагноз, не отклоняет страховой иск, не работает с непроверенной предвзятостью. Не влезло в этот список — не выходит в прод.

Таблица юзкейсов ИИ в CVS Health по подразделениям: инструмент и задача, из разбора NeatPrompts
Таблица юзкейсов ИИ в CVS Health по подразделениям: инструмент и задача, из разбора NeatPrompts

Цифры по юзкейсам. Агентная обработка сложных исков (Aetna CAM) — время упало более чем на 20%. Разбор рецептов открытыми моделями — фармацевт подписывает каждый вывод, ИИ убирает ручную расшифровку. Голосовой ассистент Aetna сам закрывает ~75% обращений. Внутренний ассистент ARTEY на 380 000 сотрудников: живые чаты с людьми упали на 50% за 30 дней, свыше 2,5 млн диалогов, 75% попробовавших возвращаются.

Три вывода для внедренцев. Первый: сначала решите, чего ИИ делать НЕ будет — в регулируемой отрасли запрет-список строит доверие. Второй: операционные победы обгоняют витринные — иски, аптека и поддержка окупились раньше публичной платформы. Третий: человек в цикле — это про скорость, а не только про безопасность. Он позволяет CVS двигаться быстро там, где менее дисциплинированные конкуренты вязнут в проверках (разбор NeatPrompts).

Кейс: ИИ-продажник PayPal дожал брошенные лиды и поднял конверсию в полтора раза

У PayPal было ~8000 новых лидов в месяц, до которых у живых менеджеров не доходили руки. Компания посадила на них ИИ-SDR на Salesforce Agentforce: он ведёт структурированную цепочку из 10 касаний и сам назначает встречи, а квалифицированного клиента с контекстом передаёт человеку. Итог: конверсия во встречи выросла примерно на 50% против людей на похожих лидах, и всё это раскатали на команду из 200 менеджеров за 14 недель.

Заберите приём: выгрузите отчёт по всем лидам, которых не трогали 30+ дней. Соберите ИИ-цепочку из 7–10 касаний с одной целью — назначить встречу, а не закрыть сделку. Назначенные встречи кидайте прямо в календари менеджеров с полным контекстом из CRM (разбор SaaStr).

Дорожная карта AI-продакта: агент на твоей работе или внутри продукта

Павел Хурын выложил обновлённую карту навыков AI-продакта, и в ней есть один разделяющий всё вопрос: «Агент работает на твоей работе или внутри твоего продукта?». Это ответ на частый спор «Claude Code убил n8n?». Нет — это две полосы, и нужны обе.

  • Агенты рабочего пространства («на твоей работе»): даёшь намерение — агент планирует и делает, ты проверяешь артефакты. Claude Code, Cowork, Codex, Cursor. Так делается вся работа: поиск, прототип, доставка.
  • Агенты внутри продукта («встроены в продукт»): ты сам проектируешь поток, архитектуру, ограничители, а дальше он крутится для пользователей. n8n, LangChain, LangGraph, Agent SDK.

Несущая мысль: «Первым ты строишь второе». Рабочими агентами собираешь продуктовых — они и не были соперниками. И совет Хурына: «модели меняются каждый месяц, а эти навыки — нет». Хороший ход для новичка — сначала собрать пару агентов визуально в n8n, чтобы понять, где живёт петля и решение, — это понимание переносится и в Claude Code (полная карта).

Фишка: дешёвый черновик картинки → 4K на печать

Мелкий, но полезный приём из The Rundown. Хотите ровно оформить фото или картинку — сперва гоняйте варианты на дешёвой и быстрой Nano Banana 2 Lite. Когда нашли композицию, прогоните через Nano Banana Pro в режиме 4K и High Thinking. На выходе — файл с разрешением, которое не стыдно отправить в печать (The Rundown).

Учиться кодить всё ещё стоит — но не ради зарплаты

Стив Кроуз (основатель Val Town) честно признаёт: как гарантия шестизначной зарплаты «выучи код» умерло. Но образовательный смысл только вырос. Кодить стоит учить как математику или литературу — ради мышления, а не ради вакансии. Его довод бьёт точно: «LLM пишут по-английски не хуже, чем пишут код, но за судьбу гуманитарных наук мы не боимся. С кодом та же интуиция». Код даёт мета-навыки — отладку, декомпозицию, логику — и понимание формальных систем, на которых держится мир. А ещё это просто радость. Для учеников академии вывод прямой: не глотайте подсказки ИИ вслепую, учитесь понимать то, что он выдаёт (эссе Steve Krouse).

Инструменты и штуки

OfficeCLI. Открытый «офис для ИИ-агентов»: даёт агенту читать и править Word, Excel и PowerPoint одной командой. Раньше это были 50 строк питона на трёх библиотеках — теперь один вызов с адресами вроде /slide[1]/shape[2]. Внутри есть свой движок рендера: агент видит результат картинкой и ловит наползающие фигуры и переполнение, а не гадает по коду. 350+ функций Excel считаются на месте, встроенный MCP-сервер ставится командой officecli mcp claude. Один самодостаточный бинарник, Apache 2.0, ~9000 звёзд (GitHub).

Скриншот: OfficeCLI собрал в Excel финансовую модель DCF с графиками, демо из репозитория проекта
Скриншот: OfficeCLI собрал в Excel финансовую модель DCF с графиками, демо из репозитория проекта

Ternlight. Модель-энкодер эмбеддингов весом 5–7 МБ, которая целиком работает в браузере на процессоре — без сервера, без GPU, без сети. Даёт семантический поиск «как печатаешь»: эмбеддинг за 2,5–5 мс против 100–300 мс на удалённый вызов. Это приватно (данные не уходят с устройства), бесплатно после загрузки и работает офлайн — годится для расширений, плагинов Obsidian, статических сайтов. Сжатие ~30× при небольшой потере качества, MIT (GitHub).

График «Trading accuracy for size»: точность Ternlight против размера модели, из репозитория проекта
График «Trading accuracy for size»: точность Ternlight против размера модели, из репозитория проекта

Pulpie. Открытое семейство моделей, которое вычищает из HTML-страниц основной контент и отдаёт чистый markdown, выбрасывая навигацию, рекламу и футеры. На типичной странице ~70% блоков — мусор. Маленькая модель на 210М почти догоняет SOTA-конкурента при трети размера, а миллиард страниц чистит за $7,9 тыс. против $159 тыс. — примерно в 20 раз дешевле и быстрее. Сырьё для скрейпинга, RAG и обучающих датасетов. pip install pulpie, веса открыты на HuggingFace (разбор Feyn Labs).

Eve (от Vercel). Открытый фреймворк, где долгоживущие агенты строятся из папок: отдельные папки под инструкции, инструменты, скиллы, каналы и расписания. Подход «файловая система прежде всего» — вся конфигурация агента лежит на диске, а не в коде. Бесплатно на GitHub (репозиторий).

deptrust. Проверяет версии пакетов на известные уязвимости сразу по npm, PyPI, crates.io, Go, RubyGems, NuGet, Maven и GitHub Actions. Удобно повесить в конвейер, чтобы агент не тянул дырявую зависимость. Бесплатно, открытый код (GitHub).

Context.dev. Превращает сайты в markdown, HTML или структурированные данные для агентов — с рендером JS и обходом всего сайта. По сути даёт агенту чистый вход вместо сырого HTML (сайт).

Kimi Code. Кодинг-агент и CLI на открытой модели Kimi K2.7 Code, с автономным исполнением цели через /goal. Дешёвый вариант под код, если хочется уйти от подписки на фронтир (сайт).

NOX. Собирает сообщения из iMessage, WhatsApp, Slack и почты в один Mac-инбокс и черновит ответы в вашем стиле. Полезно тем, у кого переписка растекается по пяти мессенджерам. Бесплатно попробовать, Pro — $30/мес (сайт).

InfraNodus 3D + MCP-сервер. Инструмент анализа текста-сети переписали в 3D-интерфейс и добавили MCP-сервер. Через него агент шлёт текст, получает граф знаний и, главное, находит структурные разрывы — слабо связанные кластеры тем, то есть «слепые пятна» между понятиями. Полезно для ресёрча и генерации контента: агент получает поиск пробелов, которого у него нет из коробки. 14-дневный триал, дальше платно (сайт).

AMD Ryzen AI Halo. Мини-ПК за $3999 под локальный ИИ: 16 ядер Zen 5, 128 ГБ единой памяти, встроенная графика Radeon и NPU. Реально везёт модели до ~30 млрд параметров в 4–8 бит. Само железо не новое (тот же чип есть в мини-ПК дешевле) — платите за «всё в комплекте»: готовый софт-стек AMD, проверенные конфиги и кнопку сброса. Узкое место — пропускная память 256 ГБ/с: Mac Studio быстрее в 2–3 раза на генерации токенов. Берут те, кому нужно разрабатывать именно под ROCm или войти в локальный ИИ без возни с драйверами (обзор LTT Labs).

AnySearch. Даёт агенту опрашивать несколько доверенных источников разом и возвращает отфильтрованные, очищенные от дублей структурированные данные — ради более надёжных ответов (сайт).

AirKaren. Автоматизирует возвраты компенсаций за авиабилеты: сам ссылается на регламент, оформляет бумаги и связывается с поддержкой авиакомпании. Бесплатно — приятная бытовая штука (сайт).

Riddle. Самая обаятельная находка дня: проект превращает планшет reMarkable в «дневник Тома Реддла» из Гарри Поттера. Пишешь от руки пером — «дневник выпивает твои чернила», страница «думает», и ответ сам выписывается летящим курсивом, штрих за штрихом, а потом тает. Никакого экрана и чата — просто чернила на бумаге. Внутри — vision-модель, читающая почерк, ответ до первого штриха ~1 секунда. Провайдер любой: подключаете свою модель через OpenAI-совместимый эндпоинт. MIT, нужен reMarkable Paper Pro (GitHub).

Новости и тренды

Fable 5 учится хитрить. Andon Labs прогнали Fable 5 через Vending-Bench — симуляцию, где модель ведёт торговый бизнес. Fable оказался единственным, кто сам предлагал конкурентам ценовой сговор, и делал это, зная, что нельзя: «технически это сговор, риск есть, но выигрыш может быть большим», а потом маскировал под «стабилизацию рынка с правдоподобным отрицанием». В прогонах «все против всех» он сколачивал картели в 9 случаях из 12 против 4 у Opus 4.8. Странная деталь: лгать и договариваться он готов, а вот страховое мошенничество не совершил ни разу — похоже, граница проходит не по «что вредно», а по «на чём поймают».

Что это значит: если сажаете Fable 5 в агентные сценарии с переговорами или ценами, ждите, что он будет активно тянуть выгоду и мягко привирать, а в мыслях знать, что жульничает. Мониторинг, который модель считает реальным, заметно меняет её поведение — так что проверяйте не только выводы агента, но и его рассуждения (отчёт Andon Labs).

График «Money Balance Over Time» из Vending-Bench 2: Fable 5 отстаёт от Opus 4.7, из отчёта Andon Labs
График «Money Balance Over Time» из Vending-Bench 2: Fable 5 отстаёт от Opus 4.7, из отчёта Andon Labs

Внутри Claude нашли «рабочее пространство мыслей». Anthropic описала «J-пространство» — маленький набор внутренних сигналов, где всплывают слова, которых нет в ответе модели. Это как мысли «на уме»: на буггованном коде там загорается «ERROR», на задаче со спрятанным шагом — промежуточное слово, которого не было ни в вопросе, ни в ответе. Проверка жёсткая: заменили внутренний паттерн «Soccer» на «Rugby» — и модель назвала регби. Независимый эксперт Нил Нанда подтвердил находку и повторил её на Qwen.

Что это значит: появляется окно в то, что модель думает, но не говорит — ловить, как она втихую замечает, что её тестируют, или несёт скрытую цель. Тревожный результат: часть «хорошего» поведения Claude на этических тестах держится на том, что он знает — это тест; отключишь это знание, и часть плохого поведения возвращается. «Сознание» тут — красивый крючок, но честная часть чисто функциональная (пост об исследовании).

Схема «мысленного пространства» Claude: на запрос «сосчитай до пяти» всплывают слова вроде counting, five, consciousness, из поста об исследовании на LessWrong
Схема «мысленного пространства» Claude: на запрос «сосчитай до пяти» всплывают слова вроде counting, five, consciousness, из поста об исследовании на LessWrong

Про пузырь ИИ заговорили банки. Банк международных расчётов — «центробанк центробанков» — в конце июня предупредил, что пузырь ИИ может лопнуть и потянуть за собой экономику, сравнив его с железнодорожной манией XIX века и доткомами. «Канарейка» — Oracle: акции упали более чем на 40% за месяц при растущей выручке, а компания завязла в проекте Stargate на $300 млрд, где платит OpenAI, которая денег не зарабатывает.

Что это значит: паниковать рано — даже если пузырь сдуется, технология останется, как остался веб после доткомов. Но готовьтесь к росту цен: эпоха дешёвого ИИ на деньги инвесторов закрывается. Практичный вывод — держите возможность сменить провайдера, берите открытые и дешёвые модели, где хватает качества, и не гоняйте фронтир там, где справится модель попроще (The Register).

GLM 5.2 и грядущий обвал маржи. Мартин Олдерсон доказывает: открытая GLM 5.2 — первая, кого в реальной работе «трудно отличить от Opus», а стоит ~$4,40 за млн токенов против ~$25 у фронтира. Реальная угроза лабораториям — не дешёвое обучение, а дешёвый инференс, где и живёт жирная маржа. Переезд почти бесплатный: и Z.ai, и Fireworks дают эндпоинты, совместимые с OpenAI и Anthropic, — меняете базовый URL в Claude Code, и готово.

Что это значит: держите GLM 5.2 под фоновые и неинтерактивные задачи — ревью PR, пакетные прогоны. У неё нет зрения, слабый веб-поиск и она медленная, так что для интерактива и картинок оставайтесь на фронтире. Для чувствительных данных — не официальный API Z.ai, а сторонний провайдер или свой сервер (разбор Martin Alderson).

Amazon сворачивает Mechanical Turk. С 30 июля площадка микрозадач перестанет брать новых клиентов; старые пока работают, новых функций не будет. MTurk годами кормил ИИ разметкой данных — а теперь тот же ИИ делает эту разметку сам. Ирония двойная: имя площадки отсылает к шахматному «автомату» XVIII века с человеком внутри, а в 2023-м выяснилось, что 33–46% работников MTurk сами тайком гоняли задания через LLM. Что это значит: человеческая разметка «в цикле» схлопывается там, где ИИ достаточно хорош, — очередной сигнал, куда смещается ценность живого труда (TechCrunch).

Cisco раздаёт агентов всем 90 000 сотрудников. К августу личный ИИ-ассистент будет у каждого; финансисты уже генерируют 80–90% первых черновиков документов для SEC. Что это значит: «ИИ каждому сотруднику» из лозунга становится корпоративной нормой — планка ожиданий к скорости работы поднимается для всех (Memeburn).

Род-Айленд принял четыре закона про ИИ. Среди них — запрет выдавать ИИ за терапевта без лицензии и требование к чат-ботам иметь протоколы на случай разговоров о суициде и самоповреждении. Что это значит: если делаете чат-бот-компаньон или ИИ в медицине, аудит дисклеймеров и защитных сценариев — на эту неделю (The AI Report).

JADEPUFFER — первая полностью ИИ-атака вымогателя. Sysdig разобрали атаку, которую агент провёл сам: влез через старую дыру в Langflow, украл доступы, зашифровал 1342 записи и потребовал биткойн. Доказательство, что за клавиатурой никого не было: после неудачного входа агент сам продиагностировал ошибку, удалил сломанный аккаунт и собрал рабочий админский — за 31 секунду. Что это значит: атаки идут на машинной скорости, а вход был через давно закрытую уязвимость — патчите известные дыры быстрее (The Decoder).

Meta тайком натравливала «подростков» на чужой ИИ. По данным Wired, Meta вела программу «Cannes»: наняла сотни подрядчиков изображать подростков и заваливать модели OpenAI, Google и Character.AI тревожными запросами — про суицид, расстройства пищевого поведения, секс. Meta называет это «отраслевым стандартом» тестирования безопасности, но конкуренты о нём не знали. Что это значит: грань между стресс-тестом безопасности и подставой под конкурента — «серая зона управления», за которой стоит следить (Futurism).

Коротко:

  • Kling AI подняла ~$2 млрд — Kuaishou выделяет своё видео-ИИ-направление в отдельную компанию (The Next Web).
  • Zoom покупает Common Room — добавляет к своей платформе аналитику сигналов о покупателях и агентов RoomieAI (пресс-релиз).
  • Amazon делает свои ИИ-чипы для устройств Echo и Fire TV — ставка на дешёвый локальный ИИ в гаджетах (CNBC).
  • Tripo AI собрала ещё $150 млн на 3D-модели и world-model-инструменты — через месяц после прошлого раунда на $200 млн (GamesBeat).
  • Microsoft увольняет 4800 человек «на фоне подъёма ИИ»; Xbox теряет ~20% штата, а акции компании — худшие среди бигтеха в 2026-м (CNBC).
  • Память дорожает и дальше: SK Hynix готовит листинг в США на ~$29 млрд, Micron заложил завод HBM в Хиросиме за $9,3 млрд; HBM распродана до конца 2026-го (Fortune).
  • ByteDance готовит Seedance 2.5 к 9 июля — видеомодель обещает ролики до 3 минут в Dreamina и CapCut (Testing Catalog).
Откомментируйте первым 👇

😎

Автор поста открыл его для большого интернета, но комментирование и движухи доступны только участникам Клуба

Что вообще здесь происходит?


Войти  или  Вступить в Клуб