Раньше на Stack Overflow задавали около 200 тысяч вопросов в месяц — теперь примерно тысячу. Почти весь этот поток ушёл в приватные чаты с ИИ, и откуда возьмётся новое знание, толком никто не понимает. Пока одни об этом спорят, практики спокойно отдают агенту целый запасной Mac и идут пить кофе. А те, кто гоняет модели всерьёз, выяснили неприятное: модный режим /goal чаще мешает, чем помогает.
Главное за 30 секунд
- Готовый рецепт: запасной Mac превращается в песочницу, которой Claude Code управляет целиком — хоть с телефона, без риска для основной машины.
- Turing Post объясняет: ИИ экономит время на задачах, но деньги приходят, только когда компания осознанно тратит освободившиеся часы.
- Разбор /goal: на задачах поиска и оптимизации этот режим повышает частоту мелких выигрышей, но усиливает редкие крупные провалы.
- Anthropic обсуждает с Meta аренду чужих вычислений на 10 млрд долларов — и одновременно строит и сдаёт свои.
- Число вопросов на Stack Overflow упало почти на 99% от пика 2014 года — причём вдвое только за первый год после ChatGPT.
Внедряем и улучшаем
Отдай агенту целый Mac — и не бойся --dangerously-skip-permissions. Инженер ykdojo выложил пошаговый гайд: как превратить запасной Mac в песочницу, которой Claude Code управляет полностью (ykdojo.github.io). Идея простая: рискованные задачи безопаснее давать машине, которой нечего терять, а не основному компьютеру. Управлять ей можно с телефона через приложение Claude или с основного Mac по SSH.
Сначала запасной Mac стирают начисто и заводят на нём новый локальный аккаунт-админ, без Apple ID. Дальше — три быстрых шага, чтобы агент не спотыкался о пароли и сон. Включаем удалённый доступ, разрешаем sudo без пароля и запрещаем машине засыпать:
# на запасном Mac (target)
sudo systemsetup -setremotelogin on
echo "<user> ALL=(ALL) NOPASSWD: ALL" | sudo tee /etc/sudoers.d/<user>-nopasswd >/dev/null
sudo chmod 440 /etc/sudoers.d/<user>-nopasswd
sudo pmset -c sleep 0 # не спать от сети
sudo pmset -c disablesleep 1 # не спать даже с закрытой крышкой
С основного Mac настраиваем вход по ключу без пароля и ставим Claude Code прямо по SSH:
# на основном Mac (source)
ssh-keygen -t ed25519
ssh-copy-id <user>@<target-host>.local
ssh <user>@<target-host>.local 'curl -fsSL https://claude.ai/install.sh | bash -s -- 2.1.201'
Самое ценное — раздел про computer use, то есть скриншоты, мышь и клавиатуру. Из коробки по SSH это не работает: macOS привязывает права к графической сессии. Автор обходит ограничение через постоянный tmux-сервер внутри GUI, который поднимает готовый скрипт setup-computer-use.sh. Ключевая тонкость, на которой все спотыкаются: права Screen Recording и Accessibility нужно выдать процессу tmux, а не claude — macOS вешает разрешения на «ответственный процесс», а им как раз оказывается tmux. После выдачи прав сервер обязательно перезапустить.
Есть и мелочь для удобства — общий буфер обмена по SSH. Скрипт clip умеет и текст, и картинки: clip send отправляет буфер с основного Mac на запасной, clip get — обратно. Пароли для входов в приложения передают так же, чтобы агент их не видел. Управление с телефона включается командой /remote-control прямо в сессии. А если нужен доступ из любой сети, на обе машины ставят Tailscale — и SSH с песочницей работают через телефонный хотспот так же, как дома.
Зачем это тебе. Это самый чистый способ дать агенту максимум свободы и при этом не потерять рабочую машину, если он что-то снесёт. Все команды и подводные камни в гайде расписаны дословно — можно повторить за вечер.
Режим /goal — не кнопка «старайся сильнее». Инженер Charles Azam прогнал Claude Fable 5 и GPT-5.6 Sol на одной NP-трудной задаче — проектировании волоконной сети, где надо минимизировать длину кабеля (charlesazam.com). Проверял с включённым и выключенным /goal. Результат парадоксальный: /goal выиграл 4 прогона из 6, но ухудшил средний результат у обеих моделей. Причина — редкий, но крупный провал в «хвосте». У Fable средний балл вырос с 32 386 до 33 145 (меньше — лучше), у Sol — с 34 261 до 35 129.
Важно понимать, что /goal — это две разные штуки под одним именем. В Claude Code это хук на конец хода: маленькая модель-проверяльщик (по умолчанию Haiku) читает диалог и решает, достигнута ли цель. Она не видит файлов и инструментов — судит только по тексту сессии. В Codex наоборот: рабочая модель сама ведёт цель, видит файлы, но фактически сама себе и ставит оценку.
Практический вывод. На обычном кодинге прогресс «читаемый»: ещё ход — починил тест, доделал миграцию. Там /goal помогает не бросать задачу на полпути. А на поиске и оптимизации лишнее время одинаково усиливает и удачную стратегию, и тупиковую — здесь /goal по умолчанию лучше не включать. И помни: Fable на этой задаче держался куда стабильнее Sol.

ИИ сэкономил время, а деньги не пришли — вот где потеря. Turing Post разобрал свежее датское исследование NBER: опросили 25 тысяч работников в 7 тысячах компаний (turingpost.com, исследование). Люди говорят, что чат-боты экономят им в среднем 2,8% рабочего времени, а сэкономившими себя назвали от 64% до 90%. Но в реальных часах и зарплатах за два года — почти ноль. Задача стала легче, а экономика не сдвинулась.
Turing Post предлагает для этого рабочую модель — «цепочку от ёмкости к результату». Четыре звена: выигрыш на задаче → высвобожденные часы → поглощение организацией → бизнес-результат. Ломается обычно на третьем. Сэкономленное время приходит рассеянными кусочками и тут же уходит в бэклог, совещания и проверку самого ИИ. Само по себе оно в деньги не превращается.
Что с этим делать — «дисциплина конверсии» из пяти шагов. Измерь изменение на задаче. Вычти из него время на ревью и сопровождение — считай чистую экономию, а не валовую. Найди, где именно возникла свободная ёмкость. Выбери один из шести каналов, куда её направить: больше объёма, короче цикл, выше качество, ниже риск, новый продукт или ранее неподъёмная работа. И назначь этому каналу владельца — без владельца ёмкость просто растворяется. Отчитывайся сконвертированной ёмкостью, а не «сэкономленными часами».

Обвязка агента важнее модели — и вот как её чинить. Мы уже отмечали на неделе: выигрыш в том, КАК ты гоняешь агента, а не в самой модели. Райан Лопополо собрал под эту мысль целый практический сборник — Harness Engineering (github.com). Модель и агента держим как чёрный ящик, а крутим два внешних рычага — контекст и инструменты. Задача обвязки — донести до агента то, чего нет в весах: требования к надёжности, безопасности и совместимости твоего проекта.
Внутри — готовый playbook «улучшай обвязку». Цикл такой: снять базовый прогон → найти самый ранний сбойный переход → внести одно минимальное исправление у «владельца» → проверить на реальной задаче → прогнать заново с чистого листа. Ключевой приём — классифицировать разрыв, а не сразу винить модель. Категорий шесть: не хватило контекста, инструмента, владения доменом, полномочий, доказательства результата или доставки обратной связи. Один сбойный прогон ещё не доказывает, что модель слабая.
Забрать можно прямо шаблоны. В репозитории лежат дословные заготовки «контракта задачи» и «гипотезы-вмешательства» — их копируют в свой проект как есть. Плюс отдельный чек-лист для аудита репозитория: воспроизводит ли агент поведение без человека-посредника, доказывает ли результат на нужной границе. Принцип экономии автор формулирует прямо: предпочитай минимальную систему, которая закрывает реальные сбои.

Ревью не спасёт от ошибок ИИ-кода — посчитай сам. Томас Депьер разбирает популярный аргумент «относись к коду от модели как к коду джуна: всё равно же всё ревьюишь» (softwaremaxims.com). И упирается в жёсткие цифры из исследований code review. Ревью дольше часа подряд теряет смысл — человек устаёт. Эффективная скорость — максимум 400 строк в час, дальше почти ничего не находишь. В день у сеньора таких слотов несколько, и они ещё конкурируют с митингами и инцидентами.
Отсюда потолок: реалистично меньше 1000 строк проверенного кода в день на одного ревьюера. Это и есть предел пользы от вала ИИ-кода. Хуже того: есть данные, что на коде от модели ревьюеры находят меньше дефектов, но при этом сильнее уверены, что нашли всё. То есть ревью создаёт ложное чувство контроля.
Вывод для практики. Если твой план качества — «я всё поревьюю», держи это узкое место в голове. И особенно осторожно давай модели самый труднопроверяемый код — bash, шелл, конфиги, где одна опечатка либо безвредна, либо сносит систему. Не путай объём сгенерированного с объёмом реально проверенного.
Инструменты и штуки
Deepsec — сканер уязвимостей от vercel-labs, который натравливает кодинг-агентов (Claude или Codex) на большую кодовую базу (github.com). Ищет глубоко спрятанные дыры, которые пропускают обычные линтеры. Работает конвейером: быстрый поиск кандидатов → расследование моделью → перепроверка по git-истории → выгрузка отчёта. Разворачивается у себя, есть распределённый режим на изолированных микро-ВМ. Открытый, Apache 2.0. Честное предупреждение авторов: полный скан крупного репозитория может стоить тысячи долларов на моделях — платишь за скорость закрытия дыр.
Transcribe.cpp — быстрый локальный движок распознавания речи на C++ (github.com). Поддерживает 16 семейств моделей и 60+ вариантов — Whisper, Parakeet, Voxtral и другие. Ускорение на Metal, Vulkan и CUDA, работает быстрее реального времени даже на слабом ARM-компьютере. По сути замена whisper.cpp, читает те же файлы. Есть биндинги под Python, JS, Rust и Swift. Лицензия MIT, бесплатно. Годится, чтобы транскрибировать звонки, встречи и подкасты локально, без облака и утечки данных.
Codex Resets — крохотный сайт, который следит, когда OpenAI сбрасывает лимиты Codex (codex-resets.com). Сбросы объявляют нерегулярно и часто «из ниоткуда» — в личном твиттере инженера OpenAI. Сайт автоматически вылавливает эти анонсы и показывает график активности. За всё время — 35 сбросов, в среднем раз в 8,9 дня, самый долгий разрыв — почти 68 дней. Удобно быстро глянуть, освежили ли лимиты, вместо ручного листания ленты.
Academa: многомерное исчисление с ИИ-тьютором — бесплатный курс из 35 видеолекций с компьютерной анимацией (calculus.academa.ai). Интересна не сама математика, а приём вёрстки. У каждой лекции рядом с видео — переключатель на чат с ИИ, где спрашиваешь непонятное прямо по контексту урока, не уходя в отдельный ChatGPT. Без регистрации, шесть языков интерфейса. Готовый паттерн «контент плюс контекстный ИИ-ассистент в одном окне» легко скопировать для своего курса или базы знаний.

Better Codex App — неофициальная macOS-заплатка для приложения ChatGPT, которая добавляет выбор провайдера модели под каждую задачу без выхода из аккаунта (github.com). Штука нишевая и на свой риск, но удобная тем, кто гоняет несколько бэкендов из одного приложения.
DocuSmart AI — поиск по Google Drive, SharePoint, Dropbox и другим хранилищам обычным человеческим языком (docusmart.eu). Ничего не надо мигрировать или переупорядочивать: подключаешь и спрашиваешь. Полезно, когда файлы разбросаны по десятку сервисов, а нужный документ надо найти здесь и сейчас.
Acebuilder — сборка сайтов из готовых компонентов и шаблонов Aceternity (acebuilder.ai). Импортируешь блоки, а текст, макет и структуру правишь через чат. На выходе можно выгрузить код. Быстрый способ собрать симпатичный лендинг, не начиная с пустого экрана.
Новости и тренды
Anthropic и Meta: 10 млрд за вычисления. Meta ведёт переговоры об аренде вычислительных мощностей у Anthropic — сделка на несколько лет может дойти до 10 млрд долларов (Economic Times / NYT). Anthropic сама недавно подписала контракт на 45 млрд и строит свои дата-центры, а Meta хочет отбить вложения в ИИ, сдавая излишки.
Что это значит. Вычисления окончательно стали новой нефтью: даже прямые конкуренты торгуют друг с другом мощностями. Для тебя это косвенный сигнал — дефицит и цена железа ещё долго будут определять, сколько стоит доступ к сильным моделям.
SpaceX может продать Пентагону ИИ-вычисления. Маск ведёт переговоры об аренде мощностей своих дата-центров военным на миллиарды долларов (newsbytesapp). Его стартап xAI задействует лишь 11% своей ёмкости, так что продажа излишков закрывает дыры в бюджете. Мотив тот же, что у Meta: простаивающие мощности выгоднее сдавать, чем держать пустыми. Рынок аренды GPU превращается в отдельную большую экономику.
Белый дом решает, кому давать передовые модели. По данным CNBC, администрация США начинает диктовать доступ к самым сильным ИИ-моделям, смещая власть от техногигантов к государству (CNBC). Что это значит: доступ к моделям становится геополитическим рычагом, а не только рыночным. От таких решений зависит, какие инструменты вообще доедут до пользователей в разных странах.
GPT-5.6 закрыл 30-летний пробел в математике — и на этот раз с проверкой. Мы писали 11 и 15 июля, как ИИ щёлкал матзадачи, но там доказательства просто выкладывали. Здесь иначе. Математик Филлип Кергер закрыл разрыв, открытый с 1996 года, в теории выпуклой оптимизации (arXiv). Модель работала по десятистраничному промпту 148 минут, а доказательство потом формально проверили в Lean — и оно прошло.
Что это значит. Проверка в Lean эпистемически сильнее, чем текст «на естественном языке»: это уже не «выложено», а «доказано машиной». Но заголовок «за 148 минут» обманчив — за ним год работы эксперта и промпт, куда он сам заложил все нужные подходы. Пока это не автономный прорыв ИИ, а связка «сильный человек плюс упрямая модель».
Stack Overflow обвалился почти на 99%. График числа новых вопросов красноречив: пик 2014 года — около 207 тысяч в месяц, сейчас — примерно тысяча (data.stackexchange.com). За первый год после ChatGPT показатель упал ровно вдвое — самый резкий обвал за всю историю. Честности ради: спад начался ещё раньше из-за токсичной модерации, но ИИ его резко ускорил.
Что это значит. Публичный обмен знаниями схлопывается. То, что раньше становилось общедоступным ответом в Google, теперь растворяется в приватных диалогах с моделью. И большой открытый вопрос — откуда возьмётся свежий корпус, на котором учить следующие поколения ИИ.
«Массовый ИИ-психоз» в корпорациях. Консультант по данным описал год из 300 разговоров с компаниями — от нишевых до Fortune 500 (ludic.mataroa.blog). Тезис резкий: все наблюдаемые ИИ-проекты за полтора года провалились, а сомневаться в ИИ вслух стало опасно для карьеры. Красивое демо, по его словам, отключает у людей критическое мышление, и они сметают даже более полезные не-ИИ решения.
Что это значит. Полезный приём на будущее — отделяй реальную ценность от ритуала. Автор советует анонимный опрос участников по шкале 1–10: разрыв «3 против 8» выдаёт скрытую от начальства правду. И всегда спрашивай тех, кто на земле: у одного клиента сотрудники даже не знали, что им выдали ИИ-лицензии. Пара к разбору Turing Post выше: экономия на задачах ≠ деньги.
Реклама Anthropic пугает людей. Новый ролик «There's hope in hard questions» открывается горящим домом, дальше — слежка, надгробия, шахтёры (TechCrunch). Закадровый голос спрашивает: «Кто нажмёт на тормоза, если понадобится?». Сэм Альтман тут же поддел: «думал, это сатира». Обычно маркетинг Anthropic бьёт в точку, но игра в «мы честно признаём вред ИИ» на этот раз ушла в жуть и стала мемом даже среди своих.
Обречённую задачу агента можно поймать после первого шага. Свежая работа показывает: провал многошаговой задачи заметен по внутренним сигналам модели уже на первом шаге (arXiv). Это позволяет обрывать тупиковые запуски заранее и резать расходы до 60%, при этом успешно завершая 90% задач. Что это значит: скоро агентные прогоны станут дешевле — модель научится не тратить токены на заведомо гиблое дело.
Коротко. NYC при мэре Мамдани хочет обязать арендодателей раскрывать ИИ-правки в фото объявлений — ранний сигнал, что помечать «изменено ИИ» скоро придётся всем (PetaPixel). А атаки через промпт-инъекции, оказывается, неплохо ломают и самих ИИ-агентов-взломщиков (Wired).