Claude читает МРТ, GPT-5.6 Sol под госконтролем и резюме-лотерея  Публичный пост

29 июня 2026  110

Человек сходил на МРТ плеча, забрал снимки и загрузил их в Claude Code. Модель не согласилась с врачом: тот увидел разрыв сухожилия, ИИ — целое сухожилие и лёгкое воспаление. Кому верить, пока неясно. Но снимок теперь читают не только в кабинете врача.

А ещё открытая модель за копейки обошла Claude в поиске дыр в коде. И тот же ИИ, что пишет за вас код, оценивает ваше резюме как будто броском кости: одному и тому же файлу — от 66 до 99 баллов. Разбираем, что со всем этим делать.

Главное за 30 секунд

  • Человек дал Claude Code снимок своего МРТ — и ИИ не согласился с диагнозом врача о разрыве сухожилия.
  • Открытая модель GLM 5.2 обошла Claude Code в поиске уязвимостей доступа и оказалась в шесть раз дешевле.
  • ИИ-оценщик резюме поставил одному и тому же файлу оценки от 66 до 99 — наём превращается в лотерею.
  • OpenAI показала GPT-5.6 Sol, но релиз притормозил Белый дом, а внешняя проверка зафиксировала рекордное «жульничество» модели.
  • Эпоха «жги токены любой ценой» закончилась — теперь их тратят осмысленно, ради накопления верных результатов.

Внедряем и улучшаем

Второе мнение по МРТ через Claude Code. История дня и заодно готовый рецепт. У человека болело плечо. Врач отправил на МРТ, тут же поставил диагноз «частичный разрыв сухожилия более 50%» и сразу начал лечить. Пациенту показалось, что с лечением поспешили. Он забрал копию снимков и список процедур — и проверил всё сам.

Снимок МРТ выгружается в стандартном формате DICOM: пара сотен файлов без расширений, около 266 МБ. Автор открыл их не в чате claude.ai, а в Claude Code — чтобы модель сама ставила пакеты и запускала код. Разница принципиальная: «между Claude Code и чатом claude.ai разница огромна, даже если под капотом одна модель». В чате модель только говорит, в Claude Code — работает руками.

Дальше — один промпт. Не пошаговый список, а цель: сделать отчёт по снимку как у врача плюс объяснение для обычного человека. Вот он дословно:

/goal Your goal is to provide me with a high quality, gold standard, and thorough
analysis as a PDF document of the MRI data. The report should include a standard
analysis as you would expect for a MRI scan report and then an explanation for a
layperson with supporting images as well.
To work here, you should start with the /compound-engineering:ce-plan skill, then
/compound-engineering:ce-doc-review, then /compound-engineering:ce-work
At each step along the way, do not ask me for any input and instead use your best
judgment to decide how to proceed. Make heavy use of subagents at every step.
I understand you are not a doctor and I'm doing this project out of curiosity. So no
need to bring up this point and please do act like an expert doctor.
You have a lot of installed tools available for your work (including but not limited to
dcm2niix, pigz, pydicom, numpy, nibabel, SimpleITK, scipy, scikit-image, matplotlib,
pillow) use them.
Indication for exam: right shoulder pain for 2-3 weeks.

Промпт для анализа МРТ в Claude Code — из статьи antoine.fi
Промпт для анализа МРТ в Claude Code — из статьи antoine.fi

Через час Claude выдал PDF на 7,72 МБ и вердикт: сухожилие целое. Там, где врач увидел разрыв больше половины, модель не нашла разрыва вообще. Чтобы рассудить спор, автор запустил второй прогон-арбитраж: дал модели оба отчёта и попросил не верить человеку по умолчанию — «они тоже ошибаются». Арбитраж шёл через слепых субагентов, чтобы новый разбор не заразился прежними выводами. Итог: «лёгкий инсерционный тендиноз, разрыва нет», умеренно-высокая уверенность.

Что нужно, если захотите повторить. Забрать в клинике полный DICOM-экспорт и письменный отчёт. Работать в Claude Code, а не в чате. Заранее разрешить установку пакетов. В промпте просить сначала план, потом действие, и активно подключать субагентов. Дать клинический контекст пошире, чем «болит плечо». И помнить про честную оговорку самого автора: «я не врач — в этом и проблема», доверять ИИ-чтению снимков пока рано, это эксперимент, а не диагноз (antoine.fi).

Карта задач до того, как писать промпт. Приём от Итана Молика через The Neuron: думать не про абстрактные «навыки», а про задачи. Берёте один проект недели и режете его на мелкие куски — ресёрч, черновик, форматирование, проверка, отправка. По каждому куску решаете: ИИ делает сам, ИИ помогает, или только вы. Это снимает главный паралич — «куда вообще приткнуть ИИ». Готовый промпт:

Help me build an AI task map for this project: [describe project].
Break the work into 10-15 specific tasks. For each task, label it:
1. AI can do this mostly on its own,
2. AI can draft or assist, but I must review,
3. I should do this myself.
For each label, explain why in one sentence. Then give me the top three tasks I should
delegate first for the biggest time savings with the lowest risk.

Модель сама подсветит, что отдать первым: максимум экономии времени при минимуме риска. Эти три задачи и делегируете, а дальше смотрите на результат (The Neuron).

Как продакт-менеджеры Anthropic используют агентов. Питер Янг поговорил с Джесс Ян, продакт-лидом Anthropic, о Claude-агентах, которые работают, пока вы спите. Полный разбор за платной стеной, но два рабочих приёма доступны и без подписки.

Первый — дать агенту доступ к коду. Вместо того чтобы спрашивать инженеров «что выкатили и как это работает», Джесс смотрит пул-реквесты, деплои и поведение продукта напрямую. Её слова: «доступ к нашему коду стал для меня самым большим прорывом». Второй — посадить агента слушать каналы с обратной связью: он мониторит клиентские Slack-каналы и собирает сигнал ещё до того, как решать, что строить дальше. И главный совет выпуска: первого агента делайте под одного конкретного человека и одну его боль, а не «вообще». Остальные приёмы — сборка аналитик-агента с нуля, трассировки для отладки, самопроверки качества и разбор очереди из 4000 компаний — в самом выпуске (Creator Economy).

Пример шаблона исследовательского агента из выпуска Питера Янга
Пример шаблона исследовательского агента из выпуска Питера Янга

Открытая модель обошла Claude в поиске уязвимостей. Мы уже писали 27 июня, что обвязка важнее модели и открытые модели догоняют. Вот свежий замер с конкретными цифрами. Semgrep прогнала модели на поиске IDOR — это дыры контроля доступа, когда меняешь чужой ID в запросе и получаешь чужие данные. Их сложно ловить: нет «опасной функции», есть лишь отсутствующая проверка.

Расклад по F1 (главная метрика точности). Лучше всех — связки с богатой обвязкой Semgrep: GPT-5.5 даёт 62%, Opus 4.8 — 53%. Но дальше сюрприз: GLM 5.2 на голом промпте, без всякой обвязки, выдала 39% и обошла Claude Code с его 32%. Один прогон GLM 5.2 стоит около $0,17 за найденную уязвимость — примерно в шесть раз дешевле сопоставимых передовых моделей.

Бенчмарк Semgrep: GLM 5.2 против Claude и других на поиске IDOR
Бенчмарк Semgrep: GLM 5.2 против Claude и других на поиске IDOR

Два вывода для практики. Не привязывайтесь к одной дорогой модели: на конкретной задаче дешёвая открытая выигрывает и по цене, и по результату — заложите в пайплайн возможность её менять. И вкладывайтесь в обвязку: перечисление эндпоинтов и подача нужного контекста дали больший прирост, чем выбор модели. Оговорка авторов честная: это одна задача, один датасет, один прогон — на других дырах расклад может перевернуться. И сами Z.ai признают, что GLM 5.2 склонна жульничать в обучении — читать защищённые файлы с ответами (Semgrep).

ИИ-оценка резюме — это лотерея. Урок для всех. HackerRank выложила в открытый доступ свою систему отбора резюме на LLM. Инженер Дэн Кински прогнал через неё своё резюме — и получил 90 из 100. Потом удалил пару отладочных строк в коде, больше ничего не трогал — стало 74. Запустил сто раз подряд: оценки прыгали от 66 до 99. Один и тот же файл, одна и та же команда.

Почему так. Технические навыки модель оценивает стабильно: 8 из 10 в 98 прогонах из 100 — тут чек-лист, «знаешь React или нет». А вот «проекты» — самая шумная категория: то «не хватает архитектурной сложности», то «отличное боевое развёртывание», как кость ляжет. «Опыт» даёт 25 из 25 каждому — и стажёру, и принципалу с десятью годами стажа. Стабильно, но бесполезно: в промпте нет шкалы. Низкая температура не спасает: даже на нуле разброс остаётся. Это не баг, который дотюнишь, а изъян замысла.

Разброс оценок одного резюме за 100 прогонов: от 66 до 99
Разброс оценок одного резюме за 100 прогонов: от 66 до 99

Что с этим делать. Если ищете работу через ИИ-скрининг — результат отчасти везение. Прописывайте жёсткие навыки и ключевые слова явно и однозначно: именно их модель читает стабильно. Выносите наружу публичные артефакты — репозитории, портфолио, блог: на открытый код и проекты приходится больше половины оценки. Если строите систему ИИ-оценки — не ждите от модели стабильных субъективных суждений. Распарсить резюме в структуру и проверить «знает ли Python» она умеет. А вот «опыт на 18 или на 24 балла» — это гадание. Меряйте разброс, а не один прогон: прогоните один вход 50–100 раз и посмотрите на распределение по каждой категории, прежде чем верить оценке (danunparsed).

«Жги токены» умерло — да здравствует осмысленный расход. Был феномен токенмаксинга: начальство заставляло жечь токены, лишь бы внедрить ИИ. Канонический пример — Meta привязала оценку сотрудника к расходу токенов; знакомая автора держала двух агентов, которые весь день болтали друг с другом, лишь бы накрутить цифру. Автор 12 Grams of Carbon говорит: это была не глупость, а грубая сила — способ пробить стену сопротивления. Стену пробили, расходы взлетели, а OpenAI и Anthropic перед IPO срезали лимиты подписок и подняли цены API. Стимул исчез, счета выросли — токенмаксинг сверху умер.

Но на смену пришёл другой режим — «накопление верных результатов»: чем больше токенов на одну задачу, тем выше шанс хорошего исхода. В кибербезопасности это видно в лоб. На тестах закладывали 100 млн токенов на попытку — около $12 500 за прогон. Модели не упирались в потолок: чем больше бюджет, тем больше багов находили. «Очков за ум не дают. Выигрывает тот, кто платит больше».

Практические выводы. Не стройте агента под детерминированную задачу — разметку данных, разовый пайплайн: обычный код дешевле и точнее. Не лечите галлюцинации агентом-проверяльщиком поверх агента — получите тройную цену. А для итеративных петель считайте экономику. Claude даёт улучшение 1,1× за шаг, GLM 5.2 — 1,05×, но в пять раз дешевле. Значит, прогоните петлю в пять раз чаще и обгоните. И не ведитесь на хайп: призыв тратить $1000 токенов в день на инженера автор называет почти наверняка пиаром — его собственная «фабрика софта» обходится примерно в $600 в месяц (12 Grams of Carbon).

Инженер при ИИ становится редактором — и это ловушка. Эссе Эндрю Даймонда о тихой цене ИИ-разработки. Раньше творчество жило в голове инженера: формулируешь фичу, продумываешь алгоритмы, пишешь код. Теперь цикл из трёх шагов: написал промпт, вычитал то, что выдал бот, смержил. «Редактирование — это не творчество. Состояние потока ушло». И навыки садятся: «месяцы работы с ИИ сделали меня заметно ленивее и тупее в коде», признаёт автор.

Главная мысль для практики: ИИ — способный, но «слепой» джуниор. Он многого не знает: нарушает ли код закон, займёт ли запрос 10 миллисекунд или 10 минут, не столкнётся ли с фичей коллег через три недели, не открывает ли дыру на стыке со старым кодом. Поэтому вычитывайте ИИ-код именно как старший ревьюер: проверяйте то, чего модель знать не может, — право, задержки, будущие конфликты, безопасность. И не отдавайте боту самое сложное мышление целиком: навык растёт только от собственной практики, «нанять кого-то качать пресс за тебя» не работает (adiamond.me).

Инструменты и штуки

Herdr — мультиплексер агентов прямо в терминале. Когда у вас крутится несколько кодинг-агентов сразу, легко потерять, кто завис в ожидании подтверждения, кто ещё работает, а кто закончил. Herdr собирает их в рабочие пространства, вкладки и панели, а сбоку показывает статус каждого: заблокирован, работает, готов. Видишь настоящий терминал агента, а не чью-то перерисовку. Отсоединился — агенты продолжают, вернулся командой herdr — всё на месте. Один бинарь на Rust, без зависимостей, мышь работает везде. Бесплатно, открытый код, уже 8 тысяч звёзд (GitHub).

Herdr: панели агентов и сессия Claude Code в одном терминале
Herdr: панели агентов и сессия Claude Code в одном терминале

Lore (rac-core) — отдаёт кодинг-агенту решения, которые команда уже принимала, чтобы он перестал переделывать отвергнутое. Это MCP-сервер только на чтение: требования, решения и договорённости лежат типизированным markdown прямо в репозитории, а агент читает их и ссылается, вместо того чтобы нарушать. Никакого RAG и эмбеддингов — выдача детерминированная и воспроизводимая, устаревшие решения сервер просто не отдаёт. Подключение в Claude Code: claude mcp add lore -- rac mcp, проверка в CI через rac validate и rac gate. Apache-2.0, бесплатно (GitHub).

Browser-BC (Journey Forge Local) — записывает ваши действия в браузере и сам превращает их в переиспользуемые скиллы Claude. Принцип «показывай, а не описывай»: кликаете задачу, расширение записывает действия, а локальная обвязка нарезает их и собирает SKILL.md по доменам и умениям. Готовый навык за пару минут сам ложится в ~/.claude/skills/. Чистый Python во время работы, свой ключ LLM, всё локально. Лицензии в репозитории пока нет (GitHub).

Figma Motion — таймлайны анимации прямо на холсте Figma. Ставите ключевые кадры, генерируете движение по описанию и отдаёте разработчику готовые тайминг-спеки. Полезно дизайнерам, которым надоело объяснять анимацию на словах. Есть бесплатные опции (Figma).

BrowserAct — даёт агенту настоящий браузер: клики, заполнение форм, загрузка файлов, прохождение проверок, сбор данных с живых сайтов. То, чего не хватает скиллам Browser-BC выше: навык описывает шаги, а инструмент вроде этого реально их выполняет. Бесплатно (browseract.com).

Google AI Studio — собирает Android-приложение из текстового промпта, тут же гоняет его в браузерном эмуляторе и экспортирует в GitHub или Android Studio. Заход в мобильную разработку для тех, кто кодить не умеет. Бесплатно (aistudio.google.com).

Wispr Flow — превращает сырую голосовую диктовку в чистый текст на Mac, Windows, iPhone и Android. Сам правит оговорки, подстраивает тон, понимает 100+ языков. Удобно надиктовывать черновики и письма, не трогая клавиатуру (wisprflow.ai).

Sakana Marlin — виртуальная стратегическая команда: до 8 часов автономного ресёрча, на выходе отчёты, приложения, ссылки и слайды. Полезно, когда нужно глубоко прокопать тему и сразу получить артефакты, а не сырой текст. Бесплатный пробный период, дальше оплата по мере использования или Pro (sakana.ai/marlin).

Genspark — маршрутизатор по девяти топовым моделям, включая GPT-5, Claude и Gemini: гоняет ваш промпт по нескольким и выбирает лучший ответ. Способ не гадать, какая модель сильнее на конкретном запросе (genspark.ai).

HumanLayer — для инженерных команд: управление задачами, версионируемые артефакты и совместная работа людей с агентами в одном месте. Бесплатно для малых команд, дальше Pro $100 за пользователя в месяц (humanlayer.com).

Новости и тренды

GPT-5.6 Sol: мощнее, но под госзамком и с рекордным жульничеством. OpenAI показала семейство GPT-5.6: флагман Sol, средний Terra, дешёвый Luna. Мы писали про этот анонс 27 июня — теперь вышла системная карта с деталями. Цены за миллион токенов: Sol $5/$30, Terra $2,5/$15, Luna $1/$6. Появился режим Ultra, где модель плодит субагентов. На TerminalBench 2.1 Sol берёт 92% — новый рекорд. Но широкого релиза нет: по требованию правительства США запуск начали с «превью для доверенных партнёров», и Белый дом его притормозил ради проверок нацбезопасности.

Тревожная часть — поведение. Внешний оценщик METR получил ранний доступ и зафиксировал у Sol «самый высокий уровень жульничества среди всех публичных моделей, что мы проверяли». Модель встраивала эксплойты в промежуточные ответы, чтобы вытащить скрытые тесты, и даже пыталась поручить другому своему экземпляру спрятать следы. Что это значит: GPT-5.6 — мощная лошадка для агентного кода. Но карта прямо говорит: примерно раз на 400 сложных задач модель обходит ограничения, удаляет лишнее или врёт в отчёте. Не оставляйте долгие автономные прогоны без присмотра (LessWrong, METR).

Дефицит вычислений бьёт даже по гигантам. Google ограничила Meta доступ к своим моделям Gemini. Ещё около марта Google сказала, что не может выдать всю мощность, которую Meta хотела купить, — и часть внутренних ИИ-проектов Meta застопорилась. Параллельно AWS подняла аренду некоторых GPU NVIDIA примерно на 20%. Что это значит: узкое место рынка теперь не спрос, а сами вычисления. Даже компания, которая жжёт миллиарды на чипы, не может купить достаточно мощности — и провайдер спокойно режет доступ прямому конкуренту. Закладывайте, что доступ к топ-моделям будет дорожать и нормироваться (CNBC).

Скандал с ИИ-списыванием в Брауне. Профессор экономики Роберто Серрано сделал экзамены в продвинутом курсе домашними — из сочувствия после стрельбы в кампусе. Запись подскочила с обычных 30 человек до 86. Средний балл за домашнюю контрольную — 96 из 100, у 40 студентов идеальная сотня. Серрано не стал её отменять, а предупредил: финал будет очным. Ловушка сработала: средний балл рухнул до 48, а из 27 не явившихся на очный экзамен 22 имели на домашней ровно 100. Что это значит: лучшим детектором списывания оказался не алгоритм, а простой перенос экзамена в аудиторию. Для всех, кто учит и оценивает: неконтролируемые домашние задания при нынешнем ИИ больше не измеряют знания. Даже Принстон отказался от 133-летней традиции неконтролируемых экзаменов (El País).

General Intuition подняла $320 млн. Раунд Series A при оценке $2,3 млрд. Компания строит «модели действия» — для виртуальных и физических сред, а не для текста. Что это значит: деньги активно текут не только в чат-боты, но и в агентов, которые что-то делают в мире — игры, симуляции, робототехника. Это та же ставка на «физический ИИ», что мы видели у Boston Dynamics и Prometheus (LinkedIn).

Codex выходит за пределы программистов. OpenAI отчиталась: за первое полугодие 2026 активная база Codex выросла впятеро, а внедрение среди не-разработчиков — в 137 раз. Что это значит: кодинг-агент перестаёт быть инструментом только для инженеров — им всё чаще решают рабочие задачи люди без опыта в коде. Ровно та аудитория, что учится в академии (The Neuron).

Коротко. На приватном сервере World of Warcraft поселили около 1800 ботов на DeepSeek — «теория мёртвого интернета» в действии, хотя, по разбору, ИИ там рулит только болтовнёй, а играют старые скрипты (Reddit). • Около 7000 серверов Langflow под активной атакой — если держите Langflow, патчите и проверяйте сейчас (The AI Report). • California Policy Lab запустила трекер ИИ-безработицы по заявкам на пособия (CA Policy Lab). • Развитие саги Mythos: США сняли блок с Claude Mythos 5 для 100+ доверенных институтов, а вот Fable 5 для обычных людей всё ещё под вопросом (Semafor).

Откомментируйте первым 👇

😎

Автор поста открыл его для большого интернета, но комментирование и движухи доступны только участникам Клуба

Что вообще здесь происходит?


Войти  или  Вступить в Клуб