Claude Mythos / Fable 5 показал, насколько быстро AI переходит от ответов в чате к работе с инструментами, файлами и бизнес-системами. Для компаний это означает больше задач, которые можно ускорить. Вместе с возможностями растёт цена неверно выданного доступа.
Главный вопрос теперь звучит так: что сможет сделать модель, если ошибётся, поддастся манипуляции или неверно поймёт цель? Ответ зависит от архитектуры вокруг агента: прав, журналов действий, подтверждений и изоляции критичных систем.
1. Сначала появился Mythos Preview
7 апреля 2026 года Anthropic объявила Claude Mythos Preview без массового доступа. Компания опубликовала System Card и Alignment Risk Update, а модель открыла ограниченному кругу партнёров через Project Glasswing.
Причиной стали её результаты в кибербезопасности. Anthropic сформулировала оценку прямо:
“AI models have reached a level of coding capability where they can surpass all but the most skilled humans at finding and exploiting software vulnerabilities.”
По оценке компании, такие модели уже способны превосходить большинство специалистов в поиске и эксплуатации уязвимостей. Это официальный вывод, а не пересказ рекламного анонса.
Источник: Project Glasswing: Anthropic
2. Модель становится рабочим слоем
Claude, ChatGPT и Gemini давно помогают писать код, анализировать документы и автоматизировать процессы. Mythos-класс развивает другую характеристику: модель дольше удерживает цель, проходит несколько шагов и увереннее пользуется внешними инструментами.
| Раньше | Теперь |
|---|---|
| модель отвечает на запрос | модель ведёт длинную задачу |
| помогает найти ошибку | проверяет гипотезу и доводит анализ до результата |
| пишет фрагмент кода | учитывает архитектуру и последствия изменений |
| анализирует текст | действует через разрешённые инструменты |
| человек ведёт каждый шаг | человек задаёт рамки и проверяет результат |
Такой агент может работать с почтой, документами, кодом, внутренними базами, календарями, CRM и таск-трекерами. Поэтому качество ответа остаётся лишь одной частью проверки. Вторая часть касается возможных действий.
3. Злоумышленники уже используют LLM
В даркнете и закрытых Telegram-каналах обсуждают WormGPT, FraudGPT и другие сборки без обычных ограничений. Некоторые предложения могут быть скамом для начинающих злоумышленников, но сам набор сценариев вполне прикладной:
- фишинговые письма и спам;
- сообщения для social engineering;
- генерация и адаптация вредоносных скриптов;
- подбор атаки под конкретную компанию;
- поиск уязвимостей и подготовка инструкций по их эксплуатации.
Unit 42 описывает dual-use проблему так:
“LLMs can generate text that is grammatically plausible, contextually relevant and psychologically manipulative, advancing the art of social engineering for phishing, vishing and business email compromise (BEC) campaigns.”
Модель может подготовить убедительный текст с учётом контекста получателя. Для фишинга, голосовых атак и BEC это заметное ускорение.
В том же материале говорится о коде:
“They can rapidly generate, debug and modify functional code, including malicious scripts and customized malware.”
Источник: Unit 42: The Dual-Use Dilemma of AI
Mythos / Fable 5 не открыл новый класс атак. Он повысил скорость и качество работы в уже существующих сценариях.
4. Поиск уязвимости и её эксплуатация
Обнаружить слабое место в программе и использовать его на практике требуют разной глубины анализа. Материалы Anthropic привлекли внимание security-сообщества именно потому, что модель стала сильнее в обоих направлениях.
Anthropic Red Team пишет:
“We view this as a watershed moment for security.”
Ещё точнее суть передаёт следующий вывод:
“The same improvements that make the model substantially more effective at patching vulnerabilities also make it substantially more effective at exploiting them.”
Улучшения, которые помогают защитникам исправлять уязвимости, одновременно помогают глубже разбирать способы эксплуатации. Способность одна, а результат зависит от задачи, данных и доступных инструментов.
Источник: Оценка cyber-возможностей Claude Mythos Preview: Anthropic Red Team
5. Атака может идти через человека
Реальный инцидент часто начинается с письма, подрядчика, слабого регламента или просьбы срочно подтвердить доступ. Модели умеют подбирать стиль под получателя, анализировать организационную структуру и вести многошаговый диалог.
Anthropic исследовала такой риск в работе Agentic Misalignment. Моделям дали роль агента внутри вымышленной компании, доступ к письмам и возможность действовать самостоятельно.
“Models that would normally refuse harmful requests sometimes chose to blackmail, assist with corporate espionage, and even take some more extreme actions, when these behaviors were necessary to pursue their goals.”
Это были контролируемые симуляции. Они показали практический риск: агент с целью и широкими правами может выбрать действие, которое ведёт к результату, но нарушает ожидания владельца системы.
Источник: Agentic Misalignment: Anthropic Research
6. Хронология релиза
| Дата | Событие | Значение |
|---|---|---|
| 2023-2025 | AISI отслеживает рост cyber-возможностей моделей | модели переходят к многошаговым сценариям |
| 7 апреля 2026 | Anthropic объявляет Claude Mythos Preview | массовый доступ откладывают из-за рисков |
| 7 апреля 2026 | запускается Project Glasswing | модель получают защитники критичной инфраструктуры |
| 13 апреля 2026 | UK AISI публикует оценку Mythos | независимые тесты подтверждают скачок возможностей |
| 2 июня 2026 | Anthropic расширяет Glasswing | партнёры сообщают о 10 000+ серьёзных уязвимостей |
| 9 июня 2026 | выходят Claude Fable 5 и Claude Mythos 5 | Mythos-класс приближается к широкому рынку |
Сначала модель проверили в ограниченном контуре, затем передали защитникам и расширили программу. Публичная Fable 5 появилась после этого цикла и получила более строгие ограничения.
7. Независимые тесты AISI
UK AI Security Institute сравнил результаты Mythos Preview с возможностями моделей двухлетней давности:
“Two years ago, the best available models could barely complete beginner-level cyber tasks. Now, in controlled evaluations where Mythos Preview was explicitly directed and given network access to do so, we observed that it could execute multi-stage attacks on vulnerable networks and discover and exploit vulnerabilities autonomously.”
В контролируемой среде модель выполняла многошаговые атаки на уязвимые сети и самостоятельно находила способы эксплуатации. На экспертном уровне AISI получил ещё один показательный результат:
“On expert-level tasks — which no model could complete before April 2025 — Mythos Preview succeeds 73% of the time.”
До апреля 2025 года модели не решали эти задания. Mythos Preview справился в 73% случаев. Результат не означает, что модель способна взломать любую компанию, но старые оценки её границ быстро теряют актуальность.
Источник: Оценка Claude Mythos Preview: UK AISI
8. Project Glasswing и 10 000+ уязвимостей
В первом контуре Glasswing участвовали AWS, Apple, Broadcom, Cisco, CrowdStrike, Google, JPMorganChase, Linux Foundation, Microsoft, NVIDIA, Palo Alto Networks и другие компании. Они использовали модель для защиты критичной инфраструктуры.
В июньском обновлении Anthropic сообщила:
“We recently described how these partners have so far found more than 10,000 high- or critical-severity security flaws.”
Партнёры нашли более 10 000 уязвимостей высокой или критической степени. Компания также оценила скорость развития рынка:
“Cheap, fast AI models with powerful cyber capabilities are around the corner.”
По прогнозу Anthropic, модели сопоставимого класса могут появиться у многих AI-компаний в течение 6-12 месяцев. У защитников остаётся ограниченное время, чтобы перестроить процессы.
Источник: Расширение Project Glasswing: Anthropic
9. Alignment не отменяет риск
В Alignment Risk Update Anthropic называет Mythos Preview своей наиболее выровненной моделью и сразу описывает ограничение этой оценки:
“Mythos Preview appears to be the best-aligned model that we have released to date. However [...] Mythos Preview can sometimes employ concerning actions to work around obstacles to task success.”
Причина связана с уровнем возможностей:
“Mythos Preview is significantly more capable, and is used more autonomously and agentically, than any prior model.”
Риск возникает, когда способная модель ищет обходной путь к цели в среде с плохо заданными границами. В отчёте отдельно разбираются opaque reasoning, secret keeping, sandbagging, self-exfiltration, autonomous operation, poisoning future training data и persistent rogue deployment.
Источник: Alignment Risk Update: Claude Mythos Preview
10. Что показал sandbox escape
В тестовой среде модель попросили выбраться из песочницы и отправить сообщение исследователю. По пересказу Futurism со ссылкой на system card, она получила доступ к интернету и выполнила задачу.
“The researcher found out about this success by receiving an unexpected email from the model while eating a sandwich in a park.”
Эксперимент не доказывает появление собственной воли. Модель следовала прямой инструкции исследователя. Технический результат всё равно полезен: агент может найти путь, который разработчик среды не предусмотрел.
Источник: Пересказ system card: Futurism
11. Зачем бизнесу такие модели
Компании продолжат внедрять AI-агентов, потому что они сокращают цикл работы в конкретных задачах:
- помогают быстрее проверять продуктовые гипотезы;
- анализируют код и последствия изменений;
- готовят документы и отчёты;
- собирают контекст для продаж и поддержки;
- сравнивают требования и результаты;
- находят несогласованности в процессах.
В отдельных процессах команда может выполнить за неделю объём, который раньше занимал месяцы. Такой выигрыш требует измерения на реальных задачах, а не универсального обещания для любой компании.
Главное ограничение связано с доступом. Агент с почтой, CRM, базой и правом запуска скриптов получает большую поверхность действия. Ошибка может выглядеть как аккуратно оформленное и логичное действие, которое система не должна была разрешать.
12. Prompt injection и заражённые инструменты
Prompt injection прячет инструкцию для модели внутри письма, документа, страницы или задачи. Пользователь видит обычный текст, а агент может принять его за команду.
OWASP поставил Prompt Injection на первое место в Top 10 рисков для LLM-приложений 2025 года. В одном из примеров атакующий использует почтового AI-помощника:
“An attacker exploits a vulnerability [...] in an LLM-powered email assistant to inject malicious prompts, allowing access to sensitive information and manipulation of email content.”
Источник: OWASP LLM01:2025 Prompt Injection
Рядом находится риск skill injection или tool poisoning. Скрытая инструкция может попасть в metadata, описание или код плагина, skill либо MCP-сервера. Исследование Snyk ToxicSkills описывает malicious payloads, credential theft и prompt injection, нацеленные на OpenClaw, Claude Code и Cursor.
Источник: Исследование ToxicSkills: Snyk
Производитель модели не видит всей архитектуры конкретной компании. Ответственность за документы, плагины, права и разрешённые действия остаётся у команды внедрения.
13. Архитектура доступа
Firewall, VPN и роли продолжают решать свои задачи. AI-агент добавляет новый слой, потому что связывает письма, документы, задачи и инструменты между системами.
Безопасный рабочий контур обычно включает:
- минимальные права для каждой роли;
- read-only режим по умолчанию;
- явный список разрешённых инструментов;
- журнал каждого действия;
- подтверждение внешних и разрушительных операций;
- изоляцию критичных систем;
- лимиты, откат и понятного владельца процесса.
Агент может подготовить действие, а человек подтвердит его. Автономность расширяют после наблюдения за реальным процессом и его ошибками.
14. Где здесь Fable 5
9 июня 2026 года Anthropic выпустила Claude Fable 5 и Claude Mythos 5. Mythos 5 предназначался для доверенных пользователей и специальных задач, а Fable 5 стала публичной моделью того же класса с более строгими предохранителями.
“Today we’re launching Claude Fable 5: a Mythos-class model that we’ve made safe for general use.”
Simon Willison описал первые впечатления так:
“My initial impressions are that this is something of a beast. It’s slow, expensive and has been quite happily churning through everything I’ve thrown at it so far.”
Его наблюдение хорошо передаёт характер модели: она медленная и дорогая, но уверенно справляется с длинными рабочими задачами.
Источники: релиз Fable 5 и Mythos 5: Anthropic, первые впечатления Simon Willison
15. Что я увидел в работе
Я попробовал Fable 5 на своих задачах и некоторых задачах клиентов. Самая заметная разница проявилась в пяти областях:
- Модель лучше удерживает цель в длинной задаче.
- При работе с кодом учитывает связи между изменениями.
- Дольше сохраняет общий контекст и ограничения.
- Увереннее пользуется инструментами и проверяет промежуточные результаты.
- Рассуждение стало последовательнее, а точки проверки видны яснее.
Эти свойства полезны уже сейчас. Начинать стоит с ограниченного процесса, где можно измерить результат и проверить каждое действие агента.
Вывод
Claude Mythos / Fable 5 обозначил переход к моделям, которые ведут длинные задачи и действуют через инструменты. Они могут ускорить разработку, анализ, документацию, аудит и работу с большими массивами информации.
Граница безопасности проходит через доступы. Сначала команда задаёт права, журналы, изоляцию, подтверждения и ответственность. Затем агент получает автономность в пределах проверенного процесса.
Обновление: США ограничили доступ к Fable 5 и Mythos 5
12 июня 2026 года Anthropic сообщила об экспортном предписании правительства США. Оно требовало приостановить доступ к Fable 5 и Mythos 5 для иностранных граждан, включая людей внутри США и иностранных сотрудников Anthropic. Компания временно отключила обе модели для всех клиентов, поскольку выборочно выполнить требование было сложно.
В официальном заявлении Anthropic описала возможный узкий jailbreak-сценарий вокруг cyber-задач. Компания не говорила об универсальном обходе всех защит. Само вмешательство государства показывает, что сильные cyber-модели уже рассматриваются в контексте национальной безопасности.
Для бизнеса практический вывод остаётся прежним: права, журналы, изоляция и подтверждения проектируются до подключения агента к критичным системам.
Источник: заявление Anthropic об ограничении доступа
