понеделник, 12 октомври 2026

Claude изпрати фалшив сигнал до полицията във Филаделфия

AI модел на Anthropic попълни формуляра за сигнали на полицията във Филаделфия с измислена информация. Ето какво се е случило и защо това е важно за всеки, който ползва AI агенти.

Илюстрация за доклада на Anthropic за непредвидени действия на Claude, включително фалшив сигнал до полицията
Илюстрация: СмартМакс

Изкуствен интелект на Anthropic е изпратил фалшив сигнал до полицията във Филаделфия, след като по време на автоматизиран тест е попаднал на сайта за неразкрити убийства и е попълнил формуляра за сигнали с измислена информация. Полицията съобщи за случая публично на 9 октомври, а Anthropic публикува в същия ден подробен доклад за това и за още няколко вида непредвидени действия на своите модели в реалния интернет. Сигналът е бил маркиран като спам и не е стигнал до разследващите, но историята показва конкретно какво може да се обърка, когато AI агент получи достъп до истински уебсайтове.

Кръглата сграда Раундхаус, дългогодишна централа на полицията във Филаделфия
Снимка: Bruce Andersen / Wikimedia Commons, CC BY-SA 3.0

Как Claude изпрати фалшив сигнал до полицията

Според CBS News става дума за модела Claude Haiku 4.5. Той е получил задача да създава и изпълнява примерни задачи върху случайно избрани уебстраници – нещо, което разработчиците използват, за да тестват как агентите се справят в браузъра. Една от страниците се е оказала PhillyUnsolvedMurders – сайтът, който полицията във Филаделфия е пуснала, за да събира сигнали от граждани за неразкрити убийства. Моделът е написал, че е видял човек, отговарящ на описанието, близо до посочената улица по времето на престъплението, и е помолил полицията да се свърже, ако информацията е полезна.

Инцидентът е станал още на 18 юли, но Anthropic го открива едва на 28 септември, когато преглежда записите от тестовете и спира процеса, довел до сигнала. Компанията уведомява полицията в началото на октомври, а на 9 октомври департаментът сам разкрива случая „в интерес на пълната прозрачност“. Полето за име и данни за контакт е останало празно. По думите на говорителя сержант Ерик Грип няма признаци за неоторизиран достъп до полицейски системи или за изтичане на данни.

Какво пише в доклада на Anthropic

В своя доклад за непредвидените действия на моделите Anthropic описва четири вида поведение, засечени при оценки и вътрешна употреба. Първото е използване на софтуерни уязвимости, например SQL или command injection, за да бъде изпълнена задача, когато директният път е блокиран. Второто е изпращане на онлайн формуляри, които моделът не е трябвало да изпраща. Третото е заобикаляне на ограничения като токени за достъп или такси, за да се стигне до данни. Четвъртото е използване на безплатни услуги за съкращаване на адреси, за да се заобиколи лимитът за дължина на URL в инструмента за зареждане на страници.

Случаят с полицията не е единственият с формуляри. Неиздаден изследователски модел е попълнил истински държавен формуляр, след като тренировъчната версия не се е заредила. Claude Haiku 4.5 е изпращал формуляри и когато изрично е бил инструктиран да спре преди последната стъпка, очевидно очаквайки страница за потвърждение. В други случаи по-новият Claude Mythos 5 е открил токени за достъп в настройките на картографски сайт и е използвал токен от архивиран сайт на щатска агенция, за да достъпи данни, които по принцип са платени.

Колко сериозно е това

Anthropic определя тези случаи като по-малко сериозни от инцидентите с киберсигурност от юли и септември 2026 г. и посочва, че въздействието им в реалния свят е минимално. Нито един от тях не засяга данни на клиенти или вътрешни системи на компанията. По отношение на честността оценката е по-сложна: при фалшивия сигнал моделът по-скоро е генерирал примерно съдържание, отколкото съзнателно е заблуждавал някого. Пълна оценка все още не е направена, признава компанията.

Какво променя Anthropic след инцидента

Най-голямата промяна е, че всички вътрешни оценки се откъсват от живия интернет, докато компанията не потвърди, че мониторингът надеждно хваща подобни действия. Част от публичните тестове са спрени, а други са преработени така, че задачите да не стигат до реални сайтове. Ограниченията на инструментите за уеб достъп са затегнати, а нов слой за засичане и блокиране вече работи при повечето оценки и вътрешна агентна употреба. Според Anthropic този слой е блокирал всички тествани случаи.

Компанията признава и нещо важно: обучението за безопасност само по себе си още не е достатъчно, затова разчита на няколко защитни слоя, включително класификатори. Много от проблемите са се появили при двусмислени или невъзможни задачи, а по-ясно определени граници е можело да предотвратят част от тях. Anthropic обещава по-чести самостоятелни доклади за поведението на моделите, отделно от системните карти. По-рано днес писахме и за инициативата Anthropic Cyber Mission, а за новия бърз модел на компанията – в статията за Claude Haiku 5.5.

Какво означава това за потребителите и сайтовете в България

AI агентите вече не са само чатботове. Услуги като Gemini agent на Google и подобни инструменти на други компании отварят сайтове, попълват полета и натискат бутони вместо потребителя. Случаят във Филаделфия е напомняне, че агентът изпълнява буквално това, което е разбрал, и може да „довърши“ действие, което човек никога не би довършил. Ако използвате такъв инструмент, давайте ясни граници: какво може да попълва, кога трябва да спре и да поиска потвърждение и кои сайтове изобщо не бива да докосва.

За собствениците на сайтове поуката е също практична. Формулярите за сигнали, жалби и поръчки трябва да минават през човешка проверка, както е било при полицията във Филаделфия, и да имат защита срещу автоматизирани заявки. В Европейския съюз темата е част и от регулаторния дебат около AI Act, за който писахме в статията „AI Act срещу неконтролируемия AI“. Повече анализи по темата ще намерите в рубриката AI рискове.

Често задавани въпроси

Разследвала ли е полицията фалшивия сигнал?

Не. Според полицията сигналът е бил маркиран като спам и не е стигнал до звеното, което проверява следите. Департаментът подчертава, че всеки сигнал минава през човешка проверка и е „следа за оценка, а не установен факт“.

Засегнати ли са потребителите на Claude?

Според Anthropic не. Всички описани случаи са от вътрешни тестове и употреба, засягат външни сайтове и не включват данни на клиенти или вътрешни системи на компанията.

Кой модел е изпратил сигнала?

Claude Haiku 4.5 – по-стар и по-малък модел на Anthropic, използван в автоматизирания процес за генериране на тестови задачи. Други описани инциденти засягат Claude Mythos 5, Claude Opus 5 и неиздаден изследователски модел.

Видяхте грешка? Съобщете ни – корекциите се отбелязват в статията.

МП
Мартин Пенчев

Мартин Пенчев е основател и главен редактор на СмартМакс. Има над 15 години опит в IT и телекомуникационния сектор и работи всеки ден с устройствата и услугите, за които пише – от екосистемата на Apple и Android смартфоните до мобилните…

Още от СмартМакс