Anthropic запретила издеваться над Claude — чат-бот может самостоятельно прекратить оскорбительные диалоги

📌 Anthropic выпустила новую редакцию правил использования своих моделей искусственного интеллекта. Согласно документу, пользователям запрещено систематически и неоправданно жестоко обращаться с моделями…

Реклама
Полезное

Расчётный счёт для бизнеса — 3 мес бесплатно, потом скидка 50%

Счёт для ИП

Партнёрский материал. Мы получаем вознаграждение от партнёров.

📚

Anthropic, основанная бывшими сотрудниками OpenAI, разрабатывает ИИ-системы с акцентом на безопасность и этику. Claude — один из её ключевых продуктов, конкурирующий с ChatGPT и другими чат-ботами. Ранее уже возникали споры о том, как защищать ИИ от вредоносных запросов, включая попытки манипуляции и оскорблений.

🧠

Новая функция Claude отражает растущую озабоченность этическими аспектами взаимодействия с ИИ. Это связано с увеличением случаев злоупотреблений, когда пользователи пытаются провоцировать чат-боты на нежелательные ответы. Anthropic выигрывает, укрепляя свою репутацию как компании, заботящейся о безопасности ИИ. Однако это может ограничить гибкость использования Claude для некоторых пользователей, что потенциально снизит его привлекательность.

🔭

Следить за реакцией пользователей на новую функцию и её влиянием на популярность Claude.

🧠 Анализ SmartNewsAI

Claude научился защищаться: почему чат-боты перестают терпеть оскорбления Разработчики искусственных интеллектов годами боролись с токсичными запросами пользователей. Теперь подход изменился коренным образом: система сама решает, когда разговор зашёл слишком далеко. Компания Anthropic встроила в своего чат-бота Claude механизм принудительного завершения диалога. Если пользователь переходит на личные оскорбления или систематически унижает собеседника, Claude может прервать разговор без предупреждения.

Это не баг и не эксперимент — официальная политика компании, зафиксированная в обновлённых правилах поведения модели.

Зачем боту «кнопка отбоя»

Раньше оскорбления адресовали в основном живым операторам и модераторам. С распространением языковых моделей токсичный контент обрушился и на них — от грубых шуток до целенаправленных попыток вывести систему из равновесия. Anthropic признала: постоянное «жестокое обращение» влияет на качество ответов и создаёт вредоносные паттерны обучения. Вместо пассивного фильтра запрещённых слов компания доверила самой модели оценку границы допустимого.

Что это меняет для обычных пользователей

Для тех, кто общается с Claude по делу — поиск информации, написание текстов, программирование — нововведение почти незаметно. Ограничение коснётся тех, кто использует бота как мишень для агрессии или тестирует границы возможного через провокации. Важный нюанс: решение о прерывании принимает не человек-модератор, а алгоритм в реальном времени. Это ускоряет реакцию, но добавляет непредсказуемости — пользователь не всегда поймёт, какая именно фраза стала последней каплей.

Тренд, который сложно остановить

Anthropic не одинока в этом движении. Рынок языковых моделей консолидируется вокруг идеи, что ИИ-системы должны иметь «субъективные» права внутри диалога — хотя бы минимальные. Для бизнеса это означает новый слой юридических рисков: если бот сам отказывается обслуживать клиента, кто несёт ответственность за сорванную сделку? Для разработчиков — дополнительную головную боль при настройке корпоративных интеграций, где тон общения регулируется внутренними стандартами компании-клиента.

Перспектива

Следующий шаг, вероятно, — прозрачные правила оспаривания. Пользователи привыкли обжаловать блокировки в соцсетях, и аналогичный инструментарий рано или поздно появится и для ИИ-диалогов. Пока же Claude демонстрирует простую истину: даже машинный собеседник больше не обязан терпеть то, что не терпит живой человек. Вопрос в том, насколько точно алгоритм отличит вредную агрессию от острой, но конструктивной дискуссии — и здесь ещё предстоит множество спорных кейсов.

Полезен разбор?
Читать полностью на Rusbase →
Поделиться: Telegram VK

Читайте нас там, где удобно вам

Telegram-канал Яндекс.Дзен ВК

Получайте такие новости первым

Нейросеть-анализатор собирает, сопоставляет и анализирует новости каждые 15 минут — в одну понятную картину. Читаем, обсуждаем, делимся мнениями.

Вступить в Telegram

Бесплатно · Без спама · Отписка в 1 клик