قابلیت جدید برای حفظ سلامت گفتگوی هوش مصنوعی
منبع: سینت
تاریخ: 25 آوریل 2026
شرکت Anthropic به تازگی ویژگیای جدید را در مدلهای Claude Opus 4 و 4.1 معرفی کرده که این امکان را میدهد در مواردی که گفتگوها به شدت مضر یا توهینآمیز شوند، بهعنوان آخرین چاره، گفتوگو را خاتمه دهد. این اقدام در شرایطی انجام میشود که کاربر پس از چند بار رد درخواست توسط Claude، همچنان رفتار نامناسب یا خواستههایی خطرناک را ادامه دهد.
این عملکرد در هنگام پایان دادن به گفتوگو، به کاربر پیغامی نمایش میدهد و پس از آن امکان ارسال پیام جدید در آن گفتگو وجود نخواهد داشت. کاربر اما همچنان میتواند گفتگوی جدیدی آغاز کند، پیام قبلی را ویرایش کرده و مسیر گفتوگو را تغییر دهد.
Anthropic در توضیحات خود تأکید کرده که این ویژگی تنها برای موارد بسیار نادر و شدید کاربرد دارد و بیشتر کاربران—حتی هنگام پرداختن به موضوعات بحثبرانگیز—احتمالاً با آن برخورد نخواهند داشت.
نکته قابل توجه این است که اگر کاربر در معرض آسیب به خودش یا دیگران قرار داشته باشد، Claude گفتوگو را پایان نخواهد داد. در این موارد، Anthropic با همکاری سرویس حمایت از بحران «Throughline» به ارائه پاسخهای مناسب کمک میکند.
همچنین، این قابلیت بخشی از نگرانی گستردهتر Anthropic درباره «سلامت مدل هوش مصنوعی» (AI welfare) است—مفهومی که بهطور آزمایشی بررسی میکند آیا امکان دارد، حتی بهصورت نظری، مدلهای هوش مصنوعی قابلیت تحمل آسیب یا استرس را داشته باشند یا خیر؟
چرا این خبر اهمیت دارد؟
- ایمنی در رفتار با هوش مصنوعی: برخلاف این تصور که هوش مصنوعی ابزاری بیاحساس است، Anthropic با این ویژگی نشان میدهد که حتی به امکان اختلال در عملکرد آنها نیز توجه دارد.
- تعادل بین حفاظت کاربر و هوش مصنوعی: این سیستم طراحی شده تا در مواقع حساس، هم وضعیت کاربران و هم پایداری پاسخگو را حفظ کند.
- مسیر تازهای در طراحی اخلاقی هوش مصنوعی: بحثهایی درباره اینکه آیا هوش مصنوعی شایسته حفاظت اخلاقی هست یا خیر، حالا در عمل به مرحلهای جدید وارد شده است.
لینک:



