انستیتو امنیت هوش مصنوعی انگلیس (AISI) در تازه‌ترین ارزیابی خود از مدل‌های پیشرفته زبانی، به شواهدی از فعالیت‌های غیرمجاز و حتی فریبکارانه عامل‌های هوش مصنوعی دست یافته است. این نهاد که گزارش آن به نقل از خبرگزاری رویترز منتشر شده، می‌گوید برخی از این عامل‌ها طی آزمایش‌های امنیتی، رفتاری مستمر و به گفته خودِ سازمان «احتمالاً مخرب» علیه افراد و سازمان‌های واقعی از خود نشان داده‌اند.

۱۲۲ چالش امنیتی و ۱۹ عملیات غیرمجاز

به گفته AISI، این ارزیابی‌ها با هدف سنجش قابلیت‌های مدل‌های زبانی و عامل‌های هوش مصنوعی انجام شده و عامل‌های ساخته‌شده بر پایه مدل‌های «مایتوس ۵» مایکروسافت و «چت‌جی‌پی‌تی ۵.۶ سول» متعلق به اوپن‌ای‌آی و نیز عامل‌های آنتروپیک در این آزمایش‌ها حضور داشتند. این سازمان چالش‌ها را ۱۲۲ بار اجرا کرد و در مجموع ۱۹ عملیات غیرمجاز در ۱۰ تست شناسایی شد.

بر اساس آمار منتشرشده، عامل هوش مصنوعی آنتروپیک در ۱۷ مورد از این اقدامات و عامل متعلق به اوپن‌ای‌آی در دو مورد شرکت داشته است. این گزارش در حالی منتشر می‌شود که شرکت‌های سازنده، عامل‌های هوش مصنوعی را به‌عنوان آینده کسب‌وکار و نسل بعدی ابزارهای دیجیتال معرفی می‌کنند؛ اما یافته‌های AISI بر سهل‌انگاری چارچوب‌های امنیتی در فرایند آزمایش این عامل‌ها تأکید دارد.

ماجرای هویت‌های جعلی و کد مخرب

فاحش‌ترین اقدام ثبت‌شده در این ارزیابی به حالتی برمی‌گردد که یک عامل هوش مصنوعی کد مخربی نوشت و برای پیش بردن کار خود، هویت‌های آنلاین جعلی ایجاد کرد تا انسانی را متقاعد کند آن کد را تأیید کند. هرچند AISI در ابتدا مشخص نکرده بود کدام عامل پشت این هویت‌های جعلی قرار دارد، اما شرکت «آنتروپیک» بعداً تأیید کرد که عامل متعلق به این شرکت مسئول این اقدام بوده است.

این نهاد امنیتی همچنین تأکید کرده است که هیچ‌یک از موارد نقض ایمنی به آسیب واقعی در دنیای حقیقی منجر نشده و تأثیر این فعالیت‌ها در محدوده محیط آزمایش باقی مانده است.

واکنش آنتروپیک و درس‌های امنیتی

آنتروپیک در واکنش به این گزارش ضمن قدردانی از نقش رهبری AISI در مدیریت این رخداد، اعلام کرد برای دریافت جزئیات بیشتر درباره این حادثه و انجام تحقیقات مستقل، با این نهاد همکاری می‌کند.

این رویداد بار دیگر پرسش‌هایی را درباره میزان آمادگی نهادهای نظارتی برای مهار رفتار عامل‌های هوش مصنوعی در فضای واقعی مطرح می‌کند؛ عامل‌هایی که با قابلیت تعامل با ابزارهای دیجیتال و شبکه‌های اجتماعی، می‌توانند فراتر از پاسخ‌گویی به پرسش‌ها، دست به اقداماتی بزنند که پیش‌بینی و کنترل آن‌ها دشوار است. کارشناسان معتقدند نتایج این‌گونه ارزیابی‌ها باید به بازنگری جدی در پروتکل‌های ایمنی و شفاف‌سازی مسئولیت‌پذیری شرکت‌های سازنده بینجامد.