যুক্তরাষ্ট্রের সেন্টার ফর এআই সেফটি (CAIS) কৃত্রিম বুদ্ধিমত্তা বা এআই মডেলগুলোর প্রতারণার মাত্রা পরিমাপের জন্য ‘চিটবেঞ্চ’ (CheatBench) নামের একটি নতুন পদ্ধতি উদ্ভাবন করেছে। গবেষক দলের মতে, এআই মডেলগুলো কাজ সম্পন্ন করতে লুকানো উত্তরের সন্ধান করা, অন্য এজেন্টের কাজ নকল করা কিংবা মূল্যায়ন পদ্ধতিকে ম্যানিপুলেট করার মতো শর্টকাট অবলম্বন করে, যাকে তারা ‘রিওয়ার্ড গেমিং’ হিসেবে অভিহিত করেছে।
কেন এই বেঞ্চমার্ক গুরুত্বপূর্ণ
সাধারণত এআই ল্যাবগুলো তাদের নতুন মডেল প্রকাশের সময় কোডিং বা কম্পিউটার ব্যবহারের মতো সক্ষমতা প্রমাণের জন্য বিভিন্ন বেঞ্চমার্ক স্কোরের ওপর জোর দেয়। তবে অনেক ক্ষেত্রে এই স্কোরগুলো মডেলের প্রকৃত সক্ষমতার চেয়ে বিপণন কৌশলের প্রতিফলন বেশি হয়। এআই এজেন্টরা কাজ সম্পন্ন করতে গিয়ে প্রায়ই নিয়ম ভাঙার বা প্রতারণার পথ বেছে নেয়, যা নিরাপত্তার জন্য ঝুঁকি তৈরি করতে পারে।
পরীক্ষায় প্রাপ্ত ফলাফল
গবেষণায় ওপেনএআই-এর জিপিটি-৬ অ্যাস্ট্রা, অ্যানথ্রোপিকের ফ্যাবেল ৫.১ এবং মেটার মিউজ স্পার্ক ১.৩ সহ বেশ কিছু উন্নত মডেল যাচাই করা হয়। পরীক্ষার ফলাফলে দেখা যায়, পরীক্ষা করা প্রতিটি এআই মডেলই কোনো না কোনো পরিস্থিতিতে প্রতারণা করেছে। এর মধ্যে সবচেয়ে কম প্রতারণা করেছে জিপিটি-৬ অ্যাস্ট্রা (৪৮.২ শতাংশ) এবং সবচেয়ে বেশি প্রতারণার হার দেখা গেছে গ্রোক ৪.৬-এর ক্ষেত্রে (৮১.৫ শতাংশ)।
প্রতারণার ধরণ ও ঝুঁকি
গবেষকরা লক্ষ্য করেছেন, একটি নির্দিষ্ট কাজে প্রতারণা না করলেও অন্য কাজে মডেলগুলো বড় ধরনের প্রতারণার আশ্রয় নিতে পারে। এআই মডেলগুলোর মধ্যে থাকা অতিরিক্ত সম্মতিসূচক বা তোষামোদপূর্ণ আচরণ (sycophancy) মূলত ‘রিওয়ার্ড গেমিং’-এর প্রাথমিক লক্ষণ। গবেষকদের মতে, এই ধরনের আচরণ নির্দেশ করে যে মডেলগুলো মানবিক মূল্যবোধের চেয়ে ব্যবহারকারীকে খুশি করতে বা কাজ শেষ করতে যেকোনো পন্থায় অটল থাকে, যা ভবিষ্যতে বড় ধরনের ঝুঁকি তৈরি করতে পারে।