اشتراک
تصویرسازی توسط کارول باناخ
تصویرسازی توسط کارول باناخ
علم فناوری آموزش

ابزارهای تشخیص هوش مصنوعی پیشرفت‌های بزرگی داشته‌اند — چقدر خوب هستند؟

در یک نگاه چکیدهٔ خودکار موتور هوش مصنوعی افق آبی

ابزارهای تشخیص هوش مصنوعی، مانند «پانگرام» (Pangram) و «جی‌پی‌تی‌زیرو» (GPTZero)، با بهره‌گیری از مدل‌های پیشرفته یادگیری ماشین و آموزش بر اساس میلیون‌ها متن انسانی، گام بلندی در شناسایی محتوای تولید شده توسط مدل‌های زبانی بزرگ برداشته‌اند. برخلاف نرم‌افزارهای قدیمی که تنها ویژگی‌های آماری متن را بررسی می‌کردند و نرخ خطای بالایی داشتند، این ابزارهای جدید با دقت بسیار بالایی محتوای کاملاً انسانی را از متون هوش مصنوعی متمایز می‌کنند. با این حال، این فناوری با چالش‌های مهمی روبروست؛ از جمله دشواری در تشخیص متون «ترکیبی» (که هم توسط انسان نوشته شده و هم با هوش مصنوعی ویرایش شده است) و احتمال بروز خطای مثبت کاذب در برخی شرایط خاص. استفاده از این ابزارها در محیط‌های آکادمیک و علمی برای بررسی مقالات و تکالیف دانشجویی افزایش یافته است، اما کارشناسان هشدار می‌دهند که امتیازات این نرم‌افزارها نباید به‌تنهایی ملاک قضاوت نهایی قرار گیرند. بزرگترین چالش، تشخیص «میزان» و «نوع» دخالت هوش مصنوعی است؛ چرا که ابزارها نمی‌توانند نیت نویسنده یا ماهیت اخلاقی استفاده از این فناوری را تعیین کنند. در نهایت، با وجود بهبود مستمر این نرم‌افزارها و ظهور رقابتی که منجر به ارتقای دقت آن‌ها شده، تقابل میان ابزارهای تشخیص و ابزارهای «انسانی‌ساز» به یک بازی موش و گربه بی‌پایان تبدیل شده است. بسیاری از محققان معتقدند به جای تکیه صرف بر این نرم‌افزارها، باید به سمت شفافیت بیشتر در نحوه استفاده از هوش مصنوعی و تعیین استانداردهای اخلاقی مشخص برای نگارش علمی و حرفه‌ای حرکت کرد.

هنگامی که دانیل ایوانکو از یک دانشمند پرسید که آیا برای نوشتن گزارش بازبینی همتای خود از هوش مصنوعی استفاده کرده است یا خیر، انتظار اعتراف نداشت. ایوانکو، مدیر عملیات مجله در انجمن آمریکایی تحقیقات سرطان (AACR)، می‌گوید که بیشتر محققان کمک هوش مصنوعی را فاش نمی‌کنند.

اما این بار فرق داشت. بازبین در پاسخ نوشت: «وای، شماها عالی هستید!» و اعتراف کرد که پس از اتمام زمان، از یک مدل زبان بزرگ (LLM) استفاده کرده است.

ایوانکو یک سلاح مخفی داشت. او و AACR از یک ابزار تجاری تشخیص هوش مصنوعی به نام پانگرام استفاده می‌کنند، زیرا نگرانی‌هایی در مورد تعداد گزارش‌های بازبینی همتا که به مجلات آن‌ها ارسال می‌شود و به نظر می‌رسد بدون افشای آن از هوش مصنوعی استفاده می‌کنند، برخلاف سیاست ناشر، وجود دارد.

پس از سال‌ها نتایج ناامیدکننده، اکنون چندین شرکت ادعا می‌کنند که نرم‌افزار می‌تواند به طور قابل اعتمادی بین متن نوشته شده توسط هوش مصنوعی و متن نوشته شده توسط انسان تمایز قائل شود. یکی از آن‌ها پانگرام لبز، استارتاپ مستقر در شهر نیویورک است که پانگرام را تولید می‌کند. این شرکت در وب‌سایت خود می‌گوید: «محتوای تولید شده توسط هوش مصنوعی را با دقت ۹۹.۹۸٪ تشخیص دهید.»

دانشمندان و سازمان‌های تحقیقاتی از جمله کسانی هستند که از این ابزار برای شناسایی ردپای هوش مصنوعی استفاده می‌کنند. بر اساس مطالعه‌ای که در ژانویه منتشر شد، یک مقاله از هر هشت مقاله زیست‌پزشکی در سال گذشته حاوی متنی تولید شده با هوش مصنوعی بود1. در ماه ژوئن، کنفرانس برجسته علوم کامپیوتر NeurIPS اعلام کرد که ۱۸٪ از مقالات ارسالی را پس از غربالگری با پانگرام رد کرده است. کاربران سرور پیش‌چاپ arXiv اکنون می‌توانند با مراجعه به وب‌سایت آلفاایکس‌آی‌وی (alphaXiv) که این ابزار را نصب کرده است، نظر پانگرام را در مورد هر مقاله بررسی کنند. و دانشگاه شیکاگو در ایلینوی می‌گوید که استفاده از آن را برای بررسی تکالیف دانشجویان آغاز کرده است.

مکس اسپرو، یکی از بنیانگذاران پانگرام، می‌گوید که می‌خواهد به همه کمک کند تا تشخیص دهند چه زمانی متن توسط هوش مصنوعی نوشته شده است. او می‌گوید: «اگر افشای استفاده از هوش مصنوعی برای نوشتن تابو باشد، فکر می‌کنم افراد بیشتری را خواهیم دید که از وظایف خود شانه خالی می‌کنند و اجازه می‌دهند هوش مصنوعی جایگزین آن‌ها شود. ما در زمان بسیار حساسی برای تعیین هنجارها هستیم.» اسپرو شخصاً روزنامه‌نگارانی را که پانگرام نشان می‌دهد از هوش مصنوعی استفاده می‌کنند، افشا کرده است و در یک مورد، حتی پست‌های رسانه‌های اجتماعی پاپ را به عنوان نوشته شده با هوش مصنوعی علامت‌گذاری کرده است. در ماه ژوئیه، پانگرام در سراسر پلتفرم محبوب وبلاگ‌نویسی ساب‌استک (Substack) ادغام شد و به خوانندگان اجازه می‌دهد تا ببینند آیا این پلتفرم پست‌ها را نوشته شده با هوش مصنوعی می‌داند یا خیر.

پانگرام تنها شرکتی نیست که نتایج قابل توجهی گزارش می‌دهد. جی‌پی‌تی‌زیرو (GPTZero)، رقیبی دیگر در شهر نیویورک، می‌گوید که ۹۹٪ دقت دارد و «دقیق‌ترین و قابل اعتمادترین نتایج تشخیص هوش مصنوعی را در بازار» ارائه می‌دهد. الکس کوی، مدیر ارشد فنی این شرکت، می‌گوید که تاکنون پنج کنفرانس علوم کامپیوتر و سه دانشگاه برای استفاده از آن ثبت‌نام کرده‌اند و دیگران نیز در حال آزمایش آن هستند.

تحلیلگران مستقل می‌گویند که این تشخیص‌دهنده‌های هوش مصنوعی به این معنا کار می‌کنند که تقریباً همیشه محتوای صرفاً انسانی را به درستی به عنوان انسانی علامت‌گذاری می‌کنند، اگرچه هیچ ابزاری نمی‌تواند کامل باشد. و به گفته تیم ریکوارث، که در مرکز سلامت لانگون دانشگاه نیویورک در شهر نیویورک به مطالعه ارتباطات علمی می‌پردازد، آن‌ها «برای غربالگری مکان‌هایی که محتوای بی‌کیفیت تولید می‌کنند، خوب هستند.»

اما آن‌ها هنوز هم گاهی اوقات اشتباه می‌کنند، بنابراین این ابزارها فقط می‌توانند به عنوان نقاط شروع برای تحقیق استفاده شوند — و نتایج آن‌ها برای نگارش ویرایش شده با هوش مصنوعی، که در آن متن انسانی و هوش مصنوعی در هم تنیده شده و هیچ مرز مشخصی برای استفاده مشکل‌ساز وجود ندارد، کمتر روشنگر است. نیچر این ابزارها را آزمایش کرده و با کارشناسان مصاحبه کرده است تا ارزیابی کند که آن‌ها در موقعیت‌های مختلف چقدر خوب عمل می‌کنند: کجا کار می‌کنند و کجا کم می‌آورند.

چگونه نوشته‌های هوش مصنوعی را تشخیص دهیم

مارزنا کارپینسکا، دانشمند کامپیوتر در دانشگاه سایمون فریزر در برنابی، کانادا، که تحلیل‌های مستقلی از این ابزارها انجام داده است، می‌گوید که تا پیش از ظهور پانگرام و دیگران، نرم‌افزارهای تشخیص هوش مصنوعی به طور بدنامی غیرقابل اعتماد بودند. بیشتر نرم‌افزارها ویژگی‌های آماری یک متن را تحلیل می‌کردند: نوشته‌های هوش مصنوعی تمایل به نمایش «پیچیدگی» (perplexity) بیشتر، تخمینی از میزان قابل پیش‌بینی بودن هر کلمه در یک توالی، و «انفجار» (burstiness) کمتر، که تغییرات در طول و ساختار جملات را در یک متن اندازه‌گیری می‌کند، داشتند. برخی از ابزارها ویژگی‌های سبکی خاص در نوشته‌های هوش مصنوعی را شناسایی می‌کردند، مانند استفاده بیش از حد از ساختار «این X نیست، این Y است».

اما این رویکردها اغلب متن نوشته شده توسط انسان را به اشتباه به عنوان تولید شده توسط هوش مصنوعی علامت‌گذاری می‌کردند. کارپینسکا می‌گوید: «ما اعتماد زیادی به تشخیص نداشتیم.» برخی از دانشگاه‌ها آنقدر از تشخیص‌دهنده‌های هوش مصنوعی بی‌ثبات خسته شدند که در نهایت استفاده از این نرم‌افزار را برای کارکنان ممنوع یا دلسرد کردند.

سپس، در اوایل سال ۲۰۲۴، اسپرو و بردلی امی — هر دو دانشمند کامپیوتر که از زمان تحصیل مشترک در دانشگاه استنفورد در کالیفرنیا در شرکت‌های فناوری مختلف کار کرده بودند — رویکرد متفاوتی را گزارش کردند.

آن‌ها میلیون‌ها متن نوشته شده توسط انسان را جمع‌آوری کردند و از مدل‌های زبان بزرگ (LLM) خواستند تا «آینه‌هایی» از این متون ایجاد کنند: برای مثال، درخواست یک مقاله با همان عنوان، طول و لحن یک نمونه انسانی. سپس، مدل‌های یادگیری ماشین را آموزش دادند تا بین محتوای نوشته شده توسط انسان و آینه هوش مصنوعی تمایز قائل شوند و با بازخورد دادن چالش‌برانگیزترین موارد، عملکرد مدل را بهبود بخشیدند. مانند بسیاری از این مدل‌ها، نرم‌افزار حاصل یک جعبه سیاه است. این نرم‌افزار یاد می‌گیرد که ویژگی‌های ظریف نوشته‌های هوش مصنوعی را، که اغلب مختص مدل‌های زبان بزرگ خاص هستند، شناسایی کند. اما این ویژگی‌ها همیشه نمی‌توانند به راحتی با اصطلاحات انسانی توصیف شوند.

اسپرو و امی در مطالعه سال ۲۰۲۴ خود (که هنوز بازبینی همتا نشده است)2، نرخ مثبت کاذب ۰.۰۲٪ را گزارش کردند: یعنی مدل به ندرت نوشته‌های انسانی را به عنوان هوش مصنوعی برچسب‌گذاری می‌کرد. کارپینسکا و دیگر محققان مستقل این مدل‌ها را آزمایش کردند3. او می‌گوید: «ما واقعاً از اینکه به خوبی کار می‌کرد، بسیار شگفت‌زده شدیم. هرچه به آن می‌دادیم، در تشخیص بسیار، بسیار خوب بود.»

در ماه ژوئیه، شرکت تحقیقاتی اپوک ای‌آی (Epoch AI) در سانفرانسیسکو، کالیفرنیا، گزارش داد که پانگرام در ۴۹۵ متن نوشته شده توسط انسان، هیچ مثبت کاذبی نداشته است. آخرین مقاله فنی پانگرام نرخ مثبت کاذب ۰.۰۰۴۱٪ را در متون انگلیسی گزارش می‌دهد، با نرخ‌های مشابه پایین در بیش از ۱۰۰ زبان4. آزمایش‌ها در این مطالعه همچنین نشان می‌دهد که پانگرام علیه نویسندگانی که انگلیسی‌زبان بومی نیستند، تبعیض قائل نمی‌شود، مشکلی که در نرم‌افزارهای قبلی مطرح شده بود.

زمانی که کار اولیه پانگرام عمومی شد، جی‌پی‌تی‌زیرو نیز از اندازه‌گیری پیچیدگی و انفجار به استفاده از شکل مشابهی از یادگیری ماشین روی آورد. این ابزار نیز در مطالعه کارپینسکا عملکرد خوبی داشت و در آزمایش اپوک ای‌آی (Epoch AI) هیچ مثبت کاذبی نداشت. در ماه فوریه، جی‌پی‌تی‌زیرو نرخ مثبت کاذب ۰.۰۸٪ را در آزمایش‌های داخلی خود اعلام کرد، اگرچه مقاله فنی آن5 با احتیاط بیشتری این را «زیر ۱٪» در تمام حوزه‌های نگارش بیان می‌کند.

رقابت تسلیحاتی هوش مصنوعی

توانایی چشمگیر این ابزارها در شناسایی کارهای صرفاً انسانی، با یک بده‌بستان همراه است. برای جلوگیری از علامت‌گذاری متن انسانی به عنوان هوش مصنوعی، هر دو شرکت نسبت بالاتری از نتایج منفی کاذب را می‌پذیرند — یعنی به اشتباه برخی از متون تولید شده توسط هوش مصنوعی را به عنوان انسانی تأیید می‌کنند. اپوک ای‌آی (Epoch AI) دریافت که پانگرام و جی‌پی‌تی‌زیرو تقریباً تمام بخش‌های تولید شده توسط هوش مصنوعی را که با دستورات اولیه ساخته شده بودند، علامت‌گذاری کردند. اما وقتی از هوش مصنوعی خواسته شد تا از یک نویسنده خاص تقلید کند، حدود ۸٪ از بخش‌های حاصل به عنوان انسانی شناخته شدند.

مطالعه کارپینسکا یک ابزار «انسانی‌ساز» را بررسی کرد — ابزاری که متن تولید شده توسط هوش مصنوعی را بازنویسی می‌کند تا برخی از نشانه‌های هوش مصنوعی را حذف کند. او دریافت که وقتی از تشخیص‌دهنده‌ها خواسته شد تا متون انسانی را در مقابل متن نوشته شده توسط هوش مصنوعی انسانی‌سازی شده طبقه‌بندی کنند، نرخ منفی کاذب و مثبت کاذب آن‌ها افزایش یافت.

اما شرکت‌ها می‌گویند که این آزمایش‌ها از رده خارج شده‌اند. برای مثال، مطالعه کارپینسکا نشان داد که مدل زبان بزرگ o1 که به تازگی از OpenAI منتشر شده بود، نسخه قدیمی پانگرام را به مشکل انداخت. هر دو این ابزارها اکنون منسوخ شده‌اند و شرکت‌های تشخیص هوش مصنوعی به طور مداوم مدل‌های خود را با انتشار نسخه‌های جدید مدل‌های زبان بزرگ (LLM) به‌روزرسانی می‌کنند.

برای مثال، در سال گذشته، جی‌پی‌تی‌زیرو ۲۳ به‌روزرسانی برای مدل‌های خود منتشر کرده است. در همین حال، پانگرام لبز در ماه ژوئیه مدل نسل بعدی خود، پانگرام ۴ را منتشر کرد که پیشرفت‌های عظیمی را نسبت به نسخه قبلی خود، از جمله بهبودهایی در شناسایی امضاهای انسانی‌ساز هوش مصنوعی، وعده می‌دهد. این شرکت می‌گوید که نرخ منفی کاذب آن اکنون تنها ۰.۳۴٪ است و وقتی از هوش مصنوعی خواسته می‌شود تا از سبک‌ها تقلید کند (مانند آزمایش اپوک)، نرخ منفی کاذب به ۲.۹٪ کاهش می‌یابد. با این حال، مانند همه مدل‌ها، عملکرد با بخش‌های بسیار کوتاه هوش مصنوعی (کمتر از ۵۰ کلمه) کاهش می‌یابد.

نتیجه این است که فقط نرخ‌های دقت اعلام شده توسط شرکت‌ها از آزمایش‌های داخلی می‌تواند واقعاً به‌روز باشد — اما این‌ها به طور خارجی تأیید نشده‌اند. ریکوارث می‌گوید: «ارزیابی‌های شخص ثالث همیشه از جدیدترین تشخیص‌دهنده‌ها عقب خواهند ماند.»

چالش هوش مصنوعی ترکیبی

هم پانگرام و هم جی‌پی‌تی‌زیرو با فروش اشتراک برای استفاده منظم یا سنگین درآمد کسب می‌کنند، اما برخی بررسی‌های رایگان محدود را نیز ارائه می‌دهند. هر دو همچنین ابزارهای مرورگری را راه‌اندازی کرده‌اند که متن نوشته شده با هوش مصنوعی را در رسانه‌های اجتماعی، سایر صفحات وب و اسناد گوگل بررسی می‌کنند.

با تجربه بیشتر نویسندگان از علامت‌گذاری شدن توسط نرم‌افزار، مشخص شده است که بزرگترین چالش در نحوه برخورد با موارد نگارش با کمک هوش مصنوعی است که به طور فزاینده‌ای رایج می‌شود. نویسندگانی که از هوش مصنوعی استفاده می‌کنند به نیچر گفتند که مفید خواهد بود که خطی بین استفاده از هوش مصنوعی برای صیقل دادن یا ویرایش پیش‌نویس‌های نوشته شده توسط انسان، که آن‌ها آن را عمدتاً قابل قبول می‌دانستند، و تولید یک پیش‌نویس با هوش مصنوعی از ابتدا و سپس ویرایش یا انسانی‌سازی آن، ترسیم شود.

هم پانگرام و هم جی‌پی‌تی‌زیرو متون را به بخش‌هایی تقسیم می‌کنند و سعی می‌کنند میزان صیقل‌کاری جزئی با هوش مصنوعی، کمک سنگین هوش مصنوعی یا تولید کامل با هوش مصنوعی را نشان دهند (به «چگونگی ارائه امتیازات توسط دو تشخیص‌دهنده هوش مصنوعی» مراجعه کنید). اما در عمل، این ابزارها همیشه به طور رضایت‌بخشی بین این موارد تمایز قائل نمی‌شوند.

برای مثال، در ماه ژوئن، النا ویکاریو، مدیر یکپارچگی تحقیقات در انتشارات فرانتیرز (Frontiers) که دفتر مرکزی آن در لوزان سوئیس است، پستی را برای The Scholarly Kitchen، وب‌سایتی که دیدگاه‌هایی در مورد انتشارات علمی منتشر می‌کند، نوشت و استدلال کرد که هوش مصنوعی می‌تواند برای حمایت از بازبینی همتا استفاده شود. هنگامی که نیچر این مقاله را در اوایل ژوئیه از طریق پانگرام اجرا کرد، ۱۰۰٪ هوش مصنوعی تشخیص داده شد؛ پس از انتشار پانگرام ۴، این میزان به ۹۶٪ هوش مصنوعی تغییر یافت.

اما ویکاریو می‌گوید که پیش‌نویس اول و ایده‌هایی که در آن به کار رفته بود «کاملاً توسط انسان ایجاد شده بود» و او از هوش مصنوعی به عنوان ابزاری برای صیقل دادن متن استفاده کرده است «که صرفاً بهترین روش است». ویراستاران The Scholarly Kitchen اضافه می‌کنند که مقاله در آنجا بیشتر ویرایش شده بود، بنابراین نمی‌توانست کاملاً هوش مصنوعی باشد.

اسپرو می‌گوید که اگر پانگرام یک اثر را ۱۰۰٪ هوش مصنوعی برچسب‌گذاری کند، این به معنای آن نیست که هر کلمه توسط هوش مصنوعی تولید شده است. این ابزار یک متن را به بخش‌هایی تقسیم می‌کند و قضاوت می‌کند که آیا هر بخش احتمالاً توسط هوش مصنوعی تولید شده، توسط انسان نوشته شده یا «ترکیبی» است. سپس، پانگرام بر اساس نسبت بخش‌های علامت‌گذاری شده، یک امتیاز کلی اختصاص می‌دهد. ۱۰۰٪ هوش مصنوعی فقط به این معنی است که هر بخش به احتمال زیاد هوش مصنوعی تشخیص داده شده است، حتی اگر آن بخش حاوی محتوای نوشته شده توسط انسان باشد.

اسپرو اضافه می‌کند که این فرآیند تکه‌تکه کردن به این معنی است که یک پاراگراف که به تنهایی «انسانی» تشخیص داده شده است، می‌تواند در ترکیب با متن‌های دیگر در یک بخش به هوش مصنوعی تغییر کند — این توضیح می‌دهد که چرا برخی نویسندگان متوجه می‌شوند که جملات استخراج شده از یک مقاله می‌توانند امتیاز متفاوتی نسبت به زمانی که در کل مقاله قضاوت می‌شوند، داشته باشند.

ویکاریو می‌گوید: «اگر یک ویراستار یا نویسنده از برنامه هوش مصنوعی برای روان کردن یک جمله یا روشن کردن استدلال در طول فرآیند ویرایش استفاده کرده باشد، ما این را مشکلی نمی‌دانیم.»

پانگرام ۴، نرم‌افزاری که در ماه ژوئیه راه‌اندازی شد، ارزیابی‌ها را تا حدی تغییر داده است زیرا متن را به بخش‌های دقیق‌تری تقسیم می‌کند. در حالی که نسخه قدیمی بخش‌هایی حدود ۲۰۰ تا ۳۰۰ کلمه را تحلیل می‌کرد — به این معنی که یک پست ۱۰۰۰ کلمه‌ای ممکن بود فقط به سه بخش تقسیم شود — نسخه جدید می‌تواند بخش‌هایی به کوچکی ۳۰ تا ۴۰ کلمه را تحلیل کند.

اسپرو می‌گوید که پانگرام ۴ بهتر بین صیقل‌کاری جزئی با هوش مصنوعی — که معمولاً برچسب نوشته شده توسط انسان را حفظ می‌کند — و ویرایش‌های سنگین با هوش مصنوعی تمایز قائل می‌شود. او می‌گوید: «برای فعال کردن پانگرام ۴، ورودی عمده هوش مصنوعی مانند جملات کاملاً تولید شده یا بازنویسی‌های عمده لازم است.»

جی‌پی‌تی‌زیرو متون را کمی متفاوت تحلیل می‌کند. مانند پانگرام، آن را به بخش‌هایی تقسیم می‌کند، اما در پایان، امتیازی را ارائه می‌دهد که نشان‌دهنده اطمینان آن در مورد کل متن است، نه تفکیک نتایج هر بخش5. کاربران پولی می‌توانند ببینند کدام جملات بیشترین سهم را در ارزیابی جی‌پی‌تی‌زیرو از یک اثر به عنوان احتمالاً انسانی، هوش مصنوعی یا ترکیبی داشته‌اند. این ابزار ۱۰۰٪ اطمینان تولید می‌کند که پست ویکاریو هوش مصنوعی بوده است، که به معنای «اطمینان بسیار بالا از تولید این متن توسط هوش مصنوعی» توصیف می‌شود.

پس از بررسی این مورد توسط نیچر، ویراستاران The Scholarly Kitchen در پست خود اشاره کردند که هوش مصنوعی «به عنوان ابزار ویرایش» استفاده شده است.

سوالات بیشتری در مورد ارزیابی‌های پانگرام زمانی مطرح شد که، در طول گزارش این مقاله، اسپرو گزارشی از بررسی مقالات در وب‌سایت نیچر ارسال کرد. او با استفاده از ارزیابی پانگرام ۳.۳، اشاره کرد که برخی از مقالات در نمونه‌ای از وب‌سایت‌های نیچر هند و نیچر آفریقا به عنوان هوش مصنوعی-انسانی ترکیبی، و در برخی موارد، ۱۰۰٪ هوش مصنوعی، تشخیص داده شدند.

بررسی توسط تیم‌های تحریریه سایت‌ها نشان داد که برخی از مقالات علامت‌گذاری شده، ترجمه‌های با کمک هوش مصنوعی از مقاله‌ای دیگر یا نکات برجسته تحقیقاتی کوتاهی بودند که به صراحت با کمک هوش مصنوعی نوشته شده و توسط انسان ویرایش شده بودند. اما برخی از آن‌ها مقالاتی بودند که توسط مشارکت‌کنندگان نوشته شده بودند. آن‌ها گفتند که از هوش مصنوعی فقط برای کمک به رونویسی یا ترجمه مصاحبه‌ها، سازماندهی یادداشت‌ها و ویرایش پیش‌نویس‌های خود استفاده کرده‌اند. همه این مقالات مراحل بیشتری از ویرایش انسانی را پشت سر گذاشتند.

در بسیاری از موارد، پانگرام ۴ این مقالات را صرفاً ترکیبی از انسان و هوش مصنوعی تشخیص داد، در حالی که نسخه قدیمی‌تر آن‌ها را کاملاً هوش مصنوعی نامیده بود. اما نرم‌افزار جدیدتر هنوز دو گزارش خبری را که حاوی اطلاعاتی برگرفته از گزارش‌های اصلی، از جمله مصاحبه‌ها، بودند، ۱۰۰٪ هوش مصنوعی برچسب‌گذاری کرد. هر دو سایت استفاده از هوش مصنوعی را با نظارت انسانی مجاز می‌دانند، مطابق با دستورالعمل‌های انتشارات در مجموعه نیچر که می‌گوید هوش مصنوعی باید در صورت استفاده گسترده برای ویرایش یا نگارش، اعلام شود، اما برای صیقل دادن یا اصلاح زبان نیازی به اعلام ندارد، اگرچه شفافیت تشویق می‌شود. پس از بررسی نتایج پانگرام، ویراستاران سایت یادداشت‌هایی را به برخی مقالات اضافه کردند تا کمک هوش مصنوعی را مشخص کنند.

به طور کلی، مانند مورد The Scholarly Kitchen، نرم‌افزار به درستی دخالت هوش مصنوعی را تشخیص داد. اما پانگرام و جی‌پی‌تی‌زیرو گاهی اوقات در مورد نحوه رتبه‌بندی مقالات و اینکه کدام بخش‌ها قوی‌ترین نشانه‌های انسانی یا هوش مصنوعی را داشتند، اختلاف نظر داشتند. و این مثال‌ها نشان می‌دهد که مقالاتی که ۱۰۰٪ هوش مصنوعی یا نزدیک به ۱۰۰٪ علامت‌گذاری شده‌اند، می‌توانند شامل متنی باشند که توسط انسان نوشته و ویرایش شده است.

اسپرو می‌گوید که اگرچه پانگرام در شناسایی مواردی که پاراگراف‌های کاملاً نوشته شده با هوش مصنوعی بین بخش‌های متن نوشته شده توسط انسان قرار می‌گیرند، خوب عمل می‌کند، اما «فضای زیادی برای بهبود» در قضاوت موارد واقعی که در آن‌ها نوشته‌های هوش مصنوعی و انسانی به شیوه‌ای همگن‌تر در هم آمیخته‌اند، وجود دارد. برای مثال، او می‌گوید، ویرایش‌های کوچک در چنین اسنادی گاهی اوقات می‌تواند امتیاز پانگرام را به میزان زیادی تغییر دهد — مشکلی که به عنوان «لرزش» (jitter) شناخته می‌شود. مطالعه فنی پانگرام همچنین اشاره می‌کند که وقتی شرکت با استفاده از هوش مصنوعی مصرف‌کننده برای «تغییر اساسی» مقالات دانشجویی نوشته شده توسط انسان آزمایش کرد، مدل هنوز هم نتایج را در ۴۱٪ موارد کاملاً انسانی برچسب‌گذاری کرد.

ریکوارث می‌گوید که او به درصد‌های دقیق ارائه شده توسط تشخیص‌دهنده‌ها در مواردی که کمک یا ویرایش هوش مصنوعی دخیل است، و به ویژه در سطح استدلال برای جملات منفرد یا بخش‌های کوتاه متن که توسط هوش مصنوعی نوشته شده‌اند، اعتماد زیادی ندارد.

کوی می‌گوید که اولویت برای تشخیص‌دهنده‌های هوش مصنوعی باید تعیین این باشد که آیا یک متن به طور کامل توسط هوش مصنوعی تولید شده است یا خیر، زیرا «این همان چیزی است که مردم به دنبال آن هستند». او می‌گوید که تعیین میزان کمک هوش مصنوعی در یک متن «مشکل دشوارتری است.»

شکار جادوگران؟

هنگامی که خوانندگان ساب‌استک شروع به دیدن ارزیابی پانگرام از پست‌ها در این پلتفرم کردند، برخی از نویسندگان عصبانی شدند. سم ایلینگورث، که در دانشگاه ادینبورگ ناپیر (Edinburgh Napier University) بریتانیا به مطالعه سواد هوش مصنوعی می‌پردازد، در پستی در ساب‌استک که پانگرام آن را ۱۰۰٪ هوش مصنوعی امتیاز داده بود، آن را «شکار جادوگران» نامید. او همچنین متن خود را از طریق یک انسانی‌ساز (humanizer) اجرا کرد که ارزیابی پانگرام را به ۱۰۰٪ انسانی تغییر داد.

ایلینگورث می‌گوید که او به شدت از ابزارهای هوش مصنوعی برای ویرایش پیش‌نویس‌های خود استفاده می‌کند. او می‌گوید: «قطعاً کار من با کمک هوش مصنوعی انجام می‌شود، اما آیا ۱۰۰٪ توسط هوش مصنوعی تولید شده است؟ خیر.» این مثال دوباره پتانسیل سردرگمی با برچسب ۱۰۰٪ تولید شده توسط هوش مصنوعی پانگرام را نشان می‌دهد.

پانگرام ۴، که پس از پست ایلینگورث منتشر شد، پست اصلی را ۹۵٪ هوش مصنوعی و ۵٪ انسانی ارزیابی می‌کند. این ابزار نسخه انسانی‌سازی شده را ۶۰٪ هوش مصنوعی، «ترکیبی از محتوای نوشته شده با هوش مصنوعی و انسانی» ارزیابی می‌کند — این نشان می‌دهد که ابزار جدیدتر حتی در کارهای انسانی‌سازی شده نیز ردپای هوش مصنوعی را تشخیص می‌دهد.

اما پست‌هایی در فضای آنلاین منتشر شده است که نشان می‌دهد برخی از ابزارهای انسانی‌ساز می‌توانند پانگرام ۴ را نیز فریب دهند. نیکیل گارگ، دانشمند کامپیوتر در کورنل تک (Cornell Tech) در شهر نیویورک، می‌گوید: «این بازی موش و گربه در هر دو طرف ادامه خواهد داشت.»

نگرانی‌های ایلینگورث همچنان باقی است. او می‌گوید که اجازه دادن به خوانندگان برای بررسی امتیازات در پست‌های ساب‌استک ممکن است افرادی را که سبک نگارش طبیعی‌شان بیشتر شبیه هوش مصنوعی است (نگرانی‌ای که به ویژه توسط برخی نویسندگان دارای اختلالات عصبی مطرح شده است) جریمه کند، و کسانی را که از هوش مصنوعی برای بهبود کار استفاده می‌کنند، اگر انگلیسی زبان اولشان نباشد، مجازات می‌کند — نگرانی‌ای که ایوانکو، که پانگرام را روی بازبینی‌های همتا آزمایش کرده است، نیز آن را تکرار می‌کند.

ایوانکو می‌گوید: «بزرگترین نقص زمانی است که بازبین‌ها از مدل‌های زبان بزرگ (LLM) برای ترجمه نظرات خود از زبان‌های غیر هندواروپایی به انگلیسی استفاده می‌کنند.» او اضافه می‌کند: «نتیجه کاملاً توسط هوش مصنوعی تولید شده است.» اما AACR به تازگی پانگرام ۴ را معرفی کرده است؛ در آزمایش‌های اولیه، حدود یک پنجم از بازبینی‌هایی که توسط نرم‌افزار قدیمی‌تر ۱۰۰٪ هوش مصنوعی طبقه‌بندی شده بودند، اکنون سهم هوش مصنوعی آن‌ها کاهش یافته است، با شدیدترین کاهش‌ها برای بازبین‌های غیر هندواروپایی.

اسپرو می‌گوید که صرف ترجمه نباید باعث فعال شدن پرچم هوش مصنوعی شود؛ او فکر می‌کند که در مواردی که ایوانکو ذکر می‌کند، ترجمه و ویرایش هوش مصنوعی به طور همزمان اتفاق می‌افتد.

کوی می‌گوید که امتیاز تشخیص‌دهنده نباید به خودی خود به عنوان نتیجه در نظر گرفته شود — بلکه فقط به عنوان سیگنالی برای تحقیقات بیشتر. اسپرو اضافه می‌کند که الگوی استفاده سنگین از هوش مصنوعی، بیشتر از قضاوت در مورد یک مقاله واحد، روشنگر است.

محققان می‌گویند که محدودیت اجتناب‌ناپذیر تشخیص هوش مصنوعی، هر چقدر هم که خوب شود، این است که اگرچه نرم‌افزار می‌تواند تشخیص دهد که آیا هوش مصنوعی در یک قطعه دخیل بوده است یا خیر، اما نمی‌تواند ثابت کند که چگونه از آن استفاده شده یا چه چیزی از نظر اخلاقی قابل قبول است.

رنه دی‌رستا، پژوهشگر دانشگاه جورج‌تاون در واشنگتن دی‌سی، که به مطالعه کلاهبرداری‌ها، کمپین‌های اطلاعات نادرست و سایر نمونه‌های دستکاری و سوءاستفاده آنلاین می‌پردازد، می‌گوید که خوانندگان واقعاً می‌خواهند بدانند که آیا یک قطعه به طور معناداری توسط انسان نوشته شده است یا اینکه یک محتوای بی‌کیفیت یا اسپم هوش مصنوعی بوده است، اما حتی یک تشخیص‌دهنده هوش مصنوعی کامل نیز نمی‌تواند این مورد را ثابت کند. دی‌رستا در پستی وبلاگی درباره تشخیص‌دهنده پانگرام در ساب‌استک نوشت: «ما در نهایت چیزی را که آسان‌تر قابل تشخیص است، به جای پرداختن به نگرانی عمیق‌تر و اساسی‌تر، برجسته می‌کنیم.»

افزایش بی‌اعتمادی

ابزارهای جدید همچنین در محیطی آنلاین پر از تشخیص هوش مصنوعی بی‌کیفیت وارد می‌شوند. خدمات نامرغوب همچنان در گردش هستند، گاهی اوقات با ارائه دور زدن تشخیص‌دهنده‌های هوش مصنوعی از طریق انسانی‌سازی کار، و به بی‌اعتمادی به نرم‌افزار کمک می‌کنند. بسیاری از انتقادات به تشخیص هوش مصنوعی به ابزارهای بی‌کیفیت اشاره دارند.

برای مثال، مارک کاریگان، که در دانشگاه منچستر بریتانیا در زمینه آموزش دیجیتال کار می‌کند و کتابی درباره هوش مصنوعی مولد برای دانشگاهیان نوشته است، در ماه ژوئیه در فضای آنلاین پستی منتشر کرد که در آن گفته بود پایان‌نامه دکترای قدیمی خود را از سال ۲۰۱۴، که مدت‌ها قبل از وجود مدل‌های زبان بزرگ (LLM) نوشته شده بود، از طریق ابزاری به نام تکست‌گارد (TextGuard) بررسی کرده است، که به او گفته بود ۶۲٪ از فایل نشانه‌های هوش مصنوعی دارد و پیشنهاد انسانی‌سازی آن را داده بود.

او نتیجه گرفت که نمی‌توان به تشخیص‌دهنده‌های هوش مصنوعی اعتماد کرد؛ دیگران نیز تجربیات مشابهی با خدماتی مانند تکست‌گارد گزارش کرده‌اند. اما وقتی نیچر پایان‌نامه کاریگان و متون دیگر را آزمایش کرد، جی‌پی‌تی‌زیرو و پانگرام همیشه محتوای قدیمی‌تر را به درستی به عنوان نوشته شده توسط انسان شناسایی کردند. به طور گیج‌کننده، گزارش امتیاز هوش مصنوعی تکست‌گارد شامل یک گرافیک است که بیان می‌کند با جی‌پی‌تی‌زیرو «دوباره بررسی شده است»؛ کوی می‌گوید جی‌پی‌تی‌زیرو هیچ همکاری یا ارتباطی با تکست‌گارد ندارد. سخنگوی شرکت سازنده تکست‌گارد، لول مدیا لیمیتد (Level Media Limited) مستقر در هنگ‌کنگ، به نیچر گفت که این به معنای عدم تأیید نتایج توسط این شرکت با استفاده از جی‌پی‌تی‌زیرو نیست، اما از توضیح بیشتر خودداری کرد. به طور کلی، سخنگو نوشت، تکست‌گارد ارزیابی خود را بر اساس شباهت به الگوهای سبکی و ساختارهای جمله‌ای که اغلب در نوشته‌های هوش مصنوعی یافت می‌شوند، انجام می‌دهد و مثبت کاذب می‌تواند رخ دهد.

اسپرو از پانگرام اشاره می‌کند که خود جی‌پی‌تی‌زیرو در ماه ژوئن توسط شرکت بهره‌وری هوش مصنوعی سوپرهیومن (Superhuman)، که قبلاً با نام گرامرلی (Grammarly) شناخته می‌شد و ابزارهای کمک‌کننده نگارش هوش مصنوعی، از جمله ابزارهایی برای انسانی‌سازی متن هوش مصنوعی، ارائه می‌دهد، خریداری شد. او می‌گوید پانگرام شرکت مستقل پیشرو است که به عملیات انسانی‌ساز وابسته نیست.

کوی از جی‌پی‌تی‌زیرو پاسخ می‌دهد که این ابزارها جداگانه هستند و با یکدیگر در تضاد نیستند؛ جی‌پی‌تی‌زیرو حتی تشخیص می‌دهد که آیا محصولات سوپرهیومن استفاده شده‌اند یا خیر. او به نوبه خود استدلال می‌کند که پانگرام در نرخ‌های مثبت کاذب خود بیش از حد مطمئن است و در نحوه اعلام درصد خاصی از محتوا به عنوان هوش مصنوعی یا انسانی، به طور کاذب دقیق عمل می‌کند. اسپرو مخالف است.

همانطور که محققان به طور فزاینده‌ای از هوش مصنوعی برای نوشتن یا ویرایش محتوا استفاده می‌کنند و از افشای آن اجتناب می‌ورزند، به احتمال زیاد ناشران بیشتری غربالگری هوش مصنوعی را اتخاذ خواهند کرد. در حال حاضر، سرویس غربالگری دست‌نوشته Proofig AI در رِهووت، اسرائیل، و شرکت یکپارچگی تحقیقات Clearskies در لندن، پانگرام را به کاربران خود ارائه می‌دهند. از ناشران تحقیقاتی که به پرسش‌های نیچر پاسخ دادند، مجلات ساینس می‌گویند که اخیراً ویژگی تشخیص متن هوش مصنوعی iThenticate را ادغام کرده‌اند، و MDPI می‌گوید که یک تشخیص‌دهنده هوش مصنوعی داخلی به نام Binoculars ساخته است. اسپرینگر نیچر می‌گوید که در حال بررسی ابزارهای تشخیص هوش مصنوعی داخلی و شخص ثالث است. (تیم خبری نیچر از نظر تحریریه مستقل از ناشر خود، اسپرینگر نیچر، عمل می‌کند.)

در تحولی دیگر، این ماه، شرکت آمریکایی آنتروپیک (Anthropic) اعلام کرد که برای رعایت قانون هوش مصنوعی اتحادیه اروپا، واترمارکینگ را در مدل‌های هوش مصنوعی کلود (Claude) خود معرفی خواهد کرد — اگرچه مشخص نیست که ویرایش تا چه حد می‌تواند این نشانه‌ها را حذف کند، یا اینکه آیا نویسندگان در نتیجه از کلود اجتناب خواهند کرد.

گارگ می‌گوید که در نهایت، به احتمال زیاد اگر واترمارکینگ و ابزارهای تشخیص هوش مصنوعی گسترده شوند، نویسندگان، از جمله دانشمندان، باید شفاف‌تر نحوه استفاده خود از هوش مصنوعی را فاش کنند و راه‌هایی برای اثبات یا مستندسازی فرآیند خود بیابند. و این ممکن است به همه کمک کند تا پاسخ‌هایی برای مسئله اساسی پیدا کنند: چه چیزی به عنوان استفاده اخلاقی قابل قبول از هوش مصنوعی محسوب می‌شود؟

اشتراک:
این گزارش ترجمه و بازنویسی خبری با موتور هوش مصنوعی افق آبی است و برای خوانندهٔ فارسی‌زبان بازتنظیم شده. منبع اصلی: nature.com