با فراگیر شدن مدلهای زبانی بزرگ (LLM) در تولید محتوا، شناسایی متون تولید شده توسط هوش مصنوعی به یک چالش جدی برای مخاطبان و ویراستاران تبدیل شده است. پژوهش جدید شرکت بازاریابی Graphite نشان میدهد که اگرچه برخی نشانههای قدیمی مانند استفاده بیشازحد از خط تیره (em-dash) در نسخههای جدید مدلها حذف شدهاند، اما مدلهای پیشرو همچنان الگوهای نوشتاری خاص و تکرارپذیری دارند که آنها را از نویسندگان انسانی متمایز میکند.
تکامل الگوهای نوشتاری: از حذف خط تیره تا تولد نشانههای جدید
پژوهش Graphite با تحلیل پیکرهای متشکل از ۱۰ هزار مقاله پیش از ظهور ChatGPT به عنوان گروه کنترل انسانی، توانست ۱۳ هزار عبارت را شناسایی کند که در متون هوش مصنوعی حداقل دو برابر بیشتر از متون انسانی تکرار شدهاند. این مطالعه نشان میدهد که علیرغم تلاش شرکتهای بزرگ برای «طبیعیتر» کردن خروجی مدلها، مدلهایی نظیر Opus 5.5 و خانواده GPT همچنان دارای «امضاهای زبانی» منحصربهفردی هستند. نکته قابلتامل این است که با رفع یک ایراد فنی در ساختار جمله، مدلها به طور خودکار به سراغ کلیشههای جدیدی میروند که از دید الگوریتمهای بهینهسازی شده، بهینهتر به نظر میرسند.
آناتومی نشانههای اختصاصی مدلها (AI Tells)
بر اساس تحلیلهای انجام شده، هر مدل زبانی هویت نوشتاری خاص خود را دارد:
- مدل Opus 5.5 (آنتراپیک): این مدل علاقه مفرطی به جملات تاکیدی دارد. استفاده از عباراتی نظیر «This matters» (این موضوع اهمیت دارد) با نرخ ۱۱۶ برابر بیشتر از متون انسانی و «Why X matters» با نرخ ۹۲ برابر بیشتر، از شاخصترین ویژگیهای آن است. همچنین استفاده از ساختار «بیش از یک X، یک Y است» جایگزین ساختارهای قدیمی شده است.
- مدل Astra (اوپنایآی): این مدل به سبک «چارچوببندی اصلاحی» (Corrective Framing) تمایل دارد. Astra علاقه زیادی به توصیف «بعد دیگری» از موضوعات دارد و با جملاتی نظیر «ممکن است فراهم کند» (may provide) یا «میتواند فراهم کند» (can provide) سعی در احتیاط و کاهش قطعیت در ادعاهای خود دارد.
تحلیل فنی: چرا کنترل این الگوها دشوار است؟
- پایگاه داده مرجع: ۱۰,۰۰۰ مقاله پیش از انتشار ChatGPT
- شاخص اصلی شناسایی (Tell): تکرار عبارات با فرکانس حداقل ۲ برابر متون انسانی
- وضعیت خط تیره (em-dash): کاهش ۹۹ درصدی در Opus 5.5 و کاهش ۸۸ درصدی در Astra
- تنوع نشانهها: بیش از ۱۳,۰۰۰ عبارت کلیشهای منحصر به مدلهای زبانی شناسایی شده است
گرگ دراک، مدیر ارشد هوش مصنوعی در Graphite، معتقد است که دلیل این تکرارپذیری به ماهیت مدلهای پارامتری کلان بازمیگردد. با وجود میلیاردها پارامتر، کنترل دقیق بر تمامی خروجیهای زبانی از نظر آماری غیرممکن است. در حالی که آنتراپیک و اوپنایآی در مستندات فنی خود ادعا میکنند که مدلهای نسل جدید (مانند GPT-6 یا سری Opus) از واژگان تخصصی (Jargon) کمتر و ساختار شفافتری برخوردارند، دادههای تجربی نشان میدهد که این مدلها در حال حرکت به سمت یک «نرمالسازی مصنوعی» هستند که خود به یک نشانه (Tell) جدید تبدیل شده است.
نتیجهگیری برای متخصصان محتوا
شناسایی متن AI تنها با جستجوی چند کلمه کلیدی میسر نیست، بلکه نیازمند درک ساختارهای نحوی است که مدلها برای ایجاد «وزن» در متن استفاده میکنند. نویسندگان و ویراستاران باید بدانند که با هر بهروزرسانی (مانند گذار از Opus 5 به 5.5)، مدلها یاد میگیرند که نقاط ضعف قبلی خود را بپوشانند، اما بلافاصله در الگوهای جدیدی گیر میافتند. این چرخه «موش و گربه» بین توسعهدهندگان مدلها و ابزارهای شناسایی متن، همچنان یکی از مباحث داغ در اکوسیستم هوش مصنوعی در پاییز ۱۴۰۵ است.