هوش مصنوعی و یادگیری ماشین

تحلیل سبک‌شناختی مدل‌های زبانی: چرا AI هنوز مانند یک ماشین می‌نویسد؟

با فراگیر شدن مدل‌های زبانی بزرگ (LLM) در تولید محتوا، شناسایی متون تولید شده توسط هوش مصنوعی به یک چالش جدی برای مخاطبان و ویراستاران تبدیل شده است. پژوهش جدید شرکت بازاریابی Graphite نشان می‌دهد که اگرچه برخی نشانه‌های قدیمی مانند استفاده بیش‌ازحد از خط تیره (em-dash) در نسخه‌های جدید مدل‌ها حذف شده‌اند، اما مدل‌های پیشرو همچنان الگوهای نوشتاری خاص و تکرارپذیری دارند که آن‌ها را از نویسندگان انسانی متمایز می‌کند.

تکامل الگوهای نوشتاری: از حذف خط تیره تا تولد نشانه‌های جدید

پژوهش Graphite با تحلیل پیکره‌ای متشکل از ۱۰ هزار مقاله پیش از ظهور ChatGPT به عنوان گروه کنترل انسانی، توانست ۱۳ هزار عبارت را شناسایی کند که در متون هوش مصنوعی حداقل دو برابر بیشتر از متون انسانی تکرار شده‌اند. این مطالعه نشان می‌دهد که علیرغم تلاش شرکت‌های بزرگ برای «طبیعی‌تر» کردن خروجی مدل‌ها، مدل‌هایی نظیر Opus 5.5 و خانواده GPT همچنان دارای «امضاهای زبانی» منحصربه‌فردی هستند. نکته قابل‌تامل این است که با رفع یک ایراد فنی در ساختار جمله، مدل‌ها به طور خودکار به سراغ کلیشه‌های جدیدی می‌روند که از دید الگوریتم‌های بهینه‌سازی شده، بهینه‌تر به نظر می‌رسند.

آناتومی نشانه‌های اختصاصی مدل‌ها (AI Tells)

بر اساس تحلیل‌های انجام شده، هر مدل زبانی هویت نوشتاری خاص خود را دارد:

  • مدل Opus 5.5 (آنتراپیک): این مدل علاقه مفرطی به جملات تاکیدی دارد. استفاده از عباراتی نظیر «This matters» (این موضوع اهمیت دارد) با نرخ ۱۱۶ برابر بیشتر از متون انسانی و «Why X matters» با نرخ ۹۲ برابر بیشتر، از شاخص‌ترین ویژگی‌های آن است. همچنین استفاده از ساختار «بیش از یک X، یک Y است» جایگزین ساختارهای قدیمی شده است.
  • مدل Astra (اوپن‌ای‌آی): این مدل به سبک «چارچوب‌بندی اصلاحی» (Corrective Framing) تمایل دارد. Astra علاقه زیادی به توصیف «بعد دیگری» از موضوعات دارد و با جملاتی نظیر «ممکن است فراهم کند» (may provide) یا «می‌تواند فراهم کند» (can provide) سعی در احتیاط و کاهش قطعیت در ادعاهای خود دارد.

تحلیل فنی: چرا کنترل این الگوها دشوار است؟

مشخصات تحلیل سبک‌شناختی مدل‌های هوش مصنوعی:

  • پایگاه داده مرجع: ۱۰,۰۰۰ مقاله پیش از انتشار ChatGPT
  • شاخص اصلی شناسایی (Tell): تکرار عبارات با فرکانس حداقل ۲ برابر متون انسانی
  • وضعیت خط تیره (em-dash): کاهش ۹۹ درصدی در Opus 5.5 و کاهش ۸۸ درصدی در Astra
  • تنوع نشانه‌ها: بیش از ۱۳,۰۰۰ عبارت کلیشه‌ای منحصر به مدل‌های زبانی شناسایی شده است

گرگ دراک، مدیر ارشد هوش مصنوعی در Graphite، معتقد است که دلیل این تکرارپذیری به ماهیت مدل‌های پارامتری کلان بازمی‌گردد. با وجود میلیاردها پارامتر، کنترل دقیق بر تمامی خروجی‌های زبانی از نظر آماری غیرممکن است. در حالی که آنتراپیک و اوپن‌ای‌آی در مستندات فنی خود ادعا می‌کنند که مدل‌های نسل جدید (مانند GPT-6 یا سری Opus) از واژگان تخصصی (Jargon) کمتر و ساختار شفاف‌تری برخوردارند، داده‌های تجربی نشان می‌دهد که این مدل‌ها در حال حرکت به سمت یک «نرمال‌سازی مصنوعی» هستند که خود به یک نشانه (Tell) جدید تبدیل شده است.

نتیجه‌گیری برای متخصصان محتوا

شناسایی متن AI تنها با جستجوی چند کلمه کلیدی میسر نیست، بلکه نیازمند درک ساختارهای نحوی است که مدل‌ها برای ایجاد «وزن» در متن استفاده می‌کنند. نویسندگان و ویراستاران باید بدانند که با هر به‌روزرسانی (مانند گذار از Opus 5 به 5.5)، مدل‌ها یاد می‌گیرند که نقاط ضعف قبلی خود را بپوشانند، اما بلافاصله در الگوهای جدیدی گیر می‌افتند. این چرخه «موش و گربه» بین توسعه‌دهندگان مدل‌ها و ابزارهای شناسایی متن، همچنان یکی از مباحث داغ در اکوسیستم هوش مصنوعی در پاییز ۱۴۰۵ است.

📌 منبع و مطالعه بیشتر: TechCrunch – AI Writing Tells Study
حامد

حامد

مسئول مجله فناوری آسمان نقره‌ای