برنامه‌نویسی و معماری نرم‌افزار

جنجال بنچمارک Rust: آیا هوش مصنوعی و DHH در سنجش عملکرد زبان‌های برنامه‌نویسی دچار سوگیری شده‌اند؟

دیوید هاینمایر هانسون (DHH)، خالق فریم‌ورک محبوب Ruby on Rails، در مهرماه ۱۴۰۵ با انتشار نتایج یک بنچمارک بحث‌برانگیز در رابطه با بازنویسی اپلیکیشن Campfire توسط ایجنت‌های هوش مصنوعی، جامعه برنامه‌نویسی را به چالش کشید. این تحلیل، که مدعی برتری مطلق زبان Rust در عملکرد بود، با موجی از انتقادات فنی همراه شد؛ چرا که بسیاری از متخصصان معتقدند این مقایسه ناعادلانه بوده و سوگیری در بهینه‌سازی کدهای تولید شده، نتایج را مخدوش کرده است.

معماری آزمون و ادعاهای مطرح شده

DHH در این آزمایش که نتایج آن بیش از ۹۰۰ هزار بار دیده شد، از ایجنت‌های هوش مصنوعی «Frontier» خواست تا اپلیکیشن چت Campfire را در سه زبان Elixir، Go و Rust بازنویسی کنند. نتایج اولیه حاکی از آن بود که Rust در برخی سناریوها، عملکردی خیره‌کننده (تا ۳۶,۲۶۰ درخواست در ثانیه) از خود نشان داده است، در حالی که Ruby on Rails تنها ۲۴۱ درخواست را پردازش می‌کرد. DHH با استناد به این ارقام، بار دیگر بر دیدگاه خود مبنی بر «کمرنگ شدن نیاز به برنامه‌نویسان برای کدنویسی دستی» تاکید کرد.

تحلیل فنی انتقادات: چرا بنچمارک DHH زیر سوال رفت؟

جامعه برنامه‌نویسی، از جمله مهندسان برجسته گوگل، به سرعت به کاستی‌های این آزمایش اشاره کردند. هسته اصلی انتقادات بر این استوار است که بنچمارک، نه عملکرد واقعی زبان‌ها، بلکه «میزان تلاش انسانی یا ایجنتی» صرف‌شده برای بهینه‌سازی هر زبان را می‌سنجد. توسعه‌دهندگان Elixir و Go با بازنویسی کدهای خود ثابت کردند که با اعمال بهینه‌سازی‌های مشابه، می‌توانند فاصله عملکردی را با Rust به شدت کاهش داده یا حتی در برخی سناریوها از آن پیشی بگیرند.

خلاصه یافته‌های فنی و نتایج بنچمارک اولیه:

  • Rust: ۳۶,۲۶۰ درخواست در ثانیه (بهینه‌سازی شده)
  • Golang: ۳,۸۶۰ درخواست در ثانیه
  • Elixir: ۷۲۲ درخواست در ثانیه
  • Ruby on Rails: ۲۴۱ درخواست در ثانیه
  • نکته: شکاف عملکردی به شدت وابسته به تنظیمات کامپایلر و الگوهای Memory Management است.

ظهور هوش مصنوعی در تولید کد و واقعیت‌های مهندسی

در حالی که DHH مدعی است هوش مصنوعی باید مسیر توسعه نرم‌افزار را تغییر دهد، منتقدان خاطرنشان می‌کنند که اعتماد کورکورانه به خروجی ایجنت‌ها بدون بررسی دستی (Manual Review)، منجر به نتایج گمراه‌کننده می‌شود. این مسئله تنها محدود به زبان‌های برنامه‌نویسی نیست؛ بلکه پروژه‌های بزرگی نظیر Microsoft Copilot و ابزارهای مشابه در حال مهاجرت به Rust برای دستیابی به کارایی بالاتر هستند، اما این مهاجرت‌ها معمولاً حاصل بررسی‌های دقیق مهندسی است، نه اجرای سریع و بدون تحلیل توسط ایجنت‌ها.

نتیجه‌گیری: ابزار یا هدف؟

درس اصلی این جنجال برای جامعه فناوری این است: معیارهای سنجش عملکرد (Performance Benchmarking) اگر بدون رعایت شرایط ایزوله و بهینه‌سازی برابر برای تمام رقبا انجام شوند، نه تنها راهگشا نیستند، بلکه موجب گسترش باورهای غلط در اکوسیستم برنامه‌نویسی می‌شوند. همان‌طور که DHH خود در سال ۲۰۰۳ با انتخاب Ruby بر اولویت «لذت برنامه‌نویس» تاکید داشت، اکنون نیز باید در پذیرش نتایج ایجنت‌ها، بین «سرعت اجرای ماشین» و «بهره‌وری توسعه‌دهنده» تفکیک قائل شد.

📌 منبع و مطالعه بیشتر: گزارش تحلیلی The Register درباره بنچمارک DHH
حامد

حامد

مسئول مجله فناوری آسمان نقره‌ای