A central gear with a green circuit pattern
هوش مصنوعی

به‌روزرسانی AIMultiple: فهرست ۵۰+ عامل متن‌باز AI

تازه‌سازی ۱۶ اوت بیان می‌کند که بیشتر عوامل متن‌باز هنوز به نظارت انسانی نیاز دارند و پس از جلسات طولانی‌تر ممکن است کیفیت آن‌ها کاهش یابد.

نوشته Elliot Marsh6 دقیقه مطالعه

AIMultiple فهرست به‌روزرسانی شده‌ای از "بهترین ۵۰+ عامل هوش مصنوعی متن‌باز" را در تاریخ ۱۶ آگوست ۲۰۲۶ پس از آزمایش‌های عملی و ارزیابی مبتنی بر معیارها منتشر کرد. این به‌روزرسانی پروتکل زمینه مدل (MCP) و پروتکل تجارت عاملی استرایپ (ACP) را به عنوان استانداردهای نوظهور معرفی می‌کند و هشدار می‌دهد که بیشتر عوامل متن‌باز هنوز به طور کامل خودمختار نیستند.

نکات کلیدی

  • AIMultiple فهرست انتخابی خود از "بهترین ۵۰+ منبع باز" را به‌روزرسانی کرد.عامل‌های هوش مصنوعیصفحه در ۱۶ اوت ۲۰۲۶، اعتبار دادن به جم دیلمگانی با هازال شیمشک و چارچوب‌بندی لیست به عنوان تست شده عملی با معیارها.
  • این صفحه یک عامل هوش مصنوعی را به عنوان یک حلقه دور یک LLM تعریف می‌کند که برنامه‌ریزی، حافظه، استفاده از ابزار و اجرای تکراری را ترکیب می‌کند، در حالی که بیان می‌کند که "هیچ تعریف توافق‌شده‌ای" برای یک عامل وجود ندارد.
  • AIMultiple ادعا می‌کند که بیشتر عوامل متن‌باز هنوز به‌طور کامل خودکار نیستند، هنوز به ورودی‌های ساختارمند و یک انسان در حلقه نیاز دارند و نرخ‌های موفقیت معیارها پس از ۳۵ دقیقه تعامل انسانی کاهش می‌یابد.
  • نقطه تجدید نظر بر روی MCP برای اتصال استاندارد بین عامل و داده/ابزار و ACP استریپ برای جریان‌های تسویه حساب و تکمیل که توسط عامل در داخل رابط‌های چت اجرا می‌شود، متمرکز است.

AIMultiple فهرست "بیش از ۵۰ عامل هوش مصنوعی متن باز" خود را پس از آزمایش‌های عملی به‌روزرسانی کرد.

AIMultiple صفحه تحقیقاتی خود با عنوان "بهترین ۵۰+ عامل هوش مصنوعی متن باز فهرست شده" را در تاریخ ۲۵ مرداد ۱۴۰۵ به‌روزرسانی کرد و نام Cem Dilmegani و Hazal Şimşek را به عنوان نویسندگان فهرست کرد. این صفحه به عنوان یک انتخاب گزینش شده معرفی می‌شود که پس از "آزمایش‌های عملی با عوامل کدگذاری هوش مصنوعی محبوب، سازندگان عامل هوش مصنوعی و ابزارها" و با استفاده از معیارها برای ارزیابی "توانایی‌های دنیای واقعی" ساخته شده است.

این لیست بر اساس دسته‌بندی‌هایی سازماندهی شده است که به نحوه‌ای که سازندگان واقعاً انباشت‌های عامل را جمع‌آوری می‌کنند، مرتبط است: توسعه عامل و زیرساخت، چارچوب‌های عامل، اتوماسیون و ارکستراسیون جریان کار، و برنامه‌های خاص دامنه.

بخش گزیده شده از صفحه نامی از ترکیبی از چارچوب‌ها و زمان‌های اجرایی از پیش ساخته شده را ذکر می‌کند، از جمله LangGraph (که به عنوان نرم‌افزار اختصاصی با یک کتابخانه متن‌باز شناخته می‌شود)، AutoGen، CrewAI، Camel، Mastra، PydanticAI، Cybersecurity AI (CAI)، Atomic Agents، SmolAgents، Auto-GPT، AIlice، Manus AI، BabyAGI، AgentGPT و OpenManus.

ارزش عملی به‌روزرسانی کمتر به شمار خام "50+" و بیشتر به نحوه‌ای که خطی بین بلوک‌های ساخت عامل و محصولات عامل ترسیم می‌کند، مربوط می‌شود. این تمایز برای هر کسی که داستان‌های "عامل" را در ابزارهای مرتبط با کریپتو دنبال می‌کند، اهمیت دارد، جایی که یک چارچوب که ادغام‌ها را استاندارد می‌کند، می‌تواند از یک عامل نمایشی که در جلسات طولانی خراب می‌شود، پایدارتر باشد.

AIMultiple با "عامل‌محور" چه معنایی دارد: برنامه‌ریزی، حافظه، ابزارها و یک حلقه تکراری

چارچوب AIMultiple با یک مکانیزم آغاز می‌شود، نه یک نام تجاری. "یک عامل هوش مصنوعی یک سیستم ترکیبی است که برنامه‌ریزی، حافظه، استفاده از ابزار و اجرای تکراری را ترکیب می‌کند،" صفحه می‌گوید و یک حلقه ساختاریافته حول یک LLM را توصیف می‌کند که می‌تواند تصمیم‌گیری کند، اقداماتی انجام دهد و به اطلاعات جدید سازگار شود.

این همچنین ادعا نمی‌کند که این اصطلاح حل شده است. "هیچ تعریف توافق شده‌ای از آنچه که یک 'عامل هوش مصنوعی' را تشکیل می‌دهد وجود ندارد،" صفحه بیان می‌کند و به‌طور صریح از یک تعریف دقیق اجتناب می‌کند. در عوض، "عامل‌محور" را به عنوان یک طیف در نظر می‌گیرد و عواملی را که یک سیستم را بیشتر شبیه عامل می‌کند، فهرست می‌کند: کار در محیط‌های پیچیده با اهداف متغیر، نیاز به نظارت کمتر کاربر و استفاده از الگوهای طراحی مانند استفاده از ابزار و برنامه‌ریزی.

این چارچوب طیفی کار واقعی انجام می‌دهد. این بسیاری از بازاریابی را به مجموعه‌ای از ویژگی‌های قابل مشاهده کاهش می‌دهد: آیا سیستم در مراحل مختلف زمینه را حفظ می‌کند، آیا ابزارها را به‌طور شرطی انتخاب می‌کند، آیا عملیات چند مرحله‌ای را هماهنگ می‌کند و آیا کنترل جریان کار را زمانی که ورودی‌های جدید وارد می‌شوند حفظ می‌کند.

در عمل، این نقاطی هستند که سیستم‌های عامل شکست می‌خورند، زیرا مدیریت زمینه و ارکستراسیون جایی است که هزینه‌ها، تأخیر و مدیریت خطا جمع می‌شوند.

هنوز خودمختاری وجود ندارد: واقعیت انسان در حلقه و افت معیار 35 دقیقه‌ای

ادعای مرتبط‌ترین به تریدر در به‌روزرسانی همچنین کم‌زرق‌وبرق‌ترین است: "آیا این عوامل کاملاً خودمختار هستند؟ هنوز نه." AIMultiple استدلال می‌کند که بیشتر عوامل متن‌باز هنوز به ورودی‌های ساختاریافته و یک انسان در حلقه نیاز دارند، حتی زمانی که استفاده از ابزار و تصمیم‌گیری را بر روی یک LLM اضافه می‌کنند.

صفحه Devon و PR-Agent را به عنوان مثال‌هایی از سیستم‌هایی که اغلب به عنوان "عوامل" توصیف می‌شوند، اما به منطق از پیش تعریف شده یا جریان‌های یادگیری تقویتی نزدیک‌تر هستند، ذکر می‌کند. این تمایز برای ارزیابی داستان‌های توکن که به خودمختاری متن‌باز اشاره می‌کنند، مفید است، زیرا یک جریان کاری با مسیرهای کد ثابت رفتار بسیار متفاوتی از یک عامل که می‌تواند در وظایف و محیط‌ها تعمیم یابد، دارد.

AIMultiple همچنین یک نقطه داده قابل اعتماد مشخص را با یک نکته مهم اضافه می‌کند. "برای مثال، در معیارهای ما، مشاهده کردیم که نرخ موفقیت عوامل هوش مصنوعی پس از 35 دقیقه تعامل انسانی کاهش یافت." این گزیده شامل روش‌شناسی معیار، مجموعه وظایف یا جدول نتایج نمی‌شود، بنابراین علامت 35 دقیقه باید به عنوان یک مشاهده جهت‌دار درباره کاهش در جلسات طولانی خوانده شود نه یک آستانه جهانی.

توضیح صفحه در مورد اینکه چرا این اتفاق می‌افتد ساختاری است: سیستم‌های عاملی بار اضافی در مدیریت حافظه، ارکستراسیون ابزار، مدیریت خطا و حلقه‌های کنترل معرفی می‌کنند که باعث افزایش تأخیر و هزینه می‌شود. AIMultiple استدلال می‌کند که بسیاری از موارد استفاده بهتر با تولید تقویت‌شده با بازیابی (RAG) خدمت‌رسانی می‌شوند، جایی که مدل در زمان پرسش، اسناد مرتبط را بدون راه‌اندازی یک حلقه خودکار چند مرحله‌ای می‌کشد.

MCP و ACP استرایپ: استانداردسازی دسترسی به داده‌های عاملی و پرداخت عاملی

سیگنال رو به جلو در به‌روزرسانی استانداردسازی است. AIMultiple پروتکل زمینه مدل (MCP) را به عنوان "استاندارد صنعتی برای نحوه ارتباط عوامل با منابع داده خارجی" برچسب‌گذاری می‌کند و می‌گوید LangGraph MCP را ادغام می‌کند تا عوامل بتوانند با پایگاه‌های داده و ابزارهای محلی بدون نیاز به پوشش‌های سفارشی "وصل و بازی" کنند.

اگر این درست باشد، MCP کمتر به یک چارچوب واحد برنده مربوط می‌شود و بیشتر به کاهش کد چسبنده سفارشی در سراسر انبوه عوامل مربوط می‌شود. برای سازندگان، این به معنای آن است که تعویض ابزارها و منابع داده به پیکربندی نزدیک‌تر از کار یکپارچه‌سازی می‌شود. برای بازارها، این نوع لوله‌کشی می‌تواند "عوامل" را از دموهای یک‌باره به زیرساخت‌های تکراری تبدیل کند.

استاندارد دیگری که مورد تأکید قرار گرفته، تجارت بومی است. AIMultiple "پروتکل تجارت عاملی استرایپ (ACP)" را به عنوان "اولین استاندارد زنده صنعتی که به عوامل هوش مصنوعی اجازه می‌دهد پرداخت‌ها، موجودی و حمل و نقل را به‌طور ایمن مدیریت کنند" توصیف می‌کند و اضافه می‌کند که این امکان را فراهم می‌کند تا "پرداخت عاملی"، جایی که یک عامل خرید را برای یک کاربر در یک رابط چت کامل می‌کند.

دو مورد قابل توجه از این چارچوب خارج می‌شوند. اول، اینکه آیا پذیرش MCP فراتر از اکوسیستم LangGraph به سایر چارچوب‌های عمده عوامل گسترش می‌یابد، که می‌تواند به عنوان یک نماینده برای تبدیل آن به یک لایه رابط غیررسمی باشد. دوم، اینکه آیا ACP استرایپ از مستندات به مراجع شریک و محصول قابل مشاهده‌ای که نشان‌دهنده پذیرش واقعی بازرگان و عامل است، منتقل می‌شود.

یک ادعا در صفحه همچنین به تأیید مستقل نیاز دارد قبل از اینکه به عنوان ورودی قطعی تلقی شود: بیانیه‌ای که می‌گوید Manus AI "توسط متا خریداری شده است" و به اکوسیستم "هوش محیطی شخصی" متا ادغام می‌شود. این بخش هیچ تاریخ معامله، شرایط یا مستندات اصلی ارائه نمی‌دهد، بنابراین بهترین خوانش این است که این در مواد ارائه شده تأیید نشده است.

چرا این برای روایت‌های AI-Crypto مهم است

آستانه‌ای که در اینجا مهم است این است که آیا استانداردها از دموها پیشی می‌گیرند. یک لیست انتخاب شده از "50+ عامل" مفید است، اما تغییر پایدار MCP و ACP است که به عنوان رابط‌هایی قاب‌بندی می‌شوند که به عوامل اجازه می‌دهند به‌طور قابل‌اعتماد به داده‌ها دسترسی پیدا کنند و تجارت را بدون یکپارچه‌سازی‌های سفارشی هر بار اجرا کنند.

اگر چارچوب‌های بیشتری پشتیبانی از MCP را در سطح اول ارائه دهند و ACP استرایپ شروع به نمایش در جریان‌های واقعی پرداخت کند، "عاملی" دیگر یک داستان رابط کاربری نخواهد بود و به یک داستان ابتدایی تبدیل می‌شود.

آزمایش واقعی این است که آیا قابلیت اطمینان با طول و پیچیدگی جلسه مقیاس می‌یابد، زیرا یادداشت معیار AIMultiple خود می‌گوید که نرخ موفقیت پس از 35 دقیقه تعامل انسانی کاهش یافته است. بدون روش‌شناسی کامل، آن نقطه داده یک قانون نیست، اما یک برچسب هشدار است.

اگر AIMultiple جزئیات معیار کامل‌تری منتشر کند و آزمایش‌های مستقل کاهش طول جلسه را بازتولید کنند، بازار باید "عوامل کاملاً خودکار متن‌باز" را به عنوان روایت در نظر بگیرد تا زمانی که حالت شکست در سیستم‌های تولیدی مهندسی شود.

منابع