هوش مصنوعی عمومی AGI چیست؟ معیارها، معماریهای محتمل، ایمنی و وضعیت ۲۰۲۶
این مقاله بخشی از مجموعه «انواع هوش مصنوعی» است. بازگشت به راهنمای جامع ANI، AGI و ASI.
مقدمه
AGI مخفف Artificial General Intelligence است و معمولاً به سامانهای اشاره میکند که بتواند در دامنهای بسیار گسترده از وظایف شناختی یاد بگیرد، استدلال کند، دانش را منتقل کند و با موقعیتهای تازه سازگار شود. مشکل اصلی این تعریف واژه «عمومی» است: انسانها نیز تواناییهای ناهمگون دارند و هیچ مرز عددی واحدی وجود ندارد که همه پژوهشگران بر اساس آن بگویند AGI در یک نقطه مشخص آغاز شده است.
به همین دلیل در سالهای اخیر پژوهشگران بهجای یک آزمون جادویی، به چارچوبهای چندبعدی توجه بیشتری کردهاند. یک سامانه ممکن است در ریاضیات بسیار قوی، در برنامهریزی بلندمدت متوسط، در یادگیری از تجربه ضعیف و در تعامل فیزیکی محدود باشد. برچسب AGI بدون گزارش این پروفایل میتواند گمراهکننده باشد.
تعریف AGI و جایگاه آن در هوش مصنوعی
AGI امروز بهتر است «هدف پژوهشی و چارچوب ارزیابی» دانسته شود تا نام یک محصول قطعی. شرکتها و آزمایشگاهها تعریفهای متفاوتی دارند؛ برخی بر توانایی اقتصادی، برخی بر سطح انسان در اغلب کارهای شناختی، برخی بر یادگیری مهارت جدید و برخی بر خودمختاری تأکید میکنند. بنابراین هر ادعای AGI باید همراه با تعریف عملیاتی، نسخه مدل، دامنه آزمون و شواهد مستقل باشد.
از دید فنی، AGI الزاماً یک مدل منفرد نیست. ممکن است از مدل پایه چندوجهی، حافظه، ابزار، جستوجو، یادگیری مستمر، برنامهریز، عاملهای تخصصی و لایههای کنترل تشکیل شود. حتی فرضیه «AGI وصلهای یا توزیعشده» مطرح است که در آن رفتار عمومی از همکاری چند سامانه تخصصی پدید میآید.
این نقشه مفهومی نشان میدهد که تحلیل AGI باید از دامنه ورودی و معماری تا ارزیابی، محدودیت و نظارت انسانی را یکپارچه ببیند.
سازوکار، معماری و مؤلفههای کلیدی
یک معماری محتمل برای سامانههای عمومیتر شامل مدل جهان یا representation غنی، حافظه کوتاهمدت و بلندمدت، برنامهریزی چندمرحلهای، استفاده از ابزار، یادگیری از بازخورد و سازوکار خودارزیابی است. با این حال اضافه کردن این اجزا به یک مدل بهتنهایی AGI ایجاد نمیکند؛ مسئله اصلی عملکرد پایدار و تعمیم در مجموعه بزرگی از محیطهاست.
تعمیم باید در چند سطح آزمون شود: تغییر سطحی ورودی، تغییر توزیع، ترکیب مهارتهای آموختهشده، انتقال به وظیفه جدید و یادگیری با نمونه کم. سامانهای که فقط روی benchmarkهای آشنا عالی است ممکن است در مسئله تازه یا شرایط خصمانه شکست بخورد.
خودمختاری نیز محور مستقلی است. یک مدل میتواند بسیار توانمند باشد اما فقط با تأیید انسان عمل کند؛ یا مدلی متوسط میتواند به ابزارهای قدرتمند دسترسی خودکار داشته باشد. ارزیابی AGI باید این دو را جداگانه گزارش کند زیرا ریسک استقرار بیشتر تابع ترکیب قابلیت، دسترسی و خودمختاری است.
ورودیها، مؤلفهها و معیارهای ارزیابی
- تعریف دقیق دامنه و هدف برای AGI؛ چه چیزی داخل دامنه و چه چیزی خارج از دامنه است.
- داده، ابزار و حافظه موردنیاز، همراه با سیاست دسترسی و کیفیت منبع.
- معیارهای قابلیت مانند دقت، استدلال، تعمیم، پایداری، خودمختاری و نرخ شکست.
- معیارهای عملیاتی مانند Latency، Throughput، هزینه، مصرف حافظه و انرژی.
- کنترلهای ایمنی شامل Human-in-the-loop، ثبت رویداد، محدودسازی ابزار و مسیر توقف.
ترجمه و بازنویسی تازه از منابع انگلیسی ۲۰۲۶
در ۱۷ مارس ۲۰۲۶، Google DeepMind چارچوبی شناختی برای اندازهگیری پیشرفت به سوی AGI معرفی کرد. بازنویسی فارسی پیام اصلی آن این است که پیشرفت باید روی مجموعهای از تواناییهای شناختی و وظایف متنوع سنجیده شود، نه با یک برچسب صفر و یکی. چنین رویکردی امکان میدهد نقاط قوت و ضعف هر سیستم بهصورت پروفایل دیده شود.
AI Index 2026 استنفورد نیز نشان میدهد مدلهای مرزی در برخی آزمونهای علمی، ریاضی، چندوجهی و کدنویسی جهش بزرگی داشتهاند. با این حال اشباع شدن benchmarkها خود یک مشکل ارزیابی است: وقتی مدلها به سقف آزمون نزدیک میشوند، آزمون دیگر قدرت تفکیک کافی ندارد و نیاز به سناریوهای تازه، سختتر و مقاوم به آلودگی داده بیشتر میشود.
پژوهش Distributional AGI Safety در اواخر ۲۰۲۵ هشدار میدهد که نباید فقط منتظر یک «مدل واحد AGI» بود. شبکهای از عاملهای زیرسطح AGI که ابزار دارند، با یکدیگر معامله اطلاعات میکنند و وظایف را تقسیم میکنند، ممکن است در مجموع رفتار بسیار عمومی ایجاد کند. این دیدگاه برای امنیت مهم است چون مرز سیستم دیگر یک مدل منفرد نیست.
چارچوبهای ایمنی مرزی در ۲۰۲۵ و ۲۰۲۶ نیز بیشتر بر capability thresholds، ارزیابی ریسک و اقدامات متناسب با سطح توانایی تمرکز کردهاند. پیام عملی برای مهندسان این است که ارزیابی قابلیت باید به تصمیم استقرار و کنترلهای امنیتی متصل شود، نه اینکه فقط در گزارش پژوهشی باقی بماند.
در جریان بالا، AGI بهصورت یک زنجیره قابل ارزیابی دیده میشود: داده و مسئله، پردازش، آزمون، تصمیم و کنترل ریسک. این نگاه از قضاوت صرفاً تبلیغاتی جلوگیری میکند.
مثالهای عملی
مثال 1: انتقال مهارت از کدنویسی به تحلیل داده
سامانهای که مفهوم الگوریتم را در کدنویسی آموخته باید بتواند آن را در تحلیل دادهای تازه بهکار گیرد، نه اینکه فقط الگوهای مشابه را تکرار کند.
| ورودی یا وضعیت | نتیجه مورد انتظار | نکته تصمیمگیری |
|---|
| وظیفه آشنا | حل صحیح | Baseline |
| وظیفه ترکیبی جدید | انتقال مفهوم | شاهد قویتر برای generality |
انتقال واقعی باید با داده و prompt کنترلشده آزمون شود تا حفظ شدن پاسخها با استدلال اشتباه نشود.
مثال 2: یادگیری یک بازی جدید از قوانین
سامانه فقط قوانین متنی یک بازی ناشناخته را میگیرد و باید با چند تجربه استراتژی بسازد.
| ورودی یا وضعیت | نتیجه مورد انتظار | نکته تصمیمگیری |
|---|
| قواعد اولیه | عملکرد مبتدی | طبیعی |
| چند دور تجربه | بهبود پایدار | Learning efficiency |
سرعت یادگیری و انتقال استراتژی به بازی مشابه، معیار مهمتری از یک برد منفرد است.
مثال 3: پژوهش چندمرحلهای علمی
عامل باید سؤال پژوهشی را به جستوجو، طراحی آزمایش، تحلیل و نقد تقسیم کند.
| ورودی یا وضعیت | نتیجه مورد انتظار | نکته تصمیمگیری |
|---|
| منابع سازگار | فرضیه مستند | موفقیت جزئی |
| شواهد متناقض | بازنگری فرضیه | Self-correction |
توانایی تغییر نظر بر اساس شواهد برای سیستم عمومی مهمتر از تولید پاسخ روان است.
مثال 4: برنامهریزی سفر با محدودیتهای تازه
سامانه باید بودجه، ویزا، زمان، ترجیحات و اختلال ناگهانی را همزمان مدیریت کند.
| ورودی یا وضعیت | نتیجه مورد انتظار | نکته تصمیمگیری |
|---|
| برنامه پایدار | برنامه اولیه | Planning |
| لغو پرواز | بازبرنامهریزی | Adaptation |
این سناریو چندمهارتی است و توانایی سازگاری با تغییر را آزمایش میکند.
مثال 5: عامل نرمافزاری با ابزار
عامل کد مینویسد، تست اجرا میکند، خطا را میخواند و patch تولید میکند.
| ورودی یا وضعیت | نتیجه مورد انتظار | نکته تصمیمگیری |
|---|
| تست پاس | پیشنهاد merge | کنترلشده |
| دسترسی حساس | نیاز به approval | Autonomy boundary |
توانایی ابزارمحور باید جدا از سطح هوش خام سنجیده شود.
مثال 6: داده مبهم و ناسازگار
سامانه چند منبع با اعداد متفاوت دریافت میکند و باید عدم قطعیت را گزارش کند.
| ورودی یا وضعیت | نتیجه مورد انتظار | نکته تصمیمگیری |
|---|
| منابع همسو | جمعبندی | Confidence بالا |
| منابع متناقض | ذکر اختلاف | Calibration |
AGI قابل اعتماد نباید اختلاف را با ساختن عدد واحد پنهان کند.
مثال 7: حالت مرزی: دستور جدید خارج از آموزش
وظیفهای طراحی میشود که ترکیب قواعد آن در داده benchmark شناختهشده وجود ندارد.
| ورودی یا وضعیت | نتیجه مورد انتظار | نکته تصمیمگیری |
|---|
| الگوی آشنا | موفقیت | کمارزش برای سنجش عمومی |
| ترکیب نو | حل یا یادگیری | آزمون تعمیم |
Benchmark نو باید احتمال آلودگی و حفظ پاسخ را کاهش دهد.
مثال 8: سناریوی سازمانی چنددپارتمانی
سامانه باید مسئلهای را میان مالی، حقوقی و فنی تقسیم کند و تضاد اهداف را مدیریت کند.
| ورودی یا وضعیت | نتیجه مورد انتظار | نکته تصمیمگیری |
|---|
| هدف روشن | تقسیم کار | Coordination |
| تعارض سیاستها | ارجاع و مذاکره | Governance |
عمومیت سازمانی نیازمند فهم محدودیت و قدرت توقف است، نه فقط تولید سریع پاسخ.
مثال 9: روش اشتباه: اعلام AGI با یک رکورد benchmark
یک شرکت با امتیاز بالا در یک آزمون ادعا میکند AGI ساخته است.
| ورودی یا وضعیت | نتیجه مورد انتظار | نکته تصمیمگیری |
|---|
| یک benchmark | رکورد بالا | شواهد ناکافی |
| پروفایل چنددامنهای مستقل | ارزیابی جامعتر | نسخه اصلاحشده |
تعریف عملیاتی و ارزیابی مستقل باید قبل از برچسبگذاری ارائه شود.
مثال 10: Performance در عامل عمومی
سامانه برای هر کار از بزرگترین مدل استفاده میکند و هزینه و latency بالا میرود.
| ورودی یا وضعیت | نتیجه مورد انتظار | نکته تصمیمگیری |
|---|
| کار ساده | مدل کوچک یا cache | Routing |
| کار پیچیده | مدل قوی + ابزار | Adaptive compute |
هوشمندی سیستم میتواند در تخصیص محاسبه نیز باشد؛ همه درخواستها به یک مسیر گران نیاز ندارند.
خطاهای رایج و Failure Modeها
خطای رایج نخست Anthropomorphism است: روان بودن زبان، شوخطبعی یا لحن مطمئن بهاشتباه بهعنوان شواهد فهم انسانی تفسیر میشود. ارزیابی باید بر رفتار قابل تکرار و آزمون کنترلشده تکیه کند.
خطای دوم Benchmark Overfitting است. داده آزمون میتواند به شکل مستقیم یا غیرمستقیم وارد آموزش شده باشد، یا توسعهدهندگان بارها بر اساس همان benchmark مدل را تنظیم کرده باشند. آزمونهای خصوصی و تازه برای ادعاهای بزرگ ضروریاند.
خطای سوم ترکیب capability با agency است. دسترسی به shell، مرورگر و پرداخت میتواند اثر سامانه را چند برابر کند حتی اگر مدل پایه تغییر نکرده باشد. امنیت باید بر کل سیستم عاملمحور اعمال شود.
نکات Performance و مقیاسپذیری
Performance در AGI فقط سرعت پاسخ نیست. باید هزینه هر درخواست، مصرف GPU/CPU، حافظه، زمان صف، نرخ خطا، کیفیت در بار بالا و هزینه نظارت انسانی را همزمان اندازه گرفت. بهینهسازی کورکورانه Latency ممکن است کیفیت، ایمنی یا قابلیت توضیح را کاهش دهد؛ بنابراین معیارها باید به هدف کسبوکار و سطح ریسک متصل باشند.
برای سامانههای مبتنی بر مدلهای بزرگ، تکنیکهایی مانند batching، caching، quantization، routing میان مدل کوچک و بزرگ، محدودکردن context و استفاده انتخابی از ابزار میتوانند هزینه را کاهش دهند. اما هر بهینهسازی باید دوباره روی کیفیت، امنیت و دادههای خارج از توزیع اعتبارسنجی شود.
نمودار تصمیم AGI نشان میدهد استقرار موفق زمانی رخ میدهد که معیار پذیرش، تعمیم، Performance، ایمنی و بازبینی انسانی بهصورت یک سیستم کنترلشده طراحی شوند.
بهترین روشها
- AGI را با یک تعریف عملیاتی و مجموعه معیارهای شفاف ارزیابی کنید.
- Generality، Performance و Autonomy را بهصورت محورهای جدا گزارش کنید.
- از benchmarkهای تازه، ضدآلودگی و ارزیابی انسانی مستقل استفاده کنید.
- توانایی امتناع، گزارش عدم قطعیت و خودتصحیحی را بسنجید.
- دسترسی به ابزار را مرحلهای و مبتنی بر حداقل اختیار طراحی کنید.
- برای قابلیتهای پرریسک، trigger و mitigation از پیش تعریف کنید.
- آزمایشهای red-team و adversarial را بخشی از چرخه توسعه قرار دهید.
- ادعاهای AGI را با تاریخ، نسخه و محدودیتهای دقیق منتشر کنید.
سؤالات متداول
AGI دقیقاً چیست؟
AGI مفهوم سامانهای با توانایی عمومی برای یادگیری، استدلال و انتقال مهارت در دامنههای گسترده است، اما تعریف واحد و پذیرفتهشده جهانی ندارد.
آیا AGI در ۲۰۲۶ ساخته شده است؟
ادعاها و تعریفها متفاوتاند و اجماع علمی عمومی درباره تحقق قطعی AGI وجود ندارد؛ باید هر ادعا را با معیار و شواهد همان تعریف سنجید.
AGI چه ارزش تجاری دارد؟
در صورت تحقق پایدار، میتواند کارهای چنددامنهای و پیچیده را خودکار کند، اما هزینه، امنیت، حقوق و قابلیت اطمینان تعیینکننده ارزش واقعی خواهند بود.
آیا شرکتها باید منتظر AGI بمانند؟
خیر. بسیاری از مسائل امروز با ANI، مدلهای موجود، RAG و automation حل میشوند و انتظار برای یک فناوری تعریفنشده معمولاً منطقی نیست.
تفاوت AGI و مدل زبانی چیست؟
مدل زبانی یک نوع معماری یا مدل است؛ AGI سطحی از عمومیت و قابلیت است. یک LLM ممکن است بخشی از یک سیستم AGI فرضی باشد ولی این دو اصطلاح مترادف نیستند.
برای ارزیابی سیستمهای عمومی چه خدماتی لازم است؟
طراحی benchmark اختصاصی، red-team، ارزیابی امنیت، سنجش latency/cost، تست ابزار و طراحی governance از خدمات کلیدی است.
رایجترین خطای ارزیابی AGI چیست؟
تکیه بر یک benchmark، یک دمو یا self-report مدل و نادیده گرفتن داده آغشته، failure mode و ارزیابی مستقل.
Performance AGI چگونه سنجیده میشود؟
علاوه بر کیفیت، باید پایداری در وظایف تازه، هزینه محاسبه، زمان، نرخ مداخله انسان و قابلیت بازیابی از خطا سنجیده شود.
Best Practice برای عاملهای عمومیتر چیست؟
sandbox، least privilege، approval برای اقدامات حساس، budget cap، logging و امکان توقف فوری از اصول اصلیاند.
نسخه مدل چه اثری بر ادعای AGI دارد؟
تغییر نسخه میتواند قابلیتها و failure modeها را عوض کند؛ هر نتیجه باید دقیقاً به نسخه و تاریخ مشخص متصل باشد.
سؤالات مصاحبه
سؤال 1: چرا تعریف AGI دشوار است؟
چون عمومیت و سطح انسان چندبعدیاند و انسانها نیز در مهارتها متفاوتاند؛ یک عدد واحد این پیچیدگی را پوشش نمیدهد.
سؤال 2: Generality و Autonomy چه تفاوتی دارند؟
Generality گستره قابلیت است؛ Autonomy میزان عمل مستقل بدون تأیید مستمر انسان است.
سؤال 3: چگونه benchmark contamination را کاهش میدهید؟
با مجموعههای تازه و خصوصی، زمانبندی پس از cutoff آموزش و آزمونهای پویا و مولد.
سؤال 4: Patchwork AGI چه ریسکی دارد؟
رفتار عمومی ممکن است از تعامل چند عامل پدید آید و کنترل یک مدل منفرد برای مهار کل سیستم کافی نباشد.
سؤال 5: مهمترین معیار یک AGI قابل اعتماد چیست؟
هیچ معیار واحدی کافی نیست؛ قابلیت، تعمیم، calibration، امنیت، کنترلپذیری و رفتار در failure باید همزمان سنجیده شوند.
چکلیست نهایی
- تعریف مسئله و مرز دامنه مستند شده است.
- نسخه مدل، داده، ابزار و وابستگیها ثبت شدهاند.
- آزمون مستقل برای حالت عادی، مرزی و خارج از توزیع وجود دارد.
- معیارهای کیفیت، هزینه، تأخیر و ریسک قبل از استقرار تعیین شدهاند.
- دسترسیها حداقلیاند و مسیر توقف امن وجود دارد.
- پایش پس از استقرار و بازبینی دورهای تعریف شده است.
جمعبندی
AGI در ۲۰۲۶ بیش از آنکه یک نام تجاری روشن باشد، مسئلهای برای تعریف، سنجش و ایمنی است. بهترین رویکرد این است که ادعاهای بزرگ را به مجموعهای از تواناییهای قابل آزمون، تعمیم واقعی، خودمختاری کنترلشده و ریسکهای قابل اندازهگیری تبدیل کنیم. هر سامانه عمومیتر باید نه فقط با «چه کارهایی میتواند انجام دهد»، بلکه با «کجا شکست میخورد و چگونه مهار میشود» توصیف شود.
بازگشت به مقاله مادر: انواع هوش مصنوعی ANI، AGI و ASI