AGI چیست؟ هوش مصنوعی عمومی، معیارهای سنجش و وضعیت واقعی در ۲۰۲۶

هوش مصنوعی عمومی AGI چیست؟ معیارها، معماری‌های محتمل، ایمنی و وضعیت ۲۰۲۶

توسط admin | گروه هوش مصنوعی | 1405/05/01

نظرات 0

هوش مصنوعی عمومی AGI چیست؟ معیارها، معماری‌های محتمل، ایمنی و وضعیت ۲۰۲۶

این مقاله بخشی از مجموعه «انواع هوش مصنوعی» است. بازگشت به راهنمای جامع ANI، AGI و ASI.

مقدمه

AGI مخفف Artificial General Intelligence است و معمولاً به سامانه‌ای اشاره می‌کند که بتواند در دامنه‌ای بسیار گسترده از وظایف شناختی یاد بگیرد، استدلال کند، دانش را منتقل کند و با موقعیت‌های تازه سازگار شود. مشکل اصلی این تعریف واژه «عمومی» است: انسان‌ها نیز توانایی‌های ناهمگون دارند و هیچ مرز عددی واحدی وجود ندارد که همه پژوهشگران بر اساس آن بگویند AGI در یک نقطه مشخص آغاز شده است.

به همین دلیل در سال‌های اخیر پژوهشگران به‌جای یک آزمون جادویی، به چارچوب‌های چندبعدی توجه بیشتری کرده‌اند. یک سامانه ممکن است در ریاضیات بسیار قوی، در برنامه‌ریزی بلندمدت متوسط، در یادگیری از تجربه ضعیف و در تعامل فیزیکی محدود باشد. برچسب AGI بدون گزارش این پروفایل می‌تواند گمراه‌کننده باشد.

تعریف AGI و جایگاه آن در هوش مصنوعی

AGI امروز بهتر است «هدف پژوهشی و چارچوب ارزیابی» دانسته شود تا نام یک محصول قطعی. شرکت‌ها و آزمایشگاه‌ها تعریف‌های متفاوتی دارند؛ برخی بر توانایی اقتصادی، برخی بر سطح انسان در اغلب کارهای شناختی، برخی بر یادگیری مهارت جدید و برخی بر خودمختاری تأکید می‌کنند. بنابراین هر ادعای AGI باید همراه با تعریف عملیاتی، نسخه مدل، دامنه آزمون و شواهد مستقل باشد.

از دید فنی، AGI الزاماً یک مدل منفرد نیست. ممکن است از مدل پایه چندوجهی، حافظه، ابزار، جست‌وجو، یادگیری مستمر، برنامه‌ریز، عامل‌های تخصصی و لایه‌های کنترل تشکیل شود. حتی فرضیه «AGI وصله‌ای یا توزیع‌شده» مطرح است که در آن رفتار عمومی از همکاری چند سامانه تخصصی پدید می‌آید.

نقشه مفهومی و معماری AGIنمای برداری از اجزای اصلی، جریان داده، ارزیابی و کنترل در AGI AGI Novel Task ورودی و دامنه مسئله Generalist Core Memory + Tools هسته پردازش و استدلال Cross-domain Action خروجی و کنش Cognitive Eval ارزیابی Misalignment محدودیت و Failure Mode Human Oversight بازبینی، کنترل و بازخورد Safety Gate سیاست، امنیت و توقف معماری معتبر باید دامنه، معیار موفقیت، نظارت انسانی و محدودیت‌های AGI را هم‌زمان مدل کند.

این نقشه مفهومی نشان می‌دهد که تحلیل AGI باید از دامنه ورودی و معماری تا ارزیابی، محدودیت و نظارت انسانی را یکپارچه ببیند.

سازوکار، معماری و مؤلفه‌های کلیدی

یک معماری محتمل برای سامانه‌های عمومی‌تر شامل مدل جهان یا representation غنی، حافظه کوتاه‌مدت و بلندمدت، برنامه‌ریزی چندمرحله‌ای، استفاده از ابزار، یادگیری از بازخورد و سازوکار خودارزیابی است. با این حال اضافه کردن این اجزا به یک مدل به‌تنهایی AGI ایجاد نمی‌کند؛ مسئله اصلی عملکرد پایدار و تعمیم در مجموعه بزرگی از محیط‌هاست.

تعمیم باید در چند سطح آزمون شود: تغییر سطحی ورودی، تغییر توزیع، ترکیب مهارت‌های آموخته‌شده، انتقال به وظیفه جدید و یادگیری با نمونه کم. سامانه‌ای که فقط روی benchmarkهای آشنا عالی است ممکن است در مسئله تازه یا شرایط خصمانه شکست بخورد.

خودمختاری نیز محور مستقلی است. یک مدل می‌تواند بسیار توانمند باشد اما فقط با تأیید انسان عمل کند؛ یا مدلی متوسط می‌تواند به ابزارهای قدرتمند دسترسی خودکار داشته باشد. ارزیابی AGI باید این دو را جداگانه گزارش کند زیرا ریسک استقرار بیشتر تابع ترکیب قابلیت، دسترسی و خودمختاری است.

ورودی‌ها، مؤلفه‌ها و معیارهای ارزیابی

  • تعریف دقیق دامنه و هدف برای AGI؛ چه چیزی داخل دامنه و چه چیزی خارج از دامنه است.
  • داده، ابزار و حافظه موردنیاز، همراه با سیاست دسترسی و کیفیت منبع.
  • معیارهای قابلیت مانند دقت، استدلال، تعمیم، پایداری، خودمختاری و نرخ شکست.
  • معیارهای عملیاتی مانند Latency، Throughput، هزینه، مصرف حافظه و انرژی.
  • کنترل‌های ایمنی شامل Human-in-the-loop، ثبت رویداد، محدودسازی ابزار و مسیر توقف.

ترجمه و بازنویسی تازه از منابع انگلیسی ۲۰۲۶

در ۱۷ مارس ۲۰۲۶، Google DeepMind چارچوبی شناختی برای اندازه‌گیری پیشرفت به سوی AGI معرفی کرد. بازنویسی فارسی پیام اصلی آن این است که پیشرفت باید روی مجموعه‌ای از توانایی‌های شناختی و وظایف متنوع سنجیده شود، نه با یک برچسب صفر و یکی. چنین رویکردی امکان می‌دهد نقاط قوت و ضعف هر سیستم به‌صورت پروفایل دیده شود.

AI Index 2026 استنفورد نیز نشان می‌دهد مدل‌های مرزی در برخی آزمون‌های علمی، ریاضی، چندوجهی و کدنویسی جهش بزرگی داشته‌اند. با این حال اشباع شدن benchmarkها خود یک مشکل ارزیابی است: وقتی مدل‌ها به سقف آزمون نزدیک می‌شوند، آزمون دیگر قدرت تفکیک کافی ندارد و نیاز به سناریوهای تازه، سخت‌تر و مقاوم به آلودگی داده بیشتر می‌شود.

پژوهش Distributional AGI Safety در اواخر ۲۰۲۵ هشدار می‌دهد که نباید فقط منتظر یک «مدل واحد AGI» بود. شبکه‌ای از عامل‌های زیرسطح AGI که ابزار دارند، با یکدیگر معامله اطلاعات می‌کنند و وظایف را تقسیم می‌کنند، ممکن است در مجموع رفتار بسیار عمومی ایجاد کند. این دیدگاه برای امنیت مهم است چون مرز سیستم دیگر یک مدل منفرد نیست.

چارچوب‌های ایمنی مرزی در ۲۰۲۵ و ۲۰۲۶ نیز بیشتر بر capability thresholds، ارزیابی ریسک و اقدامات متناسب با سطح توانایی تمرکز کرده‌اند. پیام عملی برای مهندسان این است که ارزیابی قابلیت باید به تصمیم استقرار و کنترل‌های امنیتی متصل شود، نه اینکه فقط در گزارش پژوهشی باقی بماند.

جریان اجرا و ورودی تا خروجی AGIفلوچارت فنی پنج مرحله‌ای برای پردازش، ارزیابی و بازخورد در AGI Data / Decision Flow — AGI Novel Problemمرحله 1Reason & Planمرحله 2Tool Useمرحله 3Transfer Skillمرحله 4Safety Gateمرحله 5 Quality Checkدقت، تعمیم، خطای توزیع Cost & Latencyهزینه، تأخیر، مقیاس‌پذیری Risk Reviewایمنی، حریم خصوصی، سوءاستفاده بازخورد ارزیابی باید به طراحی، داده و محدودسازی AGI برگردد؛ نه اینکه فقط یک امتیاز نهایی تولید کند.

در جریان بالا، AGI به‌صورت یک زنجیره قابل ارزیابی دیده می‌شود: داده و مسئله، پردازش، آزمون، تصمیم و کنترل ریسک. این نگاه از قضاوت صرفاً تبلیغاتی جلوگیری می‌کند.

مثال‌های عملی

مثال 1: انتقال مهارت از کدنویسی به تحلیل داده

سامانه‌ای که مفهوم الگوریتم را در کدنویسی آموخته باید بتواند آن را در تحلیل داده‌ای تازه به‌کار گیرد، نه اینکه فقط الگوهای مشابه را تکرار کند.

ورودی یا وضعیتنتیجه مورد انتظارنکته تصمیم‌گیری
وظیفه آشناحل صحیحBaseline
وظیفه ترکیبی جدیدانتقال مفهومشاهد قوی‌تر برای generality

انتقال واقعی باید با داده و prompt کنترل‌شده آزمون شود تا حفظ شدن پاسخ‌ها با استدلال اشتباه نشود.

مثال 2: یادگیری یک بازی جدید از قوانین

سامانه فقط قوانین متنی یک بازی ناشناخته را می‌گیرد و باید با چند تجربه استراتژی بسازد.

ورودی یا وضعیتنتیجه مورد انتظارنکته تصمیم‌گیری
قواعد اولیهعملکرد مبتدیطبیعی
چند دور تجربهبهبود پایدارLearning efficiency

سرعت یادگیری و انتقال استراتژی به بازی مشابه، معیار مهم‌تری از یک برد منفرد است.

مثال 3: پژوهش چندمرحله‌ای علمی

عامل باید سؤال پژوهشی را به جست‌وجو، طراحی آزمایش، تحلیل و نقد تقسیم کند.

ورودی یا وضعیتنتیجه مورد انتظارنکته تصمیم‌گیری
منابع سازگارفرضیه مستندموفقیت جزئی
شواهد متناقضبازنگری فرضیهSelf-correction

توانایی تغییر نظر بر اساس شواهد برای سیستم عمومی مهم‌تر از تولید پاسخ روان است.

مثال 4: برنامه‌ریزی سفر با محدودیت‌های تازه

سامانه باید بودجه، ویزا، زمان، ترجیحات و اختلال ناگهانی را هم‌زمان مدیریت کند.

ورودی یا وضعیتنتیجه مورد انتظارنکته تصمیم‌گیری
برنامه پایداربرنامه اولیهPlanning
لغو پروازبازبرنامه‌ریزیAdaptation

این سناریو چندمهارتی است و توانایی سازگاری با تغییر را آزمایش می‌کند.

مثال 5: عامل نرم‌افزاری با ابزار

عامل کد می‌نویسد، تست اجرا می‌کند، خطا را می‌خواند و patch تولید می‌کند.

ورودی یا وضعیتنتیجه مورد انتظارنکته تصمیم‌گیری
تست پاسپیشنهاد mergeکنترل‌شده
دسترسی حساسنیاز به approvalAutonomy boundary

توانایی ابزارمحور باید جدا از سطح هوش خام سنجیده شود.

مثال 6: داده مبهم و ناسازگار

سامانه چند منبع با اعداد متفاوت دریافت می‌کند و باید عدم قطعیت را گزارش کند.

ورودی یا وضعیتنتیجه مورد انتظارنکته تصمیم‌گیری
منابع همسوجمع‌بندیConfidence بالا
منابع متناقضذکر اختلافCalibration

AGI قابل اعتماد نباید اختلاف را با ساختن عدد واحد پنهان کند.

مثال 7: حالت مرزی: دستور جدید خارج از آموزش

وظیفه‌ای طراحی می‌شود که ترکیب قواعد آن در داده benchmark شناخته‌شده وجود ندارد.

ورودی یا وضعیتنتیجه مورد انتظارنکته تصمیم‌گیری
الگوی آشناموفقیتکم‌ارزش برای سنجش عمومی
ترکیب نوحل یا یادگیریآزمون تعمیم

Benchmark نو باید احتمال آلودگی و حفظ پاسخ را کاهش دهد.

مثال 8: سناریوی سازمانی چنددپارتمانی

سامانه باید مسئله‌ای را میان مالی، حقوقی و فنی تقسیم کند و تضاد اهداف را مدیریت کند.

ورودی یا وضعیتنتیجه مورد انتظارنکته تصمیم‌گیری
هدف روشنتقسیم کارCoordination
تعارض سیاست‌هاارجاع و مذاکرهGovernance

عمومیت سازمانی نیازمند فهم محدودیت و قدرت توقف است، نه فقط تولید سریع پاسخ.

مثال 9: روش اشتباه: اعلام AGI با یک رکورد benchmark

یک شرکت با امتیاز بالا در یک آزمون ادعا می‌کند AGI ساخته است.

ورودی یا وضعیتنتیجه مورد انتظارنکته تصمیم‌گیری
یک benchmarkرکورد بالاشواهد ناکافی
پروفایل چنددامنه‌ای مستقلارزیابی جامع‌ترنسخه اصلاح‌شده

تعریف عملیاتی و ارزیابی مستقل باید قبل از برچسب‌گذاری ارائه شود.

مثال 10: Performance در عامل عمومی

سامانه برای هر کار از بزرگ‌ترین مدل استفاده می‌کند و هزینه و latency بالا می‌رود.

ورودی یا وضعیتنتیجه مورد انتظارنکته تصمیم‌گیری
کار سادهمدل کوچک یا cacheRouting
کار پیچیدهمدل قوی + ابزارAdaptive compute

هوشمندی سیستم می‌تواند در تخصیص محاسبه نیز باشد؛ همه درخواست‌ها به یک مسیر گران نیاز ندارند.

خطاهای رایج و Failure Modeها

خطای رایج نخست Anthropomorphism است: روان بودن زبان، شوخ‌طبعی یا لحن مطمئن به‌اشتباه به‌عنوان شواهد فهم انسانی تفسیر می‌شود. ارزیابی باید بر رفتار قابل تکرار و آزمون کنترل‌شده تکیه کند.

خطای دوم Benchmark Overfitting است. داده آزمون می‌تواند به شکل مستقیم یا غیرمستقیم وارد آموزش شده باشد، یا توسعه‌دهندگان بارها بر اساس همان benchmark مدل را تنظیم کرده باشند. آزمون‌های خصوصی و تازه برای ادعاهای بزرگ ضروری‌اند.

خطای سوم ترکیب capability با agency است. دسترسی به shell، مرورگر و پرداخت می‌تواند اثر سامانه را چند برابر کند حتی اگر مدل پایه تغییر نکرده باشد. امنیت باید بر کل سیستم عامل‌محور اعمال شود.

نکات Performance و مقیاس‌پذیری

Performance در AGI فقط سرعت پاسخ نیست. باید هزینه هر درخواست، مصرف GPU/CPU، حافظه، زمان صف، نرخ خطا، کیفیت در بار بالا و هزینه نظارت انسانی را هم‌زمان اندازه گرفت. بهینه‌سازی کورکورانه Latency ممکن است کیفیت، ایمنی یا قابلیت توضیح را کاهش دهد؛ بنابراین معیارها باید به هدف کسب‌وکار و سطح ریسک متصل باشند.

برای سامانه‌های مبتنی بر مدل‌های بزرگ، تکنیک‌هایی مانند batching، caching، quantization، routing میان مدل کوچک و بزرگ، محدودکردن context و استفاده انتخابی از ابزار می‌توانند هزینه را کاهش دهند. اما هر بهینه‌سازی باید دوباره روی کیفیت، امنیت و داده‌های خارج از توزیع اعتبارسنجی شود.

سناریوی عملی، خطا و Best Practice در AGIنمودار تصمیم برای انتخاب، پایش و توقف بر اساس معیارهای فنی و ریسک در AGI Decision & Risk Map — AGI Generality Thresholdآیا معیار پذیرش برقرار است؟ Limited Autonomyمسیر کنترل‌شده Escalate / Stopتوقف یا محدودسازی بله خیر ReliabilityPerformance Transfer LearningGeneralization AlignmentSafety Human Reviewنظارت انسانی Best Practice: معیارهای AGI را قبل از استقرار تعریف کنید و مسیر توقف امن را بخشی از معماری بدانید.

نمودار تصمیم AGI نشان می‌دهد استقرار موفق زمانی رخ می‌دهد که معیار پذیرش، تعمیم، Performance، ایمنی و بازبینی انسانی به‌صورت یک سیستم کنترل‌شده طراحی شوند.

بهترین روش‌ها

  1. AGI را با یک تعریف عملیاتی و مجموعه معیارهای شفاف ارزیابی کنید.
  2. Generality، Performance و Autonomy را به‌صورت محورهای جدا گزارش کنید.
  3. از benchmarkهای تازه، ضدآلودگی و ارزیابی انسانی مستقل استفاده کنید.
  4. توانایی امتناع، گزارش عدم قطعیت و خودتصحیحی را بسنجید.
  5. دسترسی به ابزار را مرحله‌ای و مبتنی بر حداقل اختیار طراحی کنید.
  6. برای قابلیت‌های پرریسک، trigger و mitigation از پیش تعریف کنید.
  7. آزمایش‌های red-team و adversarial را بخشی از چرخه توسعه قرار دهید.
  8. ادعاهای AGI را با تاریخ، نسخه و محدودیت‌های دقیق منتشر کنید.

سؤالات متداول

AGI دقیقاً چیست؟

AGI مفهوم سامانه‌ای با توانایی عمومی برای یادگیری، استدلال و انتقال مهارت در دامنه‌های گسترده است، اما تعریف واحد و پذیرفته‌شده جهانی ندارد.

آیا AGI در ۲۰۲۶ ساخته شده است؟

ادعاها و تعریف‌ها متفاوت‌اند و اجماع علمی عمومی درباره تحقق قطعی AGI وجود ندارد؛ باید هر ادعا را با معیار و شواهد همان تعریف سنجید.

AGI چه ارزش تجاری دارد؟

در صورت تحقق پایدار، می‌تواند کارهای چنددامنه‌ای و پیچیده را خودکار کند، اما هزینه، امنیت، حقوق و قابلیت اطمینان تعیین‌کننده ارزش واقعی خواهند بود.

آیا شرکت‌ها باید منتظر AGI بمانند؟

خیر. بسیاری از مسائل امروز با ANI، مدل‌های موجود، RAG و automation حل می‌شوند و انتظار برای یک فناوری تعریف‌نشده معمولاً منطقی نیست.

تفاوت AGI و مدل زبانی چیست؟

مدل زبانی یک نوع معماری یا مدل است؛ AGI سطحی از عمومیت و قابلیت است. یک LLM ممکن است بخشی از یک سیستم AGI فرضی باشد ولی این دو اصطلاح مترادف نیستند.

برای ارزیابی سیستم‌های عمومی چه خدماتی لازم است؟

طراحی benchmark اختصاصی، red-team، ارزیابی امنیت، سنجش latency/cost، تست ابزار و طراحی governance از خدمات کلیدی است.

رایج‌ترین خطای ارزیابی AGI چیست؟

تکیه بر یک benchmark، یک دمو یا self-report مدل و نادیده گرفتن داده آغشته، failure mode و ارزیابی مستقل.

Performance AGI چگونه سنجیده می‌شود؟

علاوه بر کیفیت، باید پایداری در وظایف تازه، هزینه محاسبه، زمان، نرخ مداخله انسان و قابلیت بازیابی از خطا سنجیده شود.

Best Practice برای عامل‌های عمومی‌تر چیست؟

sandbox، least privilege، approval برای اقدامات حساس، budget cap، logging و امکان توقف فوری از اصول اصلی‌اند.

نسخه مدل چه اثری بر ادعای AGI دارد؟

تغییر نسخه می‌تواند قابلیت‌ها و failure modeها را عوض کند؛ هر نتیجه باید دقیقاً به نسخه و تاریخ مشخص متصل باشد.

سؤالات مصاحبه

سؤال 1: چرا تعریف AGI دشوار است؟

چون عمومیت و سطح انسان چندبعدی‌اند و انسان‌ها نیز در مهارت‌ها متفاوت‌اند؛ یک عدد واحد این پیچیدگی را پوشش نمی‌دهد.

سؤال 2: Generality و Autonomy چه تفاوتی دارند؟

Generality گستره قابلیت است؛ Autonomy میزان عمل مستقل بدون تأیید مستمر انسان است.

سؤال 3: چگونه benchmark contamination را کاهش می‌دهید؟

با مجموعه‌های تازه و خصوصی، زمان‌بندی پس از cutoff آموزش و آزمون‌های پویا و مولد.

سؤال 4: Patchwork AGI چه ریسکی دارد؟

رفتار عمومی ممکن است از تعامل چند عامل پدید آید و کنترل یک مدل منفرد برای مهار کل سیستم کافی نباشد.

سؤال 5: مهم‌ترین معیار یک AGI قابل اعتماد چیست؟

هیچ معیار واحدی کافی نیست؛ قابلیت، تعمیم، calibration، امنیت، کنترل‌پذیری و رفتار در failure باید هم‌زمان سنجیده شوند.

چک‌لیست نهایی

  • تعریف مسئله و مرز دامنه مستند شده است.
  • نسخه مدل، داده، ابزار و وابستگی‌ها ثبت شده‌اند.
  • آزمون مستقل برای حالت عادی، مرزی و خارج از توزیع وجود دارد.
  • معیارهای کیفیت، هزینه، تأخیر و ریسک قبل از استقرار تعیین شده‌اند.
  • دسترسی‌ها حداقلی‌اند و مسیر توقف امن وجود دارد.
  • پایش پس از استقرار و بازبینی دوره‌ای تعریف شده است.

جمع‌بندی

AGI در ۲۰۲۶ بیش از آنکه یک نام تجاری روشن باشد، مسئله‌ای برای تعریف، سنجش و ایمنی است. بهترین رویکرد این است که ادعاهای بزرگ را به مجموعه‌ای از توانایی‌های قابل آزمون، تعمیم واقعی، خودمختاری کنترل‌شده و ریسک‌های قابل اندازه‌گیری تبدیل کنیم. هر سامانه عمومی‌تر باید نه فقط با «چه کارهایی می‌تواند انجام دهد»، بلکه با «کجا شکست می‌خورد و چگونه مهار می‌شود» توصیف شود.

بازگشت به مقاله مادر: انواع هوش مصنوعی ANI، AGI و ASI

خدمات برنامه‌نویسی و پایگاه داده

برنامه‌نویسی اصفهان

قبول سفارش‌های برنامه‌نویسی و پایگاه داده: 09131253620

انجام پروژه‌های برنامه‌نویسی، آموزش برنامه‌نویسی و آموزش پایگاه داده SQL Server

از سال ۱۳۷۵ در زمینه برنامه‌نویسی، پایگاه داده و طراحی راهکارهای نرم‌افزاری فعالیت می‌کنیم؛ بیش از سه دهه تجربه مستمر، پشتوانه اعتبار و کیفیت خدمات ماست.

دانلود پروژه‌های مجانی برنامه‌نویسی سی‌شارپ

دانلود پروژه‌های رایگان پایگاه داده SQL Server

دانلود پروژه‌های رایگان و مجانی پایگاه داده Microsoft Access

دانلود پروژه‌های رایگان UML مهندسی نرم‌افزار و نمودارهای تحلیل و طراحی

دانلود پروژه‌های مجانی وب‌فرم ASP.NET به همراه داکیومنت و مستندات

دانلود گزارش‌های کارآموزی رایگان برای رشته‌های مختلف

دانلود طرح‌های توجیهی کسب‌وکار و پروژه‌های کارآفرینی رایگان

دانلود پروژه‌های رایگان Multimedia Builder به همراه مستندات

برای سفارش پروژه‌های برنامه‌نویسی و پایگاه داده، سیستم‌های تحت وب، وب‌سایت و راهکارهای نرم‌افزاری جدید

با شماره تلفن همراه 09131253620 تماس حاصل فرمایید.

ایتا، واتساپ و تماس مستقیم: +989131253620

تماس با ما

 

0 نظر

نظر محترم شما در مورد مقاله های وب سایت برنامه نویسی و پایگاه داده

نظرات محترم شما در خدمات رسانی بهتر ما را یاری می نمایند. لطفا اگر مایل بودید یک نظر ما را مهمان فرمائید. آدرس ایمیل و وب سایت شما نمایش داده نخواهد شد.

حرف 500 حداکثر