مثالهای عملی و قابل اجرا
مثال 1: خواندن شمارنده تجمعی THREADPOOL
اولین گام این است که وجود و اندازه تاریخی THREADPOOL را ببینید. ستون wait_time_ms شامل signal_wait_time_ms نیز هست و مقدار از زمان Startup یا آخرین پاکسازی Wait Stats تجمع یافته است.
SELECT
wait_type,
waiting_tasks_count,
wait_time_ms,
signal_wait_time_ms,
CAST(wait_time_ms * 1.0 /
NULLIF(waiting_tasks_count, 0) AS decimal(18,2)) AS avg_wait_ms
FROM sys.dm_os_wait_stats
WHERE wait_type = N'THREADPOOL';
| Wait Type | تعداد | زمان کل | میانگین |
|---|
| THREADPOOL | 12,480 | 3,842,000 ms | 307.85 ms |
این خروجی Baseline است و رخداد جاری را اثبات نمیکند. زمان Startup، workload و Delta بعدی را ثبت کنید تا درباره اهمیت THREADPOOL نتیجهگیری شود.
مثال 2: محاسبه Delta پنجثانیهای THREADPOOL
دو Snapshot کوتاه نشان میدهد در بازه مشاهده چه مقدار انتظار جدید ساخته شده است. برای محیط واقعی، بازه را با چرخه کاری سامانه هماهنگ کنید و Snapshotها را در جدول مانیتورینگ پایدار نگه دارید.
IF OBJECT_ID(N'tempdb..#WaitStart') IS NOT NULL
DROP TABLE #WaitStart;
SELECT wait_type, waiting_tasks_count, wait_time_ms, signal_wait_time_ms
INTO #WaitStart
FROM sys.dm_os_wait_stats
WHERE wait_type = N'THREADPOOL';
WAITFOR DELAY '00:00:05';
SELECT
w.wait_type,
w.waiting_tasks_count - ISNULL(b.waiting_tasks_count, 0) AS delta_tasks,
w.wait_time_ms - ISNULL(b.wait_time_ms, 0) AS delta_wait_ms,
w.signal_wait_time_ms - ISNULL(b.signal_wait_time_ms, 0) AS delta_signal_ms
FROM sys.dm_os_wait_stats AS w
LEFT JOIN #WaitStart AS b ON b.wait_type = w.wait_type
WHERE w.wait_type = N'THREADPOOL';
| Wait Type | Delta Task | Delta Wait | Delta Signal |
|---|
| THREADPOOL | 38 | 8,420 ms | 310 ms |
Delta را به نرخ بر ثانیه و تعداد تراکنش نرمال کنید. یک پنجره پنجثانیهای برای آموزش است و در سامانه کمترافیک ممکن است نماینده نباشد.
مثال 3: یافتن Requestهای فعال روی THREADPOOL
وقتی THREADPOOL در لحظه رخ میدهد، Session، وضعیت، منبع انتظار و Blocker را یکجا ثبت کنید. این Snapshot به اتصال آمار Instance-level به رخداد واقعی کمک میکند.
SELECT
r.session_id,
DB_NAME(r.database_id) AS database_name,
r.status,
r.command,
r.wait_time,
r.wait_resource,
r.blocking_session_id,
r.cpu_time,
r.total_elapsed_time
FROM sys.dm_exec_requests AS r
WHERE r.wait_type = N'THREADPOOL'
ORDER BY r.wait_time DESC;
| Session | پایگاه داده | منبع | زمان |
|---|
| 74 | a00b | THREADPOOL resource | 4,280 ms |
اگر خروجی خالی است، انتظار در همان لحظه فعال نیست؛ این موضوع با بالا بودن مقدار تجمعی تناقض ندارد و اهمیت Capture دورهای را نشان میدهد.
مثال 4: بررسی Taskها و Contextهای منتظر THREADPOOL
یک Request میتواند چند Task داشته باشد، بهویژه در Plan موازی. sys.dm_os_waiting_tasks جزئیات worker و resource_description را برای تحلیل سطح پایینتر فراهم میکند.
SELECT
wt.session_id,
wt.exec_context_id,
wt.wait_duration_ms,
wt.wait_type,
wt.blocking_session_id,
wt.resource_description
FROM sys.dm_os_waiting_tasks AS wt
WHERE wt.wait_type = N'THREADPOOL'
ORDER BY wt.wait_duration_ms DESC;
| Session | Context | مدت | Resource |
|---|
| 74 | 0 | 4,280 ms | resource details |
تعداد Taskها را با DOP، Blocking و ماهیت Worker Thread تفسیر کنید؛ یک Task منفرد و کوتاه با صف گسترده و پایدار یکسان نیست.
مثال 5: نمایش متن SQL عامل THREADPOOL
برای رسیدن از Wait به اقدام اصلاحی باید متن Batch و Statement جاری را ثبت کرد. Offsetها باعث میشوند بخش در حال اجرای Batch جدا از متن کامل نمایش داده شود.
SELECT
r.session_id,
r.wait_time,
r.wait_resource,
SUBSTRING(st.text,
(r.statement_start_offset / 2) + 1,
((CASE r.statement_end_offset
WHEN -1 THEN DATALENGTH(st.text)
ELSE r.statement_end_offset
END - r.statement_start_offset) / 2) + 1) AS current_statement,
st.text AS batch_text
FROM sys.dm_exec_requests AS r
OUTER APPLY sys.dm_exec_sql_text(r.sql_handle) AS st
WHERE r.wait_type = N'THREADPOOL'
ORDER BY r.wait_time DESC;
| Session | Wait | Statement | Batch |
|---|
| 74 | 4,280 ms | SELECT/UPDATE جاری | نام Procedure یا Batch |
متن Query ممکن است اطلاعات حساس داشته باشد؛ آن را در مخزن مانیتورینگ امن نگه دارید و برای اصلاح THREADPOOL حتماً Execution Plan و پارامترها را نیز جمعآوری کنید.
مثال 6: مقایسه Worker و صف Runnable در Schedulerها
در Worker exhaustion باید تعداد workerهای جاری و فعال را کنار صف Runnable دید. چند Scheduler با active_workers_count بالا و صف پایدار میتواند فشار گسترده را نشان دهد.
SELECT
scheduler_id,
current_tasks_count,
runnable_tasks_count,
current_workers_count,
active_workers_count,
work_queue_count,
load_factor
FROM sys.dm_os_schedulers
WHERE status = N'VISIBLE ONLINE'
ORDER BY active_workers_count DESC;
| Scheduler | Task | Worker | Runnable |
|---|
| 2 | 74 | 64 | 12 |
این Snapshot را سریع ثبت کنید؛ در رخداد شدید ممکن است فقط Dedicated Admin Connection امکان اجرای دستور تشخیصی داشته باشد.
مثال 7: شمارش Sessionهای کاربر بر اساس وضعیت
Sessionهای sleeping الزاماً worker فعال نگه نمیدارند، اما تعداد زیاد Requestهای running یا suspended همراه با Blocking اهمیت دارد. گروهبندی زیر برنامههای غالب را نیز مشخص میکند.
SELECT
status,
program_name,
COUNT_BIG(*) AS session_count,
SUM(CASE WHEN open_transaction_count > 0 THEN 1 ELSE 0 END) AS sessions_with_open_tran
FROM sys.dm_exec_sessions
WHERE is_user_process = 1
GROUP BY status, program_name
ORDER BY session_count DESC;
| Status | برنامه | Session | Transaction باز |
|---|
| sleeping | WebApi | 420 | 3 |
| running | WebApi | 88 | 16 |
Connection Pool را با Request فعال اشتباه نگیرید؛ زنجیره Blocking و مدت Queryها مشخص میکند workerها چرا آزاد نمیشوند.
مثال 8: خواندن ظرفیت Worker و تنظیم max worker threads
مقدار صفر برای max worker threads یعنی SQL Server ظرفیت را خودکار محاسبه میکند. max_workers_count ظرفیت محاسبهشده جاری را نشان میدهد و مبنایی برای مشاهده است، نه دعوت فوری به تغییر.
SELECT
osi.cpu_count,
osi.scheduler_count,
osi.max_workers_count
FROM sys.dm_os_sys_info AS osi;
SELECT
name,
value,
value_in_use
FROM sys.configurations
WHERE name = N'max worker threads';
| CPU | Scheduler | حداکثر Worker | تنظیم |
|---|
| 16 | 16 | 704 | 0 (automatic) |
اگر Blocking یا Parallelism علت مصرف worker باشد، افزایش ظرفیت بدون رفع علت میتواند فقط نقطه شکست را عقب بیندازد.
مثال 9: مقایسه THREADPOOL با Waitهای همخانواده
Wait Typeها در خلأ تفسیر نمیشوند. مقایسه THREADPOOL با SOS_SCHEDULER_YIELD، CXPACKET، LCK_M_X کمک میکند بفهمید علامت اصلی به کدام زیرسیستم نزدیکتر است.
SELECT
wait_type,
waiting_tasks_count,
wait_time_ms,
signal_wait_time_ms,
CAST(100.0 * wait_time_ms /
NULLIF(SUM(wait_time_ms) OVER (), 0) AS decimal(10,2)) AS family_percent
FROM sys.dm_os_wait_stats
WHERE wait_type IN (N'THREADPOOL', N'SOS_SCHEDULER_YIELD', N'CXPACKET', N'LCK_M_X')
ORDER BY wait_time_ms DESC;
| Wait Type | تعداد | زمان | سهم خانواده |
|---|
| THREADPOOL | 12,480 | 3,842,000 ms | 64.20% |
| SOS_SCHEDULER_YIELD | 4,110 | 1,820,000 ms | 30.42% |
سهم خانواده برای Prioritization مفید است، ولی شدت کسبوکاری را نشان نمیدهد. زمان پاسخ، SLA و تعداد درخواست متاثر را هم اضافه کنید.
مثال 10: ساخت قاعده هشدار مستقل برای Delta THREADPOOL
در مانیتورینگ بهتر است روی Delta یک بازه ثابت و نرخ هر ثانیه هشدار بسازید، نه روی مقدار تجمعی از Startup. مثال مستقل زیر با داده نمونه منطق سطحبندی را نمایش میدهد و در سامانه مانیتورینگ با Snapshot واقعی جایگزین میشود.
DECLARE @WindowSeconds int = 60;
DECLARE @WaitDelta TABLE
(
wait_type nvarchar(60),
delta_wait_ms bigint,
delta_tasks bigint
);
INSERT INTO @WaitDelta (wait_type, delta_wait_ms, delta_tasks)
VALUES (N'THREADPOOL', 8400, 38);
SELECT
wait_type,
delta_wait_ms,
delta_tasks,
CAST(delta_wait_ms * 1.0 / @WindowSeconds AS decimal(18,2)) AS wait_ms_per_second,
CASE
WHEN delta_wait_ms >= 30000 THEN N'بحرانی'
WHEN delta_wait_ms >= 5000 THEN N'نیازمند بررسی'
ELSE N'عادی'
END AS alert_level
FROM @WaitDelta;
| Wait Type | Delta | نرخ | سطح |
|---|
| THREADPOOL | 8,400 ms | 140 ms/s | نیازمند بررسی |
آستانههای نمونه عمومی نیستند. آنها را از Baseline، ظرفیت و SLA سامانه خود استخراج کنید تا برای THREADPOOL هشدار کاذب تولید نشود.
سؤالات متداول
سؤال 1: THREADPOOL دقیقاً چه زمانی در SQL Server ثبت میشود؟
THREADPOOL زمانی رخ میدهد که Task آماده اجراست اما Worker آزاد در Pool وجود ندارد. Blocking وسیع، Connectionهای فعال بسیار زیاد، Queryهای موازی و تنظیم نامناسب Workerها میتوانند این وضعیت بحرانی را ایجاد کنند. ثبت یک انتظار کوتاه بخشی طبیعی از زمانبندی موتور است؛ اهمیت زمانی ایجاد میشود که Delta آن با کندی قابل مشاهده و افت SLA همزمان باشد.
سؤال 2: برای شروع تحلیل THREADPOOL کدام DMVها مناسباند؟
sys.dm_os_wait_stats برای روند Instance، sys.dm_exec_requests برای Request جاری و sys.dm_os_waiting_tasks برای Task و منبع انتظار نقطه شروع هستند. با توجه به دسته Worker Thread باید DMV تخصصی همان زیرسیستم و Execution Plan نیز افزوده شود.
سؤال 3: آیا زیاد بودن THREADPOOL به معنی نیاز فوری به سختافزار جدید است؟
خیر. افزایش max worker threads بدون یافتن Blocking یا فشار ورودی میتواند Context Switching و بیثباتی را بیشتر کند. پیش از خرید باید هزینه اصلاح Query، تنظیمات، معماری برنامه و زیرساخت با اندازهگیری قبل و بعد مقایسه شود؛ یک ارزیابی فنی حرفهای میتواند از هزینه اشتباه جلوگیری کند.
سؤال 4: چه زمانی تحلیل حرفهای THREADPOOL برای یک کسبوکار توجیه دارد؟
وقتی انتظار با افت فروش، Timeout، ناتمام ماندن Job، افزایش زمان پاسخ یا نقض SLA همبسته است، تحلیل ساختاریافته ارزش تجاری دارد. مشاوره SQL Server در این مرحله باید خروجی قابل سنجش مانند کاهش p95 و نرخ انتظار ارائه کند، نه فقط تغییر چند تنظیم.
سؤال 5: تفاوت THREADPOOL با SOS_SCHEDULER_YIELD چیست؟
THREADPOOL در دسته Worker Thread تفسیر میشود، در حالی که SOS_SCHEDULER_YIELD مرحله یا منبع متفاوتی را برجسته میکند. همزمانی این دو ممکن است زنجیره علت و معلول باشد؛ تعریف هر Wait، منبع جاری و Timeline تعیین میکند کدامیک علامت و کدامیک علت نزدیکتر است.
سؤال 6: برای سفارش پروژه کاهش THREADPOOL چه دادههایی باید آماده شود؟
بازه دقیق کندی، نسخه و Edition، Wait Delta، Query و Plan، شاخصهای سیستمعامل، توپولوژی و SLA را آماده کنید. حذف اطلاعات حساس و فراهم کردن نمونه قابل بازتولید باعث میشود خدمت عیبیابی سریعتر، کمریسکتر و قابل ارزیابی باشد.
سؤال 7: رایجترین خطای تشخیصی درباره THREADPOOL چیست؟
قضاوت با مقدار تجمعی از زمان Startup و تغییر تنظیمات بدون اتصال انتظار به Query و بازه حادثه رایجترین خطاست. افزایش max worker threads بدون یافتن Blocking یا فشار ورودی میتواند Context Switching و بیثباتی را بیشتر کند. Snapshot کوتاه، Baseline و مقایسه قبل و بعد این خطا را کاهش میدهد.
سؤال 8: اثر THREADPOOL بر Performance چگونه اندازهگیری میشود؟
Delta wait_time_ms، تعداد Task، متوسط انتظار و نرخ بر ثانیه را کنار throughput، p95 زمان پاسخ و منابع سیستم ثبت کنید. درخواستهای جدید حتی برای تشخیص مشکل هم ممکن است وصل یا اجرا نشوند و کل Instance ظاهراً فریز شود بنابراین معیار فنی باید به معیار تجربه کاربر یا Job کسبوکار متصل شود.
سؤال 9: Best Practice اصلی برای مدیریت THREADPOOL چیست؟
از Dedicated Admin Connection در رخداد شدید استفاده و Head Blocker، Scheduler و تعداد workerها را فوراً ثبت کنید. تغییر را ابتدا در محیط آزمایش یا روی دامنه محدود اعمال کنید، معیار موفقیت را از قبل بنویسید و امکان بازگشت داشته باشید. پاک کردن Wait Stats بدون ذخیره Baseline یا اجرای چند تغییر همزمان قابلیت استناد نتیجه را از بین میبرد.
سؤال 10: THREADPOOL با کدام نسخههای SQL Server سازگار است؟
نسخههای متداول SQL Server و Azure SQL. ستونها و Permissionهای DMV ممکن است میان نسخههای On-premises، Azure SQL و نسخههای جدید تغییر کنند؛ Query تشخیصی را در مستندات همان نسخه کنترل و ابتدا با دسترسی Read-only مناسب اجرا کنید.