مثالهای عملی و قابل اجرا
مثال 1: خواندن شمارنده تجمعی HADR_SYNC_COMMIT
اولین گام این است که وجود و اندازه تاریخی HADR_SYNC_COMMIT را ببینید. ستون wait_time_ms شامل signal_wait_time_ms نیز هست و مقدار از زمان Startup یا آخرین پاکسازی Wait Stats تجمع یافته است.
SELECT
wait_type,
waiting_tasks_count,
wait_time_ms,
signal_wait_time_ms,
CAST(wait_time_ms * 1.0 /
NULLIF(waiting_tasks_count, 0) AS decimal(18,2)) AS avg_wait_ms
FROM sys.dm_os_wait_stats
WHERE wait_type = N'HADR_SYNC_COMMIT';
| Wait Type | تعداد | زمان کل | میانگین |
|---|
| HADR_SYNC_COMMIT | 12,480 | 3,842,000 ms | 307.85 ms |
این خروجی Baseline است و رخداد جاری را اثبات نمیکند. زمان Startup، workload و Delta بعدی را ثبت کنید تا درباره اهمیت HADR_SYNC_COMMIT نتیجهگیری شود.
مثال 2: محاسبه Delta پنجثانیهای HADR_SYNC_COMMIT
دو Snapshot کوتاه نشان میدهد در بازه مشاهده چه مقدار انتظار جدید ساخته شده است. برای محیط واقعی، بازه را با چرخه کاری سامانه هماهنگ کنید و Snapshotها را در جدول مانیتورینگ پایدار نگه دارید.
IF OBJECT_ID(N'tempdb..#WaitStart') IS NOT NULL
DROP TABLE #WaitStart;
SELECT wait_type, waiting_tasks_count, wait_time_ms, signal_wait_time_ms
INTO #WaitStart
FROM sys.dm_os_wait_stats
WHERE wait_type = N'HADR_SYNC_COMMIT';
WAITFOR DELAY '00:00:05';
SELECT
w.wait_type,
w.waiting_tasks_count - ISNULL(b.waiting_tasks_count, 0) AS delta_tasks,
w.wait_time_ms - ISNULL(b.wait_time_ms, 0) AS delta_wait_ms,
w.signal_wait_time_ms - ISNULL(b.signal_wait_time_ms, 0) AS delta_signal_ms
FROM sys.dm_os_wait_stats AS w
LEFT JOIN #WaitStart AS b ON b.wait_type = w.wait_type
WHERE w.wait_type = N'HADR_SYNC_COMMIT';
| Wait Type | Delta Task | Delta Wait | Delta Signal |
|---|
| HADR_SYNC_COMMIT | 38 | 8,420 ms | 310 ms |
Delta را به نرخ بر ثانیه و تعداد تراکنش نرمال کنید. یک پنجره پنجثانیهای برای آموزش است و در سامانه کمترافیک ممکن است نماینده نباشد.
مثال 3: یافتن Requestهای فعال روی HADR_SYNC_COMMIT
وقتی HADR_SYNC_COMMIT در لحظه رخ میدهد، Session، وضعیت، منبع انتظار و Blocker را یکجا ثبت کنید. این Snapshot به اتصال آمار Instance-level به رخداد واقعی کمک میکند.
SELECT
r.session_id,
DB_NAME(r.database_id) AS database_name,
r.status,
r.command,
r.wait_time,
r.wait_resource,
r.blocking_session_id,
r.cpu_time,
r.total_elapsed_time
FROM sys.dm_exec_requests AS r
WHERE r.wait_type = N'HADR_SYNC_COMMIT'
ORDER BY r.wait_time DESC;
| Session | پایگاه داده | منبع | زمان |
|---|
| 74 | a00b | HADR_SYNC_COMMIT resource | 4,280 ms |
اگر خروجی خالی است، انتظار در همان لحظه فعال نیست؛ این موضوع با بالا بودن مقدار تجمعی تناقض ندارد و اهمیت Capture دورهای را نشان میدهد.
مثال 4: بررسی Taskها و Contextهای منتظر HADR_SYNC_COMMIT
یک Request میتواند چند Task داشته باشد، بهویژه در Plan موازی. sys.dm_os_waiting_tasks جزئیات worker و resource_description را برای تحلیل سطح پایینتر فراهم میکند.
SELECT
wt.session_id,
wt.exec_context_id,
wt.wait_duration_ms,
wt.wait_type,
wt.blocking_session_id,
wt.resource_description
FROM sys.dm_os_waiting_tasks AS wt
WHERE wt.wait_type = N'HADR_SYNC_COMMIT'
ORDER BY wt.wait_duration_ms DESC;
| Session | Context | مدت | Resource |
|---|
| 74 | 0 | 4,280 ms | resource details |
تعداد Taskها را با DOP، Blocking و ماهیت Always On Availability Groups تفسیر کنید؛ یک Task منفرد و کوتاه با صف گسترده و پایدار یکسان نیست.
مثال 5: نمایش متن SQL عامل HADR_SYNC_COMMIT
برای رسیدن از Wait به اقدام اصلاحی باید متن Batch و Statement جاری را ثبت کرد. Offsetها باعث میشوند بخش در حال اجرای Batch جدا از متن کامل نمایش داده شود.
SELECT
r.session_id,
r.wait_time,
r.wait_resource,
SUBSTRING(st.text,
(r.statement_start_offset / 2) + 1,
((CASE r.statement_end_offset
WHEN -1 THEN DATALENGTH(st.text)
ELSE r.statement_end_offset
END - r.statement_start_offset) / 2) + 1) AS current_statement,
st.text AS batch_text
FROM sys.dm_exec_requests AS r
OUTER APPLY sys.dm_exec_sql_text(r.sql_handle) AS st
WHERE r.wait_type = N'HADR_SYNC_COMMIT'
ORDER BY r.wait_time DESC;
| Session | Wait | Statement | Batch |
|---|
| 74 | 4,280 ms | SELECT/UPDATE جاری | نام Procedure یا Batch |
متن Query ممکن است اطلاعات حساس داشته باشد؛ آن را در مخزن مانیتورینگ امن نگه دارید و برای اصلاح HADR_SYNC_COMMIT حتماً Execution Plan و پارامترها را نیز جمعآوری کنید.
مثال 6: بررسی Queue و نرخ ارسال Log در AG
HADR_SYNC_COMMIT را باید در سطح هر Database Replica تحلیل کرد. Queue بزرگ یا send_rate پایین میتواند مسیر شبکه یا Secondary را برجسته کند.
SELECT
DB_NAME(database_id) AS database_name,
is_local,
synchronization_state_desc,
synchronization_health_desc,
log_send_queue_size,
log_send_rate,
redo_queue_size,
redo_rate,
last_commit_time
FROM sys.dm_hadr_database_replica_states
ORDER BY database_id, is_local DESC;
| پایگاه داده | همگامسازی | Send Queue | Send Rate |
|---|
| a00b | SYNCHRONIZED | 18432 KB | 51200 KB/s |
Queue را همراه با نرخ و زمان اندازه بگیرید؛ حجم لحظهای بدون روند ممکن است ناشی از Burst طبیعی تولید Log باشد.
مثال 7: نمایش نقش و وضعیت اتصال Replicaها
وضعیت Connected و Role هر Replica مشخص میکند Primary منتظر کدام شریک همگام است. این DMV فقط وضعیت محلی Instance را گزارش میکند.
SELECT
ag.name AS availability_group_name,
ar.replica_server_name,
ars.role_desc,
ars.connected_state_desc,
ars.synchronization_health_desc,
ar.availability_mode_desc,
ar.failover_mode_desc
FROM sys.dm_hadr_availability_replica_states AS ars
JOIN sys.availability_replicas AS ar
ON ar.replica_id = ars.replica_id
JOIN sys.availability_groups AS ag
ON ag.group_id = ar.group_id
ORDER BY ag.name, ar.replica_server_name;
| AG | Replica | Role | Connection |
|---|
| AG-PROD | SQL-02 | SECONDARY | CONNECTED |
قطع و وصل شدن Connection یا سلامت غیرعادی باید با لاگ SQL Server، شبکه و وضعیت Cluster در همان زمان بررسی شود.
مثال 8: اندازهگیری Write Latency فایل Log روی Replica محلی
Secondary باید Log را Harden کند؛ بنابراین Latency فایل Log آن میتواند زمان تأیید Commit را افزایش دهد. این Query روی هر Replica جداگانه اجرا و نتایج همزمان مقایسه شود.
SELECT
DB_NAME(vfs.database_id) AS database_name,
mf.name AS log_file,
vfs.num_of_writes,
CAST(vfs.io_stall_write_ms * 1.0 /
NULLIF(vfs.num_of_writes, 0) AS decimal(18,2)) AS avg_write_ms
FROM sys.dm_io_virtual_file_stats(NULL, NULL) AS vfs
JOIN sys.master_files AS mf
ON mf.database_id = vfs.database_id
AND mf.file_id = vfs.file_id
WHERE mf.type_desc = N'LOG'
AND vfs.database_id IN
(SELECT database_id FROM sys.dm_hadr_database_replica_states WHERE is_local = 1)
ORDER BY avg_write_ms DESC;
| پایگاه داده | فایل Log | Writeها | Latency |
|---|
| a00b | a00b_Log | 220400 | 9.80 ms |
مقایسه Primary و Secondary باید در یک پنجره زمانی واحد باشد؛ تفاوت Storage یا فشار workload ثانویه ممکن است عامل اصلی باشد.
مثال 9: مقایسه HADR_SYNC_COMMIT با Waitهای همخانواده
Wait Typeها در خلأ تفسیر نمیشوند. مقایسه HADR_SYNC_COMMIT با WRITELOG، HADR_THROTTLE_LOG_RATE_MISMATCH_SLOWS، HADR_LOGCAPTURE_WAIT کمک میکند بفهمید علامت اصلی به کدام زیرسیستم نزدیکتر است.
SELECT
wait_type,
waiting_tasks_count,
wait_time_ms,
signal_wait_time_ms,
CAST(100.0 * wait_time_ms /
NULLIF(SUM(wait_time_ms) OVER (), 0) AS decimal(10,2)) AS family_percent
FROM sys.dm_os_wait_stats
WHERE wait_type IN (N'HADR_SYNC_COMMIT', N'WRITELOG', N'HADR_THROTTLE_LOG_RATE_MISMATCH_SLOWS', N'HADR_LOGCAPTURE_WAIT')
ORDER BY wait_time_ms DESC;
| Wait Type | تعداد | زمان | سهم خانواده |
|---|
| HADR_SYNC_COMMIT | 12,480 | 3,842,000 ms | 64.20% |
| WRITELOG | 4,110 | 1,820,000 ms | 30.42% |
سهم خانواده برای Prioritization مفید است، ولی شدت کسبوکاری را نشان نمیدهد. زمان پاسخ، SLA و تعداد درخواست متاثر را هم اضافه کنید.
مثال 10: ساخت قاعده هشدار مستقل برای Delta HADR_SYNC_COMMIT
در مانیتورینگ بهتر است روی Delta یک بازه ثابت و نرخ هر ثانیه هشدار بسازید، نه روی مقدار تجمعی از Startup. مثال مستقل زیر با داده نمونه منطق سطحبندی را نمایش میدهد و در سامانه مانیتورینگ با Snapshot واقعی جایگزین میشود.
DECLARE @WindowSeconds int = 60;
DECLARE @WaitDelta TABLE
(
wait_type nvarchar(60),
delta_wait_ms bigint,
delta_tasks bigint
);
INSERT INTO @WaitDelta (wait_type, delta_wait_ms, delta_tasks)
VALUES (N'HADR_SYNC_COMMIT', 8400, 38);
SELECT
wait_type,
delta_wait_ms,
delta_tasks,
CAST(delta_wait_ms * 1.0 / @WindowSeconds AS decimal(18,2)) AS wait_ms_per_second,
CASE
WHEN delta_wait_ms >= 30000 THEN N'بحرانی'
WHEN delta_wait_ms >= 5000 THEN N'نیازمند بررسی'
ELSE N'عادی'
END AS alert_level
FROM @WaitDelta;
| Wait Type | Delta | نرخ | سطح |
|---|
| HADR_SYNC_COMMIT | 8,400 ms | 140 ms/s | نیازمند بررسی |
آستانههای نمونه عمومی نیستند. آنها را از Baseline، ظرفیت و SLA سامانه خود استخراج کنید تا برای HADR_SYNC_COMMIT هشدار کاذب تولید نشود.
سؤالات متداول
سؤال 1: HADR_SYNC_COMMIT دقیقاً چه زمانی در SQL Server ثبت میشود؟
در حالت Synchronous Commit، این انتظار وقتی دیده میشود که Primary پس از Harden کردن Log محلی منتظر تأیید Replica ثانویه است. Latency شبکه، Log Flush در Secondary، فشار CPU و جریان ارسال Log بر مدت آن اثر دارند. ثبت یک انتظار کوتاه بخشی طبیعی از زمانبندی موتور است؛ اهمیت زمانی ایجاد میشود که Delta آن با کندی قابل مشاهده و افت SLA همزمان باشد.
سؤال 2: برای شروع تحلیل HADR_SYNC_COMMIT کدام DMVها مناسباند؟
sys.dm_os_wait_stats برای روند Instance، sys.dm_exec_requests برای Request جاری و sys.dm_os_waiting_tasks برای Task و منبع انتظار نقطه شروع هستند. با توجه به دسته Always On Availability Groups باید DMV تخصصی همان زیرسیستم و Execution Plan نیز افزوده شود.
سؤال 3: آیا زیاد بودن HADR_SYNC_COMMIT به معنی نیاز فوری به سختافزار جدید است؟
خیر. تغییر فوری به Asynchronous Commit هدف RPO را عوض میکند و باید تصمیم معماری و کسبوکاری باشد، نه واکنش عجولانه. پیش از خرید باید هزینه اصلاح Query، تنظیمات، معماری برنامه و زیرساخت با اندازهگیری قبل و بعد مقایسه شود؛ یک ارزیابی فنی حرفهای میتواند از هزینه اشتباه جلوگیری کند.
سؤال 4: چه زمانی تحلیل حرفهای HADR_SYNC_COMMIT برای یک کسبوکار توجیه دارد؟
وقتی انتظار با افت فروش، Timeout، ناتمام ماندن Job، افزایش زمان پاسخ یا نقض SLA همبسته است، تحلیل ساختاریافته ارزش تجاری دارد. مشاوره SQL Server در این مرحله باید خروجی قابل سنجش مانند کاهش p95 و نرخ انتظار ارائه کند، نه فقط تغییر چند تنظیم.
سؤال 5: تفاوت HADR_SYNC_COMMIT با WRITELOG چیست؟
HADR_SYNC_COMMIT در دسته Always On Availability Groups تفسیر میشود، در حالی که WRITELOG مرحله یا منبع متفاوتی را برجسته میکند. همزمانی این دو ممکن است زنجیره علت و معلول باشد؛ تعریف هر Wait، منبع جاری و Timeline تعیین میکند کدامیک علامت و کدامیک علت نزدیکتر است.
سؤال 6: برای سفارش پروژه کاهش HADR_SYNC_COMMIT چه دادههایی باید آماده شود؟
بازه دقیق کندی، نسخه و Edition، Wait Delta، Query و Plan، شاخصهای سیستمعامل، توپولوژی و SLA را آماده کنید. حذف اطلاعات حساس و فراهم کردن نمونه قابل بازتولید باعث میشود خدمت عیبیابی سریعتر، کمریسکتر و قابل ارزیابی باشد.
سؤال 7: رایجترین خطای تشخیصی درباره HADR_SYNC_COMMIT چیست؟
قضاوت با مقدار تجمعی از زمان Startup و تغییر تنظیمات بدون اتصال انتظار به Query و بازه حادثه رایجترین خطاست. تغییر فوری به Asynchronous Commit هدف RPO را عوض میکند و باید تصمیم معماری و کسبوکاری باشد، نه واکنش عجولانه. Snapshot کوتاه، Baseline و مقایسه قبل و بعد این خطا را کاهش میدهد.
سؤال 8: اثر HADR_SYNC_COMMIT بر Performance چگونه اندازهگیری میشود؟
Delta wait_time_ms، تعداد Task، متوسط انتظار و نرخ بر ثانیه را کنار throughput، p95 زمان پاسخ و منابع سیستم ثبت کنید. افزایش مستقیم زمان Commit برنامه و کاهش نرخ تراکنش در Primary بنابراین معیار فنی باید به معیار تجربه کاربر یا Job کسبوکار متصل شود.
سؤال 9: Best Practice اصلی برای مدیریت HADR_SYNC_COMMIT چیست؟
زمان Commit را با log_send_queue_size، send_rate، وضعیت Synchronization و Latency Log هر دو Replica همبسته کنید. تغییر را ابتدا در محیط آزمایش یا روی دامنه محدود اعمال کنید، معیار موفقیت را از قبل بنویسید و امکان بازگشت داشته باشید. پاک کردن Wait Stats بدون ذخیره Baseline یا اجرای چند تغییر همزمان قابلیت استناد نتیجه را از بین میبرد.
سؤال 10: HADR_SYNC_COMMIT با کدام نسخههای SQL Server سازگار است؟
SQL Server با Always On Availability Groups و Replica همگام. ستونها و Permissionهای DMV ممکن است میان نسخههای On-premises، Azure SQL و نسخههای جدید تغییر کنند؛ Query تشخیصی را در مستندات همان نسخه کنترل و ابتدا با دسترسی Read-only مناسب اجرا کنید.