Data Quality Services: پروژه‌ها، مدیریت و یکپارچه‌سازی | آموزش Microsoft SQL Server 2012

Data Quality Services: پروژه‌ها، مدیریت و یکپارچه‌سازی

توسط admin | گروه SQL Server | 1405/05/15

نظرات 0

Data Quality Services: پروژه‌ها، مدیریت و یکپارچه‌سازی

صفحهٔ ۱۷۹ فایل PDF — صفحهٔ ۱۶۱ کتاب

در صورت نیاز می‌توان به مرحلهٔ قبل بازگشت، Matching Rule را دقیق‌تر کرد و دوباره به نتیجه برگشت. پیش از Restart، گزینهٔ Reload Data From Source دادهٔ Source را به Staging Table کپی و دوباره Index می‌کند؛ Execute On Previous Data از دادهٔ موجود در Staging بدون Re-index استفاده می‌کند و سریع‌تر است.

پس از رضایت از نتیجه Finish را بزنید و Matching Policy را در Knowledge Base منتشر کنید. سپس Policy در Matching Data Quality Project قابل استفاده است.

Data Quality Projectها

با Knowledge Base آماده، Data Quality Project می‌تواند Source Data را پاک‌سازی یا با Matching Policy رکوردهای مشابه را پیدا کند. نتیجه به SQL Server Database یا CSV Export یا به Domain در Domain Management وارد می‌شود.

در Home روی New Data Quality Project کلیک، Name و Description اختیاری را وارد و Knowledge Base را انتخاب کنید. Cleansing برای هر Knowledge Base قابل انتخاب است، اما Matching فقط وقتی فعال است که Knowledge Base دارای Matching Policy باشد. Create، Wizard را اجرا و Project را برای دیگر Userها Lock می‌کند.

Cleansing Project

با تحلیل Source Data بر اساس Knowledge Base آغاز می‌شود و داده را به Correct و Incorrect طبقه‌بندی می‌کند. سپس می‌توان Proposed Correctionها را تأیید، رد یا تغییر داد. مراحل عبارت‌اند از Map، Cleanse، Manage And View Results و Export.

Map

Source، یعنی Excel File یا SQL Server Table/View، مانند Knowledge Discovery به Domainهای Knowledge Base نگاشت می‌شود. پس از Mapping همهٔ Columnها Next را بزنید.

تصویر مرجع صفحهٔ ۱۷۹تصویر صفحهٔ اصلی برای حفظ کامل نمودارها، جدول‌ها، کدها، رابط‌های کاربری و چیدمان منبع.
تصویر مرجع صفحهٔ ۱۷۹ فایل PDF
صفحهٔ ۱۸۰ فایل PDF — صفحهٔ ۱۶۲ کتاب

Cleanse

Start فرایند را آغاز می‌کند. پس از تحلیل، Profiler آمار گروه‌های Correct، Corrected، Suggested و Invalid را نشان می‌دهد. الگوریتم‌های DQS Confidence Score محاسبه می‌کنند و Thresholdهای Auto-Correction و Auto-Suggestion قابل پیکربندی‌اند. Recordی که Score آن پایین‌تر از هر دو Threshold است و Correct یا Invalid نیست، New می‌شود تا در مرحلهٔ بعد دستی اصلاح گردد.

شکل ۷-۱۹ — آمار Profiler پس از پایان Cleansing.

Manage And View Results

برای گروه‌های Suggested، New، Invalid، Corrected و Correct زبانه‌های جدا با شمار Record وجود دارد. هر زبانه جدول Domain Valueها و تعداد Recordهای دارای هر Value را نشان می‌دهد.

در صورت وجود، Proposed Corrected Value، Confidence Score و Reason نمایش داده می‌شوند. انتخاب ردیف، Recordهای دارای Original Value را نشان می‌دهد و Scroll افقی برای همهٔ Fieldها لازم است.

اگر Speller Domain فعال باشد، غلط احتمالی با زیرخط موج‌دار قرمز دیده می‌شود؛ با راست‌کلیک Suggestionها قابل انتخاب یا Value قابل افزودن به Dictionary است.

تصویر مرجع صفحهٔ ۱۸۰تصویر صفحهٔ اصلی برای حفظ کامل نمودارها، جدول‌ها، کدها، رابط‌های کاربری و چیدمان منبع.
تصویر مرجع صفحهٔ ۱۸۰ فایل PDF
صفحهٔ ۱۸۱ فایل PDF — صفحهٔ ۱۶۳ کتاب
شکل ۷-۲۰ — نتایج طبقه‌بندی‌شده پس از Data Cleansing خودکار.

اگر Source Value به‌عنوان Synonym شناخته شود، Correction به Leading Value پیشنهاد می‌شود. برای این Standardization باید Use Leading Values و Synonymها پیش از اجرای Project در Domain تعریف شده باشند.

پس از بازبینی، Change هر Value یا Record جداگانه تأیید یا رد می‌شود؛ Approve All Terms و Reject All Terms نیز وجود دارند. Correct To را می‌توان با مقدار دستی جایگزین و تأیید کرد. Approved Valueها معمولاً به Corrected و Rejected Valueها به Invalid می‌روند؛ Approved Value از New به Correct منتقل می‌شود.

Export

DQS هیچ‌گاه Source Data را هنگام Cleansing تغییر نمی‌دهد. نتیجه به SQL Server Table یا CSV Export می‌شود و مرحلهٔ آخر Preview خروجی را نشان می‌دهد.

شکل ۷-۲۱ — Preview نتیجهٔ Cleansing برای Export.
تصویر مرجع صفحهٔ ۱۸۱تصویر صفحهٔ اصلی برای حفظ کامل نمودارها، جدول‌ها، کدها، رابط‌های کاربری و چیدمان منبع.
تصویر مرجع صفحهٔ ۱۸۱ فایل PDF
صفحهٔ ۱۸۲ فایل PDF — صفحهٔ ۱۶۴ کتاب

پیش از Export مشخص کنید فقط Data یا Data همراه Cleansing Information صادر شود. اطلاعات Cleansing شامل Original Value، Cleansed Value، دلیل Correction، Confidence Score و Categorization است. DQS به‌طور پیش‌فرض Format Output تعریف‌شده در Domain را استفاده می‌کند، مگر Standardize Output پاک شود. Export داده را به مقصد می‌فرستد و Finish Project را بسته و Unlock می‌کند.

Matching Project

با Matching Policy موجود، Matchهای Exact و Approximate در Source شناسایی می‌شوند. بهتر است پس از Cleansing و Export اجرا شود و فایل یا Table خروجی Cleansing به‌عنوان Source Matching استفاده گردد. مراحل Map، Matching و Export هستند.

Map

Fieldهای Source به Domain نگاشت می‌شوند و باید برای هر Domain موجود در Matching Policy یک Field نگاشت شود.

تصویر مرجع صفحهٔ ۱۸۲تصویر صفحهٔ اصلی برای حفظ کامل نمودارها، جدول‌ها، کدها، رابط‌های کاربری و چیدمان منبع.
تصویر مرجع صفحهٔ ۱۸۲ فایل PDF
صفحهٔ ۱۸۳ فایل PDF — صفحهٔ ۱۶۵ کتاب

Matching

Overlapping یا Nonoverlapping Cluster را انتخاب و Start را بزنید. پس از پردازش، نتیجه بر اساس Cluster دیده می‌شود. رابط شبیه نتیجهٔ Matching Policy است، اما Column اضافی Check Box دارد تا Record به‌عنوان Match رد شود.

Export

مقصد و نوع محتوا تعیین می‌شود:

  • Matching Results: شامل Matched و Unmatched Record. Recordهای Match دارای Cluster Identifier، Matching Rule، Matching Score، Approval Status و Flag مربوط به Pivot Record هستند.
  • Survivorship Results: فقط Survivorship Record و Unmatched Record. Survivorship Rule تعیین می‌کند کدام Record در هر Cluster حفظ شود؛ بقیه حذف می‌شوند. اگر چند Record Criteria را برآورده کنند، DQS رکورد با کمترین Record Identifier را نگه می‌دارد.
شکل ۷-۲۲ — انتخاب محتوای قابل Export در Matching Project.
تصویر مرجع صفحهٔ ۱۸۳تصویر صفحهٔ اصلی برای حفظ کامل نمودارها، جدول‌ها، کدها، رابط‌های کاربری و چیدمان منبع.
تصویر مرجع صفحهٔ ۱۸۳ فایل PDF
صفحهٔ ۱۸۴ فایل PDF — صفحهٔ ۱۶۶ کتاب

Administration

در Data Quality Client شامل Activity Monitoring و Configuration است. همهٔ Userهای دارای دسترسی به Client می‌توانند Monitoring را ببینند، اما Configuration فقط برای Administrator است.

Activity Monitoring

وضعیت Activityهای جاری و تاریخی Data Quality Server را نشان می‌دهد. DQS Administrator می‌تواند با راست‌کلیک، Activity یا Step داخل آن را Terminate کند.

شکل ۷-۲۳ — وضعیت Activityها و Stepهای Activity انتخاب‌شده.
تصویر مرجع صفحهٔ ۱۸۴تصویر صفحهٔ اصلی برای حفظ کامل نمودارها، جدول‌ها، کدها، رابط‌های کاربری و چیدمان منبع.
تصویر مرجع صفحهٔ ۱۸۴ فایل PDF
صفحهٔ ۱۸۵ فایل PDF — صفحهٔ ۱۶۷ کتاب

Activityهای Knowledge Discovery، Domain Management، Matching Policy، Cleansing Project، Matching Project و DQS Cleansing Transformation در Integration Services نمایش داده می‌شوند. Initiator، Start/End Time و Elapsed Time قابل مشاهده‌اند. Filter بر اساس Date Range، Status، Type، Subtype، Knowledge Base یا User است. انتخاب Activity، Stepها و Profiler Information را نشان می‌دهد.

Export The Selected Activity To Excel جزئیات را در چهار Worksheet می‌نویسد:

  • Activity: Name، Type، Subtype، Current Status، Elapsed Time و جزئیات دیگر.
  • Processes: Status، Start/End Time و Elapsed Time هر Step.
  • Profiler – Source: برای Cleansing شمار Total، Correct، Corrected و Invalid Record؛ برای Knowledge Discovery، Domain Management، Matching Policy و Matching شمار Record، Total Value، New Value، Unique Value و New Unique Value.
  • Profiler – Fields: برای Cleansing و SSIS Cleansing، Domain، Corrected Value، Suggested Value، Completeness و Accuracy؛ برای سایر Subtypeها، Domain، New Value Count، Unique Value Count، Valid In Domain Count و Completeness.

Configuration

برای تنظیم Reference Data Provider، Propertyهای Data Quality Server و Logging است و فقط DQS Administrator دسترسی دارد.

Reference Data

به‌جای نگه‌داری Domain Value و Rule می‌توان از Reference Data Service در Windows Azure Marketplace اشتراک گرفت. بیشتر Serviceها اشتراک ماهانه و برخی Trial رایگان دارند؛ Digital Trowel نیز Service رایگانی برای پاک‌سازی و Standardize دادهٔ شرکت‌های عمومی و خصوصی ایالات متحده ارائه می‌کرد. Account Key اشتراک باید در Client Register شود.

تصویر مرجع صفحهٔ ۱۸۵تصویر صفحهٔ اصلی برای حفظ کامل نمودارها، جدول‌ها، کدها، رابط‌های کاربری و چیدمان منبع.
تصویر مرجع صفحهٔ ۱۸۵ فایل PDF
صفحهٔ ۱۸۶ فایل PDF — صفحهٔ ۱۶۸ کتاب

در Reference Data، Account Key در DataMarket Account ID وارد و Validate DataMarket Account ID زده می‌شود. اگر DQS Server برای اینترنت به Proxy نیاز دارد، Proxy Server و Port نیز وارد می‌شوند.

شکل ۷-۲۴ — پیکربندی حساب Reference Data Service.

به‌جای DataMarket می‌توان Provider شخص ثالث را با Add New Reference Data Service Provider تعریف کرد: Service Name، فهرست Comma-Delimited Fieldها به‌عنوان Schema، Secure URI، Maximum Records Per Batch و Subscriber Account Identifier.

تصویر مرجع صفحهٔ ۱۸۶تصویر صفحهٔ اصلی برای حفظ کامل نمودارها، جدول‌ها، کدها، رابط‌های کاربری و چیدمان منبع.
تصویر مرجع صفحهٔ ۱۸۶ فایل PDF
صفحهٔ ۱۸۷ فایل PDF — صفحهٔ ۱۶۹ کتاب

General Settings

  • Interactive Cleansing: Minimum Confidence برای Suggestion و Auto-Correction؛ Threshold طبقه‌بندی Recordها.
  • Matching: Minimum Matching Score برای Matching Policy.
  • Profiler: فعال یا غیرفعال‌کردن Profiling Notification هنگام Knowledge Base Activity یا Data Quality Project.
شکل ۷-۲۵ — General Settings برای Thresholdهای Score و Notification.

Log Settings

Log برای عیب‌یابی است. پیش‌فرض Severity برابر Error است، اما برای هر Activity می‌تواند Fatal، Warn، Info یا Debug باشد.

شکل ۷-۲۶ — Log Settings مربوط به Data Quality Server.
تصویر مرجع صفحهٔ ۱۸۷تصویر صفحهٔ اصلی برای حفظ کامل نمودارها، جدول‌ها، کدها، رابط‌های کاربری و چیدمان منبع.
تصویر مرجع صفحهٔ ۱۸۷ فایل PDF
صفحهٔ ۱۸۸ فایل PDF — صفحهٔ ۱۷۰ کتاب

DQS سه نوع Log File می‌سازد:

  • Data Quality Server: فایل DQServerLog.DQS_MAIN.log در پوشهٔ Program Files\Microsoft SQL Server\MSSQL11.MSSQLSERVER\MSSQL\Log.
  • Data Quality Client: فایل DQClientLog.log در %APPDATA%\SSDQS\Log.
  • DQS Cleansing Transformation: فایل DQSSSISLog.log در همان پوشهٔ AppData هنگام اجرای Package.

علاوه بر Activity، Severity در سطح Module نیز در بخش Advanced قابل تنظیم است. Module با نام Microsoft.Ssdqs.Core.Startup پیش‌فرض Info دارد تا Start و Stop Service را ثبت کند. Moduleهای دیگر از Drop-down انتخاب می‌شوند.

یکپارچه‌سازی

Cleansing و Matching DQS در Integration Services و Master Data Services تعبیه شده‌اند. Integration Services پاک‌سازی دوره‌ای را در Package زمان‌بندی‌شده انجام می‌دهد؛ MDS دادهٔ خارجی را با Master Data و Matching Policy مقایسه می‌کند.

تصویر مرجع صفحهٔ ۱۸۸تصویر صفحهٔ اصلی برای حفظ کامل نمودارها، جدول‌ها، کدها، رابط‌های کاربری و چیدمان منبع.
تصویر مرجع صفحهٔ ۱۸۸ فایل PDF
صفحهٔ ۱۸۹ فایل PDF — صفحهٔ ۱۷۱ کتاب

Integration Services

در نسخه‌های پیشین Cleansing با Derived Column یا Script Transformation ممکن بود، اما Data Flow پیچیده زمان‌بر بود. اکنون Rule یا Reference Data یک Knowledge Base با DQS استفاده می‌شود. وظیفه‌های Cleansing Project به‌صورت زمان‌بندی‌شده انجام می‌شوند و Source می‌تواند غیر از Excel یا SQL Server Database باشد.

قابلیت DQS داخلی محصول است و نصب اضافی نمی‌خواهد، اما Data Quality Server و Knowledge Base لازم‌اند. DQS Connection Manager، Data Flow Task و DQS Cleansing Transformation به Package افزوده می‌شوند.

DQS Connection Manager

اتصال Package به Data Quality Server را برقرار می‌کند. Server Name وارد و اتصال Test می‌شود.

شکل ۷-۲۷ — Icon و رابط DQS Connection Manager.

DQS Cleansing Transformation

داده را به Data Quality Server می‌فرستد؛ Server Cleansing را اجرا و داده را همراه Corrected Value و Status بازمی‌گرداند. Conditional Split می‌تواند Recordها را بر اساس Status به Destinationهای جدا بفرستد.

پیکربندی با انتخاب Connection Manager و Knowledge Base آغاز می‌شود و Domainها و Composite Domainها نمایش داده می‌شوند.

تصویر مرجع صفحهٔ ۱۸۹تصویر صفحهٔ اصلی برای حفظ کامل نمودارها، جدول‌ها، کدها، رابط‌های کاربری و چیدمان منبع.
تصویر مرجع صفحهٔ ۱۸۹ فایل PDF
صفحهٔ ۱۹۰ فایل PDF — صفحهٔ ۱۷۲ کتاب
شکل ۷-۲۸ — پیکربندی Connection Manager برای DQS Cleansing Transformation.

در Mapping، هر Pipeline Column به Domain متناظر نگاشت می‌شود. برای Composite Domain، Column باید Valueهای Domain را به‌صورت Comma-Delimited و با همان ترتیب Domainهای عضو داشته باشد.

شکل ۷-۲۹ — نگاشت Pipeline Column به Domain.
تصویر مرجع صفحهٔ ۱۹۰تصویر صفحهٔ اصلی برای حفظ کامل نمودارها، جدول‌ها، کدها، رابط‌های کاربری و چیدمان منبع.
تصویر مرجع صفحهٔ ۱۹۰ فایل PDF
صفحهٔ ۱۹۱ فایل PDF — صفحهٔ ۱۷۳ کتاب

برای هر Input Column، Aliasهای Output Columnهای Source، Output و Status تعیین می‌شوند. Default قابل تغییر است. Source Alias مقدار اصلی را دارد؛ Output Alias برای Correct و Invalid همان مقدار و برای Suggested یا Corrected مقدار اصلاح‌شده را دارد. Status Alias یکی از Auto Suggest، Correct، Invalid یا New است.

گزینه‌های Advanced:

  • Standardize Output: پیش‌فرض فعال؛ دادهٔ Output Alias را بر اساس Format Output هر Domain استاندارد و در صورت فعال بودن Use Leading Values، Synonym را به Leading Value تبدیل می‌کند.
  • Enable Field-Level Columns: افزودن Confidence Score یا Reason Correction به خروجی.
  • Enable Record-Level Columns: اگر RDS Columnهای اضافه برگرداند، آن‌ها و Schema مربوط به Appended Data به خروجی افزوده می‌شوند.

Master Data Services

در MDS می‌توان از Matching DQS برای De-duplicate کردن Master Data استفاده کرد. ابتدا DQS Integration در Web Configuration مربوط به MDS Configuration Manager فعال و Matching Policy در Knowledge Base ساخته می‌شود. سپس داده به Excel Worksheet افزوده و با MDS Add-in for Excel با دادهٔ تحت مدیریت MDS ترکیب می‌شود. Matching Columnهایی مشابه Matching Project، از جمله Matching Score، به Worksheet می‌افزاید. فصل ۸ جزئیات را توضیح می‌دهد.

تصویر مرجع صفحهٔ ۱۹۱تصویر صفحهٔ اصلی برای حفظ کامل نمودارها، جدول‌ها، کدها، رابط‌های کاربری و چیدمان منبع.
تصویر مرجع صفحهٔ ۱۹۱ فایل PDF
صفحهٔ ۱۹۲ فایل PDF — صفحهٔ جداکننده

این صفحه در نسخهٔ اصلی عمداً بدون محتوای متنی است.

تصویر مرجع صفحهٔ ۱۹۲تصویر صفحهٔ اصلی برای حفظ کامل نمودارها، جدول‌ها، کدها، رابط‌های کاربری و چیدمان منبع.
تصویر مرجع صفحهٔ ۱۹۲ فایل PDF
فروش یا انتشار این ترجمه منوط به داشتن مجوز لازم از صاحب حقوق اثر است.

امتیاز کاربران به این مقاله

☆☆☆☆☆

0 نفر امتیاز داده اند. میانگین: 0.0 از 5

 

0 نظر

نظر محترم شما در مورد مقاله های وب سایت برنامه نویسی و پایگاه داده

نظرات محترم شما در خدمات رسانی بهتر ما را یاری می نمایند. لطفا اگر مایل بودید یک نظر ما را مهمان فرمائید. آدرس ایمیل و وب سایت شما نمایش داده نخواهد شد.

0 / 500