صفحهٔ ۱۵۹ فایل PDF — صفحهٔ ۱۴۱ کتاب
فصل ۷
Data Quality Services
کیفیت داده برای بسیاری از پروژهها، چه عملیات عمومی کسبوکار و چه هوش تجاری، عامل حیاتی موفقیت است. دادهٔ نامناسب در اثر ورود کاربر، خرابی هنگام انتقال، فرایندهای کسبوکار یا استانداردهای متعارض میان Data Sourceها وارد برنامهها میشود. Data Quality Services یا DQS در Microsoft SQL Server 2012 مجموعهای از فناوریها برای اندازهگیری و مدیریت کیفیت داده از راه ترکیب فرایندهای رایانهیار و دستی است. دادهٔ باکیفیت، اثربخشی فرایند کسبوکار و تصمیمگیری مدیران را بهتر میکند. متمرکزکردن مدیریت کیفیت داده نیز زمان صرفشده برای بازبینی و اصلاح را کاهش میدهد.
معماری Data Quality Services
دو Component اصلی DQS عبارتاند از Data Quality Server و Data Quality Client. معماری شامل Componentهای داخلی قابلیتهای دیگر SQL Server 2012 نیز هست؛ برای نمونه DQS Cleansing Transformation در Integration Services، Ruleهای پاکسازی داده را روی Data Flow Pipeline اعمال میکند و Master Data Services از DQS Matching برای حذف دادهٔ تکراری پیش از افزودن به Master Data استفاده میکند. همهٔ Componentها میتوانند روی یک Server یا Serverهای جدا نصب شوند.
Data Quality Server
هستهٔ معماری است و ذخیرهٔ Knowledge و اجرای فرایندهای مرتبط را مدیریت میکند. شامل DQS Engine و چند پایگاهداده در نمونهٔ محلی SQL Server 2012 است. این پایگاهدادهها Knowledge Base، Stored Procedureهای مدیریت Server و محتوا، و دادهٔ فعالیتهای Cleansing، Matching و Data Profiling را نگه میدارند.
نصب چندمرحلهای است: در SQL Server Setup حداقل Database Engine و Data Quality Services را در Feature Selection انتخاب کنید. سپس از پوشهٔ Data Quality Services در گروه Microsoft SQL Server 2012، Data Quality Server Installer را اجرا کنید. در Command Window رمز Database Master Key درخواست میشود.
تصویر مرجع صفحهٔ ۱۵۹ فایل PDF
صفحهٔ ۱۶۰ فایل PDF — صفحهٔ ۱۴۲ کتاب
Password باید دستکم هشت کاراکتر و شامل حداقل یک حرف بزرگ، یک حرف کوچک و یک کاراکتر ویژه باشد. پس از ورود Password معتبر، نصب چند دقیقه ادامه مییابد، Assemblyها ساخته و Register میشوند و پایگاهدادههای زیر ایجاد میشوند:
- DQS_MAIN: پایگاهدادهٔ اصلی Data Quality Server؛ شامل Knowledge Baseهای Published و Stored Procedureهای DQS Engine. پس از نصب Knowledge Base نمونهای با نام DQS Data دارد که برای پاکسازی دادهٔ کشورها یا موقعیتهای جغرافیایی ایالات متحده استفاده میشود.
- DQS_PROJECTS: برای استفادهٔ داخلی Server و نگهداری دادهٔ مدیریت Knowledge Base و Data Quality Project.
- DQS_STAGING_DATA: ذخیرهٔ میانی Source Data عملیات DQS و ذخیرهٔ دادهٔ پردازششده برای Export بعدی.
پیش از اتصال Client، کاربر sysadmin باید برای هر User، SQL Server Login بسازد و او را در DQS_MAIN به یکی از نقشهای زیر نگاشت کند:
- dqs_administrator: همهٔ امتیازهای نقشهای دیگر و امتیازهای کامل مدیریتی بهجز افزودن User؛ میتواند Activity یا Process را متوقف و همهٔ Configuration Taskها را در Data Quality Client اجرا کند.
- dqs_kb_editor: همهٔ فعالیتهای DQS بهجز Administration؛ ساخت یا ویرایش Knowledge Base به این نقش نیاز دارد.
- dqs_kb_operator: محدودترین نقش؛ فقط ویرایش و اجرای Data Quality Project و مشاهدهٔ Activity Monitoring.
Data Quality Client
رابط اصلی Data Quality Server و برنامهای مستقل است. Business Userها پروژههای تعاملی Cleansing و Profiling، Data Stewardها ساخت و نگهداری Knowledge Base و Administratorها پیکربندی و مدیریت Server را انجام میدهند.
تصویر مرجع صفحهٔ ۱۶۰ فایل PDF
صفحهٔ ۱۶۱ فایل PDF — صفحهٔ ۱۴۳ کتاب
برای نصب، Data Quality Client را در Feature Selection در SQL Server Setup انتخاب کنید. Microsoft .NET Framework 4.0 در صورت نیاز خودکار نصب میشود.
عضو یکی از نقشهای DQS یا sysadmin میتواند Data Quality Client را از Start Menu باز کند و Data Quality Server را برای اتصال معرفی کند. دکمهٔ Options گزینهٔ Encryption اتصال را ارائه میکند.
صفحهٔ Home سه گروه کار دارد:
- Knowledge Base Management: ساخت Knowledge Base جدید، ویرایش موجود، Knowledge Discovery برای افزودن Value و ساخت Matching Policy.
- Data Quality Projects: ساخت و اجرای پروژههای Data Cleansing یا Data Matching.
- Administration: مشاهدهٔ وضعیت فعالیتهای Knowledge Base، Projectها و DQS Cleansing Transformationهای Packageهای Integration Services؛ همچنین Configuration Server، Logging و Reference Data Service.
مدیریت Knowledge Base
Knowledge Base اطلاعات داده، Valueهای معتبر و نامعتبر و Ruleهای اعتبارسنجی و اصلاح را نگه میدارد. از Sample Data یا بهصورت دستی ساخته، در چند Project استفاده و با خروجی Cleansing و Matching به مرور غنی میشود. سه Activity اصلی عبارتاند از Domain Management، Knowledge Discovery و Matching Policy.
Domain Management
Knowledge Base مجموعهٔ منطقی Domainهاست و هر Domain با یک Field متناظر است. میتوان Knowledge Baseهای جدا برای Customer و Product ساخت یا هر دو را ترکیب کرد.
تصویر مرجع صفحهٔ ۱۶۱ فایل PDF
صفحهٔ ۱۶۲ فایل PDF — صفحهٔ ۱۴۴ کتاب
پس از ساخت Domain، Trusted Value، Invalid Value و نمونهٔ دادهٔ اشتباه، همراه Property و Rule مدیریت میشوند. برای جلوگیری از Conflict چند User، DQS هنگام آغاز Activity، Knowledge Base را Lock میکند. برای Unlock باید تغییرها Publish یا Discard شوند.
Knowledge Base نمونهٔ DQS Data
پیش از ساخت Knowledge Base اختصاصی میتوان DQS Data را برای آشنایی با Client و مفهومها بررسی کرد. Data Quality Client را باز و Open Knowledge Base را انتخاب کنید. DQS Data تنها مورد فهرست است و Domainهای آن نمایش داده میشوند.
شکل ۷-۱ — جزئیات Knowledge Base نمونهٔ DQS Data و مجموعه Domainهای آن.تصویر مرجع صفحهٔ ۱۶۲ فایل PDF
صفحهٔ ۱۶۳ فایل PDF — صفحهٔ ۱۴۵ کتاب
Domain Management را انتخاب و Next کنید. از Domain List، Domainی مانند Country/Region را برگزینید و زبانههای Knowledge را ببینید. Domain Values نشان میدهد Valueهای کشور یا منطقه هنگام Data Cleansing چگونه اصلاح میشوند.
شکل ۷-۲ — Domain Valueهای Country/Region.DQS Data بهطور پیشفرض فقط Domain Value دارد. میتوان Domain Rule برای شرایط دادهٔ معتبر یا Term-Based Relation برای اصلاح Termهای داخل String افزود.
Knowledge Base جدید
در Home روی New Knowledge Base کلیک کنید. Name اجباری و Description اختیاری است. میتوان Knowledge Base خالی، نسخهای از Knowledge Base موجود مانند DQS Data یا Knowledge واردشده از DQS File ساخت؛ فایل DQS با Export از Knowledge Base موجود ایجاد میشود.
تصویر مرجع صفحهٔ ۱۶۳ فایل PDF
صفحهٔ ۱۶۴ فایل PDF — صفحهٔ ۱۴۶ کتاب
پس از ساخت، Domain Management را انتخاب و یک یا چند Domain اضافه کنید. Domain دستی ساخته یا از Knowledge Base دیگر Import میشود؛ همچنین میتوان Domain را از خروجی Data Quality Project ایجاد کرد.
Propertyهای Domain
- Domain Name: در Knowledge Base یکتا و حداکثر ۲۵۶ کاراکتر.
- Description: اختیاری، حداکثر ۲۰۴۸ کاراکتر.
- Data Type: String، Date، Integer یا Decimal.
- Use Leading Values: خروجی Cleansing یا Matching، Leading Value گروه Synonym را استفاده میکند؛ در غیر این صورت Input Value یا Corrected Value برمیگردد.
- Normalize String: فقط برای String؛ کاراکترهای ویژه را هنگام Knowledge Discovery، Cleansing و Matching حذف میکند. برای افزایش دقت De-duplication در رشتههای دارای نشانهگذاری ناسازگار مفید است.
- Format Output To: قالب خروجی را بر اساس Data Type تعیین میکند؛ مانند
Mon-yyyy برای Date، #,##0.00 برای Decimal، #,##0 برای Integer یا Capitalize برای String. - Language: فقط String و زبان Speller را تعیین میکند.
- Enable Speller: خطاهای احتمالی Syntax، Spelling و Sentence Structure را با زیرخط قرمز در Domain Values، Term-Based Relations، Manage Domain Values و Manage And View Results نشان میدهد.
- Disable Syntax Error Algorithms: در حالت عادی DQS پیش از افزودن String Value هنگام Cleansing، Syntax Errorها را بررسی میکند؛ این گزینه آن الگوریتمها را غیرفعال میکند.
تصویر مرجع صفحهٔ ۱۶۴ فایل PDF
صفحهٔ ۱۶۵ فایل PDF — صفحهٔ ۱۴۷ کتاب
شکل ۷-۳ — Propertyهای Domain در Create Domain.Domain Valueها
پس از ساخت Domain، Valueهایی به آن افزوده میشوند که دامنهٔ مقدارهای احتمالی Source را، چه صحیح و چه غلط، نمایش میدهند. وجود Value غلط امکان تعریف Rule اصلاح در Cleansing را فراهم میکند. در Domain Values میتوان Value را دستی افزود، Valid Value را از Excel Import کرد یا String Value با Type برابر Correct یا Error را از Cleansing Project وارد کرد.
Type هر Value:
- Correct: عضو شناختهشدهٔ Domain و بدون Syntax Error.
تصویر مرجع صفحهٔ ۱۶۵ فایل PDF
صفحهٔ ۱۶۶ فایل PDF — صفحهٔ ۱۴۸ کتاب
- Error: عضو Domain اما دارای مقدار نادرست مانند غلط املایی یا اختصار نامطلوب. برای نمونه در Product Domain مقدار
Mtn 500 Silver 52 با Corrected Value برابر Mountain-500 Silver, 52. شناساندن خطاهای معلوم، Cleansing را سریع میکند، هرچند Error میتواند بدون Corrected Value باشد. - Invalid: عضو Domain نیست و Correction ندارد؛ مانند United States در Product Domain.
پس از Publish و بازگشت به Domain Values، رابطهٔ Correct و Incorrect دیده میشود. در مثال Product با نام Adjustable Race، زیرخط رابط نیز احتمال غلط املایی «Adj Race» را نشان میدهد.
شکل ۷-۴ — Domain Value با حالت Error و Corrected Value.اگر چند Correct Value نمایندهٔ یک Entity باشند، آنها را انتخاب و Set Selected Domain Values As Synonyms را بزنید. با راستکلیک و Set As Leading یکی Leading Value میشود. DQS هنگام Cleansing هر Synonym غیرپیشرو را با Leading Value جایگزین میکند.
شکل ۷-۵ — Synonymها برای Leading Value با نام Road-750 Black, 52.تصویر مرجع صفحهٔ ۱۶۶ فایل PDF
صفحهٔ ۱۶۷ فایل PDF — صفحهٔ ۱۴۹ کتاب
Data Quality Client تغییرهای Domain Value در Session جاری را ثبت میکند. آخرین دکمهٔ Toolbar با نام Show/Hide The Domain Values Changes History Panel تاریخچه را نمایش میدهد.
Term-Based Relation
برای یافتن و اصلاح Occurrenceهای رایج در String Value استفاده میشود. بهجای ساخت Synonym برای هر Variation، در Term-Based Relations فهرست String و Correct To متناظر تعریف میشود. برای نمونه Productهایی مانند Mtn-500 Silver, 40 و Mtn End Caps دارند؛ رابطهٔ Term-Based میتواند هر Mtn را به Mountain اصلاح کند.
شکل ۷-۶ — رابطهٔ Term-Based میان Value و Corrected Value.تصویر مرجع صفحهٔ ۱۶۷ فایل PDF
صفحهٔ ۱۶۸ فایل PDF — صفحهٔ ۱۵۰ کتاب
Reference Data
میتوان مشترک Reference Data Service یا RDS شد تا DQS داده را پاکسازی، استاندارد و غنی کند. پیش از تعیین Propertyهای Reference Data باید Provider در Administration پیکربندی شود.
پس از تنظیم DataMarket Account Key، Browse را در Reference Data بزنید و Provider دارای Subscription فعال را انتخاب کنید. در Online Reference Data Service Providers Catalog، Domain به Column شِمای RDS نگاشت میشود. حرف M کنار Columnهای Mandatory است.
تنظیمها:
- Auto Correction Threshold: آستانهٔ Confidence Score؛ رکورد بالاتر از آن خودکار اصلاح میشود.
- Suggested Candidates: شمار Candidateهای Suggested Value قابل بازیابی.
- Min Confidence: حداقل Confidence برای Suggestion؛ پایینتر از آن نادیده گرفته میشود.
شکل ۷-۷ — تنظیمهای Reference Data Service Provider.Domain Rule
شرایط معتبر بودن Domain Value را تعیین میکند، اما برای Correction به کار نمیرود. Add A New Domain Rule را بزنید، Name و Description اختیاری بدهید و Conditionها را در Build A Rule بسازید. برای حداکثر طول، Condition با نام Length Is Less Than Or Equal To و مقدار حد استفاده میشود.
تصویر مرجع صفحهٔ ۱۶۸ فایل PDF
صفحهٔ ۱۶۹ فایل PDF — صفحهٔ ۱۵۱ کتاب
شکل ۷-۸ — Domain Rule برای اعتبارسنجی طول Domain Value.Rule مرکب با چند Condition و منطق AND یا OR ساخته میشود. Run The Selected Domain Rule On Test Data برای Test Valueهای دستی است؛ Test The Domain Rule On All The Terms نتیجه را با Iconهای Correct، Error یا Invalid نمایش میدهد. Apply All Rules وضعیت Valueها را بر اساس Rule جدید Update میکند.
Composite Domain
گاهی یک String پیچیده شامل چند Term با Rule یا Data Type متفاوت است و باید هم اجزا و هم کل Field اعتبارسنجی شوند. مثلاً در Mountain-500 Black, 40، Model، Color و Size جدا بررسی میشوند. Composite Domain این نیاز را رفع میکند.
حداقل دو Domain لازم است. در Domain Management دکمهٔ Create A Composite Domain را بزنید، Name و Description بدهید و Domainهای عضو را انتخاب کنید.
تصویر مرجع صفحهٔ ۱۶۹ فایل PDF
صفحهٔ ۱۷۰ فایل PDF — صفحهٔ ۱۵۲ کتاب
CD Properties
در این زبانه Domainها اضافه، حذف یا تغییر میکنند و Parsing Method تعیین میشود:
- Reference Data: اگر Composite Domain به RDS نگاشت شده، RDS هر Domain را Parse میکند.
- In Order: Valueها به ترتیب Domainهای فهرست Parse میشوند.
- Delimiters: Parsing با Tab، Comma، Space یا Delimiter مشخص. Knowledge-Base Parsing، Domain Valueهای شناختهشده را تشخیص و Unknown Value را با Knowledge به Domain مناسب میافزاید. مثلاً در
Mountain-500 Brown, 40 اگر Model و Size شناخته شوند و Brown ناشناخته باشد، Brown به Color Domain افزوده میشود.
Reference Data
Provider RDS و نگاشت هر Domain Composite به Field جدا در شِمای RDS تعیین میشود. برای اعتبارسنجی Address، Domainهای Address، City، State و Zip ترکیب و به شِمای RDS نگاشت میشوند؛ سپس Cleansing Project Ruleها را اعمال میکند.
CD Rules
Cross-Domain Rule برای اعتبارسنجی، اصلاح و استانداردسازی Valueهای Composite است. Rule دارای If و Then با Conditionهای مربوط به Domainهای جداست. مثال: اگر Model با Mountain- آغاز شود و Size یکی از S، M یا L نباشد، Record نامعتبر شود.
تصویر مرجع صفحهٔ ۱۷۰ فایل PDF
صفحهٔ ۱۷۱ فایل PDF — صفحهٔ ۱۵۳ کتاب
شکل ۷-۹ — Cross-Domain Rule برای اعتبارسنجی Size متناظر در Composite Domain.Value Relations
پس از Knowledge Discovery میتوان تعداد Occurrence هر ترکیب Value در Composite Domain را دید.
شکل ۷-۱۰ — Value Relationها برای Composite Domain.Linked Domain
برای دو Field که از Domain Valueهای یکسان استفاده میکنند، بهجای نگهداری دو Domain جدا میتوان Linked Domain ساخت که Property، Value و Ruleهای Domain مبدأ را به ارث میبرد. در Knowledge Base روی Domain راستکلیک و Create A Linked Domain را انتخاب کنید، یا هنگام Mapping دومین Field به همان Domain، پیشنهاد ساخت Linked Domain را بپذیرید و Name و Description بدهید.
تصویر مرجع صفحهٔ ۱۷۱ فایل PDF
صفحهٔ ۱۷۲ فایل PDF — صفحهٔ ۱۵۴ کتاب
پس از ساخت Linked Domain، افزودن Value یا Rule از طریق هر Domain، Domain دیگر را خودکار Update میکند؛ اما Property فقط در Domain اصلی قابل تغییر است.
پایان Domain Management
DQS برای جلوگیری از Conflict، Knowledge Base را Lock میکند. اگر کار در یک Session تمام نشد، Close را بزنید تا کار ذخیره و Lock حفظ شود. اگر تمام شد Finish و سپس Publish را بزنید تا تغییرها دائمی، پایگاهداده Unlock و Knowledge Base برای دیگران قابل استفاده شود. انتخاب No کار را ذخیره و Lock را نگه میدارد.
Knowledge Discovery
راهی نیمهخودکار برای افزودن Knowledge است و میتواند چند بار با Sourceهای مختلف اجرا شود. Knowledge Base را در Client باز، Knowledge Discovery را انتخاب و مراحل Map، Discover و Manage Domain Values را انجام دهید.
Map
Source Data باید روی Data Quality Server در SQL Server Table/View یا Excel File باشد، اما لازم نیست همان Source نهایی Cleansing یا De-duplication باشد. Columnهای Source به Domain یا Composite Domain نگاشت میشوند و در صورت نیاز Domain جدید همانجا ساخته میشود.
شکل ۷-۱۱ — نگاشت Source Column به Domain برای Knowledge Discovery.تصویر مرجع صفحهٔ ۱۷۲ فایل PDF
صفحهٔ ۱۷۳ فایل PDF — صفحهٔ ۱۵۵ کتاب
Discover
Start فرایند را آغاز میکند. وضعیت سه Phase نشان داده میشود:
- Pre-processing Records: Load و Index رکوردها برای Profiling. وضعیت بهصورت رکورد پردازششده نسبت به کل نشان داده میشود. همهٔ آمارهای Profiler جز Valid In Domain Update میشوند: شمار کل Record، شمار Value بر اساس Field و شمار Unique Value. Valueهای Source با Domain مقایسه و موارد فقط موجود در Source بهعنوان New شناخته میشوند.
- Running Domain Rules: Domain Ruleها ستون Valid In Domain را Update میکنند و درصد پیشرفت نشان داده میشود.
- Running Discovery: داده برای Manage Domain Values تحلیل و Syntax Errorها شناسایی میشوند؛ درصد پیشرفت نمایش داده میشود.
تصویر مرجع صفحهٔ ۱۷۳ فایل PDF
صفحهٔ ۱۷۴ فایل PDF — صفحهٔ ۱۵۶ کتاب
شکل ۷-۱۲ — آمار Source حاصل از تحلیل Data Discovery.آمار Profiler برای سنجش Completeness و Uniqueness Source است. اگر Source برای Domain فقط چند Value جدید یا Invalid Value فراوان داشته باشد، Source دیگری مناسبتر است. Notificationها نیز این شرایط را هشدار میدهند.
شکل ۷-۱۳ — Notification و آمار Source در Profiler.Manage Domain Values
در مرحلهٔ سوم، Unique New Domain Valueها با Type و Suggested Correction نمایش داده میشوند. Value، Type و Corrected Value قابل تغییرند و مانند Domain Values میتوان Value افزود، حذف یا Synonymها را مدیریت کرد.
تصویر مرجع صفحهٔ ۱۷۴ فایل PDF
صفحهٔ ۱۷۵ فایل PDF — صفحهٔ ۱۵۷ کتاب
در شکل ۷-۱۴ چند Product Model با Mountain- بهعنوان Error علامت خورده و DQS برای همه Corrected Value برابر Mountain-500 پیشنهاد داده است، چون تنها Model از پیش موجود همین بوده و DQS Similar Valueهای Source را غلط املایی فرض کرده است. اگر Modelهای جدید صحیحاند، Type را Correct کنید؛ Correct To خودکار حذف میشود.
شکل ۷-۱۴ — Suggested Correctionهای تولیدشده در Knowledge Discovery.پس از بازبینی همهٔ Domainها، Finish و سپس Publish را بزنید تا Valueهای جدید به Knowledge Base افزوده و Lock باز شود. انتخاب No نتیجهٔ Activity را Discard و Knowledge Base را Unlock میکند.
Matching Policy
برای Projectهایی که با Matching مشکلهایی مانند غلط املایی نام مشتری یا قالب ناسازگار نشانی را اصلاح میکنند لازم است. Policy شامل یک یا چند Matching Rule است که احتمال Match دو Record را تعیین میکند.
تصویر مرجع صفحهٔ ۱۷۵ فایل PDF
صفحهٔ ۱۷۶ فایل PDF — صفحهٔ ۱۵۸ کتاب
Knowledge Base را باز و Matching Policy را انتخاب کنید. سه مرحله Map، Matching Policy و Matching Results هستند.
Map
Field از Excel یا SQL Server Source به Domain یا Composite Domain نگاشت میشود. اگر Domain متناظر وجود ندارد میتوان ساخت. هر Field موردنیاز در Rule بعدی باید در این مرحله انتخاب شود.
Matching Policy
یک یا چند Rule، Matching Score هر جفت Record را تعیین میکنند. اگر Score از Minimum Policy بیشتر باشد، Recordها Match هستند. Create A Matching Rule را بزنید، Name، Description اختیاری و Minimum Matching Score را تعیین کنید. حداقل معمول ۸۰ درصد است، مگر Configuration DQS تغییر کند. سپس Domain Element اضافه و Parameterهای Rule تنظیم میشوند.
شکل ۷-۱۵ — ساخت Matching Rule برای Matching Policy.تصویر مرجع صفحهٔ ۱۷۶ فایل PDF
صفحهٔ ۱۷۷ فایل PDF — صفحهٔ ۱۵۹ کتاب
Similarity Parameter:
- Similar: DQS Score Field دو Record را محاسبه میکند و اگر کمتر از ۶۰ باشد Similarity Score را صفر میگذارد. برای Numeric میتوان Threshold درصدی یا Integer و برای Date مقدار روز، ماه یا سال تعیین کرد.
- Exact: فقط Fieldهای کاملاً یکسان Match هستند؛ Score برابر ۱۰۰، و در غیر این صورت صفر است.
برای هر Domain غیرPrerequisite باید Weight تعیین شود و مجموع Weightها ۱۰۰ باشد. Weight سهم Score Domain در Score کلی است.
با Prerequisite، Similarity خودکار Exact میشود و Match فقط با Value یکسان رخ میدهد، اما این Domain در Score کلی اثر ندارد. این Optimization سرعت Matching را بالا میبرد.
Start Rule را Test میکند. در Retest میتوان از Matchهای پردازششدهٔ اجرای قبل یا دادهٔ Reloadشدهٔ Source استفاده کرد. Matching Results نتیجهٔ Test جاری و قبلی را برای مقایسه نشان میدهد.
شکل ۷-۱۶ — مقایسهٔ نتایج اجرای متوالی Matching Rule.Profiler در اصلاح Rule کمک میکند. Field با Unique Record زیاد ممکن است حذف یا Weight آن کم شود؛ Unique Record کم فقط همراه Completeness بالا مفید است. اگر هر دو پاییناند Field حذف شود. Restore Previous Rule تنظیم قبلی را بازمیگرداند.
تصویر مرجع صفحهٔ ۱۷۷ فایل PDF
صفحهٔ ۱۷۸ فایل PDF — صفحهٔ ۱۶۰ کتاب
Matching Results
نتیجه بهصورت Overlapping Cluster یا Nonoverlapping Cluster بررسی میشود. در Overlapping ممکن است Clusterهای جدا Record مشترک داشته باشند؛ در Nonoverlapping فقط Clusterهای دارای Record مشترک نمایش داده میشوند. Start همهٔ Ruleها را روی Source اعمال میکند.
جدول نتیجه فهرست فیلترشدهٔ Matched Recordها را با Color Code مربوط به Rule نشان میدهد. هر Cluster یک Pivot Record دارد که DQS تصادفی برای نگهداری انتخاب میکند، و یک یا چند Matched Record همراه Score. Filter میتواند Unmatched Record یا Matchهای با Score حداقل ۸۰، ۸۵، ۹۰، ۹۵ یا ۱۰۰ درصد را نشان دهد.
شکل ۷-۱۷ — Matched Recordها بر اساس دو Matching Rule.Color Codeها در Matching Rules و آمار در Matching Results دیده میشوند. با Double-click یک Matched Record، Fieldهای Pivot و Matched کنار هم، Score هر Field و Score کلی نمایش داده میشوند.
شکل ۷-۱۸ — جزئیات Matching Score شامل Field Scoreها و Overall Score.تصویر مرجع صفحهٔ ۱۷۸ فایل PDF