Data Quality Services: معماری و مدیریت پایگاه دانش | آموزش Microsoft SQL Server 2012

Data Quality Services: معماری و مدیریت پایگاه دانش

توسط admin | گروه SQL Server | 1405/05/15

نظرات 0

Data Quality Services: معماری و مدیریت پایگاه دانش

صفحهٔ ۱۵۹ فایل PDF — صفحهٔ ۱۴۱ کتاب

فصل ۷

Data Quality Services

کیفیت داده برای بسیاری از پروژه‌ها، چه عملیات عمومی کسب‌وکار و چه هوش تجاری، عامل حیاتی موفقیت است. دادهٔ نامناسب در اثر ورود کاربر، خرابی هنگام انتقال، فرایندهای کسب‌وکار یا استانداردهای متعارض میان Data Sourceها وارد برنامه‌ها می‌شود. Data Quality Services یا DQS در Microsoft SQL Server 2012 مجموعه‌ای از فناوری‌ها برای اندازه‌گیری و مدیریت کیفیت داده از راه ترکیب فرایندهای رایانه‌یار و دستی است. دادهٔ باکیفیت، اثربخشی فرایند کسب‌وکار و تصمیم‌گیری مدیران را بهتر می‌کند. متمرکزکردن مدیریت کیفیت داده نیز زمان صرف‌شده برای بازبینی و اصلاح را کاهش می‌دهد.

معماری Data Quality Services

دو Component اصلی DQS عبارت‌اند از Data Quality Server و Data Quality Client. معماری شامل Componentهای داخلی قابلیت‌های دیگر SQL Server 2012 نیز هست؛ برای نمونه DQS Cleansing Transformation در Integration Services، Ruleهای پاک‌سازی داده را روی Data Flow Pipeline اعمال می‌کند و Master Data Services از DQS Matching برای حذف دادهٔ تکراری پیش از افزودن به Master Data استفاده می‌کند. همهٔ Componentها می‌توانند روی یک Server یا Serverهای جدا نصب شوند.

Data Quality Server

هستهٔ معماری است و ذخیرهٔ Knowledge و اجرای فرایندهای مرتبط را مدیریت می‌کند. شامل DQS Engine و چند پایگاه‌داده در نمونهٔ محلی SQL Server 2012 است. این پایگاه‌داده‌ها Knowledge Base، Stored Procedureهای مدیریت Server و محتوا، و دادهٔ فعالیت‌های Cleansing، Matching و Data Profiling را نگه می‌دارند.

نصب چندمرحله‌ای است: در SQL Server Setup حداقل Database Engine و Data Quality Services را در Feature Selection انتخاب کنید. سپس از پوشهٔ Data Quality Services در گروه Microsoft SQL Server 2012، Data Quality Server Installer را اجرا کنید. در Command Window رمز Database Master Key درخواست می‌شود.

تصویر مرجع صفحهٔ ۱۵۹تصویر صفحهٔ اصلی برای حفظ کامل نمودارها، جدول‌ها، کدها، رابط‌های کاربری و چیدمان منبع.
تصویر مرجع صفحهٔ ۱۵۹ فایل PDF
صفحهٔ ۱۶۰ فایل PDF — صفحهٔ ۱۴۲ کتاب

Password باید دست‌کم هشت کاراکتر و شامل حداقل یک حرف بزرگ، یک حرف کوچک و یک کاراکتر ویژه باشد. پس از ورود Password معتبر، نصب چند دقیقه ادامه می‌یابد، Assemblyها ساخته و Register می‌شوند و پایگاه‌داده‌های زیر ایجاد می‌شوند:

  • DQS_MAIN: پایگاه‌دادهٔ اصلی Data Quality Server؛ شامل Knowledge Baseهای Published و Stored Procedureهای DQS Engine. پس از نصب Knowledge Base نمونه‌ای با نام DQS Data دارد که برای پاک‌سازی دادهٔ کشورها یا موقعیت‌های جغرافیایی ایالات متحده استفاده می‌شود.
  • DQS_PROJECTS: برای استفادهٔ داخلی Server و نگه‌داری دادهٔ مدیریت Knowledge Base و Data Quality Project.
  • DQS_STAGING_DATA: ذخیرهٔ میانی Source Data عملیات DQS و ذخیرهٔ دادهٔ پردازش‌شده برای Export بعدی.

پیش از اتصال Client، کاربر sysadmin باید برای هر User، SQL Server Login بسازد و او را در DQS_MAIN به یکی از نقش‌های زیر نگاشت کند:

  • dqs_administrator: همهٔ امتیازهای نقش‌های دیگر و امتیازهای کامل مدیریتی به‌جز افزودن User؛ می‌تواند Activity یا Process را متوقف و همهٔ Configuration Taskها را در Data Quality Client اجرا کند.
  • dqs_kb_editor: همهٔ فعالیت‌های DQS به‌جز Administration؛ ساخت یا ویرایش Knowledge Base به این نقش نیاز دارد.
  • dqs_kb_operator: محدودترین نقش؛ فقط ویرایش و اجرای Data Quality Project و مشاهدهٔ Activity Monitoring.

Data Quality Client

رابط اصلی Data Quality Server و برنامه‌ای مستقل است. Business Userها پروژه‌های تعاملی Cleansing و Profiling، Data Stewardها ساخت و نگه‌داری Knowledge Base و Administratorها پیکربندی و مدیریت Server را انجام می‌دهند.

تصویر مرجع صفحهٔ ۱۶۰تصویر صفحهٔ اصلی برای حفظ کامل نمودارها، جدول‌ها، کدها، رابط‌های کاربری و چیدمان منبع.
تصویر مرجع صفحهٔ ۱۶۰ فایل PDF
صفحهٔ ۱۶۱ فایل PDF — صفحهٔ ۱۴۳ کتاب

برای نصب، Data Quality Client را در Feature Selection در SQL Server Setup انتخاب کنید. Microsoft .NET Framework 4.0 در صورت نیاز خودکار نصب می‌شود.

عضو یکی از نقش‌های DQS یا sysadmin می‌تواند Data Quality Client را از Start Menu باز کند و Data Quality Server را برای اتصال معرفی کند. دکمهٔ Options گزینهٔ Encryption اتصال را ارائه می‌کند.

صفحهٔ Home سه گروه کار دارد:

  • Knowledge Base Management: ساخت Knowledge Base جدید، ویرایش موجود، Knowledge Discovery برای افزودن Value و ساخت Matching Policy.
  • Data Quality Projects: ساخت و اجرای پروژه‌های Data Cleansing یا Data Matching.
  • Administration: مشاهدهٔ وضعیت فعالیت‌های Knowledge Base، Projectها و DQS Cleansing Transformationهای Packageهای Integration Services؛ همچنین Configuration Server، Logging و Reference Data Service.

مدیریت Knowledge Base

Knowledge Base اطلاعات داده، Valueهای معتبر و نامعتبر و Ruleهای اعتبارسنجی و اصلاح را نگه می‌دارد. از Sample Data یا به‌صورت دستی ساخته، در چند Project استفاده و با خروجی Cleansing و Matching به مرور غنی می‌شود. سه Activity اصلی عبارت‌اند از Domain Management، Knowledge Discovery و Matching Policy.

Domain Management

Knowledge Base مجموعهٔ منطقی Domainهاست و هر Domain با یک Field متناظر است. می‌توان Knowledge Baseهای جدا برای Customer و Product ساخت یا هر دو را ترکیب کرد.

تصویر مرجع صفحهٔ ۱۶۱تصویر صفحهٔ اصلی برای حفظ کامل نمودارها، جدول‌ها، کدها، رابط‌های کاربری و چیدمان منبع.
تصویر مرجع صفحهٔ ۱۶۱ فایل PDF
صفحهٔ ۱۶۲ فایل PDF — صفحهٔ ۱۴۴ کتاب

پس از ساخت Domain، Trusted Value، Invalid Value و نمونهٔ دادهٔ اشتباه، همراه Property و Rule مدیریت می‌شوند. برای جلوگیری از Conflict چند User، DQS هنگام آغاز Activity، Knowledge Base را Lock می‌کند. برای Unlock باید تغییرها Publish یا Discard شوند.

Knowledge Base نمونهٔ DQS Data

پیش از ساخت Knowledge Base اختصاصی می‌توان DQS Data را برای آشنایی با Client و مفهوم‌ها بررسی کرد. Data Quality Client را باز و Open Knowledge Base را انتخاب کنید. DQS Data تنها مورد فهرست است و Domainهای آن نمایش داده می‌شوند.

شکل ۷-۱ — جزئیات Knowledge Base نمونهٔ DQS Data و مجموعه Domainهای آن.
تصویر مرجع صفحهٔ ۱۶۲تصویر صفحهٔ اصلی برای حفظ کامل نمودارها، جدول‌ها، کدها، رابط‌های کاربری و چیدمان منبع.
تصویر مرجع صفحهٔ ۱۶۲ فایل PDF
صفحهٔ ۱۶۳ فایل PDF — صفحهٔ ۱۴۵ کتاب

Domain Management را انتخاب و Next کنید. از Domain List، Domainی مانند Country/Region را برگزینید و زبانه‌های Knowledge را ببینید. Domain Values نشان می‌دهد Valueهای کشور یا منطقه هنگام Data Cleansing چگونه اصلاح می‌شوند.

شکل ۷-۲ — Domain Valueهای Country/Region.

DQS Data به‌طور پیش‌فرض فقط Domain Value دارد. می‌توان Domain Rule برای شرایط دادهٔ معتبر یا Term-Based Relation برای اصلاح Termهای داخل String افزود.

Knowledge Base جدید

در Home روی New Knowledge Base کلیک کنید. Name اجباری و Description اختیاری است. می‌توان Knowledge Base خالی، نسخه‌ای از Knowledge Base موجود مانند DQS Data یا Knowledge واردشده از DQS File ساخت؛ فایل DQS با Export از Knowledge Base موجود ایجاد می‌شود.

تصویر مرجع صفحهٔ ۱۶۳تصویر صفحهٔ اصلی برای حفظ کامل نمودارها، جدول‌ها، کدها، رابط‌های کاربری و چیدمان منبع.
تصویر مرجع صفحهٔ ۱۶۳ فایل PDF
صفحهٔ ۱۶۴ فایل PDF — صفحهٔ ۱۴۶ کتاب

پس از ساخت، Domain Management را انتخاب و یک یا چند Domain اضافه کنید. Domain دستی ساخته یا از Knowledge Base دیگر Import می‌شود؛ همچنین می‌توان Domain را از خروجی Data Quality Project ایجاد کرد.

Propertyهای Domain

  • Domain Name: در Knowledge Base یکتا و حداکثر ۲۵۶ کاراکتر.
  • Description: اختیاری، حداکثر ۲۰۴۸ کاراکتر.
  • Data Type: String، Date، Integer یا Decimal.
  • Use Leading Values: خروجی Cleansing یا Matching، Leading Value گروه Synonym را استفاده می‌کند؛ در غیر این صورت Input Value یا Corrected Value برمی‌گردد.
  • Normalize String: فقط برای String؛ کاراکترهای ویژه را هنگام Knowledge Discovery، Cleansing و Matching حذف می‌کند. برای افزایش دقت De-duplication در رشته‌های دارای نشانه‌گذاری ناسازگار مفید است.
  • Format Output To: قالب خروجی را بر اساس Data Type تعیین می‌کند؛ مانند Mon-yyyy برای Date، #,##0.00 برای Decimal، #,##0 برای Integer یا Capitalize برای String.
  • Language: فقط String و زبان Speller را تعیین می‌کند.
  • Enable Speller: خطاهای احتمالی Syntax، Spelling و Sentence Structure را با زیرخط قرمز در Domain Values، Term-Based Relations، Manage Domain Values و Manage And View Results نشان می‌دهد.
  • Disable Syntax Error Algorithms: در حالت عادی DQS پیش از افزودن String Value هنگام Cleansing، Syntax Errorها را بررسی می‌کند؛ این گزینه آن الگوریتم‌ها را غیرفعال می‌کند.
تصویر مرجع صفحهٔ ۱۶۴تصویر صفحهٔ اصلی برای حفظ کامل نمودارها، جدول‌ها، کدها، رابط‌های کاربری و چیدمان منبع.
تصویر مرجع صفحهٔ ۱۶۴ فایل PDF
صفحهٔ ۱۶۵ فایل PDF — صفحهٔ ۱۴۷ کتاب
شکل ۷-۳ — Propertyهای Domain در Create Domain.

Domain Valueها

پس از ساخت Domain، Valueهایی به آن افزوده می‌شوند که دامنهٔ مقدارهای احتمالی Source را، چه صحیح و چه غلط، نمایش می‌دهند. وجود Value غلط امکان تعریف Rule اصلاح در Cleansing را فراهم می‌کند. در Domain Values می‌توان Value را دستی افزود، Valid Value را از Excel Import کرد یا String Value با Type برابر Correct یا Error را از Cleansing Project وارد کرد.

Type هر Value:

  • Correct: عضو شناخته‌شدهٔ Domain و بدون Syntax Error.
تصویر مرجع صفحهٔ ۱۶۵تصویر صفحهٔ اصلی برای حفظ کامل نمودارها، جدول‌ها، کدها، رابط‌های کاربری و چیدمان منبع.
تصویر مرجع صفحهٔ ۱۶۵ فایل PDF
صفحهٔ ۱۶۶ فایل PDF — صفحهٔ ۱۴۸ کتاب
  • Error: عضو Domain اما دارای مقدار نادرست مانند غلط املایی یا اختصار نامطلوب. برای نمونه در Product Domain مقدار Mtn 500 Silver 52 با Corrected Value برابر Mountain-500 Silver, 52. شناساندن خطاهای معلوم، Cleansing را سریع می‌کند، هرچند Error می‌تواند بدون Corrected Value باشد.
  • Invalid: عضو Domain نیست و Correction ندارد؛ مانند United States در Product Domain.

پس از Publish و بازگشت به Domain Values، رابطهٔ Correct و Incorrect دیده می‌شود. در مثال Product با نام Adjustable Race، زیرخط رابط نیز احتمال غلط املایی «Adj Race» را نشان می‌دهد.

شکل ۷-۴ — Domain Value با حالت Error و Corrected Value.

اگر چند Correct Value نمایندهٔ یک Entity باشند، آن‌ها را انتخاب و Set Selected Domain Values As Synonyms را بزنید. با راست‌کلیک و Set As Leading یکی Leading Value می‌شود. DQS هنگام Cleansing هر Synonym غیرپیشرو را با Leading Value جایگزین می‌کند.

شکل ۷-۵ — Synonymها برای Leading Value با نام Road-750 Black, 52.
تصویر مرجع صفحهٔ ۱۶۶تصویر صفحهٔ اصلی برای حفظ کامل نمودارها، جدول‌ها، کدها، رابط‌های کاربری و چیدمان منبع.
تصویر مرجع صفحهٔ ۱۶۶ فایل PDF
صفحهٔ ۱۶۷ فایل PDF — صفحهٔ ۱۴۹ کتاب

Data Quality Client تغییرهای Domain Value در Session جاری را ثبت می‌کند. آخرین دکمهٔ Toolbar با نام Show/Hide The Domain Values Changes History Panel تاریخچه را نمایش می‌دهد.

Term-Based Relation

برای یافتن و اصلاح Occurrenceهای رایج در String Value استفاده می‌شود. به‌جای ساخت Synonym برای هر Variation، در Term-Based Relations فهرست String و Correct To متناظر تعریف می‌شود. برای نمونه Productهایی مانند Mtn-500 Silver, 40 و Mtn End Caps دارند؛ رابطهٔ Term-Based می‌تواند هر Mtn را به Mountain اصلاح کند.

شکل ۷-۶ — رابطهٔ Term-Based میان Value و Corrected Value.
تصویر مرجع صفحهٔ ۱۶۷تصویر صفحهٔ اصلی برای حفظ کامل نمودارها، جدول‌ها، کدها، رابط‌های کاربری و چیدمان منبع.
تصویر مرجع صفحهٔ ۱۶۷ فایل PDF
صفحهٔ ۱۶۸ فایل PDF — صفحهٔ ۱۵۰ کتاب

Reference Data

می‌توان مشترک Reference Data Service یا RDS شد تا DQS داده را پاک‌سازی، استاندارد و غنی کند. پیش از تعیین Propertyهای Reference Data باید Provider در Administration پیکربندی شود.

پس از تنظیم DataMarket Account Key، Browse را در Reference Data بزنید و Provider دارای Subscription فعال را انتخاب کنید. در Online Reference Data Service Providers Catalog، Domain به Column شِمای RDS نگاشت می‌شود. حرف M کنار Columnهای Mandatory است.

تنظیم‌ها:

  • Auto Correction Threshold: آستانهٔ Confidence Score؛ رکورد بالاتر از آن خودکار اصلاح می‌شود.
  • Suggested Candidates: شمار Candidateهای Suggested Value قابل بازیابی.
  • Min Confidence: حداقل Confidence برای Suggestion؛ پایین‌تر از آن نادیده گرفته می‌شود.
شکل ۷-۷ — تنظیم‌های Reference Data Service Provider.

Domain Rule

شرایط معتبر بودن Domain Value را تعیین می‌کند، اما برای Correction به کار نمی‌رود. Add A New Domain Rule را بزنید، Name و Description اختیاری بدهید و Conditionها را در Build A Rule بسازید. برای حداکثر طول، Condition با نام Length Is Less Than Or Equal To و مقدار حد استفاده می‌شود.

تصویر مرجع صفحهٔ ۱۶۸تصویر صفحهٔ اصلی برای حفظ کامل نمودارها، جدول‌ها، کدها، رابط‌های کاربری و چیدمان منبع.
تصویر مرجع صفحهٔ ۱۶۸ فایل PDF
صفحهٔ ۱۶۹ فایل PDF — صفحهٔ ۱۵۱ کتاب
شکل ۷-۸ — Domain Rule برای اعتبارسنجی طول Domain Value.

Rule مرکب با چند Condition و منطق AND یا OR ساخته می‌شود. Run The Selected Domain Rule On Test Data برای Test Valueهای دستی است؛ Test The Domain Rule On All The Terms نتیجه را با Iconهای Correct، Error یا Invalid نمایش می‌دهد. Apply All Rules وضعیت Valueها را بر اساس Rule جدید Update می‌کند.

Composite Domain

گاهی یک String پیچیده شامل چند Term با Rule یا Data Type متفاوت است و باید هم اجزا و هم کل Field اعتبارسنجی شوند. مثلاً در Mountain-500 Black, 40، Model، Color و Size جدا بررسی می‌شوند. Composite Domain این نیاز را رفع می‌کند.

حداقل دو Domain لازم است. در Domain Management دکمهٔ Create A Composite Domain را بزنید، Name و Description بدهید و Domainهای عضو را انتخاب کنید.

تصویر مرجع صفحهٔ ۱۶۹تصویر صفحهٔ اصلی برای حفظ کامل نمودارها، جدول‌ها، کدها، رابط‌های کاربری و چیدمان منبع.
تصویر مرجع صفحهٔ ۱۶۹ فایل PDF
صفحهٔ ۱۷۰ فایل PDF — صفحهٔ ۱۵۲ کتاب
CD Properties

در این زبانه Domainها اضافه، حذف یا تغییر می‌کنند و Parsing Method تعیین می‌شود:

  • Reference Data: اگر Composite Domain به RDS نگاشت شده، RDS هر Domain را Parse می‌کند.
  • In Order: Valueها به ترتیب Domainهای فهرست Parse می‌شوند.
  • Delimiters: Parsing با Tab، Comma، Space یا Delimiter مشخص. Knowledge-Base Parsing، Domain Valueهای شناخته‌شده را تشخیص و Unknown Value را با Knowledge به Domain مناسب می‌افزاید. مثلاً در Mountain-500 Brown, 40 اگر Model و Size شناخته شوند و Brown ناشناخته باشد، Brown به Color Domain افزوده می‌شود.
Reference Data

Provider RDS و نگاشت هر Domain Composite به Field جدا در شِمای RDS تعیین می‌شود. برای اعتبارسنجی Address، Domainهای Address، City، State و Zip ترکیب و به شِمای RDS نگاشت می‌شوند؛ سپس Cleansing Project Ruleها را اعمال می‌کند.

CD Rules

Cross-Domain Rule برای اعتبارسنجی، اصلاح و استانداردسازی Valueهای Composite است. Rule دارای If و Then با Conditionهای مربوط به Domainهای جداست. مثال: اگر Model با Mountain- آغاز شود و Size یکی از S، M یا L نباشد، Record نامعتبر شود.

تصویر مرجع صفحهٔ ۱۷۰تصویر صفحهٔ اصلی برای حفظ کامل نمودارها، جدول‌ها، کدها، رابط‌های کاربری و چیدمان منبع.
تصویر مرجع صفحهٔ ۱۷۰ فایل PDF
صفحهٔ ۱۷۱ فایل PDF — صفحهٔ ۱۵۳ کتاب
شکل ۷-۹ — Cross-Domain Rule برای اعتبارسنجی Size متناظر در Composite Domain.
Value Relations

پس از Knowledge Discovery می‌توان تعداد Occurrence هر ترکیب Value در Composite Domain را دید.

شکل ۷-۱۰ — Value Relationها برای Composite Domain.

Linked Domain

برای دو Field که از Domain Valueهای یکسان استفاده می‌کنند، به‌جای نگه‌داری دو Domain جدا می‌توان Linked Domain ساخت که Property، Value و Ruleهای Domain مبدأ را به ارث می‌برد. در Knowledge Base روی Domain راست‌کلیک و Create A Linked Domain را انتخاب کنید، یا هنگام Mapping دومین Field به همان Domain، پیشنهاد ساخت Linked Domain را بپذیرید و Name و Description بدهید.

تصویر مرجع صفحهٔ ۱۷۱تصویر صفحهٔ اصلی برای حفظ کامل نمودارها، جدول‌ها، کدها، رابط‌های کاربری و چیدمان منبع.
تصویر مرجع صفحهٔ ۱۷۱ فایل PDF
صفحهٔ ۱۷۲ فایل PDF — صفحهٔ ۱۵۴ کتاب

پس از ساخت Linked Domain، افزودن Value یا Rule از طریق هر Domain، Domain دیگر را خودکار Update می‌کند؛ اما Property فقط در Domain اصلی قابل تغییر است.

پایان Domain Management

DQS برای جلوگیری از Conflict، Knowledge Base را Lock می‌کند. اگر کار در یک Session تمام نشد، Close را بزنید تا کار ذخیره و Lock حفظ شود. اگر تمام شد Finish و سپس Publish را بزنید تا تغییرها دائمی، پایگاه‌داده Unlock و Knowledge Base برای دیگران قابل استفاده شود. انتخاب No کار را ذخیره و Lock را نگه می‌دارد.

Knowledge Discovery

راهی نیمه‌خودکار برای افزودن Knowledge است و می‌تواند چند بار با Sourceهای مختلف اجرا شود. Knowledge Base را در Client باز، Knowledge Discovery را انتخاب و مراحل Map، Discover و Manage Domain Values را انجام دهید.

Map

Source Data باید روی Data Quality Server در SQL Server Table/View یا Excel File باشد، اما لازم نیست همان Source نهایی Cleansing یا De-duplication باشد. Columnهای Source به Domain یا Composite Domain نگاشت می‌شوند و در صورت نیاز Domain جدید همان‌جا ساخته می‌شود.

شکل ۷-۱۱ — نگاشت Source Column به Domain برای Knowledge Discovery.
تصویر مرجع صفحهٔ ۱۷۲تصویر صفحهٔ اصلی برای حفظ کامل نمودارها، جدول‌ها، کدها، رابط‌های کاربری و چیدمان منبع.
تصویر مرجع صفحهٔ ۱۷۲ فایل PDF
صفحهٔ ۱۷۳ فایل PDF — صفحهٔ ۱۵۵ کتاب

Discover

Start فرایند را آغاز می‌کند. وضعیت سه Phase نشان داده می‌شود:

  • Pre-processing Records: Load و Index رکوردها برای Profiling. وضعیت به‌صورت رکورد پردازش‌شده نسبت به کل نشان داده می‌شود. همهٔ آمارهای Profiler جز Valid In Domain Update می‌شوند: شمار کل Record، شمار Value بر اساس Field و شمار Unique Value. Valueهای Source با Domain مقایسه و موارد فقط موجود در Source به‌عنوان New شناخته می‌شوند.
  • Running Domain Rules: Domain Ruleها ستون Valid In Domain را Update می‌کنند و درصد پیشرفت نشان داده می‌شود.
  • Running Discovery: داده برای Manage Domain Values تحلیل و Syntax Errorها شناسایی می‌شوند؛ درصد پیشرفت نمایش داده می‌شود.
تصویر مرجع صفحهٔ ۱۷۳تصویر صفحهٔ اصلی برای حفظ کامل نمودارها، جدول‌ها، کدها، رابط‌های کاربری و چیدمان منبع.
تصویر مرجع صفحهٔ ۱۷۳ فایل PDF
صفحهٔ ۱۷۴ فایل PDF — صفحهٔ ۱۵۶ کتاب
شکل ۷-۱۲ — آمار Source حاصل از تحلیل Data Discovery.

آمار Profiler برای سنجش Completeness و Uniqueness Source است. اگر Source برای Domain فقط چند Value جدید یا Invalid Value فراوان داشته باشد، Source دیگری مناسب‌تر است. Notificationها نیز این شرایط را هشدار می‌دهند.

شکل ۷-۱۳ — Notification و آمار Source در Profiler.

Manage Domain Values

در مرحلهٔ سوم، Unique New Domain Valueها با Type و Suggested Correction نمایش داده می‌شوند. Value، Type و Corrected Value قابل تغییرند و مانند Domain Values می‌توان Value افزود، حذف یا Synonymها را مدیریت کرد.

تصویر مرجع صفحهٔ ۱۷۴تصویر صفحهٔ اصلی برای حفظ کامل نمودارها، جدول‌ها، کدها، رابط‌های کاربری و چیدمان منبع.
تصویر مرجع صفحهٔ ۱۷۴ فایل PDF
صفحهٔ ۱۷۵ فایل PDF — صفحهٔ ۱۵۷ کتاب

در شکل ۷-۱۴ چند Product Model با Mountain- به‌عنوان Error علامت خورده و DQS برای همه Corrected Value برابر Mountain-500 پیشنهاد داده است، چون تنها Model از پیش موجود همین بوده و DQS Similar Valueهای Source را غلط املایی فرض کرده است. اگر Modelهای جدید صحیح‌اند، Type را Correct کنید؛ Correct To خودکار حذف می‌شود.

شکل ۷-۱۴ — Suggested Correctionهای تولیدشده در Knowledge Discovery.

پس از بازبینی همهٔ Domainها، Finish و سپس Publish را بزنید تا Valueهای جدید به Knowledge Base افزوده و Lock باز شود. انتخاب No نتیجهٔ Activity را Discard و Knowledge Base را Unlock می‌کند.

Matching Policy

برای Projectهایی که با Matching مشکل‌هایی مانند غلط املایی نام مشتری یا قالب ناسازگار نشانی را اصلاح می‌کنند لازم است. Policy شامل یک یا چند Matching Rule است که احتمال Match دو Record را تعیین می‌کند.

تصویر مرجع صفحهٔ ۱۷۵تصویر صفحهٔ اصلی برای حفظ کامل نمودارها، جدول‌ها، کدها، رابط‌های کاربری و چیدمان منبع.
تصویر مرجع صفحهٔ ۱۷۵ فایل PDF
صفحهٔ ۱۷۶ فایل PDF — صفحهٔ ۱۵۸ کتاب

Knowledge Base را باز و Matching Policy را انتخاب کنید. سه مرحله Map، Matching Policy و Matching Results هستند.

Map

Field از Excel یا SQL Server Source به Domain یا Composite Domain نگاشت می‌شود. اگر Domain متناظر وجود ندارد می‌توان ساخت. هر Field موردنیاز در Rule بعدی باید در این مرحله انتخاب شود.

Matching Policy

یک یا چند Rule، Matching Score هر جفت Record را تعیین می‌کنند. اگر Score از Minimum Policy بیشتر باشد، Recordها Match هستند. Create A Matching Rule را بزنید، Name، Description اختیاری و Minimum Matching Score را تعیین کنید. حداقل معمول ۸۰ درصد است، مگر Configuration DQS تغییر کند. سپس Domain Element اضافه و Parameterهای Rule تنظیم می‌شوند.

شکل ۷-۱۵ — ساخت Matching Rule برای Matching Policy.
تصویر مرجع صفحهٔ ۱۷۶تصویر صفحهٔ اصلی برای حفظ کامل نمودارها، جدول‌ها، کدها، رابط‌های کاربری و چیدمان منبع.
تصویر مرجع صفحهٔ ۱۷۶ فایل PDF
صفحهٔ ۱۷۷ فایل PDF — صفحهٔ ۱۵۹ کتاب

Similarity Parameter:

  • Similar: DQS Score Field دو Record را محاسبه می‌کند و اگر کمتر از ۶۰ باشد Similarity Score را صفر می‌گذارد. برای Numeric می‌توان Threshold درصدی یا Integer و برای Date مقدار روز، ماه یا سال تعیین کرد.
  • Exact: فقط Fieldهای کاملاً یکسان Match هستند؛ Score برابر ۱۰۰، و در غیر این صورت صفر است.

برای هر Domain غیرPrerequisite باید Weight تعیین شود و مجموع Weightها ۱۰۰ باشد. Weight سهم Score Domain در Score کلی است.

با Prerequisite، Similarity خودکار Exact می‌شود و Match فقط با Value یکسان رخ می‌دهد، اما این Domain در Score کلی اثر ندارد. این Optimization سرعت Matching را بالا می‌برد.

Start Rule را Test می‌کند. در Retest می‌توان از Matchهای پردازش‌شدهٔ اجرای قبل یا دادهٔ Reloadشدهٔ Source استفاده کرد. Matching Results نتیجهٔ Test جاری و قبلی را برای مقایسه نشان می‌دهد.

شکل ۷-۱۶ — مقایسهٔ نتایج اجرای متوالی Matching Rule.

Profiler در اصلاح Rule کمک می‌کند. Field با Unique Record زیاد ممکن است حذف یا Weight آن کم شود؛ Unique Record کم فقط همراه Completeness بالا مفید است. اگر هر دو پایین‌اند Field حذف شود. Restore Previous Rule تنظیم قبلی را بازمی‌گرداند.

تصویر مرجع صفحهٔ ۱۷۷تصویر صفحهٔ اصلی برای حفظ کامل نمودارها، جدول‌ها، کدها، رابط‌های کاربری و چیدمان منبع.
تصویر مرجع صفحهٔ ۱۷۷ فایل PDF
صفحهٔ ۱۷۸ فایل PDF — صفحهٔ ۱۶۰ کتاب

Matching Results

نتیجه به‌صورت Overlapping Cluster یا Nonoverlapping Cluster بررسی می‌شود. در Overlapping ممکن است Clusterهای جدا Record مشترک داشته باشند؛ در Nonoverlapping فقط Clusterهای دارای Record مشترک نمایش داده می‌شوند. Start همهٔ Ruleها را روی Source اعمال می‌کند.

جدول نتیجه فهرست فیلترشدهٔ Matched Recordها را با Color Code مربوط به Rule نشان می‌دهد. هر Cluster یک Pivot Record دارد که DQS تصادفی برای نگه‌داری انتخاب می‌کند، و یک یا چند Matched Record همراه Score. Filter می‌تواند Unmatched Record یا Matchهای با Score حداقل ۸۰، ۸۵، ۹۰، ۹۵ یا ۱۰۰ درصد را نشان دهد.

شکل ۷-۱۷ — Matched Recordها بر اساس دو Matching Rule.

Color Codeها در Matching Rules و آمار در Matching Results دیده می‌شوند. با Double-click یک Matched Record، Fieldهای Pivot و Matched کنار هم، Score هر Field و Score کلی نمایش داده می‌شوند.

شکل ۷-۱۸ — جزئیات Matching Score شامل Field Scoreها و Overall Score.
تصویر مرجع صفحهٔ ۱۷۸تصویر صفحهٔ اصلی برای حفظ کامل نمودارها، جدول‌ها، کدها، رابط‌های کاربری و چیدمان منبع.
تصویر مرجع صفحهٔ ۱۷۸ فایل PDF
فروش یا انتشار این ترجمه منوط به داشتن مجوز لازم از صاحب حقوق اثر است.

امتیاز کاربران به این مقاله

☆☆☆☆☆

0 نفر امتیاز داده اند. میانگین: 0.0 از 5

 

0 نظر

نظر محترم شما در مورد مقاله های وب سایت برنامه نویسی و پایگاه داده

نظرات محترم شما در خدمات رسانی بهتر ما را یاری می نمایند. لطفا اگر مایل بودید یک نظر ما را مهمان فرمائید. آدرس ایمیل و وب سایت شما نمایش داده نخواهد شد.

0 / 500