صفحهٔ ۱۷۹ فایل PDF — صفحهٔ ۱۶۱ کتاب
در صورت نیاز میتوان به مرحلهٔ قبل بازگشت، Matching Rule را دقیقتر کرد و دوباره به نتیجه برگشت. پیش از Restart، گزینهٔ Reload Data From Source دادهٔ Source را به Staging Table کپی و دوباره Index میکند؛ Execute On Previous Data از دادهٔ موجود در Staging بدون Re-index استفاده میکند و سریعتر است.
پس از رضایت از نتیجه Finish را بزنید و Matching Policy را در Knowledge Base منتشر کنید. سپس Policy در Matching Data Quality Project قابل استفاده است.
Data Quality Projectها
با Knowledge Base آماده، Data Quality Project میتواند Source Data را پاکسازی یا با Matching Policy رکوردهای مشابه را پیدا کند. نتیجه به SQL Server Database یا CSV Export یا به Domain در Domain Management وارد میشود.
در Home روی New Data Quality Project کلیک، Name و Description اختیاری را وارد و Knowledge Base را انتخاب کنید. Cleansing برای هر Knowledge Base قابل انتخاب است، اما Matching فقط وقتی فعال است که Knowledge Base دارای Matching Policy باشد. Create، Wizard را اجرا و Project را برای دیگر Userها Lock میکند.
Cleansing Project
با تحلیل Source Data بر اساس Knowledge Base آغاز میشود و داده را به Correct و Incorrect طبقهبندی میکند. سپس میتوان Proposed Correctionها را تأیید، رد یا تغییر داد. مراحل عبارتاند از Map، Cleanse، Manage And View Results و Export.
Map
Source، یعنی Excel File یا SQL Server Table/View، مانند Knowledge Discovery به Domainهای Knowledge Base نگاشت میشود. پس از Mapping همهٔ Columnها Next را بزنید.
تصویر مرجع صفحهٔ ۱۷۹ فایل PDF
صفحهٔ ۱۸۰ فایل PDF — صفحهٔ ۱۶۲ کتاب
Cleanse
Start فرایند را آغاز میکند. پس از تحلیل، Profiler آمار گروههای Correct، Corrected، Suggested و Invalid را نشان میدهد. الگوریتمهای DQS Confidence Score محاسبه میکنند و Thresholdهای Auto-Correction و Auto-Suggestion قابل پیکربندیاند. Recordی که Score آن پایینتر از هر دو Threshold است و Correct یا Invalid نیست، New میشود تا در مرحلهٔ بعد دستی اصلاح گردد.
شکل ۷-۱۹ — آمار Profiler پس از پایان Cleansing.Manage And View Results
برای گروههای Suggested، New، Invalid، Corrected و Correct زبانههای جدا با شمار Record وجود دارد. هر زبانه جدول Domain Valueها و تعداد Recordهای دارای هر Value را نشان میدهد.
در صورت وجود، Proposed Corrected Value، Confidence Score و Reason نمایش داده میشوند. انتخاب ردیف، Recordهای دارای Original Value را نشان میدهد و Scroll افقی برای همهٔ Fieldها لازم است.
اگر Speller Domain فعال باشد، غلط احتمالی با زیرخط موجدار قرمز دیده میشود؛ با راستکلیک Suggestionها قابل انتخاب یا Value قابل افزودن به Dictionary است.
تصویر مرجع صفحهٔ ۱۸۰ فایل PDF
صفحهٔ ۱۸۱ فایل PDF — صفحهٔ ۱۶۳ کتاب
شکل ۷-۲۰ — نتایج طبقهبندیشده پس از Data Cleansing خودکار.اگر Source Value بهعنوان Synonym شناخته شود، Correction به Leading Value پیشنهاد میشود. برای این Standardization باید Use Leading Values و Synonymها پیش از اجرای Project در Domain تعریف شده باشند.
پس از بازبینی، Change هر Value یا Record جداگانه تأیید یا رد میشود؛ Approve All Terms و Reject All Terms نیز وجود دارند. Correct To را میتوان با مقدار دستی جایگزین و تأیید کرد. Approved Valueها معمولاً به Corrected و Rejected Valueها به Invalid میروند؛ Approved Value از New به Correct منتقل میشود.
Export
DQS هیچگاه Source Data را هنگام Cleansing تغییر نمیدهد. نتیجه به SQL Server Table یا CSV Export میشود و مرحلهٔ آخر Preview خروجی را نشان میدهد.
شکل ۷-۲۱ — Preview نتیجهٔ Cleansing برای Export.تصویر مرجع صفحهٔ ۱۸۱ فایل PDF
صفحهٔ ۱۸۲ فایل PDF — صفحهٔ ۱۶۴ کتاب
پیش از Export مشخص کنید فقط Data یا Data همراه Cleansing Information صادر شود. اطلاعات Cleansing شامل Original Value، Cleansed Value، دلیل Correction، Confidence Score و Categorization است. DQS بهطور پیشفرض Format Output تعریفشده در Domain را استفاده میکند، مگر Standardize Output پاک شود. Export داده را به مقصد میفرستد و Finish Project را بسته و Unlock میکند.
Matching Project
با Matching Policy موجود، Matchهای Exact و Approximate در Source شناسایی میشوند. بهتر است پس از Cleansing و Export اجرا شود و فایل یا Table خروجی Cleansing بهعنوان Source Matching استفاده گردد. مراحل Map، Matching و Export هستند.
Map
Fieldهای Source به Domain نگاشت میشوند و باید برای هر Domain موجود در Matching Policy یک Field نگاشت شود.
تصویر مرجع صفحهٔ ۱۸۲ فایل PDF
صفحهٔ ۱۸۳ فایل PDF — صفحهٔ ۱۶۵ کتاب
Matching
Overlapping یا Nonoverlapping Cluster را انتخاب و Start را بزنید. پس از پردازش، نتیجه بر اساس Cluster دیده میشود. رابط شبیه نتیجهٔ Matching Policy است، اما Column اضافی Check Box دارد تا Record بهعنوان Match رد شود.
Export
مقصد و نوع محتوا تعیین میشود:
- Matching Results: شامل Matched و Unmatched Record. Recordهای Match دارای Cluster Identifier، Matching Rule، Matching Score، Approval Status و Flag مربوط به Pivot Record هستند.
- Survivorship Results: فقط Survivorship Record و Unmatched Record. Survivorship Rule تعیین میکند کدام Record در هر Cluster حفظ شود؛ بقیه حذف میشوند. اگر چند Record Criteria را برآورده کنند، DQS رکورد با کمترین Record Identifier را نگه میدارد.
شکل ۷-۲۲ — انتخاب محتوای قابل Export در Matching Project.تصویر مرجع صفحهٔ ۱۸۳ فایل PDF
صفحهٔ ۱۸۴ فایل PDF — صفحهٔ ۱۶۶ کتاب
Administration
در Data Quality Client شامل Activity Monitoring و Configuration است. همهٔ Userهای دارای دسترسی به Client میتوانند Monitoring را ببینند، اما Configuration فقط برای Administrator است.
Activity Monitoring
وضعیت Activityهای جاری و تاریخی Data Quality Server را نشان میدهد. DQS Administrator میتواند با راستکلیک، Activity یا Step داخل آن را Terminate کند.
شکل ۷-۲۳ — وضعیت Activityها و Stepهای Activity انتخابشده.تصویر مرجع صفحهٔ ۱۸۴ فایل PDF
صفحهٔ ۱۸۵ فایل PDF — صفحهٔ ۱۶۷ کتاب
Activityهای Knowledge Discovery، Domain Management، Matching Policy، Cleansing Project، Matching Project و DQS Cleansing Transformation در Integration Services نمایش داده میشوند. Initiator، Start/End Time و Elapsed Time قابل مشاهدهاند. Filter بر اساس Date Range، Status، Type، Subtype، Knowledge Base یا User است. انتخاب Activity، Stepها و Profiler Information را نشان میدهد.
Export The Selected Activity To Excel جزئیات را در چهار Worksheet مینویسد:
- Activity: Name، Type، Subtype، Current Status، Elapsed Time و جزئیات دیگر.
- Processes: Status، Start/End Time و Elapsed Time هر Step.
- Profiler – Source: برای Cleansing شمار Total، Correct، Corrected و Invalid Record؛ برای Knowledge Discovery، Domain Management، Matching Policy و Matching شمار Record، Total Value، New Value، Unique Value و New Unique Value.
- Profiler – Fields: برای Cleansing و SSIS Cleansing، Domain، Corrected Value، Suggested Value، Completeness و Accuracy؛ برای سایر Subtypeها، Domain، New Value Count، Unique Value Count، Valid In Domain Count و Completeness.
Configuration
برای تنظیم Reference Data Provider، Propertyهای Data Quality Server و Logging است و فقط DQS Administrator دسترسی دارد.
Reference Data
بهجای نگهداری Domain Value و Rule میتوان از Reference Data Service در Windows Azure Marketplace اشتراک گرفت. بیشتر Serviceها اشتراک ماهانه و برخی Trial رایگان دارند؛ Digital Trowel نیز Service رایگانی برای پاکسازی و Standardize دادهٔ شرکتهای عمومی و خصوصی ایالات متحده ارائه میکرد. Account Key اشتراک باید در Client Register شود.
تصویر مرجع صفحهٔ ۱۸۵ فایل PDF
صفحهٔ ۱۸۶ فایل PDF — صفحهٔ ۱۶۸ کتاب
در Reference Data، Account Key در DataMarket Account ID وارد و Validate DataMarket Account ID زده میشود. اگر DQS Server برای اینترنت به Proxy نیاز دارد، Proxy Server و Port نیز وارد میشوند.
شکل ۷-۲۴ — پیکربندی حساب Reference Data Service.بهجای DataMarket میتوان Provider شخص ثالث را با Add New Reference Data Service Provider تعریف کرد: Service Name، فهرست Comma-Delimited Fieldها بهعنوان Schema، Secure URI، Maximum Records Per Batch و Subscriber Account Identifier.
تصویر مرجع صفحهٔ ۱۸۶ فایل PDF
صفحهٔ ۱۸۷ فایل PDF — صفحهٔ ۱۶۹ کتاب
General Settings
- Interactive Cleansing: Minimum Confidence برای Suggestion و Auto-Correction؛ Threshold طبقهبندی Recordها.
- Matching: Minimum Matching Score برای Matching Policy.
- Profiler: فعال یا غیرفعالکردن Profiling Notification هنگام Knowledge Base Activity یا Data Quality Project.
شکل ۷-۲۵ — General Settings برای Thresholdهای Score و Notification.Log Settings
Log برای عیبیابی است. پیشفرض Severity برابر Error است، اما برای هر Activity میتواند Fatal، Warn، Info یا Debug باشد.
شکل ۷-۲۶ — Log Settings مربوط به Data Quality Server.تصویر مرجع صفحهٔ ۱۸۷ فایل PDF
صفحهٔ ۱۸۸ فایل PDF — صفحهٔ ۱۷۰ کتاب
DQS سه نوع Log File میسازد:
- Data Quality Server: فایل
DQServerLog.DQS_MAIN.log در پوشهٔ Program Files\Microsoft SQL Server\MSSQL11.MSSQLSERVER\MSSQL\Log. - Data Quality Client: فایل
DQClientLog.log در %APPDATA%\SSDQS\Log. - DQS Cleansing Transformation: فایل
DQSSSISLog.log در همان پوشهٔ AppData هنگام اجرای Package.
علاوه بر Activity، Severity در سطح Module نیز در بخش Advanced قابل تنظیم است. Module با نام Microsoft.Ssdqs.Core.Startup پیشفرض Info دارد تا Start و Stop Service را ثبت کند. Moduleهای دیگر از Drop-down انتخاب میشوند.
یکپارچهسازی
Cleansing و Matching DQS در Integration Services و Master Data Services تعبیه شدهاند. Integration Services پاکسازی دورهای را در Package زمانبندیشده انجام میدهد؛ MDS دادهٔ خارجی را با Master Data و Matching Policy مقایسه میکند.
تصویر مرجع صفحهٔ ۱۸۸ فایل PDF
صفحهٔ ۱۸۹ فایل PDF — صفحهٔ ۱۷۱ کتاب
Integration Services
در نسخههای پیشین Cleansing با Derived Column یا Script Transformation ممکن بود، اما Data Flow پیچیده زمانبر بود. اکنون Rule یا Reference Data یک Knowledge Base با DQS استفاده میشود. وظیفههای Cleansing Project بهصورت زمانبندیشده انجام میشوند و Source میتواند غیر از Excel یا SQL Server Database باشد.
قابلیت DQS داخلی محصول است و نصب اضافی نمیخواهد، اما Data Quality Server و Knowledge Base لازماند. DQS Connection Manager، Data Flow Task و DQS Cleansing Transformation به Package افزوده میشوند.
DQS Connection Manager
اتصال Package به Data Quality Server را برقرار میکند. Server Name وارد و اتصال Test میشود.
شکل ۷-۲۷ — Icon و رابط DQS Connection Manager.DQS Cleansing Transformation
داده را به Data Quality Server میفرستد؛ Server Cleansing را اجرا و داده را همراه Corrected Value و Status بازمیگرداند. Conditional Split میتواند Recordها را بر اساس Status به Destinationهای جدا بفرستد.
پیکربندی با انتخاب Connection Manager و Knowledge Base آغاز میشود و Domainها و Composite Domainها نمایش داده میشوند.
تصویر مرجع صفحهٔ ۱۸۹ فایل PDF
صفحهٔ ۱۹۰ فایل PDF — صفحهٔ ۱۷۲ کتاب
شکل ۷-۲۸ — پیکربندی Connection Manager برای DQS Cleansing Transformation.در Mapping، هر Pipeline Column به Domain متناظر نگاشت میشود. برای Composite Domain، Column باید Valueهای Domain را بهصورت Comma-Delimited و با همان ترتیب Domainهای عضو داشته باشد.
شکل ۷-۲۹ — نگاشت Pipeline Column به Domain.تصویر مرجع صفحهٔ ۱۹۰ فایل PDF
صفحهٔ ۱۹۱ فایل PDF — صفحهٔ ۱۷۳ کتاب
برای هر Input Column، Aliasهای Output Columnهای Source، Output و Status تعیین میشوند. Default قابل تغییر است. Source Alias مقدار اصلی را دارد؛ Output Alias برای Correct و Invalid همان مقدار و برای Suggested یا Corrected مقدار اصلاحشده را دارد. Status Alias یکی از Auto Suggest، Correct، Invalid یا New است.
گزینههای Advanced:
- Standardize Output: پیشفرض فعال؛ دادهٔ Output Alias را بر اساس Format Output هر Domain استاندارد و در صورت فعال بودن Use Leading Values، Synonym را به Leading Value تبدیل میکند.
- Enable Field-Level Columns: افزودن Confidence Score یا Reason Correction به خروجی.
- Enable Record-Level Columns: اگر RDS Columnهای اضافه برگرداند، آنها و Schema مربوط به Appended Data به خروجی افزوده میشوند.
Master Data Services
در MDS میتوان از Matching DQS برای De-duplicate کردن Master Data استفاده کرد. ابتدا DQS Integration در Web Configuration مربوط به MDS Configuration Manager فعال و Matching Policy در Knowledge Base ساخته میشود. سپس داده به Excel Worksheet افزوده و با MDS Add-in for Excel با دادهٔ تحت مدیریت MDS ترکیب میشود. Matching Columnهایی مشابه Matching Project، از جمله Matching Score، به Worksheet میافزاید. فصل ۸ جزئیات را توضیح میدهد.
تصویر مرجع صفحهٔ ۱۹۱ فایل PDF
صفحهٔ ۱۹۲ فایل PDF — صفحهٔ جداکننده
این صفحه در نسخهٔ اصلی عمداً بدون محتوای متنی است.
تصویر مرجع صفحهٔ ۱۹۲ فایل PDF