الدروس · الدرس 5 من 6
الشراء بلا معيار مرجعي
كيف تصمّم اختبار قبول على مستنداتك أنت حين يكون كل رقم منشور مقيساً على مستندات غيرك، ولماذا تراوحت ثلاثة أرقام دقة صحيحة من تجربة واحدة بين 99.1% و5.0%، ولماذا لا تكون العتبة المتفق عليها بعد النتيجة عتبةً.
الدرس 5 من 6 · 19 د
لماذا لا يورد هذا المساق أي رقم دقة منشور في أي موضع
لا رقم واحد في هذا المساق يأتي من خارج إريمتان. وذلك قرار، لا إغفال.
رقم الدقة ليس خاصية للنظام. إنه جواب ثلاثة أسئلة اختارها غيرك: أي المستندات، ومقيسة في مقابل أي مرجع، ومعدودة بأي وحدة خطأ. غيّر واحداً من الثلاثة فيتغيّر الرقم، بعشرات النقاط في الغالب، دون أن يحرّف أحد شيئاً. وبقية هذا الدرس تعرض تجربة واحدة تنتج ثلاثة أرقام صحيحة بين 99.1% و5.0%، وكل ذلك المدى يأتي من السؤال الثالث وحده.
فالرقم المنشور، مهما بلغت أمانة الحصول عليه، بيان عن مجموعة مستندات ليست مستنداتك. والمجموعة الوحيدة التي تستطيع التصرّف بناءً على جوابها هي التي في بريدك أنت. والخبر السار أن قياسها أسبوع عمل، وأنه عمل يخصّك أنت وحدك.
ستة قرارات، وكلها تُتَّخذ قبل شراء أي شيء
العيّنة، وطبقاتها
تنقسم مستندات إريمتان الواردة انقساماً حاداً. فـ71% تصل على نموذج المشتري نفسه، بالتخطيط نفسه في كل مرة، ويولّدها نظام المشتري نفسه. و29% ممسوحة ضوئياً أو مصوّرة أو مؤشَّر عليها بخط اليد أو محوَّلة من وكيل على نموذج خاص به. والطبقة هي واحدة من هاتين المجموعتين، تُعامَل وحدها.
وهاتان مشكلتان مختلفتان، والصعبة منهما هي الصغيرة. فسحب عشوائي لستين مستنداً يعطي نحو 17 من النوع الصعب. وهو عدد يكفي لإنتاج رقم ولا يكفي للوثوق به. فسحبت إريمتان 30 و30، وأبلغت عن كل طبقة على حدة، لا رقماً واحداً أبداً.
فرقم الدقة المخلوط متوسطٌ مرجَّح لنظامين مختلفين، والترجيح هو مزيج دفترك، وهو يتغيّر في الموسم القادم.
المرجع الحقيقي، والأرضية التي يكشفها
ستون مستنداً بـ 22 حقلاً تعني 1,320 قيمة. أدخلها كاتبان بصورة مستقلة بواقع 11.6 دقيقة للمستند: أي 23.2 ساعة، زائد 1.8 ساعة للاتفاق على الفروق. أي 25.0 ساعة، أي 615.00 دولاراً. والمرجع الحقيقي هو الجواب الذي تصحّح عليه كل ما عداه.
وتلك هي الخطوة التي تتخطّاها أكثر المصانع، وتخطّيها يكلّف أكثر من الساعات. فقد اختلف الكاتبان على 47 من الحقول الـ 1,320، أي 3.6%. لا عن تهاون. فالترميز غير المألوف يُقرأ قراءتين فعلاً، والتأشير بخط اليد ملتبس فعلاً.
إذاً لا قياس في هذه التجربة يمكن أن يكون أدقّ من 96.4%. وأي رقم فوق ذلك يقع داخل ضجيج المرجع الذي يُقاس عليه. والمصنع الذي لم يحدّد أرضيته قط لا يستطيع تمييز نتيجة جيدة من نتيجة غير قابلة للقياس.
وحدة الخطأ، وفيها يقع المدى كله
| مقيساً بـ | المنظَّمة | غير المنظَّمة | الاثنتان معاً |
|---|---|---|---|
| الحقول الصحيحة | 99.1% | 95.3% | 97.2% |
| المستندات التي كل حقولها صحيحة | 90.0% | 53.3% | 71.7% |
| المستندات التي غيّر فيها حقل خاطئ قراراً | 0 | 3 | 5.0% |
كل صفّ صحيح، وهي أجوبة أسئلة مختلفة. وثمة أيضاً دلالة حسابية تستحق الانتباه. فإذا كان 22 حقلاً كل منها صحيحاً 97.2% من المرات، وكانت الأخطاء مستقلة، فمعدّل المستندات سيكون 53.5%. والمعدّل المرصود 71.7%. فالأخطاء إذاً متكتّلة: فالمستند العسير نفسه صعبٌ في حقول عدة دفعةً واحدة. وهو بالضبط ما تتوقّعه، وبالضبط ما يخفيه رقم على مستوى الحقل.
وواحدة أخرى، لأنها الرقم الذي سيعرضه عليك مورّد. فمرجَّحاً بمزيج دفتر إريمتان الفعلي بدل سحب الثلاثين والثلاثين، يكون معدّل المستندات 79.4% لا 71.7%. أي بفارق 7.7 نقطة، من المستندات الستين نفسها، ولا خطأ في أي من الرقمين. فأبلغ عن الوحدة وعن الترجيح، أو لا تبلغ بشيء.
الإفلات لا الدقة
الدقة هي الكمية الخطأ. فهناك مراجع، والذي يهمّ هو كم مرة يخطئ على نحو لن يلتقطه المراجع.
من الحقول الخاطئة الـ 37، التقط مراجعٌ يعمل بزمن المراجعة المقيس 31، أي 83.8%. أما الـ 6 التي أفلتت فكانت كلها معقولة: تاريخ بالصيغة الصحيحة وهو التاريخ الخطأ، وكمية هي كمية حقيقية لذلك الموديل، وحدّ مسموح هو حدّ عادي.
فالمراجع يلتقط غير المعقول ويفوته المعقول، والأخطاء المعقولة هي التي تغيّر القرارات. وثلاثة من الستة غيّرت قراراً، وثلاثتها في الطبقة غير المنظَّمة.
العتبة، محسوبة ومكتوبة قبل سحب المستندات
| البند | المبلغ |
|---|---|
| المستندات في السنة | 3,180 |
| زمن إدخال الكاتب اليوم | 13.8 دقيقة |
| زمن المراجعة بالأداة، المنظَّمة / غير المنظَّمة | 2.1 / 5.6 دقيقة |
| الوقت الموفَّر سنوياً | 13,931.39 دولاراً |
| ناقص الرسم السنوي | 8,940.00 دولاراً |
| الصافي قبل أي خطأ | 4,991.39 دولاراً |
| خطأ مفلت يبلغ عاقبة حقيقية، واحد من كل 8 بكلفة | 780.00 دولاراً |
| والسبعة الأخرى، تُلتقط لاحقاً بواقع 0.9 ساعة | 22.14 دولاراً |
| الكلفة المتوقعة لخطأ مفلت واحد يغيّر قراراً | 116.87 دولاراً |
| معدّل الإفلات عند التعادل | واحد في كل 74.5 مستند |
| العتبة المكتوبة والموقّعة | واحد في كل 60، وزمن مراجعة دون 4.0 دقيقة |
والعتبة أشدّ من التعادل عمداً، والسبب يستحق أن يُقال صراحةً. فالعتبة الموضوعة عند التعادل بالضبط تشتري سنة عمل بلا مقابل.
المقارنة، وهي في مقابل ما تفعله اليوم لا في مقابل الكمال
أُدخلت المستندات الستون نفسها بأيدي كتّاب إريمتان في الظروف المعتادة وصُحّحت بالطريقة نفسها: 98.9% من الحقول و88.3% من المستندات.
وخرج من ذلك النصف من التمرين أمران، وتقول تيكاند إنه النصف الذي كانت ستبقيه لو لم تستطع إجراء إلا واحد.
الأول أن لا أحد قاس العملية القائمة قط هو الآخر. فكل نقاش في المبنى كان يقارن مرشّحاً مقيساً بقائم غير مقيس. وهكذا يفوز في اجتماع نظامٌ أسوأ مما عندك.
والثاني أن الأخطاء تقع في مواضع مختلفة. فالكتّاب يخطئون في إدخال الكميات والتواريخ تحت ضغط الوقت. والأداة تسيء قراءة الترميز غير المألوف وخط اليد. ومن الحقول الـ 37 التي أخطأت فيها الأداة أصاب الكتّاب 34. ومن الـ 14 التي أخطأ فيها الكتّاب أصابت الأداة 11. والتقاطع 3. والعملية التي يفحص فيها كل طرف الآخر أفضل من أي منهما وحده. وتلك عملية شراء مختلفة عن التي اقتُرحت، ولم تكن مرئية إلا لأن القائم قيس.
ماذا قرّرت الأرقام
على الطبقة غير المنظَّمة: 3 أخطاء مفلتة غيّرت قرارات في 30 مستنداً، أي واحد في كل 10. وذلك ستة أمثال العتبة. وزمن المراجعة 5.6 دقيقة في مقابل حدّ قدره 4.0. فتسقط في الاختبارين، وتسقط قبل أن يجادل أحد.
وعلى الطبقة المنظَّمة: 0 إفلات في 30، وزمن 2.1 دقيقة. تجتاز اختبار الزمن. وهنا الجزء الذي يكاد يُغفل دائماً: لا يمكن إثبات اجتيازها اختبار الخطأ. فمع صفر إخفاق في 30 مستنداً قد يظل المعدّل الحقيقي نحو 3 في كل 30، أي واحد في كل عشرة، وهو المعدّل نفسه الذي يُراد استبعاده. فالنتيجة النظيفة على عيّنة صغيرة ليست دليلاً على معدّل صغير.
فحجم العيّنة الذي تحتاجه تحدّده العتبة التي اخترتها، وأكثر التجارب الأولى أصغر من أن تُثبت الشيء الذي أُجريت لإثباته. ومدّت إريمتان التجربة المنظَّمة إلى 180 مستنداً فحصلت على 1 إفلات، وهو داخل واحد في كل 60 بفسحة.
والقرار: شراؤها للطبقة المنظَّمة، وإبقاء الكتّاب على غير المنظَّمة، وإعادة الاختبار عند التجديد بموجب بند الدرس 4. التقنية نفسها، والمورّد نفسه، ونطاق أضيق، وجواب مختلف. وهو الشكل الذي يعرضه المساق 24.1 لشراء التقاط البيانات، ولا يكرّره هذا المساق.
اختبر فهمكتجربة مورّد تبلّغ عن دقة 97% على مستنداتك. ما الأسئلة الثلاثة قبل أن تتفاعل معها؟أظهر الإجابة
أي مستندات: المزيج كله أم الطبقة السهلة؟ ومقيسة في مقابل أي مرجع، وكم كان الفارق بين اثنين من موظفيك أنت على الحقول نفسها؟ ومعدودة بأي وحدة: حقل، أم مستند كامل، أم قرار تغيّر؟ فتجربة إريمتان نفسها أعطت 97.2% من الحقول، و71.7% من المستندات، و5.0% من المستندات التي تحرّك فيها قرار، كلها من المستندات الستين نفسها. وحتى تظهر الأجوبة الثلاثة على الصفحة، لا تكون 97% رقماً تستطيع التصرّف بناءً عليه في أي اتجاه.
موجّه · صمّم اختبار قبولي وثبّت العتبة أولاً
قبل أي تجربة أو تجربة أولى أو عرض توضيحي، وتحهذهداً قبل أن يرى أحد نتيجة.
تصرّف كمقيّم متشكّك رأى عتبة يُتَّفق علماذاا بعد النتيجة. صمّم اختبار قبول على مستنداتي أنا. سأعطيك: [ما الذي يُفترض أن يفعله النظام]، [أنواع مستنداتي وحصّة كل نوع من حجمي]، [أيها يصل على نموذج ثابت وأيها ممسوح أو مؤشَّر علماذا أو أعاد غيري كتابته]، [المستندات في السنة]، [كم يستغرق موظفوي للمستند اليوم]، [كلفة ساعتي المحمّلة]، [الرسم السنوي]، [كم كلّفتني قيمة خاطئة فعلاً حين أفلتت واحدة، وكم مرة حدث ذلك]. افعل ما يلي. أولاً، قل لي ما الطبقات، وكم مستنداً أسحب من كل طبقة، ومن أين أسحبها، وأصرّ على الإبلاغ لكل طبقة على حدة لا مخلوطاً. ثانياً، قل لي كيف أنشئ المرجع الحقيقي، وكم ساعة سيكلّف، ولماذا يكون معدّل الاختلاف بين اثنين من موظفيّ سقفاً لكل ما سأقيسه بعهذا. ثالثاً، عرّف ثلاث وحدات للخطأ — الحقل، والمستند، والقرار المتغيّر — وقل لي بأيها ستُكتب العتبة. رابعاً، احسب العتبة من أرقامي: الوفر السنوي، والرسم السنوي، والكلفة المتوقعة لخطأ مفلت واحد يغيّر قراراً، ومعدّل الإفلات عند التعادل. ثم اقترح عتبة أشدّ قليلاً من التعادل، وقل لماذا. خامساً، قل لي أصغر عدد من المستندات يلزم لإثبات ذلك المعدّل، ونبّهني إن كانت عيّنتي المزمعة أصغر من أن تُظهره ولو بنتيجة نظيفة. سادساً، أصرّ على قياس عمليتي الحالية على المستندات نفسها بالطريقة نفسها، وقل لي ماذا أفعل إن تبيّن أن الأخطاء في حقول مختلفة.
قد يخطئ الذكاء الاصطناعي — تحقّق من أي شيء ستتصرّف بناءً عليه.
ما تخرج به
- رقم الدقة بيان عن مجموعة مستندات ومرجع ووحدة خطأ. ولا واحد من الثلاثة يخصّك حتى تجري الاختبار.
- اقسم العيّنة إلى طبقات. فالرقم المخلوط متوسط مرجّح لنظامين مختلفين، مرجَّح بمزيج يتغيّر.
- أنشئ مرجعك الحقيقي واقرأ معدّل الاختلاف فيه. اختلف كاتبا إريمتان على 3.6% من الحقول، فلم يكن شيء فوق 96.4% قابلاً للقياس.
- قِس الإفلات لا الدقة. فالمراجع يلتقط غير المعقول ويفوته المعقول، والمعقول هو الذي يحرّك القرارات.
- احسب العتبة قبل التجربة ووقّعها. كان تعادل إريمتان واحداً في كل 74.5 فكتبت واحداً في كل 60.
- قِس ما تفعله اليوم، على المستندات نفسها. لم يفعل ذلك أحد قط، وقد لا تكون أخطاؤه في الحقول نفسها.
- النتيجة النظيفة على 30 مستنداً لا تُثبت معدّلاً قدره واحد في كل 60. فالعتبة هي التي تحدّد حجم العيّنة لا التقويم.