Cypha / الشطرنج

عرض المنتج

العب الشطرنج ضد Cypha

لم يرَ Cypha قط مباراة شطرنج. تعلّم بمشاهدة برنامج شطرنج عادي وهو يفكّر — 26,568 وضعية، كل واحدة موسومة بحكم ذلك البرنامج نفسه على مَن يكسب — حتى صار Cypha ينتج الحكم بنفسه.

ما تلعبه أدناه هو ذاك، يعمل في متصفحك داخل بحث ضحل. يمكن هزيمته، ولا يزال يخسر أمام البرنامج الذي تعلّم منه. وكل رقم في هذه الصفحة خرج من التشغيل التدريبي الذي أنتج الأوزان التي تحمّلها الصفحة.

مقيس، لا مُدَّعى

جذر متوسّط مربّع الخطأ (RMSE)، أدناه، هو المقياس المعتاد لمقدار بُعد مجموعة تخمينات عن الصواب؛ وكلّما صغُر اقترب النموذج من معلّمه.

R² على المحجوز
—
RMSE
—
الوضعيات
—
أمام المعلّم
—

R² محسوب على وضعيات محجوزة لم يرَها النموذج أثناء الملاءمة. وسطر المباريات هو Cypha بعمق بحث 2 أمام محرّك المعلّم بالعمق نفسه، بافتتاحيات عشوائية وألوان متبادلة. والأرقام الأربعة كلها تصف النموذج كما قُطِّر — وهي ثابتة، وليست قياسات لنسختك.

نسختك ما زالت تتعلّم. Cypha متعلّم مباشر، فالرأس لا يتوقّف عن الملاءمة عند انتهاء التنزيل. كل نقلة يلعبها ضدّك زوج تدريب إضافي، واللوحة أسفل الرقعة تُظهر كم ابتعدت نسختك عن النسخة المشحونة.
ولا يجعله ذلك يلعب أفضل بعد. مقيس، لا مفترض. على مدى 12 مباراة ذاتية يخفض التصحيح خطأ الرأس في مقابل بحثه هو من 0.76 إلى 0.67 بيدق — وحيث ينجرف الرأس المجمَّد 4.6% نحو الأسوأ خلال جلسة، يتحسّن الرأس المتعلّم بنسبة 5.2% . إذن الملاءمة حقيقية. لكن نسخة دُرِّبت على 1,119 وضعية ثم لُعبت ضد النسخة المشحونة، 24 مباراة بعمق 2 مع تبديل الألوان، تنتهي 6 فوز–7 خسارة–11 تعادل: تعادل تام.

هذه هي النتيجة المتوقَّعة، وذِكرها أولى من إخفائها. فالإشارة هي بحث النموذج نفسه بعمق 2، وهو بالكاد أعمق من رؤية الرأس الساكن — وتعلُّم الاتفاق مع نفسك ليس كالاشتداد. وألف وضعية في مقابل 26,568 قُطِّر عليها لا شيء أيضًا. الادّعاء الصادق هو أن المتعلّم المباشر يعمل ويفعل ما يقوله؛ أما الادّعاء بأنه سيتغلّب على النسخة المشحونة فلم يُستحقّ بعد.
بلغة بسيطة

ما هذا، في دقيقة واحدة

المشكلة

كل تصميم جديد للذكاء الاصطناعي يصل مصحوبًا بشرح لماذا ينبغي أن يعمل. وقراءة الشرح لا تخبرك شيئًا عمّا إذا كان يعمل. والشطرنج يحسم ذلك، لأن الجواب ليس مسألة رأي: إمّا أن يلعب شطرنجًا قانونيًّا معقولًا وإمّا لا، ويمكنك أن تجلس وتعرف بنفسك.

الحل

يحكم برنامج الشطرنج العادي على الوضعية بالبحث أمامًا في النقلات. وعُرضت على Cypha 26,568 من تلك الأحكام فلاءم صيغة واحدة تعيد إنتاجها — سطر رياضيات واحد فوق 388 رقمًا تصف الرقعة. لم يُضَف شيء إلى البنية من أجل الشطرنج. تغيّرت الأرقام المُدخَلة إليه فقط.

لمن هو

كل من يقيّم Cypha ويفضّل أن يتحقّق على أن يُقال له. ومن يعملون في تعلّم الآلة ويريدون مشاهدة نموذج يواصل التعلّم أثناء استعماله. وكل من يشتهي مباراة ببساطة — كل ذلك يعمل في متصفحك، ولا يُرسَل ما تلعبه إلى أي مكان.

نسخُ حكم محرّك شطرنج ليس تعلّمًا للشطرنج. ولا شيء في هذه الصفحة يدّعي ذلك. وبقية الصفحة هي كيف جرى الأمر، وما يعنيه كل رقم، والأمور الأربعة التي لا يستطيعها هذا التصميم.

cypha::Cypha — رأس الشطرنج يتعلّم

انقر قطعة، ثم انقر حيث تذهب. الوجهات القانونية مُعلَّمة.

الوضعية

جارٍ تحميل النموذج…
جلب الأوزان المُقطَّرة.
تقييم Cypha
—
العقد
—

ما نظر فيه Cypha

النقلات

التعلّم منك

التصنيف عند هذا العمق
—
النموذج المستخدم
عمق 2
الوضعيات المتعلَّمة
0
المباريات المنتهية
0
الانجراف عن المشحون
0.00%
آخر تصحيح
—

الانجراف هو حجم التغيّر في متجه الأوزان، نسبةً إلى المتجه المُقطَّر. آخر تصحيح هو مقدار خطأ الرأس الساكن في الوضعية التي تحرّك منها للتوّ، بالبيادق، مقيسًا في مقابل بحثه الأعمق.

التصنيف على سُلَّم داخلي، لا على مقياس Fédération Internationale des Échecs (FIDE) — فلا سبيل صادقًا لوضع رقم FIDE على شيء لم يلعب قط أمام إنسان مصنَّف. ومحرّك المرجع عند العمق 1 مثبَّت عند 1000، وكل شيء مُلاءَم من 210 مباريات بأقصى إرجاح على طريقة برادلي-تيري، فلا يعتمد على ترتيب لعبها. السلّم المقيس: المرجع 1000 / 1171 / 1245 عند الأعماق 1–3، وCypha 798 / 1010 / 1161. يسير Cypha خلف المحرّك الذي قُطِّر منه بعمق بحث واحد تقريبًا، وهوامش الخطأ نحو ±50، وهذا ما تشتريه لك 210 مباريات.

كل إعداد قوة يحتفظ بنموذجه الخاص. الرأس الذي يلعب بعمق 1 يُصحَّح نحو بحث بعمق 1؛ وعند العمق 3 يكون الهدف مختلفًا وأفضل. وتدريب الاثنين في متجه أوزان واحد سيجعلهما يتنازعان فقط. بدّل القوة فتتبدّل العدّادات معها.

التقييم دالّة خطّية في 388 سمة. ليس له عمق بحث خاص به، ولا كتاب افتتاحيات، ولا معرفة بالنهايات. التغلّب عليه متوقَّع؛ والمثير أن رأسًا خطّيًّا واحدًا مُبيَّضًا يعيد إنتاج تقييم بحث محرّك أصلًا — ثم يواصل تصحيح نفسه وأنت تلعب.
المحرّك والسمات والأوزان المُقطَّرة واللاعب كلها تعمل محليًّا. لا يُرسَل أي شيء إلى أي جهة، ولا يُنزَّل أي نموذج أبعد من بضعة كيلوبايتات من المعاملات. وما تتعلّمه نسختك يبقى في متصفحك، وهو ملكك، ولا يُرفَع أبدًا — فلا مباريات أحد آخر تستطيع تحريك نموذجك، ولا مبارياتك تستطيع تحريك نموذجه.
الطريقة

كيف يصير المحرّك نموذج Cypha

هذا تقطير معرفة، بالمكوّنات نفسها التي في كل تطبيق Cypha آخر. لم يُضَف إلى المعمارية أي شيء خاص بالشطرنج — السمات فقط.

سلسلة التقطير: محرّك مرجعي متحقَّق منه بـperft يُعنوِن 26,568 وضعية، تصير 388 سمة، تُلائَم في رأس Cypha بحجم 9.4 كيلوبايت يبلغ R تربيع 0.866 على المحجوز
مرّر لرؤية المخطّط كاملًا →
تقطير، لا اكتشاف. كل رقم في الصندوق الأخير قاسه التشغيل التدريبي الذي أنتج الأوزان التي تحمّلها هذه الصفحة.
الخطوة 1

المعلّم

محرّك 0x88 بتوليد كامل للنقلات القانونية، وتقييم بالمادّة وبجداول القطعة-المربع، وترتيب أثمن ضحية – أرخص مهاجم (MVV-LVA)، وبحث سكون. جرى التحقّق منه في مقابل خمس وضعيات perft قياسية منها kiwipete، فالقواعد صحيحة بالبرهان قبل أن يُتعلَّم منه أي شيء.

الخطوة 2

البيانات

وضعيات مأخوذة من لعب ذاتي بافتتاحيات عشوائية وضوضاء متعمَّدة، فتغطي المجموعة مباريات حقيقية بدل خط ضيّق واحد. وكل وضعية مُعنوَنة بدرجة البحث الخاصة بالمعلّم، مقصوصة عند ±12 بيدقًا كي لا تهيمن درجات الكِش مات.

الخطوة 3

السمات

388 بُعدًا: فرق إشغال قطعة-مربّع بعرض 384 (6 أنواع × 64 مربّعًا) إضافة إلى زوج الفيلة، والبيادق المضاعفة، والحركية، وطور المباراة. دائمًا من منظور الطرف صاحب الدور، فيخدم متجه أوزان واحد اللونين معًا.

الخطوة 4

الملاءمة

‏WorldPrior θ₀ مُلاءَم مباشرةً بخوارزمية Welford، والتبييض بوصفه مقياس التدرّج الطبيعي، وتحديثات أوزان بأقلّ المربّعات المتوسّطة (LMS) المُطبَّعة، واضمحلال أدنى طول وصف (MDL) يشدّ الأوزان نحو المسبق، وذاكرة إعادة موزونة بالمفاجأة عند نسبة Cypha المرجعية 0.30.

لماذا هذا عرض منصف

المعمارية هي التي قامت بالعمل، لا المجال

كل مكوّن في الخطوة 4 مكوّن Cypha حقيقي يؤدي عمله الحقيقي. وWorldPrior هو التوزيع الغاوسي المباشر نفسه الذي يمنح المصنّف ثنائي الأبعاد في صفحة Cypha سطحَ قراره. والتبييض هو ادّعاء الهندسة المعلوماتية مجسَّدًا: التحديثات تتبع التدرّج الطبيعي بدل الخام. واضمحلال MDL هو مسبق Solomonoff معبَّرًا عنه بحدّ انكماشي.

ما تغيّر من أجل الشطرنج هو خريطة السمات والرأس — انحدار بدل تصنيف. وهذه هي الحجّة التي يسوقها ملف README الخاص بـCypha عن كونه نوعًا واحدًا يؤدي عدة أعمال، مختبَرةً على مجال جوابه لا يحتمل اللبس: إمّا أن يلعب شطرنجًا قانونيًّا معقولًا أو لا.

ما لا يُظهره هذا

الحدود بصراحة

  • هو خطّي. دالّة خطية لسمات القطعة-المربع لا تستطيع تمثيل أمان الملك، ولا تفاعلات بنية البيادق، ولا أي شيء يتطلّب جداء سمتين. لها السقف نفسه الذي يصفه ملف Cypha التعريفي لدالّة أو الحصرية (XOR).
  • المعلّم متواضع. المحرّك المرجعي باحث كلاسيكي كفء، لا Stockfish. وتقطيره جيّدًا يعني مطابقة مقيِّم متواضع مطابقةً جيّدة.
  • لا عمق بحث خاص به. القوة هنا تأتي في معظمها من غلاف alpha-beta، تمامًا كما هي للمعلّم.
  • التقطير ليس اكتشافًا. أعاد Cypha إنتاج دالّة تقييم عُرضت عليه. لم يتعلّم الشطرنج من الصفر، ولا شيء في هذه الصفحة يدّعي أنه فعل.
أعد إنتاجه: node tools/chess/perft.js يتحقّق من المحرّك في مقابل وضعيات الاختبار المعيارية، و node tools/chess/train.js يعيد توليد النموذج من الصفر ببذرة ثابتة. والأرقام في أعلى هذه الصفحة تُقرأ مباشرة من الملف الذي ينتجه ذلك التشغيل.