एक शब्द खेल के लिए वैध स्ट्रिंग्स की एक सूची से अधिक की आवश्यकता होती है। यह बताना चाहिए कि प्रत्येक का अर्थक्या है, और अर्थ संग्रहीत करने की सबसे कठिन चीज़ है।
WordChess 25×25 बोर्ड पर खेला जाता है, जिसमें एक 148,941-शब्द अंग्रेज़ी शब्दकोश6है, जिसमें प्रविष्टियाँ औसतन 8.6 अक्षरों की होती हैं, कुछ 25 तक जाती हैं। यह आसान हिस्सा है। वैध शब्दों की सूची बस स्ट्रिंग्स का एक सेट है जिसे खेल स्वीकार करेगा। दिलचस्प हिस्सा खिलाड़ी को यह बताना है कि बोर्ड पर स्ट्रिंग का अर्थक्या है, और इसे एक साथ बीस-दो भाषाओं में करना है।
शब्दकोशकार एक स्पष्ट रेखा खींचते हैं लेम्मा और इसके झुके हुए रूप। लेम्मा वह मुख्य शब्द है जिसे आप खोजते हैं, run, house, be। इसके चारों ओर सतही रूपों का एक परिभाषा-समूह घूमता है: runs, ran, running। प्रत्येक में एक ही मूल अर्थ होता है, जो अलग-अलग व्याकरणिक भूमिका के लिए सजाया गया होता है।3 कोश अपने विस्तृत विवरण को लेम्मा पर खर्च करता है और छायाओं को घर की ओर इशारा करने देता है।
किसी शब्द की कितनी छायाएँ पड़ती हैं, यह भाषा पर निर्भर करता है। अंग्रेज़ी analyticहै: यह शब्द क्रम और कुछ सहायक शब्दों पर निर्भर करती है, इसलिए किसी क्रिया के अक्सर केवल कुछ ही रूप होते हैं। फ़िन्निश है agglutinative, यह एक मूल शब्द पर उपसर्ग जोड़कर अर्थ बनाती है। एक ही फ़िन्निश संज्ञा कुछ पंद्रह कारकों के लिए झुकी हुई होती है, एकवचन और बहुवचन में, स्वामित्व समापन और क्लिटिक्स जो ऊपर से जुड़ते हैं; अलग-अलग रूपों की व्यावहारिक गिनती हज़ारों तक पहुँच जाती है।4 हंगेरियन एक पूरा अंग्रेज़ी वाक्यांश, मेरे घर में, को एक शब्द में, házamban.5
परिभाषाएँ आती हैं Wiktionary, उस मुफ्त शब्दकोश से जिसे कोई भी संपादित कर सकता है। यह है विशाल और बहुभाषी: यह परियोजना सौ से अधिक सक्रिय भाषा संस्करणों और करोड़ों प्रविष्टियों को कवर करती है, जिन्हें भुगतान वाले संपादकीय बोर्ड के बजाय स्वयंसेवकों द्वारा सहयोग से लिखा गया है।1 22 भाषाओं में चलने वाले एक खेल के लिए, कवरेज के मामले में कोई अन्य मुफ्त शब्दकोश इसकी समीक्षा नहीं कर सकता।
लेकिन कागज़ पर कवरेज वह कवरेज नहीं है जिसे आप पढ़कर सुना सकते हैं। Wiktionary झुके हुए रूपों को इस तरह संग्रहीत करता है कि इससे मानव संपादकों को एक ही ग्लॉस दस हज़ार बार लिखने से बचाया जाता है। एक परिभाषा को स्पष्ट रूप से लिखने के बजाय, एक गैर-लेम्मा प्रविष्टि एक form-of टेम्पलेट, एक छोटा सा संकेतक, वह लेती है जो असल में कहता है, "यह उस लेम्मा का एक विशेष व्याकरणिक रूप है।"2 The entry for smoulders यह गद्य नहीं है; यह एक टेम्पलेट है जो "smoulder के तृतीय पुरुष एकवचन सरल वर्तमान" के रूप में रेंडर होता है।1
ये संकेत गोल-मोल त्रुटि नहीं हैं। अंग्रेज़ी विकिशनरी पर, लगभग 1.27 मिलियन परिभाषाओं में से, लगभग 478,000, यानी एक तिहाई से भी अधिक, "form of" परिभाषाएँ हैं, न कि लिखित अर्थ।1 डेटा वहाँ मौजूद है। यह बस मोड़ दिया गया है।
तो जो चुनौती महत्वपूर्ण थी, वह कभी "शब्द गायब है" नहीं थी। यह थी कि शब्द का अर्थ एक टेम्पलेट के अंदर बसा था जिसे एक साधारण पार्सर फेंक देता। WordChess की परिभाषाएँ बनाई गईं raw Wiktionary dumps and expanding the inflection templates भाषा के अनुसार भाषा, पार्सर को सिखाया गया कि प्रत्येक संकेत का क्या अर्थ है और इसे एक साधारण व्याख्या में पुनर्लिखित किया गया।6
हर भाषा अपने रूपों को अलग-अलग यंत्रों के पीछे छुपाती है। स्पेनिश क्रिया के रूपों को {{forma verbo}}, "X का क्रियात्मक रूप" में बदल दिया जाता है। जर्मन {{Grundformverweis Dekl/Konj}} उत्क्रमित और संयुग्मित रूपों के लिए उपयोग करता है। फिनिश {{taivutusmuoto}}. रूसी अक्सर कोई फ़ॉर्म टेम्पलेट भी संग्रहीत नहीं करती, झुका हुआ शब्द एक खाली रेडिरेक्ट (собаки → собака) है जिसे "फ़ॉर्म ऑफ़" ग्लॉस पुनर्प्राप्त करने के लिए अनुसरण करना होता है।6 प्रत्येक पद्धति का संभालें, और कवरेज बढ़ जाती है।
| भाषा | पहले | बाद में | लाभ |
|---|---|---|---|
| जर्मन | 45% | 92% | +47 |
| डच | 58% | 90% | +32 |
| फ़िनिश | 54% | 74% | +20 |
| रूसी | 20% | 70% | +50 |
| यूनानी | 15% | 57% | +42 |
इस परियोजना के डिज़ाइन और निर्माण नोट्स से मापा गया। प्रतिशत शब्दकोश प्रविष्टियों का हिस्सा हैं जिनमें उपयोग योग्य परिभाषा या हल हुआ "फ़ॉर्म ऑफ़" ग्लॉस होता है।
डेटा कभी भी गायब नहीं था। यह एक पॉइंटर में मोड़ दिया गया था, और मशीन को शब्द देने का मतलब था उसे अनफ़ोल्ड करना सीखना।
खेल की वर्तमान स्थिति के बारे में ईमानदार होना ज़रूरी है। जब WordChess दिखाता है कि собаки का एक रूप है собака, "कुत्ता," तो इसने कुछ समझा नहीं है। यह एक स्ट्रिंग को दूसरी स्ट्रिंग, एक ग्लॉस (अनुवाद/व्याख्या), में मैप कर रहा है, बस इसलिए क्योंकि उसने वही पॉइंटर्स (संदर्भ) फॉलो किए हैं जो एक मानव संपादक ने पीछे छोड़े थे। यह lemmatizationहै, नेचुरल-लैंग्वेज प्रोसेसिंग (NLP) की मूलभूत प्रक्रिया: एक सतही रूप को उसके मूल रूप में कम करना, ताकि मशीन को ट्रैक करने के लिए अलग-अलग चीज़ों की संख्या कम हो जाए।7
यह जानने का एक वास्तविक और उपयोगी प्रकार है। यह खेल को एक शब्दकोशकार (lexicographer) के बिना एथेंस या एम्सटरडैम में "यह शब्द क्या है?" का उत्तर देने की अनुमति देता है। लेकिन यह लुकअप (खोज) के रूप में जानना है, अर्थ के रूप में जानना नहीं। ग्लॉस एक वादा है कि कोई व्यक्ति, इसे पढ़कर, उस शब्द को पहचान लेगा। मशीन वह वादा रखती है; पाठक अर्थ प्रदान करता है।
कुछ भाषाएँ एक सीमा से टकराती हैं जिसे कोई भी पार्सर हटा नहीं सकता, क्योंकि डेटा बस वहाँ मौजूद नहीं है जो खुल सके। हंगेरियान प्रविष्टियों में अक्सर केवल एक उत्पत्ति (etymology) और अनुवादों की एक तालिका होती है, कोई परिभाषा पाठ नहीं, इसलिए एक पूर्ण पाठक भी खाली हाथ लौट आता है। सबसे कठिन मामले वहाँ केंद्रित होते हैं जहाँ भाषाविज्ञान सबसे कठिन है: फिनिश और हंगेरियान जैसे जुड़ाव वाले (agglutinative) भाषाएँ, जो विशाल परिभाषाएँ (paradigms) पैदा करती हैं, और सिरिलिक और यूनानी लिपियाँ, जहाँ समुदाय की कवरेज शुरू से ही पतली होती है। यूनानी 15% से बढ़कर 57% तक पहुँची; यह तथ्य है कि यह जर्मन के 92% से बहुत पीछे रह जाती है, यह स्रोत के बारे में है, कोड के बारे में नहीं। 6