एक शब्द-खेल के लिए कानूनी स्ट्रिंग्स की एक सूची से अधिक की ज़रूरत होती है। इसमें यह बताना ज़रूरी है कि प्रत्येक का अर्थ क्या है, और अर्थ संग्रहीत करने की सबसे कठिन चीज़ है।
अंग्रेज़ी में लिखा और संपादित। यह हिन्दी संस्करण मशीनी अनुवाद से तैयार किया गया है; जहाँ सटीकता महत्वपूर्ण हो, वहाँ अंग्रेज़ी मूल ही प्रामाणिक है। मूल अंग्रेज़ी में पढ़ें →
WordChess 25×25 बोर्ड पर खेला जाता है, जिसमें 148,941 शब्दों वाला एक अंग्रेज़ी शब्दकोश है 6, जिसकी प्रविष्टियाँ औसतन 8.6 अक्षरों की हैं और सबसे लंबी 27 अक्षरों तक जाती है। यह आसान हिस्सा है। वैध शब्दों की सूची बस स्ट्रिंग्स का एक समूह है जिसे खेल स्वीकार करेगा। दिलचस्प हिस्सा खिलाड़ी को यह बताना है कि बोर्ड पर रखी स्ट्रिंग का अर्थ क्या है, और यह एक साथ बाईस भाषाओं में करना।
शब्दकोशकार लेम्मा और उसके वक्रित रूपों के बीच एक स्पष्ट रेखा खींचते हैं। लेम्मा वह मुख्य शब्द है जिसे आप खोजते हैं, run, house, be। इसके चारों ओर सतही रूपों का एक पद्धति-चक्र घूमता है: runs, ran, running। प्रत्येक में एक ही मूल अर्थ होता है, जो एक अलग व्याकरणिक भूमिका के लिए सजाया गया होता है। 3 एक शब्दकोश अपनी गद्य-प्रविष्टियाँ लेम्मा पर खर्च करता है और छायाओं को घर की ओर इशारा करने देता है।
एक शब्द कितनी छायाएँ डालता है, यह भाषा पर निर्भर करता है। अंग्रेज़ी विश्लेषणात्मक है: यह शब्द-क्रम और छोटे सहायक शब्दों पर निर्भर करती है, इसलिए एक क्रिया में कभी-कभी से अधिक रूप नहीं होते। फ़िन्नी जुड़वाँ है, यह स्टम पर प्रत्यय चिपकाकर अर्थ बनाती है। एक एकल फ़िन्नी संज्ञा के लिए लगभग पंद्रह कारकों के लिए वक्रण होता है, एकवचन और बहुवचन में, इससे पहले कि स्वामित्व-अंत और क्लिटिक ऊपर से जुड़ जाएँ; अलग-अलग रूपों की व्यावहारिक गिनती हज़ारों में जाती है। 4 हंगेरियन एक पूरा अंग्रेज़ी वाक्यांश, in my house, को एक शब्द में पैक करती है, házamban। 5
परिभाषाएँ Wiktionary से आती हैं, एक मुफ़्त शब्दकोश जिसे कोई भी संपादित कर सकता है। यह विशाल और बहुभाषी है: यह परियोजना एक सौ से अधिक सक्रिय भाषा-संपादनों और करोड़ों प्रविष्टियों को शामिल करती है, जो वेतनभोगी संपादकीय बोर्ड के बजाय स्वयंसेवकों द्वारा सहयोग से लिखी जाती हैं। 1 22 भाषाओं में चलने वाले एक खेल के लिए, कोई अन्य मुफ़्त शब्दकोश कवरेज के मामले में इससे कहीं नहीं पहुँच पाता।
लेकिन कागज़ पर कवरेज वह कवरेज नहीं है जिसे आप पढ़कर सुना सकें। Wiktionary विभक्त (inflected) रूपों को इस तरह संग्रहीत करता है कि मानव संपादकों को एक ही ग्लॉस दस हज़ार बार न लिखना पड़े। परिभाषा को पूरा लिखने के बजाय, एक गैर-लेम्मा प्रविष्टि में एक form-of टेम्पलेट होता है, एक छोटा-सा संकेतक जो प्रभावतः कहता है, "यह उस लेम्मा का एक विशेष व्याकरणिक रूप है।" 2 smoulders की प्रविष्टि गद्य नहीं है; यह एक टेम्पलेट है जो "third-person singular simple present form of smoulder" (smoulder का अन्य पुरुष एकवचन सामान्य वर्तमान रूप) के रूप में दिखता है। 1
ये संकेतक गोल-मोल त्रुटि नहीं हैं। अंग्रेज़ी Wiktionary पर, लगभग 1.27 मिलियन परिभाषाओं में, लगभग 478,000, एक तिहाई से अधिक, "form of" परिभाषाएँ हैं, लिखे गए अर्थों के बजाय। 1 डेटा वहाँ है। यह बस मोड़ दिया गया है।
इसलिए वह चुनौती जो मायने रखती थी, कभी "शब्द गायब है" नहीं थी। यह थी कि शब्द का अर्थ एक टेम्पलेट के अंदर बैठा था जिसे एक साधारण पार्सर फेंक देता। WordChess की परिभाषाएँ कच्चे Wiktionary डम्प्स को पढ़कर और भाषा-दर-भाषा वक्रण टेम्पलेट्स को विस्तारित करके बनाई गईं, पार्सर को सिखाया गया कि प्रत्येक संकेतक का क्या अर्थ है और इसे एक साधारण ग्लॉस में पुनर्लेखन किया गया। 6
हर भाषा अपने रूपों को अलग-अलग यंत्रों के पीछे छुपाती है। स्पेनिश क्रिया के रूपों को {{forma verbo}} के पीछे रखती है, जो "X का क्रियात्मक रूप" में बदल जाता है। जर्मन विभक्ति और संयुग्मन के रूपों के लिए {{Grundformverweis Dekl/Konj}} का उपयोग करता है। फ़िन्निश {{taivutusmuoto}} पर निर्भर करता है। रूसी अक्सर कोई रूप-टेम्पलेट ही नहीं रखता, विभक्ति-बदला शब्द एक सादा रीडायरेक्ट (собаки → собака) होता है जिसे "रूप के" ग्लॉस प्राप्त करने के लिए अनुसरित करना पड़ता है। 6 हर परिपाटी को संभालें, और कवरेज बढ़ जाती है।
| भाषा | पहले | बाद में | वृद्धि |
|---|---|---|---|
| जर्मन | 45% | 92% | +47 |
| डच | 58% | 90% | +32 |
| फ़िन्निश | 54% | 74% | +20 |
| रूसी | 20% | 70% | +50 |
| ग्रीक | 15% | 57% | +42 |
इस परियोजना के डिज़ाइन और बिल्ड नोट्स से मापा गया। प्रतिशत शब्दकोश प्रविष्टियों का हिस्सा है जिनमें एक उपयोगी परिभाषा या हल हुआ "रूप के" ग्लॉस है।
डेटा कभी भी गायब नहीं था। वह एक पॉइंटर में मोड़ा गया था, और मशीन को शब्द देने का मतलब था उसे खोलना सीखना।
यह सच बोलने लायक है कि खेल अब क्या रखता है। जब WordChess दिखाता है कि собаки собака का एक रूप है, "कुत्ता," तो उसने कुछ समझा नहीं है। उसने एक स्ट्रिंग को दूसरी स्ट्रिंग, एक ग्लॉस, से मैप किया है, एक मानव संपादक के पीछे छोड़े गए समान पॉइंटर्स का अनुसरण करके। यह लेममाइज़ेशन है, प्राकृतिक भाषा प्रसंस्करण का कामकाज़ी घोड़ा: एक सतह रूप को उसकी मूल अवस्था में कम करना ताकि मशीन को ट्रैक करने के लिए अलग-अलग चीज़ें कम हों। 7
यह जानने का एक वास्तविक और उपयोगी प्रकार है। यह खेल को एथेंस या एम्स्टर्डम में "यह शब्द क्या है?" का उत्तर देने की अनुमति देता है, बिना किसी शब्दकोशकार को स्टाफ में रखे। लेकिन यह लुकअप के रूप में जानना है, अर्थ के रूप में जानना नहीं। ग्लॉस एक वादा है कि एक व्यक्ति, उसे पढ़कर, शब्द को पहचानेगा। मशीन वादा रखती है; पाठक अर्थ प्रदान करता है।
कुछ भाषाएँ एक सीमा तक पहुँचती हैं जिसे कोई पार्सर नहीं उठा सकता, क्योंकि डेटा बस वहाँ नहीं है जो खोला जा सके। हंगेरियन प्रविष्टियाँ अक्सर केवल एक उत्पत्ति और अनुवादों की एक तालिका रखती हैं, कोई परिभाषा पाठ नहीं, इसलिए एक पूर्ण पाठक भी खाली हाथ लौटता है। सबसे कठिन मामले वहाँ क्लस्टर होते हैं जहाँ भाषाविज्ञान सबसे कठिन है: चिपकने वाली भाषाएँ जैसे फ़िन्निश और हंगेरियन, जो विशाल पैराडाइम्स पैदा करती हैं, और सिरिलिक और ग्रीक लिपि, जहाँ समुदाय कवरेज शुरू से ही पतला होता है। ग्रीक 15% से 57% तक बढ़ा; यह जर्मन के 92% से बहुत पीछे रुकना स्रोत के बारे में एक तथ्य है, कोड के बारे में नहीं। 6