PlayPendium
WordChess · विचार के लिए भोजन

22 भाषाओं में एक मशीन को 149,000 शब्द सिखाना

एक शब्द खेल के लिए वैध स्ट्रिंग्स की एक सूची से अधिक की आवश्यकता होती है। यह बताना चाहिए कि प्रत्येक का अर्थक्या है, और अर्थ संग्रहीत करने की सबसे कठिन चीज़ है।

01 · The लेम्मा और उसके छायाएँ

एक शब्द, और वह सभी रूप जो वह लेता है

WordChess 25×25 बोर्ड पर खेला जाता है, जिसमें एक 148,941-शब्द अंग्रेज़ी शब्दकोश6है, जिसमें प्रविष्टियाँ औसतन 8.6 अक्षरों की होती हैं, कुछ 25 तक जाती हैं। यह आसान हिस्सा है। वैध शब्दों की सूची बस स्ट्रिंग्स का एक सेट है जिसे खेल स्वीकार करेगा। दिलचस्प हिस्सा खिलाड़ी को यह बताना है कि बोर्ड पर स्ट्रिंग का अर्थक्या है, और इसे एक साथ बीस-दो भाषाओं में करना है।

शब्दकोशकार एक स्पष्ट रेखा खींचते हैं लेम्मा और इसके झुके हुए रूप। लेम्मा वह मुख्य शब्द है जिसे आप खोजते हैं, run, house, be। इसके चारों ओर सतही रूपों का एक परिभाषा-समूह घूमता है: runs, ran, running। प्रत्येक में एक ही मूल अर्थ होता है, जो अलग-अलग व्याकरणिक भूमिका के लिए सजाया गया होता है।3 कोश अपने विस्तृत विवरण को लेम्मा पर खर्च करता है और छायाओं को घर की ओर इशारा करने देता है।

किसी शब्द की कितनी छायाएँ पड़ती हैं, यह भाषा पर निर्भर करता है। अंग्रेज़ी analyticहै: यह शब्द क्रम और कुछ सहायक शब्दों पर निर्भर करती है, इसलिए किसी क्रिया के अक्सर केवल कुछ ही रूप होते हैं। फ़िन्निश है agglutinative, यह एक मूल शब्द पर उपसर्ग जोड़कर अर्थ बनाती है। एक ही फ़िन्निश संज्ञा कुछ पंद्रह कारकों के लिए झुकी हुई होती है, एकवचन और बहुवचन में, स्वामित्व समापन और क्लिटिक्स जो ऊपर से जुड़ते हैं; अलग-अलग रूपों की व्यावहारिक गिनती हज़ारों तक पहुँच जाती है।4 हंगेरियन एक पूरा अंग्रेज़ी वाक्यांश, मेरे घर में, को एक शब्द में, házamban.5

02 · हर किसी द्वारा लिखा गया शब्दकोश

परिभाषाएँ कहाँ रहती हैं

परिभाषाएँ आती हैं Wiktionary, उस मुफ्त शब्दकोश से जिसे कोई भी संपादित कर सकता है। यह है विशाल और बहुभाषी: यह परियोजना सौ से अधिक सक्रिय भाषा संस्करणों और करोड़ों प्रविष्टियों को कवर करती है, जिन्हें भुगतान वाले संपादकीय बोर्ड के बजाय स्वयंसेवकों द्वारा सहयोग से लिखा गया है।1 22 भाषाओं में चलने वाले एक खेल के लिए, कवरेज के मामले में कोई अन्य मुफ्त शब्दकोश इसकी समीक्षा नहीं कर सकता।

लेकिन कागज़ पर कवरेज वह कवरेज नहीं है जिसे आप पढ़कर सुना सकते हैं। Wiktionary झुके हुए रूपों को इस तरह संग्रहीत करता है कि इससे मानव संपादकों को एक ही ग्लॉस दस हज़ार बार लिखने से बचाया जाता है। एक परिभाषा को स्पष्ट रूप से लिखने के बजाय, एक गैर-लेम्मा प्रविष्टि एक form-of टेम्पलेट, एक छोटा सा संकेतक, वह लेती है जो असल में कहता है, "यह उस लेम्मा का एक विशेष व्याकरणिक रूप है।"2 The entry for smoulders यह गद्य नहीं है; यह एक टेम्पलेट है जो "smoulder के तृतीय पुरुष एकवचन सरल वर्तमान" के रूप में रेंडर होता है।1

ये संकेत गोल-मोल त्रुटि नहीं हैं। अंग्रेज़ी विकिशनरी पर, लगभग 1.27 मिलियन परिभाषाओं में से, लगभग 478,000, यानी एक तिहाई से भी अधिक, "form of" परिभाषाएँ हैं, न कि लिखित अर्थ।1 डेटा वहाँ मौजूद है। यह बस मोड़ दिया गया है।

03 · A parsing problem, not a data gap

The gloss is unfolding the template

तो जो चुनौती महत्वपूर्ण थी, वह कभी "शब्द गायब है" नहीं थी। यह थी कि शब्द का अर्थ एक टेम्पलेट के अंदर बसा था जिसे एक साधारण पार्सर फेंक देता। WordChess की परिभाषाएँ बनाई गईं raw Wiktionary dumps and expanding the inflection templates भाषा के अनुसार भाषा, पार्सर को सिखाया गया कि प्रत्येक संकेत का क्या अर्थ है और इसे एक साधारण व्याख्या में पुनर्लिखित किया गया।6

हर भाषा अपने रूपों को अलग-अलग यंत्रों के पीछे छुपाती है। स्पेनिश क्रिया के रूपों को {{forma verbo}}, "X का क्रियात्मक रूप" में बदल दिया जाता है। जर्मन {{Grundformverweis Dekl/Konj}} उत्क्रमित और संयुग्मित रूपों के लिए उपयोग करता है। फिनिश {{taivutusmuoto}}. रूसी अक्सर कोई फ़ॉर्म टेम्पलेट भी संग्रहीत नहीं करती, झुका हुआ शब्द एक खाली रेडिरेक्ट (собаки → собака) है जिसे "फ़ॉर्म ऑफ़" ग्लॉस पुनर्प्राप्त करने के लिए अनुसरण करना होता है।6 प्रत्येक पद्धति का संभालें, और कवरेज बढ़ जाती है।

परिभाषा कवरेज, टेम्पलेट विस्तार से पहले → बाद में
भाषापहलेबाद मेंलाभ
जर्मन45%92%+47
डच58%90%+32
फ़िनिश54%74%+20
रूसी20%70%+50
यूनानी15%57%+42

इस परियोजना के डिज़ाइन और निर्माण नोट्स से मापा गया। प्रतिशत शब्दकोश प्रविष्टियों का हिस्सा हैं जिनमें उपयोग योग्य परिभाषा या हल हुआ "फ़ॉर्म ऑफ़" ग्लॉस होता है।

डेटा कभी भी गायब नहीं था। यह एक पॉइंटर में मोड़ दिया गया था, और मशीन को शब्द देने का मतलब था उसे अनफ़ोल्ड करना सीखना।

04 · मशीन के लिए "शब्द जानना" का क्या अर्थ है

एक स्ट्रिंग, और उसके बारे में एक वाक्य

खेल की वर्तमान स्थिति के बारे में ईमानदार होना ज़रूरी है। जब WordChess दिखाता है कि собаки का एक रूप है собака, "कुत्ता," तो इसने कुछ समझा नहीं है। यह एक स्ट्रिंग को दूसरी स्ट्रिंग, एक ग्लॉस (अनुवाद/व्याख्या), में मैप कर रहा है, बस इसलिए क्योंकि उसने वही पॉइंटर्स (संदर्भ) फॉलो किए हैं जो एक मानव संपादक ने पीछे छोड़े थे। यह lemmatizationहै, नेचुरल-लैंग्वेज प्रोसेसिंग (NLP) की मूलभूत प्रक्रिया: एक सतही रूप को उसके मूल रूप में कम करना, ताकि मशीन को ट्रैक करने के लिए अलग-अलग चीज़ों की संख्या कम हो जाए।7

यह जानने का एक वास्तविक और उपयोगी प्रकार है। यह खेल को एक शब्दकोशकार (lexicographer) के बिना एथेंस या एम्सटरडैम में "यह शब्द क्या है?" का उत्तर देने की अनुमति देता है। लेकिन यह लुकअप (खोज) के रूप में जानना है, अर्थ के रूप में जानना नहीं। ग्लॉस एक वादा है कि कोई व्यक्ति, इसे पढ़कर, उस शब्द को पहचान लेगा। मशीन वह वादा रखती है; पाठक अर्थ प्रदान करता है।

दीवार कहाँ है

कुछ भाषाएँ एक सीमा से टकराती हैं जिसे कोई भी पार्सर हटा नहीं सकता, क्योंकि डेटा बस वहाँ मौजूद नहीं है जो खुल सके। हंगेरियान प्रविष्टियों में अक्सर केवल एक उत्पत्ति (etymology) और अनुवादों की एक तालिका होती है, कोई परिभाषा पाठ नहीं, इसलिए एक पूर्ण पाठक भी खाली हाथ लौट आता है। सबसे कठिन मामले वहाँ केंद्रित होते हैं जहाँ भाषाविज्ञान सबसे कठिन है: फिनिश और हंगेरियान जैसे जुड़ाव वाले (agglutinative) भाषाएँ, जो विशाल परिभाषाएँ (paradigms) पैदा करती हैं, और सिरिलिक और यूनानी लिपियाँ, जहाँ समुदाय की कवरेज शुरू से ही पतली होती है। यूनानी 15% से बढ़कर 57% तक पहुँची; यह तथ्य है कि यह जर्मन के 92% से बहुत पीछे रह जाती है, यह स्रोत के बारे में है, कोड के बारे में नहीं। 6

स्रोत & नोट्स
  1. विकिपीडिया, "विकिशनरी", स्केल, बहुभाषी संरचना, सहयोगात्मक संपादन, और "form of" परिभाषाओं की गिनती (जिसमें smoulders उदाहरण शामिल है)। en.wikipedia.org/wiki/Wiktionary
  2. विकिशनरी, "विकिशनरी:Form-of templates", गैर-लेमा (non-lemma) प्रविष्टियाँ परिभाषा पंक्ति पर लेमा की ओर कैसे वापस इशारा करती हैं। en.wiktionary.org/wiki/Wiktionary:Form-of_templates
  3. विकिपीडिया, "Lemma (morphology)", लेम्मा को उद्धरण रूप के रूप में; विभक्ति रूपों की परिकल्पना। en.wikipedia.org/wiki/Lemma_(morphology)
  4. विकिपीडिया, "Finnish noun cases", लगभग पंद्रह विभक्तियाँ, एकवचन और बहुवचन में, प्रतीत्य प्रत्ययों और चिह्नों के ऊपर जमा होने से पहले। en.wikipedia.org/wiki/Finnish_noun_cases. Broader context: en.wikipedia.org/wiki/Finnish_grammar
  5. "Morphology of Different Languages," Psychology of Language (BCcampus Open Textbook), विश्लेषणात्मक बनाम चिह्न-संयोजी वर्गीकरण; házamban example. opentextbc.ca/psyclanguage/chapter/morphology-of-different-languages/
  6. WordChess परिभाषा पाइपलाइन, प्रत्येक भाषा के लिए टेम्पलेट-विस्तार नियम (स्पेनिश {{forma verbo}}, German {{Grundformverweis}}, Finnish {{taivutusmuoto}}, रूसी रीडायरेक्ट) और कवरेज आँकड़े। इस परियोजना के डिज़ाइन और बिल्ड नोट्स से मापा गया।
  7. विकिपीडिया, "लेममाइज़ेशन", NLP में प्रवर्तित रूपों को एक मूल रूप में कम करना। en.wikipedia.org/wiki/Lemmatization
  8. विकिशनरी पर और पढ़ने के लिए, [1011.1368] रिश्तेदार डेटाबेस स्कीमा में तालिकाओं और संबंधों में विकिशनरी प्रविष्टि संरचना का रूपांतरण। arxiv.org.
  9. विकिशनरी पर और पढ़ने के लिए, अंग्रेज़ी विकिशनरी प्रविष्टियों में उपयोगकर्ता रुचि के पूर्वानुमान के रूप में CEFR शब्दभंडार स्तर। doi.org.
  10. लेममाइज़ेशन पर और पढ़ने के लिए, बायोलेममाटाइज़र: जैव-चिकित्सा पाठ के आकारिकीय प्रसंस्करण के लिए एक लेममाइज़ेशन टूल - PMC। ncbi.nlm.nih.gov.
Was this worth reading?
← Back to WordChess
PlayPendium · About · Contact · Privacy · Terms · Cookies · Accessibility · Copyright · Browse all games · Inspirations · © 2026