PlayPendium
WordChess · विचार के लिए भोजन

एक मशीन को 149,000 शब्द, 22 भाषाओं में सिखाना

एक शब्द-खेल के लिए कानूनी स्ट्रिंग्स की एक सूची से अधिक की ज़रूरत होती है। इसमें यह बताना ज़रूरी है कि प्रत्येक का अर्थ क्या है, और अर्थ संग्रहीत करने की सबसे कठिन चीज़ है।

अंग्रेज़ी में लिखा और संपादित। यह हिन्दी संस्करण मशीनी अनुवाद से तैयार किया गया है; जहाँ सटीकता महत्वपूर्ण हो, वहाँ अंग्रेज़ी मूल ही प्रामाणिक है। मूल अंग्रेज़ी में पढ़ें →

01 · लेम्मा और उसकी छायाएँ

एक शब्द, और वह सभी आकार जो वह लेता है

WordChess 25×25 बोर्ड पर खेला जाता है, जिसमें 148,941 शब्दों वाला एक अंग्रेज़ी शब्दकोश है 6, जिसकी प्रविष्टियाँ औसतन 8.6 अक्षरों की हैं और सबसे लंबी 27 अक्षरों तक जाती है। यह आसान हिस्सा है। वैध शब्दों की सूची बस स्ट्रिंग्स का एक समूह है जिसे खेल स्वीकार करेगा। दिलचस्प हिस्सा खिलाड़ी को यह बताना है कि बोर्ड पर रखी स्ट्रिंग का अर्थ क्या है, और यह एक साथ बाईस भाषाओं में करना।

शब्दकोशकार लेम्मा और उसके वक्रित रूपों के बीच एक स्पष्ट रेखा खींचते हैं। लेम्मा वह मुख्य शब्द है जिसे आप खोजते हैं, run, house, be। इसके चारों ओर सतही रूपों का एक पद्धति-चक्र घूमता है: runs, ran, running। प्रत्येक में एक ही मूल अर्थ होता है, जो एक अलग व्याकरणिक भूमिका के लिए सजाया गया होता है। 3 एक शब्दकोश अपनी गद्य-प्रविष्टियाँ लेम्मा पर खर्च करता है और छायाओं को घर की ओर इशारा करने देता है।

एक शब्द कितनी छायाएँ डालता है, यह भाषा पर निर्भर करता है। अंग्रेज़ी विश्लेषणात्मक है: यह शब्द-क्रम और छोटे सहायक शब्दों पर निर्भर करती है, इसलिए एक क्रिया में कभी-कभी से अधिक रूप नहीं होते। फ़िन्नी जुड़वाँ है, यह स्टम पर प्रत्यय चिपकाकर अर्थ बनाती है। एक एकल फ़िन्नी संज्ञा के लिए लगभग पंद्रह कारकों के लिए वक्रण होता है, एकवचन और बहुवचन में, इससे पहले कि स्वामित्व-अंत और क्लिटिक ऊपर से जुड़ जाएँ; अलग-अलग रूपों की व्यावहारिक गिनती हज़ारों में जाती है। 4 हंगेरियन एक पूरा अंग्रेज़ी वाक्यांश, in my house, को एक शब्द में पैक करती है, házamban। 5

02 · सबके द्वारा लिखा गया एक शब्दकोश

परिभाषाएँ कहाँ रहती हैं

परिभाषाएँ Wiktionary से आती हैं, एक मुफ़्त शब्दकोश जिसे कोई भी संपादित कर सकता है। यह विशाल और बहुभाषी है: यह परियोजना एक सौ से अधिक सक्रिय भाषा-संपादनों और करोड़ों प्रविष्टियों को शामिल करती है, जो वेतनभोगी संपादकीय बोर्ड के बजाय स्वयंसेवकों द्वारा सहयोग से लिखी जाती हैं। 1 22 भाषाओं में चलने वाले एक खेल के लिए, कोई अन्य मुफ़्त शब्दकोश कवरेज के मामले में इससे कहीं नहीं पहुँच पाता।

लेकिन कागज़ पर कवरेज वह कवरेज नहीं है जिसे आप पढ़कर सुना सकें। Wiktionary विभक्त (inflected) रूपों को इस तरह संग्रहीत करता है कि मानव संपादकों को एक ही ग्लॉस दस हज़ार बार न लिखना पड़े। परिभाषा को पूरा लिखने के बजाय, एक गैर-लेम्मा प्रविष्टि में एक form-of टेम्पलेट होता है, एक छोटा-सा संकेतक जो प्रभावतः कहता है, "यह उस लेम्मा का एक विशेष व्याकरणिक रूप है।" 2 smoulders की प्रविष्टि गद्य नहीं है; यह एक टेम्पलेट है जो "third-person singular simple present form of smoulder" (smoulder का अन्य पुरुष एकवचन सामान्य वर्तमान रूप) के रूप में दिखता है। 1

ये संकेतक गोल-मोल त्रुटि नहीं हैं। अंग्रेज़ी Wiktionary पर, लगभग 1.27 मिलियन परिभाषाओं में, लगभग 478,000, एक तिहाई से अधिक, "form of" परिभाषाएँ हैं, लिखे गए अर्थों के बजाय। 1 डेटा वहाँ है। यह बस मोड़ दिया गया है।

03 · एक पार्सिंग समस्या, डेटा की कमी नहीं

ग्लॉस टेम्पलेट को खोल रहा है

इसलिए वह चुनौती जो मायने रखती थी, कभी "शब्द गायब है" नहीं थी। यह थी कि शब्द का अर्थ एक टेम्पलेट के अंदर बैठा था जिसे एक साधारण पार्सर फेंक देता। WordChess की परिभाषाएँ कच्चे Wiktionary डम्प्स को पढ़कर और भाषा-दर-भाषा वक्रण टेम्पलेट्स को विस्तारित करके बनाई गईं, पार्सर को सिखाया गया कि प्रत्येक संकेतक का क्या अर्थ है और इसे एक साधारण ग्लॉस में पुनर्लेखन किया गया। 6

हर भाषा अपने रूपों को अलग-अलग यंत्रों के पीछे छुपाती है। स्पेनिश क्रिया के रूपों को {{forma verbo}} के पीछे रखती है, जो "X का क्रियात्मक रूप" में बदल जाता है। जर्मन विभक्ति और संयुग्मन के रूपों के लिए {{Grundformverweis Dekl/Konj}} का उपयोग करता है। फ़िन्निश {{taivutusmuoto}} पर निर्भर करता है। रूसी अक्सर कोई रूप-टेम्पलेट ही नहीं रखता, विभक्ति-बदला शब्द एक सादा रीडायरेक्ट (собаки → собака) होता है जिसे "रूप के" ग्लॉस प्राप्त करने के लिए अनुसरित करना पड़ता है। 6 हर परिपाटी को संभालें, और कवरेज बढ़ जाती है।

परिभाषा कवरेज, टेम्पलेट विस्तार से पहले → बाद में
भाषापहलेबाद मेंवृद्धि
जर्मन45%92%+47
डच58%90%+32
फ़िन्निश54%74%+20
रूसी20%70%+50
ग्रीक15%57%+42

इस परियोजना के डिज़ाइन और बिल्ड नोट्स से मापा गया। प्रतिशत शब्दकोश प्रविष्टियों का हिस्सा है जिनमें एक उपयोगी परिभाषा या हल हुआ "रूप के" ग्लॉस है।

डेटा कभी भी गायब नहीं था। वह एक पॉइंटर में मोड़ा गया था, और मशीन को शब्द देने का मतलब था उसे खोलना सीखना।

04 · एक मशीन के लिए "शब्द जानने" का क्या अर्थ है

एक स्ट्रिंग, और उसके बारे में एक वाक्य

यह सच बोलने लायक है कि खेल अब क्या रखता है। जब WordChess दिखाता है कि собаки собака का एक रूप है, "कुत्ता," तो उसने कुछ समझा नहीं है। उसने एक स्ट्रिंग को दूसरी स्ट्रिंग, एक ग्लॉस, से मैप किया है, एक मानव संपादक के पीछे छोड़े गए समान पॉइंटर्स का अनुसरण करके। यह लेममाइज़ेशन है, प्राकृतिक भाषा प्रसंस्करण का कामकाज़ी घोड़ा: एक सतह रूप को उसकी मूल अवस्था में कम करना ताकि मशीन को ट्रैक करने के लिए अलग-अलग चीज़ें कम हों। 7

यह जानने का एक वास्तविक और उपयोगी प्रकार है। यह खेल को एथेंस या एम्स्टर्डम में "यह शब्द क्या है?" का उत्तर देने की अनुमति देता है, बिना किसी शब्दकोशकार को स्टाफ में रखे। लेकिन यह लुकअप के रूप में जानना है, अर्थ के रूप में जानना नहीं। ग्लॉस एक वादा है कि एक व्यक्ति, उसे पढ़कर, शब्द को पहचानेगा। मशीन वादा रखती है; पाठक अर्थ प्रदान करता है।

दीवार कहाँ है

कुछ भाषाएँ एक सीमा तक पहुँचती हैं जिसे कोई पार्सर नहीं उठा सकता, क्योंकि डेटा बस वहाँ नहीं है जो खोला जा सके। हंगेरियन प्रविष्टियाँ अक्सर केवल एक उत्पत्ति और अनुवादों की एक तालिका रखती हैं, कोई परिभाषा पाठ नहीं, इसलिए एक पूर्ण पाठक भी खाली हाथ लौटता है। सबसे कठिन मामले वहाँ क्लस्टर होते हैं जहाँ भाषाविज्ञान सबसे कठिन है: चिपकने वाली भाषाएँ जैसे फ़िन्निश और हंगेरियन, जो विशाल पैराडाइम्स पैदा करती हैं, और सिरिलिक और ग्रीक लिपि, जहाँ समुदाय कवरेज शुरू से ही पतला होता है। ग्रीक 15% से 57% तक बढ़ा; यह जर्मन के 92% से बहुत पीछे रुकना स्रोत के बारे में एक तथ्य है, कोड के बारे में नहीं। 6

Sources & notes
  1. Wikipedia, "Wiktionary", scale, multilingual structure, collaborative editing, and the "form of" definition counts (including the smoulders example). en.wikipedia.org/wiki/Wiktionary
  2. Wiktionary, "Wiktionary:Form-of templates", how non-lemma entries point back to a lemma on the definition line. en.wiktionary.org/wiki/Wiktionary:Form-of_templates
  3. Wikipedia, "Lemma (morphology)", lemma as citation form; the paradigm of inflected forms. en.wikipedia.org/wiki/Lemma_(morphology)
  4. Wikipedia, "Finnish noun cases", the roughly fifteen cases, in singular and plural, before possessive suffixes and clitics stack on top. en.wikipedia.org/wiki/Finnish_noun_cases. Broader context: en.wikipedia.org/wiki/Finnish_grammar
  5. "Morphology of Different Languages," Psychology of Language (BCcampus Open Textbook), analytic vs. agglutinative typology; the házamban example. opentextbc.ca/psyclanguage/chapter/morphology-of-different-languages/
  6. WordChess definition pipeline, template-expansion rules per language (Spanish {{forma verbo}}, German {{Grundformverweis}}, Finnish {{taivutusmuoto}}, Russian redirects) and coverage figures. Measured from this project's design and build notes.
  7. Wikipedia, "Lemmatization", reducing inflected forms to a base form in NLP. en.wikipedia.org/wiki/Lemmatization
  8. Further reading on Wiktionary, [1011.1368] Transformation of Wiktionary entry structure into tables and relations in a relational database schema. arxiv.org.
  9. Further reading on Wiktionary, CEFR vocabulary level as a predictor of user interest in English Wiktionary entries. doi.org.
  10. Further reading on Lemmatization, BioLemmatizer: a lemmatization tool for morphological processing of biomedical text - PMC. ncbi.nlm.nih.gov.
Was this worth reading?
Play WordChess
PlayPendium · About · Contact · Privacy · Terms · Cookies · Accessibility · Copyright · Browse all games · Classic arcade games · © 2026