Q का मूल्य दस अंक है और E का एक। यह अकेला तथ्य भाषा के एक छोटे-से सिद्धांत, सूचना के बारे में एक तर्क, और इस बात का कारण छिपाए हुए है कि खेल का टाइल सेट स्पेनिश में अंग्रेज़ी से अलग क्यों दिखता है।
अंग्रेज़ी में लिखा और संपादित। यह हिन्दी संस्करण मशीनी अनुवाद से तैयार किया गया है; जहाँ सटीकता महत्वपूर्ण हो, वहाँ अंग्रेज़ी मूल ही प्रामाणिक है। मूल अंग्रेज़ी में पढ़ें →
पहली ही बारी में आपका सामना जिस स्कोरिंग नियम से होता है, वह कोई सौंदर्य-संबंधी चुनाव नहीं है। वह एक माप है। 1930 के दशक के आरंभ में अल्फ्रेड मोशर बट्स नाम के एक बेरोज़गार वास्तुकार ने एक ऐसा शब्द-खेल बनाने की ठानी जो न तो केवल भाग्य पर टिका हो और न केवल शब्द-भंडार पर, और उन्हें हर अक्षर की कीमत तय करने का एक सैद्धांतिक तरीका चाहिए था। इसलिए उन्होंने वही किया जो एक इंजीनियर करता है: उन्होंने गिनती की। बट्स ने गिना कि उनके समय के छपे स्रोतों में हर अक्षर कितनी बार आता है, जिनमें सबसे प्रमुख The New York Times का मुख पृष्ठ था, और साथ में Herald Tribune और The Saturday Evening Post भी। 1
उन गिनतियों से उन्होंने एक साथ दो संख्याएँ निकालीं। गिनती, यानी थैली में हर टाइल कितनी बार डाली जाती है, यह दर्शाती है कि वास्तविक लेखन में वह अक्षर कितना आम है। मूल्य उल्टी दिशा में चलता है: अक्षर जितना दुर्लभ हो, उसका उपयोग करने वाली चाल को उतना ही अधिक मिलना चाहिए। आम स्वरों को एक अंक मिलता है; जो अक्षर केवल विदेशी मूल के शब्दों और शब्दकोश के अटपटे कोनों में दिखते हैं, उन्हें खेल का अधिकतम मूल्य मिलता है। अंग्रेज़ी खेल में यह अधिकतम दस अंक है, और केवल Q और Z को ही यह मिलता है; जैसा कि बीबीसी ने एक बार लिखा, बट्स ने "यह मापकर कि न्यूयॉर्क टाइम्स के मुख पृष्ठ पर हर अक्षर कितनी बार आता है, हर टाइल का मूल्य निकाला।" 2
अक्षरों को एक पंक्ति में लाइनें करें और डिज़ाइन खुद प्रकट हो जाता है। वास्तविक दुनिया की आवृत्ति गिरने के साथ अंक मूल्य लगभग एकदिशात्मक रूप से बढ़ता है। E हर जगह है और सस्ता है; Z और Q लगभग कहीं नहीं हैं और महंगे हैं।
| अक्षर | थैली में टाइलें | अंक मूल्य | अंग्रेज़ी में आवृत्ति |
|---|---|---|---|
| E | 12 | 1 | ≈ 12.7% |
| A | 9 | 1 | ≈ 8.2% |
| N | 6 | 1 | ≈ 6.7% |
| D | 4 | 2 | ≈ 4.3% |
| B | 2 | 3 | ≈ 1.5% |
| K | 1 | 5 | ≈ 0.8% |
| X | 1 | 8 | ≈ 0.15% |
| Q | 1 | 10 | ≈ 0.12% |
| Z | 1 | 10 | ≈ 0.07% |
गिनतियाँ और मूल्य मानक अंग्रेज़ी सेट के हैं; 3 आवृत्ति के आँकड़े सामान्य अंग्रेज़ी पाठ के प्रचलित अनुमान हैं। 4 WordChess इसी परंपरा में अंक-मूल्य वाली टाइलों और आवृत्ति-भारित टाइल सेट का उपयोग करता है (अंग्रेज़ी में 100 टाइलें, 98 अक्षर और 2 ब्लैंक), हालाँकि हर खिलाड़ी थैली से टाइलें खींचने के बजाय एक पूरा सेट रखता है, जो खेल के डिज़ाइन दस्तावेज़ों से मापा गया है।
यहाँ एक साफ़ विचार एक कठिन प्रतिबंध से मिलता है। यदि मूल्य केवल दुर्लभता का पुरस्कार देता, तो आदर्श थैली Q और Z से भरी होती, जहाँ विशाल अंक दावा करने के लिए इंतज़ार कर रहे होते। लेकिन थैली वह हाथ भी है जिससे आपको वास्तव में खेलना पड़ता है। सात उच्च-मूल्य वाले विचित्र अक्षर निकालें और आप जम जाते हैं, कोई वैध शब्द बनाने में असमर्थ। इसलिए गिनती मूल्य के विरुद्ध खींचती है: थैली में अक्षरों को लगभग उस अनुपात में रखना होगा जिसमें भाषा उन्हें उपयोग करती है, अन्यथा खेल रुक जाता है।
इसीलिए थैली में ठीक एक Q है, और इसीलिए उसके लगभग अविभाज्य साथी U को अपनी चार टाइलें मिलती हैं: एक Q, और थैली में चार U, ताकि उसे कोई U मिल जाने का मौका रहे। अकेला Q कीमती है क्योंकि उसे खेलना लगभग असंभव है, और वह खेला जा सकता है तो केवल इसलिए कि थैली की बाकी टाइलें जीवन के अपने अनुपातों में बाँटी गई थीं। दुर्लभता पुरस्कार तय करती है; आवृत्ति खेल को चलता रखती है।
टाइल की कीमत उस बात से तय होती है कि अक्षर कितनी दुर्लभता से प्रकट होता है, लेकिन थैली की सामग्री उस बात से तय होती है कि वह कितनी बार प्रकट होता है। ये दो बल एक ही तथ्य हैं, आगे और पीछे पढ़े गए।
यदि एक निष्पक्ष टाइल सेट किसी भाषा की अक्षर-आवृत्तियों की तस्वीर है, तो भाषा बदलने पर तस्वीर भी बदलनी चाहिए। और वह साफ़ तौर पर बदलती है। WordChess 22 भाषाओं में चलता है, और उसका टाइल सेट हर भाषा के लिए नए सिरे से बनाया जाता है, क्योंकि अंग्रेज़ी के लिए समायोजित वितरण दूसरी भाषाओं में बस गलत होता है। 3
उत्तर अमेरिका के बाहर बिकने वाले स्पेनिश सेट K और W को पूरी तरह छोड़ देते हैं; ये अक्षर स्पेनिश में केवल आयातित शब्दों में आते हैं, इसलिए एक ईमानदार थैली उन्हें कोई टाइल नहीं देती। 5 इतालवी इससे भी आगे जाती है और J, K, W, X और Y को छोड़ देती है, जो मूल इतालवी वर्तनी का हिस्सा नहीं हैं और केवल विदेशी मूल के शब्दों में मिलते हैं। 5 जिन अक्षरों को अंग्रेज़ी थैली केवल एक या दो टाइलें देती है, वे दूसरी भाषा में दुर्लभ नहीं, बल्कि अनुपस्थित हैं। दुर्लभता किसी अक्षर का गुण नहीं है। वह किसी अक्षर का किसी भाषा में गुण है।
बट्स, बिना इसकी शब्दावली के, कुछ ऐसा माप रहे थे जिसे एक गणितज्ञ लगभग पंद्रह वर्ष बाद औपचारिक रूप देने वाला था। 1948 में क्लॉड शैनन ने सूचना सिद्धांत की नींव एक सटीक दावे पर रखी: कोई प्रतीक जितना अप्रत्याशित होगा, वह उतनी ही अधिक सूचना ले जाएगा। जिस अक्षर का आप अनुमान लगा सकते थे, वह आपको कम बताता है; एक चौंकाने वाला अक्षर बहुत कुछ बताता है। दुर्लभता ही सूचना है, और सूचना बिट्स में मापी जाती है। 6
अपने 1951 के पेपर Prediction and Entropy of Printed English में, शैनन ने उस मात्रा को तौलने का प्रयास किया। अक्षरों को अलग-अलग मानते हुए, अंग्रेज़ी लगभग चार बिट्स प्रति अक्षर तक जाती है; लेकिन यदि एक पाठक संदर्भ का उपयोग करे, यह तथ्य कि q लगभग u का वादा करता है, और कम शब्द v पर समाप्त होते हैं, तो वास्तविक दर गिर जाती है। शैनन के अनुमान प्रयोगों ने सामान्य अंग्रेज़ी की एन्ट्रॉपी को 0.6 और 1.3 बिट्स प्रति अक्षर के बीच कहीं पर रखा। 6 हम जो लिखते हैं, उसका अधिकांश भाग अनावश्यक है; आश्चर्यजनक अक्षर ही असली काम करते हैं।
वही हिसाब पहले से ही एक पूर्ववर्ती कोड को आकार दे चुका था। जब सैम्युअल मॉर्स और एल्फ्रेड वैल ने 1840 के दशक में अपना वर्णमाला बनाया, तो कहा जाता है कि वैल ने यह जानने के लिए एक प्रिंटर की दुकान के टाइप केस का अध्ययन किया कि कौन से अक्षर सबसे अधिक उपयोग किए जाते थे, फिर उन्होंने उन अक्षरों को सबसे छोटे संकेत दिए, E के लिए एक बिंदु, T के लिए एक डैश। 7 आवृत्त अक्षरों के लिए छोटे कोड; सामान्य टाइलों के लिए सस्ते अंक; प्रत्याशित चीज़ों के लिए कम बिट्स। मॉर्स ने तार पर समय कम किया, बट्स ने एक खेल को संतुलित किया, शैनन ने मूल संख्या का नाम दिया, लेकिन तीनों एक ही बहीखाते को पढ़ रहे थे। एक अक्षर की कीमत, जैसा पता चला, हमेशा इसका माप थी कि वह आपको कितना आश्चर्यचकित कर सकता है।