|
|
发表于 2006-4-17 01:46:19
|
显示全部楼层
5樓補充 060412補
「冯志伟计算汉字的信息熵为9点多,印欧文是3——5。可见汉字仍有很大简化空间。」
1. → 設若印歐文的信息熵是5, 這句話表示馮的實驗所用的現實文章中, 平均一特定中文字是出現機率是印歐文一特定字母的「2的(9-5)次方」倍低(2的4次方=16), 也即某一中文字的出現機率「平均」只有印歐文某一字母的出現機率的16分之一那麼低。(平均, 應要把全部中文十萬字都計進去。但馮志偉並沒有取那麼多字。)
2. → 如果馮志偉用這個信息熵來研究通訊, 而非錯誤地用在電腦的中文研究。那也要有一種情況出現, 中文和歐文才能是平等比較。
即是, 在實際通訊中, 把實驗所用的文章中所出現的中文字(這並不是全部的十萬字喔!!!)全部算一下有多少個, 假設是20000字好了。這時, 他要找到一個通訊線路及設備, 其上的訊號有20000個變化以代表這兩萬個字, 而英文只要26個變化即夠。以電壓變化來代表, 0.1伏特是一個變化, 馮志偉的實驗針對20000個中文字就需要一條通訊線路上可由0.0伏特、0,1伏特、....到2000伏特的變化。而事實上根本這樣的一條線路要有2萬個變化狀態的通訊機器, 根本沒有。(注意, 這裡還是假設馮志偉對熵瞭解, 而且真的用於通訊方面的研究喔!!!事實他是用錯在電腦內部, 更離譜!)
那麼事實中文電報是如何? 在未談之前, 先看英文的:
英文有26個字母, 要設計一個具有26個變化狀態的通訊機器是沒問題的。但, 從效率及電能的消耗上計, 不花算!
※摩期把26個字母用點.和横-來編碼,叫摩斯電碼。一個指定的時間間隔內(叫時槽)不是送點訊號就是送横訊號, 也即是每個訊號只有點和横2種訊號狀態, 這就是二進位了。「點」是電報鍵按一下即放開(按和放的時間一樣短; 按下叫閉路, 放開叫開路), 「横」是電報鍵按著不放為時是「點」的三倍長, 再放開。
※2的4次方等於16, <26, 不夠用; 2的5次方等於32, >26, 於是用5個二進位訊號(5個時槽的時間間隔)來編碼就足夠了。那中文有20000字的話, 就要15個二進位訊號(12個時槽的時間間隔); 因2的15次方是32768, 多於20000, 而2的14次方是16384, 少於20000。如熵是用二進位來計算的話, 那麼馮志偉要做的實驗就適合於這個情況了。現在, 中文和英文兩者符號系統是在同一對等的狀況下比較了, 但比較的是英文字母和中文字啊!(字母和字是同一意義等級麼?) 注意, 對等是指符號, 不是指有意義的單位(但這還只是前奏而已), 難道我們打電報不是傳送有意義的文字符號麼? 英文在這水平上, 一個字母可代表甚麼意義? 至少中文一個字還可能會有意義(一字詞)。信息熵就是在這個字母層次上做研究的!!!信息熵就是在這個字母層次上做研究的!!!信息熵就是在這個字母層次上做研究的!!!所以, foxql之前曾說過的張時釗老師, 他說拼音文的字母只相當於中文字的筆劃這個等級, 真是真知灼見!
所以, 要比較應該考慮是word字詞和中文詞。這個類似: 比較「international」 和「國際」、比較「English」和「英文」, 比較「Chinese」和「中文」, 看誰的訊號比較長。當然是英文的長, 比較花時間。難道不是中文比英文優越? 算一下, 一個英文字母佔一位元組(字節)長, 一個中文字佔兩個位元組(字節)長, 比較這幾組英文詞word和中文詞, 分別是13對4, 7對4, 7對4。一般而言, 同一內容的一篇中文稿和英文稿, 中文的字節數只有英文的60%。
還有, 中文的電報不是這樣編碼的!!!中文電報是用數字, 由0000編到9999(註), 打電報時, 用摩斯電碼(因為只傳數字, 所以用摩斯簡碼集更快), 每個字只傳4個符號(代表號碼)的訊號。但, 這樣比, 中英兩者又是不同的東西了, 一個是代表了「英文字母」的碼, 一個「代表了中文字的號碼數字」的碼。
注意, 這是作電報的通訊比較, 不是馮志偉的作電腦內部的傳輸的比較(熵, 根本就不是用在電腦內部傳輸的)。
註: 好, 中文電信碼用4位數字編碼, 0000-9999才只能給一萬字(含標點符號)編碼。想想, 1970以前中文電腦未發明之前, 看著中文電報, 各位漢改高手是不是更加振振有詞地說: 「我們要漢改, 我們要拼音中文!」中文實在太高深了, 是科技追不上, 不是中文不好。哪有捨寶貝而就糟粕的?
那電腦之間的通訊呢, 它們全是傳輸電腦的內碼, 英文是ASCII碼, 中文有Big5碼、GB碼, 或簡繁中英及各種語文可共存的Unicode或ISO/IEC 10646, 那個和上面打※的那句所描述的狀況, 根本是兩回事! 電腦通訊傳的內碼訊號就是電腦內的010101...訊號。
其實電腦的中文更應改為使用圖形格式的檔案(這種檔案比較大), 而不是使用文字格式的檔案(因為要編中文內碼, 而且這種檔案比較小), 這是台灣瘋子朱邦復所說的話, 真知灼見。他雖然把電腦搞成可以處理中文了, 使大家可以用微軟Windows來「寫」中文, 但有人聽嗎? 因為編內碼方法的中文檔, 和英文的現有軟體相容性更佳, 否則所有中文軟體另外開發。那些電腦廠商都想省錢(省研發成本), 只要對現成的英文軟體改一下畫面及顯示訊息就可, 又是另一種的拿來主義(台灣版本), 還自行開發純中文軟體幹嗎?
3. 你所謂的「簡化」在閃農原始論文引申的是「通訊編碼的壓縮」(壓碼data compression), 這個壓碼是另一門專門學問。中英要比, 是在上面打※那句上的情況, 來談壓碼。所以, 這個所謂「簡化」又錯得離譜! 壓碼, 簡單說, 要送10個碼(訊號), 但實際上利用壓碼技術(數學咚 |
|