找回密码
 注册
搜索
楼主: 新字

【转帖】一个学者对“汉字优越”论的驳斥

[复制链接]
发表于 2006-8-8 10:54:01 | 显示全部楼层
人能發的音是有限的, 但形符是可無限創新。所以, 演變成今日的, 一音會有許多字, 其實是描述各種事物的字, 遠多於我們人能發的音, 所以才造就現在所見的多字一音, 或眾多同音字的現象。這不是中文字的本身問題, 是中文字能有效反映世界上整個時空的事物的側影。當中文字已對應好各種事物之時, 是我們發的音不夠多, 不夠去對應那麼多的事物, 於是我們才發現音對應字, 變得一音對多字。於是漢改高手, 卻反過來說, 這個現象即是中文字不好, 它不表音。即令你能表各種的音, 先以各種的音去匹配世上事物, 再來配字, 你又能發得出音來嗎?
----------------------------------------------------------------语言学界,能有你这样认识的人几乎没有!当代的语言学走向唯心。
发表于 2006-8-10 01:40:35 | 显示全部楼层
現在來看一下樓主所轉貼的本文吧。裡面謬論多的是! 我來一句一句地抓出來檢驗。

(一)....「当时,最流行的一个说法是:联合国文件中,汉字印刷的文件最薄,所以,汉字比英文等文字更优越。」
==>  「联合国文件中,汉字印刷的文件最薄」這是事實, 不能說不是優點。在電腦時代, 我們不要比文件的厚薄, 我們來比電腦內中文所佔用的內存空間。內存記憶體及磁碟的成本, 在考處其儲存成本時是用每個位元(比特bit)得花多少美元來計算的。各位可以自己做實驗, 去找多篇英文文章翻譯成中文, 於是同一內容的文章, 有了中文版和英文版。這是再算一下, 英文字母多少個, 中文字多少個。一個英文字母是一個字節(即8個位元(比特bit)), 一個中文字是2個字節(即16個位元)。以字節來計算, 中文版的字節數是英文版的60%以下。光是儲存成本, 存取、傳送所耗時間, 中文版只有英文版的60%。哪個優越?

「如果汉字的部首笔画也用单线字符串方式,那么,一个汉字所需要的单线长度往往超过英文字母方式」
==> 本句前面講得好, 「做任何比较都有个起码前提:条件和方式相同。」但是這句話, 說以單線字符方式寫中文字部首筆劃是不可能有的假設, 中文就是因為是寫筆劃才能優越, 作者試圖以寫字的線條長短來比, 實在是比得不合適。英文字母是固定的定型符號, 再變也只能作線性的排列組合的變, 能變出甚麼花樣? 怎能變成二維空間的搭配組合呢? 同一書寫空間一個方形格內, 中文字可以有十萬個變化的事實(且不算理論上的所有筆劃全集合組合有多少個--這個理論值是更高於十萬的), 那還是有意義的字(尤其單字詞); 而英文字母只有52種變化(含大小寫), 在同一個方形格裡只能有一個無意義的字母。給你同樣的書寫空間, 中文可以表達的事物比英文可以表達的多。

「如果英文词汇也用平面绘画方式,那么,它所需要的平面空间与汉字差不多。」
==> 英文字母是無法寫成平面二維組合的, 這個「如果」是一個完全不會發生、甚至人為故意也無法發生的假設, 這樣的說理, 完全是空中樓閣。

「“中国人”用三个汉字符号,英文“CHINESE”用七个不可再分割的书写符号单线串写而成。然而,如果汉字也用不可再分割的符号以单线字符串方式书写,例如部首笔画,那就有“竖、折、横、竖”等14个符号,比英文的字符串长得多。」
==> “中国人”三字有十四筆劃, 但這裡中的4筆劃、国的8筆劃、人的2筆劃, 都是不可分割的, 一分割即是毫無意義的筆劃, 再也不是這三個字了。作者一再強把中文分割為筆劃再來轉化為單線字符的說理方式, 是昧於事實上兩種文字的書寫結構的差異。本來即是二維平面的卻硬拆作一維線性。 所以, 我說, 電腦時代, 一切以電腦為中心, 就以電腦內中文和英文的文檔比較是最理想的比較了。同一內容, 中文版文檔所需容量只有英文版文檔的60%。是不是「薄」很多呢?

「(二)“汉字优越”论的鼓吹者们说,汉字平均信息量大,所以,汉字比英文更优越。」
==> 這是錯的, 錯在這些人不是通訊專業人才, 他們最多只可能是電腦資訊專業人, 但卻不下點功夫去看看書, 瞭解一下真正的所謂「平均信息量」這個錯名詞(真正英文技術原文, 根本沒有這個「平均信息量 average information amount/quantity」的東西)。也錯在他們沒有真正用心搞懂甚麼是「平均信息熵average information entropy」。信息熵, 是一個通訊傳輸上的設計觀念。

「信息学基本原理说明,某数据所使用的符号系统的平均信息量越大,它的不稳定性和消耗就越大,对数据管理和信息传递是不利因素。」
==> 這是對電腦、通訊只懂一半的「半桶水」說的話。應該說: 「某語文符號系所使用的數據的平均信息熵越大, 其在通道channel(通訊道路, 一個假想的路)在選取一特定符號的機率就小」。機率小, 竟然轉講成了「不稳定性」, 真是天啊, 我好像在教幼稚園小孩! 這裡頭還加鹽添醋多了個「消耗」的怪觀念。這完全跟機器或系統的穩定性、消耗無關! 只是用機率概念在思考、設計通訊上選取一特定符號的數學模型而已。本謬論還擴大解說成:「对数据管理和信息传递是不利因素。」數據管理已是這個機器運作設計層次之上的「作業軟體」之上附加的應用軟體運\作之上的再附有的資料庫(數字庫database)管理那裡了。隔了好幾個層次, 卻全攪和在一塊! 「信息傳遞」麼, 是傳輸一篇文稿的文字啊, 文字都已在文稿內定好了, 電腦只是依打字存檔內的中文字內碼, 直接傳內碼而已, 都是0和1的訊號, 還有甚麼「信息传递是不利」和利的?管你英文、中文、印度文、非洲文...., 都是0和1啊!
    在閃農提出信息熵原文的文獻裡(網址如下),  p12 由本頁底部倒數8列: The uncertainty(or entropy) of the joint event....... 這個熵entropy其實是一個不確定性的衡量數字(確實說, 是機率), 相信是半桶水的人, 把不確定性uncertainty譯成不穩定性吧。再由此引申出一個所謂「消耗」的說法。
    http://cm.bell-labs.com/cm/ms/what/shannonday/shannon1948.pdf
    或 http://pespmc1.vub.ac.be/books/Shannon-TheoryComm.pdf

「英文平均信息熵是4.03比特左右、汉字是9.6比特左右,汉字平均信息量比英文符号大许多。做同样的数据作业,汉字符号系统的总体消耗最大,其信息量大是不利因素。」
==> 這個平均信息熵是指一字符集中, 某一特定字符出現的機率。由於0.xxx這樣不好看清楚作比較, 便再把這個數字取其負的對數(即倒數了, 不再是0.xxx方式), 又因電腦使用2進位, 所以取對數是取以2為底的對數, 這樣得出的數字, 給了一個叫位元(bit比特)的單位稱號以表達之前對機率所作的變形運算, bit即二進位數字BInary digiT的縮寫。汉字是9.6比特, 表示漢字的全字符集合的字數多。問題來了, 「做同样的数据作业」是指傳送同一內容的文章吧? 請問同一內容的文章, 英文只要用26個字母, 而中文都要用上全部十萬漢字嗎? 如果是, 那由一個不懂電腦的人口中說出: 「汉字符号系统的总体消耗最大,其信息量大是不利因素。」這樣是好像對的, 有道理的。(註: 那, 一個懂電腦的人又看到甚麼實情? 請看下面的註) 事實, 沒有十萬中文字全都傳送出來, 因為平常中文用字也不過二三千字而已。再者, 符號集字數多, 總體消耗量就多? 這是那門子的電腦概論, 是哪位教授教出來的學生在胡言亂語? 符號集字符多, 和平時作業要傳輸處理的字符有甚麼關係? 電腦內有日文平假名版假名的符號, 有印度文、泰文字母, 有俄羅斯的字母, 各位不使用日文、印度文、泰文、俄文的人會用到嗎? 電腦放著額外不用的這些外文字符, 會使電腦消耗更多電能、阻礙電腦處理中文嗎? 同理, 十萬中文字放在電腦裡, 絕大多都是古字死字, 平時只用那二三千字而已, 會使電腦消耗更多電能、阻礙電腦處理中文文檔麼? 說「會」的人, 小心把人家大牙笑掉找你來賠償!
    註: 再來看, 懂電腦的人都知道, 電腦通訊, 及電腦內部傳輸, 如處理器、內存、磁碟、螢幕、印表機之間, 所傳的全是內碼, 就是GBK, big5, UTF...這些編碼, 也即0和1兩種符號的代表訊號而已。根本不是在傳十萬中文字, 或二三千個常用漢字, 或26個字母。所傳的數據串即是0和1的組合串。
        有關信息熵的誤解謬論, 請看下一樓專文貼出。

「据海内外专业人员考察分析,汉字和英文等文字符号系统的平均多余度差不多;也就是说,汉字平均信息量大,并没有换来更高的精密精确度、并没有换得更可靠和更有效地避免歧义的实效。要达到大体相同的精密精确度和可靠性,汉字符号系统的消耗比英文符号系统高出许多,能说汉字比英文更“优越”吗?」
==>  汉字平均信息量, 或信息熵扯完了, 現在又扯上甚麼「平均多余度」。冗餘redundancy(大陸叫多餘, 這個譯名很不適當), 是在傳輸數據時, 額外多傳一些位元(比特bit)作為偵錯error detection, 或自動改錯auto-error correction機制的資訊。冗餘是數據在傳輸之初, 運用一機制(叫方法論algorithm), 自動運算出一些額外的改錯碼, 附在要傳輸的數據之後。數據傳輸到目的地後, 冗餘便經由同一機制反運算回來, 用以檢查所傳輸來的碼是否正確, 有錯即知錯在哪裡而作自動改錯回來, 改錯後才用作運算或處理。冗餘是由系統設計者加上去的, 當定好一個方法論algorithm機制後, 便成形了。它不是天生的, 故甚麼「汉字和英文等文字符号系统的平均多余度差不多」, 講到似乎是人力不能勝天這樣的口氣。其實, 由米阿仑的《从信息熵角度看中文软件和中文信息业的发展》帖中, 及網上其他言論, 原來始作俑者是這樣看事情的: 一個字節byte8個位元bit, 英文字母abc使用ASCII編碼, 只需7個位元bit即搞定, 於是8個bit即「多余」了一個比特bit(位元), 可作為redundancy之用。所謂「多余」即從這個redundancy的原始出處, 也即當初通訊系統設計時, 這個多出的"無用"之bit。英文的redundancy有重覆的意義, 日後數據自動偵錯及改錯技術(都在編碼學中發展出來的), 便真的額外加入了冗餘用的字節(位元組)redundancy byte。作者後面這句「汉字平均信息量大,并没有换来更高的精密精确度、并没有换得更可靠和更有效地避免歧义的实效。」即在看到了信息量的比特數, 認為中文字要9.6比特(位元)才可以夠傳輸用(天啊, 那是機率的變化表現形式, 是馮志偉針對二萬多字搞出來的, 比起十萬還遠呢), 於是, 一字節才8比特(位元), 便大喊「不夠了, 沒空間容納冗餘了」, 所以「沒有換到精密精确度、沒有更可靠、沒有更有效地避免歧义」。這是信息熵和冗餘兩種觀念作了錯誤的瞭解後, 又再湊在一塊造出新的謬論假說! 後面的結論反問: 「要达到大体相同的精密精确度和可靠性,汉字符号系统的消耗比英文符号系统高出许多,能说汉字比英文更“优越”吗?」就是「錯誤+錯誤」結婚的新生代觀念。

「见到“大”就是好,占领了许多人的头脑,于是,见到“汉字平均信息量大”、就望文生义地以为那是多么“优越”」
==> 這句批得中肯。但是緊接的這句「殊不知那是中文数据管理和传递的不利因素。」是胡說八道。不過, 奇怪, 錯有錯著吧? 再緊接著這句「以“汉字信息量大”作“汉字优越”的理由,是违背信息学科学原理和基础知识的。」反而是罵得很對! 因為那些“汉字优越”論之徒, 和批評“汉字优越”論的人一樣, 是學而不思、學藝不精、半桶水的哇哇叫。

「(三)“汉字优越”论的鼓噪者们说,计算机操作,汉字输入比英文还快,几个键敲下去就能出现整个词组短句,而英文却要一个个字母敲打,所以,汉字比英文更“优越”。这是缺乏计算机知识的说法。
  了解计算机输入输出原理的人都知道,文字符号如何显示和键盘操作的关系,完全是人为程序所规定的。......按照同样方法,英文输入输出也编个程序,敲打“Shakespeare_12”就能显示整部《第十二夜》、几十万个英文符号都显示出来了.......」
==>  本來中文輸入即比英文快, 至少也不慢, 詳看:
    1. http://www.zgyuyan.com/discuz/viewthread.php?tid=2700
       中国语言论坛
发表于 2006-8-11 03:32:40 | 显示全部楼层
電腦要適應漢語漢字,不是漢語漢字去適應電腦。
发表于 2006-8-13 15:13:38 | 显示全部楼层
承接#12 所說的「下一樓」:

下一樓專文貼出「信息熵」的解說, 這本是批米阿仑有關中文信息熵的一小段, 三月份寫好,
但整篇連載大作仍未脫稿, 所以乃懸著。
(請問, 我就是二十幾年老經驗的電腦工程師, 我不是專搞通訊的, 所以我發現我對這個信息
熵的觀念仍不夠深入, 我便到處翻資料、書, 及重溫以前大學讀過的課本, 務求對這個信息
熵的解說是淺的可講出讓人懂, 深的也要完整呈現全貌給專業的人。各位大陸耍嘴皮的人們,
不要像米阿仑這類人空想吶喊的, 不懂便胡亂湊合一些歪理。學一下我吧, 做事講話要有根
據, 學東西要認真, 這叫踏實做事, 中國何愁不強!)

 在電腦時代, 漢改高手總要說中文比不上歐洲拼音文字, 扯出這個信息熵也說中文的漢
  字信息熵和歐洲拼音文的信息熵作比較來證明, 但怎麼個比法卻不去深究, 盡取對中文不
  公平的數據, 用以佐證中文字是低劣的, 推論出漢字必要一番改革才可生存於電腦時代。
  所羅列理由全是莫須有罪名, 何以簡體的中国人總是如此自悲, 胳臂往外彎, 鄙視自家珍
  寶? 漢改高手們連個公平的比較方法都不會! 請漢改高手看一看, 怎樣才是正確的比法。
  (又, 縱然比得劣結果, 難道技術、工具不能克服? 工具是人發明的, 技術是人想出來的,
  何以外行人總在說內行話? 何以總是不懂技術的人盡是搶在技術人員前面給技術瓶頸或
  極限下定論? )
   漢改高手的比法是: 拿英文或拼音文的一個abc字母去跟中文的一個方塊字比, 這能比
  嗎? 兩者根本不在同一位階上啊! 英文字母只相當於中文的筆劃。應該用英文詞和中文詞
  來比才正確。"information"(11字母, 即11字節)和「資訊」(信息)(2字, 即4字節), 哪
  個佔空間, 哪個傳得快? 不不不!!! 更準確地講, 是要用同一內容的文稿, 來比較中文版
  的和英文版的所佔用字節數, 也即兩個不同語文版本的文檔大小。
    還有, 米阿仑所批的「汉字优越论」者, 也是學得不夠精進。胡亂解釋「平均信息熵」
  , 還從馮志偉的「汉字平均信息熵」, 望文生義地臆測, 扯出個「汉字平均信息量」的錯
  名詞。
 

  一) 平面媒體層次(報紙、雜誌、書)
     要傳播的字符集  印刷所傳訊號(即字形)    傳播有意義訊息(信息)
     --------------  --------------------    --------------------
   英   26個字母       26字母         100萬字詞word
   中   十萬字        十萬字         37萬詞條
   註: 我們研究開發中文電腦時要針對十萬中文字, 但平時使用只有約三千字。
  二) 電機層次
    1) 電報
           要傳播的字符集      編碼         要傳的訊號
           --------------   ----------------    ----------------
   英       26個字母     .和-2種訊號編碼    26組.和-組合

   中 十萬字→
     預訂電
     信碼編碼─→中文字電信碼   .和-2種訊號編碼    10組.和-組合
          (0-9編組的4位數
           ,只能編一萬組
           碼, 即一萬字)
     (註: 摩斯電碼中, 「.」是電報鍵按1個時間單位鬆開1個時間單位, 即閉1開1;
        「-」是電報鍵按3個時間單位, 鬆開1個時間單位, 即閉3開1。)
    2) 電腦通訊
     要傳播的字符集   調變(不壓碼)/編碼(壓碼)     要傳的訊號
                 或脈碼調變方式  
     --------------  ------------------------  --------------------
   英 0和1       0和1兩種訊號調變的載波   調變後,代表0和1的載波
     (26個字母的
      ASCII碼, 共
     26種0和1組合;
     每字母1字節)
   中 0和1       0和1兩種訊號調變的載波   調變後,代表0和1的載波
     (十萬字的Big5,
      GB, Unicode或
     其他編制的內碼;
     每字2字節)
  三) 人的層次看電腦通訊是要儲存、傳輸一篇描述某事件的完整文稿
    (由人的層次看, 才是電腦、電報、平面媒體或任何一種記錄、傳輸方式所要工作
    的最終目的。)
     要傳播的字符集   調變(不壓碼)/編碼(壓碼)     要傳的訊號
                 或脈碼調變方式  
     --------------  ------------------------  --------------------
   英 26個字母, 轉化  0和1兩種訊號調變的載波   調變後,代表0和1的載波
     為0和1, 要傳送
     的是一篇文章
     (同一內容英文版)
   中 中萬個中文字,   0和1兩種訊號調變的載波   調變後,代表0和1的載波
     轉化為0和1, 要
     傳送一篇文章
     (同一內容中文
     版; 內容所佔空
     間為英文版的
     60%)
  ★★★★★★★★★★★★★★★★★★★★★★★★★★★★★★
  ★資訊熵(信息熵)要研究的是在「要傳的訊號」這一站點上看的。★
  ★★★★★★★★★★★★★★★★★★★★★★★★★★★★★★
    ●中文和英文, 在「要傳的訊號」這一站點上看, 都是0和1兩種訊號而已, 已經是沒
   有差別了。那信息熵, 還有甚麼差別?
  ●同一內容文章, 中文版所佔空間是英文版的60%, 於是在電腦內: 1)中文佔用空間
   是英文的60%, 2)中文傳輸時間是英文的60%!!!這還不足以表示中文在電腦內「處理
   的效率」是比英文快? 你會只處理一個英文字母嗎? 你會只處理一個中文字嗎? 你工
   作上要處理的, 是一篇完整的文章啊!

[ 本帖最后由 abcxyz1 于 2006-08-13 15:30:00 编辑 ]
您需要登录后才可以回帖 登录 | 注册

本版积分规则

手机版|小黑屋|中语书院

GMT+8, 2026-9-4 19:07 , Processed in 0.023900 second(s), 13 queries .

Powered by Discuz! X3.5

© 2001-2026 Discuz! Team.

快速回复 返回顶部 返回列表