2008-01-28

社會組科技須知 - 檔案格式 3 (圖片)

你電腦上應該有圖片。很多圖片,對不對?都是照片,還是也有別的圖片?你是不是有時候在文件也需要用一些圖片,像流程圖或類似的?但是不好看?或者,有沒有收過很大的e-mail,然後裡面只有一兩張照片?有沒有看過十幾MB的簡報?那我們看一下為什麼會有問題……

圖片檔案會有很多種格式。太多。所以我只要談一些主要的格式跟一些基礎。第一,我們可以把電腦圖片分成兩種:點陣向量。區別呢?在點陣圖,檔案必須包含每一個點的資訊,亮度(黑白)或色彩(彩色)。你要更大的圖片?那你要更多“點”,所以要更多資訊 - 所以檔案更大。在這裡,檔案大小跟圖片大小有關。

向量圖不一樣。這裡你的電腦必須計算一下,因為這種圖片例如記得從什麼位子開始要畫一條什麼厚度跟色彩的線到哪一個位子。向量圖的檔案大小有關圖片內容。如果圖片幾乎是空的,檔案很小。如果有很多東西,檔案較大。但是,跟圖片大小沒有關系!

為什麼?你數學課應該有學過向量?那你應該知道可以做各種計算,例如把一些向量改成兩倍大。電腦對你的圖片也可以這樣做。向量圖雖然不太適合為了照片,但是特別是“線材”跟字的話這種格式非常適合。對,你當然也可以把點陣圖放大,但是發生什麼事?


了解嗎?左邊是點陣圖放大的結果,右邊是向量圖。如果你在文件需要圖片顯示一個流程、句子部分的關系或類似的,用到字跟線的圖片,用向量圖會讓你放大或縮小之後還是有一個漂亮的結果。

有沒有聽過CorelDRAW這個名字?你有它的盜版,是不是?CorelDRAW獨特的格式(CDR)是向量格式,這個軟體原來有名的地方就是向量圖的制造。你用它修改照片?Tsss...

但是為什麼付錢或用盜版?OpenOffice允許你畫向量圖。或者,如果你想畫很高級的圖:Inkscape。而如果你像用一個開放,而且很流行的格式,你最好要存SVG

不過,照片之類的圖片就可能需要用點陣圖。而這裡我們可能要分壓縮跟未壓縮的格式。未壓縮的格式會為了每一個“點”存一個(黑白)或三到四個(彩色)byte。你有沒有收過BMP格式的screenshot?Windows本身會輸出未壓縮的點陣圖,所以如果一個Windows使用者沒有用額外的screenshot軟體或之後存別的格式(“這樣不是就可以嗎?”),你會收到一個比較大的檔案。

我們算一下:1024x768x3?快2.5MB!那如果用比較現代化的銀幕?1680x1050x3?超過5MB!突然你也了解為什麼上個禮拜的簡報有那麼大,對不對?那怎麼辦?當然要壓縮!不過,我們最好不要把BMP檔壓所成ZIP檔,我們要用一個壓縮圖片格式。

而這裡我們又必須選:你能不能接受失落?我有沒有聽到一個“不行”?確定?我有點懷疑,但是…… 如果你想要小一點的檔案,但是不要有失落,PNG是最好的選擇。你可以選色彩深度,甚至有支援透明。

我還是懷疑你是不是真的不能接受失落。請問,你用你的數位相機拍照的時候存RAW還是JPG檔?沒聽過RAW?了解…… JPG現在那麼流行的原因包含它雖然是失落的壓縮圖片格式,但是我可以自己決定為了每一張圖片對我比較重要的是畫質還是檔案大小。

存JPG檔的時候也要決定圖片的畫質。(甚至你的數位相機也要知道這件事,要不要再參考一下手冊?)畫質越好,檔案越大,這麼簡單。當然,壓縮的時候,圖片內容的“復雜度”也會影響壓縮效果。你應該有發現過你相機的照片有大概一樣的檔案大小,但是不會完全一樣大?

還有…… 每一個點陣圖有它的大小。圖片越大,點或畫素越多,檔案越大。我雖然可以壓縮,但是如果我根本只用XGA(1024x768)的投影機放我的簡報,為什麼裡面要用1600x1200或更大的圖片?一點都沒有意義…… 考慮一下需要的到底是什麼。只因為我們會做一件事,這還不是說我們也必須這樣做或這樣做很聰明。聽說人跟動物的一個主要的區別是人有思考能力。Hmm...

如果你現在剛好思考要用什麼軟體輸出那些格式:放心,你不需要盜版的Photoshop或盜版的ACDSee,免費的GimpPaint.net(Windows,對不對?)或Irfanview就好了。

2008-01-16

社會組科技須知 - 檔案格式 2 (文字檔)

“文書處理就是Word“ - 你會不會也這樣說?那,請問,你對Word的了解多深?一個很基本的問題:你會不會把你寫的文章當RTF檔存?如果你知道,而且也知道RTF是什麼,你不用繼續看。不知道?Hmm... 你會不會說你”會Word“?下次存檔的時候要不要先看一下你的Word可以存哪一些格式?


這是Word2007的存檔視窗。(一個朋友幫我做,我自己沒有Windows)其它版本的選項可能有點不一樣,但是平常每一個文書處理的軟體(有蠻多個,不只有Word)可以存幾種格式,而且一定會包含RTF。

如果你沒有知道這件事,可以啟動Word,按F1,然後慢慢逛。那是華語的說明,所以你應該看得懂。如果你看不懂,你原則上也不懂Word…… 但是我們想談檔案格式,所以我們看一下一些比較重要的格式:

TXT - 最單純的格式,只能記錄字,無法記錄字的格式或圖片。檔案小,相當文章大小。編碼可能造成麻煩,因為最單純的TXT檔不會包含編碼資訊,但是有編碼TXT檔。

RTF - Rich Text Format,符合文書處理主要的需求,所以會記錄字型、大小等,可以包含表格等。大小相當文章大小,但是比TXT大。奇怪的是,微軟自己大概1987年為了交換文章設計這個格式,但是現在好像不太喜歡它。

PDF - Portable Document Format,由Adobe為了交換文件設計的格式。檔案裡面用Postscript,一個印表機語言。所以,一個軟體做出的PDF檔應該跟那個軟體列印的樣子一樣。而且,PDF檔不是要修改的格式,它是最後要輸出的樣子。所以這個格式很適合顯示跟列印。許多平台支援這個格式,為了顯示或制造有不少免費軟體可以使用。

DOC - 這個格式有點麻煩。微軟為了Word已經從DOS版本開始使用這個格式,但是其實不只有一個格式。例如,Word97-2003的格式跟Word6的不一樣,Word2又不一樣,而DOS版本…… 微軟沒有開放這個格式的規格,所以如果微軟不會再支援一個版本,可能沒有人會合法地開這個版本的檔案。所以最近越來越多政府或組織使用ODF。(剛今天微軟公告要開放DOC規格,但是我看到才相信。)

DOC是Word的專屬格式,所以會支援它所有的功能。檔案是這些格式中最大的。這種檔案可以編輯,但是有問題:除了Windows跟OS X沒有平台有Word,而在OS X的Word,文章的排版可能變成跟Windows版不一樣。在Windows版排版的顯示也會跟標凖的印表機有關,所以同樣的Word版本在不同電腦可能顯示不同樣子。(對,不一定是你的錯……)

而且,最糟糕的做法是把DOC檔改成EXE檔。為什麼???如果有人覺得DOC檔太大,那為什麼還要用這個格式呢?而且,如果太大,那就簡單地壓縮一下,例如ZIP檔很流行。但是,只因為有人認為這樣比較“方便”(會嗎?)就把一個文件改成一個只在某些平台可啟動的執行檔 - 這個我真的不了解。

還好網路上沒有病毒或其它的“怪軟體”。還好那些軟體不可能是Windows的執行檔(exe, com, scr, pif等),所以還好沒有組織可能為了安全把那些檔案當掉…… 我在我們計中工作的時候把Windows所有可執行的檔案在proxy當掉 - 馬上幾乎沒有人還會中毒。不過…… 教育部雖然要求所有學校必須注意資通安全,但是學務處跟人事室還是一直抱怨,因為他們必須下載政府單位提供的文件 - 而那些文件常常是EXE檔。厲害……

ODF - Open Document Format是原來OpenOffice的專屬格式,現在是國際標凖(ISO26300),所以越來越多軟體支援它。在所有主要平台可以使用這個格式。檔案會比較小,因為ODF檔是一個ZIP檔,包含幾個XML檔跟另外需要的(例如JPG圖片)檔案。我不需要專用的文書處理軟體就可以修改ODF檔的內容。

DOCX - OOXML,微軟為了攻擊ODF設計的格式。它是MSO2007的專屬格式,目前造成很大的爭論。我建議不要使用這個格式,因為很多人沒有辦法開這種檔案。(你有Word2007?存檔時選別的格式會那麼困難嗎?)而且,連微軟本身好像不完全了解他們自己的6000(!)頁的規格……

那,這些現在要告訴我們什麼?如果我根本只要對方看或者列印我的文件,PDF最好。為什麼我要允許別人亂改我的文件,如果他只要乖乖地印,然後用筆寫?如果他要編輯文件,給他RTF比較好 - 除非我只要給一個人,而我知道他用什麼軟體。而如果我要長期保留文章,可能用TXT或ODF比較適合。

那DOC呢?Hmm... 如果對方也用Word,你當然可以試試用DOC。但是,請問,你跟別人交換DOC檔都沒有遇過麻煩?如果有,也許要考慮一下為什麼。我自己這方面影響最深刻的經驗是Word2000不願意開另一個Word2000幾分鍾前存的檔案……

2008-02-18更新:微軟剛今天開放他們主要的檔案格式的規格。這措施主要的希望好像是讓自己的OOXML終於成功變成ISO標凖。

2008-01-15

社會組科技須知 - 檔案格式 1

抱歉,較久沒有寫。其實有寫,但是不太滿意結果,所以要重寫……

檔案格式 - 為什麼是這麼麻煩的題目?因為需要了解一些基礎,但是這裡很少人願意了解那些基礎。我問你:你的應用軟體(不管哪一個)跳出一個視窗,你會不會不用看就知道它裡面所寫什麼?不知道,是不是?那,你會不會看它裡面所寫什麼?好像也不會……

這樣就比較“方便”,不用“浪費時間”看那些。而且,你也不需要,對不對?到現在一直不用知道,為什麼現在會有人說要看?“反正,電腦顯示的那些訊息,我根本都看不懂。而且,我也不要懂。太麻煩。我其實不太會電腦。”

那,我可不可以請你把電腦關掉,交給別人用?因為,看起來,你對電腦這個工具一點興趣都沒有。如果你不會了解一個工具,也不願意了解這個工具,你是不是最好不要用這個工具?常識會建議我們這麼做……

“但是我一定要有電腦!我的同事都有電腦!而且,沒有電腦,不是比較低級的工作嗎?”

Hmm... 如果電腦的使用包含在你工作範圍內,你是不是最好要了解一下?你是不是需要知道你要怎麼做你的工作?可能還是要學一下…… 如果你願意學,我會跟你談檔案格式的問題。

平常,每一個軟體會有辦法處理幾種格式的檔案,不管是跟文件、影片、音樂或圖片有關的軟體。沒有這種彈性的軟體平常活不下去很久。

我們用不同格式因為每一個格式有它的特色,有它的用途。我當然可以用一台Porsche搬家,但是會有點麻煩,因為這不是這台車的用途。我也可以開大卡車去逛夜市。不是不可能的,但是也不是很聰明的選擇。檔案格式一樣都有它們的用途。

所以,存檔的時候,我可以簡單地點那個磁片的圖像(存檔圖案),寫個檔案名,按Enter就好了 - 或者我可以考慮我的目的到底是什麼,我這個檔案的用途會是什麼,要用我這個檔案的人到底有沒有辦法順利地使用它?

我可能要考慮檔案大小重不重要,還是畫質或音質更重要?我是不是要保留這個檔案比較久?我知不知道對方使用的作業系統跟應用軟體?

你現在可能還不了解為什麼這些問題的答案可能比較重要。所以我們最好分開看五種檔案的格式:
文字檔
圖片
聲音檔
影片
壓縮檔

2008-01-02

Conference fun (CJCU)

So I got it confirmed again: Foreigners can speak their native language, but that's about it. Well, that at least was my impression when I attended this conference last weekend. I should probably mention that this conference was about interpreting and translation. So, naturally, one would expect the people there to have the one or other relation to either interpreting or translation - or both, if you want. And since this conference took place in Taiwan, one might assume that people attending there will understand Chinese. At least my logic tells me so.

When I arrived however, I was asked by someone from the organising department (translation and interpreting) where I came from. Next question:

"So you teach English there?"
"No, Interpreting."

And that was just the beginning. Right in the first session, the moderator opened by commenting (in English) that there are foreigners present and that those foreigners surely don't quite understand Chinese, so he would moderate in English. He didn't even ask if those foreigners perhaps might understand Chinese.

I could only spot two white faces (including mine) at that time, I didn't check if one of the two Japanese attending was present. But I'm pretty sure the moderator did not mean them when he spoke of "foreigners". I had seriously thought about leaving the room, mentioning in Chinese on my way out that I better don't want to cause too much inconvenience.

Btw, what sense does it make for someone who does not understand the local language and has no relation to interpreting or translation at all to come to such a conference where every presentation will be related to translating to or from Chinese? I don't see any.

During the last session of that conference, a student then asked me if I needed "this" - which was a receiver, probably UHF, with a single earphone. I declined politely (and with a grin), but later still took one to check what was happening on the airwaves.

There were (graduate?) students sitting in the back of the room, not separated from the other audience, without earphones, trying to simultaneously translate what they heard coming from the front in Chinese into English. The result was not overwhelming, but as you can see from the description, all the conditions were not quite in their favour. And some of the presenters did not help those students much with their style.

Personally, I found the last two presentations to be the most interesting. Unfortunately, most people not from CJCU had already left, probably because the presenters were "only" postgraduate students. But they were well prepared, finished on the mark, and what they spoke about was interesting too.

There was some software mentioned during this conference, and the geek in me couldn't rest before he knew a bit more about them:

- Paraconc is payware and calls itself "a bilingual or multilingual concordancer". However, you will need equivalent texts in source and target language, if you want to work with this one. And something tells me that this can be done with OSS.

- MIT OpenCourseWare is a collection of free course materials available on-line. Need something to feed you? Here you go...

- Translog is a keylogger that seems to be pretty popular in linguistic circles. Despite this fact I couldn't find a homepage for this. But you could basically use any other keylogger, they should all do the job.

Oh, one more thing: Thank you for the music! It was not punk rock, but a nice ensemble of 70's songs. (not 50's, as someone claimed) So I'm looking forward to the conferences next semester...

2007-12-12

社會組科技須知 - 軟體本地化: gettext (2)

我已經說過gettext為本地化的好處。那時候我提過幾次po檔專用的編輯軟體多好用。那,我們看一下有什麼軟體。最有名的應該是poedit。不管你用的是WindowsOS XLinux,到處都可以用poedit。我自己沒有Windows主機,所以我能放的是OS XLinux的畫面。先OS X:


而這個是Linux版:


兩個版本有讀的po檔不一樣,一個是Drupal的語言檔(華語),另一個是Postnuke(日語)。我們看一下有哪一些比較重要的部分:


我已經說過,源語言的內容沒有辦法改,軟體只會顯示那些視窗。翻譯可以改的是下面的目標語言視窗。在左邊我會寫翻譯,在右邊可以留下說明、意見等。

在狀態列(最下面)軟體會告訴我們總共有多少個記錄,多少個還要翻,多少個模糊。如果有未翻的記錄,poedit會先放那些給我們看。不過,我們的本地化可以開始之前我們一定先要輸入一些設定:


我們一定要告訴poedit誰想使用它,因為poedit讀pot檔(樣本)的時候會自動地把這些資訊放進去。如果你打算較長期做這種本地化的工作,你最好先找一個比較“穩定”的信箱,像GMail或類似的地方。不要換工作或學校就沒有辦法聯絡你,有人可能需要你……

在上面的設定也可以看到一個Translation Memory選項。我希望你知道這種翻譯記憶是多好用的東西…… 所以,高興吧,poedit也提供這個功能。


我們也可能要選語言方面的設定。我希望你知道編碼是什麼東西…… 上面的設定是屬於另外一個軟體,gtranslator。它只有Linux版,而且是為了Gnome做的。


Gtranslator也有TM(翻譯記憶),所以它一段時間有學你的翻譯之後也可以自己提供目標語言版本。這個版本不會完美,但是你用越久,它的版本越準。不對的地方當然可以修改。所以,如果你沒有能力或懶得做翻譯,電腦沒有辦法替你工作,但是它可以讓你的工作輕鬆多了。

這是gtranslator:


而這裡有為了KDE做的軟體,KBabel


你會發現,雖然有三個不同的軟體,兩個作業系統的版本,但是它們在很多方面一樣:它們都會給我們看一個記錄裡面的資訊,讓我們方便地翻,允許我們把狀態改成模糊等。Windows的poedit也一樣,所以不用怕。

你只要先輸入基本資料,包含目標語言跟編碼,下載一個pot檔,讀進去,然後就可以開始翻。翻完後軟體會自己“另存”一個檔案,然後你只需要把那個檔案寄給負責你做本地化的那個軟體的人。這麼簡單……

OK,技術方面的部分其實會這麼簡單。如果你真的是語言方面的專家,我想你應該自己知道在翻譯的過程中要注意什麼。我這裡只想讓你不會怕技術……

以上介紹的其實都是個人使用的軟體。不過,軟體開發有合作的話就更好做,對不對?翻譯也一樣。所以,我在上面談的同樣的功能現在也可以在網路上使用。

一個不錯的軟體是Pootle。你可以用它自己設一個本地化網站。而如果你想看到一個真漂亮的開發(包含本地化)的環境,你一定要逛launchpad。這是Canonical為了Ubuntu開發建的網站。這個網站真棒……

2007-12-11

Conference fun (NKFUST)

Last week I attended a conference in Gaoxiong. While the topic ("Transcending Borders: Innovations in Language Learning and Use" - a little bit too "Web2.0"ish for my taste) was not that exciting, it was still "fun" - from a certain point of view.

First of all, while most presentations revolved around the use of technology (mostly in the form of computers) in language teaching, most of the presenters encountered technical difficulties using a computer to present their findings. Irony, anyone?

It was fun to see the use of PHP and MySQL (pronounced as "my S Q L" during the presentation) declared to be the "optimal choice" for a machine translation web interface. That's like saying the 8051 is the ultimate choice for all controller needs. Let's say it was the only thing the guy who wrote the code could come up with...

The same interface still lacks user authentication and permission control. I would have suggested to become familiar with the API of a popular CMS and then make the code into a module for that CMS, but at that time I think nobody would have understood what I was talking about. I'll better try to contact the poor guy who has to write the code directly... (Though he would not like my suggestion, as it means work for him...)

Captain Obvious was also attending. He found out that "students prefer the use of technology in language teaching" over the pure use of textbooks. Surprise, surprise, who would have thought that?

I had asked whether the "technology" in that study would also include cassette tapes, since (depending on the point of view) that is a technology that has been around for about 70 years now. Yes, tapes were included in that "technology". Unfortunately I forgot to ask how students like the tapes (and CDs these days) attached to textbooks. Now that would have been interesting... (Or not, from my experience, as Captain Obvious already knows the answer...)

A few publishing houses presented some of their offers outside. I looked through a few books on "simultaneous interpretation". Quite interesting to see people claiming that there is only one way to properly translate a given example sentence and at the same time calling the own profession "interpretation". The title in Chinese was not much better: 同步翻譯...

There was also a book with the title 專業翻譯. However, contrary to most courses with that title, this book deserved it, as it dealt with many aspects of working as a translator. The publishing company is Bookman (書林).

But the real "fun" came later, in the afternoon. As an interpreter, I am naturally concerned about communication (in whatever ways, as you may have noticed), mutual understanding - and misunderstanding, of course. Although there were some "funny" moments spread over the day, this was not one of those "cheap" conferences only held for a few people to be able to say they presented their research on a conference.

People discussed things at that conference that I will probably never hear even mentioned at other (cough, cough...) schools. But even those supposedly highly qualified experts found it absolutely normal that one can not write Chinese without a "special" keyboard, meaning that people moving to the US have to write in English to their friends in Taiwan.

In another presentation regarding the use of both Chinese and English ("code switching") on a BBS in Taiwan it was not even considered that some of the "English" written there could actually be romanised Chinese. (I admit this is not something I would expect to see on a BBS in Taiwan, but nevertheless it should be correctly identified if it shows up.)

In my opinion this is a pretty sad state, but even for those language experts romanisation is not an issue, it seems not to exist at all. Zhuyin is a phonetic system to write Chinese as is Hanyu Pinyin or even Tongyong, just with a different script. But while people here are quite familiar with Zhuyin, nobody regards a word written in Latin script anything else than "English". And this is sad indeed, as it shows a serious misconception regarding writing systems and even language in general.

Well, I'm looking forward to the next conference at another school, this one a little bit more related to my official field of expertise. Though... IIRC, they too spoke of "interpretation" - and they are asking for "English names", something NKFUST (Thanks!) did not do...

2007-12-10

社會組科技須知 - 軟體本地化: gettext (1)

我蠻確定你沒有聽過gettext這個名稱。那它到底是什麼呢,而為什麼語言方面的人要知道或甚至了解它?

首先,如果你打算自己寫程式,你可能要花一點時間自己看gettext相關的資料。我沒看過華語的手冊,但是你應該有習慣這一件事。不過,如果你是筆譯或另外語言相關的人,我想在這裡解釋你關於gettext可能要知道的部分。

Gettext是一個library,一種功能庫。它不是“某一種”功能庫,它的用途是軟體國際化跟本地化(i18n/l10n)。所以,gettext能夠幫助寫程式的人做出多一些語言的版本。

它也會幫助翻譯人員,因為它會把軟體的語言檔提供在一個特殊的格式。那種檔案叫"po"或"pot"檔。"pot"表示它是范本檔,這兩個的區別跟一般文書處理的檔案一樣。

這些檔案對翻譯那麼有用是因為它們非常適合處理各種各樣的語言,因為它們可以包含許多跟翻譯過程有關的資訊,因為它們專用的編輯軟體保證連電腦使用方面較弱的人(社會組……)不會“破掉”東西。那我們看一下每一點。

能夠處理各種各樣的語言:你不只能選你要用什麼編碼,你也可以設定你的目標語言使用幾種(以數量定的)復數。華語沒有復數,但是英語有一種,俄語有兩種,而一些語言甚至有三種復數。

Gettext的手冊也強調軟體輸出詞句的準備,說明怎樣的string才比較適合順利地翻成其它語言。這些是軟體設計的人員或“語言顧問”需要注意的。沒有做到的話,可能沒有辦法翻到一些語言或至少會遇到困難。

可以包含許多跟翻譯過程有關的資訊:po檔開頭已經提供不少資訊,包含翻譯人員相關資訊,像名字,信箱等。Open Source Software在華語雖然被稱呼“自由軟體”,但是它還是會尊敬每一個人的貢獻,所以也會記錄誰有翻哪一個部分。

不過,更有趣的是檔案內容。我先“偷”一下手冊相關的部分

# translator-comments
#. extracted-comments
#: reference...
#, flag...
msgctxt context
msgid untranslated-string
msgid_plural untranslated-string-plural
msgstr translated-string
msgstr[0] translated-string-case-0
...
msgstr[N] translated-string-case-n

一個記錄可以包含這些部分。那我們看一下一個一個有什麼作用:

# 這樣開始的行包含翻譯的意見或說明。

#. 這裡有設計軟體的人在程式碼或在這個檔案留下給翻譯的一些建議或說明。

#: 在這裡,軟體會記錄這一句從哪一個(哪一些)檔案的哪一(些)行來,因為翻完後也要把結果再放回去。人一般看不到這一行的內容,軟體才用得到。

#, 狀態。唯一跟翻譯有關(而翻譯可以改)的狀態是"fuzzy",模糊。如果有人覺得原文跟結果不太相當(因為原文有變,翻譯人不完全了解原文的意思等),他可以把這個記錄的狀態改成“模糊”,所以其他人會知道哪裡還要再看。

msgctxt 如果源語言為了表示不同意思使用同樣的詞,同樣的表現方式,我們可以有幾個同樣內容的msgid,但是經過msgctxt的說明告訴翻譯人員這一句要用在什麼環境,在什麼情況下,所以在目標語言可以選相當而不同的版本。

msgid 這裡終於有源語言的詞句。

msgid_plural 如果也想顯示源語言的復數格式,就會放到這裡。

msgstr 翻出來的,目標語言的版本會在這裡。

msgstr[0] 如果目標語言支援或需要復數,這個復數版本會在這裡。如果一個語言有幾種復數,我們另外也可以看到其它msgstr[n]的行。不過,因為華語沒有復數,我們一般用不到。

現在會怕,對不對?好復雜…… 別怕!不要忘記:專用的編輯軟體保證連電腦使用方面較弱的人(社會組……)不會“破掉”東西!人平常看不到每一行,專用的編輯軟體會處理,會給翻譯人員他們需要的,而不會讓他們弄壞東西。

例如,翻譯雖然(必須)看到源語言的詞句,但是完全沒有辦法改。可以改的只是目標語言的部分。這裡你不可能不小心刪掉源語言的句子,放心!談到亂改,你唯一能夠“亂改”的地方是目標語言,但是因為源語言一直還在,每個人能發現有問題,而能把狀態改成“fuzzy”,所以下一個懂目標語言的人知道他還要看哪裡。

你也不用擔心沒有(不會)翻完。專用的編輯軟體會馬上知道這個檔案包含多少個記錄,其中多少個已經翻好,多少個比較模糊等。所以,如果你想幫忙做一個軟體的本地化,但是沒有很多空或部分不太熟,你也可以翻你有辦法翻的部分,然後把檔案寄回去,讓下一個人繼續翻。(這裡有好一點的方法,改天會談。)

今天我先想談理論。我希望你會大概了解gettext可以為你(翻譯)做什麼。如果你真想了解,你就可能要用po檔做本地化。而如果你之前有做過其它非應用gettext軟體(Firefox擴充套件等)的本地化,你也會了解gettext對軟體國際化與本地化提供多大的貢獻。

gettext (2)的文章我會介紹專用的軟體,讓你了解什麼是“方便”……

2007-12-05

口譯的數字麻煩

口譯遇到數字的時候很容易會有一些麻煩。我們在溝通的過程中如果使用具體的數字,我們平常有必要用。假如我去買飲料,下面的會話有可能嗎?

“老板,我要一些真奶。“
”好。“
”老板,這樣多少?“
”很便宜,給我一些些錢就好。“

我想我應該沒有機會遇到這種情況…… 所以,如果我們講話用到數字,我們平常不會隨便做。所以,口譯也必須把那些數字傳到目標語言。數字不一定很好記,所以我平常會建議我的學生把它們記錄一下。為了這種筆記,口譯最好要在身上帶小筆記本。比較強的人還會有另外的方法:他們平常不需要做筆記,所以真需要的時候(電話號碼或其它數字)直接寫在手上。

有時候有人問口譯跟筆譯除了一個講話一個寫字之外還會有什麼區別。這裡有一個:口譯平常(請注意這個“平常“)不需要換算。意思是,如果源語言跟目標語言用的單位不同,口譯平常不需要把數值換算到其它單位。如果美國人說"With a full tank, this car can run 220 miles",口譯可以翻“加滿油,這台車可以跑220英里“,但是筆譯可能要寫"加滿油,這台車可以跑354公里"。

也許,目標語言的人會問口譯“那,220英里是大概多少公里”。那時候可以試試大概予計,但是因為口譯是人而不是電腦,平常沒有人會期待這種換算。不過,在台灣有一種換算一定要做:年份。

沒有離開過台灣這個小島的人可能還沒有發現,但是“外面"的世界不知道現在是民國哪一年,他們大部分根本不知道有人會要用這種算法。所以,如果一個台灣的總經理說“我們民國90年已經跟A公司合并”,我們可能在英語(或原則上任何一個其它的語言)要說“We merged with A company as early as 2001"。在台灣雖然有不少人很喜歡談“全球化”,“ISO”等,但是這個古董還在。

不過,真麻煩的是較大的數字。到千還沒有任何問題,但是如果到萬或更大的數字,口譯可能也要辛苦一點 ── 如果一個語言是華語、韓語或日語而另外的語言不是。原因是華人、韓國人跟日本人用一個(從西方人立場來看)比較“奇怪”的數法,每四位換一個名稱。

其它語言平常會每三位換一次,所以數字越大,口譯好像越辛苦。不過,情況也不一定那麼糟糕。我們先看一下兩邊怎麼數,用華語跟英語為例。在華語,最右邊(而最後聽到)的數字代表一,代表多少次有包含“一”這個數值。下一個代表十,然後百,然後千。

之後,我們會開始談到“萬” - 在第五、第六、第七跟第八位。不過,除了用“萬”,那些數字還會代表什麼?跟前四位一樣代表“一”、“十”、“百”跟“千”,只是現在它們代表“一萬”、“十萬”、“百萬”跟“千萬”。所以,在這裡我想把那些“一”、“十”、“百”跟“千”叫數字的“名”,而把“萬”、“億“、”兆“等當數字的”姓“。

這樣看,我們有一些家庭,姓”萬“、億”、“兆”(加上一個無姓的家)等,而每一個家有一樣的人:“一”、“十”、“百”、“千”。這樣看,一個數字不管多大,它變大其實一直會按照同樣的制度:超過一家的四個人的人數,就要開始談到另外一家,而每次再談到同樣的人,只是屬於不同家庭。

那,英語呢?首先,英語用的一些名稱其實不是來自英語。西方人用的大數字名稱好像要“怪”法國人。在1485年,Nikolas Chuquet想出這個制度:

103 = thousand
106 = Million
109 = thousand million
1012 = Billion
1015 = thousand billion

你可能覺得這種數法也比較奇怪,因為你沒有看過。其實,沒有人在用這個制度,因為後來Jaques Peletier du Mans有修改它:

103 = thousand
106 = Million
109 = Milliard
1012 = Billion
1015 = Billiard

你也沒有聽過"milliard"或"billiard"?那你除了英語可能沒有學過其它西方語言。以上的制度現在叫"long scale"。從語言數量的角度來看,它可能是這個行球上最流行的制度。英語以前也有用過這個制度,但是例如英國1974年換成"short scale",一個你應該有遇過的制度:

103 = thousand
106 = million
109 = billion
1012 = trillion
1015 = quadrillion

如果繼續用“家庭”的想法,上面的"thousand"、"million"、"billion"等是英語裡數字用的“姓”。不過,這裡每一家只有三個成員:"one"、"ten"、"hundred"。

理論先到這裡,我們開始應用吧。作口譯碰到數字的時候最好要把它們寫下,這我們已經談過。我們要寫的是單純的每一位的數值,不要任何“千”、"million"等。如果中間或後面”缺“一些零,我們也要寫。

像在英語要把5000念"five thousand"。五之後的數字不用念出,因為全部都是零。所以,我們必須知道"thousand"的後面還有三位,所以聽到"thousand"之後沒有聽到其它數字,我們就可能要加三個零。

一個比較麻煩的地方是華語跟英語針對零的不同處理方法。在上面的“5000”的例子,兩個語言一樣,但是如果數字是“5500”,在華語很多人習慣把它念“五千五”,沒有“百”。而且,在英語不用念中間的零。像“5005”變成"five thousand five"。如果我們比較華語的“五千五”跟英語的"five thousand five",我們發現它們詞方面一某一樣,但是它們代表的數字並不是。小心……

那,這樣談,我們如果寫下較大的數字好像要寫一個很長的數字。這樣之後要怎麼知道怎麼念?有方法。在西方語言根本已經有習慣在較大的數字中間加符號“分組”。我們那時候要分的是我上面提到的“家庭”。所以,文件裡面我們平常看到的是123,456,789而不是123456789。在英語,標準符號是逗號,其它語言可能用別的符號。

那些符號的位子剛好在我們念數字的時候會念一家數字的“姓”。在上面的例子,第一個符號代表“million”,第二個代表“thousand”。華語好像沒有這種習慣。不過,我們最好也要分組。因為英語的符號已經在下面,華語的符號最好要寫上面,而且那個符號也要放在我們念“姓”的地方。所以,上面的數字在華語聽到寫下會變成1'2345'6789。這裡,第一個符號代表“億”,第二個代表“萬”。

現在我們終於要動手:不管我們聽到哪一種語言,我們寫下數字,然後在那個語言會念數字的”姓“的地方加符號 - 西方語言的話加在下面,聽到東方語言的時候加在上面。然後,寫完數字之後,我們會再加上目標語言的符號。所以,不管我們從什麼語言翻到什麼語言,如果是東方語言跟西方語言之間,上面當例子的數字會變成這樣:

1'23,45'6,789

現在我們可以用目標語言,較容易把數字念出來 - 過關了!

2007-12-04

It always comes as a surprise

I can't be cool, or nonchalant
Call me an impulsive fool, you're all I want
You may be right, it's too much too soon
To talk of love all night in your bedroom

I don't know why it always comes as a surprise
To find I'm here with you
You smile, and I am rubbing my eyes
At a dream come true

I won't play games or waste your time
But I won't feel ashamed to speak my mind
So just relax, don't question why
For calculated facts will not apply

I don't know why it always comes as a surprise
To find I'm here with you
You smile, and I am rubbing my eyes
At a dream come true

In my life, there've been few
Who affected me the way you do (you do)
You do (you do)

I'll tell no lies, I won't pretend
But if you've got a broken heart, I'll help it mend

I don't know why it always comes as a surprise
To find I'm here with you
You smile, and I am rubbing my eyes
At a dream come true
Smile, and I am rubbing my eyes
At a dream come true

2007-11-26

話 ── 沒意思而已?

我真愛在我周邊常常聽到的(空)話。真愛死……

像“這是一個趨勢”,我聽到這一句就想趕快跑掉,因為那個人會跟我解釋他在電視或報紙上看到人家說一個東西現在流行,所以他認為他也要(做),而且我最好也要。這有點像你問一個人他休閒活動是什麼,然後他回答“看現在流行什麼”。話反過來說變成“我不知道我想要或喜歡什麼,我需要別人告訴我。他們說什麼我就做什麼。” Nice...

現在很多人瘋狂"Web2.0"。這也是一個“趨勢”。不過,"Web2.0"是什麼?好像沒有人真的有辦法說。為什麼?因為這只是一個"marketing buzzword"。原則上,Web2.0的意思是我們把所有的角改成圓形的,然後我可以賣你免費給我的內容,而且感謝你給我你所有的個人資料,因為我也可以好好利用它們。如果你不喜歡這個說明,User Friendly有一些有道理的。

在學校也無法不遇到這種空話。"E-learning"... 其實,如果要做到e-learning,不需要花很多錢。我在計中工作的時候也有遇到一些想要賣這方面“完整的solution”。(他們真的會說“solution”,好像沒有比較好的華語的說法……)不過,他們的軟體平常蠻有限制。而且,他們只會提到硬體方面的需求,不會談到另外一種“軟體” ── 人。

為什麼一些人真的認為如果我把一個課程放到網路上,所有的學生馬上會上線上課?如果他們不會來到我能看到他們的教室,他們怎麼會準時自己上線到一個我只能看到IP跟帳號,但是看不到人的地方?夢想……

我幾年前(哇,好像真的已經快三年了)有用免費的Open Source軟體裝一個e-learning的網站要給我們系所用。結果:沒有人要用。不管是老師們或學生。為什麼?麻煩。老師們如果要用的話還要自己輸入教學內容,要做一些設定 ── 而且不是紙上寫的,都要在電腦上做。而學生…… 我不想再聽到那句“現在的年輕人網路都很厲害。”亂講。一些會,但是很少。大部分的人只能模仿別人“教”他們的一些動作。

你有沒有發現現在有很多課程、系所、甚至學校名稱裡包含“應用”?看起來現在很流行“應用”。不過,應用什麼?怎麼應用?我教的系所也是其中一個會“應用”的語言相關的系。所以,我們應該要應用語言。不過,如果真的要應用語言,可能也要有另外一些能力、技巧、知識。至少我教口譯的時候會給學生這種額外的能力。

不過,單純教口譯或筆譯也還沒有很多用。畢業之後,學生要翻什麼?文學?Harry Potter弟123個中文版?(為什麼沒有人要翻Douglas Adams?太難,對不對?)還有一些嘻嘻哈哈的聊天?然後呢?我在別的學校有教過“科技翻譯”。問題是,那些學生都是社會組,他們對“科技”(請問,什麼是“科技”呢?這包含蠻多東西……)的了解會多深?如果我要翻一片文章或一個會話,我必須了解內容,不然我只在玩游戲。

在那所學校還有另外的問題:研究所的學生當然蠻強,所以比較容易克服一些問題,但是四年級…… 我一直覺得他們翻出來的版本不太“漂亮”,不太順。問他們之後才發現他們根本沒有上過“普通”的筆譯課!如果他們還沒有了解基礎,他們要怎麼做進階一點的翻譯?

不過,跟口譯或筆譯不太有關的人對這種問題好像不太在乎。我在我們系原來不想教同步口譯,因為我認為我們的學生還沒有達到相當的水準。或者,如果真的要開這種課,真的要給他們多一點機會準備,所以至少要有兩年的逐步口譯。不過,其他人認為只需要一年(四個學分)的逐步口譯,然後就可以上同步口譯。如果已經有上過其中一種的口譯,那就應該要上另外的,對不對?

不過,這樣可以做到什麼“同步口譯”?自己想…… 我發現比我原來期待的還有多一些課(在各學校)會這樣:有一個很漂亮,很偉大的課程名稱,但是…… 像“專業翻譯”:台灣人很喜歡“專業”這個詞。但是,如果只有一個“專業”的翻譯課,其它翻譯課應該“沒有專業”,對不對?

或者看“模擬”,像“模擬口譯”。意思是不是只要假裝做口譯,所以只要假裝上課?原則上,所有的口譯或筆譯課都在“模擬”實在的工作。還是哪裡有學生上口譯課還可以賺錢?我沒看過……

“高級”應該也要加入這個俱樂部。我有教過“高級英語會話”。我不想再想到那門課。為什麼不能簡單地用“基礎”跟“進階”?(我有教過這樣兩種的筆譯課,學生跟我都還活著)答案好像很簡單:因為不好聽。主要的不是內容,主要的是包裝、空話。

所以,那些話 ── 沒意思而已……