2012年3月9日金曜日

音声入力

なんか巷では siri という音声アシストのサービスというか
反応について話題になっているようだ。
なにがスゴイって、日本語の認識機能がかなり高い…らしい。
相手(機械:i‐Phoneとかi‐Padとか)に
「○○さんに30分遅れますとメール送って」とか言うと
「わかりました」と音声で返事して
ちゃんと○○さん宛に「30分遅れます」という文書を送ってくれるらしい。
スケジュール管理も口頭でできるらしい。
「4月6日に会議」と言えば
「何時からですか?」とちゃんと聞いてきて
「10時」と答えたら、そのように設定されるとか。
スゴイ!すごすぎる!!

日本語は同音異語が多いし、区切れによって
文意が変わることもあるじゃない?
 ここで はきものを脱いでください
 ここでは きものを脱いでください 
みたいな。
一体どうやって、正しく認識するのだろう。

昔(約25年前)SEやっていた時に
河川管理システムで、雨量や水位の計測値を
音声で知らせるというプログラムを作ったことがある。
 ○月○日 ○時○分 ××川の水位は △△.△mです
みたいな音声を出力させるのだが
数字のような物でさえ、その数値に合致する音声を選んで
編集するのが大変だったのに…
音声が入力データって、どんなブロックに分けて
認識させるのだろう???
ワープロ機能の予測変換みたいな知識も必要よね。

昔の音声はかなり不自然で
登録してある音声(○月、○日、××川とか)を
組み合わせた時のバランス?があまり良くなくて
変に間(ま)があったり、イントネーションが変だったりしていた。
少し前の、駅のホームで流れていた
 ○番線に電車が入ります
の「○」と「番線」の間に妙な間があったアレ!
11番線だったりすると
 じゅう いちばんせんに…
みたいに、10と1が分かれて音声が流れていた。
あ、電話の時報もそんな感じ。
 ◎時 ◎十(じゅう) ◎分 ◎十秒 を お知らせします
あのブツブツ切れている感。
でも、今はけっこう滑らかになっていると思う。
昔は記憶容量が少なかったから
11だったら10と1の組み合わせで音を作っていたのだが
今は昔じゃ考えられない程、容量が大きくなったので
1000くらいまで、いや1万くらいまで
普通に数値は個別に登録できているのかな…

音声入力の進化、恐るべし。
このまま行ったら、紙は必要なくなりそう。
ん~… でも、それは寂しい。

0 件のコメント: