なんか巷では siri という音声アシストのサービスというか
反応について話題になっているようだ。
なにがスゴイって、日本語の認識機能がかなり高い…らしい。
相手(機械:i‐Phoneとかi‐Padとか)に
「○○さんに30分遅れますとメール送って」とか言うと
「わかりました」と音声で返事して
ちゃんと○○さん宛に「30分遅れます」という文書を送ってくれるらしい。
スケジュール管理も口頭でできるらしい。
「4月6日に会議」と言えば
「何時からですか?」とちゃんと聞いてきて
「10時」と答えたら、そのように設定されるとか。
スゴイ!すごすぎる!!
日本語は同音異語が多いし、区切れによって
文意が変わることもあるじゃない?
ここで はきものを脱いでください
ここでは きものを脱いでください
みたいな。
一体どうやって、正しく認識するのだろう。
昔(約25年前)SEやっていた時に
河川管理システムで、雨量や水位の計測値を
音声で知らせるというプログラムを作ったことがある。
○月○日 ○時○分 ××川の水位は △△.△mです
みたいな音声を出力させるのだが
数字のような物でさえ、その数値に合致する音声を選んで
編集するのが大変だったのに…
音声が入力データって、どんなブロックに分けて
認識させるのだろう???
ワープロ機能の予測変換みたいな知識も必要よね。
昔の音声はかなり不自然で
登録してある音声(○月、○日、××川とか)を
組み合わせた時のバランス?があまり良くなくて
変に間(ま)があったり、イントネーションが変だったりしていた。
少し前の、駅のホームで流れていた
○番線に電車が入ります
の「○」と「番線」の間に妙な間があったアレ!
11番線だったりすると
じゅう いちばんせんに…
みたいに、10と1が分かれて音声が流れていた。
あ、電話の時報もそんな感じ。
◎時 ◎十(じゅう) ◎分 ◎十秒 を お知らせします
あのブツブツ切れている感。
でも、今はけっこう滑らかになっていると思う。
昔は記憶容量が少なかったから
11だったら10と1の組み合わせで音を作っていたのだが
今は昔じゃ考えられない程、容量が大きくなったので
1000くらいまで、いや1万くらいまで
普通に数値は個別に登録できているのかな…
音声入力の進化、恐るべし。
このまま行ったら、紙は必要なくなりそう。
ん~… でも、それは寂しい。
0 件のコメント:
コメントを投稿