ボイスメモ
声から文字へ、そしてまた声へ。
録音した会議。車の中で口述したアイデア。昨日の講義。Yappyは端末内の音声認識で文字起こしし、テキストを残します。読むことも、直すことも、別の声でもう一度聞くこともできます。
手順は3つ。
1 録音を共有する 「ボイスメモ」や「ファイル」など、音声を保存しているアプリから共有します。
2 端末の中で文字起こし 端末で動くモデルが担当します。音声は外に出ません。
3 読むか、聞くか ふつうの文書として残ります。読めるし、共有できるし、あらためて読み上げてもらうこともできます。
ボイスメモ
音声認識モデルは別ダウンロード
文字起こしには読み上げとは別のモデルを使います。使うときだけダウンロードします。
このあたりの質問
文字起こしはどのモデルで行いますか?
NVIDIAのParakeet TDT 0.6B v3。ライセンスはCC-BY-4.0。端末の中で動きます。音声のモデルとは別物です。片方が聞き取り、もう片方が話す。
録音した音声は端末の外に出ますか?
いいえ。録音は端末内で文字起こしします。音声の合成と同じく、すべてローカルです。クラウドの文字起こしサービスも、アカウントも、アップロードもありません。
どの言語を文字起こしできますか?
耳は声ほど多くの言語を話せません。文字起こしは主なヨーロッパ言語だけ。Yappyが読める31言語ではありません。読み上げなら31言語。音声からテキストへの変換は、この短い一覧のみです。
追加でダウンロードするものはありますか?
はい。「耳」のモデルは別途ダウンロードします。最初に文字起こしをしたときの一度だけです。文字起こしを一度も使わなければ、端末の容量を取ることもありません。