Googleが「Gemini 3.5 Transcribe」を発表しました。音声を文字にするだけでなく、話し手の意図をくみ取り、読みやすい文章へ整える音声認識モデルです🎙️
言い直しや「えーと」「あの」などを整理し、雑音・専門用語・登録した社内用語にも対応。会議や通話ログは話者ごとに分け、単語単位のタイムスタンプも付けられます📝
リアルタイムのストリーミングと録音音声の処理に対応し、議事録、顧客対応メモ、インタビュー整理、音声入力などへの応用が考えられます。まずは定例会議の記録から試すと、活用イメージを持ちやすそうです🤝
Geminiアプリ(macOS)、Gboard、Google AI Studio/Gemini APIなどへの展開が案内されています。ただし機能・地域・言語・プランはサービスごとに異なり、Chrome対応は今後予定です。利用前に公式情報を確認しましょう⚠️
音声には個人情報や顧客情報が含まれるため、録音の同意、保存場所、アクセス権、誤変換の最終確認を先に決めることが大切です🔐
「文字起こしの後に何をしたいか」から用途を一つ選び、小さく試してみてはいかがでしょうか。詳細は元記事をご覧ください👇
🔗 元記事:
https://forest.watch.impress.co.jp/docs/news/2135956.html
#Gemini #音声AI #業務効率化 #AI活用

