用語集
AI音声認識
読み方
えーあいおんせいにんしき
AI音声認識(えーあいおんせいにんしき)とは、人工知能技術を活用して人間の音声をテキストに変換する音声認識技術を指し、深層学習・大規模言語モデルの進化により認識精度が飛躍的に向上した現代AIの代表的応用分野である。代表的なAI音声認識サービスは、OpenAI Whisper、Google Speech-to-Text、Microsoft Azure Speech、Amazon Transcribe、Apple SiriKit、AmiVoice(アドバンスト・メディア社)、Notta(ノッタ)、Rimo Voice、SpeakerStation、Otter.ai、tl;dv、Google Pixel Recorderなど。AI音声認識の典型的な応用は、第一に「議事録自動作成(会議の音声をリアルタイムで文字化)」、第二に「電話対応の自動文字化(コールセンター)」、第三に「字幕生成(YouTube・配信動画)」、第四に「医療・法律分野の音声記録(カルテ・調書作成)」、第五に「音声入力(スマホ・PCへのテキスト入力)」、第六に「翻訳(音声→テキスト→翻訳)」、第七に「アクセシビリティ(聴覚障がい者向け字幕)」などである。建設業・不動産業の業務では、現場打合せ・社内会議・顧客対応の議事録自動作成、現場写真への音声メモ文字起こし、AIアシスタント連携などで活用が広がっている。マンション・ビル・ホテルの大規模修繕工事における管理組合理事会・住民説明会の議事録作成にも活用でき、業務効率化・透明性向上に貢献する。明誠でもAI音声認識ツール活用を推進し、JCSAでもDX・生成AI関連セミナーを開催している。

