音声認識・音声合成とOCRとは?
音声認識・音声合成とOCRとは、音声認識は、人間の話し声をテキストデータに変換する技術。音声合成は逆に、テキストデータから人工的な音声を生成する技術。OCR(光学文字認識)は、紙面や画像に写った文字を認識してテキストデータに変換する技術。いずれも入力方法をデジタル化する技術として広く応用されている。
基本情報技術者試験の過去問では1回出題されています。
おんせいにんしき・おんせいごうせいとおーしーあーる
音声認識・音声合成とOCRの意味
音声認識は、人間の話し声をテキストデータに変換する技術。音声合成は逆に、テキストデータから人工的な音声を生成する技術。OCR(光学文字認識)は、紙面や画像に写った文字を認識してテキストデータに変換する技術。いずれも入力方法をデジタル化する技術として広く応用されている。
音声認識・音声合成とOCRの具体例
スマートスピーカーへの話しかけを音声認識でテキスト化して指示内容を理解し、応答を音声合成で読み上げる。紙の書類をスキャンしてOCRでテキスト化すれば、検索可能なデジタルデータとして扱える。
音声認識・音声合成とOCRは試験でどう引っ掛けられる?
変換の向きを逆にしないこと。声から文字が音声認識、文字から声が音声合成。またOCRは画像を「テキストデータに変換する」技術であって、単に紙を画像として取り込むスキャン(イメージ化)とは別——PDF化しただけでは文字検索できない。手書き文字を対象とするものはOCRと区別してOCR(手書き文字認識)やICRと呼ばれ、活字より認識率が下がる。いずれの技術も認識精度は100%ではなく、業務で使う際は誤認識を前提とした確認の工程が要る点も見落としやすい。
音声認識・音声合成とOCRと関連する用語
音声認識・音声合成とOCRが出た過去問
正解:人間の脳神経回路を模倣して、認識などの知能を実現する方法であり、ニューラルネットワークを用いて、人間と同じような認識ができるようにするものである。
要点:ディープラーニングは多層ニューラルネットで特徴を自動学習する
ディープラーニングは、人間の脳の神経回路をまねたニューラルネットワークを多層に重ね、大量のデータから特徴そのものを自動的に学習させる手法である。人が判断ルールを書き下すのではなく、層を深くすることで画像認識や音声認識といった認識処理を高い精度で行える点が特徴となる。ルールベースの推論やエキスパートシステムとは、知識の獲得方法が根本的に異なる。
出典:平成30年度 春期 基本情報技術者試験 午前 問3(IPA)
最終更新:2026-08-25/解説は資格暗記が独自に作成しています。 過去問の出典は各問題に記載のとおりです。