JP7192995B2 - 判定装置、学習装置、判定方法及び判定プログラム - Google Patents
判定装置、学習装置、判定方法及び判定プログラム Download PDFInfo
- Publication number
- JP7192995B2 JP7192995B2 JP2021537548A JP2021537548A JP7192995B2 JP 7192995 B2 JP7192995 B2 JP 7192995B2 JP 2021537548 A JP2021537548 A JP 2021537548A JP 2021537548 A JP2021537548 A JP 2021537548A JP 7192995 B2 JP7192995 B2 JP 7192995B2
- Authority
- JP
- Japan
- Prior art keywords
- hypotheses
- accuracy
- model
- hypothesis
- auxiliary
- Prior art date
- Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
- Active
Links
Images
Classifications
-
- G—PHYSICS
- G10—MUSICAL INSTRUMENTS; ACOUSTICS
- G10L—SPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
- G10L15/00—Speech recognition
- G10L15/08—Speech classification or search
- G10L15/18—Speech classification or search using natural language modelling
- G10L15/183—Speech classification or search using natural language modelling using context dependencies, e.g. language models
- G10L15/19—Grammatical context, e.g. disambiguation of the recognition hypotheses based on word sequence rules
- G10L15/197—Probabilistic grammars, e.g. word n-grams
-
- G—PHYSICS
- G10—MUSICAL INSTRUMENTS; ACOUSTICS
- G10L—SPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
- G10L15/00—Speech recognition
- G10L15/08—Speech classification or search
- G10L15/16—Speech classification or search using artificial neural networks
-
- G—PHYSICS
- G06—COMPUTING OR CALCULATING; COUNTING
- G06N—COMPUTING ARRANGEMENTS BASED ON SPECIFIC COMPUTATIONAL MODELS
- G06N3/00—Computing arrangements based on biological models
- G06N3/02—Neural networks
- G06N3/04—Architecture, e.g. interconnection topology
- G06N3/044—Recurrent networks, e.g. Hopfield networks
-
- G—PHYSICS
- G06—COMPUTING OR CALCULATING; COUNTING
- G06N—COMPUTING ARRANGEMENTS BASED ON SPECIFIC COMPUTATIONAL MODELS
- G06N3/00—Computing arrangements based on biological models
- G06N3/02—Neural networks
- G06N3/04—Architecture, e.g. interconnection topology
- G06N3/044—Recurrent networks, e.g. Hopfield networks
- G06N3/0442—Recurrent networks, e.g. Hopfield networks characterised by memory or gating, e.g. long short-term memory [LSTM] or gated recurrent units [GRU]
-
- G—PHYSICS
- G06—COMPUTING OR CALCULATING; COUNTING
- G06N—COMPUTING ARRANGEMENTS BASED ON SPECIFIC COMPUTATIONAL MODELS
- G06N3/00—Computing arrangements based on biological models
- G06N3/02—Neural networks
- G06N3/04—Architecture, e.g. interconnection topology
- G06N3/045—Combinations of networks
-
- G—PHYSICS
- G06—COMPUTING OR CALCULATING; COUNTING
- G06N—COMPUTING ARRANGEMENTS BASED ON SPECIFIC COMPUTATIONAL MODELS
- G06N3/00—Computing arrangements based on biological models
- G06N3/02—Neural networks
- G06N3/08—Learning methods
-
- G—PHYSICS
- G06—COMPUTING OR CALCULATING; COUNTING
- G06N—COMPUTING ARRANGEMENTS BASED ON SPECIFIC COMPUTATIONAL MODELS
- G06N3/00—Computing arrangements based on biological models
- G06N3/02—Neural networks
- G06N3/08—Learning methods
- G06N3/09—Supervised learning
-
- G—PHYSICS
- G06—COMPUTING OR CALCULATING; COUNTING
- G06N—COMPUTING ARRANGEMENTS BASED ON SPECIFIC COMPUTATIONAL MODELS
- G06N7/00—Computing arrangements based on specific mathematical models
- G06N7/01—Probabilistic graphical models, e.g. probabilistic networks
-
- G—PHYSICS
- G10—MUSICAL INSTRUMENTS; ACOUSTICS
- G10L—SPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
- G10L15/00—Speech recognition
- G10L15/06—Creation of reference templates; Training of speech recognition systems, e.g. adaptation to the characteristics of the speaker's voice
- G10L15/063—Training
-
- G—PHYSICS
- G10—MUSICAL INSTRUMENTS; ACOUSTICS
- G10L—SPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
- G10L15/00—Speech recognition
- G10L15/22—Procedures used during a speech recognition process, e.g. man-machine dialogue
-
- G—PHYSICS
- G06—COMPUTING OR CALCULATING; COUNTING
- G06N—COMPUTING ARRANGEMENTS BASED ON SPECIFIC COMPUTATIONAL MODELS
- G06N3/00—Computing arrangements based on biological models
- G06N3/02—Neural networks
- G06N3/04—Architecture, e.g. interconnection topology
- G06N3/048—Activation functions
-
- G—PHYSICS
- G10—MUSICAL INSTRUMENTS; ACOUSTICS
- G10L—SPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
- G10L15/00—Speech recognition
- G10L15/08—Speech classification or search
- G10L15/18—Speech classification or search using natural language modelling
- G10L15/183—Speech classification or search using natural language modelling using context dependencies, e.g. language models
Landscapes
- Engineering & Computer Science (AREA)
- Physics & Mathematics (AREA)
- Theoretical Computer Science (AREA)
- Computational Linguistics (AREA)
- Health & Medical Sciences (AREA)
- Artificial Intelligence (AREA)
- Evolutionary Computation (AREA)
- General Physics & Mathematics (AREA)
- Human Computer Interaction (AREA)
- Acoustics & Sound (AREA)
- Multimedia (AREA)
- Audiology, Speech & Language Pathology (AREA)
- Data Mining & Analysis (AREA)
- Computing Systems (AREA)
- General Engineering & Computer Science (AREA)
- Mathematical Physics (AREA)
- Software Systems (AREA)
- Biomedical Technology (AREA)
- Life Sciences & Earth Sciences (AREA)
- Molecular Biology (AREA)
- General Health & Medical Sciences (AREA)
- Biophysics (AREA)
- Probability & Statistics with Applications (AREA)
- Pure & Applied Mathematics (AREA)
- Mathematical Optimization (AREA)
- Mathematical Analysis (AREA)
- Computational Mathematics (AREA)
- Algebra (AREA)
- Image Analysis (AREA)
Description
[リランキング装置]
まず、実施の形態1に係るリランキング装置について説明する。このリランキング装置は、音声認識結果であるNベスト仮説のうちの二つの仮説に対して音声認識精度の高低の判定を繰り返し実行して、最も音声認識精度の高い仮説を最終的な音声認識結果として出力する。
まず、リランキング装置10に必要最低限な機能要件を数式で定義する。W(u)=w1 (u),w2 (u),・・・,wL(W(u)) (u)を、Nベスト仮説中のu位の仮説(単語列)と定義する。また、L(W(u))を、W(u)の長さ(単語数)と定義する。
第1補助モデル111~第M補助モデル11M、メインモデル及び構成について説明する。図2は、第1補助モデル111~第M補助モデル11M及びメインモデル110の構成を説明する図である。図2では、処理の流れを説明するため、判定部15も記載される。
if WER(Word error rate) of W(u)≦WER of W(v)・・・(1-1)
P(0|X(u),X(v))<0.5
otherwise ・・・(1-2)
第1補助モデル111~第M補助モデル11Mの構築例について説明する。第1補助モデル111~第M補助モデル11Mは、同じ構成であるため、図3を参照し、第1補助モデル111の構築例を説明する。図3は、第1補助モデル111の構築例を示す図である。なお、図3では、簡単のため、単語の埋め込み処理embed(・)を行うNNは省略されている。以下、その詳細について説明する。
P(y|X(u),X(v))=sigmoid(z{(u,v)})y・・・(5)
なお、第1補助モデル111及びメインモデル110は、1クラス分類FFNNにおけるシグモイド処理に代えて、ソフトマックス処理を行ってもよい。この場合、エンコーダRNNの出力として得た隠れ状態ベクトルh{(u,v)}が、1層の2クラス分類FFNNに入力され、最終的に、2クラスの記号y={0,1}の事後確率P(y|X(u),X(v))を以下(6),(7)式のように得ることができる。なお、y=0は、W(u)及び仮説W(v)の順位の上下関係が正しいことを示す。また、y=1は、W(u)及び仮説W(v)の順位の上下関係が誤りであることを示す。P(0|X(u),X(v))は、u位の仮説とv位の仮説との順位の上下関係が正しさを確率的に表現する第1の事後確率である。P(1|X(u),X(v))は、u位の仮説とv位の仮説との順位の上下関係が誤りであることを確率的に表現する第2の事後確率である。
P(y|X(u),X(v))=softmax(z{(u,v)})y ・・・(7)
なお、図3に示すエンコーダRNN111-1aのLSTMユニットは、1層単方向のLSTMユニットとしたが、複数層または双方向(bidirectional)のLSTMユニットであってもよい。
また、LSTMユニットの代わりに、単純な(sigmoid関数等を活性化関数として持つ。)RNNや、Gated Recurrent Unit(GRU)を用いてもよい。
さらに、補助モデル及びメインモデル110は、図3の構築例では、1クラス分類NNとして、1層のフィードフォワード型NNを用いたが、複数層のフィードフォワード型NNを用いてもよい。Nベストリランキングモデルは、複数層のフィードフォワード型NNを用いる場合、活性化関数として、sigmoid関数、tanh関数、Rectified Linear Unit(ReLU)関数、Parametric ReLU(PReLU)関数などを用いることができる。なお、補助モデル及びメインモデル110の他の構築例1~4の用語の詳細については、例えば、参考文献2を参照いただきたい。
また、補助モデルは、従来のNベストリスコアリングモデル(例えばRNN言語モデル)により計算されたスコアを、特徴量ベクトルにおける新たな次元として追加して利用することも可能である。
次に、図1に示すリランキング装置10が実行するリランキング処理の処理手順について説明する。図4は、実施の形態1に係るリランキング処理の処理手順を示すフローチャートである。
[学習装置]
次に、実施の形態2として、リランキング装置10が用いるNベストリランキングモデルを学習する学習装置について説明する。図6は、実施の形態2に係る学習装置の機能構成の一例を示す図である。実施の形態2に係る学習装置20は、例えば、ROM、RAM、CPU等を含むコンピュータ等に所定のプログラムが読み込まれて、CPUが所定のプログラムを実行することで実現される。図6に示すように、モデル記憶部21、学習装置20は、仮説入力部22及び学習部23を有する。
次に、図6に示す学習装置20が実行する学習処理の処理手順について説明する。図8は、実施の形態2に係る学習処理の処理手順を示すフローチャートである。図8では、Nベスト仮説から二つの仮説としてW(u),W(v)(u<v≦N)が与えられ、かつ、W(u)の精度は、W(v)の精度よりも高いときの学習処理の処理手順を示す。
このように、実施の形態2に係る学習装置20は、第1補助モデル111~第M補助モデル11M及びメインモデル110に、音声認識精度が既知である学習用のNベスト仮説のうちの二つの仮説を1組として、複数の組についてそれぞれ音声認識精度の高低を判定できるように予めマルチタスク学習を行わせている。したがって、学習装置20は、Nベストリランキングを行う上で最適な第1補助モデル111~第M補助モデル11M及びメインモデル110を、最新のNNに基づき実現することができる。そして、リランキング装置10は、学習装置20において学習された第1補助モデル111~第M補助モデル11M及びメインモデル110を使用することによって、一対一の二つの仮説の比較を精度よく行うことができ、安定した制度でオラクル仮説を抽出することができる。
図8に示す学習処理の処理手順は、計算コストが高い。例えば、Eをエポック数、Mを学習データ中の発話数とすると、上記の学習手順におけるモデルパラメータの更新回数は、最大で、E×M×N×2×NC2になる。通常、Eは数十程度、Mは少なくとも数万、Nは上記の通り100~1000程度であるので、モデルパラメータの更新回数は、膨大な数に達する。このため、本実施の形態では、学習の効率化を図ることが好ましい。そこで、以下に、学習の効率化例1について述べる。
次に、学習の効率化例2について説明する。学習の効率化例1では、Nベスト仮説が与えられたとき、その中に含まれるオラクル仮説とその他のN-1個の仮説とを比較していた。学習処理の効率化例2では、オラクル仮説と比較するその他の仮説の個数を絞り込む。
仮説1は、オラクル仮説の次に高い音声認識精度を持つ仮説である。
仮説2は、音声認識スコアが最も高い仮説である。
仮説3は、最も低い音声認識精度を持つ仮説である。
仮説4は、音声認識スコアが最も低い仮説である。
実際に、実施の形態1におけるNベストリランキングと、非特許文献1記載のNベストリランキングとの比較評価を行った。表1は、CSJ音声コーパスを用いて、非特許文献1記載のNベストリランキングとの比較評価する100(=N)ベストリランキング評価を行った結果を示す表である。表の数値は、WER(Word error rate)率[%]であり、Dev(Development)、Eval(Evaluation)を示す。
なお、実施の形態1のリランキング装置10は、メインモデル110の出力を用いて判定を行ったが、メインモデル110の出力の他に各補助モデルの出力を用いて判定を行ってもよい。図9は、実施の形態3に係るリランキング装置の要部構成を示す図である。
図10は、実施の形態3に係るリランキング処理の処理手順を示すフローチャートである。
この実施の形態3に示すように、メインモデル110による判定情報に加え、全補助モデルによる判定情報を用いて、判定を行うことも可能である。この際、実施の形態3では、各補助モデル或いはメインモデル110に応じて、各判定情報に対する重み付けを行い、重み付け和の値に基づいて二つの仮説の精度の高低を判定するため、オラクル仮説を抽出精度を保持することができる。
図示した各装置の各構成要素は機能概念的なものであり、必ずしも物理的に図示の如く構成されていることを要しない。すなわち、各装置の分散・統合の具体的形態は図示のものに限られず、その全部又は一部を、各種の負荷や使用状況等に応じて、任意の単位で機能的又は物理的に分散・統合して構成することができる。例えば、リランキング装置10及び学習装置20は、一体の装置であってもよい。さらに、各装置にて行なわれる各処理機能は、その全部又は任意の一部が、CPU及び当該CPUにて解析実行されるプログラムにて実現され、あるいは、ワイヤードロジックによるハードウェアとして実現され得る。
図11は、プログラムが実行されることにより、リランキング装置10或いは学習装置20が実現されるコンピュータの一例を示す図である。コンピュータ1000は、例えば、メモリ1010、CPU1020を有する。また、コンピュータ1000は、ハードディスクドライブインタフェース1030、ディスクドライブインタフェース1040、シリアルポートインタフェース1050、ビデオアダプタ1060、ネットワークインタフェース1070を有する。これらの各部は、バス1080によって接続される。
10 リランキング装置
11,21 モデル記憶部
12 仮説入力部
13 仮説選択部
14 特徴量抽出部
15 判定部
16 実行制御部
17 出力部
18 重み付け部
20 学習装置
22 仮説入力部
23 学習部
110 メインモデル
111~11M 第1補助モデル~第M補助モデル
231 教師ラベル付与部
232 入替部
Claims (10)
- 音声認識精度のスコアが対応付けられたNベスト仮説の入力を受け付ける入力部と、
入力を受け付けた前記Nベスト仮説のうち、判定対象である二つの仮説を選択する選択部と、
選択された二つの仮説が与えられたとき、前記二つの仮説を隠れ状態ベクトルに変換し、前記二つの仮説の隠れ状態ベクトルを基に前記二つの仮説の精度の高低を判定できるような、ニューラルネットワークで表される複数の補助モデルと、前記複数の補助モデルでそれぞれ変換された前記二つの仮説の隠れ状態ベクトルを基に、前記二つの仮説の精度の高低を判定できるような、ニューラルネットワークで表されるメインモデルとを用いて、前記二つの仮説の精度の高低を判定する判定部と、
を有することを特徴とする判定装置。 - 前記選択部は、前記Nベスト仮説のスコアの昇順に前記二つの仮説を選択することを特徴とする請求項1に記載の判定装置。
- 前記判定部は、前記メインモデルから出力された判定情報、または、各補助モデルから出力された判定情報と前記メインモデルから出力された判定情報とに対して計算した重み付け和の値、に基づいて前記二つの仮説の精度の高低を判定することを特徴とする請求項1または2に記載の判定装置。
- 各補助モデルは、前記二つの仮説を、再帰的ニューラルネットワークを用いて隠れ状態ベクトルに変換し、ニューラルネットワークを用いて、前記隠れ状態ベクトルを基に二つの系列の精度の高低の並びが正しいことを示す事後確率を出力し、
前記メインモデルは、ニューラルネットワークを用いて、前記複数の補助モデルでそれぞれ変換された前記二つの仮説の隠れ状態ベクトルを基に二つの系列の精度の高低の並びが正しいことを示す事後確率を出力する
ことを特徴とする請求項1~3のいずれか一つに記載の判定装置。 - 音声認識精度が既知である学習用の二つの仮説の入力を受け付ける入力部と、
前記二つの仮説が与えられたとき、前記二つの仮説を隠れ状態ベクトルに変換し、前記二つの仮説の隠れ状態ベクトルを基に前記二つの仮説の精度の高低を判定できるような、ニューラルネットワークで表される複数の補助モデルと、前記複数の補助モデルでそれぞれ変換された前記二つの仮説の隠れ状態ベクトルを基に、前記二つの仮説の精度の高低を判定できるような、ニューラルネットワークで表されるメインモデルとに対し、各ニューラルネットワークが前記二つの仮説の精度の高低を判定するタスクを個別に行うとみなしたマルチタスク学習を行わせる学習部と、
を有することを特徴とする学習装置。 - 前記学習部は、前記二つの仮説のうち音声認識精度がより高い仮説に他方の仮説よりも高い順位が付与されている場合に正解ラベルを付与して前記複数の補助モデル及び前記メインモデルに学習させ、前記二つの仮説のうち音声認識精度がより高い仮説に他方の仮説よりも低い順位が付与されている場合に誤りラベルを付与して前記複数の補助モデル及び前記メインモデルに学習させることを特徴とする請求項5に記載の学習装置。
- 前記学習部は、各ニューラルネットワークによって実行された各タスクについて所定の損失をそれぞれ計算し、各損失の重み付け和に基づいて、各ニューラルネットワークのパラメータの値を更新することを特徴とする請求項5または6に記載の学習装置。
- 各補助モデルは、前記二つの仮説を、再帰的ニューラルネットワークを用いて隠れ状態ベクトルに変換し、ニューラルネットワークを用いて、前記隠れ状態ベクトルを基に二つの系列の精度の高低の並びが正しいことを示す事後確率を出力し、
前記メインモデルは、ニューラルネットワークを用いて、前記複数の補助モデルでそれぞれ変換された前記二つの仮説の隠れ状態ベクトルを基に二つの系列の精度の高低の並びが正しいことを示す事後確率を出力する
ことを特徴とする請求項5~7のいずれか一つに記載の学習装置。 - 判定装置が実行する判定方法であって、
音声認識精度のスコアが対応付けられたNベスト仮説の入力を受け付ける工程と、
入力を受け付けた前記Nベスト仮説のうち、判定対象である二つの仮説を選択する工程と、
選択された二つの仮説が与えられたとき、前記二つの仮説を隠れ状態ベクトルに変換し、前記二つの仮説の隠れ状態ベクトルを基に前記二つの仮説の精度の高低を判定できるような、ニューラルネットワークで表される複数の補助モデルと、前記複数の補助モデルでそれぞれ変換された前記二つの仮説の隠れ状態ベクトルを基に、前記二つの仮説の精度の高低を判定できるような、ニューラルネットワークで表されるメインモデルとを用いて、前記二つの仮説の精度の高低を判定する工程と、
を含んだことを特徴とする判定方法。 - 音声認識精度のスコアが対応付けられたNベスト仮説の入力を受け付けるステップと、
入力を受け付けた前記Nベスト仮説のうち、判定対象である二つの仮説を選択するステップと、
選択された二つの仮説が与えられたとき、前記二つの仮説を隠れ状態ベクトルに変換し、前記二つの仮説の隠れ状態ベクトルを基に前記二つの仮説の精度の高低を判定できるような、ニューラルネットワークで表される複数の補助モデルと、前記複数の補助モデルでそれぞれ変換された前記二つの仮説の隠れ状態ベクトルを基に、前記二つの仮説の精度の高低を判定できるような、ニューラルネットワークで表されるメインモデルとを用いて、前記二つの仮説の精度の高低を判定するステップと、
をコンピュータに実行させるための判定プログラム。
Applications Claiming Priority (1)
| Application Number | Priority Date | Filing Date | Title |
|---|---|---|---|
| PCT/JP2019/031517 WO2021024491A1 (ja) | 2019-08-08 | 2019-08-08 | 判定装置、学習装置、判定方法及び判定プログラム |
Publications (2)
| Publication Number | Publication Date |
|---|---|
| JPWO2021024491A1 JPWO2021024491A1 (ja) | 2021-02-11 |
| JP7192995B2 true JP7192995B2 (ja) | 2022-12-20 |
Family
ID=74502632
Family Applications (1)
| Application Number | Title | Priority Date | Filing Date |
|---|---|---|---|
| JP2021537548A Active JP7192995B2 (ja) | 2019-08-08 | 2019-08-08 | 判定装置、学習装置、判定方法及び判定プログラム |
Country Status (3)
| Country | Link |
|---|---|
| US (1) | US12125481B2 (ja) |
| JP (1) | JP7192995B2 (ja) |
| WO (1) | WO2021024491A1 (ja) |
Families Citing this family (4)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| JP6849621B2 (ja) * | 2018-02-02 | 2021-03-24 | 日本電信電話株式会社 | 学習装置、学習方法及び学習プログラム |
| JP7544989B2 (ja) * | 2021-03-24 | 2024-09-03 | グーグル エルエルシー | ルックアップテーブルリカレント言語モデル |
| US20230153601A1 (en) * | 2021-11-15 | 2023-05-18 | International Business Machines Corporation | Global neural transducer models leveraging sub-task networks |
| US20240153495A1 (en) * | 2022-10-26 | 2024-05-09 | Google Llc | Multi-Output Decoders for Multi-Task Learning of ASR and Auxiliary Tasks |
Citations (3)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| JP2011243147A (ja) | 2010-05-21 | 2011-12-01 | Nippon Telegr & Teleph Corp <Ntt> | 素性重み学習装置、N−bestスコアリング装置、N−bestリランキング装置、それらの方法およびプログラム |
| US20170221474A1 (en) | 2016-02-02 | 2017-08-03 | Mitsubishi Electric Research Laboratories, Inc. | Method and System for Training Language Models to Reduce Recognition Errors |
| US10032463B1 (en) | 2015-12-29 | 2018-07-24 | Amazon Technologies, Inc. | Speech processing with learned representation of user interaction history |
Family Cites Families (11)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| US6490964B2 (en) * | 2000-01-24 | 2002-12-10 | Delphi Technologies, Inc. | Master brake cylinders having overmolded seals |
| US20040186714A1 (en) * | 2003-03-18 | 2004-09-23 | Aurilab, Llc | Speech recognition improvement through post-processsing |
| US9811775B2 (en) * | 2012-12-24 | 2017-11-07 | Google Inc. | Parallelizing neural networks during training |
| US20150324686A1 (en) * | 2014-05-12 | 2015-11-12 | Qualcomm Incorporated | Distributed model learning |
| US10181098B2 (en) * | 2014-06-06 | 2019-01-15 | Google Llc | Generating representations of input sequences using neural networks |
| JP6671020B2 (ja) * | 2016-06-23 | 2020-03-25 | パナソニックIpマネジメント株式会社 | 対話行為推定方法、対話行為推定装置及びプログラム |
| JP6884946B2 (ja) * | 2016-10-05 | 2021-06-09 | 国立研究開発法人情報通信研究機構 | 音響モデルの学習装置及びそのためのコンピュータプログラム |
| US20180330718A1 (en) * | 2017-05-11 | 2018-11-15 | Mitsubishi Electric Research Laboratories, Inc. | System and Method for End-to-End speech recognition |
| JP6911785B2 (ja) * | 2018-02-02 | 2021-07-28 | 日本電信電話株式会社 | 判定装置、判定方法及び判定プログラム |
| JP6849621B2 (ja) * | 2018-02-02 | 2021-03-24 | 日本電信電話株式会社 | 学習装置、学習方法及び学習プログラム |
| US11043214B1 (en) * | 2018-11-29 | 2021-06-22 | Amazon Technologies, Inc. | Speech recognition using dialog history |
-
2019
- 2019-08-08 JP JP2021537548A patent/JP7192995B2/ja active Active
- 2019-08-08 US US17/625,336 patent/US12125481B2/en active Active
- 2019-08-08 WO PCT/JP2019/031517 patent/WO2021024491A1/ja not_active Ceased
Patent Citations (3)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| JP2011243147A (ja) | 2010-05-21 | 2011-12-01 | Nippon Telegr & Teleph Corp <Ntt> | 素性重み学習装置、N−bestスコアリング装置、N−bestリランキング装置、それらの方法およびプログラム |
| US10032463B1 (en) | 2015-12-29 | 2018-07-24 | Amazon Technologies, Inc. | Speech processing with learned representation of user interaction history |
| US20170221474A1 (en) | 2016-02-02 | 2017-08-03 | Mitsubishi Electric Research Laboratories, Inc. | Method and System for Training Language Models to Reduce Recognition Errors |
Non-Patent Citations (2)
| Title |
|---|
| 小川厚徳他,一対一の仮説比較を行うencoder-classifierモデルを用いたNベスト音声認識,日本音響学会2018年春季研究発表会講演論文集[CD-ROM],2018年03月,pp.23-24 |
| 田中智大他,複数仮説を考慮したニューラル誤り訂正言語モデルの検討,電子情報通信学会技術研究報告,2018年08月,Vol.118,No.198,pp.31-36 |
Also Published As
| Publication number | Publication date |
|---|---|
| JPWO2021024491A1 (ja) | 2021-02-11 |
| US20220262356A1 (en) | 2022-08-18 |
| WO2021024491A1 (ja) | 2021-02-11 |
| US12125481B2 (en) | 2024-10-22 |
Similar Documents
| Publication | Publication Date | Title |
|---|---|---|
| US12190870B2 (en) | Learning device, learning method, and learning program | |
| US11837222B2 (en) | Determination device, determination method, and determination program | |
| US11604956B2 (en) | Sequence-to-sequence prediction using a neural network model | |
| US20230196202A1 (en) | System and method for automatic building of learning machines using learning machines | |
| US12125481B2 (en) | Determination device, training device, determination method, and determination program | |
| CN111460176A (zh) | 一种基于哈希学习的多文档机器阅读理解方法 | |
| CN115221947A (zh) | 一种基于预训练语言模型的鲁棒的多模态主动学习方法 | |
| CN117150026B (zh) | 文本内容多标签分类方法与装置 | |
| CN118364380A (zh) | 基于基准注意力及贝叶斯更新策略的标签校正方法 | |
| Moriya et al. | Evolution-strategy-based automation of system development for high-performance speech recognition | |
| CN117634580A (zh) | 一种神经网络模型的数据处理方法、训练方法及相关设备 | |
| US20230350954A1 (en) | Systems and methods of filtering topics using parts of speech tagging | |
| US9336774B1 (en) | Pattern recognizing engine | |
| Hamed et al. | Probabilistic evolving spiking neural network optimization using dynamic quantum-inspired particle swarm optimization | |
| Largeron-Leténo | Prediction suffix trees for supervised classification of sequences | |
| CN115358374B (zh) | 基于知识蒸馏的模型训练方法、装置、设备及存储介质 | |
| CN115795035A (zh) | 基于进化神经网络的科技服务资源分类方法、系统及其计算机可读存储介质 | |
| US12620996B2 (en) | Signal processor with A-D converter and reservoir unit | |
| CN116384490B (zh) | 一种应用于知识蒸馏的知识选择方法 | |
| CN117131904B (zh) | 一种神经网络的参数定点化方法及系统 | |
| CN119476277B (zh) | 敏感词类型的确定方法及装置 | |
| TW202605663A (zh) | 計算系統、計算系統執行方法及非暫時性儲存媒體 | |
| EP4261735A1 (en) | Natural language processing by means of a quantum random number generator | |
| CN110879833B (zh) | 一种基于轻量级循环单元lru的文本预测方法 | |
| Dai et al. | Learning Phonotactics in a Differentiable Framework of Subregular Languages |
Legal Events
| Date | Code | Title | Description |
|---|---|---|---|
| A621 | Written request for application examination |
Free format text: JAPANESE INTERMEDIATE CODE: A621 Effective date: 20211119 |
|
| TRDD | Decision of grant or rejection written | ||
| A01 | Written decision to grant a patent or to grant a registration (utility model) |
Free format text: JAPANESE INTERMEDIATE CODE: A01 Effective date: 20221108 |
|
| A61 | First payment of annual fees (during grant procedure) |
Free format text: JAPANESE INTERMEDIATE CODE: A61 Effective date: 20221121 |
|
| R150 | Certificate of patent or registration of utility model |
Ref document number: 7192995 Country of ref document: JP Free format text: JAPANESE INTERMEDIATE CODE: R150 |
|
| S533 | Written request for registration of change of name |
Free format text: JAPANESE INTERMEDIATE CODE: R313533 |
|
| R350 | Written notification of registration of transfer |
Free format text: JAPANESE INTERMEDIATE CODE: R350 |
