JPH10307740A - 障害処理装置および障害処理方式 - Google Patents
障害処理装置および障害処理方式Info
- Publication number
- JPH10307740A JPH10307740A JP9117294A JP11729497A JPH10307740A JP H10307740 A JPH10307740 A JP H10307740A JP 9117294 A JP9117294 A JP 9117294A JP 11729497 A JP11729497 A JP 11729497A JP H10307740 A JPH10307740 A JP H10307740A
- Authority
- JP
- Japan
- Prior art keywords
- information
- fault
- address
- failure
- output
- Prior art date
- Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
- Pending
Links
- 238000012545 processing Methods 0.000 title claims abstract description 41
- 230000015654 memory Effects 0.000 claims abstract description 12
- 230000010365 information processing Effects 0.000 claims description 44
- 238000001514 detection method Methods 0.000 claims description 8
- 230000007850 degeneration Effects 0.000 claims description 7
- 238000003672 processing method Methods 0.000 claims description 6
- 230000006870 function Effects 0.000 claims description 5
- 238000005070 sampling Methods 0.000 abstract 1
- 238000000034 method Methods 0.000 description 5
- 238000010586 diagram Methods 0.000 description 3
- 230000001174 ascending effect Effects 0.000 description 2
- 238000004891 communication Methods 0.000 description 2
- 230000000694 effects Effects 0.000 description 2
- 230000004044 response Effects 0.000 description 2
- 230000005540 biological transmission Effects 0.000 description 1
- 238000013480 data collection Methods 0.000 description 1
- 238000013500 data storage Methods 0.000 description 1
- 230000010354 integration Effects 0.000 description 1
- 238000012423 maintenance Methods 0.000 description 1
- 238000007726 management method Methods 0.000 description 1
- 238000004321 preservation Methods 0.000 description 1
- 238000011084 recovery Methods 0.000 description 1
- 230000000717 retained effect Effects 0.000 description 1
Landscapes
- Debugging And Monitoring (AREA)
Abstract
(57)【要約】
【課題】 障害情報を格納する有限のローカルメモリの
エリアを有効に使用可能にし、かつ障害情報の採取時間
を短縮化する。 【解決手段】 障害発生時に、前記不一致数計数値が
`1´であった場合には、障害通知に、不一致を検出し
たアドレスの前記エラーアドレス保持手段8の出力とこ
れに対応する障害情報保持手段5の出力とを付随させ、
一方、不一致数計数値が`2´以上であった場合には、
不一致を検出したアドレスのエラーアドレス保持手段8
の出力のみを付随させて、障害処理部14へ送出する。
エリアを有効に使用可能にし、かつ障害情報の採取時間
を短縮化する。 【解決手段】 障害発生時に、前記不一致数計数値が
`1´であった場合には、障害通知に、不一致を検出し
たアドレスの前記エラーアドレス保持手段8の出力とこ
れに対応する障害情報保持手段5の出力とを付随させ、
一方、不一致数計数値が`2´以上であった場合には、
不一致を検出したアドレスのエラーアドレス保持手段8
の出力のみを付随させて、障害処理部14へ送出する。
Description
【0001】
【発明の属する技術分野】この発明は、情報処理装置の
障害情報を障害処理部にて採取しおよび処理する障害処
理装置および障害処理方式に関する。
障害情報を障害処理部にて採取しおよび処理する障害処
理装置および障害処理方式に関する。
【0002】
【従来の技術】情報処理装置に代表される障害の形態と
しては、システム障害とシステム障害とはならない個別
装置だけに影響する障害に大別できる。昨今の障害の形
態をみると、システム障害以外の障害においては、ラン
ダム アクセス メモリなどの記憶手段における1ビッ
トエラーや、大規模集積回路の高集積化に伴う、複雑な
条件下でのみ発生する、システム障害とはならない間欠
障害が多くなり、これらの障害の発生頻度の予想はつか
ない。記憶手段であるランダム アクセス メモリの1
ビットエラーは、一度発生するとその後は比較的高頻度
で発生し、有限である障害の記憶領域を書きつぶしてし
まうおそれがある。
しては、システム障害とシステム障害とはならない個別
装置だけに影響する障害に大別できる。昨今の障害の形
態をみると、システム障害以外の障害においては、ラン
ダム アクセス メモリなどの記憶手段における1ビッ
トエラーや、大規模集積回路の高集積化に伴う、複雑な
条件下でのみ発生する、システム障害とはならない間欠
障害が多くなり、これらの障害の発生頻度の予想はつか
ない。記憶手段であるランダム アクセス メモリの1
ビットエラーは、一度発生するとその後は比較的高頻度
で発生し、有限である障害の記憶領域を書きつぶしてし
まうおそれがある。
【0003】これに対し、従来から、有限の記憶領域に
障害情報を効率的に記録する障害情報の保全方式が、例
えば特開平7―141227号公報に示されている。こ
れは、発生した障害が過去に発生した障害と同じもので
あるか否かを判定し、同時に、この障害と同一のものを
計数することにより、同一の障害がある固定数以上にな
った場合に、同一の障害情報の中から最古の障害情報を
消去し、このエリアに発生した最新の障害情報で置き換
えるというものである。こうすることで障害頻度の少な
い障害情報は保持され、しかも有限の障害情報領域を有
効に利用することができる。
障害情報を効率的に記録する障害情報の保全方式が、例
えば特開平7―141227号公報に示されている。こ
れは、発生した障害が過去に発生した障害と同じもので
あるか否かを判定し、同時に、この障害と同一のものを
計数することにより、同一の障害がある固定数以上にな
った場合に、同一の障害情報の中から最古の障害情報を
消去し、このエリアに発生した最新の障害情報で置き換
えるというものである。こうすることで障害頻度の少な
い障害情報は保持され、しかも有限の障害情報領域を有
効に利用することができる。
【0004】図3はかかる従来の障害情報の保全方式を
実行する情報処理システムの構成図である。この情報処
理システムは、複数の情報処理装置21,22,・・
・,2nに対応した障害部位を識別できる情報処理装置
状態テーブル311,312,・・・,31nと、この
情報処理装置状態テーブル311〜31nにより障害部
位判定を行い、ログデータ量を決める障害部位判定部3
2と、複数種のログデータ量に対応したログブロック
(単位格納領域)をそれぞれ含むログエリア3411,
342,・・・,34nと、当該ログエリア341〜3
4nの使用状態を示すログエリア管理テーブル351,
352,・・・,35nと、ログエリアの確保ができる
か否かを判定するログエリア判定部33と、ログエリア
の確保ができるとログデータ採取を行うログデータ採取
部36と、サービスプロセッサにログデータ格納要求を
出し障害回復処理を行う障害処理部37とから構成され
る。
実行する情報処理システムの構成図である。この情報処
理システムは、複数の情報処理装置21,22,・・
・,2nに対応した障害部位を識別できる情報処理装置
状態テーブル311,312,・・・,31nと、この
情報処理装置状態テーブル311〜31nにより障害部
位判定を行い、ログデータ量を決める障害部位判定部3
2と、複数種のログデータ量に対応したログブロック
(単位格納領域)をそれぞれ含むログエリア3411,
342,・・・,34nと、当該ログエリア341〜3
4nの使用状態を示すログエリア管理テーブル351,
352,・・・,35nと、ログエリアの確保ができる
か否かを判定するログエリア判定部33と、ログエリア
の確保ができるとログデータ採取を行うログデータ採取
部36と、サービスプロセッサにログデータ格納要求を
出し障害回復処理を行う障害処理部37とから構成され
る。
【0005】これによれば、各情報処理装置21〜2n
の各々に対応して設けられている情報処理装置状態テー
ブル311〜31nの各々は、複数の障害部位の各々に
対応したエントリを備えており、情報処理装置21〜2
nの一つにおいて障害が発生したとき、対応する情報処
理装置状態テーブル311〜31nのうち一つを参照す
ることにより、障害部位判定部32が当該情報処理装置
21〜2nにおける障害部位および当該障害に対処する
ために必要なログデータ量などを把握することが可能に
なっている。
の各々に対応して設けられている情報処理装置状態テー
ブル311〜31nの各々は、複数の障害部位の各々に
対応したエントリを備えており、情報処理装置21〜2
nの一つにおいて障害が発生したとき、対応する情報処
理装置状態テーブル311〜31nのうち一つを参照す
ることにより、障害部位判定部32が当該情報処理装置
21〜2nにおける障害部位および当該障害に対処する
ために必要なログデータ量などを把握することが可能に
なっている。
【0006】
【発明が解決しようとする課題】しかしながら、かかる
従来の障害情報の保全方式では、障害の発生頻度が高い
と、障害エリアにすべて同じ情報が保持されることによ
り、この障害よりも以前に発生した障害の情報が消去さ
れてしまうこととなり、過去の情報の全て、特に必要と
する情報が消去されてしまうことによって、過去の情報
の検討や障害処理を適正に実行できなくなるという課題
があった。
従来の障害情報の保全方式では、障害の発生頻度が高い
と、障害エリアにすべて同じ情報が保持されることによ
り、この障害よりも以前に発生した障害の情報が消去さ
れてしまうこととなり、過去の情報の全て、特に必要と
する情報が消去されてしまうことによって、過去の情報
の検討や障害処理を適正に実行できなくなるという課題
があった。
【0007】また、障害が頻繁に発生した場合、システ
ム障害が発生する可能性があるという課題があった。す
なわち、情報処理装置における障害処理装置は、障害処
理のみならず通信等のシステム動作を制御する機能を併
せ持っており、障害が頻発することによって障害処理装
置の負荷が大きくなると、障害処理装置においてビジー
が発生する可能性があり、この場合には、他の動作が停
止し、他装置からの通信がタイムアウトするという課題
があった。これは障害の報告が、その発生が予測できな
いことから障害処理装置において割り込み処理として扱
われるためであり、頻発すると他の処理ができなくな
る。さらに、障害情報が多いと、障害情報の採取に時間
がかかるという課題があった。すなわち、情報処理装置
の障害情報が多量の場合には、障害情報格納エリアへの
格納動作が従来よりも遅くなるため、障害処理装置内の
障害情報バッファが空くまで時間がかかり障害処理時間
が伸びてしまうという課題があった。
ム障害が発生する可能性があるという課題があった。す
なわち、情報処理装置における障害処理装置は、障害処
理のみならず通信等のシステム動作を制御する機能を併
せ持っており、障害が頻発することによって障害処理装
置の負荷が大きくなると、障害処理装置においてビジー
が発生する可能性があり、この場合には、他の動作が停
止し、他装置からの通信がタイムアウトするという課題
があった。これは障害の報告が、その発生が予測できな
いことから障害処理装置において割り込み処理として扱
われるためであり、頻発すると他の処理ができなくな
る。さらに、障害情報が多いと、障害情報の採取に時間
がかかるという課題があった。すなわち、情報処理装置
の障害情報が多量の場合には、障害情報格納エリアへの
格納動作が従来よりも遅くなるため、障害処理装置内の
障害情報バッファが空くまで時間がかかり障害処理時間
が伸びてしまうという課題があった。
【0008】この発明は前記のような課題を解決するも
のであり、障害情報の格納エリアを有効に利用すること
で、必要とする障害情報の消去を防止でき、頻繁な障害
発生時にもシステム障害の発生を回避できるとともに、
障害採取の時間を短縮でき、以て障害除去に迅速に対応
できる障害処理装置および障害処理方式を得ることを目
的とする。
のであり、障害情報の格納エリアを有効に利用すること
で、必要とする障害情報の消去を防止でき、頻繁な障害
発生時にもシステム障害の発生を回避できるとともに、
障害採取の時間を短縮でき、以て障害除去に迅速に対応
できる障害処理装置および障害処理方式を得ることを目
的とする。
【0009】
【課題を解決するための手段】前記目的を達成するため
に、請求項1の発明にかかる障害処理装置は、情報処理
装置の機能ごとに発生する障害を検出する障害検出手段
と、該障害検出手段による障害検出結果を保持する障害
情報保持手段と、該障害情報保持手段のアドレスに対応
して障害情報の初期値を保持する初期状態保持手段と、
前記障害情報保持手段における障害情報の状態値とこれ
に対応する前記初期状態保持手段における初期値とを比
較する比較器と、該比較器により前記状態値と初期値が
不一致であるとされたとき、最初に不一致が発生したア
ドレスのみを保持するエラーアドレス保持手段と、初期
アドレスから最終アドレスまでの間に不一致が生じた回
数を計数する不一致数計数手段と、該不一致数計数手段
の出力を保持する不一致数格納手段とを備え、障害発生
時に、前記不一致数計数値が`1´であった場合には、
障害通知に、不一致を検出したアドレスの前記エラーア
ドレス保持手段の出力とこれに対応する前記障害情報保
持手段の出力とを付随させ、一方、前記不一致数計数値
が`2´以上であった場合には、不一致を検出したアド
レスのエラーアドレス保持手段の出力のみを付随させ
て、前記障害処理部へ送出するようにしたものである。
に、請求項1の発明にかかる障害処理装置は、情報処理
装置の機能ごとに発生する障害を検出する障害検出手段
と、該障害検出手段による障害検出結果を保持する障害
情報保持手段と、該障害情報保持手段のアドレスに対応
して障害情報の初期値を保持する初期状態保持手段と、
前記障害情報保持手段における障害情報の状態値とこれ
に対応する前記初期状態保持手段における初期値とを比
較する比較器と、該比較器により前記状態値と初期値が
不一致であるとされたとき、最初に不一致が発生したア
ドレスのみを保持するエラーアドレス保持手段と、初期
アドレスから最終アドレスまでの間に不一致が生じた回
数を計数する不一致数計数手段と、該不一致数計数手段
の出力を保持する不一致数格納手段とを備え、障害発生
時に、前記不一致数計数値が`1´であった場合には、
障害通知に、不一致を検出したアドレスの前記エラーア
ドレス保持手段の出力とこれに対応する前記障害情報保
持手段の出力とを付随させ、一方、前記不一致数計数値
が`2´以上であった場合には、不一致を検出したアド
レスのエラーアドレス保持手段の出力のみを付随させ
て、前記障害処理部へ送出するようにしたものである。
【0010】また、請求項2の発明にかかる障害処理装
置は、前記障害処理部に、前記情報処理装置から送出さ
れた障害情報から、この障害情報以外に他の障害情報の
採取が必要であるか否かを判定する後続情報採取判定手
段と、該後続情報採取判定手段の出力から障害情報を採
取する障害情報採取手段とを設け、前記状態値と初期値
の不一致が発生したアドレスのほかに、前記障害情報保
持手段の出力が付随していると前記後続情報採取判定手
段にて判定されたとき、前記他の障害情報を採取せず、
一方、前記障害情報保持手段の出力が付随していないと
判定されたとき、前記不一致が発生したアドレスを障害
の発生した前記情報処理装置の先頭のアドレスとして判
断し、該先頭のアドレスに対する前記障害情報から最終
のアドレスに対する障害情報までを採取するようにした
ものである。
置は、前記障害処理部に、前記情報処理装置から送出さ
れた障害情報から、この障害情報以外に他の障害情報の
採取が必要であるか否かを判定する後続情報採取判定手
段と、該後続情報採取判定手段の出力から障害情報を採
取する障害情報採取手段とを設け、前記状態値と初期値
の不一致が発生したアドレスのほかに、前記障害情報保
持手段の出力が付随していると前記後続情報採取判定手
段にて判定されたとき、前記他の障害情報を採取せず、
一方、前記障害情報保持手段の出力が付随していないと
判定されたとき、前記不一致が発生したアドレスを障害
の発生した前記情報処理装置の先頭のアドレスとして判
断し、該先頭のアドレスに対する前記障害情報から最終
のアドレスに対する障害情報までを採取するようにした
ものである。
【0011】また、請求項3の発明にかかる障害処理装
置は、障害情報にもとづき障害の状態を判定して前記情
報処理装置に対する動作モードの設定を行う動作モード
設定手段を設けたものである。
置は、障害情報にもとづき障害の状態を判定して前記情
報処理装置に対する動作モードの設定を行う動作モード
設定手段を設けたものである。
【0012】また、請求項4の発明にかかる障害処理方
法は、障害処理部において、前記障害情報から障害の状
況を判定して前記情報処理装置に対する動作モードの設
定を行い、所定時間経過したのちに、前記設定した動作
モードの情報を採取して、動作モード格納用のローカル
メモリのエリアに格納し、障害発生時に前記情報処理装
置の縮退が必要と判定されたとき縮退動作を設定した
後、この縮退モードが設定された前記情報処理装置の動
作モードを採取し、これをこの時点から以降に発生した
障害の補助情報とするようにしたものである。
法は、障害処理部において、前記障害情報から障害の状
況を判定して前記情報処理装置に対する動作モードの設
定を行い、所定時間経過したのちに、前記設定した動作
モードの情報を採取して、動作モード格納用のローカル
メモリのエリアに格納し、障害発生時に前記情報処理装
置の縮退が必要と判定されたとき縮退動作を設定した
後、この縮退モードが設定された前記情報処理装置の動
作モードを採取し、これをこの時点から以降に発生した
障害の補助情報とするようにしたものである。
【0013】
【発明の実施の形態】以下に、この発明の実施の一形態
を図について説明する。図1において、1は障害発生装
置としての情報処理装置であり、これが障害処理部14
に対し、専用の診断インタフェースで接続され、障害発
生の通知、障害情報の送出および縮退モード等の固有の
動作モードを設定する。2は障害処理部14によって指
示される動作モードフラグ3により情報処理装置1の動
作を決定する機能回路であり、これが機能毎に障害検出
手段としての障害検出回路41,42,・・・,4nを
持ち、障害発生時にはエラーフラグ群5の状態値を障害
処理部14に報告する。各状態値はそれぞれ対応する障
害情報保持手段としてのエラーフラグ群5内のエラーフ
ラグに格納される。このエラーフラグ群5はいくつかの
単位でグループ分けされており、それぞれにアドレスA
d0,Ad1,・・・,Adnを付与している。
を図について説明する。図1において、1は障害発生装
置としての情報処理装置であり、これが障害処理部14
に対し、専用の診断インタフェースで接続され、障害発
生の通知、障害情報の送出および縮退モード等の固有の
動作モードを設定する。2は障害処理部14によって指
示される動作モードフラグ3により情報処理装置1の動
作を決定する機能回路であり、これが機能毎に障害検出
手段としての障害検出回路41,42,・・・,4nを
持ち、障害発生時にはエラーフラグ群5の状態値を障害
処理部14に報告する。各状態値はそれぞれ対応する障
害情報保持手段としてのエラーフラグ群5内のエラーフ
ラグに格納される。このエラーフラグ群5はいくつかの
単位でグループ分けされており、それぞれにアドレスA
d0,Ad1,・・・,Adnを付与している。
【0014】また、7は初期状態保持手段で、これが障
害情報の初期値、いわゆるエラーフラグ群5に対応する
前記同様のアドレスAd0〜Adnに分割されている。
9は障害発生時のエラーフラグ群5におけるエラーフラ
グの状態値とこれに対応する初期状態保持手段7の初期
値とを、アドレス6毎に昇順に比較する比較器、8はエ
ラーアドレス保持手段で、これが比較器9における比較
の結果、不一致が生じた最初のアドレスの出力を保持す
る。なお、初期状態保持手段7はエラーフラグに対する
初期値をエラーフラグ群5,アドレスAd0〜Adnに
対応した形で持っている。12は比較器9の出力をアド
レス毎に計数する不一致数計数手段としての加算器であ
り、この加算器12の出力である最終アドレスまでの各
アドレスごとの不一致数は、不一致数格納手段としての
不一致数格納レジスタ10に格納され、エラーしたアド
レスはエラーアドレス保持手段8に格納され、その不一
致数情報は障害検出回路41〜4nが障害処理部14に
よりクリアされるまで保持される。11は障害情報通知
回路であり、これは障害が発生したときに障害処理部1
4に通知および障害情報を送出する。13は不一致数格
納レジスタ10の出力に従って、障害処理部14に送出
するデータを切り替えるセレクタである。
害情報の初期値、いわゆるエラーフラグ群5に対応する
前記同様のアドレスAd0〜Adnに分割されている。
9は障害発生時のエラーフラグ群5におけるエラーフラ
グの状態値とこれに対応する初期状態保持手段7の初期
値とを、アドレス6毎に昇順に比較する比較器、8はエ
ラーアドレス保持手段で、これが比較器9における比較
の結果、不一致が生じた最初のアドレスの出力を保持す
る。なお、初期状態保持手段7はエラーフラグに対する
初期値をエラーフラグ群5,アドレスAd0〜Adnに
対応した形で持っている。12は比較器9の出力をアド
レス毎に計数する不一致数計数手段としての加算器であ
り、この加算器12の出力である最終アドレスまでの各
アドレスごとの不一致数は、不一致数格納手段としての
不一致数格納レジスタ10に格納され、エラーしたアド
レスはエラーアドレス保持手段8に格納され、その不一
致数情報は障害検出回路41〜4nが障害処理部14に
よりクリアされるまで保持される。11は障害情報通知
回路であり、これは障害が発生したときに障害処理部1
4に通知および障害情報を送出する。13は不一致数格
納レジスタ10の出力に従って、障害処理部14に送出
するデータを切り替えるセレクタである。
【0015】一方、前記障害処理部14は障害情報採取
部15、動作モード設定手段としての動作モード設定回
路16および障害情報格納部17を持つ。これらのう
ち、障害情報採取部15は情報処理装置1からの障害通
知に付随する障害情報から、報告された情報以外にさら
に情報処理装置1の障害情報の採取が必要かを判定する
後続情報採取判定手段151と、後続情報採取判定手段
151の出力から情報処理装置1の障害情報を採取する
障害情報採取手段152をもつ。また、前記動作モード
設定回路16は、障害の状態を判定して情報処理装置1
に対して動作モードの設定を行う。これにはシステムの
立ち上げの際に行われる場合と、障害の発生により縮退
して動作を行うように設定する場合がある。
部15、動作モード設定手段としての動作モード設定回
路16および障害情報格納部17を持つ。これらのう
ち、障害情報採取部15は情報処理装置1からの障害通
知に付随する障害情報から、報告された情報以外にさら
に情報処理装置1の障害情報の採取が必要かを判定する
後続情報採取判定手段151と、後続情報採取判定手段
151の出力から情報処理装置1の障害情報を採取する
障害情報採取手段152をもつ。また、前記動作モード
設定回路16は、障害の状態を判定して情報処理装置1
に対して動作モードの設定を行う。これにはシステムの
立ち上げの際に行われる場合と、障害の発生により縮退
して動作を行うように設定する場合がある。
【0016】さらに、前記障害情報格納部17は、情報
処理装置1の障害情報を所定の障害情報格納用のローカ
ルメモリ19のエリア19a,109bに格納する機能
を持ち、障害情報採取部15の出力により指示されるア
ドレスに所定のデータを書き込む。また、設定した動作
モード情報は障害情報の格納エリアとは異なった、動作
モード格納用のローカルメモリ18のエリアに書き込み
保持される。
処理装置1の障害情報を所定の障害情報格納用のローカ
ルメモリ19のエリア19a,109bに格納する機能
を持ち、障害情報採取部15の出力により指示されるア
ドレスに所定のデータを書き込む。また、設定した動作
モード情報は障害情報の格納エリアとは異なった、動作
モード格納用のローカルメモリ18のエリアに書き込み
保持される。
【0017】なお、動作モードフラグ3を設定した場合
には、適当なタイミングで、情報処理装置1内の動作モ
ードフラグ3とエラーフラグ群5の情報を採取し、障害
格納用のローカルメモリ19に格納し、エラーフラグ群
の情報は動作モード格納用のローカルメモリ18のエリ
ア18aに、動作モードフラグ3はエリア18bに格納
される。同一の動作モードで動作している際に障害が発
生した場合には、障害情報格納用のローカルメモリ19
のエリア19aを確保しておく。
には、適当なタイミングで、情報処理装置1内の動作モ
ードフラグ3とエラーフラグ群5の情報を採取し、障害
格納用のローカルメモリ19に格納し、エラーフラグ群
の情報は動作モード格納用のローカルメモリ18のエリ
ア18aに、動作モードフラグ3はエリア18bに格納
される。同一の動作モードで動作している際に障害が発
生した場合には、障害情報格納用のローカルメモリ19
のエリア19aを確保しておく。
【0018】次に動作について、図2に示すフローチャ
ートを参照して詳細に説明する。情報処理装置1におい
て障害が発生すると、機能回路2に機能ごとに接続され
た障害検出回路41〜4nの出力を格納するエラーフラ
グ群5のエラーフラグの初期値と、これに対応する初期
状態保持手段7の初期値との比較が、割り当てられたア
ドレスの昇順に、比較器9において実行される(ステッ
プS51)。かかる比較動作において不一致が検出され
ると、最初に不一致を検出した場合にはエラーフラグの
属するエラーフラグ群のアドレスが保持される(ステッ
プS52)。不一致が発生した場合でも、最終アドレス
まで比較動作は実行される。
ートを参照して詳細に説明する。情報処理装置1におい
て障害が発生すると、機能回路2に機能ごとに接続され
た障害検出回路41〜4nの出力を格納するエラーフラ
グ群5のエラーフラグの初期値と、これに対応する初期
状態保持手段7の初期値との比較が、割り当てられたア
ドレスの昇順に、比較器9において実行される(ステッ
プS51)。かかる比較動作において不一致が検出され
ると、最初に不一致を検出した場合にはエラーフラグの
属するエラーフラグ群のアドレスが保持される(ステッ
プS52)。不一致が発生した場合でも、最終アドレス
まで比較動作は実行される。
【0019】このようにして、最終アドレスまで前記比
較動作を行った結果、アドレスの不一致検出数が、`1
´か否かを判定し(ステップS53)、`1´であった
場合には、障害処理部14に対して障害の発生を通知す
る際、不一致を検出したアドレスと、このアドレスに対
応するエラーフラグ群のエラーフラグを索引して(ステ
ップS54)、障害処理部14に送出する。また、アド
レスの不一致検出数が`2´以上であった場合には、そ
の障害発生の通知に不一致を検出した1つ目のエラーフ
ラグ群のアドレスのみを付随させて、障害処理部14に
送出する(ステップS55)。
較動作を行った結果、アドレスの不一致検出数が、`1
´か否かを判定し(ステップS53)、`1´であった
場合には、障害処理部14に対して障害の発生を通知す
る際、不一致を検出したアドレスと、このアドレスに対
応するエラーフラグ群のエラーフラグを索引して(ステ
ップS54)、障害処理部14に送出する。また、アド
レスの不一致検出数が`2´以上であった場合には、そ
の障害発生の通知に不一致を検出した1つ目のエラーフ
ラグ群のアドレスのみを付随させて、障害処理部14に
送出する(ステップS55)。
【0020】これに対して、障害処理部14において
は、障害発生した情報処理装置1から障害通知を受け取
り、その障害データを解析し(ステップS56)、前記
障害通知にエラーアドレスのほかにエラーフラグ情報が
添付されているかどうかを判定する(ステップS5
7)。障害通知に対し障害情報としてエラーアドレスの
エラーフラグ情報があった場合には、これらを採取して
(ステップS58)、所定の障害情報格納用のローカル
メモリ19にそのエラーアドレスフラグ情報を格納する
(ステップS59)。障害の通知に対し障害情報として
エラーアドレスのみであった場合には、情報処理装置1
に対して本エラーアドレスから最終アドレスまでのエラ
ーフラグ群の情報をすべて採取し、障害情報格納部17
のローカルメモリ19の所定エリアに格納する。
は、障害発生した情報処理装置1から障害通知を受け取
り、その障害データを解析し(ステップS56)、前記
障害通知にエラーアドレスのほかにエラーフラグ情報が
添付されているかどうかを判定する(ステップS5
7)。障害通知に対し障害情報としてエラーアドレスの
エラーフラグ情報があった場合には、これらを採取して
(ステップS58)、所定の障害情報格納用のローカル
メモリ19にそのエラーアドレスフラグ情報を格納する
(ステップS59)。障害の通知に対し障害情報として
エラーアドレスのみであった場合には、情報処理装置1
に対して本エラーアドレスから最終アドレスまでのエラ
ーフラグ群の情報をすべて採取し、障害情報格納部17
のローカルメモリ19の所定エリアに格納する。
【0021】また、エラーフラグのリセット実行後、情
報処理装置1に対して縮退動作を要求する必要があるか
否かを判定し(ステップS60)、必要がある場合に
は、障害処理部14に対して動作モードの設定を実行す
る(ステップS61)。こうして動作モードの設定を行
った後、ある時間待ち合わせた後(ステップS62)、
情報処理装置1に設定した動作モード情報の採取を行う
こととなる(ステップS63)。
報処理装置1に対して縮退動作を要求する必要があるか
否かを判定し(ステップS60)、必要がある場合に
は、障害処理部14に対して動作モードの設定を実行す
る(ステップS61)。こうして動作モードの設定を行
った後、ある時間待ち合わせた後(ステップS62)、
情報処理装置1に設定した動作モード情報の採取を行う
こととなる(ステップS63)。
【0022】
【発明の効果】以上のように、この発明によれば、障害
にかかわる機能部の障害情報のみを障害処理部に送出す
るようにしたことにより、障害情報を格納する障害情報
格納用のローカルメモリのエリアを有効に使用できると
ともに、必要とする障害情報の消失を防止でき、さら
に、障害情報の採取にかかる時間を短縮することがで
き、この結果障害処理部においては障害情報の採取処理
に占有されることがなくなるという効果が得られる。ま
た、その結果として、障害除去に迅速に対応可能とな
る。さらに、障害にかかわる機能部に対する補助情報と
して、情報処理装置の動作を決定する動作モードの装置
情報をあらかじめ採取し、変更がないかぎり補助情報を
採取しないようにしたため、有限のローカルメモリのエ
リアを有効に使用できるという効果が得られる。
にかかわる機能部の障害情報のみを障害処理部に送出す
るようにしたことにより、障害情報を格納する障害情報
格納用のローカルメモリのエリアを有効に使用できると
ともに、必要とする障害情報の消失を防止でき、さら
に、障害情報の採取にかかる時間を短縮することがで
き、この結果障害処理部においては障害情報の採取処理
に占有されることがなくなるという効果が得られる。ま
た、その結果として、障害除去に迅速に対応可能とな
る。さらに、障害にかかわる機能部に対する補助情報と
して、情報処理装置の動作を決定する動作モードの装置
情報をあらかじめ採取し、変更がないかぎり補助情報を
採取しないようにしたため、有限のローカルメモリのエ
リアを有効に使用できるという効果が得られる。
【図1】この発明の実施の一形態による障害処理装置を
示すブロック図である。
示すブロック図である。
【図2】この発明における障害処理方式の実行手順を示
すフローチャートである。
すフローチャートである。
【図3】従来の障害処理装置を示すブロック図である。
1 情報処理装置 41〜4n 障害検出回路(障害検出手段) 5 エラーフラグ群(障害情報保持手段) 7 初期状態保持手段 8 エラーアドレス保持手段 9 比較器 10 不一致数格納レジスタ(不一致数格納手段) 12 加算器(不一致数計数手段) 14 障害処理部 16 動作モード設定回路(動作モード設定手段) 151 後続情報採取判定手段 152 障害情報採取手段
Claims (4)
- 【請求項1】 情報処理装置の障害情報を障害処理部に
て採取しおよび処理するのに利用する障害処理装置にお
いて、 前記情報処理装置の機能ごとに発生する障害を検出する
障害検出手段と、 該障害検出手段による障害検出結果を保持する障害情報
保持手段と、 該障害情報保持手段のアドレスに対応して障害情報の初
期値を保持する初期状態保持手段と、 前記障害情報保持手段における障害情報の状態値とこれ
に対応する前記初期状態保持手段における初期値とを比
較する比較器と、 該比較器により前記状態値と初期値が不一致であるとさ
れたとき、最初に不一致が発生したアドレスのみを保持
するエラーアドレス保持手段と、 初期アドレスから最終アドレスまでの間に不一致が生じ
た回数を計数する不一致数計数手段と、 該不一致数計数手段の出力を保持する不一致数格納手段
とを備え、 障害発生時に、前記不一致数計数値が`1´であった場
合には、障害通知に、不一致を検出したアドレスの前記
エラーアドレス保持手段の出力とこれに対応する前記障
害情報保持手段の出力とを付随させ、一方、前記不一致
数計数値が`2´以上であった場合には、不一致を検出
したアドレスのエラーアドレス保持手段の出力のみを付
随させて、前記障害処理部へ送出することを特徴とする
障害処理装置。 - 【請求項2】 前記障害処理部が、前記情報処理装置か
ら送出された障害情報から、この障害情報以外に他の障
害情報の採取が必要であるか否かを判定する後続情報採
取判定手段と、 該後続情報採取判定手段の出力から障害情報を採取する
障害情報採取手段とを有し、 前記状態値と初期値の不一致が発生したアドレスのほか
に、前記障害情報保持手段の出力が付随していると前記
後続情報採取判定手段にて判定されたとき、前記他の障
害情報を採取せず、 一方、前記障害情報保持手段の出力が付随していないと
判定されたとき、前記不一致が発生したアドレスを障害
の発生した前記情報処理装置の先頭のアドレスとして判
断し、 該先頭のアドレスに対する前記障害情報から最終のアド
レスに対する障害情報までを採取することを特徴とする
請求項1に記載の障害処理装置。 - 【請求項3】 障害情報にもとづき障害の状態を判定し
て前記情報処理装置に対する動作モードの設定を行う動
作モード設定手段を設けたことを特徴とする請求項2に
記載の障害処理装置。 - 【請求項4】 情報処理装置の障害情報を障害処理部に
て採取しおよび処理する障害処理方式において、 前記障害処理部において、前記障害情報から障害の状況
を判定して前記情報処理装置に対する動作モードの設定
を行い、 所定時間経過したのちに、前記設定した動作モードの情
報を採取して、動作モード格納用のローカルメモリのエ
リアに格納し、 障害発生時に前記情報処理装置の縮退が必要と判定され
たとき縮退動作を設定した後、この縮退モードが設定さ
れた前記情報処理装置の動作モードを採取し、これをこ
の時点から以降に発生した障害の補助情報とすることを
特徴とする障害処理方式。
Priority Applications (1)
| Application Number | Priority Date | Filing Date | Title |
|---|---|---|---|
| JP9117294A JPH10307740A (ja) | 1997-05-07 | 1997-05-07 | 障害処理装置および障害処理方式 |
Applications Claiming Priority (1)
| Application Number | Priority Date | Filing Date | Title |
|---|---|---|---|
| JP9117294A JPH10307740A (ja) | 1997-05-07 | 1997-05-07 | 障害処理装置および障害処理方式 |
Publications (1)
| Publication Number | Publication Date |
|---|---|
| JPH10307740A true JPH10307740A (ja) | 1998-11-17 |
Family
ID=14708201
Family Applications (1)
| Application Number | Title | Priority Date | Filing Date |
|---|---|---|---|
| JP9117294A Pending JPH10307740A (ja) | 1997-05-07 | 1997-05-07 | 障害処理装置および障害処理方式 |
Country Status (1)
| Country | Link |
|---|---|
| JP (1) | JPH10307740A (ja) |
-
1997
- 1997-05-07 JP JP9117294A patent/JPH10307740A/ja active Pending
Similar Documents
| Publication | Publication Date | Title |
|---|---|---|
| TWI229796B (en) | Method and system to implement a system event log for system manageability | |
| CN113176963B (zh) | 一种PCIe故障自修复方法、装置、设备及可读存储介质 | |
| US7328376B2 (en) | Error reporting to diagnostic engines based on their diagnostic capabilities | |
| US7734961B2 (en) | Distributed logging apparatus system and method | |
| US6012148A (en) | Programmable error detect/mask utilizing bus history stack | |
| CN106789306B (zh) | 通信设备软件故障检测收集恢复方法和系统 | |
| CN101201786A (zh) | 一种故障日志监控方法及装置 | |
| US20080270827A1 (en) | Recovering diagnostic data after out-of-band data capture failure | |
| CN114363151A (zh) | 故障检测方法和装置、电子设备和存储介质 | |
| US20090259890A1 (en) | Method & apparatus for hardware fault management | |
| JPH0950424A (ja) | ダンプ採取装置およびダンプ採取方法 | |
| CN114860487A (zh) | 一种内存故障识别方法及一种内存故障隔离方法 | |
| CN115904772A (zh) | PCIe链路的错误确定方法、装置、设备及存储介质 | |
| CN113672415B (zh) | 一种磁盘故障处理方法、装置、设备及存储介质 | |
| US7664980B2 (en) | Method and system for automatic attempted recovery of equipment from transient faults | |
| CN117271190A (zh) | 硬件可纠正错误处理方法及系统 | |
| JPH09205429A (ja) | ネットワーク故障診断装置及び故障予測装置並びにその診断及び予測方法 | |
| CN109218050B (zh) | 一种域名系统故障处理方法和系统 | |
| CN120508515A (zh) | 一种数据传输方法、装置、设备及介质 | |
| CN107391036B (zh) | 一种存储的vpd信息访问方法及系统 | |
| CN113778763B (zh) | 一种三方接口服务故障智能切换方法及系统 | |
| CN116431453A (zh) | 一种通过bios进行系统故障检测的方法、装置和设备 | |
| JPH06324916A (ja) | 障害情報ロギング方式 | |
| CN115484267A (zh) | 多集群部署处理方法、装置、电子设备和存储介质 | |
| CN115705260A (zh) | 一种信息处理方法、装置、计算机设备和存储介质 |
Legal Events
| Date | Code | Title | Description |
|---|---|---|---|
| A02 | Decision of refusal |
Free format text: JAPANESE INTERMEDIATE CODE: A02 Effective date: 20000704 |