JPH07113898B2 - 障害検出方式 - Google Patents

障害検出方式

Info

Publication number
JPH07113898B2
JPH07113898B2 JP1116977A JP11697789A JPH07113898B2 JP H07113898 B2 JPH07113898 B2 JP H07113898B2 JP 1116977 A JP1116977 A JP 1116977A JP 11697789 A JP11697789 A JP 11697789A JP H07113898 B2 JPH07113898 B2 JP H07113898B2
Authority
JP
Japan
Prior art keywords
processing unit
central processing
failure
hardware
area
Prior art date
Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
Expired - Lifetime
Application number
JP1116977A
Other languages
English (en)
Other versions
JPH02294739A (ja
Inventor
雅行 杉岡
芳一 森
博之 日高
史雄 延命
Current Assignee (The listed assignees may be inaccurate. Google has not performed a legal analysis and makes no representation or warranty as to the accuracy of the list.)
Hitachi Ltd
Hitachi Electronics Services Co Ltd
Original Assignee
Hitachi Ltd
Hitachi Electronics Services Co Ltd
Priority date (The priority date is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the date listed.)
Filing date
Publication date
Application filed by Hitachi Ltd, Hitachi Electronics Services Co Ltd filed Critical Hitachi Ltd
Priority to JP1116977A priority Critical patent/JPH07113898B2/ja
Priority to US07/520,644 priority patent/US5172378A/en
Publication of JPH02294739A publication Critical patent/JPH02294739A/ja
Publication of JPH07113898B2 publication Critical patent/JPH07113898B2/ja
Anticipated expiration legal-status Critical
Expired - Lifetime legal-status Critical Current

Links

Classifications

    • G—PHYSICS
    • G06—COMPUTING OR CALCULATING; COUNTING
    • G06F—ELECTRIC DIGITAL DATA PROCESSING
    • G06F11/00—Error detection; Error correction; Monitoring
    • G06F11/22—Detection or location of defective computer hardware by testing during standby operation or during idle time, e.g. start-up testing
    • G—PHYSICS
    • G06—COMPUTING OR CALCULATING; COUNTING
    • G06F—ELECTRIC DIGITAL DATA PROCESSING
    • G06F11/00—Error detection; Error correction; Monitoring
    • G06F11/07—Responding to the occurrence of a fault, e.g. fault tolerance
    • G06F11/0703—Error or fault processing not based on redundancy, i.e. by taking additional measures to deal with the error or fault not making use of redundancy in operation, in hardware, or in data representation
    • G06F11/0751—Error or fault detection not based on redundancy
    • G—PHYSICS
    • G06—COMPUTING OR CALCULATING; COUNTING
    • G06F—ELECTRIC DIGITAL DATA PROCESSING
    • G06F2201/00—Indexing scheme relating to error detection, to error correction, and to monitoring
    • G06F2201/865—Monitoring of software

Landscapes

  • Engineering & Computer Science (AREA)
  • General Engineering & Computer Science (AREA)
  • Theoretical Computer Science (AREA)
  • Computer Hardware Design (AREA)
  • Quality & Reliability (AREA)
  • Physics & Mathematics (AREA)
  • General Physics & Mathematics (AREA)
  • Test And Diagnosis Of Digital Computers (AREA)

Description

【発明の詳細な説明】 〔産業上の利用分野〕 本発明は、障害検出技術に関し、特に、情報処理装置に
おける障害検出および回復処理などに適用して効果のあ
る技術に関する。
〔従来の技術〕
たとえば、汎用の電子計算機システムなどの情報処理装
置においては、当該情報処理装置の普及分野の拡大など
に伴って、システムの機能停止に伴う影響が大きくなり
つつあり、安定な稼働を維持するためのシステムの信頼
性を確保することが必須となっている。
ところで、日経マグロウヒル社発行、「日経エレクトロ
ニクスNo.228」1979年12月24日号、P104〜P130、等の文
献にも記載されているように、最近の汎用コンピュータ
の中央処理装置(CPU)は、記憶制御ユニット(SCU)、
命令制御ユニット(IU)、演算ユニット(EU)等に機能
毎に分割されている。そして、記憶制御ユニット(SC
U)と命令制御ユニット(IU)は処理が定型化されてい
るので、配線論理による論理回路で構成されているが、
演算ユニット(EU)は、加算、減算、乗算、除算、シフ
ト等の種々の演算を行う必要があるために、マイクロプ
ログラム制御を採用することが一般的になっており、マ
イクロプログラムを格納するための制御記憶(CS)を備
えている(前記文献の図4参照)。
また、CPUでは、処理効率を向上させるため、パイプラ
イン制御(先行制御)の採用により、汎用命令の命令実
行が完了する前に、次の命令の読み出し、デコード等を
1マシンサイクルピッチで、SCU、IU、EUに渡って次々
に処理して行くことが行われている(前記文献の図5参
照)。
このため、従来では、情報処理システムを構成する中央
処理装置やそれに接続される周辺機器の障害を検出する
一手段として、たとえば、特開昭63−40943号公報およ
び特開昭63−55645号公報などに開示されているよう
に、一般に、マイクロプログラムの実行によって障害の
有無を判定するマイクロダイアグノスティスク(MD)が
行われている。
すなわち、マイクロプログラムのレベルでマイクロ診断
プログラムを記述し、このマイクロ診断プログラムを、
中央処理装置の動作を制御する通常のマイクロプログラ
ムとともにシステムの立ち上げ時などに制御記憶装置の
一部にロードしておき、定期的にこのマイクロ診断プロ
グラムを実行してハードウェア障害の有無を検出しよう
とするものである。
一方、ソフトウェアが行う情報処理装置の検証技術とし
て、たとえばオペレーティング・システムのレベルで
は、誤演算の検証や入出力装置の検証を行うIOパトロー
ルなどのテストプログラムを定期的に起動することで障
害検出を行っている。
〔発明が解決しようとする課題〕
ところが上記の従来技術のように、マイクロ命令によっ
て記述されたマイクロ診断プログラムによる障害検出方
式では、たとえば、マイクロ命令の実行時の先行制御な
どにおける論理の乱れに起因する障害を検出できないと
いう問題がある。
すなわち、パイプライン制御においては、パイプライン
の各処理ステージ(命令読み出し→命令デコード→アド
レス変換→オペランド読み出し→命令(演算)実行)の
うち、命令(演算)実行ステージは演算の種類により処
理時間が長くなる(1マシンサイクルで終了しない)場
合があり、このときに、1マシンサイクルピッチで連続
処理ができない、パイプラインの乱れが発生する。
この場合、CSに診断用のマイクロ命令列(マイクロプロ
グラム)をロードして診断を実行させても、当然のこと
ながら、演算ユニットのみが動作する(演算ステージの
みが処理される)だけであり、他のユニットは動作しな
い(他ステージは処理されない)ため、処理ステージの
オーバーラップ(パイプライン制御)を発生させること
ができない。すなわち、マイクロプログラムによる診断
のレベルでは、個々の演算器等のハードウェアのチェッ
クは可能であっても、パイプライン制御のように、複数
の演算器等の連携したパイプライン制御等における論理
の乱れの検証は困難である。
また、オペレーティング・システムなどのソフトウェア
レベルでのテストプログラムによる方式では、たとえ障
害を検出できたとしてもハードウェア的に検出された障
害でないために障害の解析に必要となる詳細なハードウ
ェア情報を得ることが困難であり、しかもテストプログ
ラムが数種の情報処理装置に対して共通に作成されてい
るため、個々の情報処理装置のハードウェア独自の論理
に依存したきめの細かい障害検出ができないという問題
もある。
そこで、本発明の目的は、マイクロ診断プログラムでは
検出が困難な障害を検証することが可能な障害検出方式
を提供することにある。
本発明の他の目的は、障害発生時におけるハードウェア
の状態を詳細に把握することが可能な障害検出方式を提
供することにある。
本発明のさらに他の目的は、同一の命令体系を有する他
の情報処理装置に容易に移植することが可能な障害検出
方式を提供することにある。
本発明のさらに他の目的は、主記憶装置以外に特別な記
憶装置を必要とすることなく、テストプログラムを構成
する命令列の格納および保護および実行を実現すること
が可能な障害検出方式を提供することにある。
本発明の前記ならびにその他の目的と新規な特徴は、本
明細書の記述および添付図面から明らかになるであろ
う。
〔課題を解決するための手段〕
本願において開示される発明のうち、代表的なものの概
要を簡単に説明すれば、下記のとおりである。
すなわち、本発明の障害検出方式は、オペレーティング
・システムおよび当該オペレーティング・システムの配
下で稼動する一般のプログラムを実行する中央処理装置
と、この中央処理装置によってアクセスされる主記憶装
置と、中央処理装置および主記憶装置と外部との間にお
ける情報の授受を制御する入出力処理装置とからなる情
報処理装置において、主記憶装置の記憶領域をオペレー
ティング・システムおよび一般のプログラムが格納さ
れ、かつ当該オペレーティング・システムおよび一般の
プログラムによってアクセスされるソフトウェア領域と
一般のプログラムからのアクセスが禁止されたハードウ
ェア領域(HSA)に区分し、ハードウェア領域(HSA)に
は中央処理装置および主記憶装置および入出力処理装置
を検証する汎用命令で記述された命令列を格納し、中央
処理装置はソフトウェア領域に格納されている一般のプ
ログラムとハードウェア領域(HSA)に格納されている
命令列とを所望の間隔で交互に実行し、命令列の実行結
果に基づいて障害発生の有無を判定するようにしたもの
である。
〔作用〕
上記した本発明の障害検出方式によれば、主記憶装置の
ハードウェア領域の一部に格納される命令列を汎用命令
にて記述することで、マイクロ診断プログラムでは検出
の困難なマイクロ命令の実行時の制御論理の乱れなどに
起因する障害をも確実に検出することができる。
また、障害検出時には、中央処理装置の検出したハード
ウェア障害として割り込み処理によってサービスプロセ
ッサの障害処理ルーチンを起動し、当該障害処理ルーチ
ンでは、中央処理装置などのハードウェアの状態をコン
ソールファイル装置に記録する動作を行わせることで、
障害発生時におけるハードウェアの状態を詳細に把握す
ることが可能となり、通常のプログラムレベルでのテス
トプログラムによる障害検出技術に比較して、障害の解
析や復旧処理などをより的確に行うことができる。
また、障害の有無を検証する命令列を汎用命令で記述す
ることで、ハードウェアに強く依存するマイクロ診断プ
ログラムなどと異なり、同一の命令体系を有する他の情
報処理装置に容易に移植することができる。
また、主記憶装置の一部に設けられ、一般のプログラム
やオペレーティング・システムからのアクセスが禁止さ
れたハードウェア領域(HSA)を利用して、テストプロ
グラムを構成する命令列を格納するので、主記憶装置以
外に特別に装置を必要とすることなく、テストプログラ
ムの格納および保護および実行を実現することができ
る。
〔実施例〕
以下、本発明の障害検出方式の実施例を、図面を参照し
ながら詳細に説明する。
第1図は、本発明の一実施例である障害検出方式が実施
される情報処理装置の構成の一例を示すブロック図であ
り、第2図〜第4図は、その動作の一例を示す流れ図で
ある。
まず、第1図を参照しながら、本実施例における情報処
理装置の構成の概略を説明する。
本実施例の情報処理装置は、システム全体の制御や所望
の演算動作などを行う中央処理装置5と、この中央処理
装置5の動作やシステムに接続される図示しない周辺機
器などのハードウェアを制御する動作を行うオペレーテ
ィング・システムや、当該オペレーティング・システム
の下て稼働する通常業務のプログラムなどが格納される
主記憶装置1とを備えている。
さらに、中央処理装置5には、当該中央処理装置5から
の指令に基づいて、前記主記憶装置1と、周辺機器との
間における情報の授受を制御する動作を行う入出力処理
装置13が接続されている。
また、中央処理装置5には、システムの操作者と当該中
央処理装置5との間に介在して、システム全体の稼働状
況の監視や制御を行うサービスプロセッサ6が接続され
ている。
サービスプロセッサ6は、たとえば磁気ディスク装置な
どからなるコンソールファイル装置7を備えており、こ
のコンソールファイル装置7にはシステム全体の稼働状
況などの情報からなるログデータファイル10が格納され
るようになっている。
主記憶装置1は、オペレーティング・システムや一般の
プログラムがアクセス可能なソフトウェア領域2と、周
辺機器などの種々のハードウェアを管理するための情報
が格納されるハードウェア領域3(HSA:Hardware Syste
m Area)とに区分されている。
このハードウェア領域3は、たとえば、近年科学社、昭
和61年6月5日発行「MVSの機能と構造」P195〜P197、
および日経BP社、1983年8月1日発行「日経エレクトロ
ニクス」P105、“実体が明らかになったIBM370/XAとMVS
/XA"、等の文献に記載されているように、IBM社製の大
型機コンピュータ・アーキテクチャ370/XA上で稼動する
オペレーティング・システムであるMVS/XAにおけるHSA
(Hardware System Area)に相当する。
ハードウェア領域3に対しては一般のプログラムはアク
セスが禁止されており、中央処理装置5によるHSAアク
セススイッチの“ON",“OFF"によってアクセスの制御が
行われるようになっている。
この場合、ハードウェア領域3には、中央処理装置5に
備えられた図示しない複数のレジスタの情報の退避や復
旧などのために用いられるスタックエリア12と、テスト
プログラムエリア4とが設けられており、テストプログ
ラムエリア4には、通常のプログラムなどと同等の汎用
命令で記述された複数種のテストルーチンTi(i=1,2,
3,...n)からなるテストプログラムTが格納されてい
る。
このテストプログラムTは、中央処理装置、主記憶装
置、入出力処理装置を検証するための汎用命令からなる
命令列を含み、サービスプロセッサ6に備えられたコン
ソールファイル装置7の中にテストプログラムファイル
11として格納されており、たとえばシステムの立ち上げ
時などに、ハードウェア領域3のテストプログラムエリ
ア4にロードされるようになっている。
また、サービスプロセッサ6は、前記のテストプログラ
ムTの実行時期を制御するテストタイミングモジュール
8と、システムにおける障害の検出時などに、後述のよ
うな所定の処理を行うマシンチェックモジュール9とを
備えている。
そして、テストタイミングモジュール8は、一般のプロ
グラムの稼働中に、たとえば数百msに1回の割合で中央
処理装置5に対する割り込み要求を行って前記テストプ
ログラムTを実行させることで、当該システムにおける
異常の有無の監視などが行われるものである。
以下、本実施例の障害検出方式の作用を、第2図〜第4
図の流れ図などを参照しながら説明する。
まず、サービスプロセッサ6のテストタイミングモジュ
ール8の中央処理装置5に対する割り込み処理が行われ
ると、中央処理装置5は、これまで実行中であったソフ
トウェア領域2におけるプログラムのプログラム状態語
PSWおよびレジスタ類の内容をハードウェア領域3のス
タックエリア12に退避させ(ステップ201)、主記憶装
置1のハードウェア領域3に対するアクセスを許可する
HSAアクセススイッチと、テストプログラムが稼働中で
あることを示すMDフラグとを“ON"にする。(ステップ2
02) 前記プログラム状態語PSWは、たとえば、第5図に示さ
れるように、所定の制御情報がビットパターンで表現さ
れる制御ビット部と、主記憶装置1に格納されているプ
ログラム中の、次に実行すべきアドレスを示す次実行ア
ドレス部NIAとからなっており、中央処理装置5は、こ
の次実行アドレス部NIAにテストプログラムエリア4の
アドレスを設定し(ステップ203)、テストプログラム
Tを起動する。(ステップ204) この時、テストプログラムTにおいては、第3図に示さ
れるように、たとえば経時的に変化するシステムクロッ
クなどに基づいて発生される乱数などを用いて複数のテ
ストルーチンTnの一つTiを無作為に選択して(ステップ
301)、実行する。(ステップ302) そして、実行されたテストルーチンTiの実行結果と期待
値とを比較し(ステップ303)、両者が一致する場合に
は、システムに異常や障害が認められないと判断してテ
ストフラグに“OK"をセットし(ステップ304)、両者が
不一致の場合には、障害が発生しているものと判断して
テストフラグに“NG"をセットして(ステップ305)、テ
ストプログラムTを終了する。
中央処理装置5では、上記のテストプログラムTの実行
が終了すると、中断されていたソフトウェア領域2の前
記プログラムを再開させるため、前記プログラム状態語
PSWおよび各種レジスタ類の内容を、スタックエリア12
から回復させる。(ステップ205) そして、前記テストプログラムTの実行終了時にセット
されたテストフラグを調べ(ステップ206)、当該テス
トフラグが“OK"の場合には、すなわちシステムに異常
がない場合には、前記HSAアクセススイッチおよびMDフ
ラグをともに“OFF"にして(ステップ207)、中断され
ていたソフトウェア領域2の前記プログラムを再開させ
る(ステップ208)。
一方、テストフラグが“NG"の場合には、前記HSAアクセ
ススイッチをOFFにして(ステップ209)、サービスプロ
セッサ6に対して障害検出割り込みを発行するとともに
(ステップ210)、当該中央処理装置5の動作を凍結
(フリーズ)する。(ステップ211) 障害検出割り込みを受けたサービスプロセッサ6は、第
4図に示されるように、当該サービスプロセッサ6の内
部のマシンチェックモジユール9を起動する。
マシンチェックモジユール9は、まず、中央処理装置5
の各種レジスタの内容などのハードウェア情報をログア
ウトし(ステップ401)、コンソールファイル装置7の
ログデータファイル10に格納する。(ステップ402) その後、マシンチェックモジユール9は、MDフラグを調
べ(ステップ403)、“OFF"の場合には直ちに、また“O
N"の場合には当該MDフラグを“OFF"にした後(ステップ
404)、中央処理装置5に対してリセット信号を発行し
て(ステップ405)フリーズ状態を解除し、当該中央処
理装置5のハードウェア障害時に起動されるマシンチェ
ック割り込み処理ルーチンを起動する(ステップ40
6)。
そして、当該マシンチェック割り込み処理ルーチンは、
ハードウェア障害発生時の割り込みとして、ソフトウェ
ア領域2における稼働中のオペレーティング・システム
などのプログラムに対してハードウェア障害の発生を報
告する。
以上のように、本実施例の障害検出方式によれば、サー
ビスプロセッサ6のテストタイミングモジュール8から
の割り込みを契機として、主記憶装置1のハードウェア
領域3に格納されている汎用命令で記述されたテストプ
ログラムTを周期的に起動することでシステムにおける
障害発生の有無を検証するので、たとえば、マイクロ命
令の実行時の先行制御の乱れなどのように、マイクロ命
令のレベルで記述されたマイクロ診断プログラムでは検
出が困難な論理障害などを確実に検出できるという効果
がある。
また、障害が検出された場合には、サービスプロセッサ
6のマシンチェックモジユール9を起動して、中央処理
装置5などにおける各種レジスタの内容などの詳細なハ
ードウェア情報をコンソールファイル装置7のログデー
タファイル10に記録するので、これらの詳細なハードウ
ェア情報を参照することで、障害の回復処理や解析など
を的確に行うことができる。
さらに、ハードウェア領域3に格納されるテストプログ
ラムTが汎用命令で記述されているため、同一の命令体
系を有する他の機種などのへのテストプログラムTの移
植を容易に行うことができるという利点がある。
また、主記憶装置1の一部に設けられた一般のプログラ
ムがアクセスできないハードウェア領域3を利用してテ
ストプログラムTを格納するので、主記憶装置1の他に
特別な記憶装置を設けることなく、テストプログラムT
の格納および実行を実現できる、という効果がある。
以上本発明者によってなされた発明を実施例に基づき具
体的に説明したが、本発明は前記実施例に限定されるも
のではなく、その要旨を逸脱しない範囲で種々変更可能
であることはいうまでもない。
たとえば、テストプログラムの起動方法としては、上記
の実施例中に例示したようなサービスプロセッサのテス
トタイミングモジュールからの割り込み要求を契機とす
ることに限らず、中央処理装置の内部に設けられたイン
ターバルタイマなどを用いてもよい。
また、主記憶装置のハードウェア領域の一部に各種入出
力装置などの周辺機器に関する情報を格納しておき、こ
の周辺機器に関する情報を本発明のテストプログラムの
実行時に参照することで、従来オペレーティング・シス
テムなどが行っていたIOパトロールなどの処理を本発明
の障害検出方式によって行うようにしてもよい。
〔発明の効果〕
本願において開示される発明のうち、代表的なものによ
って得られる効果を簡単に説明すれば、以下のとおりで
ある。
すなわち、オペレーティング・システムおよび当該オペ
レーティング・システムの配下で稼動する一般のプログ
ラムを実行する中央処理装置と、この中央処理装置によ
ってアクセスされる主記憶装置と、中央処理装置および
主記憶装置と外部との間における情報の授受を制御する
入出力処理装置とからなる情報処理装置において、主記
憶装置の記憶領域をオペレーティング・システムおよび
一般のプログラムが格納され、かつ当該オペレーティン
グ・システムおよび一般のプログラムによってアクセス
されるソフトウェア領域と一般のプログラムからのアク
セスが禁止されたハードウェア領域(HSA)に区分し、
ハードウェア領域(HSA)には中央処理装置および主記
憶装置および入出力処理装置を検証する汎用命令で記述
された命令列を格納し、中央処理装置はソフトウェア領
域に格納されている一般のプログラムとハードウェア領
域(HSA)に格納されている命令列とを所望の間隔で交
互に実行し、命令列の実行結果に基づいて障害発生の有
無を判定するので、主記憶装置のハードウェア領域の一
部に格納される命令列を汎用命令にて記述することで、
マイクロ診断プログラムでは検出の困難なマイクロプロ
グラムの実行時の制御論理の乱れなどに起因する障害を
も確実に検出することができる。
また、障害検出時には、中央処理装置の検出したハード
ウェア障害として割り込み処理によってサーピスプロセ
ッサの障害処理ルーチンを起動し、当該障害処理ルーチ
ンでは、中央処理装置などのハードウェアの状態をコン
ソールファイル装置に記録する動作を行わせることで、
障害発生時におけるハードウェアの状態を詳細に把握す
ることが可能となり、通常のプログラムレベルでのテス
トプログラムによる障害検出技術に比較して、障害の解
析や復旧処理などをより的確に行うことができる。
また、障害の有無を検証する命令列を汎用命令で記述す
ることで、ハードウェアに強く依存するマイクロ診断プ
ログラムなどと異なり、同一の命令体系を有する他の情
報処理装置に容易に移植することができる。
また、主記憶装置の一部に設けられ、一般のプログラム
やオペレーティング・システムからのアクセスが禁止さ
れたハードウェア領域(HSA)を利用して、テストプロ
グラムを構成する命令列を格納するので、主記憶装置以
外に特別に装置を必要とすることなく、テストプログラ
ムの格納および保護および実行を実現することができ
る。
【図面の簡単な説明】
第1図は、本発明の一実施例である障害検出方式が実施
される情報処理装置の構成の一例を示すブロック図、 第2図は、本発明の障害検出方式の一実施例の動作の一
例を説明する流れ図、 第3図は、同じく本発明の障害検出方式の一実施例の動
作の一例を説明する流れ図、 第4図は、同じく本発明の障害検出方式の一実施例の動
作の一例を説明する流れ図、 第5図は、プログラム状態語の構成の一例を示す説明図
である。 1……主記憶装置、2……ソフトウェア領域、3……ハ
ードウェア領域、4……テストプログラムエリア、5…
…中央処理装置、6……サービスプロセッサ、7……コ
ンソールファイル装置、8……テストタイミングモジュ
ール、9……マシンチェックモジユール(障害処理ルー
チン)、10……ログデータファイル、11……テストプロ
グラムファイル、12……スタックエリア、13……入出力
処理装置、33……ハードウェア領域、201〜211……ステ
ップ、301〜305……ステップ、401〜406……ステップ、
PSW……プログラム状態語、NIA……次実行アドレス部、
T……テストプログラム(命令列)。
───────────────────────────────────────────────────── フロントページの続き (72)発明者 森 芳一 神奈川県秦野市堀山下1番地 株式会社日 立製作所神奈川工場内 (72)発明者 日高 博之 神奈川県秦野市堀山下1番地 株式会社日 立製作所神奈川工場内 (72)発明者 延命 史雄 神奈川県横浜市戸塚区品濃町504番2号 日立電子サービス株式会社内 (56)参考文献 特開 昭61−62945(JP,A) 特開 昭61−182107(JP,A) 特開 昭60−140440(JP,A)

Claims (3)

    【特許請求の範囲】
  1. 【請求項1】オペレーティング・システムおよび当該オ
    ペレーティング・システムの配下で稼動する一般のプロ
    グラムを実行する中央処理装置と、この中央処理装置に
    よってアクセスされる主記憶装置と、前記中央処理装置
    および主記憶装置と外部との間における情報の授受を制
    御する入出力処理装置とからなる情報処理装置におい
    て、前記主記憶装置の記憶領域を前記オペレーティング
    ・システムおよび前記一般のプログラムが格納され、か
    つ当該オペレーティング・システムおよび一般のプログ
    ラムによってアクセスされるソフトウェア領域と前記一
    般のプログラムからのアクセスが禁止されたハードウェ
    ア領域(HSA)に区分し、前記ハードウェア領域(HSA)
    には前記中央処理装置および主記憶装置および入出力処
    理装置を検証する汎用命令で記述された命令列を格納
    し、前記中央処理装置は前記ソフトウェア領域に格納さ
    れている前記一般のプログラムと前記ハードウェア領域
    (HSA)に格納されている前記命令列とを所望の間隔で
    交互に実行し、前記命令列の実行結果に基づいて障害発
    生の有無を判定することを特徴とする障害検出方式。
  2. 【請求項2】前記命令列の実行結果が期待値と一致しな
    い場合は、前記中央処理装置の検出したハードウェア障
    害として割り込み処理によって前記オペレーティング・
    システムに報告するようにした請求項1記載の障害検出
    方式。
  3. 【請求項3】前記情報処理装置にはサービスプロセッサ
    が設けられ、当該サービスプロセッサは、前記命令列の
    実行開始時期を指令するテストタイミングモジュール
    と、障害処理ルーチンとコンソールファイル装置とを有
    し、前記オペレーティング・システムは、前記中央処理
    装置からの前記割り込みを契機として、サービスプロセ
    ッサの障害処理ルーチンを起動し、当該障害処理ルーチ
    ンでは、前記中央処理装置の状態を前記コンソールファ
    イル装置に記録するようにした請求項1記載の障害検出
    方式。
JP1116977A 1989-05-09 1989-05-09 障害検出方式 Expired - Lifetime JPH07113898B2 (ja)

Priority Applications (2)

Application Number Priority Date Filing Date Title
JP1116977A JPH07113898B2 (ja) 1989-05-09 1989-05-09 障害検出方式
US07/520,644 US5172378A (en) 1989-05-09 1990-05-08 Error detection method and apparatus for processor having main storage

Applications Claiming Priority (1)

Application Number Priority Date Filing Date Title
JP1116977A JPH07113898B2 (ja) 1989-05-09 1989-05-09 障害検出方式

Publications (2)

Publication Number Publication Date
JPH02294739A JPH02294739A (ja) 1990-12-05
JPH07113898B2 true JPH07113898B2 (ja) 1995-12-06

Family

ID=14700442

Family Applications (1)

Application Number Title Priority Date Filing Date
JP1116977A Expired - Lifetime JPH07113898B2 (ja) 1989-05-09 1989-05-09 障害検出方式

Country Status (2)

Country Link
US (1) US5172378A (ja)
JP (1) JPH07113898B2 (ja)

Families Citing this family (10)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
US5359547A (en) * 1992-06-26 1994-10-25 Digital Equipment Corporation Method and apparatus for testing processor-based computer modules
US6266787B1 (en) * 1998-10-09 2001-07-24 Agilent Technologies, Inc. Method and apparatus for selecting stimulus locations during limited access circuit test
US6654816B1 (en) * 2000-05-31 2003-11-25 Hewlett-Packard Development Company, L.P. Communication interface systems for locally analyzing computers
US20020073359A1 (en) * 2000-09-08 2002-06-13 Wade Jennifer A. System and method for high priority machine check analysis
KR100525537B1 (ko) * 2000-12-28 2005-11-02 엘지전자 주식회사 인터럽트를 이용한 응용 프로그램의 에러검출장치 및 방법.
US6789048B2 (en) * 2002-04-04 2004-09-07 International Business Machines Corporation Method, apparatus, and computer program product for deconfiguring a processor
US7853827B2 (en) * 2008-08-29 2010-12-14 International Business Machines Corporation Isotropic processor
WO2015029194A1 (ja) * 2013-08-29 2015-03-05 株式会社日立システムズ 広域管理システム、広域管理装置、建物管理装置、および広域管理方法
CN113608914B (zh) * 2021-08-10 2024-04-26 安谋科技(中国)有限公司 一种芯片、芯片的功能安全检测方法、介质和电子设备
CN117687848A (zh) * 2022-09-05 2024-03-12 华为云计算技术有限公司 一种处理器及检测处理器错误的方法

Family Cites Families (17)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
US3838260A (en) * 1973-01-22 1974-09-24 Xerox Corp Microprogrammable control memory diagnostic system
US3930146A (en) * 1974-01-18 1975-12-30 Gte Automatic Electric Lab Inc Input/output controller maintenance arrangement for a communication switching system
US4096561A (en) * 1976-10-04 1978-06-20 Honeywell Information Systems Inc. Apparatus for the multiple detection of interferences
HU174987B (hu) * 1976-10-12 1980-04-28 Textilipari Kutato Intezet Oborudovanie k bystromu i massovomu ispytaniju na razryv volokon
US4127768A (en) * 1977-01-03 1978-11-28 Honeywell Information Systems Inc. Data processing system self-test enabling technique
US4334307A (en) * 1979-12-28 1982-06-08 Honeywell Information Systems Inc. Data processing system with self testing and configuration mapping capability
JPS6053339B2 (ja) * 1980-10-09 1985-11-25 日本電気株式会社 論理装置のエラ−回復方式
US4550406A (en) * 1983-06-14 1985-10-29 Everett/Charles Test Equipment, Inc. Automatic test program list generation using programmed digital computer
JPS60107156A (ja) * 1983-11-16 1985-06-12 Hitachi Ltd デ−タ処理システム
JPS60140440A (ja) * 1983-12-27 1985-07-25 Matsushita Electric Ind Co Ltd 中央処理装置
JPS6162945A (ja) * 1984-09-04 1986-03-31 Nec Corp 情報処理装置の検査方式
JPS61182107A (ja) * 1985-02-06 1986-08-14 Hitachi Ltd デイジタル制御装置
DE3526485A1 (de) * 1985-07-24 1987-02-05 Heinz Krug Schaltungsanordnung zum pruefen integrierter schaltungseinheiten
FR2602891B1 (fr) * 1986-08-18 1990-12-07 Nec Corp Systeme de correction d'erreur d'un systeme a multiprocesseurs pour corriger une erreur dans un processeur en mettant le processeur en condition de controle apres achevement du redemarrage du microprogramme a partir d'un point de reprise
US4819233A (en) * 1987-04-08 1989-04-04 Westinghouse Electric Corp. Verification of computer software
JPH0679290B2 (ja) * 1987-05-31 1994-10-05 日本電気株式会社 コンピュ−タ装置
US4982402A (en) * 1989-02-03 1991-01-01 Digital Equipment Corporation Method and apparatus for detecting and correcting errors in a pipelined computer system

Also Published As

Publication number Publication date
JPH02294739A (ja) 1990-12-05
US5172378A (en) 1992-12-15

Similar Documents

Publication Publication Date Title
US5948112A (en) Method and apparatus for recovering from software faults
US6438709B2 (en) Method for recovering from computer system lockup condition
JP3571976B2 (ja) デバッグ装置及び方法並びにプログラム記録媒体
EP0664511A2 (en) Microprocessor fault log
JPH0820965B2 (ja) プログラムの実行を続行する方法
US5109381A (en) Apparatus and method for detecting errors in a pipeline data processor
US20020116670A1 (en) Failure supervising method and apparatus
JP2000187600A (ja) ウオッチドッグタイマ方式
JPH02294739A (ja) 障害検出方式
US5974249A (en) Zero footprint method and apparatus for expanding allocated memory space of a process using a virtual memory area
US20080133975A1 (en) Method for Running a Computer Program on a Computer System
JPH07141176A (ja) コマンドリトライ制御方式
JPH0245838A (ja) プログラム実行状態監視方法
JPH04307641A (ja) マルチタスク・システムの障害診断装置
JP3604171B2 (ja) プロセス自動再起動処理方式
JP2002229811A (ja) 論理分割システムの制御方法
CN120429122B (zh) 线程调试方法、装置、控制系统以及电子设备
KR100414059B1 (ko) Rtos에서의 와치독 타이머를 이용한 오동작 감시시스템 및 방법
EP0655686B1 (en) Retry control method and device for control processor
JPH0644238B2 (ja) 命令再実行制御方法
JP2793386B2 (ja) 電子計算機の演算エラー情報保持装置
JP2705401B2 (ja) マルチプロセッサ制御方法
JPH076103A (ja) 入出力チャネルの障害処理システム
JPH0395634A (ja) 計算機システム再起動制御方式
JPH02207347A (ja) ソフトウェア障害検出方法