
News Observation Lab for Future
学生が開発したAIOpsプラットフォーム「WATCHDOG」の概要と機能

作者について
インド・プネ在住のエンジニアリング学生が自ら構築したAIOpsプラットフォーム「WATCHDOG」について紹介しています。
解決した課題
従来のモニタリングは障害を検知すると人間が手動で調査・診断・修復を行う必要がありますが、深夜やプレッシャー下での対応は負担が大きいという問題を、WATCHDOG が自動でインシデント対応ループを完結させます。
主な機能
- 検知:6つの並列アルゴリズム(統計的Zスコア、Isolation Forest、LSTMディープディテクタ、マルチバリアント相関、季節性ディテクタ、ドリフトディテクタ)で全メトリクスを解析。
- 予測:障害予測と容量予測を行い、どのサービスが失敗に向かっているか、残り時間を通知。
- 根本原因分析:因果グラフ、影響範囲推定、依存関係マッピング、変更インテリジェンスを提供。
- 自動修復:Docker SDK を利用したコンテナ再起動を実施。回復時間は 1.4 秒と検証済み。ただし、以下の条件を通過した場合のみ実行されます。
- 信頼度ゲート(≥65%)
- 重大度ゲート(HIGH/CRITICAL のみ)
- サービスごとの30秒クールダウン
- 1時間あたり最大10アクション
- 3回連続失敗で作動するサーキットブレーカー
- 監査:検知・判断・実行の全履歴を改ざん防止型暗号チェーンに記録。
テスト結果
- 信頼性テスト 40/40 件合格(成功率 97%)
- 負荷テスト 108 イベント/秒、失敗なし
- 自動修復回復時間 1.4〜1.7 秒
- RBAC テスト 17/17 件合格
- マルチテナント分離テスト 18/18 件合格
- WAL 復旧テスト 10/10 件合格
技術スタック
Python、FastAPI、PostgreSQL、Redis(WAL)、Docker SDK、JWT 認証、SQLAlchemy、asyncio を組み合わせ、104 の REST エンドポイントと 16 の非同期パイプラインワーカーで構成。
求めていること
販売目的ではなく、DevOps エンジニアや SRE に対し、
- 本ツールが実務上の課題を解くか
- 不足している点は何か
- 自社環境で導入可能か
といったフィードバックを求めています。希望者には無料パイロットを提供します。