News Observation Lab for Future

学生が開発したAIOpsプラットフォーム「WATCHDOG」の概要と機能

Engineer working with CAD software on dual monitors in an office setting.

作者について

インド・プネ在住のエンジニアリング学生が自ら構築したAIOpsプラットフォーム「WATCHDOG」について紹介しています。

解決した課題

従来のモニタリングは障害を検知すると人間が手動で調査・診断・修復を行う必要がありますが、深夜やプレッシャー下での対応は負担が大きいという問題を、WATCHDOG が自動でインシデント対応ループを完結させます。

主な機能

  • 検知:6つの並列アルゴリズム(統計的Zスコア、Isolation Forest、LSTMディープディテクタ、マルチバリアント相関、季節性ディテクタ、ドリフトディテクタ)で全メトリクスを解析。
  • 予測:障害予測と容量予測を行い、どのサービスが失敗に向かっているか、残り時間を通知。
  • 根本原因分析:因果グラフ、影響範囲推定、依存関係マッピング、変更インテリジェンスを提供。
  • 自動修復:Docker SDK を利用したコンテナ再起動を実施。回復時間は 1.4 秒と検証済み。ただし、以下の条件を通過した場合のみ実行されます。
    • 信頼度ゲート(≥65%)
    • 重大度ゲート(HIGH/CRITICAL のみ)
    • サービスごとの30秒クールダウン
    • 1時間あたり最大10アクション
    • 3回連続失敗で作動するサーキットブレーカー
  • 監査:検知・判断・実行の全履歴を改ざん防止型暗号チェーンに記録。

テスト結果

  • 信頼性テスト 40/40 件合格(成功率 97%)
  • 負荷テスト 108 イベント/秒、失敗なし
  • 自動修復回復時間 1.4〜1.7 秒
  • RBAC テスト 17/17 件合格
  • マルチテナント分離テスト 18/18 件合格
  • WAL 復旧テスト 10/10 件合格

技術スタック

Python、FastAPI、PostgreSQL、Redis(WAL)、Docker SDK、JWT 認証、SQLAlchemy、asyncio を組み合わせ、104 の REST エンドポイントと 16 の非同期パイプラインワーカーで構成。

求めていること

販売目的ではなく、DevOps エンジニアや SRE に対し、

  • 本ツールが実務上の課題を解くか
  • 不足している点は何か
  • 自社環境で導入可能か

といったフィードバックを求めています。希望者には無料パイロットを提供します。

免責事項・利用上の注意

本サイトは情報提供および調査研究を目的としており、投資勧誘を目的とするものではありません。掲載情報には自動取得・自動翻訳・AI分析による内容が含まれます。投資判断はご自身の責任で行ってください。

詳細を確認する →