News Observation Lab for Future

Appleシリコン上でビルド・テスト・デプロイ自動化ループを実装した結果

Stunning monochrome close-up of a PCB circuit board highlighting intricate details.

Mininglampでは開発者ツールを長年手掛けてきました。その中で、プロンプトを書いてから実際に製品としてリリースするまでのギャップが大きいことに気づきました。LLM がコードを生成できても、テスト・デプロイ・運用まで人手なしで完結させるのは難しいという課題です。

Mano‑AFK の全体像

そこでチームは「Mano‑AFK」という自律実行フレームワークを構築しました。自然言語の指示を受け取り、要件定義書(PRD)作成、コード生成、ローカルへのデプロイ、三層テスト(リント、API テスト、ブラウザベースのエンドツーエンドテスト)を順に実行します。テストで失敗した場合はエラー内容を解析し、コードを自動で修正して再試行します。また、最終段階で別エージェントが敵対的レビューを行い、潜在的な欠陥を洗い出します。

インストールと実行環境

Mano‑AFK は Homebrew でインストールできます。ローカルの 4 B パラメータ VLA モデルは Apple Silicon 上で動作し、Apple M4(32 GB RAM)でも問題なく走ります。

E2E テストの結果

E2E テストではローカルモデルとクラウドの Claude CUA を選択できます。ローカルモデルのベンチマークは 100 件のテストケースで 58.0 % の正解率でした。一方、W8A8 量子化版は 54.0 % の正解率ですが、トークン生成速度は約 1,453 トークン/秒と高速です。

うまくいった点

  • PRD 生成は実用的で、機能分割や API 定義、データモデルまで網羅した文書が得られました。
  • リントと API テストはスムーズに通過し、構文エラーや基本的なロジックバグの約 70 % を自動修正で解消しました。
  • 敵対的レビューは、入力バリデーション不足など、テストスイートが見逃す問題を約 40 % 発見しました。

課題となった点

  • ローカル 4 B モデルの E2E テストは成功率が 58 % と低く、特に動的 UI(アニメーション、ローディングスピナー、位置変化要素)や複数ページに跨るフローで失敗しやすいです。
  • 設計上の根本的な問題(不適切なデータ構造や競合状態)は自動修正ループだけでは解決できず、症状のパッチに留まります。

自動修正ループの限界

単純な依存関係の追加やポート設定ミス、タイポによる 404 エラーなどは即座に修正されます。しかし、アーキテクチャ的な欠陥については繰り返しパッチを当てるだけで根本的な改善には至りません。

敵対的レビューの効果

テストがすべて合格した後、別エージェントがアプリケーション全体を再評価します。テストスイートが見逃したエッジケースやアクセシビリティ問題を検出できる一方で、偽陽性も一定数存在します。

クロスプロジェクト学習

Mano‑AFK は rules.md や preferences.md といった設定ファイルをプロジェクト間で共有し、Tailwind の使用や API 応答形式といったチームの慣習を蓄積します。5 件以上のプロジェクトを経ると、生成コードがこれらの慣習に沿うようになりました。

適用範囲と今後の展望

CRUD アプリやランディングページ、内部ツールなど比較的シンプルなケースでは 60 % 程度の成功率でほぼ手を加えずに完成します。リアルタイム機能や高度な状態管理、外部認証フローを伴うシステムでは成功率が下がり、手動介入が必要になります。

利用方法

Mano‑AFK は Apache 2.0 ライセンスで GitHub の Mano‑P 組織に公開されています。Apple M4 搭載マシンで Homebrew により簡単に導入可能です。

免責事項・利用上の注意

本サイトは情報提供および調査研究を目的としており、投資勧誘を目的とするものではありません。掲載情報には自動取得・自動翻訳・AI分析による内容が含まれます。投資判断はご自身の責任で行ってください。

詳細を確認する →