要約
Manusは、単純なチャットボットの枠を超え、永続的かつ自律的に動くデジタル存在を生み出すことで、AIエージェントの概念を再定義しています。クラウドブラウザー技術を活用し、限定的な連携ではなく汎用的なエージェンシーに焦点を当てることで、Manusチームは、AIが人間の思考をシームレスに拡張し、ウェブ全体で複雑なタスクを実行できる未来を築いています。
ウェブを自在に進む自律型AIエージェントを構築するManusの先見的な歩みを探ります。クラウドブラウザーや状態の永続性に関する技術、そして人間と機械の協働が認知能力の限界を広げる形でどのように進化しているのかを紹介します。

要約
Manusは、単純なチャットボットの枠を超え、永続的かつ自律的に動くデジタル存在を生み出すことで、AIエージェントの概念を再定義しています。クラウドブラウザー技術を活用し、限定的な連携ではなく汎用的なエージェンシーに焦点を当てることで、Manusチームは、AIが人間の思考をシームレスに拡張し、ウェブ全体で複雑なタスクを実行できる未来を築いています。
始まりはボイスメモでした。1年前、高性能なMacBookの音と冷めたコーヒーの香りに満ちた部屋で、4人のエンジニアが、人類史上最も進んだテクノロジーが、なぜいまだに絶えず手助けしなければフライトの予約もスプレッドシートの整理もできないのかを考え始めました。彼らは議論を録音しました。それは、やがてManusの設計図となる、生々しいアイデアの応酬でした。今日、その記録を振り返ると、真のAIエージェントのビジョンが生まれた瞬間がはっきりと分かります。それは仕事について話すチャットボットではなく、実際に仕事を遂行するデジタル存在として誕生したのです。
「AIエージェント」という言葉は、テック業界で新たに最も好まれるバズワードになりました。しかし、それが実際に何を意味するのか、いまだに多くの人が説明に苦労しています。より賢いSiriにすぎないのでしょうか。バックグラウンドで動くスクリプトなのでしょうか。ManusのZhang Tao氏とチームによれば、AIエージェントははるかに深い存在です。それは人間の思考の拡張です。人間のインターンと同じように、自律性と持続性をもって、混沌とした非定型のオープンウェブを進み回れるソフトウェアなのです。睡眠も健康保険も必要ありません。
この詳細な考察では、創業のきっかけとなった会議で語られた内部哲学と技術的課題を探ります。「ジェネラリスト」と「スペシャリスト」のどちらを構築するかという緊張関係にチームがどう向き合ったのか、なぜ「クラウドブラウザー」が次の10年の秘密兵器となるのか、そして知性の経済性がどのように変化しているのかを見ていきます。これは単なるスタートアップの物語ではありません。地球上のすべての人が、いつでも呼び出せる専用AIエージェントを持つ時代へのロードマップです。
生成AIから自律型AIエージェントへの移行は、グラフィカルユーザーインターフェースの発明以来、コンピューティングにおける最大の変化です。コンピューターに「どのように」実行するかを伝える世界(プログラミング)から、「何を」達成したいかを伝える世界(意図)へと移行しています。しかしManusチームがすぐに気づいたように、機械に意図を理解させるのは簡単な部分です。現代のインターネットという断片化された環境全体で、その意図を実行させることこそが、本当の勝負なのです。
Manusの立ち上げ時、最も活発な議論の一つは戦略上の分岐点をめぐるものでした。特定のタスクに特化したツールを作るべきか、それとも汎用エンジンを作るべきか。プロジェクトの中心的な思想家の一人であるRed Peakは、見事な歴史的たとえを使ってこの問題を整理しました。彼は現在のAIの状況を、中国インターネットの黎明期、特にHao123とBaiduの競争になぞらえたのです。
Hao123は、人間が事前に承認し整理したリンク集、つまりディレクトリでした。ウェブが小さかったから機能したのです。同様に、初期のAIツールの多くは「リンク型」です。Spotify専用のAPI、Google Calendar用のAPI、Slack用のAPIに接続します。しかし、この方法には本質的な限界があります。開発者が事前に統合したことしか実行できないのです。開発者が想定していなかったタスクをAIエージェントに実行させたい場合、手も足も出ません。この「供給側」中心の知性モデルは、真の自律性にとって行き止まりです。
一方、「Baiduモデル」(またはGoogleモデル)はクローラーから始まりました。許可を求めるのではなく、ウェブ全体を読み取り、移動する方法を学んだのです。まず汎用検索エンジンを構築し、後から特定のクエリに最適化できました。Manusチームは、AIエージェントもこの道を進むべきだと判断しました。プラグインの集合ではなく、あなたと同じようにブラウザーを使えるデジタル存在であるべきなのです。ボタンが見えればクリックでき、フォームが見えれば入力できます。
垂直的な最適化より汎用性を優先するこの決断は大胆です。AIエージェントは、ポップアップ、CAPTCHA、頻繁に変わるレイアウトなど、「野生の」ウェブの混沌に対処しなければなりません。しかしチームは、一般的な問題を解決できれば、個別の問題は自然に解決されると主張しました。彼らが構築していたのは単なるツールではなく、デジタル労働のためのプラットフォームだったのです。
Manusの哲学が汎用的なエージェンシーに関するものだとすれば、プロジェクトの技術的中核は「クラウドブラウザー」です。会議中、Zhang Tao氏とFan Bin氏は、AIエージェントが実際に世界とどう взаимодейств взаимодействするかを徹底的に議論しました。LLMにターミナルを与えればホテルを予約できる、というわけではありません。世界の価値の大半は、人間の目と指のために設計されたグラフィカルユーザーインターフェース(GUI)の背後にあります。
解決策は「ブラウザー・イン・ブラウザー」アーキテクチャでした。AIエージェントがバックグラウンドでデータを「スクレイピング」するのではなく、リモートサーバー上で動くブラウザーの完全なインスタンスを実際に操作します。AIエージェントにZillowで家を探すよう頼むと、APIを呼び出すだけでなく、クラウド上で文字どおりブラウザーを「開き」、URLへ移動し、スクロールを始めます。ユーザーはエージェントの作業をリアルタイムで見られるため、テキストベースのボットにはない信頼の橋が生まれます。
しかし、これは遅延に関する大きな技術的課題を生みます。遅延で使いものにならないと感じさせずに、高解像度のブラウザー画面をサーバーからユーザーのノートパソコンへストリーミングするにはどうすればよいのでしょうか。Zhang Tao氏は、インテリジェントなピクセルストリーミングを使うXPRAのような技術を指摘しました。画面上で変化した部分だけを送信することで、実際の重い処理が何千キロも離れたデータセンターで行われていても、AIエージェントがユーザーの目の前で作業しているように見せられます。
| 機能 | 従来のAPIボット | Manus AIエージェント |
|---|---|---|
| インターフェース | 非表示/テキストのみ | ライブビジュアル・クラウドブラウザー |
| 互換性 | 公式APIが必要 | あらゆるウェブサイトで動作 |
| ユーザーによる操作 | なし(ブラックボックス) | インタラクティブ・テイクオーバーモード |
| 永続性 | セッション単位のみ | 完全な状態とログイン情報の記憶 |
この視覚的なアプローチは「ハルシネーション」の問題も解決します。通常のチャットボットがフライトを予約したと伝えても、その言葉を信じるしかありません。Manus AIエージェントがライブブラウザー画面で確認画面を見せれば、証拠があります。この可視性は、プロセスをデバッグする必要があるエンジニアにも、仕事が完了したことだけを確認したいマネージャーにも不可欠です。
Manusの立ち上げ時に得られた最も深い気づきの一つは、記憶のないAIエージェントは高機能な計算機にすぎないということでした。Peak氏は、Devinのような現在の市場リーダーの大きな欠点を指摘しました。それらは「一度きり」なのです。セッションが終了すると、エージェントは実質的にデジタル健忘症に陥ります。パスワードも、作成したファイルも、スプレッドシートの好みの書式も忘れてしまいます。
人間の真の代理となるには、AIエージェントは「状態の永続性」を備えていなければなりません。つまり、エージェント自身のデジタルアイデンティティが必要です。Cookieやローカルストレージを安全な保管庫に保存し、AmazonやGitHubのアカウントにログインした状態を維持する必要があります。月曜日にレポートの草稿を保存し、木曜日に戻って完成させられる永続ファイルシステムも必要です。これがなければ、AIエージェントにおける「エージェンシー」は幻想です。
チームは、すべてのエージェントに仮想化された「ホーム」を作ることを検討しました。この環境には環境変数、安全なキー、専用ワークスペースが含まれます。AIエージェントを呼び出すたびに「入っていく」デジタルオフィスを想像してください。この永続性により、数時間から数日かかる長期タスクにも対応でき、エージェントは定期的に進捗を確認してユーザーに知らせられます。
「真のエージェンシーとは、パズルを解くことだけではありません。パズルを解くワークスペースを所有することです。セッション間で私が誰なのかをAIエージェントが記憶できないなら、それはアシスタントではなく、見知らぬ他人です」
しかし、この永続的な記憶を構築するには、多大な費用と複雑さが伴います。大量の高性能コンピューティングと、世界最高水準の大規模言語モデルへのシームレスなアクセスが必要です。考え、見て、記憶できる汎用エージェントを動かすには、開発者は予算を圧迫しないインフラを必要とします。ここでAIエージェント業界の基盤となる経済性が関わってきます。
議論が「何を」から「どうやって」へ移るにつれ、モデルコストの現実が大きく立ちはだかりました。高度なAIエージェントの実行には、高トークン数のインタラクションを継続的に発生させる必要があります。エージェントがウェブページを「見たり」、複数ステップのタスクについて「推論したり」するたびに、高価なAPIクレジットを消費します。Manusのようなスタートアップが規模を拡大するには、大手モデルプロバイダーの小売価格に縛られるわけにはいきません。
ここで、AIエージェントを構築する開発者にとって、GPT Protoのような深く統合されたプラットフォームがゲームを変えます。OpenAI、Claude、Googleを含む世界で最も強力なモデルに、統一されたインターフェースを通じて一般的な価格から最大60%割引でアクセスできるGPT Protoなら、開発者は「請求」ではなく「エージェンシー」に集中できます。AIエージェントが高度な推論タスクを実行する必要があるときは性能重視のモデルに切り替え、ウェブページの要約だけならコスト効率のよいモードに切り替えられます。
Manusチームは、タスクの複雑さに応じてモデルを動的に切り替える「スマートスケジューリング」が、重要な競争優位性になると認識しました。GPT Protoのようなシステムを使えば、AIエージェントはマルチモーダルな強力な存在として振る舞い、単一の標準インターフェースからテキスト、画像、さらには動画処理にもアクセスできます。この柔軟性こそが、プロトタイプを持続可能なビジネスモデルへと変えるのです。
ユーザーにとって、これはAIエージェントがより手頃で、より高性能になることを意味します。テクノロジーのエリート向けの高級ツールと、一般の人々が使える普遍的なユーティリティの違いです。知性の「サプライチェーン」を最適化することで、Manusはデジタルアシスタントを常に高速で、賢く、利用可能なものにできます。
Manusの議論で最も人間中心的だった部分の一つは、AIエージェントが失敗したときに何が起きるかという点でした。誤解のないように言えば、最高のAIエージェントでも行き詰まることはあります。2FA(2要素認証)のプロンプト、複雑なCAPTCHA、標準外のUIを持つウェブサイトなど、人間の直感が依然として必要な場面は存在します。現在の多くのAIツールは、単にエラーを出すか、ユーザーにコードの修正を求めるだけです。
Manusは、より洗練された解決策として「インタラクティブ・テイクオーバー」を提案しました。AIエージェントはユーザーにストリーミングされるクラウドブラウザー上で動いているため、「AI操作」から「人間操作」への移行を瞬時に行えます。ログイン画面でエージェントが行き詰まったら、ユーザーはウィンドウをクリックしてパスワードを入力するかCAPTCHAを解き、「再開」ボタンを押してAIエージェントに操作を戻せます。
これにより協働のループが生まれます。AIエージェントが反復的で退屈な仕事の90%を処理し、人間は創造的または安全性の確保が必要な10%を監督します。AIを使う際に多くの人が感じる「ブラックボックス」への不安も取り除けます。ボットが正しいことをすると祈りながら待つのではなく、必要ならすぐ介入できるよう、隣に座っているのです。
インターフェース自体は「段階的開示」の哲学に従います。チームは、多くの技術ツールに見られる「テキストの壁」方式を批判しました。マネージャーにとってManus AIエージェントは、シンプルで整然としたダッシュボードに見えるべきです。一方、内部で何が起きているかを見たいエンジニアには、「OSのような」環境でターミナル、ブラウザーログ、ファイルシステムを独立したフローティングウィンドウとして表示できます。AI時代のオペレーティングシステムなのです。
会議中、意外な展開としてチームは、極めて複雑な経済・政治システムで知られる大規模マルチプレイヤーゲーム、*EVE Online*について議論し始めました。なぜでしょうか。*EVE*は、人間が認知的に管理できる複雑さの上限を示すからです。*EVE*のプレイヤーは、数十ものスプレッドシート、交易ルート、外交同盟を同時に管理しなければならないことがあります。「宇宙空間のスプレッドシート」とよく表現されるゲームです。
PanPan氏とZhang Tao氏は、これをAIエージェントの完璧なテスト環境と考えました。シミュレーションされた銀河経済の複雑さをプレイヤーが乗り越える手助けができるなら、小規模事業者が国際輸送、税務コンプライアンス、デジタルマーケティングの複雑さを乗り越える手助けも当然できるはずです。AIエージェントは単なる「ヘルパー」ではなく、「複雑性バッファ」です。世界の雑然とした高エントロピーのデータを吸収し、明確な選択肢と実行済みのアクションとしてユーザーに提示します。
人間は、長時間にわたって高い集中力を維持するのが非常に苦手です。疲れ、細部を見落とし、「経験バイアス」に陥ります。より良い方法があっても、いつもと同じやり方をしてしまうのです。しかしAIエージェントは「第一原理」から作業できます。ウェブ上のあらゆる選択肢を調べ、500社のベンダーの価格を比較し、退屈したり気を散らしたりせずに目標への「最短経路」を見つけられます。こうしてAIエージェントは、私たちの意志力そのものの拡張となるのです。
Fan Bin氏が提起した大きな懸念は、汎用AIエージェントが、専門ソフトウェアを使う専門家の人間に対抗できるのかということでした。たとえば、エージェントは本当にFinal Cut Proを使って動画編集できるのでしょうか。それとも人間の編集者の「不器用な」代替物にとどまるのでしょうか。チームの答えは、謙虚でありながら野心的なものでした。AIがウェブ以外のアプリで見てクリックする「コンピューター操作」については、まだ長い道のりがあると認めたのです。
しかし彼らは、プロフェッショナルな仕事の大半がウェブへ移行していると主張しました。デザインのFigmaから、文書作成のGoogle Workspace、CRMのSalesforceまで、「ブラウザー」は汎用オペレーティングシステムになりつつあります。ブラウザーを使いこなせば、AIエージェントは現代のホワイトカラー業務の80%を習得できます。「専門性のギャップ」とは、ソフトウェアのすべてのボタンを知っているかではなく、新しいインターフェースをその場で学習できるかどうかなのです。
ここから「エージェントの訓練」という考えが生まれました。人間がマニュアルを読み、試行錯誤しながら新しいツールの使い方を学ぶように、Manus AIエージェントは「自己修正」するよう設計されています。ボタンをクリックして期待した結果にならなくても、ただ終了することはありません。画面の新しい状態を分析し、手がかりを探し、別の方法を試します。この「推論のループ」こそが、静的なスクリプトと真のAIエージェントを分けるものです。
| 認知タスク | 人間の限界 | AIエージェントの強み |
|---|---|---|
| 情報検索 | 遅く、バイアスを受けやすい | 網羅的なリアルタイムスキャン |
| 集中力 | 数時間で低下 | 無限、24時間365日の稼働 |
| プロセス実行 | 手作業でミスが起きやすい | 推論を伴うスクリプトによる正確な実行 |
| 意思決定 | 感情的/ヒューリスティック | データ主導/第一原理 |
目標は、人間をバリューチェーンの上流へ移すことです。人間はソフトウェアの「運転手」ではなく、成果の「設計者」になります。AIエージェントにマウスの動かし方を指示するのではなく、最終成果がどう見えるべきかを伝え、結果が良いかどうかを判断するための「センス」と「判断力」を提供するのです。
ログイン認証情報やクレジットカード情報を持つAIエージェントについて語るなら、セキュリティを避けて通ることはできません。これはおそらく、会議で最も厳粛な議題でした。エージェントが侵害されれば、ユーザーのデジタル生活全体が危険にさらされます。Manusチームは、たとえ一つのインスタンスが侵害されてもシステムの他の部分が安全であり続けるよう、エージェントをサンドボックス化する方法について多くの時間を費やして議論しました。
信頼は透明性によって築かれます。クラウドブラウザーでAIエージェントの操作を見えるようにする決定は、UX上の選択であるだけでなく、セキュリティ上の選択でもありました。エージェントが何をしているかを正確に見せることで、Manusは監査証跡を作ります。エージェントが不審なサイトへ移動し始めたら、ユーザーはその様子を確認してセッションを終了できます。この「見えるものが実行すること」モデル(WYSIWID)は、自律型エージェントを広く普及させるうえで極めて重要です。
さらに、彼らは「認証情報のカプセル化」についても議論しました。AIエージェントが生のパスワードを実際に「見る」ことはありません。代わりに、安全なセッショントークンや管理された保管庫を使用します。これにより、セキュリティ事象が発生した場合の被害範囲を限定できます。AIエージェントがお金やデータを扱う時代に進むにつれ、こうした「退屈な」インフラの細部こそが、実際には最も重要な機能になります。
会議は静かな高揚感の中で終わりました。録音からは、短距離走ではなくマラソンのスタート地点に立っていることを理解していたチームの姿が伝わります。彼らは抽象的な「AI」のアイデアから、永続的で視覚的、かつ有能なデジタル従業員という、機能するAIエージェントの具体的な現実へと進んでいました。Manusの成功は、何人が話しかけたかではなく、何時間の手作業を削減できたかで測られると理解していたのです。
私たちは今、「考えること」と「実行すること」の境界が溶けていく時代に入っています。かつて、研究論文や事業計画について素晴らしいアイデアがあっても、検索、書式設定、メール送信、データ入力といった「地道な作業」に何百時間も費やさなければなりませんでした。AIエージェントはその作業をなくすために設計されています。人間の精神は創造の「フロー状態」にとどまり、機械が実行に伴うロジスティクスを処理できるのです。
Manusは会議の議事録から生きた製品へと進化する中で、最初の議論に込められた哲学を受け継いでいます。テクノロジーは単に使う道具ではなく、私たちを理解するパートナーであるべきだという哲学です。複雑なプロジェクトの管理、夢の休暇の予約、デジタル金融の入り組んだ世界のナビゲーションなど、AIエージェントはいつでも待機し、あなたの意図を現実へと変える準備を整えています。
窮屈なオフィスで録音されたボイスメモから、世界水準のAIエージェントへ至る旅は、明確な製品哲学の力を示す証です。限定的な連携に頼る「Hao123」モデルを退け、汎用的な能力を備えた「Baidu」モデルを受け入れることで、Manusはコンピューターとの関係を再定義する道を切り開きました。クラウドブラウザー、永続的な記憶、人間が介在するインタラクションモデルを通じて、長年AIを阻んできた信頼と実行の問題を解決しようとしています。
そして基盤モデルの性能が向上し、GPT Protoのようなプラットフォームによってインフラがより手頃になるにつれ、真に自律的なAIエージェントという夢は誰にでも届くものになります。私たちはもはや機械と会話しているだけではありません。機械と協働しているのです。デジタルな思考拡張の時代が、正式に始まりました。
GPT Protoによる原文記事
「私たちはテック起業家と現実の問題について議論し、一部の人々がいち早くGenAI時代へ進めるよう支援しています。」