各AIのオートメーション比較――Codex・Claude・Cursor・Grok Botは何が違う?

最近、AIは「質問すると答えてくれるもの」から、「決められた時刻や条件になると、自分から仕事を始めるもの」へ急速に変わってきた。OpenAIのChatGPTやCodex、AnthropicのClaude Code、CursorのCloud AgentsやAutomations、さらにGrok BotとRoutinesなど、各社から次々と自動化機能が登場しており、どのような使い分けが可能なのか分かりにくくなっている。

「オートメーション」と呼ばれているものも下記のように色々な種類があり能力が大きく違う。

  • 毎朝ニュースを調べるだけのもの
  • GitHubの変更をきっかけにコードを修正するもの
  • 自分のMacのファイルを直接編集するもの
  • ブラウザやアプリを人間のように操作するもの
  • 複数のAIエージェントが役割分担するもの

そこで本記事では、2026年9月時点の主なAIオートメーションを整理し、「高難度・自律実行型」と、「定型・監視型」の2つに分けて比較した。なお、本記事では主に各社の公式仕様を基に比較しているが、実際の利用枠消費、実行時刻の精度、Computer Useの安定性などについては、今後共通条件で実機検証する必要がある。


注)本記事の内容は正確性を保証するものではありません。

(2026年9月26日 追記)YouTube動画を追加しました。 https://youtu.be/kSB2ejsj-Kg

目次

AIオートメーションは「モデル名」だけでは比較できない

GPT、Claude、Grokなどというモデル名だけを比較しても、オートメーションの違いは分かりません。

重要なのは、AIモデルそのものではなく、そのモデルをどのような「実行環境」に載せているかである。

例えば同じ高性能モデルを使っていても、

  • クラウド上だけで動く
  • 自分のMac上でコマンドを実行できる
  • ブラウザを操作できる
  • GUIアプリまで操作できる
  • 毎朝自動起動できる
  • SlackやGitHubをきっかけに起動できる

などの違いがある。

この記事では、モデル性能だけでなく、トリガー → 実行場所 → ファイル操作 → Computer Use → リモート操作 → 結果保存という一連の仕組みを「AIオートメーション」として比較する。

今回比較するAIサービス

大きく分けると、次の系統がある。

系統主な製品・機能
OpenAIChatGPT Scheduled Tasks、Work、Codex、Codex Automations、Computer Use
AnthropicClaude Code、Claude Tag、Claude Agent SDK、Computer Use
CursorCloud Agents、Automations、My Machines、Projects
Grok系Grok Bot、Skills、Routines、Computer

会社関係については少し注意が必要。Cursorを開発してきたAnysphereは、2026年8月14日にSpaceXによる買収完了を発表し、現在はCursorとGrok系サービスの関係が以前より近くなっており、Grok Botも有料Cursor個人プランなどから利用できます。そのためこの記事では、企業名だけで無理に分類するのではなく、利用者から見た「製品・サービス系統」単位で整理します。

ChatGPT Scheduled Tasks
Codex Automations
Cursor Automations(未使用)
Botに設定されたGrok系 Routines

オートメーション処理に利用できる“AI実行エンジン”として、「Grok Build CLI」というものがあるようだが、これは、「オートメーションそのもの」というより、オートメーションから呼び出せるものであり、launchdなどの、呼び出すきっかけとなるものが別途必要なので、このような構成は本記事では取り上げていない。

オートメーションを2種類に分けて考える

比較対象が多いため、この記事ではAIオートメーションを2つに分類している。

高難度・自律実行型

複数の作業をAI自身が判断しながら進めるもので、例えば、「プログラムを調査し、不具合を直し、テストして、結果を報告する」といった処理である。

目安として、

  1. 複数ステップを自分で判断する
  2. ファイル・コード・Terminal・GUIなどを変更する
  3. 長時間にわたり検証や修正を繰り返す

このうち複数に該当するものを「高難度・自律実行型」とする。

定型・監視型

こちらは、

「毎朝8時にニュースを調べる」

「特定のメールが来たら確認する」

「毎日レポートを作る」

など、処理内容が比較的明確なもの。

処理の流れは主に、取得 → 判断 → 要約 → 保存・通知となる。

高性能モデルを長時間動かすことより、安定して繰り返し実行できることの方が重要である。

比較表① 高難度・自律実行型AIエージェント

サービス実行場所自動実行ローカルファイルTerminalComputer Useリモート利用主な用途
Codex / Automationsローカル+クラウド◎◎◎◎◎開発、ファイル処理、ローカル作業
ChatGPT Workクラウド中心◎条件付き―~○◎◎調査、Web、アプリ連携、成果物作成
Claude Codeローカル中心構成による◎◎構成による△開発、ローカルファイル、MCP
Claude Tagクラウド◎接続先による接続先による構成による◎Slack、チーム業務、長時間タスク
Cursor Cloud Agents / AutomationsクラウドVM◎クラウド環境◎◎◎開発、GitHub、CI、自動修正
Cursor My Machinesクラウド+自分のPC○~◎◎◎◎◎Mac、ローカル環境、GUI操作
Cursor Projectsクラウド中心◎環境による◎環境による◎大規模・長期開発、複数Agent
Grok Bot / RoutinesクラウドComputer+ローカル対応◎○~◎◎◎◎継続業務、監視、Web、複数Bot

※この表は2026年9月時点の公式仕様を基にした。実動作の安定性や制限は実機確認が必要。

Codex

現在のCodexは単なるコーディング支援ではなく、コンピューター操作、アプリ、ブラウザ、ファイル、Terminalなどを組み合わせて処理するエージェントへ拡張されている。Automationsによって反復処理を任せることもできる。またComputer Useでは、画面を見てクリックや文字入力を行うことができ、対応環境では、スマートフォンなど別端末から処理状況を確認し、途中で指示を追加するリモート利用も可能。

私の場合、Home Assistant、ブログ関連ファイル、Obsidian、3Dプリンタ監視など、ローカル環境を扱う処理が多いため、この「ローカル環境に直接仕事をさせられるか」は重要な比較ポイントである。

Claude Code

Claude Codeも、ローカル環境でファイルを読み、コードを編集し、コマンドを実行する高難度作業向けのAIエージェントで、AnthropicはClaude Codeの基盤となるClaude Agent SDKを提供しており、subagent、background task、pluginなどを組み合わせた長時間の自律処理にも対応している。

そのためClaude Codeは、単体で使うだけでなく、将来的には独自オートメーションを構築する基盤としても比較する必要があります。

Claude Tag

Claude Tagは、ClaudeをSlack上の「チームメンバー」のように参加させる仕組み。

指定されたチャンネルやツール、データ、コードベースへアクセスさせ、@Claudeで仕事を依頼できる。将来実行するタスクを計画することも可能とされている。

Claude Codeが「個人の開発環境で作業するエージェント」に近いのに対し、Claude Tagは「チームの中で継続的に仕事を受け持つAI」に近いと考えると分かりやすそうである。

Cursor Cloud Agents / Automations

Cursor Automationsは、常時稼働するCloud Agentを、

  • スケジュール
  • Slack
  • Linear
  • GitHub
  • PagerDuty
  • Webhook

などから起動できる仕組みである。

さらにAutomationから起動されたCloud AgentではComputer Useが利用でき、ブラウザ操作、スクリーンショット、画面録画などを行える。

コードを変更するだけでなく、「変更したアプリを自分で操作し、動作確認して証拠を残す」ところまで自動化できる。

Cursor My Machines

My Machinesは今回の比較で特に注目したい機能。

Agentの推論や計画はCursorクラウド側で実行しますが、

  • Terminalコマンド
  • ファイル編集
  • ブラウザ操作
  • その他のツール

は自分のMacやPC上で実行できます。

さらにWorkerを–computer-use付きで起動すると、クリック、文字入力、スクリーンショット取得、アプリ操作なども可能になる。

つまり、クラウドAIの頭脳+自分のMacの実行環境というハイブリッド方式である。

「Cursor Cloud Agents / Automations」は、スケジュールによる起動が可能であるが、「Cursor My Machines」は、スケジュールによる起動ができない可能性がある。

Cursor Projects

2026年9月に登場したProjectsも、高難度側に入れておきたい機能である。

Projectsは長期的な作業コンテキストを維持し、多数のsubagentへ仕事を委任し、繰り返し作業を自律的に実行する方向へ進化している。

単一Agentを毎回起動するAutomationとは異なり、「プロジェクトそのものをAIに持たせる」方向の仕組みとして注目されている。

Grok Bot / Routines

Grok Botは、一般的なチャットAIとはかなり考え方が違う。

各Botに役割や継続的なコンテキストを持たせ、クラウド上のComputerを使って、

  • Browser
  • File system
  • Terminal
  • 接続ツール
  • Computer Use

などを利用して作業できます。

Bot同士でメッセージを送り、役割分担したり、作業を引き継いだりすることもでき、さらにRoutineを設定すると、スケジュールまたは対応イベントをきっかけとして、Botに繰り返し仕事をさせることができます。ノートPCを閉じていてもクラウド側でRoutineは実行できます。

そのためGrok Botは、「その都度呼び出すAI」より「担当業務を持たせておくAI」に近い位置づけだと考えています。


下記の記事でも紹介したように、Grok Botで、ニュース配信のための複数のBotを設定しているが、現在の設定では、あまり、ニュースが配信されてこないため、Bot「Automation Watchdog」に稼働状況について質問したところ、「各Botは正常に動作しています」との回答があった。調べてみると、ニュースは取得しているが、報告するほどのニュースはないのでSlackにも通知していないということだった。ニュースの質についての敷居を高く設定してしまっているかもしれない。

複数Botとの個別のチャット画面

比較表② 定型・監視型AIオートメーション

次は、高度なコード編集やGUI操作より、定期実行や監視を重視する用途向けのサービスである。

サービス時刻指定定期実行イベント起動PC停止中主な用途コスト検証
ChatGPT Scheduled Tasks◎◎○◎ニュース、監視、通知今後
ChatGPT Work Scheduled Tasks◎◎◎◎Gmail・Slack・GitHub連携今後
Claude系自動処理構成による構成による構成による構成による定期分析・処理今後
Cursor Automations◎◎◎◎GitHub、CI、監視今後
Grok Bot Routines◎◎◎◎ニュース、定期処理、監視今後

ChatGPT Scheduled Tasks

ChatGPTのScheduled Tasksでは、

  • 1回限り
  • 定期実行
  • 変更監視

などを設定できる。

対象となる有料プランでは、1時間単位の定期実行や正確な時刻指定にも対応している。

これは、

「毎朝AIニュースをまとめる」

「特定の情報が変わったら知らせる」

といった用途に向いています。

ChatGPT Workのイベントトリガー

さらにWorkでは、対応する接続アプリを利用して、

  • Gmailの新着メール
  • Slackの新着メッセージ
  • GitHubのPull Request関連イベント

などをきっかけに処理を開始できる。

これによって、単なる「午前8時になったから実行」だけでなく、「何かが起こったからAIが動く」というイベント型オートメーションが可能になります。

Cursor Automations

Cursor Automationsも定型監視用途に利用できる。

例えば、

  • CIが失敗したら調査
  • PRレビューコメントが付いたら修正
  • GitHub Actions完了後に確認
  • Slackの特定操作をきっかけに実行

といった使い方である。

高難度作業にも使えるが、日常的な開発監視にも向いているため、両方の表に記載している。

Grok Bot Routines

Grok Botでは、一度うまくいった処理をSkillとして保存し、それをRoutineとして定期実行できます。

Routineでは、

  • 実行するBot
  • スケジュール
  • 入力元
  • 出力
  • 承認条件
  • データ取得失敗時の処理

などを定義できる。

「毎日決まった処理をするAI担当者」を作る発想に近い仕組みである。

「ローカル」と「クラウド」は2択ではない

AIオートメーションを調べていて特に重要だと感じるのが、「どこで動くのか」である。

単純に、ローカルかクラウドかという2分類では足りないらしいので次の3つに分類した。

方式概要
クラウド型AIも実行環境もクラウド
ローカル型自分のMacやPCで処理
ハイブリッド型AIの推論はクラウド、実際のツール操作は自分のPC

例えば、Grok Botの通常処理は永続的なクラウドComputer上で実行でき、PCを閉じても継続できます。

一方Cursor My Machinesでは、Agentの頭脳はクラウドですが、コマンドやファイル編集などを自分のPCで行います。

この違いは、

  • NAS
  • Home Assistant
  • ローカルデータベース
  • Obsidian
  • 開発環境
  • LAN内機器

などをAIに扱わせたい場合に非常に重要になります。

これまで、Codexでオートメーションを設定してきたが、クラウドで処理が完結するものは「Cursor Automations」や「Grok Bot Routines」に処理を分散できそうだ。ローカル処理が必要なものは、ローカルを扱えるように設定した「Grok Bot Routines」か「Claude Code」に負荷分散できる可能性がある。スケジュール起動でなければ「Cursor My Machines」という候補もある。

Computer Useは「対応・非対応」だけでは比較できない

最近は多くのAIが「Computer Use対応」をうたっているが、調査すると、能力は同じではないことが分かってきた。

そこで、以降の比較では、Computer Useを次のように分けて評価している。

レベル内容
CU-0GUI操作なし
CU-1Browser中心
CU-2クラウドVMのGUI操作
CU-3自分のMac・PCをGUI操作
CU-4GUI操作+外出先から状態確認・介入

例えばCursor Cloud AgentsではAgent自身の仮想マシンを操作でき、画面や成果物をユーザーが確認できます。

My Machinesでは条件を整えることで、自分のMac上のアプリをAgentが操作できます。

Grok BotもクラウドComputerを持ち、必要なWebサイトやアプリをComputer Useで操作でき、ログインや二要素認証など、人間が操作すべき場面では一時的にユーザーがComputerを引き継ぐ仕組みも用意されている。

「Computer Use対応」という一言だけでは、実際にできることが分からない。

Grok Botの場合、「Computer Use」の「Computer」とはクラウドサーバー上の仮想PCであり、手元のPC(私の場合はMac mini)ではないので注意が必要。chromeにしても、Mac miniのものと仮想PCのものは全く同じというわけではない可能性があるので挙動に違いが出るかもしれない。

リモート操作も重要になってきた

もう一つ今後重要になるのがリモート操作である。

この能力について確認すべき項目としては下記のようなものがある。

  • iPhoneから仕事を開始できるか
  • 実行状況を確認できるか
  • AIからの質問に回答できるか
  • 承認できるか
  • 追加指示できるか
  • 停止できるか
  • Computerの画面を確認できるか

Grok BotはデスクトップとモバイルでBotや会話を同期し、モバイルからRoutineの状況やComputer画面を確認できる。

また、Codexにも対応環境でリモートから進捗確認や介入を行う仕組みがある。Claude CodeやCursor My Machinesも、事前に設定しておけば、リモート操作が可能なようである。
ただし、「Computer Use」の場合と同様に、どのようなリモート操作が可能かについては、個々に確認する必要がある。

今後AIが長時間仕事をするようになるほど、「AIを自宅のMacの前で見張る必要があるのか」は重要な比較項目になる。

コストは月額料金だけでは比較できない

料金については単純に「月額○円」という定額で比較することはできず、下記の内容などを考慮する必要がある。

  • 基本サブスクリプション
  • AIモデルの利用枠
  • 5時間枠
  • 週間枠
  • Automation用の利用量
  • Bot専用利用枠
  • On-Demand課金
  • API料金
  • クラウドComputer
  • 自分のPCを動かす電気代

特に重要なのは、「Automationを動かすと、普段使っているAIの利用枠をどの程度消費するのか」である。

機能が優秀でも、毎日のRoutineを実行するだけで大量の利用枠を消費するのであれば、実運用には向かない場合があるので、別途、オートメーション全体の利用枠消費量を実測する必要がある。

実機で検証すべき項目

この記事では、公式仕様による比較を中心としているが、各AIシステムを評価するためには、例えば、下表のような観点で実機検証することが必要である。

検証項目共通課題・テスト条件主な確認項目評価したいこと
① 定時実行指定時刻になったらニュースを3件取得し、Markdown形式で保存する開始時刻の正確さ/処理時間/ファイル保存の成否/完了通知/利用枠の増加量スケジュール実行の正確さと、日常的な定期処理への適性
② ローカルファイル共通テストフォルダのinput.mdを読み、内容を整理してresult.mdを作成するローカルファイルを直接読み込めるか/新規ファイルを作成できるか/指定場所へ正しく保存できるか自分のMacやPC上のファイルを実際に扱えるか
③ Computer Use同じWebページを使用し、Browser起動 → 指定ページ表示 → 情報確認 → 指定操作 → スクリーンショット保存まで実行するブラウザ起動/ページ認識/クリック・入力/画面遷移/スクリーンショット取得Computer Useがどこまで人間の操作を代行できるか
④ リモート操作AIが処理中の状態でMacから離れ、iPhoneなど別端末から操作する進捗確認/追加指示/承認/停止/再開/画面確認外出先からAIの処理を監視・介入できるか
⑤ 障害時の挙動ファイルなし/Worker停止/権限不足/ネットワーク切断/利用枠不足などを発生させる別手段を勝手に試すか/停止するか/ユーザーへ報告するか/再試行するかエラー時の安全性、報告能力、復旧能力
⑥ 利用枠とコスト同じ処理を単発および数日間の定期実行で行い、開始前後の利用量を記録する5時間枠/週間枠/Bot枠/On-Demand料金/API費用/1回当たり・1日当たりの平均消費量継続運用した場合の実質的なコストと利用枠への影響

実機検証で特に重視したいのは、単に「処理できたか」だけではなく、予定どおり開始するか、途中で問題が起きたときにどう対応するか、外出先から管理できるか、そして継続利用したときにどの程度のコストがかかるかまで含めて確認することである。

実機検証すべき代表的な対象

比較対象は多いが、実機検証する場合、まずは、下記の分類に従ってオートメーションを検討すべき候補を絞ることができる。
ここでは「なぜこの7つを検証対象に選んだのか」や、他のAIを除外した理由も記載した。

選定基準は、似たサービスを全部試すのではなく、実行方式や自動化方式の違いを代表するものを選んだ。

分類検証対象主な特徴検証対象に選んだ理由特に確認したい点
高難度・自律実行型Codexローカル環境、Terminal、ファイル、Computer Useなどを組み合わせ、長時間・複数Agentの処理が可能。
スマートフォンから進捗確認や承認、追加指示もできる。 (OpenAI)
ローカル作業型AIの代表として選定。
コードだけでなく、自分のMac上のファイルやアプリまで扱えるため、他方式との基準点にしやすい。
Computer Use、ローカルファイル、長時間処理、Remote、利用枠消費
高難度・自律実行型Claude CodeTerminal・IDEを中心にコードやファイルを操作。
subagent、hooks、background taskなどを利用して長時間・並列処理も可能。 (Anthropic)
Terminal中心の自律Agentの代表として選定。
Codexと似た用途でも、GUI・Remote・自動化の考え方が異なるため比較価値が高い。
ローカル処理、長時間作業、subagent、障害復旧、Codexとの差
高難度・自律実行型Cursor My MachinesAgentの推論はCursorクラウド、Terminal・ファイル編集・ブラウザ等は自分のMacで実行するハイブリッド方式。--computer-useでMacのGUI操作も可能。 (Cursor)クラウドAI+ローカル実行という独特の方式を代表するため選定。完全ローカル型や完全クラウド型との違いを確認できる。
ただし、時刻起動は不可と思われる。
Mac上での実行、Computer Use、Remote、Worker停止時の挙動、ローカルLAN利用
高難度・自律実行型Grok BotBotごとに役割・記憶を持ち、永続的なクラウドComputerのBrowser、filesystem、Terminalなどを使用。
Bot同士の連携も可能で、PCを閉じても仕事を継続できる。 (Grok API Documentation)
常駐型・Persistent Agentの代表として選定。
毎回Agentを起動する方式ではなく、「担当業務を持つAI」という違いを比較できる。
長時間継続、Computer Use、Bot間連携、承認、クラウド環境、利用枠
定型・監視型ChatGPT Scheduled Tasks1回限り・定期実行・変更監視に対応。
対象プランでは正確な時刻指定や1時間ごとの実行も可能。 (OpenAI Help Center)
最もシンプルなクラウド型定期実行の基準として選定。
高度な開発環境を用意せず、日常的な監視や通知に使えるため比較の基準になる。
時刻精度、監視能力、通知、PC停止中の動作、利用枠
定型・監視型Cursor AutomationsCloud AgentをスケジュールだけでなくGitHub、GitLab、Slack、Linear、Webhook、PagerDutyなどのイベントから起動可能。
Computer Useにも対応。 (Cursor)
イベント駆動型Automationの代表として選定。
単純な時刻指定だけではなく、「何かが起きたらAgentが動く」方式を検証できる。
cron・イベント起動、GitHub/Slack連携、再実行、Computer Use、コスト
定型・監視型Grok Bot Routines一度確立した作業をSkill化し、特定Botにスケジュールまたはイベントで繰り返し実行させる。PCを閉じていてもクラウドで実行可能。 (Grok API Documentation)「常駐Bot+定期処理」の代表として選定。Scheduled Tasksのような単純スケジューラーと、担当Botが継続的に仕事を持つ方式の違いを確認できる。定時実行、Skill再利用、失敗時処理、履歴、Botの記憶、利用枠

この7つを選ぶ理由を一言でまとめると、同じようなAIを7種類試すのではなく、「ローカル型」「クラウド型」「ハイブリッド型」「常駐Bot型」「単純スケジュール型」「イベント駆動型」という異なる自動化方式の代表を選んでいるということである。

特に高難度側の4つは、比較すると構造の違いがかなり明確である。
Codex=ローカル作業+Computer Use、Claude Code=Terminal中心、Cursor My Machines=クラウド頭脳+自分のMac、Grok Bot=常駐クラウドComputerという位置づけである。

AIオートメーション選びは「一番賢いAI」を探すことではない

ここまで整理すると、AIオートメーションを選ぶ基準は、モデルのベンチマーク順位だけではないことが分かった。

重要なのは、何をきっかけに動くのか、どこで動くのか、どこまで自分で判断できるのか、ローカル環境を操作できるのか、Computer Useで何を操作できるのか、外出先から管理できるのか、継続的に使ったとき、いくらかかるのかである。

そして現在のAIオートメーションは、大きく、高難度な仕事を丸ごと任せるAIと、毎日・毎時間、決まった仕事を黙々と続けるAIの2方向へ分かれてきている。さらに、クラウド型、ローカル型、クラウド+ローカルのハイブリッド型という違いがあった。

今後、必要に応じて、実機検証を行いながら、「難易度 × 実行場所 × Computer Use × リモート操作 × コスト」という観点から、それぞれのAIオートメーションがどのような仕事に向いているのかを確認していきたい。

目次