GPT‑6 Astraのコンピューター操作が転換:クリックよりコード実行を推奨する理由

Astraはマウス操作を一つずつ返すだけでなく、PlaywrightやPyAutoGUIのコードで反復・条件付きUI作業をまとめて実行できます。

画面を見るモデルから操作手順を書くモデルへ

OpenAIのGPT‑6 Astra向けガイドは、ブラウザーとデスクトップ操作を二つに分けます。モデルがPlaywrightやPyAutoGUIのコードを書き、アプリケーションが実行するコード実行型と、構造化されたマウス・キーボード操作を返すcomputer tool型です。両方を利用できますが、Astraではコード実行が推奨されています。

コードなら複数操作、反復、条件分岐を一回の呼び出しにまとめられます。同じ形式の項目を巡回し、要素が現れた時だけ進み、完了状態を確認するブラウザーテストに向いています。

モデルがPCを所有するわけではない

実行するのは開発者のアプリケーションです。隔離したブラウザーやデスクトップを用意し、生成コードを実行してスクリーンショットや結果を返します。セッションを維持すれば前の状態を引き継げます。既存の関数呼び出しやMCPのUIツールも継続利用できます。

つまりアクセス可能なアカウント、ネットワーク、権限、実行上限は統合側が決めます。「Astraが利用者のPCを自由に操作する」という意味ではありません。

革新は作業単位の変化

コード実行は操作のまとまりと検証を表現しやすい一方、安全を自動保証しません。サイトと機能を許可リスト化し、時間と手数を制限し、短い操作ごとに画面と実状態を確認する必要があります。決済、送信、削除には人の承認が必要です。

GUIエージェントは「次の座標を選ぶモデル」から「観察し、小さなプログラムを書き、結果を検証する実行エージェント」へ広がりました。評価では完了率、誤変更、復旧性、承認回数、総費用を測るべきです。

公式資料