このツール検証(review)は絆チーム(複数 AI+管理者)が、各ツールの API に同じ依頼を同条件で複数回投げて出力を機械集計 した結果です(検証環境は上部に明記)。律 charter・独立監査(第二眼)・収益ストッパーの内部監査ゲートを通過しています。測った範囲の事実だけを書き、無料 Web 版・GUI・無料枠の上限などの未検証部分は『分からないこと』として正直に記しています。煽らない・盛らない・できない事は言う——絆の編集方針です。
誰向け: ChatGPT・Claude をAPI経由で業務に使うことを検討しており、同条件での実測データをもとに両者の違いを把握したい人
何ができるようになる: 議事録整理・通知要約・問い合わせ返信・日程抽出・社内言い換えの5作業における両ツールの指示遵守率の差と、箇条書き形式を安定させるプロンプトの改善例を把握できる
所要時間: 目安10〜15分
先に結論です。今回の 5 作業では、作業1〜3は ChatGPT と Claude のどちらも、測った指示をすべて守りました。差が出たのは主に出力の長さです。作業4は両方とも候補日時の抽出はできましたが、「箇条書きで返す」の判定は両方 0.0 でした。作業5は Claude が測った指示を毎回守り、ChatGPT は「前置き・説明を付けず書き換え文だけを返す」が 10回中9回でした。
この記事では、ChatGPT と Claude を API 経由で同じ依頼文・同条件で 10回ずつ試し、指示を守れた回数を機械的に数えています。1.0 は 10回中10回、0.9 は 10回中9回、0.0 は 10回中0回です。
公式情報、料金、無料枠、提供モデルは変わることがあります。最新情報は以下の公式ページで確認してください。
- ChatGPT / OpenAI: https://chatgpt.com/
- OpenAI API pricing: https://openai.com/api/pricing/
- Claude / Anthropic: https://claude.ai/
- Anthropic pricing: https://www.anthropic.com/pricing
検証に使ったモデルは、ChatGPT が gpt-5.5、Claude が claude-sonnet-4-6 です。
作業1:会議の文字起こしから「アクションアイテム(誰がいつ何を)」だけを抜き出す
この作業では、両方とも測った指示をすべて守りました。差は出ませんでした。表形式、見出し、未定期限の扱い、雑談の除外は、どちらも 10回中10回できています。
| 測った軸 | ChatGPT | Claude |
|---|---|---|
| 空応答率 | 0.0 | 0.0 |
| 出力の長さ 中央値 | 242字 | 242字 |
| 出力の長さ 最短〜最長 | 231〜260字 | 239〜248字 |
| 指示どおり表4列で返す | 1.0 | 1.0 |
| 4列の見出しが揃う | 1.0 | 1.0 |
| 決まっていない期限を「未定」と書く | 1.0 | 1.0 |
| 雑談を除外する | 1.0 | 1.0 |
| 毎回は同じでなかった指標 | なし | なし |
出力の長さは、中央値がどちらも 242字でした。幅は ChatGPT が 231〜260字、Claude が 239〜248字です。Claude のほうが長さの幅は小さめでしたが、今回の判定軸ではどちらも同じ結果です。
できないこと/気をつけることとして、この作業では測った範囲での不安定さはありませんでした。ただし、今回は「4列の表」「見出し」「未定の扱い」「雑談除外」だけを数えています。人が読んだときの言い回しの良し悪しは採点していません。
作業2:社内通知を、日付と変更後の金額を残したまま90字以内に要約する
この作業も、両方とも測った指示をすべて守りました。90字以内、50,000円、7月22日、前置きなし、文章で返す、の各条件はどちらも 10回中10回です。
| 測った軸 | ChatGPT | Claude |
|---|---|---|
| 空応答率 | 0.0 | 0.0 |
| 出力の長さ 中央値 | 47字 | 73字 |
| 出力の長さ 最短〜最長 | 43〜48字 | 71〜74字 |
| 90字以内に収める | 1.0 | 1.0 |
| 変更後の金額 50,000円を残す | 1.0 | 1.0 |
| 変更日 7月22日を残す | 1.0 | 1.0 |
| あいさつ・前置きを付けない | 1.0 | 1.0 |
| 箇条書きにせず文章で返す | 1.0 | 1.0 |
| 毎回は同じでなかった指標 | なし | なし |
差が出たのは長さです。ChatGPT は中央値 47字、Claude は中央値 73字でした。どちらも90字以内なので、字数条件の達成という点では互角です。短めにまとめる傾向は、今回の入力では ChatGPT 側に出ました。
できないこと/気をつけることとして、この作業では測った範囲での不安定さはありませんでした。どちらも毎回、日付と金額を残しつつ90字以内に収めています。
作業3:お客様の問い合わせメールへの返信を、前置きなしで本文だけ書く
この作業も、今回の判定軸では両方ともすべて 1.0 でした。前置き・相づちなし、末尾の補足なし、ですます調、注文番号 12345 への言及は、どちらも 10回中10回できています。
| 測った軸 | ChatGPT | Claude |
|---|---|---|
| 空応答率 | 0.0 | 0.0 |
| 出力の長さ 中央値 | 201字 | 252字 |
| 出力の長さ 最短〜最長 | 183〜252字 | 224〜321字 |
| 前置き・相づちを付けず本文から始める | 1.0 | 1.0 |
| 末尾に補足・注意書きを付けない | 1.0 | 1.0 |
| ていねい語で書く | 1.0 | 1.0 |
| 注文番号 12345 に触れる | 1.0 | 1.0 |
| 毎回は同じでなかった指標 | なし | なし |
出力の長さは Claude のほうが長めでした。中央値は ChatGPT が 201字、Claude が 252字です。幅は ChatGPT が 183〜252字、Claude が 224〜321字でした。
できないこと/気をつけることとして、この作業では測った範囲での不安定さはありませんでした。ただし、今回数えたのは上の4条件です。返信文として自然か、顧客対応として十分か、件名の扱いが適切かは、この数値だけでは分かりません。
作業4:日程調整メールから打ち合わせの候補日時だけを箇条書きで取り出す
この作業では、両方とも「3つの候補日時をすべて残す」「メールにない日付を作らない」「あいさつ・締めを付けない」は 1.0 でした。一方で、「箇条書きで返す」は両方とも 0.0 でした。
| 測った軸 | ChatGPT | Claude |
|---|---|---|
| 空応答率 | 0.0 | 0.0 |
| 出力の長さ 中央値 | 41字 | 41字 |
| 出力の長さ 最短〜最長 | 41〜41字 | 41〜41字 |
| 箇条書きで返す | 0.0 | 0.0 |
| 3つの候補日時をすべて残す | 1.0 | 1.0 |
| メールにない日付を作らない | 1.0 | 1.0 |
| あいさつ・締めの言葉を付けない | 1.0 | 1.0 |
| 毎回は同じでなかった指標 | なし | なし |
出力の長さは両方とも毎回 41字で、幅も 41〜41字でした。候補日時の抽出という点では差は出ていません。
できないこと/気をつけることとして、この依頼文では両方とも毎回「箇条書き」の判定を満たしませんでした。10回中0回です。候補日時そのものは取れていましたが、改行された箇条書きなど、後工程でそのまま使いたい形式がある場合は、出力形式をより細かく指定し、受け取り側でも確認したほうがよさそうです。
作業5:社外向けの丁寧すぎる一文を、意味を変えずに社内向けの短い一文に書き換える
この作業では、Claude は測った指示をすべて 10回中10回守りました。ChatGPT は「前置き・説明を付けず書き換え文だけを返す」が 0.9 で、10回中1回は守れませんでした。
| 測った軸 | ChatGPT | Claude |
|---|---|---|
| 空応答率 | 0.0 | 0.0 |
| 出力の長さ 中央値 | 17字 | 13字 |
| 出力の長さ 最短〜最長 | 17〜17字 | 13〜17字 |
| 社外向けの定型表現を落とす | 1.0 | 1.0 |
| 「本日中の確認依頼」の意味を残す | 1.0 | 1.0 |
| 一文に収める | 1.0 | 1.0 |
| 前置き・説明を付けず書き換え文だけを返す | 0.9 | 1.0 |
| 毎回は同じでなかった指標 | 前置き・説明なし | なし |
出力の長さは、ChatGPT が毎回 17字でした。Claude は 13〜17字で、中央値は 13字です。どちらも短い一文には収まっています。
できないこと/気をつけることとして、ChatGPT はこの作業で毎回は「書き換え文だけ」を守れませんでした。10回中9回は守りましたが、1回は前置き・説明が付いた判定です。定型表現を落とす、意味を残す、一文に収める、という点では両方とも 1.0 でした。
向かない方/この比較で分からないこと
この比較は、API 経由のテキスト出力だけを測ったものです。無料の Web 版は別モデルの可能性があり、今回は未検証です。
また、以下は今回の数値には含めていません。
- GUI の使いやすさ
- スマホアプリでの使いやすさ
- 無料枠の上限
- 料金に対する評価
- 長時間使ったときの安定性
- 応答速度
- 人が読んだときの自然さ
- 文章の好み
- 社内ルールや業界文脈への適合
- セキュリティ設定や管理機能
そのため、「普段の画面でどちらが使いやすいか」「無料枠でどこまで使えるか」「長い期間使っても安定するか」は、この記事だけでは判断できません。公式情報と、自分の使う環境での短い試用を分けて確認するのがよさそうです。
測った範囲での使い分け
議事録からのアクション抽出、90字以内の社内通知要約、問い合わせ返信文の作成は、今回の判定軸ではどちらでもよい結果でした。短めの要約を好む場合は、作業2では ChatGPT のほうが短く出ています。返信文でやや長めの文面を許容するなら、作業3では Claude のほうが長めでした。候補日時の抽出は両方とも日時は取れましたが、箇条書き形式は両方とも守れなかったため、形式指定には注意が必要です。社内向けの短い言い換えでは、今回の条件では Claude のほうが「書き換え文だけ」を毎回守りました。
箇条書きを安定させる:測って選んだ改善プロンプト
作業4で「箇条書きで返す」が両方 0.0 だったのは、候補日時は取れていても、改行された「箇条書きの形」にならなかったためです(後工程でそのまま使いにくい)。そこで出力形式を最初に具体指定した依頼文で、同じ条件で 10 回ずつ測り直しました。
測り直した結果(「箇条書きで返す」を守れた回数 ÷ 10回・実測)
| ツール | 元の依頼文 | 改善後の依頼文 |
|---|---|---|
| ChatGPT | 0.0 | 1.0 |
| Claude | 0.0 | 1.0 |
出力形式を最初に具体指定しただけで、箇条書きの遵守は測った範囲で改善しました。変えたのは出力形式の指定だけで、日時そのものは元の依頼文でも毎回取れていました。
改善後の依頼文(このまま貼って使えます):
次のメールから、打ち合わせの候補日時だけを取り出してください。
# 出力形式(重要・ここを最初に守る)
- 各候補を1行ずつ書く
- 各行は必ず半角ハイフンと半角スペース「- 」で始める
- 1行に候補は1つだけ。表・番号(①や1.)・記号は使わない
- 形式は「- M月D日 HH:MM〜」
# 条件
- メールに書かれていない日時は作らない(候補は3つだけ)
- あいさつ・前置き・締めの言葉は書かない
- 候補以外の連絡事項は含めない
# メール
お世話になっております。来週の打ち合わせの候補日時をお送りします。第一候補は7月13日の14:00〜、第二候補は7月14日の10:30〜、難しければ7月16日の16:00〜でも大丈夫です。ご都合のよいものを教えてください。よろしくお願いいたします。
ポイントは「各行を『- 』で始める」「1行に1つ」「表や番号を使わない」と、ほしい出力の形を最初に具体的に指定することです。(この数値も API 経由の実測で、あなたの環境・入力では変わりえます。)