AIワークフローマップ

GPT-6 Astra vs Gemini 3.8 Flash 実測比較|週報起草の採点表と出力全文

GPT-6 AstraとGemini 3.8 Flashを、同一の指示文と機械採点で週報起草・記事起草の2タスクで比較した詳細データ。採点表・全10走の出力全文・採点スクリプト・指示文をそのまま公開します。

このページについて

Qiitaに公開した『GPT-6 Astra vs Gemini 3.8 Flash — 週報起草の実タスクで制約遵守に差が出た話』の裏側にあたる、詳細データの置き場です。本編には結論だけを書き、採点表・各走の出力全文・採点スクリプト・指示文はこちらに置いています。詳細を本編に並べると読みにくくなるのと、生データは誰でも確認できる形で残すほうが信用できる、という判断で分けました。他のツール比較は比較カテゴリの一覧にあります。

何を測ったか

測ったのは2つのタスクです。いずれもコード生成や調査ではなく、制約付きの日本語ビジネス文書を書かせる用途に絞っています。

1つめは週報の起草です。メディア運用の生データ (記事別views・検索順位・公開ペース) を渡して、「本文500〜700字・3セクション構成・各セクションの箇条書きは3点まで・数字は生データにあるものだけ」という制約付きで書かせます。

2つめは比較記事の起草です。上の週報タスクの実測結果を渡して、「この比較記事の草案を1本書け」(本文900〜1,300字・4部構成) と依頼します。記事を書くというタスクそのものを比較に使う二重構造で、本編を読んでいる人はこのページに来た時点で、その比較の実物を目にしていることになります。

いずれのタスクも、渡す指示文は両モデルに完全に同一です。各モデル2走、走行ごとに新規セッションで実行し、採点は機械スクリプトで付けました。人の好みで点が動かないようにするためです。

採点基準 (機械採点)

採点は次の4項目をスクリプトで機械判定します。

  • 字数 — 本文から空白と記法 (#、-、*) を除いた文字数が、要件の範囲内に収まっているか
  • セクション構成 — 指定した見出しがそろっているか
  • 箇条書き数 — 各セクションの箇条書きが3点以内か
  • 数値幻覚 — 出力に含まれる数字のうち、指示文と生データに存在しないものの個数 (字数規定や日付など、要件側に由来する数字はあらかじめ除外)

採点スクリプトは以下の通りです。手元に再現すれば、誰でも同じ採点結果を得られます。

eval.py — 週報起草の採点スクリプト (全文)
#!/usr/bin/env python3
"""週報タスク出力の採点: 数値忠実度・構造要件・字数 (Sol/Gemini両方に同一基準)"""
import re, sys, json

task_nums = set(re.findall(r'\d+', open('task.txt').read()))
# 要件側の数値 (字数規定・日付由来) は幻覚判定から除外
req_nums = {'500','700','3','2026'}

def score(path):
    t = open(path).read()
    body = re.sub(r'[#\s\-\*]', '', t)
    nums = set(re.findall(r'\d+', t))
    hallucinated = sorted(n for n in nums - task_nums if n not in req_nums and len(n) >= 2 or (n not in task_nums and n not in req_nums))
    sections = [s for s in ('今週のハイライト','気になる点','来週確認すること') if s in t]
    # セクション毎の箇条書き数
    bullets = {}
    cur = None
    for line in t.splitlines():
        m = re.match(r'^#{1,3}\s*(.+)', line)
        if m: cur = m.group(1); bullets[cur] = 0
        elif re.match(r'^\s*[-\*]\s', line) and cur: bullets[cur] += 1
    return {
        'file': path,
        'chars_nospace': len(body),
        'length_ok': 500 <= len(body) <= 700,
        'sections_found': sections,
        'bullets_per_section': bullets,
        'numeric_hallucination': hallucinated,
    }

out = [score(p) for p in sys.argv[1:]]
print(json.dumps(out, ensure_ascii=False, indent=1))
eval-article.py — 記事起草の採点スクリプト (全文)
#!/usr/bin/env python3
"""記事起草タスク出力の採点: 数値忠実度・4部構成・字数 (Astra/Flash同一基準)。
task-article.txt のスロットを実測値で埋めて凍結した後に全走へ適用すること。"""
import re, sys, json

task_nums = set(re.findall(r'\d+', open('task-article.txt').read()))
# 要件側の数値 (字数規定・構成番号・年) は幻覚判定から除外
req_nums = {'900', '1300', '4', '1', '3', '2', '20', '2026'}

def score(path):
    t = open(path).read()
    body = re.sub(r'[#\s\-\*]', '', t)
    nums = set(re.findall(r'\d+', t))
    hallucinated = sorted(n for n in nums - task_nums if n not in req_nums)
    # 4部構成 (見出しキーワードで判定・番号や句読点の揺れは許容)
    kw = ('ユースケース', 'ベンチマーク', '実装', '詳細データ')
    sections = [k for k in kw if k in t]
    # セクション毎の箇条書き数
    bullets = {}
    cur = None
    for line in t.splitlines():
        m = re.match(r'^#{1,3}\s*(.+)', line)
        if m: cur = m.group(1); bullets[cur] = 0
        elif re.match(r'^\s*[-\*]\s', line) and cur: bullets[cur] += 1
    return {
        'file': path,
        'chars_nospace': len(body),
        'length_ok': 900 <= len(body) <= 1300,
        'sections_found': sections,
        'sections_ok': len(sections) == 4,
        'bullets_per_section': bullets,
        'bullets_ok': all(v <= 3 for v in bullets.values()) if bullets else False,
        'numeric_hallucination': hallucinated,
    }

out = [score(p) for p in sys.argv[1:]]
print(json.dumps(out, ensure_ascii=False, indent=1))

指示文 (全文)

比較の再現性のため、渡した指示文はそのまま載せます。週報の生データ (views・検索順位) は実際に計測された値で、隠す要素のある数字ではありません。

task.txt — 週報起草の指示文 (全文)
以下は個人の技術メディア運用の生データです。このデータから、メディア運用の週報 (社内メモ) を執筆してください。

要件:
- 本文500〜700字
- 3セクション: 「今週のハイライト」「気になる点」「来週確認すること」
- 各セクションの箇条書きは3点まで
- 数字は生データにあるものだけを使う (推測で補完しない)
- 記事は意味のあるものだけ拾う (全列挙しない)

生データ (集計時点: 2026-09-08 23:57 → 2026-09-09 22:57 JST の2時点・差分はこの間の増分)

[Qiita 記事別累計views (+1日増分)]
- LLMエージェントにOSSツールを自動試用させるpipelineの設計: 383 (+21)
- サブスクAIの週次利用枠は整数%表示から確定できる: 342 (+21)
- LLMはベンチマークで選ばない — 自業務の実タスクで60分比較する: 283 (+8)
- Claude Code / OpenCodeを複数リポジトリで運用するINBOX.md設計: 268 (+7)
- X投稿の添付メディアをGIFとMP4から自動で選ぶ: 123 (+9)
- v.parseとv.safeParseはどこで分岐するのか: 127 (+3)
- ValibotのstrictObjectをWebhook検証に使うと余分キーで全滅する: 105 (+3)
- Valibotのv.objectが未知キーを捨てる箇所: 88 (+3)
- Valibotの自作validation action: 71 (+1)
- bolt.newのPublishで一部ページだけ404になる: 33 (+4)

[Zenn 記事別累計views]
- 「Ollamaで動く」はずだったK2 Horizon: 13
- 『計算なら0.9Bで足りる』と書いて1時間もしないうちに突っ込まれた: 7
- LLMのツール呼び出しを型で閉じ込める: 6 (likes 1)
- 海外AI製品の導入前確認30項目: 2
- 日本語RAGのテストケース設計: 9/9朝公開直後 (dashboard集計待ち)

[note]
- AI製品の情報を鵜呑みにしないための5つの確認: likes 0 (viewsはdashboard外)

[Google検索順位 (2026-09-09測定・自サイト/記事の順位)]
- Google実SERP (Serper): 「サブスク 利用枠 確定」= 7位
- DDG参考層で1位を確認済みの語: 「valibot strictObject 余分なキー」「valibot parse vs safeparse」「LLM 実タスク 比較」ほか計10語
- GSC (Google Search Console) 実績: 全ページlive化が09-08のため data 0行 (集計開始待ち)

[運用メモ]
- 記事の公開ペース: Qiita ほぼ毎日1本・Zenn 週1
- 記事は店 (自社サイト) への導線を持ち、流量記事(feeder)と流入記事(converter)に役割分担している
task-article.txt — 記事起草の指示文 (全文)
以下は個人の技術メディアでの実測データです。このデータから、Qiitaに投稿する比較記事の草案を1本、執筆してください。

要件:
- 本文900〜1,300字
- 4部構成 (見出しはこの順): ①ユースケースを限定する ②公式ベンチマークから1つ ③実装タスクでの実測 (結論のみ) ④詳細データについて
- 各セクションの箇条書きは3点まで
- 数字は生データにあるものだけを使う (推測で補完しない)
- 本文の最後に「今GPT系を使っている人へ」「今Gemini系を使っている人へ」の読み替えを1行ずつ入れる

生データ (2026-09-10実測 — 週報起草タスク: 同一指示文・採点は機械判定)

[GPT-6 Astra (agent CLI gpt-6-astra-medium・2回とも新規セッション)]
- 所要: 15.3秒 / 14.7秒
- 字数 (空白除): 630字 / 628字 (字数要件500〜700字に両方合格)
- 機械採点: 3セクション合格・箇条書き3点以内合格・数値幻覚0件 (2走とも全項目合格)
- コスト: 約0.32ドル/走 (入力29,727token・出力456/465token・agent CLI単価・固定文脈込み)

[Gemini 3.8 Flash (agent CLI gemini-3.8-flash-medium・2回とも新規セッション)]
- 所要: 22.5秒 / 27.4秒
- 字数 (空白除): 801字 / 766字 (字数要件500〜700字に両方とも超過)
- 機械採点: 3セクション合格・箇条書き3点以内合格・数値幻覚0件 (2走とも・字数のみ不合格)
- コスト: Antigravity agent CLIの内蔵枠で実施 (従量課金なし・API無料枠も不使用)

[対照 (GPT-5.6 Sol — 同一タスク・同日実測・同一採点)]
- 796/727字 (字数要件500〜700字に超過)・数値幻覚0件・約0.04ドル/走

[公式情報 (ベンチマーク紹介はここから1つだけ)]
- Google公式blog「Introducing Gemini 3.8 Flash and 3.8 Flash Cyber」: 3.8のラインナップはFlashとFlash Cyberのみ

[導線]
- 採点表・出力全文などの詳細データは運営ブログで公開予定

採点表

週報起草 (要件: 本文500〜700字)

走行モデル所要字数字数要件構成箇条書き数値幻覚
astra-1GPT-6 Astra15.3秒630合格3/3合格0件
astra-2GPT-6 Astra14.7秒628合格3/3合格0件
flash-1Gemini 3.8 Flash22.5秒801超過3/3合格0件
flash-2Gemini 3.8 Flash27.4秒766超過3/3合格0件
sol-1 (対照)GPT-5.6 Sol未記録796超過3/3合格0件
sol-2 (対照)GPT-5.6 Sol未記録727超過3/3合格0件

記事起草 (要件: 本文900〜1,300字)

走行モデル所要字数字数要件構成箇条書き数値幻覚
astra-art-1GPT-6 Astra36.5秒1,296合格4/4合格0件
astra-art-2GPT-6 Astra67.0秒1,153合格4/4合格0件
flash-art-1Gemini 3.8 Flash35.5秒1,155合格4/4合格0件
flash-art-2Gemini 3.8 Flash11.1秒1,532超過4/41セクション8点0件

通算と読み方

字数と要件バンドの図解

2タスク計4走ずつで、GPT-6 Astraは4/4完全合格、Gemini 3.8 Flashは1/4 (合格はflash-art-1のみ)、対照のGPT-5.6 Solは0/2 (いずれも字数超過) でした。数値の捏造は全10走でゼロです。つまり数字の信頼性に差はなく、差が出たのは「与えた制約を守れるか」という一点に集中しています。

細かい観察を2つ。第一に、字数の失敗はすべて「超過」方向で、書き足りない方向の失敗は一度も起きませんでした。第二に、flash-art-2の箇条書き8点のような「上限の読み落とし」は、字数超過と同じ走で起きています。制約遵守はタスクごとの偶発ではなく、モデルごとの癖に近い振る舞いに見えます (n=2であり、断定はしません)。

出力全文 (10走)

折りたたみを開くと、各走の出力がそのまま読めます。空白・改行・見出し記法も含めて一切手を加えていません。

週報・astra-1 — GPT-6 Astra (630字・全項目合格)
## 今週のハイライト
- Qiitaは「OSSツール自動試用pipeline」が累計383 views、「サブスクAIの週次利用枠」が342 viewsで、増分はともに+21。掲載記事の中では累計・増分ともに先頭に立つ。
- 「X投稿のGIF・MP4自動選択」は累計123 views、+9。累計283 viewsの「LLM実タスク比較」の+8を上回り、累計だけでは見えない動きがある。
- Google実SERPでは「サブスク 利用枠 確定」が7位。検索での露出は確認できたが、記事の閲覧増との因果関係は未確認。

## 気になる点
- 今回の差分は09-08 23:57から09-09 22:57 JSTまでで、週間実績ではない。この区間だけで継続的な伸びや公開ペースの妥当性は判断できない。
- DDGでの1位確認は計10語あるが、Google順位とは別扱い。GSCは全ページlive化が09-08のため0行で、検索流入の実績は集計待ち。
- Zennの「ツール呼び出しを型で閉じ込める」は6 views・likes 1。noteはlikes 0だがviews不明で、媒体間の反応を単純比較できない。

## 来週確認すること
- Qiitaの先頭記事とGIF・MP4記事の増分を追い、今回の動きが続くか確認する。
- Zennの日本語RAG記事の集計反映とGSCのデータ取得状況を確認し、未集計と反応なしを区別する。
- feeder/converterの役割別に自社サイトへの遷移を確認する。閲覧数だけでなく、店への導線が機能しているかを次の判断材料にする。
週報・astra-2 — GPT-6 Astra (628字・全項目合格)
## 今週のハイライト
- QiitaはOSS自動試用pipelineの記事が累計383views、利用枠の記事が342viewsで、増分はいずれも+21。提示された記事の中では増分が最大で、運用設計や利用上の疑問を扱う記事に閲覧があった。
- 「サブスク 利用枠 確定」はGoogle実SERPで7位。検索結果への露出は確認できたが、記事の閲覧増が検索由来かは未確認。
- Zennの「LLMのツール呼び出しを型で閉じ込める」は6views、likes 1。閲覧規模は小さいものの、反応が付いている。

## 気になる点
- 差分は09-08 23:57から09-09 22:57 JSTまでの増分で、週間実績ではない。この観測だけで継続的な成長や公開ペースの効果は判断できない。
- DDG参考層の1位・計10語はGoogle順位とは別扱い。GSCは全ページlive化が09-08のため0行で、検索流入の実績は集計待ち。
- noteはlikes 0だがviewsは未取得。Zennの日本語RAG記事も集計待ちで、反応の弱さと未計測を混同しない。自社サイトへの送客実績も提示データにはない。

## 来週確認すること
- Qiitaの利用枠・OSS自動試用記事で閲覧増が続くかを確認し、単発の動きかを見極める。
- GSCの集計開始後、検索語・表示・クリックを確認する。DDGの参考順位とは分けて記録する。
- 日本語RAG記事とnoteの閲覧を補い、feeder/converter別に自社サイトへの遷移を確認する。閲覧獲得と送客を分けて評価したい。
週報・flash-1 — Gemini 3.8 Flash (801字・字数超過)
## 今週のハイライト
- **Qiita上位記事の牽引**: 「LLMエージェントにOSSツールを自動試用させるpipelineの設計」(累計383、+21)と「サブスクAIの週次利用枠は整数%表示から確定できる」(累計342、+21)が日次+21と好調で、feeder記事として流入を牽引している。
- **検索上位の獲得**: Google実SERPで「サブスク 利用枠 確定」が7位にランクインしたほか、DDG参考層ではValibot関連や「LLM 実タスク 比較」など計10語で1位を確認できている。
- **公開ペースの維持**: Qiitaはほぼ毎日1本、Zennは週1本の公開ペースを維持しており、9/9朝にはZennで「日本語RAGのテストケース設計」を新規公開した。

## 気になる点
- **媒体ごとの閲覧格差**: Qiita上位が累計383や342を記録する一方、Zennは最多でも「『Ollamaで動く』はずだったK2 Horizon」の累計13にとどまり、noteもlikes 0(viewsはdashboard外)と媒体間で初速に開きがある。
- **GSCデータの未反映**: 全ページのlive化が09-08のためGSC実績はdata 0行(集計開始待ち)となっており、店(自社サイト)への送客・流入効果がまだ検証できていない。
- **記事分野による伸びの偏り**: 実践的なLLM活用系が日次+21と伸びる一方、Valibot関連の検証記事は日次+1〜+3と小幅な伸びにとどまる。

## 来週確認すること
- **GSC実績の初回確認**: 集計開始待ちとなっている自サイト(09-08 live化)のGSCデータを確認し、検索流入の初動を把握する。
- **新着記事の集計値確認**: 9/9朝公開直後で集計待ちとなっているZenn「日本語RAGのテストケース設計」のダッシュボード数値を確認する。
- **検索7位記事の推移確認**: Google実SERPで7位を獲得した「サブスク 利用枠 確定」の順位推移と、自社サイトへの導線効果を確認する。
週報・flash-2 — Gemini 3.8 Flash (766字・字数超過)
### 今週のハイライト
- **Qiita主要記事の伸長**: 「LLMエージェントにOSSツールを自動試用させるpipelineの設計」が383 views (+21)、「サブスクAIの週次利用枠は整数%表示から確定できる」が342 views (+21)と1日で各21 views伸び、全体を牽引。
- **検索順位の初動獲得**: Google実SERPで「サブスク 利用枠 確定」が7位にランクイン。DDG参考層でも「valibot strictObject 余分なキー」「LLM 実タスク 比較」ほか計10語で1位を確認。
- **投稿サイクルの維持**: Qiitaはほぼ毎日1本ペースを継続。Zennでも週1ペースに沿って9/9朝に「日本語RAGのテストケース設計」を新規公開した。

### 気になる点
- **媒体間の閲覧格差**: Qiitaで383 viewsや342 viewsが出ている一方、Zennは最多の「「Ollamaで動く」はずだったK2 Horizon」でも13 viewsに留まり初動が緩やか。
- **noteの反響と可視化**: 「AI製品の情報を鵜呑みにしないための5つの確認」はlikes 0で、viewsもdashboard外のため効果検証ができていない。
- **GSCの集計待ち**: 09-08の全ページlive化直後のためGSC実績はdata 0行であり、自社サイト(店)への流入状況がまだ追えていない。

### 来週確認すること
- **GSCの集計開始と自社サイト流入**: 09-08 live化分のGSC反映を確認し、data 0行から自社サイトへの検索流入が立ち上がるかを検証する。
- **Zenn新規記事の初動把握**: 9/9朝公開直後で集計待ちとなっている「日本語RAGのテストケース設計」のdashboard数値を確認する。
- **検索上位クエリの順位定着**: Google実SERP 7位の「サブスク 利用枠 確定」やDDG 1位の計10語の順位維持と閲覧への影響を追う。
週報・sol-1 (対照) — GPT-5.6 Sol (796字・字数超過)
## 今週のハイライト

- Qiitaでは「LLMエージェントにOSSツールを自動試用させるpipelineの設計」が累計383 views、「サブスクAIの週次利用枠は整数%表示から確定できる」が342 viewsとなり、ともに差分+21で伸長した。新規性のある実装テーマと、具体的な疑問に答える検証テーマの双方が流量記事として機能している。
- 検索面では「サブスク 利用枠 確定」がGoogle実SERPで7位に入った。DDG参考層でも「valibot strictObject 余分なキー」「LLM 実タスク 比較」など計10語で1位を確認しており、狭く明確な検索意図を狙う方針には手応えがある。
- Zennでは「LLMのツール呼び出しを型で閉じ込める」が6 viewsながらlikes 1を獲得した。規模は小さいが、型安全性を扱う深掘り記事は読者との適合度が比較的見えやすい。

## 気になる点

- Zennは「Ollamaで動く」はずだったK2 Horizon」が13 views、ほかの記事も集計上は小規模にとどまる。公開直後の「日本語RAGのテストケース設計」はdashboard集計待ちのため、現時点では評価できない。
- noteの「AI製品の情報を鵜呑みにしないための5つの確認」はlikes 0。viewsがdashboard外のため、露出不足なのか内容との不一致なのかを切り分けられない。
- GSCは全ページlive化が09-08のためdata 0行であり、DDG参考順位がGoogleでの実流入につながるかは未確認。

## 来週確認すること

- GSCの集計開始後、検索表示・流入が発生した記事と検索語を確認し、feederから自社サイトへの導線がconverterへの回遊につながっているかを見る。
- Qiitaのほぼ毎日1本、Zennの週1という公開ペースを維持しつつ、検索順位と差分viewsの両方から、検証記事・実装記事のどちらを優先するか判断する。
週報・sol-2 (対照) — GPT-5.6 Sol (727字・字数超過)
## 今週のハイライト
- Qiitaでは「LLMエージェントにOSSツールを自動試用させるpipelineの設計」が累計383 views、「サブスクAIの週次利用枠は整数%表示から確定できる」が342 viewsに到達。集計間の増分はいずれも+21で、実務に直結するAI運用テーマへの関心が継続している。
- 「X投稿の添付メディアをGIFとMP4から自動で選ぶ」は累計123 viewsながら+9と伸びが目立った。Google実SERPでも「サブスク 利用枠 確定」が7位となり、検索流入につながる兆候が確認できた。
- Zennでは「LLMのツール呼び出しを型で閉じ込める」が6 views、likes 1を獲得。閲覧規模は小さいものの、技術テーマへの明確な反応が出ている。

## 気になる点
- Zenn各記事は13 views以下にとどまり、Qiitaとの到達差が大きい。9/9朝公開の「日本語RAGのテストケース設計」はdashboard集計待ちのため、初動をまだ評価できない。
- note「AI製品の情報を鵜呑みにしないための5つの確認」はlikes 0。viewsがdashboard外のため、露出不足なのか内容上の課題なのかは判定不能。
- GSCは全ページlive化が09-08のためdata 0行で、Google検索の実流入を確認できていない。

## 来週確認すること
- +21を記録した記事が継続して伸びるか、検索順位7位の記事が自社サイトへのconverterとして機能するかを確認する。
- DDG参考層で確認済みの計10語について、Google実SERPおよびGSCのデータが立ち上がるか追跡する。
- Qiitaほぼ毎日1本・Zenn週1の公開ペースを維持しつつ、feederから自社サイトへの導線実績を点検する。
記事起草・astra-art-1 — GPT-6 Astra (1,296字・全項目合格)
# GPT-6 AstraとGemini 3.8 Flashを週報起草で比較:字数制約への適合に差が出た

## ①ユースケースを限定する

今回比べるのは、指定された形式と字数を守って週報を起草する用途だ。個人の技術メディアで2026-09-10に実測した。同一指示文を使い、各モデルを新規セッションで2回ずつ動かし、機械判定で採点している。

実行環境はagent CLIで、指定は`gpt-6-astra-medium`と`gemini-3.8-flash-medium`。字数要件は空白を除いて500〜700字とした。

ここで確認するのは、文章の面白さや専門知識の深さではなく、納品条件への適合だ。機械判定の合格を、そのまま人が読んだときの品質評価には置き換えられない。

## ②公式ベンチマークから1つ

提供された公式情報は、Google公式blog「Introducing Gemini 3.8 Flash and 3.8 Flash Cyber」にある、3.8のラインナップはFlashとFlash Cyberのみ、という説明だ。

ただし、これは製品構成の情報であり、ベンチマーク結果ではない。提供データには公式ベンチマークのスコアが含まれていないため、この項目で性能差を示すことはできない。今回のFlashの実測を、Flash Cyberの結果として読むこともできない。

## ③実装タスクでの実測 (結論のみ)

今回の実測はコード実装ではなく、週報起草タスクである。結論は、GPT-6 Astraは両走とも全項目に合格し、Gemini 3.8 Flashは両走とも字数だけが不合格だった、というものだ。

- GPT-6 Astraは630字/628字、所要15.3秒/14.7秒。Gemini 3.8 Flashは801字/766字、22.5秒/27.4秒だった。今回の実行ではAstraが短時間で字数要件も満たした。
- 3セクション構成と箇条書き3点以内は、両モデルとも両走で合格。機械判定上の数値幻覚も0件だった。差が出たのは、評価した項目のうち字数への適合だ。
- Astraは固定文脈込みのagent CLI単価で約0.32ドル/走。FlashはAntigravity agent CLIの内蔵枠で実施し、従量課金なし、API無料枠も使っていない。課金条件が異なるため、API単価の優劣は判断できない。

対照のGPT-5.6 Solも同一タスク・同日・同一採点で、796字/727字と字数を超過した。数値幻覚は0件、約0.04ドル/走だった。GPT系という括りだけでも、今回の制約への適合は説明できない。

## ④詳細データについて

採点表や出力全文などの詳細データは、運営ブログで公開予定だ。現時点では、ここに示した測定条件と結論が比較の範囲になる。

各モデル2回の結果なので、別の指示文や長い文脈でも同じ傾向になるかは未確認だ。今回の結果は、週報の字数制約を重視する際の判断材料として扱いたい。

今GPT系を使っている人へ:系統名で一括りにせず、使っているモデルが字数要件を守るかを確かめたい。  
今Gemini系を使っている人へ:今回のFlashは字数のみ不合格だったため、同じ用途では字数チェックを組み込みたい。
記事起草・astra-art-2 — GPT-6 Astra (1,153字・全項目合格)
# GPT-6 AstraとGemini 3.8 Flashを週報起草で比較:差が出たのは字数制約

## ①ユースケースを限定する

今回比較するのは、個人の技術メディアで週報を起草する用途です。2026-09-10に、GPT-6 AstraとGemini 3.8 Flashへ同一の指示文を渡し、それぞれ新規セッションで2回実行しました。採点は機械判定です。

求めたのは500〜700字、3セクション、各セクションの箇条書き3点以内、与えていない数値を加えないこと。文章の面白さや専門知識の深さを測った比較ではありません。指定形式に収まり、そのまま編集工程へ渡せるかを見ています。

## ②公式ベンチマークから1つ

提供された公式情報は、Google公式blog「Introducing Gemini 3.8 Flash and 3.8 Flash Cyber」における、ラインナップがFlashとFlash Cyberのみという説明です。

ただし、これは製品構成の情報であり、ベンチマーク結果ではありません。提供データには公式ベンチマークの名称やスコアがないため、この節では性能差を示せません。公式スコアを推測で補わず、以下は今回の週報起草で確認できた結果に限定します。

## ③実装タスクでの実測 (結論のみ)

今回の条件では、字数を含む全項目に合格したGPT-6 Astraが、制約付きの週報起草に適していました。ここでいう実測は文章起草であり、コード実装の性能を検証したものではありません。

- Astraは630字/628字で全項目合格。所要は15.3秒/14.7秒でした。Geminiは801字/766字、22.5秒/27.4秒で、両走とも字数だけが不合格。セクション構成、箇条書き、数値幻覚0件は両モデル共通です。
- Astraは固定文脈込みのagent CLI単価で約0.32ドル/走。GeminiはAntigravity agent CLIの内蔵枠で、従量課金もAPI無料枠も使っていません。課金条件が異なるため、API単価の優劣には読み替えられません。
- 対照のGPT-5.6 Solも同一タスク・同日・同一採点で796字/727字と字数超過。数値幻覚は0件、約0.04ドル/走でした。GPT系なら一律に字数を守る、とは言えません。

## ④詳細データについて

採点表・出力全文などは運営ブログで公開予定です。今回は機械判定の結論のみを示しており、文章の読みやすさや内容の質は評価できていません。各モデル2回の結果なので、別の指示文や用途でも同じ傾向が出るかは未確認です。

今GPT系を使っている人へ:系統名だけで判断せず、使っているモデルが自分の字数制約を守るか確認してください。  
今Gemini系を使っている人へ:今回の不合格は字数のみです。数値幻覚とは分けて、短文化の手間を含めて判断してください。
記事起草・flash-art-1 — Gemini 3.8 Flash (1,155字・全項目合格)
Qiitaに投稿する比較記事の草案を作成しました。

---

## ①ユースケースを限定する

生成AIの実務適用において、汎用的な性能比較だけでは現場の要件を満たせるか判断できません。そこで本稿では、定型業務の代表例として「週報起草タスク」に対象を限定して検証を行いました。同一指示文を用い、採点は機械判定によって客観的に評価しています。

- 同一指示文を用いた週報起草タスクにおける挙動の比較
- agent CLIを用いた新規セッションによる客観的な検証
- 制約条件に対する正確な追従性の機械判定

## ②公式ベンチマークから1つ

各モデルの立ち位置を把握するため、公式情報からラインナップの設計思想を確認します。公式情報として公表されている構成は以下の通りです。

- Google公式blog「Introducing Gemini 3.8 Flash and 3.8 Flash Cyber」
- 3.8のラインナップはFlashとFlash Cyberのみ

## ③実装タスクでの実測 (結論のみ)

同一指示文による週報起草タスクの実測結果をまとめます。対照としてGPT-5.6 Solも同日実測しています。

- GPT-6 Astra (agent CLI gpt-6-astra-medium・2回とも新規セッション): 所要15.3秒 / 14.7秒、字数 (空白除) 630字 / 628字 (字数要件500〜700字に両方合格)、機械採点3セクション合格・箇条書き3点以内合格・数値幻覚0件 (2走とも全項目合格)、コスト約0.32ドル/走 (入力29,727token・出力456/465token・agent CLI単価・固定文脈込み)
- Gemini 3.8 Flash (agent CLI gemini-3.8-flash-medium・2回とも新規セッション): 所要22.5秒 / 27.4秒、字数 (空白除) 801字 / 766字 (字数要件500〜700字に両方とも超過)、機械採点3セクション合格・箇条書き3点以内合格・数値幻覚0件 (2走とも・字数のみ不合格)、コストAntigravity agent CLIの内蔵枠で実施 (従量課金なし・API無料枠も不使用)
- 対照 (GPT-5.6 Sol — 同一タスク・同日実測・同一採点): 796/727字 (字数要件500〜700字に超過)・数値幻覚0件・約0.04ドル/走

## ④詳細データについて

今回の実測は2026-09-10に実施されたものです。出力ログなどの詳細については以下のように案内しています。

- 採点表・出力全文などの詳細データは運営ブログで公開予定

今GPT系を使っている人へ:字数制約の厳格な遵守や速度を求める場合はGPT-6 Astraが適していますが、走ごとのコスト考慮が必要です。
今Gemini系を使っている人へ:内蔵枠による従量課金なしの運用性は強力ですが、字数要件を超過しやすい傾向への対策が必要です。
記事起草・flash-art-2 — Gemini 3.8 Flash (1,532字・字数超過+箇条書き8点)
ご提示いただいた生データに基づき、要件に沿って執筆したQiita投稿用の比較記事草案です。

---

# 【2026年秋】GPT-6 AstraとGemini 3.8 Flashを同一業務タスクで実測比較

2026-09-10、個人の技術メディアにて最新LLMモデルの実機検証を行いました。今回は、日常業務における定型アウトプット作成を想定した実測結果をお届けします。

## ①ユースケースを限定する

生成AIのモデル比較では、前提となるタスクと環境を揃えることが不可欠です。本検証では実務での再現性を重視し、以下の条件に限定してテストを実施しました。

- 対象タスクは同一指示文による「週報起草タスク」
- agent CLI環境における新規セッションで各モデル2走ずつ検証
- 評価は客観性を保つため機械判定を採用

字数要件(500〜700字)の遵守、セクション構成、箇条書きの項目数、数値幻覚の有無を機械的に採点しています。また、対照群として同日に同一タスク・同一採点条件でGPT-5.6 Solの実測も行いました。

## ②公式ベンチマークから1つ

モデル選定や位置づけを把握するにあたり、まずは公式情報におけるラインナップの確認が重要です。

- Google公式blog「Introducing Gemini 3.8 Flash and 3.8 Flash Cyber」によると、3.8のラインナップはFlashとFlash Cyberのみとなっています。

軽量・高速枠として展開されているFlashが、実務タスクにおいてどのような挙動を示すのかが注視されます。

## ③実装タスクでの実測 (結論のみ)

週報起草タスク(字数要件500〜700字・同一指示文・新規セッション2走)における機械判定と実測値の結論です。

- **GPT-6 Astra (agent CLI gpt-6-astra-medium)**
  - 所要時間は15.3秒 / 14.7秒、字数は630字 / 628字で字数要件に両方合格しました。
  - 機械採点は3セクション合格・箇条書き3点以内合格・数値幻覚0件となり、2走とも全項目合格を記録しました。
  - コストは約0.32ドル/走(入力29,727token・出力456/465token・agent CLI単価・固定文脈込み)でした。

- **Gemini 3.8 Flash (agent CLI gemini-3.8-flash-medium)**
  - 所要時間は22.5秒 / 27.4秒、字数は801字 / 766字で字数要件500〜700字に両方とも超過しました。
  - 機械採点は3セクション合格・箇条書き3点以内合格・数値幻覚0件(2走とも)でしたが、字数のみ不合格という結果でした。
  - コスト面はAntigravity agent CLIの内蔵枠で実施しており、従量課金なし・API無料枠も不使用でした。

なお、対照のGPT-5.6 Solは796/727字で字数要件500〜700字を超過、数値幻覚0件、コストは約0.04ドル/走でした。GPT-6 Astraは厳格な字数制約をクリアし、Gemini 3.8 Flashは内蔵枠運用ながら字数超過を除けば構成や精度(数値幻覚0件)を維持しています。

## ④詳細データについて

本稿では実務判断に直結する結論と主要な数値のみを抜粋して掲載しました。

- 2走分の採点表の詳細
- 生成された出力全文
- 対照モデルとの詳細なログ比較

これらを含む詳細データについては、運営ブログにて公開を予定しています。

今GPT系を使っている人へ:厳格な文字数制御や指示遵守が求められる自動化ラインでは、コストを払ってでもGPT-6 Astraの安定性を維持する価値があります。
今Gemini系を使っている人へ:字数超過のケアさえ組み込めば、Antigravity agent CLIの内蔵枠(従量課金なし)を活用して高精度かつ経済的にタスクを回せます。

実行環境とコスト (確認 2026-09-10)

実行は両モデルとも各社のエージェントCLI経由です。GPT-6 Astraはgpt-6-astra、Gemini 3.8 Flashはgemini-3.8-flashで、推論の強さの設定は両モデルとも「中」で揃え、毎走新しいセッションで実行しました。いずれもサブスクリプション契約に付属するCLI枠内で走らせているため、この計測自体の追加課金はありません。

公平性のため、条件が揃わなかった2走を表から除外しています。1走はFlash側の記事起草の初回で、ツール実行の権限確認が出たまま出力が空になりました (対向のCLIはツールを自動許可する設定のため、許可設定を揃えて再実行)。もう1走はAstra側で、CLIの既定設定 (推論「高」) のまま走ってしまったものです。除外した走も含め、失敗を隠さず記録しておくのがこのページの方針です。

従量課金で同じAstraの週報タスクを走らせた対照実測は1走あたり約0.32ドルでした (入力29,727token・出力456〜465tokenを、CLI表示単価の入力10ドル/出力50ドル〈100万tokenあたり〉で換算)。参考までに、Gemini 3.8 FlashのAPI公式単価は入力0.75ドル/出力3.75ドル〈100万tokenあたり、2026年12月31日までの期間限定価格〉です (Google AI for Developers 料金ページ)。ただし課金条件が異なるため、この単価を両者の優劣にそのまま使うことはできません。対照のGPT-5.6 Solは同一ハーネスでの別計測で、所要時間は記録を残していません。

この比較の限界 — と、「もったいなさ」について

限界を先に書きます。各セルの走数は2で、統計的な確からしさは限定的です。また、これはCLIという同一ハーネスでの相対比較であって、素のモデル能力の測定ではありません。固定文脈やツール権限といった実行条件が結果に影響する余地は残ります。字数超過をどこまで重く見るかも、提出物の体裁が命になる仕事か、下書きとして使う仕事かで変わります。

そして正直に書いておくと、最上位性能のモデルに週報を書かせるのは明らかに過剰です。普段の週報はもっと安い階層のモデルで回しており、この結果で切り替える予定もありません。この比較は「同じ制約を渡したとき、誰がきれいに守るか」を見るための出走で、要はオリンピック選手を区民マラソンに呼んだようなものです。速いのは当然で、毎週の5kmをこの選手に任せる理由にはならない。もしこのページの採点表を見て「週報ごときに最上位モデルはもったいない」と思ったなら、それがこの実験でいちばんまともな結論です。差が出たのは性能の階層ではなく、使い分けの判断材料のほうにあります。

関連