Grandream
Clef・Decisions API・Jevを実測比較|長文の記事判定と会話分類で4モデルを比べた
文章を生成せず、質問ごとに確率を返す「判定API」が相次いで出ています。Cloudflareは10月1日にClefとClef-flashを、OpenAIは10月6日にDecisions APIのパブリックベータを公開しました。どちらも、私たちが使ってきたTypeSafe AIのJevと同じ種類のAPIです。
4つのモデルを、長文の記事判定と、問い合わせ会話の分類という2つの試験で比べました。結論は次のとおりです。
用途 | 選ぶモデル | 理由 |
|---|---|---|
長文の記事を判定する | Jev | 最も当たり、確率も信用でき、速くて安い |
短い会話を分類する(質問は短く済ませる) | Clef | 解釈が要る項目で最も当たり、確率の当たり方も最良 |
短い会話を分類する(判定基準まで書き込む) | Decisions API(Luna) | 基準を書き足すと大きく伸び、全モデルを上回った |
確率で仕事を振り分ける | Clef-flashとLunaは避ける | 言い切った判定が外れる |
比べた4モデル
Jev | Clef | Clef-flash | Decisions API | |
|---|---|---|---|---|
提供元 | TypeSafe AI | Cloudflare | Cloudflare | OpenAI |
モデル | jev-1.13.0 | clef | clef-flash | gpt-6-luna |
入力単価(100万トークンあたり) | $0.042 | $0.24 | $0.09 | $0.10 |
実測で読めた入力 | 15,575トークン以上 | 約2,000トークン | 約2,000トークン | 47,521トークン以上 |
APIの形はほぼ共通です。はい・いいえの確率を返す質問、選択肢から1つ選ぶ質問、段階で採点する質問を、1回のリクエストにまとめて送れます。Decisions APIには「はい」「いいえ」がそれぞれ何を指すかを書く欄がないので、その説明を質問文の末尾に書き足して送りました。
試験1:長文の記事判定はJevが当たる
公開済み記事86本に、H1見出しの数、本文の文字数、文体の統一などを問う質問を送りました。正解は、自社の記事パイプラインにある品質検査コードの出力です。1モデルあたり860件の判定になります。
記事全文を送った結果と、本文を2,400字以内に切りそろえて送った結果です。2,400字の版は、Clefの入力上限に収めて判定の実力だけを比べるための条件です。
モデル | 全文:正答率 | 全文:ECE | 2,400字:正答率 | 2,400字:ECE | 2,400字:AUC |
|---|---|---|---|---|---|
Jev | 76.5% | 0.115 | 68.5% | 0.215 | 0.790 |
Clef | 66.6% | 0.216 | 65.7% | 0.212 | 0.783 |
Clef-flash | 53.6% | 0.288 | 55.5% | 0.278 | 0.664 |
Luna | 71.2% | 0.212 | 62.7% | 0.304 | 0.637 |
ECEは、予測した確率と実際の的中率のずれの平均で、小さいほど確率を信用できます。AUCは、確率の高い順に並べたときに正解が上に来るかを表します。
Clefは長文の後半を読まない
先頭と末尾に目印の語を置いたテキストを長さを変えて送ると、Clefは入力が約2,000トークンを超えたところで末尾の語を見つけられなくなりました。エラーは返らず、確率も普通に返ってきます。全文を送った条件では、86本中79本が切り捨てられていました。モデルページに書かれたコンテキスト長は65,536トークンで、表記と大きく食い違います。
切りそろえるとClefとJevは互角
2,400字の条件では、正答率、ECE、AUCのどれも、差の95%区間がゼロをまたぎました。
Lunaは全文を読めるが、確率を言い切りすぎる
Lunaは約67,000字のテキストでも末尾の語を見つけました。ただ、確率0.1未満か0.9超と言い切った判定が2,400字の条件で74%を占め、その正答率は68.6%にとどまります。Jevは言い切った判定が21%と少なく、その91.8%が当たっています。Jevとの正答率の差は、全文で−5.3ポイント(95%区間は−9.4〜−1.6)でした。
Clef-flashの確率は信用できない
Clef-flashが確率0.1未満と答えた180件のうち、50.6%は正解が「はい」でした。
試験2:会話の分類はClef、基準を書けばLuna
歯科医院への問い合わせ会話120本を、7つの項目で分類させました。Webチャットが60本、AI電話の文字起こしが60本で、どれも5〜10往復、409〜1,103字です。正解ラベルは先にコードで決め、それに合わせて会話を書きました。37本は、本当の用件が後半に出る、丁寧な口調の苦情、皮肉などの紛らわしいケースです。
主な用件、用件の途中変化、苦情、有人対応の要求、結末の5項目は、4モデルとも93%以上当てました。差が出たのは、会話全体から読み取る感情の推移と緊急度です。最初の質問文と、判定基準を書き足した質問文の両方で測りました。書き足したのは「最後の定型のお礼は感情の改善の根拠にしない」「緊急度は利用者の状況で決める」といった基準です。
モデル | 感情の推移 | 緊急度 | 7項目すべて正解(120本中) |
|---|---|---|---|
Jev | 58.3% → 64.2% | 67.5% → 87.5% | 41本 → 56本 |
Clef | 75.8% → 75.0% | 85.8% → 86.7% | 68本 → 68本 |
Clef-flash | 72.5% → 57.5% | 76.7% → 85.8% | 54本 → 46本 |
Luna | 56.7% → 87.5% | 70.8% → 90.8% | 37本 → 82本 |
(左が最初の質問文、右が判定基準を書き足した質問文)
最初の質問文ではClefが最も当たる
Clefの7項目すべて正解の割合はJevより22.5ポイント高く、95%区間は+13.3〜+31.7です。JevとLunaは、会話の最後のお礼の定型句を「感情が良くなった」と読む誤りが多く、感情の誤りのうちJevは44件、Lunaは41件がこの型でした。
基準を書き足すとLunaが逆転する
判定基準を書き足した質問文では、Lunaの7項目すべて正解の割合は68.3%で、Clefより11.7ポイント高くなりました(95%区間は+2.5〜+21.7)。Clefは書き足しても変わらず、Clef-flashは逆に下がりました。Lunaは、質問文に書いた基準によく従います。
確率の当たり方はClefが最良
選択式の項目で、最大確率が0.9以上の判定だけを自動にすると、Clefは58.6%を正答率99.5%で処理できました。Lunaは最大確率の中央値が1.00と強気で、88.1%が閾値を超えるものの正答率は87.7%です。確率の閾値で人に回す運用には、Clefのほうが向きます。
会話もラベルも合成データなので、測っているのは実地の精度ではなく「意図した読み方と一致するか」です。ラベルを見せない別の判定者に付け直させると、感情と緊急度で食い違いが出ました。食い違った行を除いても順位は変わりません。ただし会話の書き手も判定者もClaude系のモデルなので、一致率は人どうしより高めに出ている可能性があります。
速さ・費用・再現性
Jev | Clef | Clef-flash | Luna | |
|---|---|---|---|---|
記事:中央値(1本ずつ順に) | 182ms | 675ms | 260ms | 549ms |
会話:中央値(6並列) | 175ms | 736ms | 368ms | 283ms |
記事86本の費用(2,400字) | $0.0152 | $0.0643 | $0.0241 | $0.0396 |
会話120本の費用 | $0.0115 | $0.0428 | $0.0161 | $0.0250 |
同じ入力に3回とも同じ確率 | 24組中4組 | 24組中24組 | 24組中24組 | 24組中24組 |
東京から投げると、どちらの試験でもJevが最も速く、最も安い結果でした。Cloudflareの発表は「ClefはJevの2.5倍速い」としていますが、私たちの環境では順位が逆です。測定地点も入力の長さも違うので、どちらかが誤りとは言えません。費用は百本単位で数セントの差で、選ぶ決め手にはなりません。
Jevは同じ入力でも確率が最大0.06動きます。他の3つは毎回同じ値を返しました。Lunaの確率は小数第2位までしか返ってきません。
どれを選ぶか
- 長文の日本語記事の判定には、Jevを使い続けます。 全文を読め、最も当たり、確率も信用でき、速くて安いからです。
- 問い合わせ会話の分類のように短い入力なら、ClefとLunaが候補です。 判定基準を書き込めるならLuna、確率の閾値で人に回すならClefが向きます。
- Clefを使うなら、入力を約3,000字までに収めます。 何もしないと後半を読まないまま、それらしい確率が返ってきます。
- 閾値は移植しません。 confidenceの定義も、得意な項目も、モデルごとに違います。自分の質問で測り直してから決めます。
データの扱い
Workers AIもOpenAIのAPIも、送った入力を学習には使わないとしています。ただし推論を日本国内に固定する設定はありません。Workers AIは実行地域を指定できず、Decisions APIのデータ所在地の指定は米国と欧州だけです。国内処理が必須なら、重みが公開されているClefを国内のGPUで動かす構成になります。
Decisions APIはベータで、Clefも公開から1週間たっていません。入力の上限や挙動は変わる可能性があるので、変わったら測り直して追記します。
関連記事
Grandream
株式会社グランドリーム
AI・システム開発のプロフェッショナルチームです。AIエージェント・業務自動化・Webシステム開発などを手がけています。




