Grandream

Grandream

公開: 6 min read

Clef・Decisions API・Jevを実測比較|長文の記事判定と会話分類で4モデルを比べた

Clef・Decisions API・Jevを実測比較|長文の記事判定と会話分類で4モデルを比べた
AIエージェントの開発をご検討中ですか? AIエージェント開発サービスを見る →

文章を生成せず、質問ごとに確率を返す「判定API」が相次いで出ています。Cloudflareは10月1日にClefとClef-flashを、OpenAIは10月6日にDecisions APIのパブリックベータを公開しました。どちらも、私たちが使ってきたTypeSafe AIのJevと同じ種類のAPIです。

4つのモデルを、長文の記事判定と、問い合わせ会話の分類という2つの試験で比べました。結論は次のとおりです。

用途

選ぶモデル

理由

長文の記事を判定する

Jev

最も当たり、確率も信用でき、速くて安い

短い会話を分類する(質問は短く済ませる)

Clef

解釈が要る項目で最も当たり、確率の当たり方も最良

短い会話を分類する(判定基準まで書き込む)

Decisions API(Luna)

基準を書き足すと大きく伸び、全モデルを上回った

確率で仕事を振り分ける

Clef-flashとLunaは避ける

言い切った判定が外れる

比べた4モデル

Jev

Clef

Clef-flash

Decisions API

提供元

TypeSafe AI

Cloudflare

Cloudflare

OpenAI

モデル

jev-1.13.0

clef

clef-flash

gpt-6-luna

入力単価(100万トークンあたり)

$0.042

$0.24

$0.09

$0.10

実測で読めた入力

15,575トークン以上

約2,000トークン

約2,000トークン

47,521トークン以上

APIの形はほぼ共通です。はい・いいえの確率を返す質問、選択肢から1つ選ぶ質問、段階で採点する質問を、1回のリクエストにまとめて送れます。Decisions APIには「はい」「いいえ」がそれぞれ何を指すかを書く欄がないので、その説明を質問文の末尾に書き足して送りました。

試験1:長文の記事判定はJevが当たる

公開済み記事86本に、H1見出しの数、本文の文字数、文体の統一などを問う質問を送りました。正解は、自社の記事パイプラインにある品質検査コードの出力です。1モデルあたり860件の判定になります。

記事全文を送った結果と、本文を2,400字以内に切りそろえて送った結果です。2,400字の版は、Clefの入力上限に収めて判定の実力だけを比べるための条件です。

モデル

全文:正答率

全文:ECE

2,400字:正答率

2,400字:ECE

2,400字:AUC

Jev

76.5%

0.115

68.5%

0.215

0.790

Clef

66.6%

0.216

65.7%

0.212

0.783

Clef-flash

53.6%

0.288

55.5%

0.278

0.664

Luna

71.2%

0.212

62.7%

0.304

0.637

ECEは、予測した確率と実際の的中率のずれの平均で、小さいほど確率を信用できます。AUCは、確率の高い順に並べたときに正解が上に来るかを表します。

Clefは長文の後半を読まない

先頭と末尾に目印の語を置いたテキストを長さを変えて送ると、Clefは入力が約2,000トークンを超えたところで末尾の語を見つけられなくなりました。エラーは返らず、確率も普通に返ってきます。全文を送った条件では、86本中79本が切り捨てられていました。モデルページに書かれたコンテキスト長は65,536トークンで、表記と大きく食い違います。

切りそろえるとClefとJevは互角

2,400字の条件では、正答率、ECE、AUCのどれも、差の95%区間がゼロをまたぎました。

Lunaは全文を読めるが、確率を言い切りすぎる

Lunaは約67,000字のテキストでも末尾の語を見つけました。ただ、確率0.1未満か0.9超と言い切った判定が2,400字の条件で74%を占め、その正答率は68.6%にとどまります。Jevは言い切った判定が21%と少なく、その91.8%が当たっています。Jevとの正答率の差は、全文で−5.3ポイント(95%区間は−9.4〜−1.6)でした。

Clef-flashの確率は信用できない

Clef-flashが確率0.1未満と答えた180件のうち、50.6%は正解が「はい」でした。

試験2:会話の分類はClef、基準を書けばLuna

歯科医院への問い合わせ会話120本を、7つの項目で分類させました。Webチャットが60本、AI電話の文字起こしが60本で、どれも5〜10往復、409〜1,103字です。正解ラベルは先にコードで決め、それに合わせて会話を書きました。37本は、本当の用件が後半に出る、丁寧な口調の苦情、皮肉などの紛らわしいケースです。

主な用件、用件の途中変化、苦情、有人対応の要求、結末の5項目は、4モデルとも93%以上当てました。差が出たのは、会話全体から読み取る感情の推移と緊急度です。最初の質問文と、判定基準を書き足した質問文の両方で測りました。書き足したのは「最後の定型のお礼は感情の改善の根拠にしない」「緊急度は利用者の状況で決める」といった基準です。

モデル

感情の推移

緊急度

7項目すべて正解(120本中)

Jev

58.3% → 64.2%

67.5% → 87.5%

41本 → 56本

Clef

75.8% → 75.0%

85.8% → 86.7%

68本 → 68本

Clef-flash

72.5% → 57.5%

76.7% → 85.8%

54本 → 46本

Luna

56.7% → 87.5%

70.8% → 90.8%

37本 → 82本

(左が最初の質問文、右が判定基準を書き足した質問文)

最初の質問文ではClefが最も当たる

Clefの7項目すべて正解の割合はJevより22.5ポイント高く、95%区間は+13.3〜+31.7です。JevとLunaは、会話の最後のお礼の定型句を「感情が良くなった」と読む誤りが多く、感情の誤りのうちJevは44件、Lunaは41件がこの型でした。

基準を書き足すとLunaが逆転する

判定基準を書き足した質問文では、Lunaの7項目すべて正解の割合は68.3%で、Clefより11.7ポイント高くなりました(95%区間は+2.5〜+21.7)。Clefは書き足しても変わらず、Clef-flashは逆に下がりました。Lunaは、質問文に書いた基準によく従います。

確率の当たり方はClefが最良

選択式の項目で、最大確率が0.9以上の判定だけを自動にすると、Clefは58.6%を正答率99.5%で処理できました。Lunaは最大確率の中央値が1.00と強気で、88.1%が閾値を超えるものの正答率は87.7%です。確率の閾値で人に回す運用には、Clefのほうが向きます。

会話もラベルも合成データなので、測っているのは実地の精度ではなく「意図した読み方と一致するか」です。ラベルを見せない別の判定者に付け直させると、感情と緊急度で食い違いが出ました。食い違った行を除いても順位は変わりません。ただし会話の書き手も判定者もClaude系のモデルなので、一致率は人どうしより高めに出ている可能性があります。

速さ・費用・再現性

Jev

Clef

Clef-flash

Luna

記事:中央値(1本ずつ順に)

182ms

675ms

260ms

549ms

会話:中央値(6並列)

175ms

736ms

368ms

283ms

記事86本の費用(2,400字)

$0.0152

$0.0643

$0.0241

$0.0396

会話120本の費用

$0.0115

$0.0428

$0.0161

$0.0250

同じ入力に3回とも同じ確率

24組中4組

24組中24組

24組中24組

24組中24組

東京から投げると、どちらの試験でもJevが最も速く、最も安い結果でした。Cloudflareの発表は「ClefはJevの2.5倍速い」としていますが、私たちの環境では順位が逆です。測定地点も入力の長さも違うので、どちらかが誤りとは言えません。費用は百本単位で数セントの差で、選ぶ決め手にはなりません。

Jevは同じ入力でも確率が最大0.06動きます。他の3つは毎回同じ値を返しました。Lunaの確率は小数第2位までしか返ってきません。

どれを選ぶか

  • 長文の日本語記事の判定には、Jevを使い続けます。 全文を読め、最も当たり、確率も信用でき、速くて安いからです。
  • 問い合わせ会話の分類のように短い入力なら、ClefとLunaが候補です。 判定基準を書き込めるならLuna、確率の閾値で人に回すならClefが向きます。
  • Clefを使うなら、入力を約3,000字までに収めます。 何もしないと後半を読まないまま、それらしい確率が返ってきます。
  • 閾値は移植しません。 confidenceの定義も、得意な項目も、モデルごとに違います。自分の質問で測り直してから決めます。

データの扱い

Workers AIもOpenAIのAPIも、送った入力を学習には使わないとしています。ただし推論を日本国内に固定する設定はありません。Workers AIは実行地域を指定できず、Decisions APIのデータ所在地の指定は米国と欧州だけです。国内処理が必須なら、重みが公開されているClefを国内のGPUで動かす構成になります。

Decisions APIはベータで、Clefも公開から1週間たっていません。入力の上限や挙動は変わる可能性があるので、変わったら測り直して追記します。

関連記事

Grandream

Grandream

株式会社グランドリーム

AI・システム開発のプロフェッショナルチームです。AIエージェント・業務自動化・Webシステム開発などを手がけています。

AIエージェント開発のご相談はお気軽に

PoC段階から本番運用まで一貫対応します。

AI開発について相談する

AIエージェント開発サービスの詳細を見る →

どのサービスが合うか30秒で診断する →