有料プラン(3カ月分)を無料プレゼント中!詳しく見る
App IconMemolith
2026年10月08日 19:09

J-MeetEval公開、会議要約AIの指示追従性を測る

執筆: Takumi(Memolith開発者)
メモリスメモリスによる要約
  • J-MeetEvalは会議要約の指示追従性を0/1判定で測る
  • データは197件の合成会議で、スコアは単一実行のため±20%程度ぶれ得る
  • 選ぶときは自分の指示と近い条件の結果かを確かめる

日本語の会議要約AIを測るベンチマーク「J-MeetEval」が、GitHubで公開された。 入力は長い会議の文字起こしで、議事録作成などの要約タスクを課す。 測るのは、モデルが指定された形式・制約にどれだけ正確に従えるか、つまり指示追従性だ。

設計には癖がある。 入力の文字起こしは3,015〜11,437字(中央値9,072字)で、1つのプロンプトに平均2.07件の指示が同時に入る。 判定は指示ごとの0/1で、段階評価ではない。READMEによれば、これで文章の巧拙と切り離して指示追従性だけを測れる。 30の指示キーを28個のチェッカーが判定し、5個がルールベース、23個がLLM-as-a-Judge(別のAIに合否を判定させる方式)だ。

同梱データは197件の合成会議で、実在の会議の録音・文字起こしではない。 文字数の中央値は、実会議データの9,191字とほぼ一致するよう選抜されている。 2026-07-20のベースライン評価では、google/gemma-4-E4B-itがプロンプトレベル精度69.0%、指示レベル精度83.3%で最上位だった。 Qwen/Qwen3.5-4Bは52.0%と72.1%だった。 ただし各スコアは単一実行の値で、指示単位ではおおむね±20%程度ぶれ得ると注記されている。

ベースライン評価のスコア比較。gemma プロンプトレベル: 69.0%、gemma 指示レベル: 83.3%、Qwen プロンプトレベル: 52.0%、Qwen 指示レベル: 72.1%。各スコアは単一実行の値で、指示単位ではおおむね±20%程度ぶれ得る

読者にとっての意味

AIで議事録を作る人にとって、要約AIの良し悪しは「流暢か」だけでは決まらない。 「決定事項を先頭に」「担当者ごとに分けて」といった指示を、長い会議でも守れるかが実務の使い勝手を左右する。 一般に、知識問題や推論問題で測る汎用ベンチマークと、この種の指示への従い方は別の軸である。 J-MeetEvalは後者を、日本語の長文会議という条件で切り出した。

メモリス(AIボイスメモ)は、録音をAIが後から文字起こし・要約するアプリで、要約の出来は会議の長さや指示の組み合わせにも左右される。 録音後に処理する方式なので、会議の記録を指示どおりの形で受け取れるかという視点は、このベンチマークの関心と重なる。

数字を選定に使うときの見方

READMEは、judgeモデルを変えるとスコアが変わるため、結果を比較する際はjudgeを揃えるよう明記している。 ベースラインの判定はgpt-5-miniによる3回投票の多数決で、生成のtemperatureは0.7だった。 他社の数字と並べるときは、この条件が同じかを先に確認するべきだ。 条件が違う数字を横に並べると、モデルの差ではなく判定者の癖を比べることになる。 LLM-as-a-Judgeはプロンプトインジェクションやjudgeの癖によるバイアスを完全には排除できない、ともREADMEは認めている。

もう一つ、順位を見る前に自分の使い方との距離を測る必要がある。 J-MeetEvalは合成データであり、実会議そのものではない。 さらに、このベンチマークの入力は文字起こし済みのテキストだ。録音から文字にする段階の精度は測っていない。 実務では、音声認識の誤りが要約の入力にそのまま混ざる。 要約AIを選ぶなら、公開スコアで候補を絞ったうえで、自分の会議の録音を同じ指示で何本か処理し、守られた指示を数えるのが確実だ。 単一実行で±20%程度ぶれ得る数字を、順位の根拠にしきるのは危うい。 同じ入力を複数回処理して安定するかまで確かめれば、その危うさを自分の手元で埋められる。

関連して、会議の要約機能を強化する動きは続いている。たとえばリコージャパンのtorunoはAI要約と翻訳を強化した。 機能が増えるほど、指示にどこまで従うかという比較軸の価値は上がっていく。

データセットとリポジトリはApache License 2.0で公開されており、自分の用途に合わせた評価にも使える。

メモリス ブログの記事を、Googleで便利に検索できます

Googleで優先ソースとして追加
有料プラン(2,490円相当)を
無料プレゼント中!
詳しく見る