視聴者評価:27のAIモデル、ChatGPTは8位 ― それを上回ったモデルはこちら
人工知能(AI)の世界は、しばしば激動の分野のように思われがちですが、その裏では驚くほど多くの分析、性能測定、テストが行われています。これは企業自身だけでなく、独自のランキングを決定するために設立された団体によっても行われています。

これらのグループは、チャットボットが数学のテストを完了する能力から、
画像の作成、論理的な説明をしたり、医学的なアドバイスをしたり、あるいは単に彼女が感情的にどれほど知的なのかを示したりすることもできます。
こうした多様なテストを通して、各モデルは様々な分野における強みと弱みを明らかにします。例えば、GPT-5は科学的推論において優れていますが、新しい概念への適応能力においてはGeminiやClaudeといったモデルに劣ります。
これらのテストはどれもAIモデルに関する新たな知見を提供し、様々なシナリオにおいてどのツールが最適かを思い出させる上で重要です。しかし、多くの場合、一つの指標が欠けています。それは、どのAIモデルが最高のユーザーエクスペリエンスを提供するのかということです。
人道的分類システム

英国に拠点を置くテクノロジー企業Prolificは、HumaineというAIランキングを作成した。Prolificは、AIがタスクを完了する能力をテストするのではなく、これらのモデルを使ったさまざまなユーザーエクスペリエンスをテストした。
21,352人のツール使用体験を評価することで、総合的な勝者を見つけることができただけでなく、年齢、場所(テストは英国と米国の両方で行われた)、政治的信条ごとに結果を分類することもできました。
これには以下の個別のリストが含まれます。
- 英国: 年齢層
- イギリス:人種
- 英国:政治的視点
- アメリカ合衆国: 年齢層
- アメリカ合衆国:人種
- アメリカ合衆国:政治的視点
チームは、各参加者に 2 つの異なる AI モデルを比較してもらい、それぞれのインタラクションでどちらのモデルのパフォーマンスが優れているかについてのフィードバックを求めました。
その結果、パフォーマンスの総合優勝者とリーダーボードが誕生しただけでなく、基本的なタスクのパフォーマンスと推論に関する個別のランキング、さらにコミュニケーション、回復力、信頼、倫理に関する優勝者も誕生しました。
結果は何を示していますか?

徹底的なレビューの結果、総合的なパフォーマンスカテゴリーだけでなく、ほとんどのサブカテゴリーにおいても、明確な勝者が決定しました。Gemini 2.5-Proは、テスト対象となったほぼすべてのベンチマークで優れた性能を発揮しました。
英国の18歳から34歳の若年層、民主党支持者、そして米国の55歳以上の人々は、Gemini 2.5 Proが総合的に見て最高のモデルであるという点で意見が一致した。すべての層がGeminiよりも高い評価を与えた唯一の分野は、信頼性、倫理、安全性であり、それはGrok-3だった。このAIモデルが最近直面している安全性と倫理に関する問題を考えると、これはやや皮肉な結果と言えるだろう。
興味深いことに、Geminiの後に登場した3つのモデルは、Deepseek、Magistral Le Chat、そしてGrokである。Deepseekは今年初めに大きな人気を博したが、最近は注目度が下がっている。一方、Le Chatはそれほど人気はないものの、根強いファン層を誇っている。
では、世界的に有名なChatGPTは、この中でどのような位置づけになるのでしょうか?最下位に位置し、最高性能のGPT-4.1モデルでも8位にランクインしています。さらに悪いのはClaudeで、その2つのバージョン(4.0と4.0)は、全体で11位と12位にとどまっています。
それで、これは何を意味するのでしょうか?
これは、Geminiが世界最高のAIチャットボットだという意味でしょうか?それとも、ChatGPTはもうやめるべきなのでしょうか?まあ、必ずしもそうではありません。
これらの結果は必ずしもこれらのモデルのパフォーマンスを反映するものではありません。他のほとんどの指標でテストした場合、上位に表示される選択肢は通常、ChatGPT、Gemini、Claude、Grokです。
しかし、これはこれらのテストに重要な追加要素となります。人間の経験という観点からAIをより深く理解するのに役立ちます。例えば、Le Chatは標準的なベンチマークでは高いスコアを獲得していませんが、経験と信頼性の点では優れた選択肢としてよく挙げられます。
AnthropicとOpenAIのパフォーマンスは今回のテストではこのレベルには達しませんでしたが、GeminiとGrokは今回も素晴らしいパフォーマンスを見せました。両社とも標準的なベンチマークで高いスコアを達成することが多く、今回もその調子を維持しました。
コメントは締め切りました。