#ベンチマーク
50 件の記事
9月6日
Artificial Analysis、知能指標を改訂
- •Artificial Analysisが指標v4.2公開
- •GPT-6 Astraは前版より4pt上昇
- •Claude Fable 5.1には及ばず
8月12日
NVIDIA、軽量高速モデルNemotron3.5公開
- •NVIDIAが軽量AIモデルLightning公開
- •36億パラメータで大型モデルに匹敵
- •処理速度は毎秒670トークンで最速
続きを読む →
8月1日
DataFlow-Harnessでパイプライン精度向上
- •AIエージェント、単発コードは得意
- •構造化パイプラインは精度10.9点低下
- •DataFlow-Harnessが精度差を縮小
続きを読む →
注目7月17日
Moonshot AI、最大級OSSモデルKimi K3公開
- •Moonshot AIがKimi K3公開
- •2.8兆パラメータの世界最大OSS
- •Anthropic・OpenAIに匹敵する性能
続きを読む →
7月9日
Android Bench更新、GeminiがLLMで後れ
- •Android BenchにFable 5等の新LLMを追加
- •GeminiはFable 5などより低スコアと判明
- •開発者もベンチマーク改善に参加できる
7月3日
BridgewaterのQwen3、金融テストでGPT超え
- •Bridgewaterが金融特化Qwen3を共同開発
- •精度84.7%、コスト1/14を達成と主張
- •ただし第三者による検証はなし
続きを読む →
6月30日
Hugging Face、モデルページに全評価結果を掲載
- •Hugging Faceがモデルページに評価結果を統合表示
- •コミュニティ収集の全評価データを一元参照可能に
- •モデル選定の透明性と比較効率が向上
続きを読む →