コーディング評価における信号とノイズの分離:OpenAIの分析がSWE-Bench Proの信頼性に懸念
-
FromOpenAI News
OpenAIの新たな分析により、人気のコーディングベンチマークであるSWE-Bench Proに問題が明らかになりました。
これは、AIモデルの評価における信頼性と正確性への懸念を高めるものです。
この分析は、ベンチマークの評価結果がAIモデルの真の能力を正確に反映していない可能性を示唆しています。
研究者たちは、より信頼性の高い評価方法の必要性を強調しています。
[custom_js_sp]
AIによる翻訳/要約をしています。正確な情報はオリジナルサイトにてご確認ください。
当サイトの記事にはプロモーションが含まれる場合があります。
