次回の更新記事:会議出席代行システム LLMでどこまでできるか(公開予定日:2025年02月25日)

論文

開発企業や言語ごとに異なるLLMのイデオロギー、価値観や態度
コンテキスト内で重要な情報同士が離れすぎるとLLMの性能は大幅に下がる
LLMには正解例だけでなく、「よくある間違い例」と理由も一緒に教えるのが有効
o1-previewが人間のように6つの思考パターンを使い分けているとの実験結果
IBMから日本語対応の商用可能オープンソースLLM「GRANITE 3.0」公開 8Bから
計画のステップが増えるほど、LLMは最初の目標を見失っていく傾向がある
500以上の実世界のマルチモーダルタスクを含む、過去最大規模の評価ベンチマーク『MEGA-BENCH』登場
「o1-preview」は自己評価メカニズムを持つ 計画立案中に自分の行動をチェックして修正 
ロングコンテキストLLMでも、情報の数は「多ければ多いほど良い」わけではない
OpenAIのo1-previewモデル、Kaggleのグランドマスター基準を上回るデータ分析性能を発揮

プロフィールを登録すると
仕事のオファーが届きます

プロフィール登録
PAGE TOP