AWSがAmazon Bedrockを通じてOpenAIのGPT-6 SolとLunaモデルの一般提供を開始したと報じられている
LLM/モデル動向
大規模言語モデル(LLM)の最新リリース、ベンチマーク、モデル比較に関する記事をAIが要約してお届けします。
カテゴリ一覧
LLM/モデル動向の主なトピック
このカテゴリの記事で多く取り上げられている製品・企業・技術です。
新着記事・要約(771件)
17 / 78 ページllama.cppのプロンプト検索ドラフティングが高速化
Faster prompt lookup drafting in llama.cpp
llama.cppのn-gramキャッシュに対する4つの変更により、ドラフティング速度が最大41.6倍に向上し、メモリ使用量も削減された
- •n-gramキャッシュへの4つの変更により、ドラフティング処理が最大41.6倍高速化された
- •静的キャッシュの読み込み速度が最大23.5倍向上した
- •ピークメモリ使用量が最大2.65倍低下した
DeepSeek Elastic Compute (DSec)
DeepSeek Elastic Compute (DSec)
大規模なエージェント型LLMの学習と評価のために、分離されたステートフルな実行環境を弾力的に管理するインフラシステムを紹介する
- •モデルがリポジトリを閲覧し、ツールを呼び出してコマンドを実行するための隔離環境が必要とされる
- •これらのワークロードは大量のサンドボックスを一時的に作成し、機能や隔離要件が異なり、長時間の相互作用で状態を保持する
- •再利用が限られた大規模なイメージコーパスからデータを取得するため、弾力的な実行環境のサポートが不可欠である
GLM-5.3-FlashをJevのような意思決定モデルに変換する
Turning GLM-5.3-Flash into a Jev-like decision model
GLM-5.3-Flashのような標準LLMからJev類似の特性を引き出す手法を紹介し、vLLM環境下でのベンチマーク結果を報告しています。
- •最初の出力トークンで質問に答えるようプロンプトを設計することで、単一のフォワードパスで意思決定を実現する
- •精度と速度の面ではJevと同等の性能を示し、Layaを大幅に上回る結果となった
- •GLM-5.3-FlashとvLLMを用いた具体的なアプローチの詳細がブログ記事で説明されている
Anthropicが公開したブログ記事で、Claude Opus 5.5利用時のコスト管理方法や、計算量調整パラメータであるエフォートの使い分けについて解説している
- •Anthropicは2026年9月25日、開発者向けブログにてClaude Opus 5.5に関する費用管理とエフォートの使い分けを解説した
- •Claude Codeの/usageコマンドを用いた推定費用の確認方法が紹介されている
- •推論などにかける計算量を調整するエフォート(effort)の設定と、キャッシュ利用を含めたコスト最適化の観点が示されている
Kaggleのデータセットやコンペティションを基盤に5,000件以上の課題を用意し、小型AIモデルにコードによるデータ分析能力を強化学習で身につけさせるための実行環境と自動採点機能を備えたツールキットとして公開された。
- •Hugging FaceのAdithya S Kolavi氏が9月24日にXにて「SmolDataEnvs」の公開を告知した。
- •データ分析プラットフォームKaggleのデータセットやコンペティションを基に、5,000件以上の課題が含まれている。
- •モデルが課題を解くための実行環境と、解答を自動採点する仕組みを一体的に提供している。
LLMおよびビジョンモデル向けの単一関数によるJev風ラッパー
A single function Jev-like wrapper for LLMs, including vision models
JevやOpenJev、SemIfといったセルフホスタブルなプロジェクトに興味を持ち、LLMやビジョンモデルを単一関数でラップする手法について考察している
- •JevやOpenJev、SemIfといったセルフホスタブルなプロジェクトの存在が紹介されている
- •これらのプロジェクトを読んだことで、単一関数によるJev風ラッパーという概念が示唆されている
- •対象となるモデルにはテキスト処理だけでなくビジョンモデルも含まれている
GoogleがAIモデルやエージェントのコーディング能力を測る「Android Bench 2.0」を公開し、複雑な長期タスクでの性能低下を検証した
- •「Android Bench 2.0」は、エンジニアが数日を要する複雑な長期タスクを課す仕様へと刷新された
- •新しい基準での最高通過率は、従来の約91%から約28%に急落した
- •このベンチマークにより、AIモデルやエージェントが長期的・複雑な開発タスクに対応する際の限界が浮き彫りになった
LLMトークン幅を揃えたフォントを生成する
Generate fonts where every LLM token is the same width
LLMのトークン単位で幅が一定になるようなフォントを生成する技術や手法について紹介する記事です。
AWSのマネージドサービスであるBedrockとClaude Platformを通じて、Anthropicの最新モデル「Claude Opus 5.5」の利用が開始されたことを示すニュースである。