技術2026年7月7日(火)約6分Transformerを1層だけRL訓練しても全パラメータ学習に匹敵するという論文、検証はQwen系7モデルRLの利得は深さ40〜60%の中間層に集中し、最良の1層だけ訓練すると全パラメータ訓練を上回ることもある。Qwen3系で層番号と数値まで出ている論文(arXiv 2607.01232)を読んだ。AILLM強化学習Qwen
技術2026年4月30日(木)約8分GPT-5.5に湧いたゴブリンをOpenAIがスレイしたOpenAIがGPT-5.1以降で増えた特定の比喩表現について、人格カスタマイズ、報酬信号、SFTデータへの混入、Codexでの抑制まで調査結果を公開した。OpenAILLMCodex強化学習AI安全性
技術2026年4月1日(水)約10分TRL v1.0がメジャーリリース、LLMポストトレーニングの安定基盤へHuggingFaceのLLMポストトレーニングライブラリTRLがv1.0に到達。Stable/Experimental二層モデルの導入、GRPO・DPO・SFTなど主要手法の安定化、非同期GRPOのロードマップが示された。AI機械学習強化学習LLMHuggingFace
技術2026年3月27日(金)約10分HyperAgents、「改善の仕方」の改善はコーディング以外にも転移するMeta AIのHyperAgentsは改善戦略そのものを最適化するメタ認知的自己修正を実現。コーディング以外の4ドメインで自己改善が動き、別ドメインで獲得した改善戦略の転移や永続メモリの自発的獲得が観察された。メタ学習自己改善AI強化学習Darwin Gödel MachineMeta AI
技術2026年3月27日(金)約7分Chroma Context-1、フロンティアLLMと同等の検索性能を20Bパラメータで実現Chromaが公開した20Bパラメータの自己編集型検索エージェント。コンテキストを動的にプルーニングしながらマルチホップ検索を行い、フロンティアモデルの1/10コスト・最大10倍速のレイテンシで同等以上の精度を示す。重みはApache 2.0で公開。Chroma検索エージェント強化学習RAGLLM
技術2026年3月21日(土)約3分Cursor Composer 2はKimi K2.5にコーディング特化RLを適用したモデルだったCursorがComposer 2の基盤モデルを未公表のままリリースし、API経由でKimi K2.5であることが判明。ライセンス問題に発展したが、Moonshot AIとの正式契約が確認された。CursorKimiMoonshot AI強化学習LLMオープンウェイト
技術2026年3月11日(水)約6分16のオープンソースRLライブラリで見えたLLM非同期訓練の設計パターンHuggingFaceが16のオープンソースRL訓練ライブラリを7つの設計軸で比較分析。同期型では生成ボトルネックでGPU利用率が60%程度に留まるが、非同期分離設計で95%以上に改善できる。AI機械学習強化学習LLM
技術2026年2月3日(火)約2分Agent Lightning: MicrosoftのAIエージェント強化学習フレームワークMicrosoftが公開した、ほぼコード変更なしであらゆるAIエージェントを強化学習で最適化できるフレームワーク。LangChain、AutoGen、Claude Agent SDKなど任意のフレームワークに対応。AIエージェント強化学習PythonMicrosoft
技術2026年2月2日(月)約5分Power Sampling:強化学習なしでLLMの推論能力を引き出すRLで学習させなくても、推論時のサンプリング戦略を変えるだけでLLMの推論性能が向上する。Haitham Bou Ammar氏の記事をもとに、Power Samplingの仕組みと実務的なインパクトを解説する。LLM推論強化学習サンプリングAI