技術2026年7月28日(火)Kimi K3の896エキスパートを「896人の専門家」と呼ぶと何がズレるか、ルーターは何を選んでいるのかKimi K3は各MoE層で896エキスパート中16個だけを動かす。公開された技術レポートを基に、エキスパートを専門家ではなく条件付きFFN部品として読み直し、線形射影1本のルーターがなぜ経路を選べるのか、固定93層の先に何があり得るのかを整理する。AILLMKimiMoETransformer
技術2026年7月18日(土)Qwen3-NextのGated AttentionはなぜシグモイドゲートひとつでAttention Sinkを消せるのかQwenチームのGated Attention論文を読み解く。SDPA出力にヘッドごとのシグモイドゲートを掛けるだけで先頭トークンへのAttentionの集中が46.7%から4.8%に落ちる。その理由と、Qwen3-Next全体での使われ方まで。LLMQwenTransformer論文MoE
技術2026年3月22日(日)Luma AIのUni-1は理解と生成を1つのTransformerに統合したLuma AIが発表したUni-1は、画像の理解と生成を単一のdecoder-only autoregressiveモデルで統合。拡散モデルを使わず、テキストと画像パッチを共有語彙空間でトークン化して逐次生成する。利用方法と料金体系も整理した。AI画像生成Luma AITransformer
技術2026年3月21日(土)MoonshotAI(Kimi)がTransformerの残差接続をAttentionで置き換えるAttnResを提案、1.25倍の計算効率Transformerの固定残差結合を深さ方向のsoftmax attentionに置き換えるAttnRes。Kimi Linear 48Bでの実証でGPQA-Diamond +7.5pt、HumanEval +3.1ptの改善。訓練オーバーヘッドは4%未満、推論は2%未満に抑えた。AILLMMoonshotAIKimiTransformer研究
技術2026年2月4日(水)Attention SinksとResidual Sinksの統一的理解 ― LLMの「外れ値」は訓練安定化の仕組みだったTransformerの謎の挙動「特定トークンへの注意集中」と「特定次元での大きな活性化」が、実は同じ機構だったという論文の解説。LLMTransformer論文