技術2026年4月17日(金)更新Qwen3.6-35B-A3BがGated DeltaNetとMoEを組み合わせてエージェントコーディングを底上げしたAlibaba QwenチームがQwen3.6-35B-A3Bをオープンウェイトで公開。Gated DeltaNet+Attention+MoEのハイブリッド40層構造で、SWE-bench Verified 73.4、MCPMark 37.0、QwenWebBench 1397を達成した。LLMローカルLLMQwenMoEエージェントコーディング
技術2026年4月15日(水)LLMの安全フィルタの仕組みとabliteratedモデルの実態LLMの安全性はRLHF・Constitutional AI・システムプロンプト・入出力フィルタの多層構造で成り立っている。クラウド各社の温度差、abliteratedとuncensoredの違い、ローカルLLMのデフォルト検閲レベルを整理した。AILLMローカルLLMセキュリティGeminiClaudeOllama
技術2026年4月14日(火)ローカルVision LLMでキャラ画像からRPGパラメータを抽出できるか試したGemma、Qwen2.5-VLなどのローカルVision LLMにキャラクターの立ち絵やドット絵を入力し、RPG風のステータスをJSON形式で返せるか実験した記録。AIローカルLLMVLM画像認識OllamaGemmaQwenApple Silicon実験
技術2026年4月13日(月)MicrosoftのFoundry Local正式リリース、アプリにバンドルして配布できるローカルAIランタイムアプリのビルドに約20MBのネイティブライブラリとして組み込めるローカルAIランタイム。ONNX RuntimeベースでGPU/NPU自動選択、OpenAI互換APIでPhi・Qwen・Mistral等をオフラインで動かせる。MicrosoftローカルLLMAzure AI FoundryONNX RuntimeWindows ML
技術2026年4月8日(水)更新日本語LLMが増えたので中身を整理してみた2026年に入って日本語に強いLLMが続々登場しているが、「日本語特化」の中身はスクラッチ学習からpost-trainingまでバラバラ。学習方式・サイズ・用途で整理した。AILLMローカルLLMJapanese AI
技術2026年4月6日(月)LLM-jp-4-32B-A3BをROCm + Strix HaloでベンチマークしたらQwen3.5より41%速かったNIIが公開したLLM-jp-4-32B-A3B-thinkingをEVO-X2(Ryzen AI Max+ 395)のROCmで動かした。62.9 t/sでQwen3.5-35B-A3Bの44.7 t/sを大きく上回るが、thinking制御やKVキャッシュ消費、知識カットオフに課題あり。日本語比較テストとコード生成テストの結果も。AILLMローカルLLMllama.cppAMDROCmMoEQwen実験
技術2026年4月3日(金)LemonadeをStrix Halo (EVO-X2) で動かしたらVulkanの共有メモリ漏れとROCmの安定性が見えたAMD Lemonade v10.0.1をRyzen AI Max+ 395環境で検証。LLM・画像生成・音声認識・音声合成の4モデル同時起動、NPU Hybrid実行、Vulkan vs ROCmの実測比較と共有メモリ漏れの発見まで。AMDローカルLLMVulkanROCmNPUllama.cppGPU推論最適化ベンチマーク実験
技術2026年4月3日(金)更新AMD公式のローカルAIサーバーLemonade、GPU+NPUを束ねてLLM・画像・音声を一元提供AMDが開発するオープンソースのローカルAIサーバーLemonadeは、llama.cppやFastFlowLMなど複数バックエンドをGPU/NPU/CPU横断で管理し、OpenAI互換APIでテキスト・画像・音声を統合提供する。AMDローカルLLMNPUGPUllama.cpp推論最適化ROCmVulkan
技術2026年4月3日(金)更新Google Gemma 4がE2BからA4Bまで4サイズ展開、Gemini 3由来の推論性能をApache 2.0で公開Google DeepMindがGemma 4をリリース。31B Dense、26B MoE(A4B)、E4B、E2Bの4モデルで、256Kコンテキスト、マルチモーダル入力、ツール呼び出し、140言語をサポートする。AILLMGoogleオープンモデルMoEマルチモーダルローカルLLM
技術2026年4月2日(木)更新SwiftLMはTurboQuantとSSDストリーミングをMetalシェーダーに統合したSwift製LLM推論サーバーApple Silicon専用のMLX推論サーバーSwiftLMが、TurboQuant V2+V3ハイブリッドKVキャッシュ圧縮とNVMe SSDエキスパートストリーミングをネイティブMetal実装で提供する。Apple SiliconLLMMLXローカルLLM推論最適化KVキャッシュMoESwift
技術2026年3月31日(火)OllamaがMLXバックエンドに移行、Apple Siliconでのローカル推論が劇的に高速化Ollama 0.19がApple SiliconでのバックエンドをMLXに切り替え、プリフィル1810トークン/秒・デコード112トークン/秒を達成。NVFP4量子化サポートとキャッシュ改善も同時投入された。OllamaMLXApple SiliconLLMローカルLLM推論最適化
技術2026年3月31日(火)Qwen3.5-35B-A3Bでctx-sizeを4096→65536にしたらVRAM 800MB増で速度も変わらなかったQwen3.5-35B-A3BはSSM+Attentionハイブリッドで40層中10層しかKVキャッシュを使わない。llama-serverでctx-sizeを4096→65536に拡張してもVRAM増加は800MB、速度低下ゼロ。q8_0 KV量子化の実測とTurboQuantの現状も。LLMローカルLLMllama.cppAMDVulkanKVキャッシュQwen実験