技術2026年4月23日(木)open-notebookをDockerもクラウドAPIも使わずM1 Maxで動かしてqwen3.6:35bに自分の記事を読ませたNotebookLMクローンのopen-notebookはデフォルトがDocker前提+クラウドAPI前提。SurrealDBをネイティブで入れて4プロセスをtmuxで立ち上げ、Ollamaのqwen3.6:35bとbge-m3だけでRAGを回した。自分が今朝書いたQwen3.6比較記事を食わせたら、正しい数値で答えた。AILLMローカルLLMOllamaQwenApple SiliconRAGOSS実験
技術2026年4月23日(木)更新Qwen3.6-27B DenseとQwen3.6-35B-A3B MoEをM1 Maxで比べたらMLXがOllamaの2倍速だったQwen3.6-27BをOllama/MLX両方で試したらOllamaはVLプロジェクタ付きGGUFをロードできず、MLXでは11 tok/sで動いた。ついでに35B-A3BをMLXで動かしたらOllama GGUFの2倍速。BBSを両モデルに作らせて意図汲み取りの差も見た。LLMローカルLLMQwenOllamaMLXApple SiliconMoE実験
技術2026年4月21日(火)更新Qwen3.6-35B-A3BをOllamaでM1 Max 64GBに流したら思考が13倍に膨らんだOllama 0.20.6でQwen3.6-35B-A3Bを試した記録。Gated DeltaNet対応済みで生成速度はQwen3.5と同じ27 tok/s、ただし思考トークンは13倍。マルチターン・ペルソナ・NSFW三段階の挙動もまとめた。LLMローカルLLMQwenOllamaApple SiliconMoE実験
技術2026年4月17日(金)Z-Image i2iでドット絵変換できるか試したIllustrious i2i + pixel-art-xl LoRAが最速だったドット絵変換に、Z-Image用ピクセルアートLoRAという別ルートがあった。LoRAの互換性、利用可能なLoRA、メモリ要件を調査。Z-Image画像生成Apple Silicon実験
技術2026年4月16日(木)更新WAI-Illustriousの新版探してたらWAI-Animaが出てたので試したWAI-Illustriousで知られるWAI0731がAnima派生モデル WAI-Anima v1をリリース。2月のAnima記事から2ヶ月で派生モデルが急増し、LoRAツールキットやテキストエンコーダのアップグレードも登場。preview3-baseとWAI-Anima v1を実際に動かして比較した。AI画像生成ComfyUIQwenApple SiliconStable DiffusionLoRA実験AnimaWAI-Anima
技術2026年4月16日(木)AMD ROCmのCUDA追い上げはどこまで来たかEE TimesのAMD AI Software VP Anush Elangovan氏インタビューをベースに、ROCmとCUDAのエコシステム差を整理。Strix HaloでROCmを使い続けて4回壊れた実体験と、NVIDIA・AMD・Apple Siliconの実務での使い分けも。AMDNVIDIAROCmCUDAGPUAIインフラPyTorchMLXApple Silicon
技術2026年4月14日(火)Qwen Image Editで写真をドット絵に変換できるか試すQwen Image Edit、JS減色、Illustrious i2i + LoRAなど5パターン試して、最終的にIllustrious i2i単体が最速・最軽量でドット絵変換できることがわかった。Qwen画像生成Apple Silicon実験
技術2026年4月14日(火)ローカルVision LLMでキャラ画像からRPGパラメータを抽出できるか試したGemma、Qwen2.5-VLなどのローカルVision LLMにキャラクターの立ち絵やドット絵を入力し、RPG風のステータスをJSON形式で返せるか実験した記録。AIローカルLLMVLM画像認識OllamaGemmaQwenApple Silicon実験
技術2026年4月2日(木)更新SwiftLMはTurboQuantとSSDストリーミングをMetalシェーダーに統合したSwift製LLM推論サーバーApple Silicon専用のMLX推論サーバーSwiftLMが、TurboQuant V2+V3ハイブリッドKVキャッシュ圧縮とNVMe SSDエキスパートストリーミングをネイティブMetal実装で提供する。Apple SiliconLLMMLXローカルLLM推論最適化KVキャッシュMoESwift
技術2026年3月31日(火)OllamaがMLXバックエンドに移行、Apple Siliconでのローカル推論が劇的に高速化Ollama 0.19がApple SiliconでのバックエンドをMLXに切り替え、プリフィル1810トークン/秒・デコード112トークン/秒を達成。NVFP4量子化サポートとキャッシュ改善も同時投入された。OllamaMLXApple SiliconLLMローカルLLM推論最適化
技術2026年3月26日(木)ComfyUIアプデ後にQwen Image Editが10分かかるようになった原因を特定したMPSのBF16演算がFP16の2倍遅い問題と、FP16 Attentionバグが重なって発生した速度劣化の原因と対策ComfyUIQwenApple SiliconMPSPyTorch実験
技術2026年3月25日(水)HypuraのNVMeストリーミングとTurboQuantのKVキャッシュ量子化llama.cppのmmap設計を脱却してNVMe 3層配置でDenseモデルもストリーミングするHypuraと、極座標変換で量子化定数オーバーヘッドを排除するTurboQuant。Flash-MoEとの設計比較、KVキャッシュ圧縮が実際に効くシナリオの整理も。LLMローカルLLM量子化Apple Silicon推論最適化KVキャッシュRust