技術2026年4月19日(日)WebAssemblyとMetalでゼロコピーGPU推論をApple Siliconに実装するmmap→MTLBuffer(bytesNoCopy)→Wasmtime MemoryCreatorの3段チェーンで、WasmリニアメモリとGPUバッファの物理アドレスを一致させる実装。M1上でLlama 3.2 1Bを9ms/tokenで動かした。WebAssemblyMetalAppleSiliconMLXWasmtimeLLM
技術2026年4月16日(木)AMD ROCmのCUDA追い上げはどこまで来たかEE TimesのAMD AI Software VP Anush Elangovan氏インタビューをベースに、ROCmとCUDAのエコシステム差を整理。Strix HaloでROCmを使い続けて4回壊れた実体験と、NVIDIA・AMD・Apple Siliconの実務での使い分けも。AMDNVIDIAROCmCUDAGPUAIインフラPyTorchMLXApple Silicon
技術2026年4月2日(木)更新SwiftLMはTurboQuantとSSDストリーミングをMetalシェーダーに統合したSwift製LLM推論サーバーApple Silicon専用のMLX推論サーバーSwiftLMが、TurboQuant V2+V3ハイブリッドKVキャッシュ圧縮とNVMe SSDエキスパートストリーミングをネイティブMetal実装で提供する。Apple SiliconLLMMLXローカルLLM推論最適化KVキャッシュMoESwift
技術2026年3月31日(火)OllamaがMLXバックエンドに移行、Apple Siliconでのローカル推論が劇的に高速化Ollama 0.19がApple SiliconでのバックエンドをMLXに切り替え、プリフィル1810トークン/秒・デコード112トークン/秒を達成。NVFP4量子化サポートとキャッシュ改善も同時投入された。OllamaMLXApple SiliconLLMローカルLLM推論最適化