技術2026年8月4日(火)M1 MaxでINT8ConvRotを実行しMetal・MPSMatrix・MLXを比べるM1 MaxでINT8ConvRotに近い量子化行列積をPyTorch、Metal、MPSMatrix、MLXから直接測定し、fp16との速度差とMPS経路の制約を確認した。AI画像生成Anima量子化Apple SiliconMLX実験
技術2026年8月4日(火)Anima-Turbo INT8ConvRot量子化版をM1 MaxのComfyUIで動かすM1 MaxのComfyUIでAnima-Turbo INT8ConvRot量子化版をロードし、MPS未対応エラー、CPUフォールバック、逆量子化回避策の生成時間を検証した。AI画像生成ComfyUIAnima量子化Apple Silicon実験
技術2026年5月26日(火)Hy-MT2 1.8BをM1 Maxで動かす、1.25bit 440MB版は標準llama.cppでまだ動かないM1 Max 64GBでHy-MT2 1.8B Q4_K_M (1.08GB) をllama-serverに載せ、JSON・SRT・HTML・用語拘束・少数言語まで投げて入出力を確認。1.25bit 440MB版は標準llama.cppでロード不可、30B-A3B (hy_v3) もMacの標準ルートで動かない。AILLM翻訳ローカルLLMHuggingFace量子化MoEオープンソースMacApple Silicon実験
技術2026年3月25日(水)HypuraのNVMeストリーミングとTurboQuantのKVキャッシュ量子化llama.cppのmmap設計を脱却してNVMe 3層配置でDenseモデルもストリーミングするHypuraと、極座標変換で量子化定数オーバーヘッドを排除するTurboQuant。Flash-MoEとの設計比較、KVキャッシュ圧縮が実際に効くシナリオの整理も。LLMローカルLLM量子化Apple Silicon推論最適化KVキャッシュRust
技術2026年1月30日(金)Not All Bits Are Equal: 推論モデルのメモリ配分に万能解はない推論モデルでメモリをどう配分すべきか。1700実験から導かれた量子化・KVキャッシュ・推論長のトレードオフを解説する。LLM量子化推論論文紹介