技術2026年3月25日(水)HypuraのNVMeストリーミングとTurboQuantのKVキャッシュ量子化llama.cppのmmap設計を脱却してNVMe 3層配置でDenseモデルもストリーミングするHypuraと、極座標変換で量子化定数オーバーヘッドを排除するTurboQuant。Flash-MoEとの設計比較、KVキャッシュ圧縮が実際に効くシナリオの整理も。LLMローカルLLM量子化Apple Silicon推論最適化KVキャッシュRust
技術2026年3月23日(月)397Bパラメータモデルを48GB MacBookで動かすFlash-MoEFlash-MoEはQwen3.5-397B-A17BをMacBook Pro M3 Maxで4.36トークン/秒で実行するC/Metal推論エンジン。SSDからのエキスパートストリーミングと手書きMetalシェーダーで209GBのモデルを48GBのメモリ環境に収めた。InferenceMPSLLMQwenMoEローカルLLM
技術2026年3月18日(水)PC操作AIが1.7倍速くなったHolotron-12Bと、コード不要でAIを自分好みに調整できるUnsloth StudioH CompanyのHolotron-12Bはメモリ効率の良い新設計で、PC操作AIの処理速度を毎秒8,900トークンに引き上げた。UnslothはAIモデルの追加学習をコード不要でできるブラウザツール「Studio」をベータ公開。AILLMAIエージェントUnslothローカルLLM
技術2026年3月1日(日)Qwen 3.5がRadeon 8060Sで全滅した原因はAMDドライバだったQwen 3.5がROCm/Vulkanで動かない原因をCPU推論・llama-server・LM Studioで切り分けた結果、AMDドライバの更新で全て解決した。AILLMローカルLLMAMDllama.cppOllamaLM Studio実験
技術2026年2月28日(土)更新abliteratedモデルをOllamaで動かそうとして全滅した話と、結局公式版で済んだ話huihui-aiのQwen 3.5 abliteratedは全バリアントでゴミトークンを吐いて全滅。GLM-4.7-Flash abliteratedもテンプレート崩壊で使い物にならず、最終的に公式版+thinking無効が正解だった。AILLMOllamaローカルLLMAMDLM StudioVulkanROCm実験
技術2026年2月27日(金)ScanSnap+NDLOCR-Liteで機密文書をローカルOCRするホットフォルダを作ったScanSnapで読み込んだ画像をフォルダ監視スクリプトで自動OCRし、LLM校正まで試した記録。エアギャップ環境でのセキュリティ設計も含む。OCRNDLOCR-LiteScanSnapPythonMacローカルLLM実験
技術2026年2月27日(金)NDLOCRを3か月やった記録と周辺の実装いろいろDocker版で地獄を見てからLite+LLM校正まで。自分の試行錯誤と、NDLOCR-LiteをブラウザOCRにした人の実装を紹介する。OCRNDLOCRNDLOCR-LitePythonDockerローカルLLMONNXWebAssembly実験
技術2026年2月26日(木)更新NDLOCR-Liteの読み取り結果をQwen3.5とSwallowで校正比較したNDLOCR-LiteのCLI版をApple Silicon Macにセットアップし、Qwen 3.5やSwallowでOCR結果を校正してみた記録。画像直読みやアンカリング効果など、いろいろ試した。OCRPythonNDLOCR-LiteMacQwenSwallowollamaローカルLLM実験
技術2026年2月15日(日)更新EVO-X2でローカルLLM環境を構築したGMKtec EVO-X2(Strix Halo)でNSFW対応のローカルLLMを構築した記録。LM StudioとMS3.2-24B-Magnum-Diamondで約11 tokens/sのGPU推論を実現するまで。AILLMローカルLLMLM StudioAMD実験