技術2026年5月2日(土)約13分OCR-Memoryはエージェントの履歴を画像として思い出すarXiv:2604.26622のOCR-Memoryを読んだ。エージェントの長い実行履歴を画像化し、Set-of-Markで該当箇所だけ選ばせ、元ログから逐語テキストを戻すメモリ方式だ。AIAIエージェントOCRVLMRAGトークン管理論文
技術2026年4月30日(木)約10分信頼度スコアで文書抽出の人手確認を絞るフィールド単位の信頼度スコアで人手確認を絞る設計と、freee MCPで仕訳自動化を試して踏んだOCR・閾値の壁。AIOCRVLMMCPAIエージェントAPI
技術2026年3月23日(月)約14分BERT+Qwen OCR校正パイプラインをPythonツールにしたBERT perplexityスキャン→LLM判定→エスカレーションの3段パイプラインを、Win/Mac/Linux対応のPythonツールにパッケージング。インストーラーがllama-serverとGGUFモデルまで自動で落としてくる。自然言語処理OCR機械学習PythonBERTLLMllama.cppQwenNDLOCR-LiteGradioOllama実験
技術2026年3月17日(火)約6分GLM-OCR(0.9B)が文書解析SOTAを更新したので段組・縦書き・数式対応を調べた智谱AIが公開したGLM-OCRは0.9Bパラメータながら文書解析ベンチマークOmniDocBench v1.5で94.62%を記録。レイアウト解析、縦書き、数式認識の実力を調査した。AIOCRVLMGLM
技術2026年3月9日(月)約7分NDLOCR-LiteをiOSネイティブアプリに載せてスマホOCRするNDLOCR-LiteのDEIMv2+PARSeqをONNX Runtime MobileでiOSアプリに同梱し、カメラ撮影→台形補正→レイアウト検出→文字認識→信頼度ベース校正をオンデバイスで完結させる。OCRNDLOCR-LiteiOSSwiftONNX Runtimeモバイル開発実験
技術2026年2月28日(土)約16分エンコーダーモデル+ローカルLLMでOCR誤字を自動検出・修正するLUKE/BERTのfill-maskファインチューニングから始めて、perplexityベースの誤字検出→Qwen2.5 7Bでの修正判定→不一致時エスカレーションのパイプラインに至るまでの実験ログ。VRAM 8GBのRTX 4060 Laptopで完結する構成。自然言語処理OCR機械学習PythonBERTLUKEOllamaLLMWSL2NDLOCR-Lite実験
技術2026年2月27日(金)約8分ScanSnap+NDLOCR-Liteで機密文書をローカルOCRするホットフォルダを作ったScanSnapで読み込んだ画像をフォルダ監視スクリプトで自動OCRし、LLM校正まで試した記録。エアギャップ環境でのセキュリティ設計も含む。OCRNDLOCR-LiteScanSnapPythonMacローカルLLM実験
技術2026年2月27日(金)約7分NDLOCRを3か月やった記録と周辺の実装いろいろDocker版で地獄を見てからLite+LLM校正まで。自分の試行錯誤と、NDLOCR-LiteをブラウザOCRにした人の実装を紹介する。OCRNDLOCRNDLOCR-LitePythonDockerローカルLLMONNXWebAssembly実験
技術2026年2月26日(木)更新約13分NDLOCR-Liteの読み取り結果をQwen3.5とSwallowで校正比較したNDLOCR-LiteのCLI版をApple Silicon Macにセットアップし、Qwen 3.5やSwallowでOCR結果を校正してみた記録。画像直読みやアンカリング効果など、いろいろ試した。OCRPythonNDLOCR-LiteMacQwenSwallowollamaローカルLLM実験
技術2026年2月25日(水)更新約8分国立国会図書館が作ったOCR「NDLOCR-Lite」をWindowsで動かしてみた国立国会図書館が公開したGPU不要の軽量OCR「NDLOCR-Lite」をWindows 11にインストールしてCLI・GUIの両方で試した記録。OCRPythonNDLOCR-Lite実験
技術2026年2月1日(日)約4分PageIndex — ベクトル検索なしでLLM推論だけのツリーRAGチャンキングもベクトルDBも使わず、LLMの推論で文書の階層ツリーを構築するRAGシステム「PageIndex」を調べた。段組認識やOCRパイプラインとの接続も考察。AIRAGLLMOCRPython
技術2026年1月30日(金)約4分PaddleOCR-VL-1.5 — 0.9Bパラメータで文書解析SOTAを更新Baiduが公開したPaddleOCR-VL-1.5は、わずか0.9Bのパラメータで文書解析ベンチマークOmniDocBench v1.5において94.5%の精度を達成。GPT-4oやQwen2.5-VL-72Bを上回るSOTA性能を記録した。AIOCRVLMPaddlePaddle