完整 human + augmented test set 的正式 relaxed accuracy。
Visual analysis terminal / 2026
問圖表,讓數據回答。
從 15,000 筆 ChartQA QLoRA fine-tuning,到完整 2,500 題品質驗證、AWQ 量化與 A100 vLLM serving benchmark。每個部署決策,都有數據可以追溯。
量化不是猜測,
是有門檻的決策。
AWQ 必須在完整 ChartQA test set 上,相對 merged 16-bit 掉分不超過 2 個百分點,才能進入 serving benchmark。
低於預先定義的 −2 pp 品質門檻;paired bootstrap 95% CI 為 [−1.40, −0.04] pp。
由 merged 16-bit 的 17.53 GB 壓縮至 AWQ W4A16 g32。
壓縮之後,
速度真的變快。
同一張 A100-SXM4-40GB、同一組多模態 workload、固定 64-token decode;merged 16-bit 與 AWQ 各測 concurrency 1/4/8/16,8 組全部 64/64 成功。
從資料到部署,
完整走完一輪。
訓練、評估、量化與 serving 各自隔離,產物透過 pinned revision 銜接,避免把環境差異誤認為模型改善。
ChartQA 資料
15,000 筆 train;human/augmented 分層保留。
QLoRA 微調
Qwen3-VL-8B · rank 16 · 1 epoch · A100。
完整評估
2,500 題 relaxed accuracy 與 paired predictions。
AWQ W4A16
group size 32;vision tower 與 lm_head 保持原精度。
vLLM Benchmark
快取隔離、獨立 server、固定 workload 與 validity gate。
GGUF 發布
Q4_K_M text + Q8_0 mmproj;llama.cpp CPU smoke PASS。
改善,落在
具體的一題上。

讀出 8 與 12,
再算出 96。
這題要求從兩組色條中找出最小值並相乘。微調前模型輸出 72;fine-tuned model 正確抓到兩個數值並回答 96。
公開 demo 驗收時重新載入不含標註的 raw ChartQA 圖片,短答與解釋模式都得到正確結果,避免展示圖上的答案文字造成洩漏。
每一階段,
都有可追溯產物。
模型、量化權重、完整評估與 benchmark 都保存在 Hugging Face Hub;不是只有一張結果截圖。
LIVE INFERENCE / COLAB A100
把你的圖表
交給模型讀。
開啟 notebook 後選擇 A100 runtime,確認 Colab Secret 已設定 `HF_TOKEN`,再按「全部執行」。最後一格會產生暫時的 Gradio 分享網址。