08BCHART/OPS · QWEN3-VL

Visual analysis terminal / 2026

問圖表,讓數據回答。

從 15,000 筆 ChartQA QLoRA fine-tuning,到完整 2,500 題品質驗證、AWQ 量化與 A100 vLLM serving benchmark。每個部署決策,都有數據可以追溯。

PROJECT STATUSPhase 6 · Complete
PUBLIC SPACEStatic · Running
LIVE INFERENCEColab · A100
執行說明:這是免費、持久的成果展示頁,不會在瀏覽器偷偷下載 8B 權重。互動推論請開啟上方 notebook,在 Colab 選擇 A100 後按「全部執行」。
01 / PROOF

量化不是猜測,
是有門檻的決策。

AWQ 必須在完整 ChartQA test set 上,相對 merged 16-bit 掉分不超過 2 個百分點,才能進入 serving benchmark。

AWQ overalln = 2,500
85.52%

完整 human + augmented test set 的正式 relaxed accuracy。

Quantization ΔPASS
−0.72 pp

低於預先定義的 −2 pp 品質門檻;paired bootstrap 95% CI 為 [−1.40, −0.04] pp。

Weight files−56.9%
7.55 GB

由 merged 16-bit 的 17.53 GB 壓縮至 AWQ W4A16 g32。

註:微調前後表與 merged/AWQ 量化表使用不同的 paired evaluation stack,分數只在各自表內比較,不跨 stack 排名。
02 / SERVING

壓縮之後,
速度真的變快。

同一張 A100-SXM4-40GB、同一組多模態 workload、固定 64-token decode;merged 16-bit 與 AWQ 各測 concurrency 1/4/8/16,8 組全部 64/64 成功。

Merged 16-bit 與 AWQ 在不同 concurrency 的 output throughput、TTFT p95 和 TPOT p95 曲線
Run v2-aa4442870cfd · vLLM 0.25.1+cu129 · measured-window JIT gate PASS
+83.2%concurrency 1 output throughput
−51.9%concurrency 1 TPOT p95
701.9tokens/s at concurrency 16
03 / PIPELINE

從資料到部署,
完整走完一輪。

訓練、評估、量化與 serving 各自隔離,產物透過 pinned revision 銜接,避免把環境差異誤認為模型改善。

01

ChartQA 資料

15,000 筆 train;human/augmented 分層保留。

02

QLoRA 微調

Qwen3-VL-8B · rank 16 · 1 epoch · A100。

03

完整評估

2,500 題 relaxed accuracy 與 paired predictions。

04

AWQ W4A16

group size 32;vision tower 與 lm_head 保持原精度。

05

vLLM Benchmark

快取隔離、獨立 server、固定 workload 與 validity gate。

06

GGUF 發布

Q4_K_M text + Q8_0 mmproj;llama.cpp CPU smoke PASS。

04 / CASE

改善,落在
具體的一題上。

ChartQA 案例:詢問兩個最小值的乘積,微調前回答 72,微調後正確回答 96

讀出 8 與 12,
再算出 96。

這題要求從兩組色條中找出最小值並相乘。微調前模型輸出 72;fine-tuned model 正確抓到兩個數值並回答 96。

GOLD96REFERENCE
BEFORE72WRONG
AFTER96CORRECT

公開 demo 驗收時重新載入不含標註的 raw ChartQA 圖片,短答與解釋模式都得到正確結果,避免展示圖上的答案文字造成洩漏。

LIVE INFERENCE / COLAB A100

把你的圖表
交給模型讀。

開啟 notebook 後選擇 A100 runtime,確認 Colab Secret 已設定 `HF_TOKEN`,再按「全部執行」。最後一格會產生暫時的 Gradio 分享網址。