08BCHART/OPS · QWEN3-VL

Visual analysis terminal / 2026

問圖表,讓數據回答。

從 15,000 筆 ChartQA QLoRA fine-tuning,到完整 2,500 題品質驗證、AWQ 量化與 A100 vLLM serving benchmark。每個部署決策,都有數據可以追溯。

PROJECT STATUSPhase 6 · Complete
PUBLIC SPACEStatic · Running
LIVE INFERENCEColab · A100
執行說明:這是免費、持久的成果展示頁,不會在瀏覽器偷偷下載 8B 權重。互動推論請開啟上方 notebook,在 Colab 選擇 A100 後按「全部執行」。
01 / PROOF

量化不是猜測,
是有門檻的決策。

AWQ 必須在完整 ChartQA test set 上,相對 merged 16-bit 掉分不超過 2 個百分點,才能進入 serving benchmark。

AWQ overalln = 2,500
85.52%

完整 human + augmented test set 的正式 relaxed accuracy。

Quantization ΔPASS
−0.72 pp

點估計下降 0.72 pp,通過 2 pp 品質門檻。歷史報告的 bootstrap 95% CI 為 [−1.40, −0.04] pp;repo 缺少重抽樣參數,離線檢查未驗證此區間。

Weight files−56.9%
7.55 GB

由 merged 16-bit 的 17.53 GB 壓縮至 AWQ W4A16 g32。

微調比較為 84.68% → 85.24%(4-bit base + LoRA);量化比較為 86.24% → 85.52%(merged/AWQ、獨立 vLLM)。來源程式的影像處理與排序不同,微調 run 版本紀錄不完整;不能將 1.00 pp 差距歸因於單一因素。離線正誤統計檢查不等同重新評分或驗證所有宣稱。
02 / SERVING

壓縮之後,
速度真的變快。

同一張 A100-SXM4-40GB、同一組多模態 workload、固定 64-token decode;merged 16-bit 與 AWQ 各測 concurrency 1/4/8/16,8 組全部 64/64 成功。

Merged 16-bit 與 AWQ 在不同 concurrency 的 output throughput、TTFT p95 和 TPOT p95 曲線
Run v2-aa4442870cfd · vLLM 0.25.1+cu129 · measured-window JIT gate PASS
+83.2%concurrency 1 output throughput
−51.9%concurrency 1 TPOT p95
701.9tokens/s at concurrency 16

限制:每組只有 64 requests,p95 為探索性結果;固定 64 output tokens 並忽略 EOS,不代表自然短答負載。結果僅適用於這次單 A100、vLLM 0.25.1+cu129 與固定版本測試。AWQ 的 TTFT p95 在 concurrency 4/8/16 退步 +9.0%/+20.9%/+18.8%,不能只依吞吐量決定服務設定。

03 / PIPELINE

從資料到部署,
完整走完一輪。

訓練、評估、量化與 serving 分階段保存證據;量化與 benchmark 記錄 pinned revision,微調評測仍有版本追溯缺口。

01

ChartQA 資料

15,000 筆 train;human/augmented 分層保留。

02

QLoRA 微調

Qwen3-VL-8B · rank 16 · 1 epoch · A100。

03

完整評估

2,500 題 relaxed accuracy 與不含內容的逐題正確性證據。

04

AWQ W4A16

group size 32;vision tower 與 lm_head 保持原精度。

05

vLLM Benchmark

快取隔離、獨立 server、固定 workload 與 validity gate。

06

GGUF 發布

Q4_K_M text + Q8_0 mmproj;llama.cpp CPU smoke PASS。

04 / CASE

安全公開,
不靠資料集截圖。

完全由本專案生成的合成堆疊長條圖

公開示範,
只用自製合成圖表。

這張堆疊長條圖由本 repository 的 deterministic generator 產生,用來展示算術型圖表問答輸入,不包含 ChartQA 影像、題目、標籤或模型輸出。

SOURCEsynthetic-ood-v1OWNED
SKILLarithmeticOOD
LICENSEMITPUBLIC

模型完整品質結論來自 2,500 題 aggregate metrics 與內容無關的 per-item correctness evidence;這張圖只是可安全公開的 UI 範例,不冒充額外 benchmark。

LIVE INFERENCE / COLAB A100

把你的圖表
交給模型讀。

開啟 notebook 後選擇 A100 runtime,確認 Colab Secret 已設定 `HF_TOKEN`,再按「全部執行」。最後一格會產生暫時的 Gradio 分享網址。