chunkformer-large-vie (mirror)

Mirror của khanhld/chunkformer-large-vie — ASR tiếng Việt kiến trúc ChunkFormer (~110M params, CTC, chunk-based encoder, decode long-form không giới hạn độ dài). Mirror giữ nguyên trọng số, phục vụ voice-bench. Model gốc: Khanh Le (khanhld), license CC-BY-NC-4.0. Paper: ICASSP 2025.

Số đo voice-bench (Mac Mini M4 24GB, CPU)

Eval WER Latency
VIVOS-test 50 clips 5.50% (CER 2.91%) p50 0.17s / p90 0.18s
Long-form 195.6s (1 request, endless_decode) 6.61% RTF 0.073
VietMed 38 clips (hội thoại y tế) 18.81%* p50 0.30s

So sánh cùng harness: bằng PhoWhisper-large-ct2 trên VIVOS (5.50%) nhưng nhanh hơn 45×; không bị floor padding 30s của whisper — model duy nhất đạt <500ms với WER <10% trên CPU M4.

*Caveat: model này train trên hầu hết dataset VN công khai kể cả VietMed_labeled và VIVOS (xem model card gốc), nên số VietMed KHÔNG chứng minh ưu thế out-of-domain so với PhoWhisper (small 22.20%, large 25.12% — không có VietMed trong train). Đánh giá OOD sạch cần audio tự thu.

Dùng

# pip install chunkformer
from chunkformer import ChunkFormerModel

model = ChunkFormerModel.from_pretrained("vudang449/chunkformer-large-vie")
text = model.batch_decode(["audio.wav"])[0]          # clip ngắn
long = model.endless_decode("long.wav", return_timestamps=False)  # file dài
Downloads last month
10
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support

Model tree for vudang449/chunkformer-large-vie

Finetuned
(1)
this model