VibeVoice-ASR
microsoft-vibevoice-asr
fields
| nameREQ | VibeVoice-ASR | github.com | 2026-05-05 |
| vendorREQ | Microsoft | github.com | 2026-05-05 |
| released_at | 2026-01-21 | github.com | 2026-05-05 |
| modality | audio | github.com | 2026-05-05 |
| access | open-weights | github.com | 2026-05-05 |
| context_window | 65536 | github.com | 2026-05-05 |
| parameters | 7B | github.com | 2026-05-05 |
| benchmark_score | |||
| benchmark_name | |||
| announcement_url | https://github.com/microsoft/VibeVoice | github.com | 2026-05-05 |
history · 8 fields · 8 revisions
name1 revision
VibeVoice-ASR
current
VibeVoice-ASR: a 7B-parameter speech recognition model that processes up to 60 minutes (64K-token context) of continuous audio in a single inference pass, released January 21 2026. Built on Qwen2.5 base with continuous speech tokenizers at 7.5 Hz frame rate. Integrated into Hugging Face Transformers on March 6, 2026.
vendor1 revision
Microsoft
current
VibeVoice-ASR: a 7B-parameter speech recognition model that processes up to 60 minutes (64K-token context) of continuous audio in a single inference pass, released January 21 2026. Built on Qwen2.5 base with continuous speech tokenizers at 7.5 Hz frame rate. Integrated into Hugging Face Transformers on March 6, 2026.
released_at1 revision
2026-01-21
current
VibeVoice-ASR: a 7B-parameter speech recognition model that processes up to 60 minutes (64K-token context) of continuous audio in a single inference pass, released January 21 2026. Built on Qwen2.5 base with continuous speech tokenizers at 7.5 Hz frame rate. Integrated into Hugging Face Transformers on March 6, 2026.
modality1 revision
audio
current
VibeVoice-ASR: a 7B-parameter speech recognition model that processes up to 60 minutes (64K-token context) of continuous audio in a single inference pass, released January 21 2026. Built on Qwen2.5 base with continuous speech tokenizers at 7.5 Hz frame rate. Integrated into Hugging Face Transformers on March 6, 2026.
access1 revision
open-weights
current
VibeVoice-ASR: a 7B-parameter speech recognition model that processes up to 60 minutes (64K-token context) of continuous audio in a single inference pass, released January 21 2026. Built on Qwen2.5 base with continuous speech tokenizers at 7.5 Hz frame rate. Integrated into Hugging Face Transformers on March 6, 2026.
context_window1 revision
65536
current
VibeVoice-ASR: a 7B-parameter speech recognition model that processes up to 60 minutes (64K-token context) of continuous audio in a single inference pass, released January 21 2026. Built on Qwen2.5 base with continuous speech tokenizers at 7.5 Hz frame rate. Integrated into Hugging Face Transformers on March 6, 2026.
parameters1 revision
7B
current
VibeVoice-ASR: a 7B-parameter speech recognition model that processes up to 60 minutes (64K-token context) of continuous audio in a single inference pass, released January 21 2026. Built on Qwen2.5 base with continuous speech tokenizers at 7.5 Hz frame rate. Integrated into Hugging Face Transformers on March 6, 2026.
announcement_url1 revision
https://github.com/microsoft/VibeVoice
current
VibeVoice-ASR: a 7B-parameter speech recognition model that processes up to 60 minutes (64K-token context) of continuous audio in a single inference pass, released January 21 2026. Built on Qwen2.5 base with continuous speech tokenizers at 7.5 Hz frame rate. Integrated into Hugging Face Transformers on March 6, 2026.