frames·cloud

VibeVoice-ASR

microsoft-vibevoice-asr

fields

nameREQ VibeVoice-ASR github.com 2026-05-05
vendorREQ Microsoft github.com 2026-05-05
released_at 2026-01-21 github.com 2026-05-05
modality audio github.com 2026-05-05
access open-weights github.com 2026-05-05
context_window 65536 github.com 2026-05-05
parameters 7B github.com 2026-05-05
benchmark_score
benchmark_name
announcement_url https://github.com/microsoft/VibeVoice github.com 2026-05-05

history · 8 fields · 8 revisions

name1 revision
VibeVoice-ASR current github.com · 2026-05-05
VibeVoice-ASR: a 7B-parameter speech recognition model that processes up to 60 minutes (64K-token context) of continuous audio in a single inference pass, released January 21 2026. Built on Qwen2.5 base with continuous speech tokenizers at 7.5 Hz frame rate. Integrated into Hugging Face Transformers on March 6, 2026.
vendor1 revision
Microsoft current github.com · 2026-05-05
VibeVoice-ASR: a 7B-parameter speech recognition model that processes up to 60 minutes (64K-token context) of continuous audio in a single inference pass, released January 21 2026. Built on Qwen2.5 base with continuous speech tokenizers at 7.5 Hz frame rate. Integrated into Hugging Face Transformers on March 6, 2026.
released_at1 revision
2026-01-21 current github.com · 2026-05-05
VibeVoice-ASR: a 7B-parameter speech recognition model that processes up to 60 minutes (64K-token context) of continuous audio in a single inference pass, released January 21 2026. Built on Qwen2.5 base with continuous speech tokenizers at 7.5 Hz frame rate. Integrated into Hugging Face Transformers on March 6, 2026.
modality1 revision
audio current github.com · 2026-05-05
VibeVoice-ASR: a 7B-parameter speech recognition model that processes up to 60 minutes (64K-token context) of continuous audio in a single inference pass, released January 21 2026. Built on Qwen2.5 base with continuous speech tokenizers at 7.5 Hz frame rate. Integrated into Hugging Face Transformers on March 6, 2026.
access1 revision
open-weights current github.com · 2026-05-05
VibeVoice-ASR: a 7B-parameter speech recognition model that processes up to 60 minutes (64K-token context) of continuous audio in a single inference pass, released January 21 2026. Built on Qwen2.5 base with continuous speech tokenizers at 7.5 Hz frame rate. Integrated into Hugging Face Transformers on March 6, 2026.
context_window1 revision
65536 current github.com · 2026-05-05
VibeVoice-ASR: a 7B-parameter speech recognition model that processes up to 60 minutes (64K-token context) of continuous audio in a single inference pass, released January 21 2026. Built on Qwen2.5 base with continuous speech tokenizers at 7.5 Hz frame rate. Integrated into Hugging Face Transformers on March 6, 2026.
parameters1 revision
7B current github.com · 2026-05-05
VibeVoice-ASR: a 7B-parameter speech recognition model that processes up to 60 minutes (64K-token context) of continuous audio in a single inference pass, released January 21 2026. Built on Qwen2.5 base with continuous speech tokenizers at 7.5 Hz frame rate. Integrated into Hugging Face Transformers on March 6, 2026.
announcement_url1 revision
https://github.com/microsoft/VibeVoice current github.com · 2026-05-05
VibeVoice-ASR: a 7B-parameter speech recognition model that processes up to 60 minutes (64K-token context) of continuous audio in a single inference pass, released January 21 2026. Built on Qwen2.5 base with continuous speech tokenizers at 7.5 Hz frame rate. Integrated into Hugging Face Transformers on March 6, 2026.