GGUF
Collection
7 items β’ Updated
How to use Renesas/Qwen3-ASR-1.7B-GGUF with llama.cpp:
curl -LsSf https://llama.app/install.sh | sh # Start a local OpenAI-compatible server with a web UI: llama serve -hf Renesas/Qwen3-ASR-1.7B-GGUF # Run inference directly in the terminal: llama cli -hf Renesas/Qwen3-ASR-1.7B-GGUF
winget install llama.cpp # Start a local OpenAI-compatible server with a web UI: llama serve -hf Renesas/Qwen3-ASR-1.7B-GGUF # Run inference directly in the terminal: llama cli -hf Renesas/Qwen3-ASR-1.7B-GGUF
# Download pre-built binary from: # https://github.com/ggerganov/llama.cpp/releases # Start a local OpenAI-compatible server with a web UI: ./llama-server -hf Renesas/Qwen3-ASR-1.7B-GGUF # Run inference directly in the terminal: ./llama-cli -hf Renesas/Qwen3-ASR-1.7B-GGUF
git clone https://github.com/ggerganov/llama.cpp.git cd llama.cpp cmake -B build cmake --build build -j --target llama-server llama-cli # Start a local OpenAI-compatible server with a web UI: ./build/bin/llama-server -hf Renesas/Qwen3-ASR-1.7B-GGUF # Run inference directly in the terminal: ./build/bin/llama-cli -hf Renesas/Qwen3-ASR-1.7B-GGUF
docker model run hf.co/Renesas/Qwen3-ASR-1.7B-GGUF
How to use Renesas/Qwen3-ASR-1.7B-GGUF with Ollama:
ollama run hf.co/Renesas/Qwen3-ASR-1.7B-GGUF
How to use Renesas/Qwen3-ASR-1.7B-GGUF with Docker Model Runner:
docker model run hf.co/Renesas/Qwen3-ASR-1.7B-GGUF
How to use Renesas/Qwen3-ASR-1.7B-GGUF with Lemonade:
# Download Lemonade from https://lemonade-server.ai/ lemonade pull Renesas/Qwen3-ASR-1.7B-GGUF
lemonade run user.Qwen3-ASR-1.7B-GGUF-{{QUANT_TAG}}lemonade list
This repository contains Qwen3-ASR-1.7B model, which support language identification and speech recognition for 30 languages and 22 Chinese dialects, optimized for Renesas X5H platform for automatic speech recognition inference.
Model Summary:
Audio Encoder:
| Parameter | Value |
|---|---|
| NUM_LAYERS | 24 |
| HIDDEN_SIZE | 1024 |
| FFN_DIM | 4096 |
| NUM_HEADS | 16 |
| HEAD_DIM | 64 |
| MEL_BINS | 128 |
| OUTPUT_DIM | 2048 |
Text Decoder:
| Parameter | Value |
|---|---|
| NUM_LAYERS | 28 |
| HIDDEN_SIZE | 2048 |
| FFN_DIM | 6144 |
| NUM_HEADS | 16 |
| NUM_KV_HEADS | 8 |
| HEAD_DIM | 128 |
| GROUP_SIZE | 2 |
| VOCAB_SIZE | 151936 |
| RMS_NORM_EPS | 1e-6 |
| ROPE_THETA | 1000000.0 |
Source Model: Qwen/Qwen3-ASR-1.7B
The following performance metrics were measured with a 15-second English audio sample.
| Model | Precision | Device | Offloading | Prefill Rate (tokens/sec) Batch size=1 | Decode Rate (tokens/sec) |
|---|---|---|---|---|---|
| Qwen3-ASR-1.7B | W4A16 | X5H - Single Cluster NPX | AudioEncode [NPX] LLM Decoder [NPX] | 20.84 | 20.71 |
| Qwen3-ASR-1.7B | FP16 | X5H - Single Cluster NPX | AudioEncode [NPX] LLM Decoder [NPX] | 12.28 | 12.23 |
To run model, you need:
bash ./qwen3-asr-w4a16-runner-0.1.0-Linux.sh --prefix=./ --exclude-subdir --skip-license
qwen3-asr-w4a16-runner
βββ Qwen3-ASR-1.7B-FP16.gguf
βββ mmproj-Qwen3-ASR-1.7b-FP16.gguf
βββ firmwares
βββ kernel_modules
βββ qwen3-asr-w4a16
βββ qwen3-asr-w4a16-runner
βββ scripts
βββ setup_npu.sh
βββ test_audio
βββ sample_en.wav
bash ./setup_npu.sh
./qwen3-asr-w4a16-runner -m Qwen3-ASR-1.7B-FP16.gguf -v mmproj-Qwen3-ASR-1.7b-FP16.gguf -w test_audio/sample_en.wav -g ./ -s
bash ./qwen3-asr-runner-0.1.0-Linux.sh --prefix=./ --exclude-subdir --skip-license
qwen3-asr-runner
βββ Qwen3-ASR-1.7B-FP16.gguf
βββ mmproj-Qwen3-ASR-1.7b-FP16.gguf
βββ firmwares
βββ kernel_modules
βββ qwen3-asr
βββ qwen3-asr-runner
βββ scripts
βββ setup_npu.sh
βββ test_audio
βββ sample_en.wav
bash ./setup_npu.sh
./qwen3-asr-runner -m Qwen3-ASR-1.7B-FP16.gguf -v mmproj-Qwen3-ASR-1.7b-FP16.gguf -w test_audio/sample_en.wav -g ./ -s
We're not able to determine the quantization variants.
Base model
Qwen/Qwen3-ASR-1.7B