wenhongquan fea1abeb4e fix 4 ماه پیش
..
client fea1abeb4e fix 4 ماه پیش
whisper_asr fea1abeb4e fix 4 ماه پیش
README.md fea1abeb4e fix 4 ماه پیش
requirements.txt fea1abeb4e fix 4 ماه پیش
startclient.sh fea1abeb4e fix 4 ماه پیش
startserver.sh fea1abeb4e fix 4 ماه پیش

README.md

Whisper Qt Client

Real-time speech recognition client using Qwen3-ASR / Whisper and Qt.

Requirements

Python Dependencies

pip install -r requirements.txt

Qt Requirements

  • Qt 6.x
  • CMake 3.16+
  • C++17 compiler

Quick Start

1. Start ASR Server (Default: Qwen3-ASR)

cd whisper-qt-client
source venv/bin/activate
python -m whisper_asr.server --model qwen --port 8765

2. Build Qt Client

cd client
mkdir build && cd build
cmake ..
make

3. Run

./whisper_client  # or whisper_client.exe on Windows

Model Support

Model Type Languages Memory
Qwen/Qwen3-ASR-1.7B Qwen 52+ languages ~6GB
Whisper small Faster-Whisper Multilingual ~2GB

Usage

Qwen3-ASR (Default)

python -m whisper_asr.server --model qwen --port 8765

Whisper

python -m whisper_asr.server --model whisper --size small --port 8765

Architecture

┌──────────────┐     WebSocket      ┌──────────────┐
│  Qt Client   │ ◄───────────────► │ ASR Server   │
│              │                    │              │
│  - UI        │                    │ Qwen3-ASR    │
│  - Audio In  │                    │    or        │
└──────────────┘                    │ Faster-Whisper│
                                    └──────────────┘

API

WebSocket Endpoint

ws://localhost:8765

Message Format (Client → Server)

{
  "type": "audio",
  "data": "<base64 encoded PCM16 audio>"
}

Message Format (Server → Client)

{
  "type": "transcript",
  "text": "识别结果文本",
  "language": "zh",
  "segments": []
}

License

MIT