Use when routing Alibaba Cloud Model Studio requests to the right local skill (Qwen text, coder, deep research, image, video, audio, search and multimodal sk...
Design & media
Alibaba Cloud AI Multimodal Qwen Omni
Try itUse when tasks require all-in-one multimodal understanding or generation with Alibaba Cloud Model Studio Qwen Omni models, including image-plus-audio interac...
What it does
Use when tasks require all-in-one multimodal understanding or generation with Alibaba Cloud Model Studio Qwen Omni models, including image-plus-audio interac...
The skill document
Category: provider
Model Studio Qwen Omni
Validation
mkdir -p output/aliyun-qwen-omni
python -m py_compile skills/ai/multimodal/aliyun-qwen-omni/scripts/prepare_omni_request.py && echo "py_compile_ok" > output/aliyun-qwen-omni/validate.txt
Pass criteria: command exits 0 and output/aliyun-qwen-omni/validate.txt is generated.
Critical model names
Use one of these exact model strings:
qwen3-omni-flashqwen3-omni-flash-realtimeqwen-omni-turboqwen-omni-turbo-realtime
Typical use
- Image + audio + text assistant
- Realtime multimodal agents
- Spoken responses grounded in visual input
Normalized interface (omni.chat)
Request
model(string, optional): defaultqwen3-omni-flashtext(string, optional)image(string, optional)audio(string, optional)response_modalities(array, optional): e.g.["text"],["text","audio"]
Response
text(string, optional)audio_urloraudio_chunk(optional)usage(object, optional)
Quick start
python skills/ai/multimodal/aliyun-qwen-omni/scripts/prepare_omni_request.py \
--output output/aliyun-qwen-omni/request.json
References
references/sources.md
Related skills
Use when understanding images with Alibaba Cloud Model Studio Qwen VL models (qwen3-vl-plus/qwen3-vl-flash and latest aliases). Use when building image Q&A,...
Use when real-time speech synthesis is needed with Alibaba Cloud Model Studio Qwen TTS Realtime models. Use when low-latency interactive speech is required,...
Route Alibaba Cloud Model Studio requests to the right local skill (Qwen Image, Qwen Image Edit, Wan Video, Wan R2V, Qwen TTS, Qwen ASR and advanced TTS vari...
Use when a task needs Alibaba Cloud Model Studio Qwen Deep Research models to plan multi-step investigation, run iterative web research, and produce structur...
Use when generating human-like speech audio with Model Studio DashScope Qwen TTS models (qwen3-tts-flash, qwen3-tts-instruct-flash). Use when converting text...