Use when routing Alibaba Cloud Model Studio requests to the right local skill (Qwen text, coder, deep research, image, video, audio, search and multimodal sk...
设计与多媒体
Alibaba Cloud AI Multimodal Qwen Omni
试用Use when tasks require all-in-one multimodal understanding or generation with Alibaba Cloud Model Studio Qwen Omni models, including image-plus-audio interac...
它能做什么
Use when tasks require all-in-one multimodal understanding or generation with Alibaba Cloud Model Studio Qwen Omni models, including image-plus-audio interac...
技能文档
Category: provider
Model Studio Qwen Omni
Validation
mkdir -p output/aliyun-qwen-omni
python -m py_compile skills/ai/multimodal/aliyun-qwen-omni/scripts/prepare_omni_request.py && echo "py_compile_ok" > output/aliyun-qwen-omni/validate.txt
Pass criteria: command exits 0 and output/aliyun-qwen-omni/validate.txt is generated.
Critical model names
Use one of these exact model strings:
qwen3-omni-flashqwen3-omni-flash-realtimeqwen-omni-turboqwen-omni-turbo-realtime
Typical use
- Image + audio + text assistant
- Realtime multimodal agents
- Spoken responses grounded in visual input
Normalized interface (omni.chat)
Request
model(string, optional): defaultqwen3-omni-flashtext(string, optional)image(string, optional)audio(string, optional)response_modalities(array, optional): e.g.["text"],["text","audio"]
Response
text(string, optional)audio_urloraudio_chunk(optional)usage(object, optional)
Quick start
python skills/ai/multimodal/aliyun-qwen-omni/scripts/prepare_omni_request.py \
--output output/aliyun-qwen-omni/request.json
References
references/sources.md
相关技能
Use when understanding images with Alibaba Cloud Model Studio Qwen VL models (qwen3-vl-plus/qwen3-vl-flash and latest aliases). Use when building image Q&A,...
Use when real-time speech synthesis is needed with Alibaba Cloud Model Studio Qwen TTS Realtime models. Use when low-latency interactive speech is required,...
Route Alibaba Cloud Model Studio requests to the right local skill (Qwen Image, Qwen Image Edit, Wan Video, Wan R2V, Qwen TTS, Qwen ASR and advanced TTS vari...
Use when a task needs Alibaba Cloud Model Studio Qwen Deep Research models to plan multi-step investigation, run iterative web research, and produce structur...
Use when generating human-like speech audio with Model Studio DashScope Qwen TTS models (qwen3-tts-flash, qwen3-tts-instruct-flash). Use when converting text...