编程

opensource-llm-models

试用

开源大模型综合技能 - 覆盖国内外主流开源LLM的选型、部署、调优、API调用。国产: DeepSeek/Qwen/ChatGLM/Yi/MiniMax/Baichuan/Kimi。国际: Llama/Mistral/Gemma/Phi/Falcon/Granite/DBRX

它能做什么

开源大模型综合技能 - 覆盖国内外主流开源LLM的选型、部署、调优、API调用。国产: DeepSeek/Qwen/ChatGLM/Yi/MiniMax/Baichuan/Kimi。国际: Llama/Mistral/Gemma/Phi/Falcon/Granite/DBRX

技能文档

开源大模型综合技能

一、模型全景

国内开源 (China)

模型公司架构参数量上下文核心优势许可证
DeepSeek V3/R1深度求索MoE (671B, 37B激活)671B128K推理天花板, 数学/代码极强, 成本极低MIT
Qwen3阿里巴巴Dense0.5B-236B128K-1M多模态全覆盖, 中文最优, 工具调用强Apache 2.0
ChatGLM-4智谱AIDense9B-130B128K中文理解深, 工具调用原生, 企业级Apache 2.0
Yi-1.5/34B零一万物Dense6B-34B200K长上下文, 推理精准, 数学好Apache 2.0
MiniMax-Text-01MiniMaxMoE (456B, 45.9B激活)456B1M超长上下文, 线性注意力, 成本低MIT
Baichuan-4百川智能Dense7B-13B128K医疗/法律垂直领域, 安全过滤Apache 2.0
Kimi (K2/K3)月之暗面MoE (1T+, 稀疏激活)1T+128KAgent/子Agent架构, 长上下文, 多模态MIT

国际开源 (Global)

模型公司架构参数量上下文核心优势许可证
Llama 4MetaMoE (17B-2T)17B-2T128K-1M生态最完善, 社区最强, 微调资源最多Llama 4 Community
Mistral/MixtralMistral AIMoE (8x7B-8x22B)7B-141B32K-128K效率极高, 代码强, 部署友好Apache 2.0
Gemma 3/4GoogleDense2B-27B8K-128K轻量级, 单GPU可跑, 安全对齐好Gemma
Phi-3/4MicrosoftDense3.8B-14B128K小模型推理天花板, 端侧部署MIT
Falcon 2TIIDense11B-180B8K-128K多语言, 阿拉伯语, 企业级Apache 2.0
Granite 3IBMDense3B-34B128K企业级代码, RAG, 安全合规Apache 2.0
DBRXDatabricksMoE (132B, 36B激活)132B32KMoE架构, 推理快, 代码好Databricks

二、选型指南

按场景推荐

场景推荐模型理由
推理/数学/逻辑DeepSeek R1 > Llama 4 > Qwen3DeepSeek推理专用, 数学SOTA
中文对话/创作Qwen3 > ChatGLM-4 > DeepSeek V3Qwen中文最优, ChatGLM理解深
代码生成DeepSeek V3 > Qwen3-Coder > Mistral-CodestralDeepSeek代码评测第一
多模态(图/视频)Qwen3-VL > Llama 4 > Gemma 3Qwen多模态覆盖面最广
长文档分析MiniMax-Text-01 > Yi-1.5 > KimiMiniMax 1M上下文, 线性注意力
Agent/工具调用Kimi K3 > Qwen3 > ChatGLM-4Kimi原生子Agent架构
端侧部署Phi-4 > Gemma 3 > Qwen3-0.5B小模型推理天花板的Phi
企业级安全Granite 3 > Falcon 2 > ChatGLM-4IBM安全合规, 智谱企业级
成本敏感DeepSeek V3 > MiniMax > MixtralDeepSeek推理成本极低

按部署方式

本地部署 (单GPU):
  Phi-4 (14B) → Gemma 3 (12B) → Qwen3 (7B) → Mistral (7B)

本地部署 (多GPU/显存):
  DeepSeek R1 (671B quant) → Llama 4 (70B) → Mixtral (8x22B) → Qwen3 (72B)

API调用:
  DeepSeek (最便宜) → Qwen (阿里云) → ChatGLM (智谱) → Yi (零一)

三、API 调用模板

DeepSeek

import openai
client = openai.OpenAI(
    api_key="sk-xxx",
    base_url="https://api.deepseek.com/v1",
)
response = client.chat.completions.create(
    model="deepseek-chat",
    messages=[{"role": "user", "content": "你好"}],
    temperature=0.7,
)

Qwen (阿里云)

from openai import OpenAI
client = OpenAI(
    api_key="sk-xxx",
    base_url="https://dashscope.aliyuncs.com/compatible-mode/v1",
)
response = client.chat.completions.create(
    model="qwen3-72b-instruct",
    messages=[{"role": "user", "content": "你好"}],
)

ChatGLM (智谱)

from zhipuai import ZhipuAI
client = ZhipuAI(api_key="xxx")
response = client.chat.completions.create(
    model="glm-4-plus",
    messages=[{"role": "user", "content": "你好"}],
)

统一路由 (多模型切换)

# 使用 openclaw-aisa-llm-router 或 asia-llm-router-skills
# 一个API Key 切换70+模型
ROUTER_BASE = "https://api.aisa.com/v1"

client = OpenAI(
    api_key="sk-xxx",
    base_url=ROUTER_BASE,
)

# 根据任务切换模型
def pick_model(task_type: str) -> str:
    models = {
        "reasoning": "deepseek-r1",
        "chat": "qwen3-72b-instruct",
        "code": "deepseek-chat",
        "vision": "qwen3-vl",
        "agent": "kimi-k3",
        "cheap": "deepseek-chat",
    }
    return models.get(task_type, "qwen3-72b-instruct")

四、本地部署

Ollama (推荐)

# 安装
ollama pull deepseek-r1
ollama pull qwen3:72b
ollama pull llama4
ollama pull mistral
ollama pull phi-4
ollama pull gemma3

# 运行
ollama run deepseek-r1

LM Studio (Windows)

# 下载GGUF模型
# 支持: DeepSeek R1, Qwen3, Llama 4, Mistral, Phi-4, Gemma 3
# 本地API: http://localhost:1234/v1

llama.cpp

# 编译
git clone https://github.com/ggerganov/llama.cpp
cd llama.cpp && cmake -B build && cmake --build build --config Release

# 运行
./build/bin/llama-cli -m model.gguf -p "你好" -n 512

五、模型路由策略

成本优先

# 简单任务 → 便宜模型
# 复杂任务 → 强模型
# 推理任务 → DeepSeek R1
# 多模态任务 → Qwen3-VL

质量优先

# 中文 → Qwen3-72B
# 英文 → Llama 4-70B
# 代码 → DeepSeek V3
# 推理 → DeepSeek R1
# Agent → Kimi K3

速度优先

# DeepSeek V3 (Flash) → 极快
# Qwen3-7B → 本地快
# Phi-4 → 端侧快
# Mistral 7B → 轻量快

六、最佳实践

1. 模型选择四步法

  1. 确定任务类型(推理/代码/创作/分析/Agent)
  2. 确定部署约束(API/本地/端侧)
  3. 确定成本预算(免费/低成本/高成本)
  4. 匹配最优模型

2. 降本策略

  • 简单任务用便宜模型(DeepSeek Chat)
  • 批量任务用路由缓存
  • 本地部署长尾任务
  • 使用量化模型(GGUF q4/q8)

3. 质量提升

  • 推理用 DeepSeek R1(思维链)
  • 中文用 Qwen3(中文理解最好)
  • 代码用 DeepSeek Coder(代码评测第一)
  • Agent用 Kimi K3(原生子Agent架构)

4. 模型切换时机

  • 普通问答 → DeepSeek Chat / Qwen3
  • 复杂推理 → DeepSeek R1
  • 代码生成 → DeepSeek Coder / Mistral Codestral
  • 多模态 → Qwen3-VL / Llama 4
  • 长文档 → MiniMax / Yi
  • Agent任务 → Kimi K3 / Qwen3

七、参考资源

国内模型

国际模型

部署资源

相关技能

国产大模型统一路由。把 DeepSeek、通义千问、智谱 GLM、Kimi、腾讯混元、字节豆包、百度文心、讯飞星火、MiniMax、零一万物 Yi、百川、阶跃 Step 等 12 家国产大模型 + Qwen-VL/GLM-4V/豆包视觉 3 家视觉模型收敛成一个命令入口;支持文本 + 图片多模态任务路由;按任务类型(代码/推理/长文/翻译/摘要/抽取/图像识别)结合能力画像自动或手动选择最合适、最省钱的模型;支持流式输出、自动统计跨厂商 token 成本、硬件自适应限流(不拖累电脑)、本地语义缓存省 token、全链路离线 Mock 调试、技能更新提醒。当用户需要「调用国产大模型」「多模型比价/降本」「统一管理多个模型 Key」「本地跑大模型路由」「不想被某一家厂商绑定」「识别图片/音频内容」时使用。

开源大模型行为蒸馏技能 - 将DeepSeek/Qwen/ChatGLM/Yi/MiniMax/Kimi/Llama/Mistral/Gemma/Phi等15个模型的核心理念蒸馏为可复用智能体行为模块

1 次安装

OpenAI-compatible LLM gateway for AI agents — point your OpenAI client's base_url here and pay per call in USDC via x402 (Base or Solana) or a funded key. 17...

1 次安装

面向团队与企业用户的 llm-provider API 全功能管理工具。核心能力: - 涵盖免费版全部能力(对话补全、图像生成、助手管理) - 批量任务(Batch API)大规模异步处理 - 模型微调(Fine-tuning)定制化训练 - 评估(Evaluations)质量度量与回归测试 - 向量存储(Vector Stores)高级检索与 RAG - 视频生成与异步任务管理 - 容器(Containers)隔离执行环境 - 审计日志与团队权限管理 适用场景: - 企业级内容生产与自动化流水线 - ...

查询大模型调用排行榜数据,数据来源证券之星科技频道(tech.stockstar.com), 提供日榜和周榜两个周期,覆盖各主流大模型的调用量(Tokens)排名、 厂商(模型发布方)、变动百分比、涨跌方向和新上榜标记。 支持查看完整榜单、前 N 名、按模型/厂商搜索定位。 触发词:调用排行榜、排行榜、日榜、周榜、大模型、模型调用量、 Tokens、调用量、模型热度、厂商、模型发布方、DeepSeek、GPT、 Claude、Gemini、Kimi、GLM、MiniMax、OpenRouter、模型排名、llm ranking

想用国内免费/低价大模型,结果每家API格式都不一样?一个网关聚合MiMo/DeepSeek/Qwen/GLM等主流模型,OpenAI兼容接口直接替换,自动负载均衡+故障切换。省钱又省心,薅遍国内AI免费额度。 触发词: - 基础词:国内免费AI、免费API、薅羊毛AI、换模型、切换AI、负载均衡 - 平台词:M...

4 次安装