按用户明确指令,在得到大脑(Get笔记)中保存、搜索并管理笔记与知识库。
编程
Bitnet
试用微软官方 1-bit LLM 推理框架,在 CPU 上运行 1.58-bit 量化大语言模型,速度提升 1.4-6x、能耗降低 55-82%,单 CPU 可运行 100B 参数模型,达到人类阅读速度
它能做什么
bitnet.cpp 是微软研究院发布的官方 1-bit LLM 推理框架,基于 llama.cpp 构建,专为 BitNet b1.58 系列模型优化。在 x86 CPU 上速度提升 2.37-6.17 倍,能耗降低 71-82%;在 ARM CPU 上速度提升 1.37-5.07 倍,能耗降低 55-70%。单台消费级 CPU 即可以 5-7 tokens/秒的速度运行 100B 参数模型,达到人类阅读速度,彻底改变本地 LLM 部署的经济性。
技能文档
BitNet — 1-bit LLM 本地高效推理
bitnet.cpp 是微软研究院发布的官方 1-bit LLM 推理框架,基于 llama.cpp 构建,专为 BitNet b1.58 系列模型优化。在 x86 CPU 上速度提升 2.37-6.17 倍,能耗降低 71-82%;在 ARM CPU 上速度提升 1.37-5.07 倍,能耗降低 55-70%。单台消费级 CPU 即可以 5-7 tokens/秒的速度运行 100B 参数模型,达到人类阅读速度,彻底改变本地 LLM 部署的经济性。
核心使用场景
- CPU 本地 LLM 推理:无需 GPU,在消费级 CPU 上运行数十亿参数模型
- 边缘设备部署:极低能耗,适合嵌入式设备、笔记本电脑、服务器 CPU
- 隐私敏感场景:完全本地运行,数据不离开设备
- 大规模批量推理:多线程优化,节省数据中心能源成本
- 学术研究:研究 1-bit LLM 量化技术和推理优化
AI 辅助使用流程
- 环境搭建 — AI 创建 conda 环境并安装编译依赖(Python、CMake、Clang)
- 克隆仓库 — AI 执行
git clone --recursive https://github.com/microsoft/BitNet.git - 下载模型 — AI 使用
huggingface-cli download下载官方 BitNet 模型 - 编译环境 — AI 运行
python setup_env.py量化模型并编译推理内核 - 运行推理 — AI 执行
python run_inference.py进行对话或文本生成 - 性能测试 — AI 运行
python e2e_benchmark.py测量吞吐量和延迟
关键章节导航
- 安装指南 — 依赖安装、conda 环境、模型下载
- 快速开始 — 编译量化、运行推理、对话模式
- 高级用法 — GPU 推理、性能测试、多线程配置
- 故障排查 — 编译错误、模型加载失败、性能问题
AI 助手能力
使用本技能时,AI 可以:
- ✅ 搭建 conda 环境并安装编译依赖(CMake、Clang)
- ✅ 克隆 BitNet 仓库并安装 Python 依赖
- ✅ 使用
huggingface-cli下载指定 BitNet 模型 - ✅ 运行
setup_env.py完成量化和环境配置 - ✅ 执行
run_inference.py进行对话推理 - ✅ 运行
e2e_benchmark.py测试推理性能 - ✅ 配置多线程参数优化吞吐量
核心功能
- ✅ 极速 CPU 推理 — x86 CPU 提升 2.4-6.2x,ARM CPU 提升 1.4-5.1x
- ✅ 超低能耗 — 比传统 INT8 推理节能 55-82%
- ✅ 大模型单 CPU — 100B 模型在单 CPU 以 5-7 tokens/秒运行
- ✅ 官方量化内核 — I2_S、TL1、TL2 三种针对不同硬件优化的内核
- ✅ GPU 支持 — 官方 GPU 推理内核(2025 年发布)
- ✅ 多模型支持 — BitNet-b1.58 2B/3B、Llama3-8B-1.58bit、Falcon3 系列
- ✅ 对话模式 —
-cnv标志启用交互式聊天(系统提示支持) - ✅ 性能基准 — 内置
e2e_benchmark.py测量 tokens/秒和能耗
快速示例
# 克隆并进入项目
git clone --recursive https://github.com/microsoft/BitNet.git
cd BitNet
# 安装依赖
conda create -n bitnet-cpp python=3.9 && conda activate bitnet-cpp
pip install -r requirements.txt
# 下载官方模型并量化
huggingface-cli download microsoft/BitNet-b1.58-2B-4T-gguf --local-dir models/BitNet-b1.58-2B-4T
python setup_env.py -md models/BitNet-b1.58-2B-4T -q i2_s
# 运行对话推理
python run_inference.py \
-m models/BitNet-b1.58-2B-4T/ggml-model-i2_s.gguf \
-p "You are a helpful assistant" \
-cnv
安装要求
| 依赖 | 版本要求 |
|---|---|
| Python | >= 3.9 |
| CMake | >= 3.22 |
| Clang | >= 18 |
| conda | 推荐(环境隔离) |
| 磁盘空间 | 模型约 1-20 GB |
项目链接
相关技能
以 AI 机器人身份加入视频会议,提供语音、虚拟形象与屏幕共享四种模式。
把自然语言描述转为结构化 JSON,并由 mcp-diagram-generator MCP 服务生成 Draw.io、Mermaid 或 Excalidraw 图表文件。
通过一个命令行工具完成多链加密货币交易、钱包管理与 AI 市场分析。
在本地磁盘以分类纯 Markdown 文件保存需要长期留存的事实,与智能体内置记忆并存。
通过一次 REST API 调用,向 10 个社交平台发布视频、图片、文字与文档。
cn-big-cabbage 的更多技能
浏览全部技能高性能自适应 Python 网页抓取框架,内置反爬虫绕过(Cloudflare Turnstile)、智能元素重定位、完整爬虫框架和 MCP 服务器,适合 AI 辅助数据提取和大规模爬取任务
用 React 代码程序化生成视频的框架,支持 CSS/Canvas/SVG/WebGL,可部署到 Lambda/Cloud Run 大规模渲染,适合创意视频生成、数据可视化视频和个性化视频批量生产
从零构建的轻量级无头浏览器,专为 AI 智能体和自动化设计,比 Headless Chrome 快 9 倍、内存占用低 16 倍,兼容 CDP 和 Playwright/Puppeteer,内置 MCP 服务器
Chrome DevTools MCP 服务器,让 AI 编码助手(Claude Code、Cursor、Copilot)直接控制和调试真实 Chrome 浏览器,实现截图、性能分析、网络请求检查、控制台调试和自动化操作
FastAPI - 高性能 Python Web API 框架
Claude Code 多智能体编排平台,部署 100+ 专业 AI 智能体协同工作,通过蜂群拓扑(层级/网状/环形/星形)协调自主工作流,内置自学习、向量记忆和原生 MCP 集成