数据分析

数据工具箱(免费版)

试用

数据工具箱免费版是一款面向个人开发者的数据全生命周期处置工具,覆盖数据提取、清洗变换、探索性剖析与基础可视化四大核心环节。Use when. 适用于需要data toolkit相关能力的开发场景,包含结构化的工作流程和可复用的模板,帮助用户快速完成任务并保持代码质量. 适用于需要data toolkit相关能力的开发场景,包含结构化的工作流程和配置指引.

它能做什么

数据工具箱免费版是一款面向个人开发者的数据全生命周期处置工具,覆盖数据提取、清洗变换、探索性剖析与基础可视化四大核心环节。Use when. 适用于需要data toolkit相关能力的开发场景,包含结构化的工作流程和可复用的模板,帮助用户快速完成任务并保持代码质量. 适用于需要data toolkit相关能力的开发场景,包含结构化的工作流程和配置指引.

技能文档

数据工具箱(免费版)

概述

本工具箱覆盖数据处理的完整生命周期:从多源数据提取,到清洗转换,再到探索性分析与基础可视化。无论你是写 SQL 查询、清洗脏数据、生成统计摘要还是制作图表,本工具均能提供标准化流程与优秀实践指导. 免费版聚焦核心数据处理能力,适合个人开发者的日常数据分析需求。专业版在此基础上扩展统计检验、数据质量监控、工作流自动化与高级可视化.

核心能力

能力域说明输入/输出
查询提取SQL 生成、API 拉取、文件读取数据源 → 结构化数据
清洗转换空值、去重、标准化、连接脏数据 → 干净数据
探索分析描述统计、分布、相关性数据 → 洞察摘要
基础可视化柱状图、折线图、饼图数据 → 图表文件
模式适配按角色提供差异化入口用户角色 → 推荐流程
技术实现要点:核心能力基于input_params参数与output_format配置实现,支持创建/查询/修改/删除等操作模式,通过config_options进行运行时配置.

核心功能执行

input_params参数进行配置.

处理: 解析核心功能执行的输入参数,完成核心逻辑,返回结构化响应. 输出: 返回核心功能执行的响应数据,包含状态码、结果和日志.

  • 执行此能力时使用input_params参数,支持创建/查询/导出操作

参数配置与调用

config_options参数进行配置.

处理: 解析参数配置与调用的输入参数,完成核心逻辑,返回结构化响应. 输出: 返回参数配置与调用的响应数据,包含状态码、结果和日志.

  • 执行此能力时使用config_options参数,支持修改/重置/导入操作

结果处理与输出

output_format参数进行配置.

处理: 解析结果处理与输出的输入参数,完成核心逻辑,返回结构化响应. 输出: 返回结果处理与输出的响应数据,包含状态码、结果和日志.

  • 执行此能力时使用output_format参数,支持导出/保存/转换操作 能力覆盖范围:本skill的核心能力覆盖以下场景关键词:数据全生命周期工、覆盖提取、分析与基础可视化、数据工具箱免费版、是一款面向个人开、发者的数据全生命、周期处理工具、覆盖数据提取、探索性分析与基础、可视化四大核心环、Use、when、需要数据分析、报表生成、统计洞察、数据可视化时使用、不适用于实时流数、据处理、适用于独立开发者、企业团队和自动化、工作流场景等。这些关键词对应description中声明的使用场景,均已在上述能力点中提供对应的操作支持.

使用场景

场景一:分析师探索新数据集(分析师)

分析师拿到一份新的销售数据 CSV,需要快速了解数据全貌。Agent 引导完成首次探索:

用户:"这份 sales.csv 里有什么有意思的模式?"
Agent:
1. 加载数据,检查形状与类型
2. 生成描述性统计(均值、中位数、分位数)
3. 检查数据质量(空值率、重复率、异常值)
4. 分析时间趋势与品类分布
5. 输出关键发现摘要

场景二:工程师清洗与加载数据(工程师)

工程师需要将一份脏数据清洗后加载至数据库。Agent 生成完整的清洗脚本:

import pandas as pd
# ...
# 加载数据
df = pd.read_csv('raw_data.csv')
# ...
# 空值处理:数值列填充中位数,分类列填充众数
df['amount'] = df['amount'].fillna(df['amount'].median())
df['category'] = df['category'].fillna(df['category'].mode()[0])
# ...
# 去重
df = df.drop_duplicates(subset=['order_id'])
# ...
# 标准化日期格式
df['date'] = pd.to_datetime(df['date'], errors='coerce')
# ...
# 输出清洗报告
print(f"原始行数: {len(pd.read_csv('raw_data.csv'))}")
print(f"清洗后行数: {len(df)}")
print(f"空值率: {df.isnull().sum().sum() / df.size * 100:.2f}%")

场景三:业务用户查看 KPI(业务)

业务用户需要对比本季度与上季度的关键指标。Agent 用自然语言解释数据:

用户:"本季度和上季度比怎么样?"
Agent:"本季度收入 1280 万,环比增长 15.3%,主要驱动因素为新用户增长 22%..."

快速开始

60 秒上手

直接向 Agent 描述你的数据任务,无需安装额外依赖(基础功能使用 Python 内置库与 pandas). 示例提问:

帮我写一个 SQL 查询,统计过去 30 天每日注册用户数
这份 CSV 有哪些空值和重复数据?帮我清洗
帮我画一个最近 7 天收入趋势的折线图

使用流程

  1. 识别数据源(数据库、文件、API)
  2. 建立连接或加载文件
  3. 初始探索性分析(形状、类型、质量)
  4. 按需清洗与转换
  5. 根据目标分析或可视化

按角色快速入口

角色关注重点典型触发语
分析师SQL、探索、洞察"这份数据说明了什么?"
工程师管道、转换、质量"清洗后加载到数据库"
业务KPI、看板、通俗解释"和上季度比怎么样?"
研究员统计严谨、可复现"这个差异显著吗?"
开发者Schema、API、类型"从这个 JSON 生成类型"

响应解析: 完成完成后,查看输出响应确认任务状态。成功时输出包含解析摘要和响应数据;失败时根据错误信息排查问题,查阅错误解析章节获取恢复步骤.

示例

SQL 查询生成

-- 统计过去 30 天每日注册用户数
SELECT
  DATE(created_at) AS day,
  COUNT(*) AS signups
FROM users
WHERE created_at >= NOW() - INTERVAL '30 days'
GROUP BY DATE(created_at)
ORDER BY day;

数据清洗模板

# 空值策略
# 数值列:填充中位数(抗异常值)
# 分类列:填充众数(保留分布)
# 时间列:标记为 NaT 后按业务规则处理
# ...
# 去重策略
# 基于业务主键去重,保留最新记录
df = df.sort_values('updated_at').drop_duplicates('id', keep='last')
# ...
# 异常值检测
# 使用 IQR 方法识别极端值
Q1, Q3 = df['amount'].quantile([0.25, 0.75])
IQR = Q3 - Q1
outliers = df[(df['amount'] < Q1 - 1.5*IQR) | (df['amount'] > Q3 + 1.5*IQR)]

基础可视化

import matplotlib.pyplot as plt
# ...
# 折线图:趋势
df.plot(x='date', y='revenue', kind='line', title='收入趋势')
plt.savefig('revenue_trend.png', dpi=150, bbox_inches='tight')
# ...
# 柱状图:对比
df.groupby('category')['amount'].sum().plot(kind='bar', title='品类销售')
plt.savefig('category_sales.png', dpi=150, bbox_inches='tight')
# ...
# 饼图:占比
df.groupby('channel')['amount'].sum().plot(kind='pie', autopct='%1.1f%%')
plt.savefig('channel_share.png', dpi=150, bbox_inches='tight')

优秀实践

1. 转换前预览

应用任何转换前先预览将受影响的行,确认后再执行。避免盲目操作导致数据丢失:

# 预览将被删除的行
to_drop = df[df['amount'].isnull()]
print(f"将删除 {len(to_drop)} 行空值记录")
print(to_drop.head())
# 确认后执行
df = df.dropna(subset=['amount'])

2. 记录转换谱系

每个转换操作记录来源、操作与理由,确保可追溯:

transformations = []
transformations.append({
  'step': 1,
  'source': 'raw_data.csv',
  'operation': 'fill_null',
  'field': 'amount',
  'strategy': 'median',
  'reason': '金额字段空值率 3.2%,中位数抗异常值'
})

3. 校验数据类型与范围

分析前必须校验数据类型与取值范围,避免"垃圾进垃圾出":

# 类型检查
assert df['amount'].dtype in ['float64', 'int64']
# 范围检查
assert df['amount'].min() >= 0  # 金额不应为负

4. 图表类型匹配数据类型

数据类型推荐图表示例
时间序列折线图每日收入趋势
分类对比柱状图各品类销售额
占比构成饼图渠道分布
分布形态直方图用户年龄分布
相关关系散点图广告投入与转化

常见问题

Q1:SQL 查询太慢?

检查执行计划,关注全表扫描与缺失索引。常见优化:为 WHERE/JOIN/GROUP BY 字段添加索引、避免 SELECT *、使用分区表。对于 PostgreSQL,可使用 EXPLAIN ANALYZE 查看实际执行计划.

Q2:CSV 文件太大加载不了?

使用分块读取:pd.read_csv('big.csv', chunksize=10000)。或使用 Dask 等并行框架处理超大数据集.

Q3:空值应该删除还是填充?

取决于空值率与业务含义。空值率低于 5% 可考虑删除;5%-30% 建议填充(数值用中位数、分类用众数);超过 30% 需评估字段是否可用.

Q4:如何判断异常值?

常用 IQR 方法:超出 Q1-1.5×IQR 或 Q3+1.5×IQR 的为异常值。也可结合业务规则(如金额为负、年龄超过 150)综合判断.

Q5:图表中文乱码?

matplotlib 默认字体不支持中文,需指定中文字体:

plt.rcParams['font.sans-serif'] = ['SimHei', 'Arial Unicode MS']
plt.rcParams['axes.unicode_minus'] = False

依赖说明

运行环境

  • Agent 平台:支持 SKILL.md 的任意 AI Agent(Claude Code / Cursor / Codex / Gemini CLI 等)
  • 操作系统:Windows / macOS / Linux
  • Python:3.9 及以上版本

依赖详情

依赖项类型是否必需获取方式
pandasPython 库必需pip install pandas
matplotlibPython 库可视化必需pip install matplotlib
psql数据库客户端数据库源推荐apt install postgresql-client
LLM APIAPI必需由 Agent 平台内置 LLM 提供

API Key 配置

  • 数据库连接串通过环境变量注入(如 DATABASE_URL
  • API 数据源的 Token 存储于环境变量
  • 禁止在脚本中硬编码数据库密码或 API Key

可用性分类

  • 分类:MD+EXEC(纯 Markdown 指令,核心功能需 exec 命令行执行能力)
  • 说明:基于 Markdown 的 AI Skill,通过自然语言指令驱动 Agent 执行数据处理任务

已知限制

本免费体验版限制以下高级功能:

  • 不包含统计检验与假设检验(t 检验、卡方、ANOVA 等)
  • 不包含数据质量监控与漂移检测
  • 不包含工作流自动化与定时任务
  • 不包含高级可视化(热力图、桑基图、交互式图表)
  • 不包含数据血缘追踪与转换谱系管理
  • 不包含多数据源连接与 JOIN 优化
  • 不提供优先技术支持与 SLA 保障

解锁全部功能请使用专业版:data-toolkit-pro

  • 当前为免费版本,如需完整功能请升级到付费版获取全部能力

错误处理

错误场景原因处理方式
配置错误参数缺失或格式错误检查依赖说明中的配置要求
运行时错误运行环境不满足确认运行环境符合依赖说明
网络错误连接超时或不可达执行ping命令测试网络连通性,检查防火墙和代理设置连接后执行ping命令测试网络连通性,检查防火墙和代理设置连接后重新执行命令,参考国内替代方案

输出格式

{
  "success": true,
  "data": {
    "result": "数据工具箱(免费版)处理结果",
    "execution_time": "0.5s",
    "metadata": {
      "version": "1.0",
      "processor": "datakit"
    }
  },
  "execution_log": ["解析输入参数", "执行核心处理", "格式化输出结果"],
  "error": null
}

相关技能

文档工具箱免费版是一款面向开发者的DOCX文档处置Skill,封装python-docx与LibreOffice渲染能力,包含从读取、创建到编辑的完整基础工作流。核心能力:. 适用于需要doc toolkit相关能力的开发场景,包含结构化的工作流程和可复用的模板,帮助用户快速完成任务并保持代码质量.

1 次安装

CSS 工具箱免费版是一份面向前端开发者的 CSS 常见陷阱速查手册,聚焦层叠上下文、Flexbox/Grid 布局陷阱、现代选择器与响应式设计基础。Use,可自发提升工作效率 when 需要代码产出、编程辅助、调试测试、开发部署时使用。不适用于无明确技术栈的模糊需求。Use when 需要代码产出、编程辅助、调试测试、开发部署时使用。不适用于无明确技术栈的模糊需求. 功能涵盖: toolkit。

Python 数据可视化工具免费版,面向个人开发者与数据分析师。核心能力: - matplotlib 静态图表(柱状/折线/散点/饼图) - seaborn 统计可视化(箱线/小提琴/KDE) - plotly 交互式图表 - 多子图布局与样式定制 - CSV/字典/NumPy 数据源支持 - PNG/SVG/PDF 导出 适用场景: - 数据分析与报告制作 - 学术论文图表绘制 - 个人项目数据可视化 差异化:免费版提供核心图表能力

Rust 开发优选实践助手免费版,面向个人开发者与学习者。核心能力:,可自发提升工作效率. 适用于需要rust toolkit相关能力的开发场景,包含结构化的工作流程和可复用的模板,帮助用户快速完成任务并保持代码质量. 适用于需要rust toolkit相关能力的开发场景,包含结构化的工作流程和配置指引.

1 次安装

面向个人用户的干净可移植 Markdown 产出工具。核心能力:. 适用于需要markdown toolkit相关能力的开发场景,包含结构化的工作流程和可复用的模板,帮助用户快速完成任务并保持代码质量. 适用于需要markdown toolkit相关能力的开发场景,包含结构化的工作流程和配置指引. 该工具经过深度差异化处置,针对用户反馈和使用痛点进行了调优改进,提升了实用性和可操作性.

1 次安装

核心能力:,可自发提升工作效率. 适用于需要security toolkit相关能力的开发场景,包含结构化的工作流程和可复用的模板,帮助用户快速完成任务并保持代码质量. 适用于需要security toolkit相关能力的开发场景,包含结构化的工作流程和配置指引. 该工具经过深度差异化处置,针对用户反馈和使用痛点进行了调优改进,提升了实用性和可操作性.

1 次安装