拿到一堆数据不知道怎么分析?丢数据进来,自动生成Python分析代码并执行,输出可视化图表和结论。统计建模、时间序列、机器学习全覆盖。不用你会写代码,只要会提问就行。 触发词:数据分析、Python分析、统计分析、数据可视化、数据建模、回归分析、相关性分析、数据清洗、机器学习、聚类分析、预测分析、数据报告 排除:...
Documents
数据分析师skill
Try it数据分析师自动化工作流。从数据加载、质量审计、数据清洗、探索性分析(EDA)、统计建模到可视化HTML报告生成,覆盖完整数据分析管线。支持CSV/Excel/JSON/SQLite多格式输入,内置4层数据防御体系。触发词:分析数据、数据分析、帮我分析数据、数据报告、EDA、data analysis、analyz...
What it does
数据分析师自动化工作流。从数据加载、质量审计、数据清洗、探索性分析(EDA)、统计建模到可视化HTML报告生成,覆盖完整数据分析管线。支持CSV/Excel/JSON/SQLite多格式输入,内置4层数据防御体系。触发词:分析数据、数据分析、帮我分析数据、数据报告、EDA、data analysis、analyze data、生成数据报告、数据可视化、探索性分析。
The skill document
数据分析师 (Data Analyst)
AI-powered data analysis workflow. Cover the full pipeline from data ingestion to interactive HTML report generation.
When to Use
Trigger when the user asks to:
- Analyze a dataset (CSV / Excel / JSON / SQLite)
- Generate a data analysis report
- Do exploratory data analysis (EDA)
- Clean or preprocess data
- Create data visualizations
- Understand data distributions and relationships
Workflow Overview
The skill follows a 7-phase CRISP-DM pipeline, executed automatically:
- Data Loading — Auto-detect format, load into DataFrame
- Data Audit — 4-layer defense: health check, structure, business rules, model readiness
- Data Cleaning — Missing values, outliers, type conversion, dedup
- EDA — Distribution analysis, correlation, group aggregation
- Statistical Analysis — Descriptive stats, hypothesis tests, trend detection
- Visualization — Charts for distributions, correlations, category breakdowns
- Report Generation — Interactive HTML report with scorecards, charts, and insights
Usage
Quick Start
To analyze a data file:
python {baseDir}/scripts/run_analysis.py [--output report.html]
The script auto-detects the file format and runs the full pipeline.
Module-Level Usage
Each module can be used independently:
# Load data
from data_loader import load_data
df = load_data("sales.csv")
# Audit data quality
from data_auditor import audit_data
report = audit_data(df)
# Clean data
from data_cleaner import clean_data
df_clean = clean_data(df)
# Run EDA
from eda_runner import run_eda
eda_results = run_eda(df_clean)
# Generate report
from report_builder import build_report
build_report(df_clean, eda_results, "report.html")
Scripts Reference
| Script | Purpose | Input | Output |
|---|---|---|---|
scripts/run_analysis.py | Main entry — orchestrates full pipeline | data file path | HTML report |
scripts/data_loader.py | Multi-format data loading | file path | pandas DataFrame |
scripts/data_auditor.py | 4-layer quality defense | DataFrame | audit dict |
scripts/data_cleaner.py | Data cleaning & preprocessing | DataFrame | cleaned DataFrame |
scripts/eda_runner.py | Exploratory data analysis | DataFrame | EDA results dict |
scripts/visualizer.py | Chart generation | DataFrame + config | saved .png charts |
scripts/report_builder.py | HTML report generation | Data + results | HTML report |
Templates
templates/report.html— Jinja2 template for the final HTML report
Config
config/business_rules.yaml— Optional business validation rules
Dependencies
Install before first use:
pip install pandas numpy matplotlib seaborn scipy jinja2 pyyaml missingno
Notes
- For files > 100MB, the audit module uses sampling (n=50000) to stay performant
- Business rules in
config/business_rules.yamlare optional; skip if no domain-specific rules exist - All charts are saved to a
charts/subdirectory in the output folder before embedding in HTML
Related skills
Excel 数据分析多步编排器。覆盖:(1) 读取多 Sheet Excel 文件并统计行数,(2) 大文件检测(≥10k 行自动 Parquet 优化),(3) 数据清洗(缺失值、文本标准化、无效字符),(4) 条件筛选与分类提取,(5) 跨 Sheet 统计聚合,(6) 导出 Excel/CSV 并提供下载链接。覆盖从数据读取到报告生成全流程,按步骤编排 capability 子 skill。**遇到以下任一情况就主动使用本 skill,不要自行写几行 pandas 就回答**:①用户出现触发词:Excel 分析 / 表格分析 / 数据分析 / 数据清洗 / 数据统计 / 数据筛选 / 数据可视化 / 数据导出 / 汇总统计 / 透视表 / 分组统计 / 交叉分析 / 趋势分析 / 对比分析 / 异常值检测 / 去重 / 缺失值处理 / Excel 报告 / 生成报表 / analyze Excel / data analysis / data cleaning / pivot table;②用户上传或指定了 .xlsx / .xls / .csv 文件并要求分析、清洗、统计或可视化;③任务涉及多 Sheet 读取、条件筛选、分类汇总、图表生成中的任意一项;④用户要求导出带格式的 Excel 报告或下载链接。仅不用于:不涉及表格数据的纯文本处理、图片分析(使用 sn-da-image-caption)、单个公式计算的简单问答。
只要用户提交表格/CSV/Excel/数据块,或提到"分析数据""找关系""盘数据""串表""对数据""看表""两表对比""数据有没有问题",都应调用此技能。即使用户没说"分析",只要给了表格数据并问"有没有猫腻""帮我看看""这数据对不对",也触发。不适用于:写代码处理CSV、解释数据库概念、画图表可视化、纯日志排查、代码审查、非结构化文本分析。
面向决策的数据分析助手,提供统计严谨性、假设检验、A/B测试与陷阱识别的免费核心能力。Use when 需要数据分析、报表生成、统计洞察、数据可视化时使用。不适用于实时流数据处理。适用于独立开发者、企业团队和自动化工作流场景。支持中文交互,无需复杂配置即开即用。输出结果可直接使用,减少二次加工成本。 功能涵盖: toolkit。
Business data analysis and operating diagnosis skill. Use when the user needs to translate a business question into an analysis plan, define metric logic, va...
Word / PDF / PPT 文档解析与数据分析引擎。覆盖三类文件格式的全量提取、表格数值化、图表理解与跨文档汇总分析。**遇到以下任一情况就主动使用本 skill**:①用户上传或指定了 .docx / .doc / .pdf / .pptx / .ppt 文件并要求分析、提取或统计其中内容;②用户出现触发词:Word分析 / PDF解析 / PPT提取 / 文档分析 / 报告解析 / 幻灯片分析 / 发票提取 / 合同分析 / 文档统计 / 错别字 / 语病 / 字号检查 / 简历分析 / 多文档对比;③任务涉及从文档中提取表格、数值、图表、格式(颜色/高亮/字号)、组织架构、时间线等结构化信息。仅不用于:Excel/CSV 数据分析(使用 sn-da-excel-workflow)、纯图片分析(使用 sn-da-image-caption)。