Manage Huawei Cloud ModelArts training jobs and related resources through full lifecycle operations via hcloud CLI. Covers 52 API interfaces across 8 functional domains: training job management, algorithm management, training job tags, training experiments, training job events, model import, auto search (hyperparameter tuning), and training image save. All write operations require user confirmation before execution. Triggers include: "ModelArts training", "训练作业", "模型训练", "创建训练作业", "查询训练作业", "停止训练作业", "删除训练作业", "算法管理", "超参配置", "training job", "training management", "create training", "ModelArts 训练", "训练实验", "自动搜索", "超参调优".
Coding
huawei-cloud-modelarts-training-diagnosis
Try itHuawei Cloud ModelArts training job fault diagnosis skill. Uses hcloud CLI to call ModelArts training job log/event APIs, analyzes training job failures/timeouts/stuck jobs, locates customer training code issues, and provides diagnosis conclusions with fix suggestions and confidence levels. Scenarios: training job failure (status.phase=Failed), timeout (Timeout), abnormal (Abnormal), stuck jobs. Triggers: training job failure, training job timeout, training job stuck, ModelArts training diagnosis, 训练任务失败排查, 训练作业异常分析.
What it does
Huawei Cloud ModelArts training job fault diagnosis skill. Uses hcloud CLI to call ModelArts training job log/event APIs, analyzes training job failures/timeouts/stuck jobs, locates customer training code issues, and provides diagnosis conclusions with fix suggestions and confidence levels. Scenarios: training job failure (status.phase=Failed), timeout (Timeout), abnormal (Abnormal), stuck jobs. Triggers: training job failure, training job timeout, training job stuck, ModelArts training diagnosis, 训练任务失败排查, 训练作业异常分析.
The skill document
ModelArts Training Job Fault Diagnosis
Overview
This skill provides automated fault diagnosis for Huawei Cloud ModelArts training jobs. It calls ModelArts log and event APIs via hcloud CLI to collect runtime information, analyzes training job failures/timeouts/stuck jobs, and outputs diagnosis conclusions with fix suggestions and confidence levels.
Architecture
User Input
↓
Phase 1: Task Discovery (ListTrainingJobs)
↓
Phase 2: Status Assessment (ShowTrainingJobDetails)
↓
[Early Exit if traceback found in status.task_statuses[].message]
↓ (if no traceback)
Phase 3: Information Collection
├─ Main Path: ListTrainingJobEvents, ListTrainingJobStages
└─ Extended Path: ShowTrainingJobLogsPreview, ShowObsUrlOfTrainingJobLogs
↓
Phase 4: Analysis (confidence-based inference)
↓
Phase 5: Output (diagnosis report + fix suggestions)
Applicable Scenarios
- Training job failure (status.phase = "Failed")
- Training job timeout (status.phase = "Timeout")
- Training job abnormal (status.phase = "Abnormal")
- Training job stuck (running long time with no progress)
- Resource shortage causing training failure
Typical Use Cases
- "My training job failed, help me diagnose"
- "Training job is stuck, no progress for hours"
- "Training job timeout, what went wrong?"
- "Scan all failed training jobs in my account"
- "Training job error code 1.015, what does it mean?"
Prerequisites
hcloud CLI Installation
- Version: 7.2.2 or higher
- Verification:
hcloud versionshould return version >= 7.2.2 - Installation guide: See references/cli-installation-guide.md
Authentication Configuration
- AK/SK configured in
~/.hcloud/config.json - Default region:
cn-north-4 project_idconfigured in profileskipSecureVerify=true(for WSL environment)
Verification command:
hcloud configure list
IAM Permissions
This skill requires read-only permissions for ModelArts training APIs.
Required permissions: See references/iam-policies.md
Permission failure handling:
- If any API returns 403/401, read
references/iam-policies.md - Display required permissions list and policy JSON to user
- Guide user to create custom policy in IAM console
- Pause execution until user confirms permissions are granted
KooCLI Command Format Standard
All commands follow the standard hcloud format:
hcloud ModelArts --param1=value1 --param2=value2 --cli-region=
Key conventions:
- Service name:
ModelArts(PascalCase) - Operation name: PascalCase (e.g.,
ShowTrainingJobDetails) - Region parameter:
--cli-region=(default:cn-north-4) - Output format:
--cli-output=json(for agent processing) - JMESPath filtering:
--cli-query=""(to reduce output)
Example:
hcloud ModelArts ShowTrainingJobDetails \
--cli-region=cn-north-4 \
--cli-output=json \
--training_job_id=""
Workflow
This skill follows a 5-phase diagnosis workflow:
Phase 1: Task Discovery
- If user provides full job ID → skip to Phase 2
- If user provides name → use
ListTrainingJobsto find ID + status.phase - If user provides nothing → scan all abnormal jobs (status.phase = "Failed"/"Timeout"/"Abnormal")
Phase 2: Status Assessment
- Call
ShowTrainingJobDetailsto get job status - Check
status.phase: "Failed"/"Timeout"/"Abnormal" = real fault, "Running"/"Success" = false alarm, "Initializing" = pending observation - Extract
status.task_statuses[].task_idfor subsequent log APIs - Early Exit: If
status.task_statuses[].messagecontains full Python traceback, diagnosis can be completed at HIGH confidence without calling Phase 3 APIs
Phase 3: Information Collection (skipped if early exit applies)
Main path (always run):
ShowTrainingJobDetails→status.phase,status.task_statuses[].message,status.task_statuses[].task_id,status.failureAnalysisResultListTrainingJobEvents(level=Error)→ error event listListTrainingJobStages→ check which stage is stuck
Extended path (conditional):
4. ShowTrainingJobLogsPreview → preview logs (find traceback/error lines)
5. ShowObsUrlOfTrainingJobLogs → OBS full log download link (5min valid)
Detailed flow: See references/diagnosis-flow.md
Core Commands
Task Discovery Commands
ListTrainingJobs — Scan all abnormal training jobs
hcloud ModelArts ListTrainingJobs \
--cli-region=cn-north-4 \
--cli-output=json \
--cli-query="items[?status.phase=='Failed' || status.phase=='Timeout' || status.phase=='Abnormal'].{job_id: metadata.id, name: metadata.name, phase: status.phase}"
Status Assessment Commands
ShowTrainingJobDetails — Get job status + error info
hcloud ModelArts ShowTrainingJobDetails \
--cli-region=cn-north-4 \
--cli-output=json \
--training_job_id=""
Key response fields:
metadata.id,metadata.name— job identifierstatus.phase— job status ("Failed", "Running", "Success", etc.)status.task_statuses[].message— full Python traceback or error message (primary evidence)status.task_statuses[].exit_code— integer exit codestatus.task_statuses[].task_id— task ID for log APIsstatus.failureAnalysisResult.analysis_results[]— platform's automatic diagnosis
Information Collection Commands
ListTrainingJobEvents — Get error events
hcloud ModelArts ListTrainingJobEvents \
--cli-region=cn-north-4 \
--cli-output=json \
--level=Error \
--limit=100 \
--training_job_id=""
ListTrainingJobStages — Check stage checkpoints
hcloud ModelArts ListTrainingJobStages \
--cli-region=cn-north-4 \
--cli-output=json \
--training_job_id=""
ShowTrainingJobLogsPreview — Preview logs (find traceback)
hcloud ModelArts ShowTrainingJobLogsPreview \
--cli-region=cn-north-4 \
--cli-output=json \
--training_job_id="" \
--task_id=""
ShowObsUrlOfTrainingJobLogs — Get OBS full log download link (5min valid)
hcloud ModelArts ShowObsUrlOfTrainingJobLogs \
--cli-region=cn-north-4 \
--cli-output=json \
--training_job_id="" \
--task_id=""
Complete command templates: See references/hcloud-command-templates.md
Parameter Confirmation
Training Diagnosis Parameters
| Parameter | Required | Type | Description | Default |
|---|---|---|---|---|
training_job_id | Yes | String | Training job ID (e.g., from ListTrainingJobs) | None |
task_id | Conditional | String | Task ID within training job (from ShowTrainingJobDetails.status.task_statuses[].task_id) | None |
--cli-region | No | String | Huawei Cloud region | cn-north-4 |
--cli-output | No | String | Output format (json/table/tsv) | json |
--cli-query | No | String | JMESPath expression to filter output | None |
Notes:
task_idis required for log APIs, obtained fromShowTrainingJobDetails.status.task_statuses[].task_id- Region can be switched (e.g.,
cn-north-9,cn-east-3), butproject_idmust be configured for that region - Logs may contain sensitive information; only extract key error/traceback lines, do not display full logs
Output Format
This skill outputs diagnosis reports in Markdown format.
Output Template
## 诊断结论
| 项目 | 值 |
|------|-----|
| 任务 | `` (``) |
| 当前状态 | `` |
| 故障级别 | Fault / Abnormal / 疑似异常 / 正常 |
## 根因
<一句话描述什么导致了作业失败>(置信度:HIGH/MEDIUM/LOW)
## 修复建议
### 方案 1
1.
2.
> 注意:以上操作涉及 [只读查询 / 需要用户确认后手动执行的变更]
## 后续步骤
[信息不足时] 当前信息不足以确定根因,建议补充以下信息:
- 调用 `` 获取 ``
- 或手动检查 ``
Strict constraint: Generate the report strictly following the template above. Keep analysis reasoning internal, not in the report.
Confidence Levels
- HIGH:
status.task_statuses[].messagecontains full Python traceback with identifiable root cause, orstatus.failureAnalysisResult.analysis_results[].descriptionprovides explicit error description, or events contain clear error - MEDIUM: Multiple indirect clues point to same root cause, or
status.task_statuses[].exit_codenon-zero butmessageis empty/vague - LOW: Insufficient information; must output "information insufficient" and list what additional information is needed
Detailed confidence rules: See references/confidence-rules.md
Verification Method
This skill follows a 3-tier verification approach:
Installation Verification
hcloud version
Success criteria: Returns version >= 7.2.2
Configuration Verification
hcloud configure list
Success criteria: Displays valid AK/SK configuration with region=cn-north-4
Function Verification
hcloud ModelArts ListTrainingJobs --cli-region=cn-north-4
Success criteria: Returns HTTP 200 and training job list
Detailed verification steps: See references/verification-method.md
Best Practices
Early Exit Principle
- If
ShowTrainingJobDetailsreturns full Python traceback instatus.task_statuses[].message, skip Phase 3 APIs (ListTrainingJobEvents, ListTrainingJobStages, ShowTrainingJobLogsPreview, ShowObsUrlOfTrainingJobLogs) - This saves API calls and speeds up diagnosis when root cause is already clear
Progressive Diagnosis
- Start with minimal information (job ID only)
- Run Phase 2 first (ShowTrainingJobDetails)
- Only run Phase 3 APIs if Phase 2 results are insufficient (no traceback in message)
- Avoid running all APIs at once; follow the 5-phase workflow
Evidence-Based Analysis
- Every inference must point to specific fields from API responses
- One evidence supports one inference; multiple evidence cross-validation increases confidence
- When return information is vague or contains no explicit errors, output "unable to determine root cause based on current information"
- Strictly prohibited: Guessing root causes without evidence
Log Handling
- Logs may contain sensitive information (IP addresses, tokens, credentials)
- Only extract key error/traceback lines for diagnosis
- Do not display full logs in output
- For complete logs, use
ShowObsUrlOfTrainingJobLogsand prompt user to download (5min valid link)
Region Switching
- Default region is
cn-north-4 - When switching regions, ensure
project_idis configured for that region - Use
hcloud configure initor explicitly pass--project_idif region profile lacks project_id
Reference Documents
| Document | File | Description |
|---|---|---|
| API Catalog | references/api-catalog.md | 6 training diagnosis APIs, status phases, response structure, event levels |
| Diagnosis Flow | references/diagnosis-flow.md | 5-phase diagnosis workflow in detail with early exit principle |
| Command Templates | references/hcloud-command-templates.md | Complete hcloud command templates for each API |
| Confidence Rules | references/confidence-rules.md | Confidence level definitions, evidence mapping, output contracts |
| CLI Installation Guide | references/cli-installation-guide.md | hcloud CLI installation, configuration, verification |
| IAM Policies | references/iam-policies.md | Required IAM permissions and policy JSON |
| Verification Method | references/verification-method.md | 3-tier verification steps |
| Acceptance Criteria | references/acceptance-criteria.md | Pass/fail criteria for skill testing |
Notes
Security Constraints
- Read-only throughout: Only call GET APIs (except ListTrainingJobs which uses POST for read-only list query); never call Create/Update/Delete/Stop
- No credential leakage: Never print AK/SK
- User confirmation required: If fix suggestions involve changes (restart, modify specs), must clearly prompt "requires user confirmation before manual execution"; never auto-execute
- Sensitive information masking: Logs may contain sensitive info; mask sensitive fields before output (e.g., desensitize IPs, do not print complete tokens)
Scope Limitations
- Training job diagnosis only: Does not diagnose Notebook, inference services, or other scenarios
- No code modification: Does not modify any business code or resources
- No fabrication: Never fabricate root causes without evidence; must be based on API return fields
- No private data access: Does not directly read private data in user repositories
Known Limitations
- Some APIs may have rate limits; if throttled, wait and retry
- Log preview may be truncated; use OBS link for complete logs
- Metrics APIs removed from skill (can show state but cannot diagnose root causes)
status.task_statuses[].messagemay be empty for some failures; in such cases, Phase 3 APIs become necessary
Related skills
Huawei Cloud MRS cluster fault diagnosis skill. Diagnoses service faults, instance faults, and host faults through progressive root cause localization: quick log scan first, host troubleshooting when host issues are found, detailed investigation when no conclusion is reached. Driven by the built-in LakeWatch API client and the per-component knowledge base under components/. No commands outside the knowledge base are fabricated. Applicable to MRS fault diagnosis and root cause localization scenarios where a service name or node name is provided. Trigger words: "故障诊断", "故障定位", "fault diagnosis", "fault diagnose", "MRS故障", "服务故障", "实例故障", "主机故障", "集群排查", "集群诊断", "启动失败", "停止异常", "KrbServer故障", "DBService故障", "fault troubleshooting"
Invoke this skill to capture poor experiences and distill them into high-value requirements (Voice of Developer). Use when user encounters any Huawei Cloud related issues, like user expresses dissatisfaction, encounters errors, or wants to report issues/suggestions.Triggers include: "体验差","反馈问题","反馈建议","这个有bug","拒绝了请求","报告问题","反馈体验","report a problem","report a suggestion","bug report","poor experience","voice of developer"
Huawei Cloud MRS cluster alarm diagnosis skill. Analyzes the root cause of an MRS alarm based on user-provided alarm information (alarm ID, alarm name, alarm details, occurrence time, node IP, related service and logs), then outputs the root cause, repair steps, and verification method. Diagnosis is driven by the built-in LakeWatch API client and the per-alarm knowledge base under alarms/. No commands outside the knowledge base are fabricated. Applicable to MRS alarm diagnosis and root cause localization scenarios where an alarm ID is provided. Trigger words: "告警诊断", "告警定位", "alarm diagnosis", "alarm diagnose", "MRS告警", "告警原因", "告警ID", "alarm ID", "root cause"
Huawei Cloud CCE Pod failure diagnosis skill using Python SDK dispatcher. Use this skill when the user wants to: (1) diagnose Pod CrashLoopBackOff, ImagePull...
Audit Huawei Cloud skills for quality, security, and compliance using a two-check pipeline: skillspector (AI security) and gitleaks (credential leak). Generates structured reports with issue details and fix strategies. Triggers include: "审计技能","技能审计","检查技能质量","扫描技能问题","技能安全审计", "audit skill","check skill quality","scan skills for issues","skill audit", "华为云技能审计","技能合规检查","skill gate","质量门禁","技能检查", "audit huawei cloud skill","verify skill compliance","技能质量检查","跑审计","安全扫描".
More from huaweiclouddev-dev
Browse all skillsQueries Huawei Cloud billing and fee details only when Terraform needs a billing or pricing inquiry. Covers balances, bills, coupons, cash coupons, stored-value cards, orders, refunds, costs, free resources, resource usage, enterprise accounts, and on-demand/period/ELB/NAT/DCS pricing. No write operations. Use this skill only when Terraform requires billing details, invoice/bill summaries, coupon or balance status, refund/order billing status, or pricing inquiry. Triggers: Terraform 账单查询, Terraform 费用查询, Terraform 价格询价, Terraform 询价, Terraform billing query, Terraform pricing inquiry, Terraform price quote, Terraform bill summary.
Huawei Cloud RDS (Relational Database Service) full-scenario intelligent service covering all database engines (MySQL, PostgreSQL, SQL Server, MariaDB, GaussDB for MySQL, TaurusDB). Provides six capability domains: (1) Basic intelligent Q&A for RDS product features, best practices, and specifications; (2) SQL statement performance optimization with slow log analysis, top SQL, execution plan guidance, and index recommendations; (3) Database instance daily O&M including health inspection, restart, flavor resize, disk expansion, primary-standby switchover, and read replica management; (4) Online fault localization and troubleshooting via error logs, replication status, connection diagnostics, and recovery time window; (5) Parameter tuning with parameter group management, modification suggestions, and performance parameter adjustment guidance; (6) Backup and recovery guidance including backup policy management, manual backup creation, restore to new/existing instance, and point-in-time rec
Install, upgrade, verify, or troubleshoot local kubectl and the Huawei Cloud kubectl-cce plugin. Trigger when a user asks to install kubectl, install kubectl-cce, configure the CCE kubectl plugin, verify kubectl-cce availability, or repair local command prerequisites for CCE Kubernetes resource access.
Huawei Cloud MRS Hive SQL specification checking skill. Checks SQL statements against defined syntax and specification rules using the automated checker engine. No extra manual analysis beyond defined rules. Trigger:"Hive SQL优化"、"检查Hive SQL"、"Hive SQL检查"、"Hive SQL规范"、"Hive SQL语法"、"Hive SQL review"