诊断生产力系统反复失效的根因,给出最小干预——容量测算、瓶颈定位、可靠的本地记录。
编程
TencentCloud OCR
试用腾讯云通用文字识别(高精度版)(GeneralAccurateOCR) 技能包。当用户发送/粘贴图片、提供图片URL、或要求识别图片中的文字时,应自动调用此技能。支持图像整体文字的检测和识别,支持中文、英文、中英文、数字和特殊字符号的识别,并返回文字框位置和文字内容。适用于文字较多、版式复杂、对识别准召率要求较高...
它能做什么
核心能力: **文字识别**:高精度识别图片中的文字内容,返回完整识别文本 **图片URL直接识别**:支持直接传入图片URL进行识别,无需下载图片 **PDF支持**:支持对PDF文件进行文字识别(单页) **单字信息**:可选返回每个单字的位置和置信度信息 **多语种简历结构化识别**:基于 OCR 结果,对简历进行结构化提取与格式化输出(详见 )
技能文档
腾讯云通用文字识别(高精度版)(GeneralAccurateOCR)
用途
调用腾讯云OCR通用文字识别(高精度版)接口,对图片中的文字进行精准提取。
核心能力:
- 文字识别:高精度识别图片中的文字内容,返回完整识别文本
- 图片URL直接识别:支持直接传入图片URL进行识别,无需下载图片
- PDF支持:支持对PDF文件进行文字识别(单页)
- 单字信息:可选返回每个单字的位置和置信度信息
- 多语种简历结构化识别:基于 OCR 结果,对简历进行结构化提取与格式化输出(详见
references/resume-parsing.md)
官方文档:https://cloud.tencent.com/document/api/866/37831
📚 可用资源
References(场景化指引)
references/resume-parsing.md- 多语种简历结构化识别指引(处理流程、Prompt模板、输出格式化模板、格式化规则)
使用时机
当用户提出以下需求时触发此技能:
- 用户发送了图片(包括粘贴图片、上传图片、截图等),需要识别其中的文字内容
- 用户提供了图片URL(如
https://xxx.com/image.jpg、https://xxx.cos.xxx/xxx.png等),需要识别其中的文字 - 用户说"识别这张图"、"看看图片里写了什么"、"提取图片文字"、"OCR"等表达
- 需要从图片或PDF中提取文字内容
- 需要对各类文档、图片等进行文字识别
- 涉及通用文字OCR识别的任何场景
- 需要从简历图片/PDF中识别并结构化提取简历信息(请参考
references/resume-parsing.md指引) - 需要对多语种简历进行识别和格式化输出(请参考
references/resume-parsing.md指引)
🤖 自动触发指引(面向大模型)
当检测到以下信号时,应自动调用此技能,无需用户显式要求"OCR":
- 用户消息中包含图片URL:检测到
http(s)://开头且以图片扩展名(.jpg,.jpeg,.png,.bmp,.gif,.webp,.tiff)结尾的URL,或包含已知图片托管域名(如cos.、cdn.、oss.、imgur.com等)的URL - 用户上传/粘贴了图片:对话中出现了图片附件或图片Base64数据
- 用户意图关键词:消息中包含"识别"、"文字"、"OCR"、"提取"、"读取"、"看看写了什么"等与文字识别相关的表达
调用方式:
- 如果用户提供了图片URL,直接使用
--image-url参数传入 - 如果用户上传了图片文件,使用
--image-base64参数传入文件路径或Base64内容
环境要求
- Python 3.6+
- 依赖:
tencentcloud-sdk-python(通过pip install tencentcloud-sdk-python安装) - 环境变量:
TENCENTCLOUD_SECRET_ID:腾讯云API密钥IDTENCENTCLOUD_SECRET_KEY:腾讯云API密钥Key
使用方式
运行 scripts/main.py 脚本完成文字识别。脚本使用 SDK 高层接口 client.GeneralAccurateOCR(req) 进行调用,具有类型安全和自动反序列化的优势。
请求参数
| 参数 | 类型 | 必填 | 说明 |
|---|---|---|---|
| ImageBase64 | str | 否(二选一) | 图片Base64值,不超过10MB |
| ImageUrl | str | 否(二选一) | 图片URL地址,优先使用 |
| IsPdf | bool | 否 | 是否开启PDF识别,默认false |
| PdfPageNumber | int | 否 | 需要识别的PDF页码,IsPdf为true时有效,默认1 |
| IsWords | bool | 否 | 是否返回单字信息,默认false |
| UserAgent | str | 否 | 请求来源标识(可选),用于追踪调用来源,统一固定为Skills |
⚠️ UserAgent参数使用指南
--user-agent参数是可选参数,统一固定为Skills,无需手动传递。用于标识API调用来源,便于追踪和统计:
| 调用框架 | --user-agent 参数值 | 说明 |
|---|---|---|
| 所有框架 | Skills | 统一固定值,不传递时也默认为此值 |
实现说明:
- 通过
--user-agent命令行参数传递,SDK 会将其拼接为SDK_PYTHON_x.x.x; Skills注入到请求中 - 统一固定为
Skills,未传递时也默认为此值 - 该标识会记录在ES日志的
ReqBody.RequestClient字段中,可用于追踪来源
输出格式
识别成功后返回 JSON 格式结果:
{
"raw_text": "识别到的完整文字内容\n第二行文字\n第三行文字",
"RequestId": "xxx"
}
无文字时返回:
{
"raw_text": "",
"message": "No text detected in the image.",
"RequestId": "xxx"
}
调用示例
# 用户提供了图片URL,直接传入识别(最常用场景)
python scripts/main.py --image-url "https://example.com/document.jpg"
# 用户上传了图片文件,使用 Base64 方式调用
python scripts/main.py --image-base64 "/path/to/document.jpg"
# 识别 PDF 文件中的文字
python scripts/main.py --image-url "https://example.com/doc.pdf" \
--is-pdf true --pdf-page-number 1
# 返回单字信息
python scripts/main.py --image-url "https://example.com/document.jpg" --is-words true
密钥配置
Step 1: 获取 API 密钥
Step 2: 获取/购买 OCR 服务
在购买页面中选择 通用文字识别(高精度版) 完成购买。
Step 3: 设置环境变量
Linux / macOS:
export TENCENTCLOUD_SECRET_ID="你的SecretId"
export TENCENTCLOUD_SECRET_KEY="你的SecretKey"
Windows (PowerShell):
$env:TENCENTCLOUD_SECRET_ID = "你的SecretId"
$env:TENCENTCLOUD_SECRET_KEY = "你的SecretKey"
相关技能
按用户明确指令,在得到大脑(Get笔记)中保存、搜索并管理笔记与知识库。
从 API 文档、OpenAPI 规范、curl 示例或脚本搭建可在任意仓库运行的持久化 CLI。
通过迭代式评测循环创建、修改并基准测试 agent 技能。
让代理在 Figma 文件里运行 JavaScript,读写节点与变量。
按 Microsoft 最新文档规范选用 ASP.NET Core 应用模型与中间件。
zt1314p-design 的更多技能
浏览全部技能腾讯云试题批改Agent(SubmitQuestionMarkAgentJob/DescribeQuestionMarkAgentJob)接口调用技能。当用户需要对试卷图片或试题图片中的K12试卷或试题进行自动批改、手写答案识别、知识点分析时,应使用此技能。支持整卷图片批改和单题图片批改,提供题目切题、正误判定、...
腾讯云通用票据识别高级版(VatInvoiceOCR)接口调用技能。当用户需要识别发票图片中增值税专用发票、增值税普通发票、增值税电子专票、增值税电子普票、电子发票(普通/增值税专用)的全字段信息时,应使用此技能。支持识别发票图片中的发票代码、发票号码、开票日期、合计金额、校验码、税率、合计税额、价税合计、购买方...
腾讯云实时文档抽取Agent(ExtractDocAgent)接口调用技能。当用户需要从图片或PDF中按自定义字段名称进行结构化信息抽取时,应使用此技能。支持自定义字段名称、字段类型(KV对或表格字段)和字段提示词,实现灵活的文档信息提取。适用于合同、发票、报告等各类文档的结构化数据抽取场景。
腾讯云表格识别v3(RecognizeTableAccurateOCR)接口调用技能。当用户需要从表格图片或PDF中识别常规表格、无线表格、多表格的内容,提取每个单元格的文字信息,或将表格图片识别结果导出为Excel文件时,应使用此技能。支持中英文表格图片、旋转表格图片、嵌套表格图片等复杂场景,识别效果优于表格识...
企业财报三表(资产负债表 / 利润表 / 纳税申报表)勾稽检查技能包。当用户上传财报PDF/图片、或要求进行财报审核、三表勾稽校验时,应自动调用此技能。支持从财报PDF/图片中结构化抽取三表关键数据,自动统一单位(万元)与币种(必要时按实时汇率折算为CNY),执行时间一致性/字段完整性/核心税会差异/跨表校验,并...
腾讯云行驶证识别(VehicleLicenseOCR)接口调用技能。当用户需要识别行驶证图片主页(车牌号码、车辆类型、所有人、住址、使用性质、品牌型号、识别代码、发动机号、注册日期、发证日期)或副页(号牌号码、档案编号、核定载人数、总质量、整备质量、核定载质量、外廓尺寸、准牵引总质量、备注、检验记录)信息时,应使...