文字识别与结构化提取示例
场景:提取一张发票中的报销信息
上传发票图片后,可以直接描述需要的字段:
识别这张发票,整理出发票号码、开票日期、购买方、销售方、金额和税额,并返回结构化结果。
Agent 会使用票据识别能力返回结构化 JSON。不同票据包含的字段可能不同,不存在或无法确认的字段不会凭空补全。
场景:提取图片中的纯文本
提取这张会议白板照片中的全部文字,只返回纯文本,不保存到云端。
Agent 会对单张图片执行通用 OCR,并直接返回文本。如果需要保留标题、列表等结构,可以改为输出 Markdown。
场景:提取图片中的数学公式
识别这张试卷中的数学公式,将公式区域裁切后拼接成一张图片。
Agent 会识别公式所在区域,并返回一张拼接后的 PNG 公式图片。这项能力不等同于通用文字 OCR。

