文字識別與結構化提取示例
場景:提取一張發票中的報銷資訊
上傳發票圖片後,可以直接描述需要的欄位:
識別這張發票,整理出發票號碼、開票日期、購買方、銷售方、金額和稅額,並返回結構化結果。
Agent 會使用票據識別能力返回結構化 JSON。不同票據包含的欄位可能不同,不存在或無法確認的欄位不會憑空補全。
場景:提取圖片中的純文本
提取這張會議白板照片中的全部文字,只返回純文本,不儲存到雲端。
Agent 會對單張圖片執行通用 OCR,並直接返回文本。如果需要保留標題、列表等結構,可以改為輸出 Markdown。
場景:提取圖片中的數學公式
識別這張試卷中的數學公式,將公式區域裁切後拼接成一張圖片。
Agent 會識別公式所在區域,並返回一張拼接後的 PNG 公式圖片。這項能力不等同於通用文字 OCR。

