插件应用市场
icon
AI识图
一个 uTools 插件:框选屏幕截图 / 选择图片 → 调用 AI 视觉接口 → 识别图片里的文字 + 解读内容,支持一键复制结果。
0 个评分
0
用户
user
3 位
版本
user
1.0.1
大小
453.50 
KB
slide
slide
slide
slide
识图 —— 截图即识,AI 读出图里的字与意

看到一段无法复制的文字(截图、报错弹窗、扫描件、图片里的表格),不必手敲,
也不必离开当前窗口:唤起 → 框选 → 点一个按钮 → 复制结果。


【先选意图,再回答】

截图后不会立刻发请求,而是先让你点选要做什么。同一张图可以换个问法再问
一次,不必重新截图。

这是什么 …… 一句话说出主体(物体 / 界面 / 场景 / 图表类型)
解释图片 …… 三点式:是什么 · 关键信息 · 可能用途
提取图片内容 …… 逐字提取,保留顺序与换行,表格还原为 Markdown
翻译图片内容 …… 原文 / 译文对照;原文是中文时自动改译英文
自定义要求 …… 就地写一句自己的要求,比如「把图里的表格转成 CSV」


【看得清才敢说】

内置识别纪律:看不清的文字、数字直接标注「该位置文字模糊无法识别」,
禁止编造文件名、路径、金额、账号等数据。

识别结果通常会被直接复制去使用——编造出来的数值比留白危险得多。


【结果直接能用】

识别结果按 Markdown 渲染:标题、列表、表格、代码块、引用都会正确排版,
不再是裸露的井号和星号。需要核对模型原始输出时,可一键切到「原文」视图。


【支持多家接口】

豆包(火山方舟)、通义千问(DashScope)、OpenAI 兼容接口,以及本地 Ollama。

填好 API Key 后会自动拉取该账号的可用模型,点下拉按钮选择即可,不必手敲
模型名;也允许直接填写接入点 ID(ep-xxxx)。


【出问题能看懂】

未填 Key、模型选错、地址写错、额度用尽、网络不通——每种情况都给出具体原因
与修法,而不是甩一串原始报错。

「测试连接」会真发一张图给模型,把「接口通了」和「模型会看图」区分开——
后者是配置视觉模型时最常见的坑。


【四种取图方式】

· 框选屏幕任意区域截图
· 选择本地图片文件
· 复制图片后直接输入关键词
· 把图片文件拖进 uTools


【隐私与离线】

· API Key 保存在 uTools 本地数据库,只发往你自己配置的那个接口,
插件不做任何遥测或上报
· 插件完全离线自足:不引远程字体、不引 CDN 脚本,界面里零个网络资源
引用,断网也能正常打开