插件应用市场

PDF解析工具
利用MinerU远程api解析pdf文档
==================================================
MinerU 文档提取器 · uTools 插件
==================================================
将 PDF / Word / PPT / Excel / 图片 / 网页 一键转换为Markdown、HTML、DOCX、JSON、LaTeX 等格式,基于 MinerU 高精度文档解析引擎。
--------------------------------------------------
一、功能亮点
--------------------------------------------------
- 多格式输入:PDF、Office 全家桶、常见图片、网页 URL
- 多格式输出:一次提取可同时生成 MD / HTML / DOCX / JSON / LaTeX
- 双模式提取:快速模式无需 Token(≤10 MB / 20 页、仅 MD);
精确模式支持 Token、多格式和 VLM
- 按文件类型选模型:PDF/图片等可选 VLM 或 Pipeline;
.html/.htm 自动锁定 HTML 专用模型
- OCR、表格识别、公式识别可分别开关
- 临时网络失败自动退避重试,插件隐藏后完成会发送通知
- 环境诊断:CLI 路径/版本、Token、输出权限、更新及功能兼容矩阵
- 五种触达方式:关键词搜索、拖入文件、剪贴板图片、URL 匹配、历史记录
- 实时进度:进度条 + 子进程日志实时输出,可随时取消
- 结果预览:内嵌 Markdown 渲染预览,支持复制 / 另存 / 打开目录
- 主题适配:自动跟随 uTools 亮 / 暗主题
- CLI 一键就绪:优先复用系统/npm CLI,确实缺失时才下载插件托管版本
- 安全边界:Token 使用 uTools 加密存储;精确提取会把文件提交至 MinerU 云端
- 批量与历史:支持最多 50 个文件批量处理,并保存历史元数据
- 文件集随时调整:配置页可继续添加、拖入、移除或重新选择文件
- 首次环境准备:首页首次自动检测 CLI/Token,之后复用上次检测结果
--------------------------------------------------
二、前置准备(首次使用必读)
--------------------------------------------------
1. 安装 mineru-open-api 命令行工具
本插件依赖 MinerU 官方 CLI,但不要求预先手动安装。
(1) 插件先实际执行 version,检查托管目录、系统 PATH 和 npm 全局目录。
(2) 发现任一可用 CLI 就直接复用,不访问下载地址、不重复安装。
(3) 确实没有 CLI 时,点击“一键安装 CLI”,插件才从 MinerU 官方 CDN
下载到 uTools 用户数据目录下的 mineru-cli 子目录。
托管安装不修改系统 PATH、不需要管理员权限。下载后会限制文件大小,
校验平台文件头,记录 SHA-256,并执行 version;全部通过后才切换生效。
失败时不会覆盖原版本,有上一托管版本时可回滚。
如需自行管理,也可手动执行:
npm install -g mineru-open-api
安装后在“MinerU CLI”状态行点击“CLI 管理”重新检测即可,不会下载。
2. 获取并配置 MinerU Token
精确提取(extract)与网页(crawl)需要 Token;
快速模式(flash-extract)无需 Token:
(1) 前往 https://mineru.net/apiManage/token 创建 Token
(2) 在首页“使用环境”卡片中点击“配置 Token”
(3) 粘贴 Token → 点击“验证并保存”
Token 使用 uTools 加密存储,通过环境变量 MINERU_TOKEN 传递给 CLI。
精确提取时,CLI 会把 Token 作为认证信息,并将文件提交给 MinerU 云端。
--------------------------------------------------
三、五种触达方式
--------------------------------------------------
1) 关键词
在 uTools 搜索框输入 MinerU / 文档提取 / 文档解析 /
PDF转MD / pdf转markdown
→ 进入主界面手动选择文件或粘贴图片
2) 拖入文件
从文件管理器拖文件到 uTools 搜索框 → 选“MinerU 提取此文件”
→ 跳过选择,直接进入配置确认
3) 剪贴板图片
复制截图 / 图片后,在主界面按 Ctrl+V 粘贴
→ 自动存为临时图片进入提取流程
4) 输入 URL
在 uTools 输入 http(s):// 开头的网址 → 选“MinerU 提取网页”
→ 走 crawl 模式提取网页内容
--------------------------------------------------
四、配置项说明
--------------------------------------------------
输出目录 默认 ~/MinerU-Skill/ 每次任务在该目录下创建独立子目录
提取模式 默认 精确 快速无需 Token;精确支持多格式与多模型
输出格式 默认 MD 快速固定 MD;精确可多选
识别模型 默认 自动 HTML 强制 html;其他文件可选 VLM/Pipeline
内容识别 表格/公式开启 OCR、表格、公式可分别开关
语言 默认 中文 (ch) 可选 ch / en / auto
超时(秒) 默认 300 大文件建议调大(如 600)
页范围 默认 全部 仅文件模式可选,如 1-10
注意:网页提取(crawl)仅支持 MD / JSON / HTML 三种格式,
且无需模型与页范围。设置项会自动记忆,下次使用时自动填充。
本地 HTML 文件与网页 URL 是不同流程。选择 .html/.htm 文件后,
界面会提示“HTML 文件已自动切换为 html 模型”,锁定模型并清除页范围。
批量任务逐文件应用同一规则,preload 后端和 MCP 调用也会再次校验。
HTML 文件必须使用精确模式。快速模式限受支持文件、10 MB / 20 页,
只生成 Markdown,临时网络错误默认自动重试 2 次。
--------------------------------------------------
五、使用步骤
--------------------------------------------------
1. 触发插件:用上述任一方式进入插件
2. 确认配置:在配置面板核对文件、输出目录、格式、模型等
可继续添加/拖入文件、逐个移除,或重新选择整个文件集
配置内容超过当前窗口高度时可直接纵向滚动
3. 开始提取:点击“开始提取”,进入进度面板
4. 查看进度:进度条 + 实时日志显示提取过程,可点“取消”中止
5. 查看结果:提取完成后,内嵌预览 Markdown 渲染结果
6. 后续操作:
- 复制 MD:将 Markdown 内容复制到剪贴板
- 保存为文件:另存到指定位置
- 打开输出目录:在系统文件管理器中打开
- 重新提取:回到配置面板再次提取
--------------------------------------------------
六、CLI 与 Token 管理
--------------------------------------------------
- 统一入口:首页“使用环境”卡片集中管理 CLI、Token 和环境诊断,
配置页不再重复显示;收起时点击提示文字或“展开”即可管理
- CLI 状态:首页显示版本、插件托管/系统 npm 来源及实际路径
- 已有 CLI:重新检测只运行环境检查,不进行任何下载
- 缺少 CLI:点击检测并安装后,后端会再次检查,确实缺失才下载
- 安全切换:staging 校验通过后才更新状态指针,失败保留原版本
- 一键安装平台:Windows、macOS、Linux 的 x64 / arm64
- 环境诊断:集中检查 CLI 路径、版本兼容性、Token、输出权限和功能矩阵
- 检测频率:首次使用自动检测并缓存;后续打开不重复检测,
仅手动重检、安装 CLI、切换 Token或运行诊断时更新
- 状态查看:首页“MinerU Token”状态行显示当前状态
(已配置 / 未配置 / 无效过期)
- 配置 / 重新配置:点状态行右侧按钮,打开 Token 弹窗
- 验证机制:保存前会调用 mineru-open-api auth --verify 校验,
无效则不保存
--------------------------------------------------
七、支持格式
--------------------------------------------------
文档:.pdf .docx .doc .pptx .ppt .xlsx .xls .txt
图片:.png .jpg .jpeg .bmp .webp .tiff .gif
网页:.html .htm 及任意 http(s):// URL
--------------------------------------------------
八、常见问题
--------------------------------------------------
Q:提示“mineru-open-api 未安装”
A:点击“一键安装 CLI”;插件会先复查,确实缺失时才下载
Q:已经用 npm 安装,但插件没有识别
A:在“CLI 管理”中重新检测;插件会扫描常见 npm 全局目录,不只依赖 PATH
Q:一键安装失败
A:原 CLI 或上一托管版本不会被覆盖;可检查网络重试,或手动 npm 安装
Q:提示“Token 无效或已过期”
A:Token 失效,重新到官网创建并配置
Q:没有 Token 是否可以使用
A:可以选择快速模式;仅支持 Markdown,且文件须满足 10 MB / 20 页限制
Q:提取超时
A:大文件请在配置中增大“超时”秒数(如 600)
Q:快速模式不可选或文件超限
A:HTML、不受支持类型、超过 10 MB 或 20 页时请切换精确模式
Q:输出目录无写入权限
A:更换到有权限的目录,如 ~/MinerU-Skill/
Q:未生成 Markdown
A:可能仅选了其它格式,检查输出格式勾选
Q:HTML 文件提示模型不支持
A:HTML 文件必须走精确模式并使用 html 模型;1.0.1 会自动锁定
Q:网络波动或进度暂时不动
A:临时网络错误默认自动重试 2 次,界面和日志会显示重试次数
--------------------------------------------------
九、隐私与安全
--------------------------------------------------
- Token:使用 uTools dbCryptoStorage 加密存储;旧版明文 Token 会自动迁移
- 云端处理:flash-extract、extract 与 crawl 都会把文件或 URL 提交给 MinerU;
快速模式只是无需 Token,并非本地离线处理
- 本地留存:输出正文保存在用户目录,历史数据库只保存路径和短摘要
- CLI 下载:仅确认没有可用 CLI 时访问 MinerU 官方 HTTPS CDN;限制主机、
端口和大小,记录 SHA-256,在 staging 中通过文件头及 version 校验后切换;
不修改系统 PATH
- CLI 校验边界:官方安装脚本目前没有独立 checksum 清单,SHA-256 用于
本地版本标识和留痕,来源认证主要依赖 HTTPS
- AI 工具:同样会触发云端上传,只应处理用户明确授权的文件
- 网页安全:仅允许公开 http/https 地址,拒绝本机和常见私有网络地址
--------------------------------------------------
十、技术信息
--------------------------------------------------
插件 ID:mineru-doc-extractor
依赖:Node.js 环境、mineru-open-api CLI、MinerU Token
技术栈:原生 HTML + CSS + Vanilla JS + Node.js(preload)
平台:Windows / macOS / Linux
官网:https://mineru.net
当前版本:1.0.1
--------------------------------------------------
如遇问题,可先运行插件内“环境诊断”,再按结果处理。
MinerU 文档提取器 · uTools 插件
==================================================
将 PDF / Word / PPT / Excel / 图片 / 网页 一键转换为Markdown、HTML、DOCX、JSON、LaTeX 等格式,基于 MinerU 高精度文档解析引擎。
--------------------------------------------------
一、功能亮点
--------------------------------------------------
- 多格式输入:PDF、Office 全家桶、常见图片、网页 URL
- 多格式输出:一次提取可同时生成 MD / HTML / DOCX / JSON / LaTeX
- 双模式提取:快速模式无需 Token(≤10 MB / 20 页、仅 MD);
精确模式支持 Token、多格式和 VLM
- 按文件类型选模型:PDF/图片等可选 VLM 或 Pipeline;
.html/.htm 自动锁定 HTML 专用模型
- OCR、表格识别、公式识别可分别开关
- 临时网络失败自动退避重试,插件隐藏后完成会发送通知
- 环境诊断:CLI 路径/版本、Token、输出权限、更新及功能兼容矩阵
- 五种触达方式:关键词搜索、拖入文件、剪贴板图片、URL 匹配、历史记录
- 实时进度:进度条 + 子进程日志实时输出,可随时取消
- 结果预览:内嵌 Markdown 渲染预览,支持复制 / 另存 / 打开目录
- 主题适配:自动跟随 uTools 亮 / 暗主题
- CLI 一键就绪:优先复用系统/npm CLI,确实缺失时才下载插件托管版本
- 安全边界:Token 使用 uTools 加密存储;精确提取会把文件提交至 MinerU 云端
- 批量与历史:支持最多 50 个文件批量处理,并保存历史元数据
- 文件集随时调整:配置页可继续添加、拖入、移除或重新选择文件
- 首次环境准备:首页首次自动检测 CLI/Token,之后复用上次检测结果
--------------------------------------------------
二、前置准备(首次使用必读)
--------------------------------------------------
1. 安装 mineru-open-api 命令行工具
本插件依赖 MinerU 官方 CLI,但不要求预先手动安装。
(1) 插件先实际执行 version,检查托管目录、系统 PATH 和 npm 全局目录。
(2) 发现任一可用 CLI 就直接复用,不访问下载地址、不重复安装。
(3) 确实没有 CLI 时,点击“一键安装 CLI”,插件才从 MinerU 官方 CDN
下载到 uTools 用户数据目录下的 mineru-cli 子目录。
托管安装不修改系统 PATH、不需要管理员权限。下载后会限制文件大小,
校验平台文件头,记录 SHA-256,并执行 version;全部通过后才切换生效。
失败时不会覆盖原版本,有上一托管版本时可回滚。
如需自行管理,也可手动执行:
npm install -g mineru-open-api
安装后在“MinerU CLI”状态行点击“CLI 管理”重新检测即可,不会下载。
2. 获取并配置 MinerU Token
精确提取(extract)与网页(crawl)需要 Token;
快速模式(flash-extract)无需 Token:
(1) 前往 https://mineru.net/apiManage/token 创建 Token
(2) 在首页“使用环境”卡片中点击“配置 Token”
(3) 粘贴 Token → 点击“验证并保存”
Token 使用 uTools 加密存储,通过环境变量 MINERU_TOKEN 传递给 CLI。
精确提取时,CLI 会把 Token 作为认证信息,并将文件提交给 MinerU 云端。
--------------------------------------------------
三、五种触达方式
--------------------------------------------------
1) 关键词
在 uTools 搜索框输入 MinerU / 文档提取 / 文档解析 /
PDF转MD / pdf转markdown
→ 进入主界面手动选择文件或粘贴图片
2) 拖入文件
从文件管理器拖文件到 uTools 搜索框 → 选“MinerU 提取此文件”
→ 跳过选择,直接进入配置确认
3) 剪贴板图片
复制截图 / 图片后,在主界面按 Ctrl+V 粘贴
→ 自动存为临时图片进入提取流程
4) 输入 URL
在 uTools 输入 http(s):// 开头的网址 → 选“MinerU 提取网页”
→ 走 crawl 模式提取网页内容
--------------------------------------------------
四、配置项说明
--------------------------------------------------
输出目录 默认 ~/MinerU-Skill/ 每次任务在该目录下创建独立子目录
提取模式 默认 精确 快速无需 Token;精确支持多格式与多模型
输出格式 默认 MD 快速固定 MD;精确可多选
识别模型 默认 自动 HTML 强制 html;其他文件可选 VLM/Pipeline
内容识别 表格/公式开启 OCR、表格、公式可分别开关
语言 默认 中文 (ch) 可选 ch / en / auto
超时(秒) 默认 300 大文件建议调大(如 600)
页范围 默认 全部 仅文件模式可选,如 1-10
注意:网页提取(crawl)仅支持 MD / JSON / HTML 三种格式,
且无需模型与页范围。设置项会自动记忆,下次使用时自动填充。
本地 HTML 文件与网页 URL 是不同流程。选择 .html/.htm 文件后,
界面会提示“HTML 文件已自动切换为 html 模型”,锁定模型并清除页范围。
批量任务逐文件应用同一规则,preload 后端和 MCP 调用也会再次校验。
HTML 文件必须使用精确模式。快速模式限受支持文件、10 MB / 20 页,
只生成 Markdown,临时网络错误默认自动重试 2 次。
--------------------------------------------------
五、使用步骤
--------------------------------------------------
1. 触发插件:用上述任一方式进入插件
2. 确认配置:在配置面板核对文件、输出目录、格式、模型等
可继续添加/拖入文件、逐个移除,或重新选择整个文件集
配置内容超过当前窗口高度时可直接纵向滚动
3. 开始提取:点击“开始提取”,进入进度面板
4. 查看进度:进度条 + 实时日志显示提取过程,可点“取消”中止
5. 查看结果:提取完成后,内嵌预览 Markdown 渲染结果
6. 后续操作:
- 复制 MD:将 Markdown 内容复制到剪贴板
- 保存为文件:另存到指定位置
- 打开输出目录:在系统文件管理器中打开
- 重新提取:回到配置面板再次提取
--------------------------------------------------
六、CLI 与 Token 管理
--------------------------------------------------
- 统一入口:首页“使用环境”卡片集中管理 CLI、Token 和环境诊断,
配置页不再重复显示;收起时点击提示文字或“展开”即可管理
- CLI 状态:首页显示版本、插件托管/系统 npm 来源及实际路径
- 已有 CLI:重新检测只运行环境检查,不进行任何下载
- 缺少 CLI:点击检测并安装后,后端会再次检查,确实缺失才下载
- 安全切换:staging 校验通过后才更新状态指针,失败保留原版本
- 一键安装平台:Windows、macOS、Linux 的 x64 / arm64
- 环境诊断:集中检查 CLI 路径、版本兼容性、Token、输出权限和功能矩阵
- 检测频率:首次使用自动检测并缓存;后续打开不重复检测,
仅手动重检、安装 CLI、切换 Token或运行诊断时更新
- 状态查看:首页“MinerU Token”状态行显示当前状态
(已配置 / 未配置 / 无效过期)
- 配置 / 重新配置:点状态行右侧按钮,打开 Token 弹窗
- 验证机制:保存前会调用 mineru-open-api auth --verify 校验,
无效则不保存
--------------------------------------------------
七、支持格式
--------------------------------------------------
文档:.pdf .docx .doc .pptx .ppt .xlsx .xls .txt
图片:.png .jpg .jpeg .bmp .webp .tiff .gif
网页:.html .htm 及任意 http(s):// URL
--------------------------------------------------
八、常见问题
--------------------------------------------------
Q:提示“mineru-open-api 未安装”
A:点击“一键安装 CLI”;插件会先复查,确实缺失时才下载
Q:已经用 npm 安装,但插件没有识别
A:在“CLI 管理”中重新检测;插件会扫描常见 npm 全局目录,不只依赖 PATH
Q:一键安装失败
A:原 CLI 或上一托管版本不会被覆盖;可检查网络重试,或手动 npm 安装
Q:提示“Token 无效或已过期”
A:Token 失效,重新到官网创建并配置
Q:没有 Token 是否可以使用
A:可以选择快速模式;仅支持 Markdown,且文件须满足 10 MB / 20 页限制
Q:提取超时
A:大文件请在配置中增大“超时”秒数(如 600)
Q:快速模式不可选或文件超限
A:HTML、不受支持类型、超过 10 MB 或 20 页时请切换精确模式
Q:输出目录无写入权限
A:更换到有权限的目录,如 ~/MinerU-Skill/
Q:未生成 Markdown
A:可能仅选了其它格式,检查输出格式勾选
Q:HTML 文件提示模型不支持
A:HTML 文件必须走精确模式并使用 html 模型;1.0.1 会自动锁定
Q:网络波动或进度暂时不动
A:临时网络错误默认自动重试 2 次,界面和日志会显示重试次数
--------------------------------------------------
九、隐私与安全
--------------------------------------------------
- Token:使用 uTools dbCryptoStorage 加密存储;旧版明文 Token 会自动迁移
- 云端处理:flash-extract、extract 与 crawl 都会把文件或 URL 提交给 MinerU;
快速模式只是无需 Token,并非本地离线处理
- 本地留存:输出正文保存在用户目录,历史数据库只保存路径和短摘要
- CLI 下载:仅确认没有可用 CLI 时访问 MinerU 官方 HTTPS CDN;限制主机、
端口和大小,记录 SHA-256,在 staging 中通过文件头及 version 校验后切换;
不修改系统 PATH
- CLI 校验边界:官方安装脚本目前没有独立 checksum 清单,SHA-256 用于
本地版本标识和留痕,来源认证主要依赖 HTTPS
- AI 工具:同样会触发云端上传,只应处理用户明确授权的文件
- 网页安全:仅允许公开 http/https 地址,拒绝本机和常见私有网络地址
--------------------------------------------------
十、技术信息
--------------------------------------------------
插件 ID:mineru-doc-extractor
依赖:Node.js 环境、mineru-open-api CLI、MinerU Token
技术栈:原生 HTML + CSS + Vanilla JS + Node.js(preload)
平台:Windows / macOS / Linux
官网:https://mineru.net
当前版本:1.0.1
--------------------------------------------------
如遇问题,可先运行插件内“环境诊断”,再按结果处理。





