MinerU 如何启用 LLM 辅助标题分级功能?
发布时间:2026/9/9 21:07:42
分类:文化教育
浏览:1234

MinerU 如何启用 LLM 辅助标题分级功能【免费下载链接】MinerUTransforms complex documents like PDFs and Office docs into LLM-ready markdown/JSON for your Agentic workflows.项目地址: https://gitcode.com/GitHub_Trending/mi/MinerUMinerU 默认输出的 Markdown 中标题的层级可能和文档实际结构不一致。MinerU 提供 LLM 辅助标题分级功能解析完成后把文档中所有标题连同行高、页码信息发给一个兼容 OpenAI 协议的 LLM 模型由模型重新划分 14 级标题层级再写回输出结果。该功能默认关闭通过用户目录下的mineru.json配置文件中llm-aided-config配置段启用需要自备 LLM API 密钥。前置条件拿到 mineru.json 配置文件配置写在用户目录家目录下的mineru.json。获得这个文件有两种方式见 模型源说明 与 使用 MinerU运行内置模型下载命令mineru-models-download时会自动生成也可以把仓库根目录的配置模板文件复制到用户目录下并重命名为mineru.json。如需把配置文件放到别处可用环境变量MINERU_TOOLS_CONFIG_JSON指定其他配置文件路径见 命令行工具使用说明。配置 llm-aided-config 配置段模板中该段结构如下摘自 mineru.template.jsonllm-aided-config: { title_aided: { api_key: your_api_key, base_url: https://dashscope.aliyuncs.com/compatible-mode/v1, model: qwen3.5-plus, enable_thinking: false, enable: false } }各字段作用依据 quick_usage 文档api_key替换为你的 LLM API 密钥这是启用前的必做项base_urlLLM 服务地址功能兼容所有支持 OpenAI 协议的模型按你的 API 供应商替换model模型名。文档说明默认使用阿里云百炼的qwen3-next-80b-a3b-instruct模型模板文件中则写的是qwen3.5-plus两处不一致请以你实际接入的供应商和模型为准enable_thinking如果你的 API 供应商不支持该参数按文档说明删除enable_thinking: false这一行即可enable功能开关必须设为true才会启用。[!NOTE] 结构差异需要留意quick_usage.md文档中的示例把api_key、enable等字段直接平铺在llm-aided-config下而模板文件和源码 title_level_postprocess.py 读取的是嵌套的title_aided子键llm_aided_config.get(title_aided)。启用功能时请以模板文件的title_aided嵌套结构为准否则开关不会被读取到。执行解析配置保存后按正常流程用命令行解析文档即可无需额外参数mineru -p input_path -o output_pathinput_path本地PDF/ 图片 /DOCX/PPTX/XLSX文件或目录替换为你自己的路径output_path输出目录替换为你自己的路径。从源码 title_level_postprocess.py 可见标题分级在pipeline、vlm、hybrid三个 PDF 解析后端的流程中被调用SUPPORTED_PDF_BACKENDSCLI 未传--api-url时会自动拉起本地临时mineru-api该功能在解析完成后随中间结果一并处理。验证功能是否生效两处可核对的迹象均来自源码 title_level_postprocess.py 与 llm_aided.py 中的日志运行日志中出现标题分级状态行格式为源码日志耗时数值会不同title leveling finished, cost: 12.34s若分级失败则输出title leveling failed, cost: ...。文档中没有任何标题块时日志会输出No titles detected, skipping LLM-aided title optimization.说明本次没有标题可分级。检查output_path中生成的 Markdown 文件标题应呈现分级后的#层级结构。LLM 调用细节见 llm_aided.py请求以流式方式发给 OpenAI 兼容接口最多重试 3 次如果模型返回的标题键与输入不一致会记录The keys in the optimized title result do not match the input titles.警告重试耗尽后记录Failed to decode dict after maximum retries.此时本次分级不生效可检查api_key、base_url和model是否正确。限制说明功能默认关闭enable为false或配置文件中不存在llm-aided-config/title_aided段时不会发起任何 LLM 调用。分级结果最多 4 级标题且层级连续不跳级这是发给模型的提示词中明确的约束见 llm_aided.py。该功能依赖外部 LLM 服务解析结果会因所用模型而存在差异配置只影响标题分级不改变其他解析参数。【免费下载链接】MinerUTransforms complex documents like PDFs and Office docs into LLM-ready markdown/JSON for your Agentic workflows.项目地址: https://gitcode.com/GitHub_Trending/mi/MinerU创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考