ARTICLE DETAIL

资讯详情

深耕网站视觉设计与运营推广的一线实战洞察。

20分钟把200页PDF变成可问答的知识库:Qwen-Agent文档解析零基础实操

20分钟把200页PDF变成可问答的知识库:Qwen-Agent文档解析零基础实操 20分钟把200页PDF变成可问答的知识库Qwen-Agent文档解析零基础实操【免费下载链接】Qwen-AgentAgent framework and applications built upon Qwen3.0, featuring Function Calling, MCP, Code Interpreter, RAG, Chrome extension, etc.项目地址: https://gitcode.com/GitHub_Trending/qw/Qwen-Agent一份200页的年报落到你桌上今天下班前要交关键数据。老办法打开PDF、一页页找表格、手动拷进表格来回核对几遍两三个小时就过去了示例估算。换成Qwen-Agent的文档解析流程上传到分块完成约15分钟再追问2024年各业务板块毛利率直接命中相关分块。下面是4个实操步骤。左边是原始PDF右边是助手基于解析内容直接作答不用人工摘录。 4步从克隆仓库到对文档提问5分钟装好环境克隆仓库并安装中括号里的两个 extras 是关键rag带来 pdfminer、pdfplumber、python-docx 等解析库gui带来 Gradio 页面。建议 Python 3.10。git clone https://gitcode.com/GitHub_Trending/qw/Qwen-Agent cd Qwen-Agent pip install -e ./[gui,rag]2分钟接上模型解析工具本身不调用模型但和文档对话需要一个设置环境变量DASHSCOPE_API_KEY官方模型服务如果你自建了 Qwen 服务vLLM、Ollama 等指向 OpenAI 兼容端点即可。10分钟拿到第一个文档解析结果核心是内置工具DocParser指一个文档它返回标题加分块列表。from qwen_agent.tools.doc_parser import DocParser parser DocParser() result parser.call({url: ./doc.pdf}) print(result[title], len(result[raw])) # 文档标题、分块数 print(result[raw][0][content]) # 第一个分块内容返回的raw里每个分块有三样content文本、token数量、metadata来源与分块编号。支持 PDF/Word/PPT/TXT/HTMLWord 表格、Excel 和 CSV 也会转成 Markdown 表格并入分块整篇 token 低于阈值时则整篇返回、不再切分。20分钟直接和文档对话不想写分块代码直接用官方示例examples/assistant_rag.py 用files[./doc.pdf]把文档挂进Assistant运行脚本后自动打开 Gradio 页面拖文件、直接提问。进阶参数一个parser_page_size控制分块大小默认500 token小块利于精确问答大块保留更多上下文。多文档场景见下节。 新手避坑3个文档解析常见问题现象解析结果空白或乱码。原因那份PDF是扫描图片版这条链路不做OCR图片提取在源码里会直接报错。解决换文本版PDF实在没有就先OCR再喂入。现象Word文档解析后部分内容消失。原因Word解析器只认正文段落和表格文本框、侧栏文字不会提取。解决先导出成PDF再解析。现象同一文档二次解析依旧慢。原因缓存键是URL哈希分块大小任一改了就重新解析。解决保持url与parser_page_size一致第二次直接命中缓存。 案例实践文档解析在金融与制造里怎么用两个场景均为示例估算量级可按你的工作对照金融·年报数据提取300页年报原先人工翻表取20多个数据点要2-3小时现在约15分钟完成解析分块再逐个追问前三个业务板块毛利率变化每次回答都挂在具体分块上。制造·设备手册问答120页设备手册原先每次查保养步骤要翻40分钟分块后每块都带[page: N]页码标记问主轴承更换周期能直接指回对应页翻到那一页核对即可。 原理速览Qwen-Agent文档解析链路怎么跑一句话先抽取、再分块、顺手缓存。三个细节抽取按页进行用字号判断行与行之间是否属于同一段落各类表格Word/Excel/CSV统一转成 Markdown 表格分块先算总量低于max_ref_token默认20000整篇返回否则按parser_page_size预算切单个段落仍超限时才退化为按句拆分块生成后写入本地工作区目录第二次直接从磁盘读。 进阶探索多文档并行问答怎么跑文档超过3份时别逐个循环。examples/parallel_doc_qa.py 里有现成的ParallelDocQA并行解析分块多份文档再检索作答运行后同样弹出 Gradio 页面可一次拖入多个文件。想扩展的话方向就是换模型配置和检索策略即可搭出团队级的文档问答工具。 冷知识缓存是怎么生效的缓存键是 URL 的 SHA-256 哈希拼接分块大小字符串同一文档、同一参数第二次call毫秒级从磁盘返回。实用提示写批处理脚本时别给同一文件反复换路径比如每次追加时间戳否则缓存全部失效。✅ 上手任务清单现在就能做的3件事挑一份这周一直拖着的文档跑一次DocParser看分块数和第一个分块10分钟。把parser_page_size设成200再解析同一份对比分块粒度差异5分钟。打开 examples/assistant_rag.py换上自己的 API Key把读文档变成和文档对话20分钟。【免费下载链接】Qwen-AgentAgent framework and applications built upon Qwen3.0, featuring Function Calling, MCP, Code Interpreter, RAG, Chrome extension, etc.项目地址: https://gitcode.com/GitHub_Trending/qw/Qwen-Agent创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表