工作周报(06-08-2026 ~ 06-12-2026)
一、本周定位
两条主线:把美国专利 PDF→MD 引擎补上 OCR 识别。能将文献批量建成知识库。
二、本周进展
1. 专利 PDF→MD 转换
上周遗留的版面问题本周修完:
- 版面修复:章节标题误判、首行缩进、claims 续页错分、栏内标号误删、跨栏跨页段落断裂,逐个修,都做到字符级零丢失。
- 新增可视化调试工具 :左边 PDF 叠识别框,右边渲染 md,并排比对。
- 扫描件和坏字形页:现有的专利 PDF(Google pattern, 智慧芽)均存在文本层缺失问题。新增 Tesseract OCR 夹层把图片页补出文本层。
2. 知识库搭建
- 知识图谱建设:Obsidian 中 ISO 危害轴 + 多来源统一, 测试用的 9 篇 paper、22 篇专利已上主表挂 MOC。
- 批量入库路线选型:借助 kimi code cli,外部多开
kimi -p可实现对文档的批量处理。 - Token 是瓶颈:每篇资料要 AI 写一份结构化摘要,目的是后面做系统性分析时,agent 能快速准确地抓到相关内容。但实测下来,6 篇专利的摘要就把 Kimi 5 小时会员额度耗光了,token 成本扛不住全量。下周要找省 token 的路子:NotebookLM 协助、优化工作流,或者绕开转码直接抓智慧芽网页正文,这几条下周逐一验证。
3. 其他
- 语音转文字:抗幻觉(CTC 交叉校验 + VAD)、prompt 泄漏加固。
- 钽屏蔽三份 DR 整合为单稿 v1.0。
三、下周计划
| 优先级 | 任务 | 产出 |
|---|---|---|
| P0 | 智慧芽 MR 危害下全部专利:下载 + 转码 + 知识库入库 | 该危害专利全量入库 |
| P0 | 探索摘要省 token 方案(NotebookLM / 工作流优化 / 智慧芽网页直抓) | 选定可全量跑的方案 |
| P1 | 飞书可分享的知识库网页 | 同事只读访问链接 |