处理流程

六步把原始来源整理成可用结构

以下为静态流程说明。每一步都写明输入、系统处理、输出和可能的质量警告,处理在不确定时倾向保留证据而不是强行猜测。

  1. 来源识别

    确认文件类型、编码和页数或结构,决定后续处理方式。

    输入
    原始来源文件,例如 PDF、DOCX、Markdown、TXT 或网页正文。
    系统处理
    • 识别文件类型
    • 检测文本编码
    • 读取页数或整体结构
    输出
    带类型、编码和结构信息的来源描述记录。
    可能的质量警告
    文件损坏、编码不明或页面结构异常时,标记来源风险并停止猜测。
  2. 内容提取

    从来源中提取正文、标题、表格和列表等原始内容单元。

    输入
    第一步确认过类型和结构的来源文件。
    系统处理
    • 提取正文文本
    • 提取候选标题
    • 提取表格与列表区域
    输出
    按出现顺序排列的原始内容单元序列。
    可能的质量警告
    对无法可靠提取的区域记录位置和原因,不伪造缺失内容。
  3. 结构恢复

    恢复标题层级、段落关系和表格边界,重建文档骨架。

    输入
    第二步输出的原始内容单元序列。
    系统处理
    • 推断标题层级
    • 合并被拆散的段落
    • 确定表格边界
    输出
    带层级关系的章节树与段落、表格结构。
    可能的质量警告
    层级证据不足时保留原始顺序并给出结构置信提示,不强行归级。
  4. 噪声清理

    清理页眉页脚、重复段落和异常空白,保留有效内容。

    输入
    第三步输出的结构化内容。
    系统处理
    • 识别并移除页眉页脚
    • 折叠重复段落
    • 规整异常空白
    输出
    去除噪声后的干净结构化内容。
    可能的质量警告
    疑似正文的重复内容不直接删除,标记后交由人工确认。
  5. 元数据补全

    补齐来源名、页码、章节路径和处理时间等溯源信息。

    输入
    第四步输出的干净结构化内容。
    系统处理
    • 关联来源文件名
    • 标注页码范围
    • 生成章节路径
    • 记录处理时间
    输出
    每个内容块都带来源线索的可溯源内容集。
    可能的质量警告
    页码或章节无法确定时记录为未知,不填入估计值。
  6. 输出与检查

    生成 Markdown、JSON 和 chunks manifest,并汇总质量警告。

    输入
    第五步输出的可溯源内容集。
    系统处理
    • 渲染 Markdown 文稿
    • 序列化结构化 JSON
    • 生成 chunks manifest
    • 汇总质量警告
    输出
    document.md、document.json、chunks.json 与质量警告清单。
    可能的质量警告
    存在未解决警告时在输出中显式保留,不默认视为通过。