数据工程与管道

langextract

google/langextract

利用大模型从非结构化文本抽取字段和关系,并将结果定位回原文,适合需要复核证据的文档结构化流程。

★ 38.6K星级
⑂ 2.7KFork 数
135未解决的问题
Python语言
Apache-2.0许可证
Q90编辑评分

概览

LangExtract 适合解决“从大量文本中提取业务事实,同时知道这些事实出自哪里”的问题。开发者通过抽取说明与示例定义任务,模型输出实体、属性和关系,工具再把抽取文字映射到原文位置。相比只要求聊天模型返回 JSON,它更强调来源对齐与可视化复核。 可把它放在 OCR 或文本解析之后、数据库写入之前:先把杂乱文档变成文本,再抽取所需信息,最后执行规则校验。它不会自动替团队决定业务字段、合并规则和错误容忍度;这些决定直接影响落地质量。

主要功能

  • 指令与少样本驱动的抽取
  • 结果映射到原文位置
  • 长文档分块处理
  • JSONL 输出与可视化复核
  • 云端与本地模型示例

要求、安装和快速入门

执行 pip install langextract,选择官方文档支持的模型提供方并配置凭据;使用本地 Ollama 时按对应示例设置服务。先运行 README 的短文本抽取和可视化示例,再处理长文档。

用法

以设备巡检记录为例,先定义设备、故障现象和处理动作三个类别,手工标注数个示例。对新记录抽取后,把每条结果定位回原文,检查否定句、日期和跨段关联。把无法对齐、字段缺失和重复实体分开统计,再决定是否增加示例或调整切块。

工作原理
任务说明和标注示例约束模型抽取行为,文本可按长文档策略分段处理。抽取结果包含类别、原文片段和属性,可保存为 JSONL 并生成可视化。无法在输入中定位的抽取可能出现空的 char_interval,需要过滤或人工复核,不能把结构完整误认为事实正确。

适用人群与环境
数据工程师、文档处理团队和需要可审核结构化输出的开发者。 Python、可用的模型服务、文本输入与高质量示例。

具体使用场景
• 报告转结构化记录:为检索和统计提供字段。
• 文本实体与关系抽取:保留可追溯证据。
• 数据标注辅助:以可视化结果加快人工审核。

局限与选型边界
来源定位能帮助复核,但不保证理解正确或抽取完整;长文档分块可能丢失跨段关系。云端模型会接收输入文本,成本和吞吐受所选服务影响。扫描件需要先 OCR,图表也需单独解析。

关联项目与选型分析
JaidedAI/EasyOCR:互补:先识别扫描图片的文字,再抽取结构字段;OCR 错误会向下游传递。

explosion/spaCy:区别:spaCy 适合固定标签的 NLP 流水线,LangExtract 更偏向以示例定义任务的大模型抽取。

资料说明
基于上游资料的编辑分析,未进行安装实测或性能基准;建议场景和项目搭配属于选型分析。

模型兼容性与使用场景

README 提供 Gemini、其他提供方及本地 Ollama 路径;抽取结构约束支持取决于提供方。

许可证与风险说明

仓库当前页面标注 Apache-2.0;完整条件请查看仓库 LICENSE,模型权重与数据集另查各自说明。

Editorial source review 2026-09-09T05:00:00.950Z. README and live repository page verified; current stars/forks from GitHub HTML. Last-push metadata retained from 2026-09-05 discovery snapshot. No runtime benchmark. Integration proposals are editorial analysis.

发布与维护

资料核对:2026-09-09。统计取自本次仓库页面;功能依据 README 与官方资料整理。版本变化请查看来源区的 Releases。 基于上游资料的编辑分析,未进行安装实测或性能基准;建议场景和项目搭配属于选型分析。

aistore

NVIDIA/aistore

★ 1.9KGo

spaCy

explosion/spaCy

★ 33.9KPython

OpenBB

OpenBB-finance/OpenBB

★ 72.7KPython

airflow

apache/airflow

★ 46.7KPython