离语
首页

第266章 先睡了

1 所示,以便进

本小章还未完,请点击下一页继续阅读后面精彩内容!

为了使后续知识库生成更加准确与完善,对文献具体内容进行筛选。例如部分文献中并未提到

所用数据,而是指出所用数据库链接,如图 3.3 所示,在对该篇文献进行解析后,数据部分就是欠

缺的,最终构建的知识库就不完整,在调用大模型回答相关问题时,极大概率产生幻觉。因此为了

构建更为准确的专业模型,对爬取下来的 507 篇文献进行筛选,选择包括流程图(system

boundaries)、各单元过程或生产环节的投入( input),产出( output),数据( ),以及数据的时间、地点、获取方法、技术细节的文献作为最后应用的数据。核对内容

后的文献数据集共 98 篇英文文献。

数据预处理

Unstructured 库是一个强大的工具,专为处理非结构化数据设计,具体流程如图 3.7 所示,

如从文本文档、PDF 文件或网页中提取数据。它支持多种数据提取方法,包括正则表达式匹配、自

然语言处理(NLP)技术等。

数据预处理步骤如下:

步骤一:数据清洗

去除杂质:从文本中去除无关的字符,如特殊符号、空白行等。

格式统一:将所有文本统一为相同的编码格式,通常为 UTF-8,以避免编码错误。

语言标准化:统一不同术语的使用,例如将所有"photovoltaic"统一替换为"PV",确保术语的

一致性。

步骤二:信息提取

关键信息标识:标识文献中的关键信息,如研究方法、主要结论、实验条件等。

数据分类:根据信息类型将数据分类,如作者、出版年份、研究结果等。

步骤三:结构化转换

结构化处理:将信息精细化拆解与清洗,将各种元素进行转换,形成结构化数据形式,拆分成

非结构化文本数据通常非常稀疏,即包含大量的词汇但每个文档只使用其中的一小部分。而结

构化数据则可以通过合并相似信息来降低数据的稀疏性,这有助于生成更加紧凑和有效的嵌入向

量。

结构化数据可以实现更高效的特征提

本章未完,请点击下一页继续阅读! 第3页 / 共4页

相关小说

全球高武,我一个F级异能杀疯了 都市 /
全球高武,我一个F级异能杀疯了
莫沧桑
七八小说免费提供作者(莫沧桑)的经典小说:《全球高武,我一个F级异能杀疯了》最新...
343039字07-21
少爷不做总裁学做起了饭2 都市 /
少爷不做总裁学做起了饭2
听就很累
七八小说免费提供作者(听就很累)的经典小说:《少爷不做总裁学做起了饭2》最新章节...
549418字07-20
快穿之柳暗花明又一村 都市 /
快穿之柳暗花明又一村
吾的网兜里没有渔
七八小说免费提供作者(吾的网兜里没有渔)的经典小说:《快穿之柳暗花明又一村》最...
1627559字07-06
奥特杂兵?在外叫我宇宙警察! 都市 /
奥特杂兵?在外叫我宇宙警察!
菌不浪
七八小说免费提供作者(菌不浪)的经典小说:《奥特杂兵?在外叫我宇宙警察!》最新...
1062724字07-21
灵犀传 都市 /
灵犀传
红衣帝女
七八小说免费提供作者(红衣帝女)的经典小说:《灵犀传》最新章节全文阅读服务,本站...
866448字07-19
从县长秘书崛起 都市 /
从县长秘书崛起
林书豪
七八小说免费提供作者(林书豪)的经典小说:《从县长秘书崛起》最新章节全文阅读服...
530901字07-19