Datawhale AI秋训营 学习笔记
大模型的性能存在着“规模定律”(Scaling Law),随着训练数据量的增长,模型的性能也会提升。但我觉得现在对大模型来说,一味专注于提升参数量,扩大训练数据的规模并不是最有效的方法,有时候去寻找一个好的框架和思路是很重要的。就像人一样,每天不停地去摄取知识或是陷入所谓“题海战术”一定是会有提升的,还如何找到并形成自己独到的学习方法有时候是更重要的。教程中提到的ReAct 框架就是这样一个新的思路。ReAct框架模拟人类解决问题的过程,通过“思考-行动-观察”的循环,让模型在推理过程中主动调用外部工具(如搜索、计算等),获取实时信息,从而减少模型依赖训练数据产生的幻觉或错误。就像我们解题,往往也是一边做一遍检验,否则很可能洋洋洒洒写完所有解题步骤之后,却发现中间有错误,导致全部作废。 教程中的Text-to-Pandas方案还让我想到Text-to-SQL,其也被称为NL2SQL,是将自然语言查询转换为可在关系数据库上执行的SQL查询的技术,早在生成式人工智能LLM技术出现之前,已有很多专注于Text-to-SQL任务的机器学习项目。其实我们发现,这一切都是一个共同的功能导向,就是“翻译”。我们人类最熟悉的任务表达和实现方式永远是自然语言,而所有需要专业语言(这个语言是广义的语言,包括特定且格式化的操作步骤与流程)来操作的,无论是软件开发所需的编程语言,数据操作所需的SQL,甚至是传统作图软件所需的PS操作、复杂的调参等等,大模型正在成为一个“翻译”,一个桥梁,桥的两端是专业语言和自然语言,这些任务在上面畅通无阻。也就是所谓的减低门槛,众生平等。那未来,可能自然语言的表达能力就会成为决定你任务完成能力的因素,就像你软件开发的能力取决你编程的水平。教程中有这么一句话:“模型生成代码的质量,高度依赖于我们提供给它的“说明书”。”我深以为然,既然我们需要大模型充当这个翻译,那么怎么让这个翻译足够的强大,就是我们需要考虑的了。教程中也提到了两个方法,一个是把一些任务完成所需的背景知识转化为结构化的信息,让模型更容易理解,一个是给少量示例,就我的实践结果来看,第二种方法是更为有效的。模仿有时候是学习的一个“捷径”,不管对人还是大模型。教程中还在RAG 流程部分提到了优化文本切块策略。提出可以尝试不同的 chunk_size 和 chunk_overlap 组合,找到最适合这些法规文档的设置。对于格式工整、章节分明的法规文档,按章节或条款进行语义切块,可能比固定大小的切块效果更好。我觉得很有道理,对文本处理的时候,如何根据文本的格式、类型采取适合的处理方式,是一个容易忽视但很重要的问题,因为我正在做一个政策文本量化分析的项目,在其中体会到政策文本有其格式的特殊性,需要一些单独的方法来保证其语义的完整性和准确性。教程中提到的“引入知识图谱 GraphRAG”这一优化方法也很有意思,传统的向量搜索是碎片化的,独立的,依赖文本相似度匹配,很容易遗漏隐含关联。知识图谱就能确保信息的结构化存储,避免传统向量搜索中因文本片段孤立导致的矛盾或不完整。而且面对海量文档,GraphRAG通过图索引优先检索相关实体和关系,减少无关数据检索,降低计算成本。总之,这些新的思路和方法都值得我们认真思考和探索,这样大模型的能力和潜力才能更好被挖掘。
更多推荐


所有评论(0)