Hendersen

动态 · 2024-01-30

Hendersen 推出实验性 AI 助手

Hendersen 推出实验性 AI 助手

我们很高兴地宣布 Hendersen Taxand 推出实验性 AI 助手,欢迎访问 ai.hendersen.com 试用。

这是什么?

2023 年是 AI 之年。随着各类大语言模型(LLM)、图像/视频生成模型以及相关应用的涌现,各行各业都在亲历 AI 对生活与工作方式的冲击。

尽管不少人仍对 AI 在处理传统由人完成的专业复杂任务时的有效性持保留态度,但变革已然在路上……

因此,我们的小应用旨在专业领域开展 AI 应用实验。它以我们在专业工作中积累的知识与经验为基础,建立 AI 知识库,并提供便捷的人机交互界面,让用户更轻松地调用这些知识与经验。

核心问题

在专业领域使用 AI 时,最突出的问题是 "AI 幻觉"(AI hallucination)。所谓 AI 幻觉,是指 AI 模型"看到"了并不存在或人类无法感知的模式或对象,从而输出看似合理但实际不准确甚至无意义的内容。用通俗的话说——AI 在"说谎",而且有时候还挺频繁。

这种 AI 幻觉在大语言模型(如 GPT)中较为常见,可能由训练数据中的偏见、意料之外的输入、或模型本身的错误等多种因素引发。幻觉会导致模型给出错误的预测,有时甚至生成仇恨言论、虚假信息等有害内容。

在专业领域,这绝对不可接受

技术方案

虽然借助深度学习技术、由模型在无任何人工先验干预的情况下自主学习,所训练出的 AI 模型在自然语言处理(NLP)、图像识别等多个场景中已展现出巨大潜力,但这类模型在面对训练数据之外的样本时,常常由于泛化能力不足而出现错误。在此类场景下,在模型训练阶段通过知识图谱或本体引入相关外部知识,往往能取得显著改善。

与此同时,在应用层,一种可行的方案是让 AI 在回答具体问题时,以外部知识库作为上下文。在这一思路下,向量嵌入(vector embedding)是 NLP 中用于将词或短语映射为数值向量的技术。该过程将词表示为高维向量,每个维度对应一个特定特征。

向量嵌入的主要目标,是捕捉词在语料库中的语义与上下文。通过这一转换,原本只能处理数值输入的神经网络、决策树等机器学习算法,便能"理解"文本背后的含义。

将自有知识转化为向量数据库后,AI 便拥有了在面对具体问题时检索最相关上下文的手段。不同于基于关键词匹配的传统检索,向量检索是基于语义进行的。

我们的实验显示:在采用向量数据库存储、并结合恰当的上下文(即知识库)后,AI 幻觉能够得到显著降低。

简而言之,我们正在做的事情是:构建知识库,让 AI 能够理解它,再让 AI 真正发挥作用

下一步

提升 AI 回答质量的方法不止一种。强化学习、基于 LoRA 的模型微调、提示工程(prompt engineering)等,都在我们接下来的实验计划中,将逐步上线。

AI Agent(智能体)是另一个值得重点关注的方向。其核心是构建一个能以自然、高效方式与人交互、并代表用户执行定义明确的任务的系统。配合细致的任务规划,AI 可以在不远的将来承担远比今天更复杂的专业任务。

相关洞察

返回动态