创造了现代人工智能的那篇论文:Transformer背后的故事
每次你与现代人工智能模型进行交互时,其实都在使用一种源于2017年那篇名为《注意力才是关键》的研究论文所提出的架构。 我们在freeCodeCamp.org的YouTube频道上发布的最新视频,详细讲述了八位谷歌研究人员是如何着手改进Google Translate的,最终又如何彻底改变了整个科技领域的格局的。 在这一突破性成果出现之前,人工智能领域主要依赖循环神经网络。这类模型会按顺序逐词处理文本,但这带来了两个巨大的障碍: “上下文丢失”:当处理长句或长段落时,模型会忘记开头那些重要的信息。 “训练速度缓慢”:由于需要顺序处理数据,各个步骤无法并行执行,因此即使使用庞大的GPU集群,模型的
每次你与现代人工智能模型进行交互时,其实都在使用一种源于2017年那篇名为《注意力才是关键》的研究论文所提出的架构。
我们在freeCodeCamp.org的YouTube频道上发布的最新视频,详细讲述了八位谷歌研究人员是如何着手改进Google Translate的,最终又如何彻底改变了整个科技领域的格局的。
在这一突破性成果出现之前,人工智能领域主要依赖循环神经网络。这类模型会按顺序逐词处理文本,但这带来了两个巨大的障碍:
“上下文丢失”:当处理长句或长段落时,模型会忘记开头那些重要的信息。
“训练速度缓慢”:由于需要顺序处理数据,各个步骤无法并行执行,因此即使使用庞大的GPU集群,模型的训练速度也依然很慢。
研究人员提出了一个简单的问题:如果模型能够同时理解整段文本,会怎么样呢?
通过将“注意力机制”从原有的处理流程中分离出来,并完全摒弃顺序处理的模式,他们创造了Transformer这一全新的架构。这种新架构不仅超越了现有的翻译技术标准,而且在训练所需的时间上也大幅减少。
并行处理能力的实现使得模型能够有效地处理规模庞大的数据集。正是这一突破为当今的生成式人工智能技术奠定了基础,也让这篇论文的作者们后来创立了Cohere、OpenAI和Character.ai等知名的人工智能企业。
想要深入了解这篇论文是如何改变计算机技术的,请访问freeCodeCamp.org的YouTube频道。
相关文章
什么是机器学习模型以及如何构建这样的模型
机器学习听起来可能比实际情况要复杂得多。你会听到诸如“模型”“训练”“特征”“数据集”“预测”和“算法”这样的术语,这可能会让你觉得,在编写第一个机器学习程序之前,自己必须拥有数学博士学位才行。 但实际上,机器学习的本质就是让计算机从示例中学习规律,然后利用这些规律来对新的案例进行预测。如果你曾经通过观察大量的猫来学会识别它们,那么你就已经理解了这一概念的基本含义。 在这个教程中,我们将使用Python构建一个真正的机器学习模型。我们会从一个小型数据集开始,训练出一个模型,让这个模型能够根据学生学习的时长来预测他们是否能够通过考试,然后利用这个训练好的模型来对新的学生进行预测。 先决条件 学习
阅读全文
从Mixtral到Kimi K3:专家混合模型是如何发展的
在本文中,我们将探讨混合专家模型是如何从最初仅有少数几个“专家”组件,发展到每层包含近900个“专家”组件的,以及那些使得这种稀疏架构仍能保持可训练性且成本可控的压缩机制与稳定性机制。 开放权重的混合专家模型发展速度惊人:Mixtral的总参数数量约为470亿,DeepSeek-V3达到了6710亿,而Kimi K3的参数数量更是突破了万亿大关。令人惊讶的是,并非这些模型的规模本身,而是每个模型实际上只使用极少量参数来处理每一个输入数据。 Kimi K3拥有2.8万亿个参数,但其中仅有约1040亿个参数被用于处理任何一个输入数据。在几乎每一层中,都有一个小型“路由器”从896个专门的前馈网络中
阅读全文
演讲主题:克劳德能够自我修复吗?利用大型语言模型进行事件响应
人类可靠性工程师亚历克斯·帕尔库埃分享了关于如何利用大语言模型来应对现实世界中的突发事件的相关经验。他解释了为什么人工智能在分析日志和追踪数据时能够发挥“超人般”的作用,为何在根本原因分析过程中,它仍然难以区分因果关系与相关性,以及工程领域的领导者该如何将人工智能融入到应急响应的工作流程中,同时避免削弱人类的专业能力。 作者:亚历克斯·帕尔库埃
阅读全文