谷歌发布的 Gemma-3 模型,拥有 270 百万种变体。该模型专为在移动设备和边缘设备上进行函数调用而优化设计。
FunctionGemma是Gemma 3 270M模型的轻量级版本。该模型经过 … Read More
Socrates
FunctionGemma是Gemma 3 270M模型的轻量级版本。该模型经过优化,能够将自然语言转化为结构化的函数和API调用,从而让AI代理不仅能“说话”,还能“行动”。
几个月前推出的Gemma 3 270M已经升级为FunctionGemma,因为它具备了处理函数调用的能力,以满足开发者的需求。
在本地运行时,该模型可以作为独立的智能体来处理一些私密的、离线的任务,或者作为“智能交通控制器”,将复杂的请求转发给更大的远程模型来处理。
在设备上运行时,该模型可以自动化复杂的多步骤流程,比如设置提醒或切换系统设置等。为了实现这一点,模型必须足够轻便,以便可以在本地运行,同时还需要具备足够的可靠性。
FunctionGemma并非用于零样本训练,而是被设计成一种可以快速定制、适用于设备的智能体。它可以将自然语言转化为可执行的API操作,从而实现生产级性能。
在我们的“Mobile Actions”评估中,通过微调后,模型的可靠性得到了提升,准确率从58%提高到了85%。
该模型能够在资源有限的设备如手机和NVIDIA Jetson Nano上高效运行。它利用Gemma的256k词汇量来高效地解析JSON和多语言输入。
FunctionGemma支持所谓的“统一动作和聊天”功能,它可以生成结构化的代码/函数调用来执行工具,然后再次使用自然语言来解释结果。
谷歌还指出,FunctionGemma拥有广泛的生态系统支持,可以与Hugging Face Transformers、Unsloth、Keras或NVIDIA NeMo等框架一起使用,也可以通过LiteRT-LM、vLLM、MLX、Llama.cpp、Ollama、Vertex AI或LM Studio等进行部署。
谷歌明确指出了使用FunctionGemma的条件,包括拥有明确的API接口、愿意对其进行微调、优先考虑本地化部署,或者构建能够结合本地设备和远程任务的复杂系统。
为了展示该模型的实际应用效果,谷歌发布了多个演示示例,包括Mobile Actions、TinyGarden和Physics Playground。这些演示都可以通过Play Store上的Google AI Edge Gallery应用程序访问。
Mobile Actions可以解析诸如“为明天午餐创建一个日历事件”、“将John添加到我的联系人列表中”或“打开手电筒”之类的自然语言命令,并将其映射到相应的操作系统级别的工具调用。
TinyGarden是一个由语音控制的游戏,玩家可以使用自然语言命令来操控游戏中的模拟行为。该模型会将这些命令分解为具体的函数调用,例如plantCrop和waterCrop,并指定具体的坐标目标。
Physics Playground则是一个互动式的物理谜题演示,用户可以使用自然语言指令来控制游戏中的模拟行为。这个演示使用了Transformer.js来展示客户端JavaScript的集成方式。
FunctionGemma可以在Hugging Face或Kaggle上找到。谷歌还提供了Colab笔记本以及mobile-actions数据集,以帮助开发者更好地使用该模型。
相关文章
“放松与它在视觉中的作用”:这篇1977年完成的博士论文为现代人工智能研究的发展奠定了基础
当人们提到杰弗里·辛顿时,他们通常会想到反向传播算法、玻尔兹曼机、深度信念网络,以及那些彻底改变了人工智能发展的深度学习技术。 然而,很少有人会追溯到他科研生涯的起点。 1977年,在那篇著名的关于反向传播的论文发表之前的近十年时间里,辛顿在爱丁堡大学完成了他的博士论文,题为《松弛机制在视觉认知中的作用》。乍一看,这篇论文似乎只是探讨计算机视觉与松弛算法之间的关系。当我开始阅读它时,我也正是抱着这样的预期。 然而,在仔细研读之后,我意识到这篇论文涉及的远不止视觉算法。许多后来成为辛顿研究核心的理念,在当时就已经初具雏形。虽然当时的术语有所不同,数学表达也更为简单,神经网络也尚未成为他研究的重点
阅读全文
那些被隐藏起来的基础设施建设成本:为什么你的团队不应该再继续承担这些责任了
大多数工程团队最初并不是为了管理基础设施而开始工作的。他们通常是带着某个产品创意 … Read More
阅读全文