微软为在AKS上运行的AI代理开发的三层大语言模型路由架构
微软发布了用于在Azure Kubernetes Service中路由代理流量的参考架构。该架构将相关问题归纳为三个关键方面:哪种模型会被用来接听电话、电话是如何被管理的,以及由哪块GPU来处理这些通话请求。 作者:Claudio Masolo

微软发布了用于在Azure Kubernetes Service中路由代理流量的参考架构。该架构将相关问题归纳为三个关键方面:哪种模型会被用来接听电话、电话是如何被管理的,以及由哪块GPU来处理这些通话请求。
作者:Claudio Masolo相关文章
会话追踪与成本控制机制有助于诊断人工智能代理出现的故障问题。
会话追踪与成本控制正逐渐成为用于诊断人工智能代理故障的关键技术手段;这些技术能够帮助团队发现工具调用循环以及过度消耗资源的情况,同时还能保留足够的执行上下文信息,以便在问题发生之后进行调试。 作者:马克·西尔维斯特
阅读全文
LinkedIn是如何通过多教师蒸馏技术让人工智能辅助求职的功能运行速度提高8倍的?
LinkedIn公布了其基于人工智能技术的求职系统背后所使用的训练基础设施的详细信息,其中描述了一种“多教师蒸馏”机制:这种机制能够将大型教师模型中的知识压缩成一个参数数量仅为0.6B的排名模型。 作者:Claudio Masolo
阅读全文
HashiCorp Packer 1.16版本为机器镜像提供了原生的SLSA来源信息生成与验证功能
HashiCorp发布了Packer v1.16.0版本,该版本为该工具生成的每一张机器镜像提供了生成、签名及验证SLSA来源证明的功能。这一更新为各团队提供了关于这些机器镜像的生成过程的安全、防篡改的记录,而且无需使用任何额外的供应链管理工具即可实现这些功能。 作者:Claudio Masolo
阅读全文
Netflix正在推动开源版本的Flink自动扩展功能的应用,以便能够支持超过30,000个流处理任务。
Netflix正在将旗下分布在多个AWS区域的3万多项流处理任务迁移至开源工具Apache Flink Autoscaler。这种基于操作员级别的调度机制有效弥补了Netflix原有集群级自动调度系统在处理复杂、具有状态依赖性的数据处理流程时所存在的局限性。据Netflix称,采用这一新方案后,某个团队的年度Flink计算成本降低了58%,每年因此节省约110万美元。 作者:Leela Kumili
阅读全文