有传言称谷歌正在研发名为Frozen v2的芯片 将AI模型部分蚀刻到芯片上提高吞吐量
2026-7-22 01:0:49 Author: www.landian.news(查看原文) 阅读量:4 收藏

#人工智能 谷歌也尝试将模型权重直接蚀刻到硅晶片中,谷歌正在研发的 Frozen v2 芯片 token 吞吐量是谷歌现有 TPU 单元的 6~10 倍。模型权重直接蚀刻到硅晶片中可以减少芯片执行的步骤数和每次查询的数据量,但代价是芯片完成蚀刻后无法再升级模型。谷歌的做法是将模型部分决策蚀刻到晶体管中固定,Gemini 发布新版本后也能继续用。查看全文:https://ourl.co/114010

知名网站 The Information 发布报告称,谷歌正在研发名为 Frozen v2 的人工智能数据中心芯片,谷歌尝试将 Gemini 模型的部分架构直接蚀刻到硅晶片上,这样模型在计算时可以直接按照蚀刻部分运行而不需要进行太多计算,带来的直接优势就是吞吐量可以大幅度提升。

知情人士称,谷歌新研发的这款芯片在单位功耗下可处理的 token 数量是谷歌最新 TPU 张量计算单元的 6~10 倍,如果顺利的话谷歌计划在 2028 年将这些芯片量产并投入使用。至于为什么要研发这种芯片,根本原因还是谷歌为了应对人工智能计算资源的严重短缺,此前谷歌已经与 SpaceX 达成合作租用算力

而算力紧缺问题也在影响谷歌云计算平台的发展,即谷歌自己算力都非常紧缺因此不得不拒绝部分外部客户的订单,也就是谷歌尽可能将现有算力全部用在自家产品和服务上,但即便如此谷歌还是面临算力紧缺问题,在无法获得更多算力的情况下,投资芯片研发是个应对方案。

有传言称谷歌正在研发名为Frozen v2的芯片 将AI模型部分蚀刻到芯片上提高吞吐量

常规 GPU 或谷歌 TPU 计算单元在处理模型时都需要将模型权重加载到内存中,然后计算单元再从内存读取模型权重数据进行推理,这意味着硬件在与每个模型交互时都需要进行耗时的运行时决策。而将模型权重直接蚀刻到硅晶片上后,实际处理数据时只需要按照硅晶片中蚀刻的电路进行流转即可,这样可以显著加快推理速度。

此前已经有公司尝试将模型直接蚀刻到硅晶片中以换取极高的吞吐量,但这种方式也存在显著弊端:蚀刻到芯片中的电路是无法更改的,这意味着芯片制造好后就不能再更新模型,而当前模型更新速度如此快,因此将模型蚀刻到硅晶片的做法会显著缩短芯片实际使用寿命 (会被提前淘汰)。

最初谷歌确实准备将整个模型权重都蚀刻到芯片中,这就是 Frozen v1 芯片方案,但因为芯片寿命问题这种方案被谷歌搁置。而 Frozen v2 方案则采用冻结架构但允许更新权重的设计,这意味着芯片可以在多个不同版本的 Gemini 模型中使用。

在 Frozen v2 中谷歌将 Gemini 模型的部分决策蚀刻到晶体管中固定,这样可以减少芯片执行的步骤数和每次查询的数据量,最终芯片同样能显著提高模型的吞吐量,消息人士称这种架构可以显著降低模型推理时间从而支持更多新的应用场景。

另外谷歌并不打算直接以 TPU 的规模生产 Frozen v2 芯片,而是将芯片作为实验品,等到模型设计稳定后为后续研发更专业的芯片做准备。这款芯片也将与谷歌现有的 TPU 产品线并行发展,而非取而代之。

即将结束终于补货!99元/年境外CN2服务器又可以购买,限量销售,售完即止。另有3年超低价国内VPS服务器。


文章来源: https://www.landian.news/archives/114010.html
如有侵权请联系:admin#unsafe.sh