汽车 car
您现在的位置:首页 > 汽车 > 特斯拉发布D1 AI芯片:500亿晶体管、400W热设计功耗

新闻

皇派门窗官宣成为亚奥理事会官方门窗合作伙伴,传递出哪些方向? 皇派门窗官宣成为亚奥理事会官方门窗合作伙伴,传...

2024年4月20日,皇派门窗与亚洲奥林匹克理事会(以下简称亚奥理事会)举行签约仪式,并正式对外官宣成为...

  • 皇派门窗品牌战略盛大发布:解密高端隔音门窗如何...

    4月16日,皇派门窗416品牌日如约而至。自2007年品牌创立,随后将“高端隔音门窗”作为品牌定位,皇派门窗从噪音污染的现实困扰切入,积极回应家居品质升级释放的“安静”需求,通过持续的产品迭代和品牌升级,在隔音...

财经

金融支持文化产业复苏主攻六方面 金融支持文化产业复苏主攻六方面

21日,北京市文化改革和发展领导小组办公室印发《关于加强金融支持文化产业健康发展的若干措施》,这是...

创新

发挥技术优势 主动参与抗疫 发挥技术优势 主动参与抗疫

传递信息助力抗疫,支持企业线上运营,开放直播与行业融合……快手科技第一时间投身疫情防控阻击战,向武...

  • 智能无人开采:能源供应的硬核力量

    “知道它厉害,没想到这么厉害!”4月9日,谈及智能化无人采矿,国家能源集团宁夏煤业枣泉煤矿党委书记、矿长翟文,对着记者连说几个“没想到”。 大年初三,枣泉煤矿收假复工的日子,不料新冠疫情将一部分回老家过...

特斯拉发布D1 AI芯片:500亿晶体管、400W热设计功耗

发布时间:2021/08/23 汽车 浏览:163

近日的特斯拉AI日活动上,特斯拉公布了最新的AI训练芯片“D1”,规模庞大,令人称奇。

该芯片采用台积电7nm工艺制造,核心面积达645平方毫米,仅次于NVIDIAAmpere架构的超级计算核心A100(826平方毫米)、AMDCDNA2架构的下代计算核心Arcturus(750平方毫米左右),集成了多达500亿个晶体管,相当于IntelPonteVecchio计算芯片的一半。

其内部走线,长度超过11英里,也就是大约18公里。

它集成了四个64位超标量CPU核心,拥有多达354个训练节点,特别用于8×8乘法,支持FP32、BFP64、CFP8、INT16、INT8等各种数据指令格式,都是AI训练相关的。

特斯拉称,D1芯片的FP32单精度浮点计算性能达22.6TFlops(每秒22.6万亿次),BF16/CFP8计算性能则可达362TFlops(每秒362万亿次)。

为了支撑AI训练的扩展性,它的互连带宽非常惊人,最高可达10TB/s,由多达576个通道组成,每个通道的带宽都有112Gbps。

而实现这一切,热设计功耗仅为400W。

特斯拉D1芯片可通过DIP(Dojo接口处理器)进行互连,25颗组成一个训练单元(TrainingTile),而且多个训练单元可以继续互连,单个对外带宽高达36TB/s,每个方向都是9TB/s。

如此庞然大物,耗电量和发热都是相当可怕的,电流达18000A,覆盖一个长方体散热方案,散热能力高达15kW。

特斯拉展示了实验室内部的一个训练单元,运行频率2GHz,计算性能最高9PFlops(每秒9千万亿次)。

特斯拉还用D1芯片,打造了一台AI超级计算机“ExaPOD”,配备120个训练单元、3000颗D1芯片、1062000个训练节点,FP16/CFP8训练性能峰值1.1EFlops(每秒110亿亿次计算)。

建成后,它将是世界上最快的AI超算,对比特斯拉现在基于NVIDIA方案的超算,成本差不多,但拥有4倍的性能、1.3倍的能效比、1/5的体积。

姓 名:
邮箱
留 言: