首页  >>  来自播客: All-In Podcast 更新   反馈  

All-In Podcast - Naveen Rao: 4D Computing, AI's Energy Wall & Beating Biology

发布时间:   原节目
以下是内容的中文翻译: **介绍人/主持人** * 介绍了Naveen Rao,他是Unconventional AI的联合创始人兼首席执行官,该公司是一家人工智能芯片初创公司,以“为深度科技公司构建和销售产品而闻名”。 * 将Naveen描述为一位“定义上的异类创始人”,并提到他之前创办的公司从2000万美元发展到7亿至8亿美元的规模。 * 引用了Naveen的一些观点,包括:“我认为除非你能构建它,否则你无法真正理解它。”“仅仅因为某事经过尝试并不意味着它是错误的。”(Naveen本人后来澄清了他在AI方面的立场)。 * 引用Naveen关于人工智能的看法:“我是一个人工智能悲观论者的对立面。我认为人工智能是人类进化的下一个阶段。”以及“我们需要硬件基板上的创新才能真正构建出真正的智能。” * 在Naveen演讲结束后,他对Naveen的演讲表示惊叹:“我必须说,这真是出乎意料,太棒了。” * 就将早期版本转化为实际产品提出了问题,包括所需生态系统(如晶圆厂、封装商)、时间和复杂性。 * 询问最终产品是什么,是否是他们管理的一个虚拟机或数据中心产品。 * 询问他们是否会支持现有的模型家族和架构,以及如何让大家适应这种新范式,因为目前的模型都基于抽象概念(如KVCache)。 * 询问他们的方法中是否存在类似矩阵乘法(matmul)这样的基本元素。 * 询问团队的构成,例如是否包含生物学家、物理学家等不同领域的专家。 * 询问是否存在类似于CUDA的工具,能够让不同背景的团队成员进行沟通和协作。 **Naveen Rao(Unconventional AI联合创始人兼首席执行官)** * 对参加会议表示兴奋,并重申自己是“人工智能悲观论者的对立面”,认为人工智能是人类有史以来创造的最具变革性的技术之一,将使人类进入“下一个进化阶段”。 * 分享个人经历: * 从小(1978年拥有第一台电脑,80年代初学习编程)就想制造智能机器,将编程视为一个谜题。 * 受科幻影响成为一名电气工程师,之后攻读神经科学博士学位,旨在解决“如何让计算机变得智能”的问题。 * 认为目前对技术专家来说是一个梦想,因为整个世界都在朝着这个方向发展。 * 分享创业经历: * 2014年创立了Nirvana Systems,这是第一家人工智能芯片公司,当时“人工智能”还不是一个常用词,且说服人们投资硬件非常困难。 * 将Nirvana Systems卖给了英特尔(他认为卖得太早了),并在英特尔创建并管理了人工智能部门。 * 2020年离开英特尔后,开始思考如何构建更大的模型(如大型语言模型)的基础设施。 * 致力于将GPU平台化并实现规模化,使其易于他人使用。 * 在2022年ChatGPT发布后,其公司成为构建自有模型的最佳选择之一。 * 2023年与Databricks合并,目前占Databricks总收入的四分之一。 * 介绍Unconventional AI及其目标: * 正在“重新思考计算机的工作基础”,从第一性原理出发构建一台新机器。 * 目标是实现极高的能效,最初设定为五年内实现“1000倍的能效”,后因AI加速科学问题解决而将目标修订为三年半。 * 描述Unconventional AI的组织结构: * 是一个“自上而下”的公司,从理论家(拥有数学、理论神经科学博士学位)开始,他们提出能通过减少信息移动来提高能效的概念。 * 这些概念被转化为在真实数据上训练的模型,并根据真实标准进行评估。 * 然后是构建物理硬件的团队(电路架构师、设计师、建模师)。 * 最终目标是构建完整的系统、主板和产品。 * 阐述能源问题: * 以谷歌为例,每月处理3.2万亿(quadrillion)个token。 * 即便以每token 10焦耳的较低能耗计算,也需要12吉瓦的电力。 * 美国数据中心目前消耗约40吉瓦,全球不足100吉瓦,而谷歌一家公司的AI服务就占用了12吉瓦。 * 估计如果模型持续增长且需求增加,大约三年内我们将面临能源短缺。 * 指出市场呈指数级增长,而能源供应呈线性增长,由此产生的“差距”是需要通过技术解决的问题。 * 数据中心关注点已从占地空间、网络设备、GPU转变为今天的能源——“首先考虑能源”。 * 服务一个token的成本中,约50%是能源,其余是硬件资本支出和空间。 * 他们的商业模式是通过将每瓦特的收益提高1000倍来“货币化”能源。 * 如何构建更高效的计算机(受生物学启发): * 人脑消耗约20瓦。猴子大脑约1瓦。手机约1瓦。 * 松鼠大脑仅消耗8毫瓦,却能表现出极其精确和准确的行为,强调了生物智能的能效。 * 认为“除非我们能创造它,否则我们无法真正理解它。” * 现有AI系统的低效率根源: * 计算系统中大部分能量都用于“移动信息”。 * 人脑皮层每秒移动约160亿位,而GPU或高端计算系统每秒在芯片外移动近30万亿位,芯片内部则更多100倍。正是这种信息移动导致了高能耗。 * 计算机历史与当前瓶颈: * 计算机从机械、模拟发展到数字时代(1930s-1940s)。 * 1940年代计算机的运行方式(内存与计算分离,信息来回移动)与今天类似,导致大量的信息移动。 * 计算机被设计为追求速度(如ENIAC用于炮弹轨迹计算),而非能效。 * 摩尔定律(通过缩小晶体管提高效率)已基本终结,频率和单线程性能的扩展也已停止,效率提升不再通过这种方式实现。 * Unconventional AI的方法:“切断中间环节”: * 现有计算机建立在抽象之上(如将模拟的晶体管行为抽象为数字的1和0),这些抽象是“有损的”且低效。 * 他们的做法是简化这一点,找到半导体物理的抽象,并将其直接与神经网络连接。 * 指出大脑中的智能源于神经元的物理特性,而非线性代数或浮点运算。他们希望用半导体模仿这一点。 * 引用自然界中的例子(如鸟群、蚁群的涌现行为)来解释“动力系统理论”,即简单组件的简单行为如何产生智能的涌现特性。 * 以节拍器同步为例解释动力系统: * 放置在同一块木板上的多个节拍器会自发同步,这是系统物理特性的体现。 * 这说明物理系统可以通过固有互联产生特定行为。 * 将动力系统应用于生成式AI: * 发布了名为“Uno”的模型,一个基于振荡器(类似节拍器)的图像生成模型。 * 该模型经过模拟并开源,展示了通过动力系统进行训练并产生有用输出(如图像生成)的能力。 * 展示了系统状态空间轨迹的分析以及实际生成的图像。 * 在稀疏性方面的进展: * 指出现有连接的N平方缩放问题(连接越多,复杂度呈指数级增长)。 * 稀疏性允许他们舍弃部分连接,不仅能提高效率和可扩展性,还能获得更好的系统行为和训练效果。 * 称之为“圣杯”,因为这在效率、可扩展性和性能上都带来了提升。 * 首次公开展示他们的物理动力学计算机: * 在短短五个月内建成,于六月一日完成设计并送厂制造。 * 芯片已返回实验室并获得结果,展示了“有史以来第一批由这种计算机生成的图像”。 * 能效极高:每张图片仅需500纳焦耳(纳焦耳是10的负9次方),而GPU约为毫焦耳,这意味着“效率高出许多个数量级”。 * 这种效率来源于它不移动信息。 * 这是首次公开谈论这一突破。 * 新型计算机的意义: * 计算机发展历程:CPU -> GPU(并行度更高) -> 计算与存储结合(更并行、更细粒度)。 * 以上皆为冯·诺依曼架构(内存与计算分离)。 * 他们构建的是“动力学计算机”,计算与存储合二为一,没有内存接口,每个计算单元本身就是内存。 * 称之为“4D计算”:利用时间维度(动态)和物理三维(芯片堆叠、平面设计)。 * 这种新方法已被证明在提高效率方面有效。 * 1000倍能效提升的未来影响: * 关注“每瓦智能”。 * 哺乳动物大脑的能效接近热力学极限(相差一到两个数量级)。 * 目前系统与极限相差100亿倍。 * 目标是在三年半内达到2D光刻的极限,并最终“超越生物学”,在未来十年内实现计算无处不在(包括机器人)。 * 预测数据中心将从大型、兆瓦级转变为众多小型、本地化、适应性强的形式,这对环境更友好。 * 设想能构建数十亿个机器人,动态协作解决世界问题。 * 引用杰文斯悖论:当一项资产的基础成本降低1000倍时,其消耗量将远超1000倍的下降比例。 * 预计这将创造“人类有史以来最大的市场”。 * 回答提问: * **产品路线图:** 两年内推出完整产品。 * **产品形态:** 一款新的数据中心产品,一个完整的机架系统,通过网线实现“token输入、token输出”,但内部结构与现有计算机完全不同。 * **对现有模型的支持:** 需要一些迁移工作,但主要在“模型层”而非操作层进行。现有模型可以工作,但需要计算资源来完成过渡。 * **矩阵乘法:** 在他们的系统中不以传统矩阵乘法形式存在。虽然可以将其描述为矩阵乘法,但它是通过“时变行为”实现的。每个时间步可以被分析为当前状态矩阵乘以一个转换矩阵。 * **团队构成:** 团队由动力系统理论家(该领域已存在百年)和芯片工程师组成。最大的挑战是让这些专业背景差异巨大的人才协调合作。 * **开发工具:** 构建了一套基于Python的库,用于表达具有随机行为的时变元素,类似于一个特定的语言。

这是一段播客节目的节选,由一位介绍人引出Unconventional AI的联合创始人兼首席执行官Naveen Rao,随后Naveen Rao进行了演讲,并在演讲结束后回答了介绍人的提问。 **介绍人/主持人** * 介绍了Naveen Rao,他是Unconventional AI的联合创始人兼首席执行官,该公司是一家人工智能芯片初创公司,以“为深度科技公司构建和销售产品而闻名”。 * 将Naveen描述为一位“定义上的异类创始人”,并提到他之前创办的公司从2000万美元发展到7亿至8亿美元的规模。 * 引用了Naveen的一些观点,包括:“我认为除非你能构建它,否则你无法真正理解它。”“仅仅因为某事经过尝试并不意味着它是错误的。”(Naveen本人后来澄清了他在AI方面的立场)。 * 引用Naveen关于人工智能的看法:“我是一个人工智能悲观论者的对立面。我认为人工智能是人类进化的下一个阶段。”以及“我们需要硬件基板上的创新才能真正构建出真正的智能。” * 在Naveen演讲结束后,他对Naveen的 발표表示惊叹:“我必须说,这真是出乎意料,太棒了。” * 就将早期版本转化为实际产品提出了问题,包括所需生态系统(如晶圆厂、封装商)、时间和复杂性。 * 询问最终产品是什么,是否是他们管理的一个虚拟机或数据中心产品。 * 询问他们是否会支持现有的模型家族和架构,以及如何让大家适应这种新范式,因为目前的模型都基于抽象概念(如KVCache)。 * 询问他们的方法中是否存在类似矩阵乘法(matmul)这样的基本元素。 * 询问团队的构成,例如是否包含生物学家、物理学家等不同领域的专家。 * 询问是否存在类似于CUDA的工具,能够让不同背景的团队成员进行沟通和协作。 **Naveen Rao(Unconventional AI联合创始人兼首席执行官)** * 对参加会议表示兴奋,并重申自己是“人工智能悲观论者的对立面”,认为人工智能是人类有史以来创造的最具变革性的技术之一,将使人类进入“下一个进化阶段”。 * 分享个人经历: * 从小(1978年拥有第一台电脑,80年代初学习编程)就想制造智能机器,将编程视为一个谜题。 * 受科幻影响成为一名电气工程师,之后攻读神经科学博士学位,旨在解决“如何让计算机变得智能”的问题。 * 认为目前对技术专家来说是一个梦想,因为整个世界都在朝着这个方向发展。 * 分享创业经历: * 2014年创立了Nirvana Systems,这是第一家人工智能芯片公司,当时“人工智能”还不是一个常用词,且说服人们投资硬件非常困难。 * 将Nirvana Systems卖给了英特尔(他认为卖得太早了),并在英特尔创建并管理了人工智能部门。 * 2020年离开英特尔后,开始思考如何构建更大的模型(如大型语言模型)的基础设施。 * 致力于将GPU平台化并实现规模化,使其易于他人使用。 * 在2022年ChatGPT发布后,其公司成为构建自有模型的最佳选择之一。 * 2023年与Databricks合并,目前占Databricks总收入的四分之一。 * 介绍Unconventional AI及其目标: * 正在“重新思考计算机的工作基础”,从第一性原理出发构建一台新机器。 * 目标是实现极高的能效,最初设定为五年内实现“1000倍的能效”,后因AI加速科学问题解决而将目标修订为三年半。 * 描述Unconventional AI的组织结构: * 是一个“自上而下”的公司,从理论家(拥有数学、理论神经科学博士学位)开始,他们提出能通过减少信息移动来提高能效的概念。 * 这些概念被转化为在真实数据上训练的模型,并根据真实标准进行评估。 * 然后是构建物理硬件的团队(电路架构师、设计师、建模师)。 * 最终目标是构建完整的系统、主板和产品。 * 阐述能源问题: * 以谷歌为例,每月处理3.2万亿(quadrillion)个token。 * 即便以每token 10焦耳的较低能耗计算,也需要12吉瓦的电力。 * 美国数据中心目前消耗约40吉瓦,全球不足100吉瓦,而谷歌一家公司的AI服务就占用了12吉瓦。 * 估计如果模型持续增长且需求增加,大约三年内我们将面临能源短缺。 * 指出市场呈指数级增长,而能源供应呈线性增长,由此产生的“差距”是需要通过技术解决的问题。 * 数据中心关注点已从占地空间、网络设备、GPU转变为今天的能源——“首先考虑能源”。 * 服务一个token的成本中,约50%是能源,其余是硬件资本支出和空间。 * 他们的商业模式是通过将每瓦特的收益提高1000倍来“货币化”能源。 * 如何构建更高效的计算机(受生物学启发): * 人脑消耗约20瓦。猴子大脑约1瓦。手机约1瓦。 * 松鼠大脑仅消耗8毫瓦,却能表现出极其精确和准确的行为,强调了生物智能的能效。 * 认为“除非我们能创造它,否则我们无法真正理解它。” * 现有AI系统的低效率根源: * 计算系统中大部分能量都用于“移动信息”。 * 人脑皮层每秒移动约160亿位,而GPU或高端计算系统每秒在芯片外移动近30万亿位,芯片内部则更多100倍。正是这种信息移动导致了高能耗。 * 计算机历史与当前瓶颈: * 计算机从机械、模拟发展到数字时代(1930s-1940s)。 * 1940年代计算机的运行方式(内存与计算分离,信息来回移动)与今天类似,导致大量的信息移动。 * 计算机被设计为追求速度(如ENIAC用于炮弹轨迹计算),而非能效。 * 摩尔定律(通过缩小晶体管提高效率)已基本终结,频率和单线程性能的扩展也已停止,效率提升不再通过这种方式实现。 * Unconventional AI的方法:“切断中间环节”: * 现有计算机建立在抽象之上(如将模拟的晶体管行为抽象为数字的1和0),这些抽象是“有损的”且低效。 * 他们的做法是简化这一点,找到半导体物理的抽象,并将其直接与神经网络连接。 * 指出大脑中的智能源于神经元的物理特性,而非线性代数或浮点运算。他们希望用半导体模仿这一点。 * 引用自然界中的例子(如鸟群、蚁群的涌现行为)来解释“动力系统理论”,即简单组件的简单行为如何产生智能的涌现特性。 * 以节拍器同步为例解释动力系统: * 放置在同一块木板上的多个节拍器会自发同步,这是系统物理特性的体现。 * 这说明物理系统可以通过固有互联产生特定行为。 * 将动力系统应用于生成式AI: * 发布了名为“Uno”的模型,一个基于振荡器(类似节拍器)的图像生成模型。 * 该模型经过模拟并开源,展示了通过动力系统进行训练并产生有用输出(如图像生成)的能力。 * 展示了系统状态空间轨迹的分析以及实际生成的图像。 * 在稀疏性方面的进展: * 指出现有连接的N平方缩放问题(连接越多,复杂度呈指数级增长)。 * 稀疏性允许他们舍弃部分连接,不仅能提高效率和可扩展性,还能获得更好的系统行为和训练效果。 * 称之为“圣杯”,因为这在效率、可扩展性和性能上都带来了提升。 * 首次公开展示他们的物理动力学计算机: * 在短短五个月内建成,于六月一日完成设计并送厂制造。 * 芯片已返回实验室并获得结果,展示了“有史以来第一批由这种计算机生成的图像”。 * 能效极高:每张图片仅需500纳焦耳(纳焦耳是10的负9次方),而GPU约为毫焦耳,这意味着“效率高出许多个数量级”。 * 这种效率来源于它不移动信息。 * 这是首次公开谈论这一突破。 * 新型计算机的意义: * 计算机发展历程:CPU -> GPU(并行度更高) -> 计算与存储结合(更并行、更细粒度)。 * 以上皆为冯·诺依曼架构(内存与计算分离)。 * 他们构建的是“动力学计算机”,计算与存储合二为一,没有内存接口,每个计算单元本身就是内存。 * 称之为“4D计算”:利用时间维度(动态)和物理三维(芯片堆叠、平面设计)。 * 这种新方法已被证明在提高效率方面有效。 * 1000倍能效提升的未来影响: * 关注“每瓦智能”。 * 哺乳动物大脑的能效接近热力学极限(相差一到两个数量级)。 * 目前系统与极限相差100亿倍。 * 目标是在三年半内达到2D光刻的极限,并最终“超越生物学”,在未来十年内实现计算无处不在(包括机器人)。 * 预测数据中心将从大型、兆瓦级转变为众多小型、本地化、适应性强的形式,这对环境更友好。 * 设想能构建数十亿个机器人,动态协作解决世界问题。 * 引用杰文斯悖论:当一项资产的基础成本降低1000倍时,其消耗量将远超1000倍的下降比例。 * 预计这将创造“人类有史以来最大的市场”。 * 回答提问: * **产品路线图:** 两年内推出完整产品。 * **产品形态:** 一款新的数据中心产品,一个完整的机架系统,通过网线实现“token输入、token输出”,但内部结构与现有计算机完全不同。 * **对现有模型的支持:** 需要一些迁移工作,但主要在“模型层”而非操作层进行。现有模型可以工作,但需要计算资源来完成过渡。 * **矩阵乘法:** 在他们的系统中不以传统矩阵乘法形式存在。虽然可以将其描述为矩阵乘法,但它是通过“时变行为”实现的。每个时间步可以被分析为当前状态矩阵乘以一个转换矩阵。 * **团队构成:** 团队由动力系统理论家(该领域已存在百年)和芯片工程师组成。最大的挑战是让这些专业背景差异巨大的人才协调合作。 * **开发工具:** 构建了一套基于Python的库,用于表达具有随机行为的时变元素,类似于一个特定的语言。