All-In Podcast - Naveen Rao: 4D Computing, AI's Energy Wall & Beating Biology
发布时间:
原节目
以下是内容的中文翻译:
**介绍人/主持人**
* 介绍了Naveen Rao,他是Unconventional AI的联合创始人兼首席执行官,该公司是一家人工智能芯片初创公司,以“为深度科技公司构建和销售产品而闻名”。
* 将Naveen描述为一位“定义上的异类创始人”,并提到他之前创办的公司从2000万美元发展到7亿至8亿美元的规模。
* 引用了Naveen的一些观点,包括:“我认为除非你能构建它,否则你无法真正理解它。”“仅仅因为某事经过尝试并不意味着它是错误的。”(Naveen本人后来澄清了他在AI方面的立场)。
* 引用Naveen关于人工智能的看法:“我是一个人工智能悲观论者的对立面。我认为人工智能是人类进化的下一个阶段。”以及“我们需要硬件基板上的创新才能真正构建出真正的智能。”
* 在Naveen演讲结束后,他对Naveen的演讲表示惊叹:“我必须说,这真是出乎意料,太棒了。”
* 就将早期版本转化为实际产品提出了问题,包括所需生态系统(如晶圆厂、封装商)、时间和复杂性。
* 询问最终产品是什么,是否是他们管理的一个虚拟机或数据中心产品。
* 询问他们是否会支持现有的模型家族和架构,以及如何让大家适应这种新范式,因为目前的模型都基于抽象概念(如KVCache)。
* 询问他们的方法中是否存在类似矩阵乘法(matmul)这样的基本元素。
* 询问团队的构成,例如是否包含生物学家、物理学家等不同领域的专家。
* 询问是否存在类似于CUDA的工具,能够让不同背景的团队成员进行沟通和协作。
**Naveen Rao(Unconventional AI联合创始人兼首席执行官)**
* 对参加会议表示兴奋,并重申自己是“人工智能悲观论者的对立面”,认为人工智能是人类有史以来创造的最具变革性的技术之一,将使人类进入“下一个进化阶段”。
* 分享个人经历:
* 从小(1978年拥有第一台电脑,80年代初学习编程)就想制造智能机器,将编程视为一个谜题。
* 受科幻影响成为一名电气工程师,之后攻读神经科学博士学位,旨在解决“如何让计算机变得智能”的问题。
* 认为目前对技术专家来说是一个梦想,因为整个世界都在朝着这个方向发展。
* 分享创业经历:
* 2014年创立了Nirvana Systems,这是第一家人工智能芯片公司,当时“人工智能”还不是一个常用词,且说服人们投资硬件非常困难。
* 将Nirvana Systems卖给了英特尔(他认为卖得太早了),并在英特尔创建并管理了人工智能部门。
* 2020年离开英特尔后,开始思考如何构建更大的模型(如大型语言模型)的基础设施。
* 致力于将GPU平台化并实现规模化,使其易于他人使用。
* 在2022年ChatGPT发布后,其公司成为构建自有模型的最佳选择之一。
* 2023年与Databricks合并,目前占Databricks总收入的四分之一。
* 介绍Unconventional AI及其目标:
* 正在“重新思考计算机的工作基础”,从第一性原理出发构建一台新机器。
* 目标是实现极高的能效,最初设定为五年内实现“1000倍的能效”,后因AI加速科学问题解决而将目标修订为三年半。
* 描述Unconventional AI的组织结构:
* 是一个“自上而下”的公司,从理论家(拥有数学、理论神经科学博士学位)开始,他们提出能通过减少信息移动来提高能效的概念。
* 这些概念被转化为在真实数据上训练的模型,并根据真实标准进行评估。
* 然后是构建物理硬件的团队(电路架构师、设计师、建模师)。
* 最终目标是构建完整的系统、主板和产品。
* 阐述能源问题:
* 以谷歌为例,每月处理3.2万亿(quadrillion)个token。
* 即便以每token 10焦耳的较低能耗计算,也需要12吉瓦的电力。
* 美国数据中心目前消耗约40吉瓦,全球不足100吉瓦,而谷歌一家公司的AI服务就占用了12吉瓦。
* 估计如果模型持续增长且需求增加,大约三年内我们将面临能源短缺。
* 指出市场呈指数级增长,而能源供应呈线性增长,由此产生的“差距”是需要通过技术解决的问题。
* 数据中心关注点已从占地空间、网络设备、GPU转变为今天的能源——“首先考虑能源”。
* 服务一个token的成本中,约50%是能源,其余是硬件资本支出和空间。
* 他们的商业模式是通过将每瓦特的收益提高1000倍来“货币化”能源。
* 如何构建更高效的计算机(受生物学启发):
* 人脑消耗约20瓦。猴子大脑约1瓦。手机约1瓦。
* 松鼠大脑仅消耗8毫瓦,却能表现出极其精确和准确的行为,强调了生物智能的能效。
* 认为“除非我们能创造它,否则我们无法真正理解它。”
* 现有AI系统的低效率根源:
* 计算系统中大部分能量都用于“移动信息”。
* 人脑皮层每秒移动约160亿位,而GPU或高端计算系统每秒在芯片外移动近30万亿位,芯片内部则更多100倍。正是这种信息移动导致了高能耗。
* 计算机历史与当前瓶颈:
* 计算机从机械、模拟发展到数字时代(1930s-1940s)。
* 1940年代计算机的运行方式(内存与计算分离,信息来回移动)与今天类似,导致大量的信息移动。
* 计算机被设计为追求速度(如ENIAC用于炮弹轨迹计算),而非能效。
* 摩尔定律(通过缩小晶体管提高效率)已基本终结,频率和单线程性能的扩展也已停止,效率提升不再通过这种方式实现。
* Unconventional AI的方法:“切断中间环节”:
* 现有计算机建立在抽象之上(如将模拟的晶体管行为抽象为数字的1和0),这些抽象是“有损的”且低效。
* 他们的做法是简化这一点,找到半导体物理的抽象,并将其直接与神经网络连接。
* 指出大脑中的智能源于神经元的物理特性,而非线性代数或浮点运算。他们希望用半导体模仿这一点。
* 引用自然界中的例子(如鸟群、蚁群的涌现行为)来解释“动力系统理论”,即简单组件的简单行为如何产生智能的涌现特性。
* 以节拍器同步为例解释动力系统:
* 放置在同一块木板上的多个节拍器会自发同步,这是系统物理特性的体现。
* 这说明物理系统可以通过固有互联产生特定行为。
* 将动力系统应用于生成式AI:
* 发布了名为“Uno”的模型,一个基于振荡器(类似节拍器)的图像生成模型。
* 该模型经过模拟并开源,展示了通过动力系统进行训练并产生有用输出(如图像生成)的能力。
* 展示了系统状态空间轨迹的分析以及实际生成的图像。
* 在稀疏性方面的进展:
* 指出现有连接的N平方缩放问题(连接越多,复杂度呈指数级增长)。
* 稀疏性允许他们舍弃部分连接,不仅能提高效率和可扩展性,还能获得更好的系统行为和训练效果。
* 称之为“圣杯”,因为这在效率、可扩展性和性能上都带来了提升。
* 首次公开展示他们的物理动力学计算机:
* 在短短五个月内建成,于六月一日完成设计并送厂制造。
* 芯片已返回实验室并获得结果,展示了“有史以来第一批由这种计算机生成的图像”。
* 能效极高:每张图片仅需500纳焦耳(纳焦耳是10的负9次方),而GPU约为毫焦耳,这意味着“效率高出许多个数量级”。
* 这种效率来源于它不移动信息。
* 这是首次公开谈论这一突破。
* 新型计算机的意义:
* 计算机发展历程:CPU -> GPU(并行度更高) -> 计算与存储结合(更并行、更细粒度)。
* 以上皆为冯·诺依曼架构(内存与计算分离)。
* 他们构建的是“动力学计算机”,计算与存储合二为一,没有内存接口,每个计算单元本身就是内存。
* 称之为“4D计算”:利用时间维度(动态)和物理三维(芯片堆叠、平面设计)。
* 这种新方法已被证明在提高效率方面有效。
* 1000倍能效提升的未来影响:
* 关注“每瓦智能”。
* 哺乳动物大脑的能效接近热力学极限(相差一到两个数量级)。
* 目前系统与极限相差100亿倍。
* 目标是在三年半内达到2D光刻的极限,并最终“超越生物学”,在未来十年内实现计算无处不在(包括机器人)。
* 预测数据中心将从大型、兆瓦级转变为众多小型、本地化、适应性强的形式,这对环境更友好。
* 设想能构建数十亿个机器人,动态协作解决世界问题。
* 引用杰文斯悖论:当一项资产的基础成本降低1000倍时,其消耗量将远超1000倍的下降比例。
* 预计这将创造“人类有史以来最大的市场”。
* 回答提问:
* **产品路线图:** 两年内推出完整产品。
* **产品形态:** 一款新的数据中心产品,一个完整的机架系统,通过网线实现“token输入、token输出”,但内部结构与现有计算机完全不同。
* **对现有模型的支持:** 需要一些迁移工作,但主要在“模型层”而非操作层进行。现有模型可以工作,但需要计算资源来完成过渡。
* **矩阵乘法:** 在他们的系统中不以传统矩阵乘法形式存在。虽然可以将其描述为矩阵乘法,但它是通过“时变行为”实现的。每个时间步可以被分析为当前状态矩阵乘以一个转换矩阵。
* **团队构成:** 团队由动力系统理论家(该领域已存在百年)和芯片工程师组成。最大的挑战是让这些专业背景差异巨大的人才协调合作。
* **开发工具:** 构建了一套基于Python的库,用于表达具有随机行为的时变元素,类似于一个特定的语言。
这是一段播客节目的节选,由一位介绍人引出Unconventional AI的联合创始人兼首席执行官Naveen Rao,随后Naveen Rao进行了演讲,并在演讲结束后回答了介绍人的提问。
**介绍人/主持人**
* 介绍了Naveen Rao,他是Unconventional AI的联合创始人兼首席执行官,该公司是一家人工智能芯片初创公司,以“为深度科技公司构建和销售产品而闻名”。
* 将Naveen描述为一位“定义上的异类创始人”,并提到他之前创办的公司从2000万美元发展到7亿至8亿美元的规模。
* 引用了Naveen的一些观点,包括:“我认为除非你能构建它,否则你无法真正理解它。”“仅仅因为某事经过尝试并不意味着它是错误的。”(Naveen本人后来澄清了他在AI方面的立场)。
* 引用Naveen关于人工智能的看法:“我是一个人工智能悲观论者的对立面。我认为人工智能是人类进化的下一个阶段。”以及“我们需要硬件基板上的创新才能真正构建出真正的智能。”
* 在Naveen演讲结束后,他对Naveen的 발표表示惊叹:“我必须说,这真是出乎意料,太棒了。”
* 就将早期版本转化为实际产品提出了问题,包括所需生态系统(如晶圆厂、封装商)、时间和复杂性。
* 询问最终产品是什么,是否是他们管理的一个虚拟机或数据中心产品。
* 询问他们是否会支持现有的模型家族和架构,以及如何让大家适应这种新范式,因为目前的模型都基于抽象概念(如KVCache)。
* 询问他们的方法中是否存在类似矩阵乘法(matmul)这样的基本元素。
* 询问团队的构成,例如是否包含生物学家、物理学家等不同领域的专家。
* 询问是否存在类似于CUDA的工具,能够让不同背景的团队成员进行沟通和协作。
**Naveen Rao(Unconventional AI联合创始人兼首席执行官)**
* 对参加会议表示兴奋,并重申自己是“人工智能悲观论者的对立面”,认为人工智能是人类有史以来创造的最具变革性的技术之一,将使人类进入“下一个进化阶段”。
* 分享个人经历:
* 从小(1978年拥有第一台电脑,80年代初学习编程)就想制造智能机器,将编程视为一个谜题。
* 受科幻影响成为一名电气工程师,之后攻读神经科学博士学位,旨在解决“如何让计算机变得智能”的问题。
* 认为目前对技术专家来说是一个梦想,因为整个世界都在朝着这个方向发展。
* 分享创业经历:
* 2014年创立了Nirvana Systems,这是第一家人工智能芯片公司,当时“人工智能”还不是一个常用词,且说服人们投资硬件非常困难。
* 将Nirvana Systems卖给了英特尔(他认为卖得太早了),并在英特尔创建并管理了人工智能部门。
* 2020年离开英特尔后,开始思考如何构建更大的模型(如大型语言模型)的基础设施。
* 致力于将GPU平台化并实现规模化,使其易于他人使用。
* 在2022年ChatGPT发布后,其公司成为构建自有模型的最佳选择之一。
* 2023年与Databricks合并,目前占Databricks总收入的四分之一。
* 介绍Unconventional AI及其目标:
* 正在“重新思考计算机的工作基础”,从第一性原理出发构建一台新机器。
* 目标是实现极高的能效,最初设定为五年内实现“1000倍的能效”,后因AI加速科学问题解决而将目标修订为三年半。
* 描述Unconventional AI的组织结构:
* 是一个“自上而下”的公司,从理论家(拥有数学、理论神经科学博士学位)开始,他们提出能通过减少信息移动来提高能效的概念。
* 这些概念被转化为在真实数据上训练的模型,并根据真实标准进行评估。
* 然后是构建物理硬件的团队(电路架构师、设计师、建模师)。
* 最终目标是构建完整的系统、主板和产品。
* 阐述能源问题:
* 以谷歌为例,每月处理3.2万亿(quadrillion)个token。
* 即便以每token 10焦耳的较低能耗计算,也需要12吉瓦的电力。
* 美国数据中心目前消耗约40吉瓦,全球不足100吉瓦,而谷歌一家公司的AI服务就占用了12吉瓦。
* 估计如果模型持续增长且需求增加,大约三年内我们将面临能源短缺。
* 指出市场呈指数级增长,而能源供应呈线性增长,由此产生的“差距”是需要通过技术解决的问题。
* 数据中心关注点已从占地空间、网络设备、GPU转变为今天的能源——“首先考虑能源”。
* 服务一个token的成本中,约50%是能源,其余是硬件资本支出和空间。
* 他们的商业模式是通过将每瓦特的收益提高1000倍来“货币化”能源。
* 如何构建更高效的计算机(受生物学启发):
* 人脑消耗约20瓦。猴子大脑约1瓦。手机约1瓦。
* 松鼠大脑仅消耗8毫瓦,却能表现出极其精确和准确的行为,强调了生物智能的能效。
* 认为“除非我们能创造它,否则我们无法真正理解它。”
* 现有AI系统的低效率根源:
* 计算系统中大部分能量都用于“移动信息”。
* 人脑皮层每秒移动约160亿位,而GPU或高端计算系统每秒在芯片外移动近30万亿位,芯片内部则更多100倍。正是这种信息移动导致了高能耗。
* 计算机历史与当前瓶颈:
* 计算机从机械、模拟发展到数字时代(1930s-1940s)。
* 1940年代计算机的运行方式(内存与计算分离,信息来回移动)与今天类似,导致大量的信息移动。
* 计算机被设计为追求速度(如ENIAC用于炮弹轨迹计算),而非能效。
* 摩尔定律(通过缩小晶体管提高效率)已基本终结,频率和单线程性能的扩展也已停止,效率提升不再通过这种方式实现。
* Unconventional AI的方法:“切断中间环节”:
* 现有计算机建立在抽象之上(如将模拟的晶体管行为抽象为数字的1和0),这些抽象是“有损的”且低效。
* 他们的做法是简化这一点,找到半导体物理的抽象,并将其直接与神经网络连接。
* 指出大脑中的智能源于神经元的物理特性,而非线性代数或浮点运算。他们希望用半导体模仿这一点。
* 引用自然界中的例子(如鸟群、蚁群的涌现行为)来解释“动力系统理论”,即简单组件的简单行为如何产生智能的涌现特性。
* 以节拍器同步为例解释动力系统:
* 放置在同一块木板上的多个节拍器会自发同步,这是系统物理特性的体现。
* 这说明物理系统可以通过固有互联产生特定行为。
* 将动力系统应用于生成式AI:
* 发布了名为“Uno”的模型,一个基于振荡器(类似节拍器)的图像生成模型。
* 该模型经过模拟并开源,展示了通过动力系统进行训练并产生有用输出(如图像生成)的能力。
* 展示了系统状态空间轨迹的分析以及实际生成的图像。
* 在稀疏性方面的进展:
* 指出现有连接的N平方缩放问题(连接越多,复杂度呈指数级增长)。
* 稀疏性允许他们舍弃部分连接,不仅能提高效率和可扩展性,还能获得更好的系统行为和训练效果。
* 称之为“圣杯”,因为这在效率、可扩展性和性能上都带来了提升。
* 首次公开展示他们的物理动力学计算机:
* 在短短五个月内建成,于六月一日完成设计并送厂制造。
* 芯片已返回实验室并获得结果,展示了“有史以来第一批由这种计算机生成的图像”。
* 能效极高:每张图片仅需500纳焦耳(纳焦耳是10的负9次方),而GPU约为毫焦耳,这意味着“效率高出许多个数量级”。
* 这种效率来源于它不移动信息。
* 这是首次公开谈论这一突破。
* 新型计算机的意义:
* 计算机发展历程:CPU -> GPU(并行度更高) -> 计算与存储结合(更并行、更细粒度)。
* 以上皆为冯·诺依曼架构(内存与计算分离)。
* 他们构建的是“动力学计算机”,计算与存储合二为一,没有内存接口,每个计算单元本身就是内存。
* 称之为“4D计算”:利用时间维度(动态)和物理三维(芯片堆叠、平面设计)。
* 这种新方法已被证明在提高效率方面有效。
* 1000倍能效提升的未来影响:
* 关注“每瓦智能”。
* 哺乳动物大脑的能效接近热力学极限(相差一到两个数量级)。
* 目前系统与极限相差100亿倍。
* 目标是在三年半内达到2D光刻的极限,并最终“超越生物学”,在未来十年内实现计算无处不在(包括机器人)。
* 预测数据中心将从大型、兆瓦级转变为众多小型、本地化、适应性强的形式,这对环境更友好。
* 设想能构建数十亿个机器人,动态协作解决世界问题。
* 引用杰文斯悖论:当一项资产的基础成本降低1000倍时,其消耗量将远超1000倍的下降比例。
* 预计这将创造“人类有史以来最大的市场”。
* 回答提问:
* **产品路线图:** 两年内推出完整产品。
* **产品形态:** 一款新的数据中心产品,一个完整的机架系统,通过网线实现“token输入、token输出”,但内部结构与现有计算机完全不同。
* **对现有模型的支持:** 需要一些迁移工作,但主要在“模型层”而非操作层进行。现有模型可以工作,但需要计算资源来完成过渡。
* **矩阵乘法:** 在他们的系统中不以传统矩阵乘法形式存在。虽然可以将其描述为矩阵乘法,但它是通过“时变行为”实现的。每个时间步可以被分析为当前状态矩阵乘以一个转换矩阵。
* **团队构成:** 团队由动力系统理论家(该领域已存在百年)和芯片工程师组成。最大的挑战是让这些专业背景差异巨大的人才协调合作。
* **开发工具:** 构建了一套基于Python的库,用于表达具有随机行为的时变元素,类似于一个特定的语言。