官方网站-首页官方网站-首页

杨哲宇:给人看的视觉方案和给AI看的视觉方案是不同的
2026-09-14 14:10:44

  服贸会专题活动“物理AI与具身智能机器人创新生态交流会”于2026年9月11日在京举办。晰见科技创始人&CEO杨哲宇出席并演讲。

  以下为演讲实录:

  杨哲宇:谢谢大家,非常荣幸有机会给大家做对应的分享。我先介绍一下晰见科技公司,晰见科技源自清华大学类脑计算研究中心。该中心由清华大学联合7个院系共建,是一个创新研究平台。中心的代表性成果包括天机芯和天眸芯,这两项成果均发表于《Nature》封面文章。需要说明的是,在中国大陆,以第一单位发表的AI或芯片领域《Nature》封面文章仅有3篇,分别是天机、天眸和DeepSeek R1,这也体现了中心在学术界的影响力。

  我先做一个简单的自我介绍。我是类脑计算研究中心中唯一一位既参与过高端算力芯片天机芯研发,也参与过感知芯片天眸芯研发的人。目前,我是晰见科技的创始人、董事长兼CEO。

  如前所述,这两项成果均发表于《Nature》封面文章。此外,我目前也是国家重点研发计划亿级项目中最年轻的课题负责人。

  在正式开讲之前,我注意到今天大家讨论最多的两个话题,一个是Physical AI,另一个是具身智能。围绕这两个话题,我先提出一个问题:为什么现在只有大语言模型,却几乎没有听说过“大视觉模型”?语言模型发展至今,参数量已经达到几个T的级别;而视觉模型,尤其是部署在具身和端侧的VLM、VLA,参数量通常只有几个B。今天,我就尝试围绕这个核心问题展开回答,并谈谈我对未来发展的看法。

  我先从视觉谈起。图像传感器是当前数字经济中规模最大的上游数据源头之一。可以看到,几乎每个人都爱拍照,每部手机上都有多个摄像头,这本身就是一个非常大的市场。但我认为,当前的视觉感知本质上是为了满足人看世界的需求,也就是服务于拍照、摄像以及视觉娱乐,对应的是图像传感器的三大核心指标:帧率、分辨率和精度。它的工作原理是在每个时刻、对每个像素采样对应的信号。这样的工作原理带来了一个最核心的瓶颈。在天眸芯出现之前,这是一个无法逾越的客观难题,也被称为视觉感知领域的“皇冠”。其核心矛盾在于,分辨率、帧率和画质这几项指标相互制约,提升其中一项,往往会导致另外两项下降。可以看看自己的手机:为什么手机背面会有那么多摄像头?一个摄像头行不行?本质上,一个摄像头是不够的,因为在不同场景下,只能用不同的CMOS传感器来解决不同的问题。

  在这个领域,自然界提供了一个可供参考的范例,那就是每个人的眼睛。可以留意一下,你的眼睛所看到的世界,和相机拍出来的世界究竟有什么不同。你的眼睛本质上是盯着某处看,注视点区域分辨率很高,而周围则是模糊的。但拍一张照片时,画面中所有信息是被均匀记录下来的,对应的是左边这个典型的生物学结果。在视觉感知领域,视觉注视点是视觉认知世界的重要方式,而这种方式和满足人类视觉需求的图像传感器有本质不同。天眸芯是第一个将上述原理实现在图像传感器芯片中的工作。相关研究借鉴的正是人类基本的视觉感知方式:在感知时,并非将所有信息均匀采样,而是把画面中的关键部分以不同的表达方式呈现。在生物学中,这被称为视觉基本元语,它构成了一种更基本的视觉表达方式,包含色彩、时间上发生变化的部分、空间上的边缘以及深度距离。这些共同构成了人类理解世界的核心方式。

  这一部分展示的是我们上一代已流片芯片的实物拍摄效果。左上角画面来自传统图像传感器:如果以30帧的速度拍摄高速目标,再慢放回看,画面是不连续的,从弓拉开到箭飞出去,只能拍到一两张画面。基于天眸芯片的感知方式则类似于人眼的自适应感知,它会感知画面中哪些部分在空间上发生变化、哪些是边缘。我们在这条技术路线上是全世界第一个实现稀疏量化效果并实现高精度去量化的,这也是我们能够登上《Nature》封面的核心原因。它能够支持画面无损重建。在画面中,无论是飞驰的箭矢、振动的弓弦,还是衣服的抖动,都能得到完整还原,并且这种还原是低功耗、低带宽的。它不像传统方式那样,为了拍高速而将所有信息均匀采样;天眸是有注视点的,像人眼一样,把关键信息放在注视点上。

  讲完这里,我再回到一开始的问题:现在大家大概率听说过大语言模型,却没有听说过大视觉模型。这个本质问题究竟出在哪里?我认为核心在于一个瓶颈点。视觉和文本是天然对立的两种模态。就人类的视觉表达能力而言,说话时每秒钟只能说几个Token,但一张1080P的图像就有8000个Token;如果要连续观看每秒30帧的画面,就是24万个Token。如果给出一个Benchmark,端侧最好的GPU能处理多少数据呢?大概在7B这样已经非常小的模型里,每秒处理300个Token。这个量级用于处理语言绰绰有余,但用于处理视频则远远不够。正是这种“远远不够”,使得当前语言模型的发展明显领先于视觉模型。那么天眸芯如何解决这个问题?我们认为,下一个核心场景就是视觉表示方式将从现在开始发生改变。我今天可以在这里做一个预测:未来两年以内,给人看的视觉方案和给AI看的视觉方案,一定会成为两个完全不同的东西。信号采集我已经讲清楚了,视觉感知可以删掉大量无效信息,同时依然能够重建对应的原始图像。基于这一原理,芯片就可以进行片上的稀疏计算,去计算每一个Token本身的信息量和价值。经过内存重排之后,就可以得到压缩后的数据——经过视觉原语压缩90%后,数据量大幅降低,再通过RDMA直通GPU。这样的数据可能人眼已经看不懂,但它真正适合Transformer、VLM、VLA以及世界模型的处理范式。这样的范式可以实现整体上的优化:无论是模型响应延迟中我们最关注的指标TDFT,还是模型的训练成本,都会出现直线下降。

  到现在为止,天眸所定义的是一种全新的Token Camera。它不像传统图像传感器那样以帧和像素为基本单位、主要服务于人看图像,而是以有效的Token为基本单位。我认为,在AI时代,给人看的视觉方案和给AI看的视觉方案,一定会变成两个不同的东西。仔细想想,生活中很多传感器和视觉感知,本质上就是给AI看的,而不是给人看的,比如各类智能可穿戴设备。我本人是做图像传感器芯片的,在这个领域,我的看法是:如果在眼镜上放一个摄像头、在胸口挂一个摄像头、在耳机里塞一个摄像头,仅仅为了拍照,其实没有太大意义,因为此时视角调整不了,画面也调整不了。但有一个场景是有意义的,就是把它直接接入大模型的理解能力,让它成为Physical AI的眼睛。这才是未来核心的发展方向。

  最后给大家看一个案例。我认为,视觉的通用性,可能会带来下一个Coding级别的应用体量爆发。这里举一个我个人最喜欢的例子:数跳绳跳了多少下。这个应用为什么有意思?传统CV能不能做这件事?答案是可以。但做这件事的背后,需要大量数据标注,需要模型去学习对应文本,接下来大概率还要写一堆规则,用规则判断什么时候算跳了一次绳。但我认为,未来的AI中,自然语言就是最好的编程语言。视觉一旦具备通用性,每个相机就可以成为每个人的个人助理。你通过提示词,就可以告诉相机到底要观察什么。这样的工作流,会彻底改变人类在编程层面的应用方式:我们做各类视觉应用,不再需要编程,直接通过提示词就可以控制相机完成各类任务。同样,在大模型的应用中,生活里有大量场景需要大模型,但仔细反思一下,真正愿意落地这些场景的科技公司,尤其是做视觉的公司,其实非常少。比如飞机舱门有没有关、我出门前有没有锁门、锁门后的操作流程对不对、做一个卷饼有没有少放酱料。任何一家视觉公司都不会做这些场景,为什么?因为这类场景是碎片化的,是case by case的服务,最终对应的是整体人力成本的投入。而在大模型时代,视觉一旦具备通用性,对公司来说,这个业务模型又会回到一种标品相机的业务模式。每个人控制相机的方式,不再是通过编程,不再是通过传统CV,而是通过真正的大模型。

  最后,我想借鉴一句黄仁勋常说的话,也是我非常欣赏的一句话。英伟达所做的事情,实际上是AI的factory:电子输入AI集群,集群最终变成Intelligence的Token,对应的是Coding,对应的是文本。而晰见所做的、天眸所做的,实际上是把光子变成有效的Token,把光线中物理的输入来源变成有限的信息,最终成为大模型理解世界的物理端口。我认为,未来的Physical AI一定是一个比具身更大的概念,它不仅是机器人的操作,更包括机器人具体的控制。

  谢谢大家!

特别声明:以上文章内容仅代表作者本人观点,不代表新浪网观点或立场。如有关于作品内容、版权或其它问题请于作品发表后的30日内与新浪网联系。
登录