• 正文
  • 相关推荐
申请入驻 产业图谱

AI下半场:从“通用智能”到“个性化智能”

13小时前
305
加入交流群
扫码加入
获取工程师必备礼包
参与热点资讯讨论

最近有个感受越来越强:大模型没有越用越好用。

用着用着变笨、变卡,上下文和Token一起爆掉。AI不记得你上周说过什么,更不会从你的反馈里进化。基模能力还在迭代,但Scaling Law的边际效用在递减,通用智能的底座趋于稳定,短期内难有颠覆性的格局变化。于是“个性化智能”这个更具体、也更难的问题,开始被行业认真对待。

头部玩家都指到了同一处。梁文锋在投资闭门会上公布过DeepSeek的AGI路线图:语言模型→CoT→Agent→持续学习→自我迭代→具身智能。他说得很直接:Agent之后,必须攻克的核心瓶颈就是持续学习(Continual Learning)。

2026年8月,Jeff Dean离开待了27年的Google,成立Discovery Loop,使命是“自动化机器学习、科学和工程”。他在Stanford的对谈里推演递归自我改进的论证链条,指向的也是同一件事:让模型在部署之后继续学习、继续进化。

那为什么通用智能已经这么强,个性化却这么难?答案藏在“压缩”两个字里。

所谓7B、70B模型,就是把整个互联网的知识压进几百亿个数字。这几百亿个数字就是模型的全部参数,是预训练时“有损压缩”的产物。模型聪明,不是因为记得多,而是压得巧:从海量数据里提炼规律、发现结构,用有限参数装下无限知识。

a16z今年4月的长文《Why We Need Continual Learning》说得更狠:"LLMs are, at their core, compression algorithms."大语言模型本质就是压缩算法,有损压缩本身就是学习。但我们在模型发布那一刻就停止了压缩,换成外挂记忆。权重冻结,新经验进不去,学习停摆。

所以个性化智能的题眼就一句:让学习在部署之后重新启动。行业目前的解法,我梳理成五条路线,分别在输入侧、模型外围、参数和激活状态上做文章。

路线一,提示词和上下文工程,最古早的方案。把偏好、历史、背景全塞进Prompt,还发展出各种模板和“人设”写法,一度让人大呼“文科生的时代来了”。

后来专家又兴致勃勃地讲上下文工程如何领先于提示词工程,但哪怕通过Agent把知识库、搜索、代码执行全接进来,也只是把上下文窗口越塞越满。塞得再满,模型本身没变,多轮长对话立刻撞墙。一句话:模型没有进化,只是被喂得更饱。

路线二,RAG(Retrieval-Augmented Generation,检索增强生成)。从“全塞”变成“查了再塞”:历史对话、文档、偏好存进向量库或知识图谱,用时检索注入。token省了,相关性高了,是企业级应用的起步标配。但坦率来说,它是“查”不是“学”。语义检索在模糊指代、时序推理、跨session关联上经常掉链子;检索结果和模型内部知识打架时,它甚至会产生幻觉来“调和”两者。

更根本的是,你的表达习惯、思维偏好、决策风格,这类说不出口的隐性知识,很难写成一条记忆存进向量库。梁文锋的判断很准:RAG解决“需要时找回哪些材料”,不解决内化。

这两条路线的共同点:模型参数纹丝不动。你跟它聊一百次,它不会比第一次更懂你。a16z文章里有句话我很喜欢:"ICL is transient. Real learning requires compression."上下文学习是临时的,真正的学习需要压缩。

路线三,记忆系统,方向是“记得更有结构”。给记忆加时间线、重要性、置信度、来源、冷热分级,让模型管理自己的记忆,而不是无差别地塞。

这条线上有几家有意思的公司:拿了华为哈勃、荣耀战投的记忆张量MemOS,把记忆拆成明文记忆(用户偏好等外部知识)、激活记忆(KV Cache、隐藏状态等模型内部瞬时状态)、参数记忆(高频稳定的知识模式)三种形态统一调度;

前华为首席专家创立的MemoraX,用Agentic RL把记忆能力内化进模型,让AI在交互中主动判断什么值得记、旧记忆怎么更新;

丘脑智能从时空知识图谱起步,把“时间+空间”当作记忆的物理锚点,第三代E2P技术把偏好信息转成高维向量,直接注入token空间,绕过LLM头部计算。

路线四,参数级压缩,直接把新经验压进模型权重。后训练全参微调和端侧LoRA都是批量更新:攒一批数据训一次,模型聪明一次,训完权重继续冻结。LoRA的巧劲在于冻结原权重,只在Attention的Q/K/V/O投影旁挂低秩矩阵,训练时只动小矩阵,训完还能合并回去。

更激进的是NVIDIA GEAR联合斯坦福、UT Austin提出的RoboTTT,让模型在推理时实时吸收新经验:基础VLA参数定义为Slow Weights,部署后保持冻结;另设Fast Weights,每个时间步用一步梯度下降把当前经验压进一个固定大小的矩阵,边用边学,就像把一本日记反复浓缩成一句话。

在双臂装配任务里,它把机器人VLA的有效记忆窗口从不到0.1秒拉到267秒,平均完成分数提到79%。代价是Fast Weights依赖反向传播,端侧NPU目前不支持训练算子,低功耗边缘芯片上的实时性还有待验证。

路线五,激活空间干预,我觉得是当下最务实的一条。大模型前向传播时,每一层都会产生一个激活向量,可以理解为模型在这一层的“瞬时思考状态”。

这条路线不改权重,推理时在这个状态上加一个偏置,让模型的思考往你的偏好偏移。偏置向量本身就是用户偏好的极致压缩:不存对话,不存历史,只存“让输出往用户方向偏移的那个向量”。

好处很实在:零训练、即时生效,端侧NPU就能跑;安全可逆,不动权重,随时回退到base模型,没有灾难性遗忘,合规审计也说得清;数据不出端,原始对话留在本地,向量本身还能跨设备同步。再配上Fail-Closed安全门,偏移一旦越界就自动回退,金融监管这类强合规场景也过得去。

五条路线串起来看,是从输入侧的外挂一步步走向模型内部,最后指向同一个判断:个性化智能的终极形态,是模型参数本身持续演化,而不是靠外部记忆打补丁。往大里说,这就是递归自我改进(RSI)在个性化维度上的工程化。我们关心的不是AGI层面的自主代码生成或自我重写,而是更落地的版本:让AI在用户的设备上,持续地、安全地,变得更懂你。

而“你”的数据,最完整、最实时也最敏感的那部分,恰恰就在端侧。手机、PC、陪伴玩具、家庭机器人、智能汽车,端侧是个性化智能最自然、市场空间也最大的场景。但端侧不是把某条算法搬过去就行,考验的是全栈工程闭环。

首先是模型得塞进设备:几十B参数的模型要量化到INT4甚至更低精度,非均匀位宽、混合精度这些策略选不好,模型直接废掉。

塞进去还得跑得动:推理引擎要在NPU、GPU、CPU之间调度计算,稀疏激活、算子融合、内存动态卸载,每一步都在和硬件架构博弈。

跑起来之后,个性化算法又和量化深度耦合:偏置加在哪一层、加多大、怎么配合量化后的数值范围,都不是调个超参的事。

再往上,记忆和偏好要在手机、PC、汽车之间同步,数据不出域的前提下还要保证一致性,端云协同协议得设计好隐私边界的仲裁。

最后还要封装成开发者能用的SDK,跨设备协议打通,生态才转得起来。任何一环掉链子,用户感受到的就是卡、慢、效果忽好忽坏。

所以端侧个性化是个系统工程问题,不只是算法问题。

最后放个项目线索。端侧个性化智能领域的优质项目推荐:

端侧“自进化长记忆”模型,离线部署,持续学习,真正适配每个人的AI模型,自有资金完成验证,已在真机跑通。字节团队创业,业内极少数同时具备“大厂AI基础设施亿级规模部署经验×端侧持续学习算法原创能力×全栈工程落地能力”的团队。

核心方案为"激活空间干预",零训练计算、数据不出端、即时个性化。同时内置Fail-Closed安全门,满足金融监管等强监管框架的合规要求。具备从底层推理框架到上层算法协同设计的全栈工程闭环能力,覆盖了从推理引擎到芯片适配的多层优化。

海外相似技术路线团队NeoCognition于2026年4月获得4000万美元种子轮融资,英特尔CEO陈立武、Databricks联合创始人Ion Stoica以个人身份入局,Walden Catalyst与Cambium Capital联合领投,Vista Equity Partners跟投。证明该路线已获得顶级学术界和投资界的认可。

 

步日欣,创道硬科技创始人,北京邮电大学集成电路专委会副会长,浙商证券研究院专家,兼任多家投资机构投委。电子工程本科、计算机硕士学位,具有证券从业资格、基金从业资格,拥有IT研发、咨询、投融资十五年以上经验,关注投资领域为半导体、智能制造、新能源等。“硬科技新势力”平台覆盖5w+投资人和几千家科技型创业企业,并辅导几十家科技企业完成股权融资。

相关推荐

公众号科创之道主笔,标准的EE、CS专业理工男。从事研发、咨询、投资工作15年,主要关注领域为半导体、人工智能、物联网、云计算等,目前专注于风险投资和企业服务领域,平时喜欢把一些工作上的感悟随手记下来,希望通过自己的文字,融合IT产业和投融资行业知识,为跨行业沟通搭建一座桥梁。