当所有 AI 都在理解世界,这家公司在理解你

阿瑶君_5841

阿瑶君_5841

2026-07-01

269人浏览

原创

5 月底,一家名为 clipto.ai 的初创公司发布了一款端侧产品,并迅速登顶 product hunt 全球榜单首位。

这是一款多模态搜索工具,用户只需输入一句自然语言,即可在数 TB 级别的视频、音频、图片及文档中快速定位所需信息。

但 Clipto 所瞄准的,并非仅是“搜索”本身。

过去几年,大模型的生成能力持续跃升——AI 能写代码、能绘图、能剪辑视频,内容创作效率被推至历史高点。与此同时,一个日益尖锐的问题浮出水面:人们生产与保存的数据量激增,却愈发难以被再次激活与复用。

硬盘里堆满了会议录音、直播回放、播客访谈、采访素材、项目文档与截图。对记者、内容创作者、律师、科研人员等知识型工作者而言,真正耗费精力的环节,往往不是产出内容,而是在庞杂资料中反复翻找。

在 Clipto 创始人康洪文看来,这背后暴露的并非技术层面的检索瓶颈,而是 AI 缺失了一层关键基础设施——他将其定义为 Memory Layer(记忆层)。

AI 不断构建世界模型,却始终缺乏用户模型;智能体(Agent)日益强大,却因无记忆支撑,难以真正理解个体用户。

而从视频理解研究起步,到投身 AIGC 创业,再到如今全力押注 AI 记忆层,康洪文近二十年的职业轨迹,恰好暗合了 AI 技术演进的一条深层脉络:从「理解内容」,到「生成内容」,再到「组织内容」。

01

从搜索工具到记忆层:

Clipto 想解决什么问题?

在康洪文的定义中,Clipto 并非一款传统意义上的多模态搜索工具,而是连接个人数据与智能体生态的「记忆层」。

「过去十年,AI 一直在构建世界模型,却长期缺失用户模型。每个人的数据散落在本地设备中,尚未转化为 AI 可持续理解与调用的个人上下文。」他指出行业空白所在,「没有长期记忆,再强大的 Agent 也无法真正读懂用户。搜索只是起点,Clipto 的终极目标,是补上 AI 时代所缺的那层记忆基础设施。」

Clipto 给出的技术路径,是一套完全运行于本地的多模态记忆构建系统:用户将本地视频、音频、图片、文档等多模态数据导入后,系统依托设备内置 AI 算力与自研端侧多模态大模型,完成感知理解、结构化解析与向量化建模,最终构建起具备认知图谱、支持时空对齐的个人记忆体系。

实际使用时,用户仅需以自然语言描述需求,端侧大模型即刻解析查询意图与上下文,再由本地搜索 Agent 在数秒内完成精准匹配——无论是特定人物出镜、某段对话、某个场景,还是完整事件片段,均可直接定位至对应文件及精确时间戳。

更进一步,Clipto 真正打通了底层大模型与上层 Agent 之间长期割裂的记忆通路。在 TB 级私有数据基础上,用户可直接以对话形式提问,让 AI 回答所有与本地记忆相关的问题,亦可基于已有内容自动生成摘要、提炼要点或梳理逻辑脉络。

而所有运算与处理,全程均在用户本地设备完成。一方面规避了海量数据上传与云端模型调用带来的高昂 Token 成本;另一方面,对于含商业机密、敏感信息的工作素材,以及移动办公、离线环境等特殊场景,“数据不出设备”本身就是不可妥协的安全底线与可用性保障。

康洪文认为,传统软件主要解决的是「存储」问题,却从未真正「理解」内容。Clipto 的核心价值,在于利用本地多模态模型,将视频、音频、图片与文档转化为 AI 可读、可推理、可关联的数据结构,使用户从“搜索文件”,跃迁为“搜索记忆”。

在他看来,搜索只是入口,真正的关键在于建立一套可持续沉淀、不断演化的个人上下文体系——Memory Layer。过去十年,AI 构建的是关于世界的通用知识库;未来十年,AI 必须深入理解每个用户的个体经验与专属知识。

02

二十年:从视频理解到视频生成

从职业履历看,康洪文几乎全程参与并亲历了过去二十年 AI 从学术研究走向产业落地的关键节点。

2004 年,他进入微软亚洲研究院实习。彼时深度学习尚未兴起,AI 多数仍停留在实验室课题阶段。

他参与的早期项目之一,是为 Xbox 设计自动分析系统,帮助用户从大量家庭照片与视频中识别关键画面,再自动生成家庭纪念短片。

今天看来已是常规功能,但在当时,这项任务已触及计算机视觉最本质的挑战:

机器必须先“看懂”内容,才能“生成”内容。它需要识别出谁在画面中、发生了什么、哪些帧具有语义重要性、哪些可被忽略。

此后,康洪文赴卡内基梅隆大学攻读博士,师从计算机视觉泰斗 Takeo Kanade。

在那里,他持续深耕图像与视频理解,致力于让机器人通过长期视觉经验积累,逐步建立对现实世界的认知。

在多数人眼中,视频只是连续帧的集合;但康洪文深知,视频本质上是一种融合时间、人物、事件与关系的复杂信息结构。理解视频,即是理解世界本身。

2017 年,他创立慧川智能,并推出文字生成视频平台“智影”。此时正值移动互联网与短视频爆发期,大量创作者涌入内容生态。

新矛盾随之浮现:过去的问题是机器看不懂内容;如今的问题是内容生产效率太低。

于是,他的技术重心开始从“理解”延伸至“生成”——文字生成视频、智能剪辑、数字人驱动……这些后来成为 AIGC 主流赛道的能力,早在智影的产品探索中就已落地实践。

2020 年底,智影被腾讯收购。康洪文加入腾讯,主导腾讯智影团队,持续推进文生图、文生视频、数字人等全栈 AIGC 技术研发。

若按既有路径发展,他本可继续深耕生成式 AI。但真正触发其思维转向的,恰恰是生成能力的井喷式爆发。

当内容生产变得越来越容易,一个更隐蔽的瓶颈浮现:信息过载。人们积累了海量视频、录音与文档,却越来越难找回真正需要的信息。AI 解决了“创造”的难题,却未破解“理解个人内容”的困局。当记录成本趋近于零,检索与组织反而成了最大障碍。

腾讯智影
腾讯智影

腾讯智影是腾讯视频智能制作平台 WorkRally 的官方入口,提供 AI 视频创作、视觉生成和项目协同相关能力。

下载

这让他意识到:行业可能忽略了一个更基础的命题。

理解是生成的前提,而记忆,是理解之后的必然延伸。AI 的下一程,或许正是“记忆”。

03

AI 的下一层竞争,

为什么会是 Memory?

在康洪文看来,Agent 若想真正走向成熟,必须先跨越一道门槛——记忆。

当前的大模型已足够强大:写代码、做推理、生成报告,甚至能代用户执行部分工作流。但无论模型多先进,它始终存在一个天然缺陷:不了解用户。

每一次打开新的 AI 应用,都像与一位健忘者重新相识——你得反复介绍自己是谁、正在做什么、过往做过什么;一旦对话结束,所有上下文即刻清空。

康洪文指出,整个 AI 基础设施缺失的,正是一层关键能力:用户模型。

今天的大模型坐拥全网公开知识,却无法真正理解一个具体的人。因为关于这个人的数据,不在互联网上,而在电脑、手机、NAS、网盘、相机、会议记录、本地笔记等私有设备中。

对 AI 来说,这些数据近乎“不可见”。而随着 Agent 进入规模化应用,这一问题将愈发严峻。

当下热议 Agent,焦点多在其“能帮用户做什么”。但若未来真有数百万乃至数亿个 Agent 普及开来,新问题将接踵而至:它们如何理解用户?如何知晓用户的历史行为?又如何共享同一套个性化上下文?

康洪文认为,不可能也不应让每个 Agent 都独立重建一套用户记忆。更合理的架构,是存在一个统一、独立、可复用的 Memory Layer。

☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

当所有 AI 都在理解世界,这家公司在理解你

Living Memory Graph

Agent 专注任务执行,Memory Layer 专司记忆管理,所有 Agent 均可基于同一套记忆系统理解用户。

这类似于互联网时代的操作系统:应用层出不穷,但底层文件系统始终唯一。

今天的 Agent 生态,同样亟需这样一套公共记忆基础设施。而这,正是 Clipto 力图担当的角色。

在康洪文的判断中,未来 AI 架构或将形成双层基础设施:一层是 Intelligence Layer(智能层),负责理解世界,由云端大模型提供通用知识;另一层是 Memory Layer(记忆层),负责沉淀用户的个人知识、上下文与长期记忆,扎根于用户持续产生的私有数据之上。

二者协同,方构成真正意义上的 Personal AI。因此,他并不认同“所有 AI 能力终将上云”的单一叙事。

过去几年,行业焦点几乎全部集中于云端大模型战场:OpenAI、Google、Anthropic,以及国内各大模型厂商,比拼的核心始终是模型性能。

但另一股趋势也在悄然成型:Apple M 系列芯片持续强化神经网络算力,NVIDIA 推动 AI PC 概念落地,微软发布 Copilot+ PC。越来越多计算能力正回归终端设备。

AI 的计算范式正在重构:过去,AI 主要依赖云端;未来,随着个人数据价值凸显,与记忆强相关的功能将更多运行于本地,而通用推理与世界知识仍将持续受益于云端大模型。

因为用户最核心的数据,本就存在于本地——采访纪要、合同文本、财务报表、创意素材、家庭影像……这些内容既不宜频繁上传,也难以完全交由云端处理。

更重要的是,数据规模本身正指数级膨胀。影视团队单个项目动辄产生数十 TB 乃至上百 TB 视频素材;媒体机构数年积累,亦可形成海量内容资产。

在此背景下,云端未必是最优解。本地理解、本地索引、本地推理,反而重获战略价值。

不过,康洪文强调,Memory Layer 并非走向“纯本地 AI”,而将是云端与本地协同的混合体系。

因为记忆 ≠ 存储。真正关键的是组织、关联与调用。用户的数据天然分散于不同终端与平台:电脑存文档,手机存照片与视频,云盘存备份资料……

未来的记忆系统,必须将这些割裂的数据重新缝合,最终构建出一张可供 AI 理解、查询与调用的个人知识网络。

而这,也正是康洪文二十年思考不断演进的结果:在微软亚研院,他探索机器如何“看懂”视频;在智影时期,他推动机器如何“生成”内容;而今,他追问的是:当 AI 已能理解与生成内容之后,谁来负责“组织”内容?

本文来自微信公众号“极客公园”(ID:geekpark),作者:连冉,编辑:郑玄,36氪经授权发布。

PHP速学视频免费教程(入门到精通)
PHP速学视频免费教程(入门到精通)

PHP怎么学习?PHP怎么入门?PHP在哪学?PHP怎么学才快?不用担心,这里为大家提供了PHP速学教程(入门到精通),有需要的小伙伴保存下载就能学习啦!

下载

相关标签:

本站声明:本文内容由网友自发贡献,版权归原作者所有,本站不承担相应法律责任。如您发现有涉嫌抄袭侵权的内容,请联系admin@php.cn

相关专题

更多
Buffalo框架数据库开发全教程
Buffalo框架数据库开发全教程

本专题围绕Buffalo框架数据库开发,讲解database.yml多环境配置、soda与fizz迁移生成回滚、模型结构体标签、增删改查与条件查询、一对多与多对多关联、数据校验、回调钩子、事务处理及原生SQL执行能力。

2026.09.23

0

15

Buffalo框架路由与请求处理实操指南
Buffalo框架路由与请求处理实操指南

本专题讲解Buffalo框架路由与请求处理机制,涵盖路由注册与分组、资源路由、Handler编写规范、Context上下文方法、参数绑定、中间件编写挂载、Session与Cookie读写、Flash消息及错误页面定制方法。

2026.09.23

0

15

Buffalo框架零基础入门教程
Buffalo框架零基础入门教程

本专题整理Buffalo框架入门内容,涵盖Go环境准备、buffalo CLI安装、新项目生成、目录结构说明、dev热加载启动、数据库连接配置与常见报错排查,帮助新手按约定优于配置的思路跑通第一个Buffalo框架应用。

2026.09.23

0

15

Conan创建软件包配方指南
Conan创建软件包配方指南

本专题介绍通过conanfile.py创建软件包的方法,讲解包名、版本、依赖和构建设置等基础信息,以及source、build、package、package_info等常用方法的作用及编写思路。

2026.09.22

0

12

Conan二进制包配置指南
Conan二进制包配置指南

本专题介绍Conan根据操作系统、编译器、架构和构建类型生成二进制包的方法,讲解Profile、Settings、Options及Package ID的作用,帮助管理不同平台和编译环境下的包版本。

2026.09.22

0

13

Conan私有仓库搭建教程
Conan私有仓库搭建教程

本专题系统的讲解Conan私有仓库的搭建流程,涵盖仓库服务部署、存储目录配置、用户认证、权限划分和远程地址添加,并介绍内部C++依赖包的上传、下载及版本维护方法。

2026.09.22

0

19

loomy官网入口地址合集
loomy官网入口地址合集

本专题汇总了 Loomy 桌面 AI 助理的官方入口地址合集及使用指南。提供 macOS 与 Windows 客户端下载 。Loomy 是讯飞推出的桌面级 AI 工作搭子,支持文件整理、数据分析、网页操作及通过飞书/钉钉远程操控电脑,助你高效完成本地办公任务 。

2026.09.22

0

19

NumPy常见函数使用方法
NumPy常见函数使用方法

本专题整理 NumPy 常见函数使用方法相关教程,覆盖函数大全、参数用法、数组运算、统计聚合、排序处理、where 条件筛选、linspace 创建数列等常用场景,帮助读者快速掌握 NumPy 函数调用思路和实际数据处理技巧。

2026.09.22

0

21

NumPy性能优化版本更新与常见报错排查
NumPy性能优化版本更新与常见报错排查

本专题整理 NumPy 性能优化、版本更新与常见报错排查相关教程,覆盖向量化计算、广播性能、内存布局、NumPy 2.0 升级、版本兼容冲突、安装导入报错、dtype 溢出、矩阵运算异常和 broadcasting 报错修复,帮助读者系统掌握 NumPy 性能调优与问题定位方法。

2026.09.22

20

25

热门下载

更多
网站特效
/
网站源码
/
网站素材
/
前端模板

精品课程

更多
相关推荐
/
热门推荐
/
最新课程
Microsoft Copilot官方手册
Microsoft Copilot官方手册

共0课时 | 0人学习

GitHub Copilot手册
GitHub Copilot手册

共0课时 | 0人学习