「用户理解」共找到 2145 篇相关文章
多模态思维链如何重塑 AI 与短视频的未来
传统多模态模型在动态视频理解与复杂推理场景面临挑战,快手开源的 Keye-VL 模型在多模态思维链技术实现突破。文章解析其核心技术,分享在快手短视频社区的落地应用,还探讨了未来“Think with Video”的技术方向。
对谈 Skyris 张宇诺:AI 陪伴机器人会飞,理所应当 | 00 后创业者系列
这是对 00 后创业者张宇诺的访谈,他介绍了 Skyris 会飞陪伴机器人的设计灵感、特点及优势,还谈及创业经历、对陪伴的理解,以及产品研发难题、规划等,最后提到 GAIR 2025 大会将邀 00 后 AI 创业者分享。
刚刚,千问App把谷歌和OpenAI的「付费绝活」塞进了手机,还免费?
千问App迎来史诗级更新,接入阿里两大视觉模型Qwen - Image和Wan 2.5。Qwen - Image在图像编辑上有强大视觉逻辑理解和一致性保持能力;Wan 2.5能实现原生音画同步。千问App还实现一站式工作流。
5个大疆离职员工,把3D打印带回风口
3D打印再度火热,街头地摊产品畅销,社交平台热度高。拓竹科技由5位大疆离职员工创立,其产品X1成绩亮眼,MakerWorld平台以积分制度吸引用户。如今3D打印因性价比、新消费、低门槛等因素升温。
18岁天才少年,登上Nature封面!
DeepSeek-R1荣登Nature封面,成史上首个经严格同行评议大模型。18岁天才少年涂津豪以实习生身份参与,其从高中生到Nature作者的经历堪称传奇。他还改造Claude 3.5,开源项目获15k多星,还对AGI发表思考。
GLM4.5之后,智谱又开源GLM-4.5V,实测下来视觉推理能力贼强~
智谱继GLM-4.1V-9B-Thinking、GLM-4.5后,又开源最强多模态推理模型GLM-4.5V,在多模态理解榜单达开源SOTA。它视觉推理强,经测试能助力科研各阶段,还介绍了其架构设计与训练策略。
Manus 数月憋大招, 100 个 Agent 并发只为选双鞋?肖弘放话:第一阶段就得先做超贵的 AI!
中国人工智能初创公司 Manus 推出新功能“Wide Research”,可让用户借助多个 AI Agent 同时处理大规模任务。该功能不走“深度研究”路径,架构经优化,计算能力扩展 100 倍,但效果待察。Manus 撤出中国市场,欲借此求差异。
比RAG高出8.9%,百度TURA:让搜索引擎“动”起来的下一代AI Agent架构
现有检索增强生成(RAG)系统只能读取已索引的静态网页,无法满足用户需实时数据的问题。百度TURA用工具调用把RAG升级为动态交互,其核心分检索、规划、执行三步,已在百度亿级流量场景跑通。
在软件工程中,对 AI 的过度依赖,会加速工程师的无能
资深软件工程师Doug Slater指出,在软件工程中对大语言模型(LLM)过度依赖会加速工程师无能。LLM无法取代人类批判性思维,它在输出、输入、开发速度和用户技能等方面存在风险,且无法掌握程序理论和抵抗程序熵。
为什么Cline不对你的代码库进行索引(以及为什么这是好事)
用户常问Cline如何处理大型代码库,是否用RAG索引全部代码。Cline特意选择不对代码库进行索引,因为传统RAG方法用于代码库有逻辑切割、索引过时、安全风险等问题。Cline像开发者一样处理代码,有独特优势。