「在线时空理解」共找到 960 篇相关文章
作为软件架构师使用 AI 的经验
Avraham Poupko 在 OOP 大会分享软件架构师用 AI 经验,认为软件架构师不会被 AI 取代,AI 适合探索权衡、提炼语言,但缺乏情境推理和情感智能,人类在这方面更有优势。
智元首发SOP系统:打破离线训练瓶颈,让具身智能在“干中学”
2025年VLA让机器人有通用性,但真实部署存问题。智元机器人具身研究中心提出SOP在线后训练系统,融合在线学习等,使机器人在真实环境持续进化,实验显示其能提升性能、效率,突破VLA瓶颈。
普林斯顿大学等Nature揭秘:人类大脑与大语言模型共享同一套语言处理时钟
普林斯顿大学等机构研究发现,大语言模型层级计算序列精确映射人类大脑处理语言的毫秒级时间动态,其与人类大脑理解语言的先后顺序高度一致,为理解大脑和开发神经网络架构开辟途径。
AI真的能读懂人心吗?阿里通义最新研究成果揭示答案
文章聚焦多模态推理问题,如全局上下文理解不足和推理捷径问题。介绍阿里通义HumanOmniV2改进方案,涵盖全局上下文理解等方面,还详述冷启动、两阶段强化学习训练方案及数据集下载和训练方法。
全新开源视频换装框架MagicTryOn
现有视频虚拟试穿(VVT)方法在时空一致性和服装内容保留方面有挑战,浙大提出全新开源视频换装框架MagicTryOn,利用全自注意力机制统一时空建模,设计服装保留策略,还引入掩码感知损失。
复旦等推出「第一人称视听基准」,补齐多模态模型「听觉拼图」
多模态大模型在真实世界会“失聪”,现有第一人称视频问答/理解基准长期偏“视觉中心”。复旦等团队推出首个系统评测第一人称声音理解能力的基准EgoSound,能让模型听懂世界,评测显示当前模型与人类差距大。
一位工程师对“好代码”的 7 年思考
本文围绕“什么是好代码”展开,作者结合自身职业发展,从初入职场的“黑盒认知”到深入思考多维度评价标准。还介绍代码评审标准,从稳定、体验、效率、成本衡量。最后给出写好代码的方法和面临的挑战。
LeCun有了新证据!大模型思考与人类思考存在本质差别
Yann LeCun参与的研究用信息论揭示大语言模型与人类在‘理解世界’上的本质差异。研究引入新量化框架,分析主流大模型,发现AI与人类在‘理解’上有三大核心差异,对当前AI发展趋势提出挑战。
独家!哈工大斩获AI顶会ACL评审阶段最高分,让AI领略汉字之美
哈工大论文获AI顶会ACL 2025评审阶段已知最高分。团队用传感器捕捉手部书写实现汉字输入识别,独创中文字形编码让AI理解汉字形态,革新中文人机交互,推动汉字文化传承,为AI理解汉字开辟新路。
前端同事看走眼了,这个“游戏网页”其实全是AI写的!
Kimi K2.5上新,集视觉理解、代码生成等能力于一体,提供四种使用模式,其中Agent集群模式提效显著。实测显示其网页生成、动效理解能力出色,下一代K3模型或用新架构KDA降低计算成本。