「实时信息」共找到 989 篇相关文章
多模态大模型中Attention机制暗藏「骗局」,需用一个公式修正丨上大×南开
上海大学曾丹团队研究发现,主流VLM中attention受位置偏置和padding区域异常高attention影响,直接用其进行视觉token剪枝会丢失关键信息。团队用公式对attention去偏,集成到多种剪枝方法,提升了模型性能。
挖掘注意力中的运动线索:无需训练,解锁4D场景重建能力
香港科技大学(广州)与地平线团队提出VGGT4D,通过分析VGGT内部机制,利用注意力层运动线索,提出无需训练框架,在动态物体分割等任务表现优异,为低成本4D重建提供新思路。
给Agent装上“海马体”!上海AILab开源MemVerse,定义多模态记忆新范式
上海人工智能实验室开源MemVerse,这是首个面向智能体的通用多模态记忆框架。它将多模态信息与文本对齐到统一语义空间,首创‘双通路’架构与‘记忆蒸馏’技术,让智能体有终身记忆能力,在多模态任务中表现出色。
当 Kafka 架构显露“疲态”:共享存储领域正迎来创新变革
沃尔玛开发者 Ankur Ranjan 与 Sai Vineel Thamishetty 长期关注 Apache Kafka 与流处理系统。文章指出 Kafka 架构现局限,介绍下一代开源项目 AutoMQ 借助云原生设计,解决其成本、扩展性与运维痛点,为实时数据流架构提供新视角。
本周推荐的5个超级6的Github开源项目!
文章推荐了5个Github开源项目。如htmx,能在纯HTML搞定多种交互,无需JS;Flow.Launcher可快速搜索文件、启动应用;Maple Mono是编程字体,中英2:1对齐;Trilium Notes是分层笔记神器;Hyprnote可实时转录会议内容。
字节Seed提出M3-Agent:像我们一样"记住"与"思考"的长视频理解新范式
字节Seed提出M3 - Agent,这是首个融合实时视听输入、类人记忆构建与自主推理的多模态智能体。它模仿人类记忆机制,解决长视频理解痛点,已被CVPR 2025收录并开源代码,为通用人工智能奠定基础。
扩散模型+自进化:这篇论文让Deep Researcher错误率直降70%
论文提出测试时扩散深度研究代理(TTD-DR),将报告生成建模为扩散过程,有组件自进化机制和动态闭环设计。实验显示其在多领域研究任务超现有方案,为AI研究助手落地提供新范式。
是的,LeCun要向28岁的Alexandr Wang汇报!这是Meta新AI团队的一些独家内部消息
Meta强势挖人组建新AI研究部门MSL,引发诸多关注与猜测。Meta员工出面澄清一些说法,还透露人员调动信息,如Yann LeCun向Alexandr Wang汇报。此外,Meta内部面临动荡,有员工抱怨改革侵蚀公司文化,阻碍AI发展。
两张图就能重构3D空间?清华&NTU利用生成模型解锁空间智能新范式
ICCV 2025中稿的LangScene-X以全新生成式框架,仅用稀疏视图就能构建可泛化的3D语言嵌入场景。它攻克传统方法痛点,将多模态信息统一在单一模型,为空间智能领域打开新大门。
老罗数字人爆火背后,百度做对了什么?
6月15日,罗永浩数字人在百度电商直播超6小时,吸引超1300万人次观看,带货破5500万元。它动作、语调等生动,能与弹幕互动。百度基于文心4.5T,从形、音、神让数字人“神形音容”一致,还实现行业首次多数字人同场及头部主播数字人整场带货。