物理场景测试」共找到 3794 篇相关文章

算法论文8

AI终于学会「读懂人心」,带飞DeepSeek R1,OpenAI o3等模型

威斯康星大学麦迪逊分校联合清华大学的研究《MetaMind: Modeling Human Social Thoughts with Metacognitive Multi-Agent Systems》,将元认知理论融入LLM架构,让AI“读懂人心”。其框架分三阶段,还有动态社交记忆,在多基准测试表现出色。

机器之心
算法论文8

斯坦福新论文:微调已死,自主上下文当立

斯坦福大学等机构研究人员新论文指出,依靠上下文工程,无需调整权重,模型也能变聪明。他们提出智能体上下文工程ACE,不依赖模型重训,让上下文自主进化,在多场景测试中表现优于多种方法。

量子位
开源动态8

谷歌最新「0.27B」Gemma 3开源!身板小却猛如虎,开发者直呼救命稻草

大模型时代开发者算力焦虑严重,谷歌Gemma 3系列另辟蹊径。新成员Gemma 3 270M参数规模小但性能强,如在IFEval测试表现突出,有小体积强架构、省电等亮点,适用于多场景

新智元
开源动态8

刚刚,李飞飞世界模型开源了个渲染神器

今天凌晨,李飞飞空间智能独角兽公司 World Labs 官宣推出「Spark 2.0」,将 3DGS 世界带入 Web,原本专业设备才能运行的 3D 场景,现在任何人可在浏览器访问,该渲染器开源,能流式加载 1 亿 + 的 3DGS 数据。

机器之心
开源动态8

告别大模型“失忆”!人大开源MemSifter:轻量代理先思考再回忆,搞定长时记忆

中国人民大学团队提出全新LLM记忆管理框架MemSifter,打破长时记忆管理‘精度不够’和‘成本太高’的困局。它将记忆检索‘外包’给轻量级代理模型,采用任务结果导向的RL训练范式,在8个基准测试中超越现有SOTA方案。

深度学习自然语言处理
算法论文8

LoRA中到底有多少参数冗余?新研究:砍掉95%都能保持高性能

这篇创新研究介绍了LoRI技术,证明即使大幅减少LoRA的可训练参数,模型性能依然强劲。研究团队在多个任务上测试了LoRI,发现仅训练LoRA参数的5%,LoRI就能匹配或超越其他方法的性能。

机器之心
新闻资讯7

“现代 AI 九成突破都来自我们!”面对核心团队被挖,谷歌 DeepMind 掌门人的回应挺硬

谷歌股价下跌,核心团队被挖,引发对其大模型地位的担忧。但 DeepMind 创始人哈萨比斯回应有底气,谈技术观点,如靠文本模型难以实现 AGI,智能需理解物理世界,还提及水印、创意等问题。

AI科技大本营
开源动态8

代码、多模态检索全面登顶SOTA!智源BGE向量模型三连击,并全面开放

检索增强技术在代码及多模态场景作用大,向量模型是关键。智源研究院联合高校研发三款向量模型BGE - Code - v1、BGE - VL - v1.5、BGE - VL - Screenshot,登顶多领域测试基准,已全面开放助力研究与应用。

机器之心
8

谷歌搜不到的80%互联网,AnySearch全打通了!开发者连夜接入

2026年5月11日海外上线的AnySearch,定位AI时代「搜索基础设施」,专为AI Agent打造统一高质量搜索入口。上线一周在海外开发者圈爆火,经测试性能优于同类产品。通过不同场景实战,展现聚合广度、专业深度等四层能力。

新智元
开源动态8

Nano Banana不及格,开源模型一分难求!上海AI Lab新基准直击文生图模型痛点

上海人工智能实验室等联合发布首个多学科文生图考试基准GenExam,覆盖10学科、1000题。实验显示,GPT - 4o严格评分正确率仅12.1%,开源模型接近0分,暴露出模型在专业场景的短板。

量子位