「屏幕图灵测试」共找到 1775 篇相关文章
ICML 2025 | 西湖大学吴泰霖研究员团队:组合生成式多物理场多元件PDE仿真
西湖大学吴泰霖课题组联合多方提出“组合生成式多物理场多元件PDE仿真(M2PDE)”,将仿真问题视为生成式概率建模任务。该成果在多任务测试中表现卓越,被ICML 2025接收。
不吹不黑,在Agent任务上,kimi 2.6确实让我忘了Claude。
Kimi K2.6发布并开源,代码和Agent能力提升。作者测试发现,它在部署Claude Code源码、网站生成、多智能体任务等方面表现出色,审美提升,思维活跃,还能复刻文档风格,开源释放了前沿编程能力。
RAG搜对了却答错?德国萨尔大学找到了真相丨ACL'26
RAG是大模型落地标配技术,但存在搜到文档却答错的痛点。德国萨尔大学等团队提出Disco - RAG框架,在‘搜’和‘答’间加入‘读懂’环节,已被ACL 2026主会录用,在多基准测试表现优异。
五百行代码打造SOTA视觉智能体!UniPat AI最新开源
多模态大模型代码能力强,但基础视觉任务常失误。UniPat AI推出极简视觉智能体框架SWE-Vision,让模型用代码弥补视觉短板,在五个主流视觉基准测试达最优。该框架设计独特,开源代码和数据已发布。
告别大模型“失忆”!人大开源MemSifter:轻量代理先思考再回忆,搞定长时记忆
中国人民大学团队提出全新LLM记忆管理框架MemSifter,打破长时记忆管理‘精度不够’和‘成本太高’的困局。它将记忆检索‘外包’给轻量级代理模型,采用任务结果导向的RL训练范式,在8个基准测试中超越现有SOTA方案。
长生不老成真?哈佛AI数周破解「衰老密码」,人类寿命或迎重写
哈佛团队借助AI系统K-Dense揭示衰老分阶段运行的秘密。K-Dense采用层级多代理架构,能完整跑通研究流程,在BixBench测试中超越GPT - 5。它还让哈佛团队几周完成原本数年的研究,成果待同行评审。
Rex-Omni:用 3B 模型颠覆目标检测
长期目标检测依赖传统坐标回归模型,MLLMs方法存在不足。IDEA研究院提出30亿参数的Rex - Omni多模态大模型,在零样本测试中表现超现有回归模型,还具备丰富语言理解能力,有独特设计和训练流程。
POF | 西交大陈泽伟、陈刚等:面向可变形域非周期非定常流动的几何自适应时空深度学习框架
西交大陈泽伟、陈刚等人提出ViT - STFlowNet框架,用于可变形域非周期非定常流动预测。该框架融合自适应网格变换与ViT架构,克服传统方法局限,测试显示预测精度高、泛化能力好,为飞行器流场感知控制提供工具。
GPT-5几个预测:用户翻倍,编程登顶,屠杀一众模型
OpenAI发布GPT-5,登顶大模型测评榜单。它有统一智能架构,在多测试取得突破,编程能力强击败对手。还改进意图,减少幻觉、增加情感、在健康领域更实用,价格便宜。作者预测其将带来用户翻倍等影响。
LoRA中到底有多少参数冗余?新研究:砍掉95%都能保持高性能
这篇创新研究介绍了LoRI技术,证明即使大幅减少LoRA的可训练参数,模型性能依然强劲。研究团队在多个任务上测试了LoRI,发现仅训练LoRA参数的5%,LoRI就能匹配或超越其他方法的性能。