测试时路由框架」共找到 3174 篇相关文章

算法论文8

挑战ReAct!MetaGPT团队提出ReCode智能体新范式

DeepWisdom研究员指出当前主流智能体框架受固定决策粒度束缚,提出ReCode新范式。它统一规划与执行,能在不同粒度间自由切换,实验显示其性能、成本和训练效率均有提升,引发广泛关注。

机器之心
开源动态8

小米陈龙团队首作:统一具身与自动驾驶的开源模型

小米具身智能团队发布首篇论文,提出统一具身智能与自动驾驶的新模型MiMo-Embodied。该模型在多任务中领先,其四阶段训练框架打通两领域边界,为行业提供新范式。

AI科技评论
开源动态8

最强开源0.9B级OCR模型!本地Agent、知识库都有救了!

百度飞桨PaddleOCR团队开源多模态文档解析模型PaddleOCR-VL,参数量仅0.9B,对算力要求低。它在OmniDocBench V1.5榜单屠榜,经测试,能精准识别发票、图表等,适合本地环境与资源受限设备。

开源星探
算法论文8

NTU等联合提出A-MemGuard:为AI记忆上锁,投毒攻击成功率暴降95%

在AI智能体依赖记忆系统的当下,记忆投毒攻击兴起。A-MemGuard作为首个为LLM Agent记忆模块设计的防御框架,通过共识验证和双重记忆结构,解决防御难题,使投毒攻击成功率暴降超95%。

新智元
开源动态8

国产大模型新SOTA:蚂蚁万亿级旗舰模型赶超GPT-5

蚂蚁集团开源万亿参数旗舰大模型Ling-1T,属Ling 2.0家族。它激活比例低降低运算成本,训练有“Ling缩放定律”等方法,多项测试超主流模型,不过处理超长上下文成本较高。

AIGC开放社区
开源动态8

马斯克转发字节Seed&哥大商学院新基准:大模型搞金融,连查个股价都能出错

字节跳动Seed团队与哥大商学院推出开源金融搜索与推理基准测试FinSearchComp,含635个问题。评测显示大模型处理金融任务有差距,凸显金融AI能力评估重要性,还揭示了关键能力差距。

量子位
新闻资讯7

马斯克周末血裁xAI 500人

上周四晚,xAI内部突袭测试,淘汰率达33%,超500人被裁。此前其数据标注团队规模持续增长,多为直聘。此次战略转变,将扩专业标注员规模,或押注垂直行业AI。

量子位
新闻资讯7

GPT-5 之后,我们离 AGI 更近了,还是更远了?

2025年8月8日OpenAI发布GPT-5,架构有革新,在基准测试成绩优异,但跑分现场PPT出错、被Grok 4击败。它在编程表现出色、价格有竞争力,写作能力有争议,模型幻觉和提示注入攻击问题待解。

AI科技大本营
算法论文8

“掩码即武器”,四款扩散LLM全部破防 ? 上交&上海AI Lab发现dllm致命安全缺陷

上海交通大学、上海人工智能实验室等团队研究指出,扩散语言模型(dLLMs)有根本性架构安全缺陷。他们提出DIJA攻击框架,能让多个dLLMs大概率生成有害内容,还呼吁从多方面加强dLLM安全。

深度学习自然语言处理
算法论文8

强化学习的两个「大坑」,终于被两篇ICLR论文给解决了

现有强化学习算法基于理想化交互模式,难应对真实环境。Mila 实验室两篇 ICLR 2025 论文提出实时强化学习框架,分别解决推理延迟和动作缺失问题,还可结合使用,对关键领域意义重大。

机器之心