测试时间扩展」共找到 2432 篇相关文章

开源动态8

AgentCPM-Explore开源,4B 参数突破端侧智能体模型性能壁垒

清华大学等联合研发的 AgentCPM-Explore 智能体模型,基于 4B 参数在深度探索类任务表现出色,有打破参数壁垒等亮点,还全流程开源,解决小模型性能提升挑战,邀伙伴共建端侧智能体生态。

AIGC开放社区
新闻资讯7

上海首场!一场专为女性设计的黑客松

上海将举办首场专为女性设计的黑客松「She Code Lab Hackathon」NO.C001,时间为2025年12月26 - 28日。活动约50 - 100人规模,由女性主导,核心是‘表达’与‘联结’,主题为‘利她技术’。

MANA新媒体艺术站
新闻资讯8

美国启动人工智能「创世纪计划」:打造AI版曼哈顿工程,270天就要见到效果

2025年11月24日,美国白宫发布行政令启动「创世纪计划」,对标「曼哈顿计划」。该计划将战略重心转向AI赋能的科学发现,盘活联邦数据与算力,构建平台,锁定六大领域,设定时间节点确保执行力。

AI寒武纪
开源动态8

罗福莉首个小米成果!开源具身大模型

正式入职小米不到10天,罗福莉作为核心作者的首篇论文出炉。MiMo团队提出并开源全球首个打通自驾与具身操作领域的跨具身基座模型MiMo - Embodied,在29个Benchmark上霸榜。

量子位
算法论文8

AI终于学会「读懂人心」,带飞DeepSeek R1,OpenAI o3等模型

威斯康星大学麦迪逊分校联合清华的研究《MetaMind: Modeling Human Social Thoughts with Metacognitive Multi-Agent Systems》,将元认知理论融入LLM架构,使模型在心智理论测试达人类平均水平,揭示构建社交智能AI方法论。

AINLPer
算法论文8

Meta通过简单算术解锁LLM SoTA性能

大型语言模型训练耗算力与时间,传统模型融合方法有局限。本文提出SoCE新方法,通过筛选专家模型、非均匀加权平均融合,在多评测中实现先进性能,为LLM优化提供新思路。

深度学习自然语言处理
开源动态8

上交×蚂蚁发布 DiagGym:以世界模型驱动交互式医学诊断智能体

上海交通大学与蚂蚁集团等团队提出新训练框架,构建面向医学诊断的世界模型DiagGym,训练诊断智能体DiagAgent,还设计评测基准DiagBench。实验显示该框架下的智能体表现优于先进模型,代码等已开源。

机器之心
新闻资讯8

黄仁勋、李飞飞、Yann LeCun等六位AI顶级大佬最新对话:AI到底有没有泡沫?

六位 AI 顶级大佬黄仁勋、约书亚·本吉奥等齐聚参加峰会对话,回顾 AI 发展历程,分享职业生涯“顿悟时刻”,探讨 AI 是否有泡沫、何时达人类智能水平等问题,各抒己见展现对 AI 未来的不同思考。

AI前线
产品应用8

360发布全球最强视觉语言对齐模型!榜单全面领先!

360发布FG - CLIP 2双语细粒度视觉语言对齐模型,几乎在所有数据集上全面领先。它能让AI在统一框架内看懂图像细节、理解中英双语,团队还提出新中文多模态评测基准。

AIGC开放社区
算法论文8

RAE的终极形态?北大&阿里提出UniLIP: 将CLIP拓展到重建、生成和编辑

北大和阿里团队提出 UniLIP,解决了统一多模态模型中语义理解与像素重建的矛盾。它创新微调 CLIP,实现图像重建,还提出双条件架构用于生成和编辑,在多基准取得 SOTA 性能。

机器之心