零转全驱」共找到 2233 篇相关文章

算法论文8

迈向原生模态AI智能体:人大&小红书发布OmniGAIA新基准

中国人民大学等团队推出 OmniGAIA 新基准及 OmniAtlas 训练框架。OmniGAIA 含 360 个高难度任务,覆盖多领域。实验显示闭源与开源模型差距大,OmniAtlas 显著提升开源模型表现,并指出未来模态智能体发展方向。

PaperAgent
开源动态8

从VLA到RoboOmni,模态具身新范式让机器人察言观色、听懂话外音

复旦大学等联合推出模态端到端操作大模型RoboOmni,统一多模态,实现动作与语音协同控制。它重新定义机器人交互范式,让机器人具备“察言观色”能力,还构建了OmniAction数据集,实验表现面领先。

机器之心
新闻资讯7

5位华人联创走,创始12人只剩3人,马斯克xAI梦碎?

xAI的五位华人联创部离开,其创始人正经历离职潮。公司并入SpaceX 、剑指万亿估值IPO ,资本压力下或致人员变动,马斯克将换人重建,效果未知。

新智元
新闻资讯7

Stability AI前CEO惊人预测:人类智力价值归,只剩1000天!

Stability AI前CEO Emad Mostaque在节目中称,未来1000天AI将重塑经济结构,人类劳动价值或归甚至为负。他提出「MIND框架」衡量经济,指出当前处于智能反阶段,还探讨应对之策。

新智元
开源动态8

真实评估!北理发布球首个「场景教育」基准,支持4000+情境

北京理工大学高扬老师团队推出EduBench,是球首个「场景教育」基准,涵盖9大教育场景、12个评估维度、超4000个情境。团队将数据、模型等面开源,评估发现大模型在特殊教育场景有不足,还提出多源知识蒸馏等方法。

新智元
算法论文8

0%完成率!Claude、GPT、Gemini 灭,SWE-Bench作者新作把AI圈干沉默了

SWE - Bench创建者推出新benchmark ProgramBench,测试AI从构建软件系统能力。结果一线模型完成率0%,暴露AI擅长局部代码生成,缺局系统规划能力,引发对其评估方式的讨论。

机器之心
新闻资讯7

Stripe 的停机数据移平台以毫秒级流量切换迁移 PB 级数据

在旧金山 QCon 会议上,Stripe 工程师介绍停机数据移平台,能 PB 级数据库迁移,流量切换毫秒内完成,支持每秒 500 万次查询和 99.9995% 可靠性。还讲了迁移六阶段及多用途。

InfoQ
新闻资讯7

刷榜AI挂了!Meta斯坦福地狱级测试,GPT/Claude/Gemini交出0分

Meta联合斯坦福、哈佛推出ProgramBench测试,200个项目从手写,9大顶级模型完整通过率0%。该测试与SWE - Bench不同,考AI自主设计软件能力,还发现模型代码风格异于人类,联网时部分模型作弊。

新智元
产品应用7

从需求到设计到代码,一个软件搞定!TRAE Work Design实测来了

TRAE Work上新Design模式,与Work、Code模式配合,实现需求、设计、代码链路在一个平台跑通。它能识别提取设计系统,提供多种改图方式,且出图合规、改图顺手,还简化了工作流。

量子位
开源动态8

最新W4A4KV4量化框架,单卡A100大模型推理速度飙升

计算所王颖研究员团队等联合在ASPLOS 2025上发表并开源COMET框架,通过系统 - 算法协同优化,实现4比特推理性能突破,在多方面有技术亮点,实测性能碾压现有方案且已开源。

AIGC开放社区