成果评估」共找到 1414 篇相关文章

产品应用8

超10万亿Tokens的高质量数据集是怎么炼成的?专访中国电信天翼AI阮宜龙

中国电信天翼AI打造超10万亿Tokens高质量数据集,依托星辰MaaS平台构建“数据—模型—服务”闭环。其与研究院推进技术研发并落地产品,建“三全”星辰大模型体系,还在多行业展现应用价值。

量子位
开源动态8

AIME'25满分炸场!Qwen一波七连发,全家桶大更新

云栖大会上,通义团队成果丰硕。Qwen3-Max性能提升,数学评测满分,多测试成绩优异;Qwen3-VL、Qwen3-Omni等开源,各有亮点;Qwen3-Coder升级。吴泳铭称要发展超级人工智能。

量子位
新闻资讯7

和知乎一起,推出了个 AI 先行者榜单

知乎发起AI先行者榜单评选,与作者合作。提名公开透明,来自社区征集。评选从多维度评估,综合各方评分推出首期榜单。活动非一次性,后续每季度都有,鼓励更多人参与。

特工宇宙
开源动态8

马斯克转发字节Seed&哥大商学院新基准:大模型搞金融,连查个股价都能出错

字节跳动Seed团队与哥大商学院推出开源金融搜索与推理基准测试FinSearchComp,含635个问题。评测显示大模型处理金融任务有差距,凸显金融AI能力评估重要性,还揭示了关键能力差距。

量子位
产品应用7

MultiAgent架构实践:如何打造GitHub Stars 2.8k的ComfyUI-Copilot V2.0

ComfyUI是Stable Diffusion生态中可视化编程工具,但使用有难度。ComfyUI - Copilot V2.0基于多智能体协作框架构建,能实现对话开发、报错修复等功能,还介绍了其架构、技术栈及多智能体设计思路等。

开源星探
产品应用8

制造企业如何实现 AI 产品经理“能力复制”?|极客时间 AI 人才培养实践

在数智化转型中,企业开展AI培训却难转化业务价值。极客时间与制造企业合作,用“线上+线下+实战”的OMO训练营,实现AI产品经理“能力复制”,成果获认可,模式可复制。

InfoQ
算法论文8

AlphaGo作者领衔,8个机械臂协同干活0碰撞,DeepMind新作登Science子刊

DeepMind等机构成果RoboBallet登Science子刊。它将图神经网络用于强化学习,可控制8个机械臂协同无碰撞工作。核心是结合图神经网络与强化学习,解决多机器人协作复杂问题,实验表现出色。

量子位
新闻资讯8

新天终启,万象智生!从AlphaGo到GPT-5,新智元十年见证ASI创世纪

2025年9月7日新智元举办十周年峰会,主题为「新天终启,万象智生」,汇聚多位重量级嘉宾探讨AI前沿突破。当下AI发展迅猛,大模型密集发布,如OpenAI的GPT - 5、谷歌的Gemini 2.5等,中国造大模型也在开源领域领先。

新智元
开源动态8

字节开源图像生成“六边形战士”,一个模型搞定人物/主体/风格保持

字节UXO团队设计并开源统一框架USO,解决图像生成多指标一致性问题。它能统一看似孤立任务,实现单任务和组合任务的SOTA,弥补了主体保持和风格迁移短板,性能领先,还采用新范式及算法。

量子位
开源动态8

MetaGPT 用户智能体发布,开启端到端自主软件测试新范式!

当前AI软件领域代码生成智能化发展快,但测试验收仍靠手动,效率低。MetaGPT推出用户智能体,研究团队发布RealDevWorld框架和AppEvalPilot实现端到端自动化评测,解决复杂软件质量评估难题。

特工宇宙