协作评估」共找到 1193 篇相关文章

算法论文8

AI编程真面目:完整项目通过率仅27% | 上交大新基准

多校联合团队发布ProjDevBench,评估AI编程智能体端到端项目开发能力。结果显示,六种主流智能体总体提交AC率仅27.38%,从零构建任务中性能大幅下滑,还揭示了智能体多方面短板。

量子位
开源动态8

50个Agent分工干活,Kimi K2.5的Agent“军团”把我看呆了。。。

Kimi K2.5今日下午发布并开源,具备多模态能力。它能根据视频、链接等复刻网站,有Visual Edit功能且自动部署上线。还有Agent Swarm场景,多Agent协作解决复杂问题,应用体验佳。

探索AGI
新闻资讯7

生态为基,关系为王:AI Agent下半场的竞争法则|甲子引力

12月3日,2025甲子引力年终盛典上,嘉宾围绕《我们与AI Agent的关系》探讨。指出AI Agent竞争从技术转向生态与关系构建,还分享产品亮点、探讨技术协作等问题,并预测未来C端AI Agent核心壁垒。

甲子光年
新闻资讯7

20美元,撕开人类思维鸿沟!宾大教授警告AI隐形阶层战

宾大教授Ethan Mollick指出,AI已成新社会基础设施,正制造人类内部分层。从免费到20美元、200美元,不同付费层级对应不同使用模式和能力,思维差异才是关键,未来需培养与AI协作的直觉。

新智元
开源动态8

中山大学&华为联合提出 Issue Resolution 数据集构建神器SWE-Factory:每条只要$0.024

中山大学和华为联合提出低成本开源方案 SWE-Factory,可自动收集代码打造高质量代码评估数据集。它能解决传统构建流程繁琐、依赖人工的问题,实现全流程自动化,还构建了 SweSetupBench 数据集,表现出色。

深度学习自然语言处理
新闻资讯7

CEO让AI定裁员名单:被它反驳时,我选择怀疑自己!

Confluent报告显示,62%英国高管用AI辅助决策,27%用其处理人事。88%称决策更快、83%表示压力更小,但65%认为决策不协作,70%与AI意见相左时会怀疑自己,数据质量也影响决策。

新智元
产品应用8

=COPILOT()函数横空出世!AI自动写公式效率起飞,网友:让Excel再次伟大

微软官宣在Excel引入全新的=COPILOT()函数,用自然语言提需求就能让其干活。它内置在Excel引擎,能与现有函数协作,还可自动刷新结果。网友称这将改变数据分析,让Excel再次伟大。

新智元
产品应用8

AI时代,企业微信5.0的实用主义答卷 | 甲子光年

在AI浪潮下,企业微信5.0于8月20日发布,未推‘无所不能’的AI Agent,而是将AI融入搜索、总结、问答、表格等高频办公场景,解决数据孤岛,赋能内外协作,以实用主义破企业级AI落地难题。

甲子光年
算法论文8

数学推理热潮下的冷思考!如何训练真正"全能"的推理模型?

论文评估20余个开源推理模型在多领域表现,发现多数模型数学成功难迁移。揭示微调方法(RL vs SFT)决定能力泛化,SFT像‘填鸭’,RL似‘思维健身’,为构建通用推理智能体提供新路径。

深度学习自然语言处理
产品应用7

华为昇腾推理对决:开源vLLM vs 官方MindIE,数据说话「Qwen与DeepSeek推理实测」

文章围绕华为昇腾推理,对比开源vLLM与官方MindIE。借助GPUStack平台测试Qwen与DeepSeek模型,分析不同场景性能。指出vLLM和MindIE各有优势,还强调构建国产AI推理生态需多要素,鼓励开源协作

AI寒武纪