性能评估」共找到 2543 篇相关文章

新闻资讯7

DeepSeek V3.2爆火,Agentic性能暴涨40%解密

文章解密了DeepSeek V3.2 Agentic性能暴涨40%的原因,即采用交错思维链机制。还对比了其与早期ReAct范式,介绍其效果、原理,以及MiniMax为落地该机制做的工作,最后提到多家模型达成技术共识。

新智元
新闻资讯7

ChatGPT 评估员工绩效,评得是真能力吗?

绩效考核季,不少管理者用 ChatGPT 生成绩效评语,认为高效。但文章指出,把关键管理工作交 AI 是‘职业肌肉’萎缩,还给出管理场景下 AI 使用清单,网友也对 AI 辅助绩效评估展开热议。

AI科技大本营
新闻资讯7

The Batch: 952 | GPT-5.5 性能领先,但幻觉问题突出

OpenAI 最新旗舰模型 GPT-5.5 是闭源视觉 - 语言模型,在重要基准测试中表现领先,但在区分已知未知内容上有困难,幻觉问题突出,在主观评估中落后于对手。

DeeplearningAI
开源动态7

Uno Platform 6.6 发布:Android 启动性能最高提升 61%

Uno Platform 6.6发布,在五平台引入原生AOT发布、可选Vulkan渲染后端等。聚焦运行时性能,提升多平台启动速度,还简化XAML编写,增强AI辅助、无障碍及多语言支持等。

InfoQ
新闻资讯7

Meta收购Manus最新进展:商务部介入,启动评估调查

2026年1月8日,中国商务部宣布会同相关部门对Meta收购Manus案开展评估调查,审查其与出口管制等法律法规的一致性。此次调查或使交易走向审查通过、需补办手续、认定违规三种情形。

新智元
开源动态8

SGLang支持GPT-OSS:从Day 0支持到性能增强

SGLang宣布重大更新,聚焦openai/gpt - oss - 120b模型深度性能优化与新功能。预填充和解码阶段吞吐量显著提升,支持多GPU,有推测解码等功能,还支持智能体应用程序,且不损害模型推理能力。

GiantPandaLLM
算法论文8

SRO赋能Qwen-2.5-VL推理性能飙升16.8%

文本领域推理模型成就大,但多模态大型语言模型推理能力扩展遇阻,如冷启动初始化不足等。提出SRO三阶段训练框架,经测试,ReVisual - R1平均性能提升16.8%。

CourseAI
算法论文8

微调已死!「共识机制」实现提示词自我进化,性能飙升

人工智能领域正从「模型微调」向「上下文工程」转变。西湖大学MAPLE实验室齐国君教授团队提出基于「共识机制」的提示词组进化算法C - Evolve,能突破单一提示词性能局限,提升系统整体性能

量子位
算法论文7

何恺明改进了谢赛宁的REPA:极大简化但性能依旧强悍

扩散生成模型在建模复杂数据分布表现出色,但与表征学习领域关联不大。谢赛宁团队提出REPA,不过较麻烦。何恺明团队提出Dispersive Loss,简化且性能强,无需预训练等,适用于多种模型。

机器之心
新闻资讯8

黄仁勋出手!45倍性能暴涨,英伟达定义物理AI新纪元

在SIGGRAPH 2025上,英伟达发布「物理AI」全家桶。展示完整生态,含新硬件、仿真平台和AI模型。如RTX PRO 6000服务器显卡性能涨45倍,还推多款模型,应用于多领域,推动物理AI落地。

新智元