评测反馈」共找到 839 篇相关文章

新闻资讯8

OpenAI Astra发布在即,全自动网络攻防能力已突破天际!

OpenAI即将发布的模型Astra,在内部评测中获ExploitBench满分,还发现两个零日漏洞。它能力远超上一代GPT - 5.6 Sol且更听话。不过为安全考虑,OpenAI部署监控,还放慢其研究速度。

新智元
开源动态8

阿里重磅开源!Open Code Review:一周 5k star,为你的代码保驾护航

阿里开源 Open Code Review,它前身是内部 AI 代码评审助手,经大规模验证。该工具结合确定性工程与 Agent,解决通用 Agent 评审代码的问题,在准确率、效率等方面表现出色,还介绍了使用方法和评估方式。

阿里云开发者
开源动态7

这张信息图,居然是8B开源模型做的??

商汤新开源的 8B 多模态模型 SenseNova U1,架构独特,图像评测表现好,信息图生成能力强、延迟低。它具备图文交错能力,适合自媒体、敏感行业等,有在线体验和开源代码入口。

花叔
产品应用8

The Batch: 942|暗基因组揭秘

AlphaGenome 能解读人类和小鼠基因组中 98% 不编码蛋白质部分,识别多项特征。它经预训练和知识蒸馏,在多项评测超早期模型,API 等免费用于非商业,助研究基因组与生物过程联系。

DeeplearningAI
推荐文章8

Harness is the New Dataset:模型智能提升的下一个关键方向

文章指出当基模能力成熟,决定 agent 上限的是围绕模型搭建的系统,即 harness engineering。介绍其组件、设计原则,探讨模型与 harness 关系,还列举创业机会项目,最后推测下一范式是 Coordination Engineering。

海外独角兽
产品应用7

全民养虾,百虾大战,但2026年了,99%的企业用AI还是没赚到钱。

2026年,99%企业用AI未盈利。如今模型性能差距小,壁垒在context。Data不等于Context,企业需挂钩业务结果、构建反馈闭环与专属上下文系统。特赞GEA是这样的企业级智能体系统。

探索AGI
算法论文8

刚刚,加入腾讯的姚顺雨发表首篇Paper~

腾讯混元与复旦联合发表论文《CL-bench》,姚顺雨署名并全面细致审阅反馈。CL-BENCH 首次单独考‘现学现卖’,有独特设计原则、四大题型,其评分杜绝‘差不多’,还让 10 个前沿模型‘翻车’。

PaperAgent
产品应用8

世界最强医疗模型百川M3发布:AI医疗,奇点已至

百川智能发布并开源全球最强医疗模型Baichuan - M3,各项指标SOTA且超越人类医生平均水平。它告别机械‘背医书’,学会主动追问、排查病因,解决AI‘胡说八道’问题,准确度超GPT - 5.2 - High。

新智元
推荐文章7

从算法天才到机器人造梦者,原力灵机范浩强详解具身智能进化论:模型解锁场景,场景定义硬件

AI 前线深度访谈原力灵机范浩强,探讨其创业选择、具身智能技术演进与产业趋势。他认为机器人是 AI 绕不过的点,2025 年硬件与算法拼图开始对齐,原力灵机强调算法先行,还分享了保证算法演进的路线。

AI前线
产品应用8

全自研仿真GPU求解器x虚实对标物理测量工厂,打造具身合成数据SuperApp,加速具身仿真生态丨光轮智能@MEET2026

在量子位MEET2026大会上,光轮智能杨海波指出具身智能核心是数据,仿真是解决数据问题的唯一方案。光轮智能自研“测量、生成、求解”基础设施,建立全栈仿真平台,还打造多个“爆品应用”,为具身智能发展提供支撑。

量子位