「测试成绩」共找到 1890 篇相关文章
抢先体验GenFlow2.0:未来多Agent协作的理想形态
作者在百度邀测会抢先体验Genflow 2.0,用其解决小学教改信息查询问题,还让它生成创意图片。它得益于“沧舟OS”,有流畅、并发且跨模态能力,架构全自研,测试版亮点多,值得期待8月正式上线。
告别 CVE?欧洲漏洞数据库 EUVD 正式上线
欧盟网络安全局推出欧洲漏洞数据库(EUVD)测试版,与CVE并行独立运作,旨在提升欧盟内部漏洞处理协调性与透明度。CVE虽为国际标准,但美国政治动向引发其稳定性担忧,EUVD可作备用且有增强功能。
建模世界偏好:偏好建模中的Scaling Laws
研究首次揭示人类偏好建模遵循Scaling Law,从论坛收集数据在Qwen 2.5模型训练,发现测试损失随训练规模指数增长线性下降。提出建模世界偏好,论文和模型已开源,还探讨了偏好建模可扩展性等问题。
ICML 2025 | 长视频理解新SOTA!蚂蚁&人大开源ViLAMP-7B,单卡可处理3小时视频
在视觉语言模型取得突破的当下,长视频理解挑战凸显。蚂蚁和人大团队提出视觉语言大模型ViLAMP,采用‘混合精度’策略,在多基准测试中超越现有方案,单卡可处理3小时视频,为实际应用带来新可能。
Anthropic万字Skills教程,把Agent工程的核心武功秘籍说明白了
Anthropic官方发布33页Skills构建指南,详细介绍构建高效Skill的方法,涵盖基础概念、规划设计、测试迭代、分发共享等内容。还提及openai用codex agent做项目的经验,指出人类审查成瓶颈,引出渐进式披露的核心秘籍。
DGM:首个可通过重写自己的代码来实现进化的AI Agent
Sakana AI发布Darwin Gödel Machine(DGM),可通过重写代码自我进化,突破了当前AI Agent智能固定的局限。它在多测试中表现出色,能力具通用性,但也有潜在风险和局限,团队已开源并提出未来研究方向。
横扫19项榜单!大晓机器人开源全球首创空间智能底座
大晓机器人联合多机构推出通用基础模型“ACE - Brain - 0”并全行业开源。它打破本体壁垒,在24个核心benchmark中19个获SOTA成绩,应用于机器狗,还提出新训练范式,统一四大能力,重新定义通用具身智能。
融资35亿后,Kimi神秘模型现身竞技场
大模型竞技场上,神秘模型Kiwi - do现身,自报来自月之暗面Kimi。网友推测它可能是K2 - VL,其通过VPCT测试或改变多模态Agent格局。2025年末Kimi获35亿融资,将用于K3模型研发。
MiniCPM 4.0极速狂飙,端侧模型的比赛,结束了!
面壁智能联合清华发布MiniCPM 4.0,极限场景220倍加速。它是首个原生稀疏模型,有InfLLM v2、CPM.cu等创新,基准测试碾压对手,适配全平台,还有科研、工具调用等功能,标志端侧长文本时代到来。
Claude Opus 4.7深夜上线,评分碾压
周四晚间,Anthropic 宣布 Claude Opus 4.7 全面上市。它在高级软件工程、视觉效果上表现出色,多项基准测试优于 Opus 4.6。还具备新特性,如自动模式等,安全性能与 Opus 4.6 相似。此外,Anthropic 还有相关更新。