biosec基准库」共找到 1120 篇相关文章

产品应用8

编程新王Composer 2.5来了,逼近Opus 4.7!成本仅为1/10

Cursor推出全新AI编程模型Composer 2.5,在部分编程基准测试上接近Claude 4.7 Opus和GPT - 5.5,运行效率最高提升10倍,成本仅为竞品一小部分。其采用定向文本反馈RL等机制,还与SpaceXAI合作冲击百万H100集群算力。

新智元
产品应用8

实测LibTV团队版:AI视频的工作室时代来了!

作者实测LibTV团队版,分享用其制作皮克斯风格3D动画片段的过程,介绍团队版核心功能,如团队主体、共享积分池、权限管理等,还提及新功能,指出AI视频走向工业化,而该团队版是首个专注团队协作的工具。

花叔
新闻资讯7

当国产模型追上闭源旗舰,企业 AI 编程的真正障碍才浮出水面

过去企业AI Coding讨论多集中在模型能力等方面,DeepSeek V4出现缓解了模型问题,但更深层的代码业务隐知识等问题浮现。合规限制使企业工具建设受阻,V4打破了模型供应瓶颈,可组织知识管理仍成难题。

InfoQ
新闻资讯8

Google 悄悄升级了 Deep Think,ARC-AGI-2 直接干到 84.6%

Google DeepMind 升级了 Gemini 3 的专用推理模式 Deep Think,跑分屠榜。ARC - AGI - 2 拿下 84.6%,在多个基准测试中表现优异。它不仅是解题机器,还能解决真实科学工程问题,已向部分用户推送,科研人员和开发者可通过 API 使用。

AGI Hunt
算法论文7

为什么AI总是"记错"你?我们造了一个"合成人生"来测试

现有AI记忆评测只记'事'不记'人',存在数据源窄、不重理解、注入成本高的问题。QuantaAlpha联合高校团队提出CloneMem基准测试,用'数字痕迹'评估AI Clone长期记忆能力,实验有反直觉结论并给出设计启示。

深度学习自然语言处理
开源动态7

创始人强塞AI代码,致开源社区分裂!核心开发集体出走:“你这种强权压制,让人恶心!”

近期,GZDoom 背后的开源社区因创始人兼维护者 Graf Zahl 在代码中加入未经测试的 AI 生成代码而分裂,抗议者创建了分支 UZDoom。Graf 称只是用 AI 生成样板代码,不影响核心功能,但社区成员认为开源项目不该用 AI 工具。

InfoQ
算法论文8

3D VLA新范式!CVPR冠军方案BridgeVLA,真机性能提升32%

中科院自动化所提出BridgeVLA模型,将3D输入投影为2D图像并利用2D热图进行动作预测。它训练分两阶段,在多仿真基准和真机实验表现卓越,仅3条轨迹基础任务成功率达96.8%,真机性能提升32%。

新智元
产品应用8

长文本推理 5 倍提速!面壁MiniCPM4 端侧模型发布,0.5B模型效果秒杀同级

近日,面壁发布 MiniCPM4.0 端侧模型,有 8B、0.5B 两种规模。其在基准测试表现出色,长文本推理提速,缓存锐减,还做了架构创新。此外,面壁有自研推理框架,科学化建模产线,6 月 27 - 28 日 AICon 北京站将探讨 AI 趋势。

AI前线
开源动态7

开源项目捐给基金会后又往回要,维护 7 年出钱出力却被告上法庭?网友:捐了代码想收回去靠它赚钱,太无耻!

云原生计算基金会 (CNCF) 与开源消息系统 NATS 背后的 Synadia 公司就 NATS 项目的商标、域名和 GitHub 存储控制权产生纠纷。Synadia 曾将项目捐赠给 CNCF,如今想“撤回”并变更许可证,双方各执一词,最终达成 Synadia 同意 CNCF 控制相关资产的协议。

InfoQ
算法论文8

为什么GPT-5算得出微积分,却数不清积木?

文章对GPT - 5展开系统化空间能力测评,涵盖8个基准、超10亿token成本。提出“空间智能六维图谱”,发现GPT - 5在MM和SR达人类水平,但MR、PT等方面有短板,还揭示闭源与开源模型在复杂任务上差距小等情况。

深度学习自然语言处理