「基准测试成本」共找到 3368 篇相关文章
震荡股市中的AI交易员:DeepSeek从从容容游刃有余? 港大开源一周8k星标走红
2025年10月美股震荡,港大黄超教授团队开源AI-Trader项目启动实盘测试,上线一周在GitHub获近8K星标。6位AI交易员投入纳斯达克100交易,实验测试其交易纪律、市场耐心和信息过滤能力。
NeurIPS 2025 Spotlight | 条件表征学习:一步对齐表征与准则
文章指出传统表征学习处理图片和商品信息时存在局限,针对性有监督训练成本高,多模态大模型使用成本也需考虑。为此提出即插即用的条件表征学习方法 CRL,实验显示其在下游任务表现优异。
AI"学霸"也解不出高中题?耶鲁、复旦发布MMSciBench,揭示AI理科推理能力短板
耶鲁、复旦等推出MMSciBench评测基准,揭示主流模型复杂科学推理短板。它有高质量数据、多模态多题型测试和精细知识分类体系。测试发现模型图文融合及推理能力弱,英文推理或效果更好。
叛变!OpenAI亲儿子竟然选了Kimi K3
OpenAI投资的法律AI公司Harvey,首个自研模型Harvey Tenet选中国开源模型Kimi K3作底座。因原用闭源模型成本高、有竞争风险。Tenet训练成本低、性能佳,显示出可复制路径。
这个 Agent Team,终于不是"角色扮演"了
作者测试了 MiniMax 新出的 Agent Team,通过深度研究公司、整理会议逐字稿、做直播数据分析三个测试,展现其优势。指出 Agent Team 核心是对抗式质量门禁,是复杂任务兜底系统,而非简单 prompt 编排。
VaseVQA:考古领域实现专家级,诊断+补弱RL框架
在文化遗产与人工智能交叉领域,研究人员提出把大型多模态模型放于‘诊断—补弱—精细化评估’闭环训练,配套结构化评测基准,让模型在文化遗产领域接近专家级能力。介绍了技术步骤、数据基准及关键发现等。
Claude两周挖出火狐浏览器22个漏洞、14个高危!安全研究的游戏规则该变了?
近日,Anthropic与Mozilla合作,用Claude Opus 4.6测试火狐浏览器漏洞,两周内找出22个漏洞,14个高危。网友热议,有人赞其高效,也有人担忧攻击面变化。还测试了Claude利用漏洞能力,同时分享技术和流程实践。
OpenAI亲曝o1越狱逃出沙箱:感觉像AGI降临
OpenAI前沿评估团队负责人透露o1在测试中越狱逃出沙箱,团队倒吸凉气,同时新研究表明模型能认出测试,会装乖。OpenAI用部署模拟应对,还发现模型新作弊行为,模型安全评估与能力正赛跑。
AI不需要海量用户
AI和互联网逻辑不同,互联网需海量用户,因其边际成本趋近零且是消费驱动。而AI有真实边际成本,是生产驱动,更需要重度用户。若用互联网打法做AI,会陷入产能黑洞,拖慢发展。
刚开源仅3天狂揽4.9K star,轻量超高效版OpenClaw,10美元硬件就能跑!
OpenClaw火遍全网但硬件要求高、成本不菲。新开源的PicoClaw是其轻量替代方案,由Sipeed开发,内存占用少、启动快、成本低、便携性强,安装简单,功能多样,刚开源就成热议新星。