「好表现定义」共找到 3245 篇相关文章
o3-pro通关“推箱子”,人类怀旧小游戏成了大模型新Benchmark
推箱子、俄罗斯方块等经典小游戏成大模型benchmark,o3 - pro挑战这两款游戏表现出色,突破benchmark上限,成绩远超o3。Lmgame含多款游戏,有不同评价方式,且开源可用于模型测试。
Anthropic的多智能体,真的有必要吗?
作者曾质疑多智能体系统,看了Anthropic对「Claude Research」的说明后有了改观。介绍了多智能体系统定义、性能提升、代价,还阐述构建方法、评估方式,公开三个核心提示词及协作模式。
何恺明评审,谢赛宁获奖!牛津华人博士生拿下CVPR 2025最佳论文
CVPR 2025奖项揭晓,投稿量增13%,接收率22.1%。最佳论文来自牛津与Meta AI,提出新前馈网络。还公布年轻研究者等多奖项,何恺明任最佳论文评审。
低延时、可交互的音频驱动肖像视频生成框架LLIA
美团提出新型音频驱动肖像视频生成框架LLIA,是低延迟、可实时交互的虚拟形象生成技术。它提出四项核心技术,引入三大核心模块,构建超100小时数据集,在多方面有出色表现。
让AI自己设计芯片!中国科学院发布「启蒙」,芯片全流程自动设计
近日,中科院计算所联合软件所推出「启蒙」系统,基于AI实现处理器芯片软硬件全流程自动设计,达到或部分超越人类专家水平。该系统在多方面表现出色,如设计的CPU达ARM Cortex A53性能等。
给大模型装上「思维分段引擎」:浙大InftyThink解锁无限深度推理
如今大模型长上下文推理面临计算成本高、推理易中断问题。浙大联合北大团队提出InftyThink新范式,将传统推理拆成短片段并总结,突破推理长度限制,在多基座模型实验中表现优异。
AIAAJ | 西工大张巧、张伟伟等:多专家特征融合网络架构预测跨声速抖振气动噪声
为解决气动噪声数据中流动状态与空间位置分布不平衡导致的MLP预测精度不足问题,本研究提出多专家特征融合网络架构,以跨声速抖振气动噪声为算例评估,可降低MLP算法MSE,泛化性更好。
字节跳动&清华大学开源多模态时序大模型ChatTS,可实现时序数据对话与推理
字节跳动与清华合作开源多模态时序大模型ChatTS,可实现时序数据对话与推理。它用合成数据训练,解决了数据稀缺等问题,在评估中表现远超基线模型,未来可拓展至更高阶任务。
ICML 2025|如何凭「自动补全」实现100K生成3×加速?
在大模型推理复杂的当下,生成超长文本成本高。BIGAI NLCo团队提出推理加速框架TokenSwift,被ICML 2025接收。它重构传统自回归推理,解决长生成瓶颈,在多模型实验中表现亮眼。
ACL2025 | 代码助手火了,但安全吗?所有模型评估结果都很扎心
近期,GitHub Copilot、ChatGPT等AI代码生成工具爆火,效率显著提升,但代码安全性存疑。北大团队用CoV-Eval评测20款主流大模型,结果不佳,论文还给出优化方向,呼吁代码上线前严格测试。