学术评估」共找到 854 篇相关文章

新闻资讯8

LangChain Agent 年度报告:输出质量仍是 Agent 最大障碍,客服、研究是最快落地场景

LangChain对1300名行业人士调查,揭示AI Agent应用情况。超半数受访者已将Agent投入生产,客户服务、研究与数据分析是热门方向,但输出质量仍是落地最大障碍,成本不再是难题。

Founder Park
算法论文8

挖掘注意力中的运动线索:无需训练,解锁4D场景重建能力

香港科技大学(广州)与地平线团队提出VGGT4D,通过分析VGGT内部机制,利用注意力层运动线索,提出无需训练框架,在动态物体分割等任务表现优异,为低成本4D重建提供新思路。

量子位
算法论文8

用「进化+压力测试」自动生成的竞赛级编程题,各家大模型谁更hold住?

北京大学与通用人工智能研究院联合提出 UniCode 框架,构建进化式评测系统,能自动生成高质量算法题目与抗污染测试用例。通过对 19 个前沿大模型测试,展现高挑战性与强判别力,为代码能力评估开辟新路径。

机器之心
算法论文7

剑桥揭开大模型翻车黑箱!别再怪它不懂推理,是行动出错了

剑桥大学等机构研究指出,大模型执行长时任务易翻车,问题不在推理而在执行能力。研究人员评估多个指标,发现单步准确率提升可让任务长度指数增长,还研究了自条件化等影响及模型规模的作用。

新智元
算法论文8

“AI版LeCun”自己讲解论文,自我进化智能体框架生成精美演讲视频

加州大学研究者提出自我进化的学术演讲智能体框架EvoPresent,它由四个智能体协作,核心美学模型PresAesth模拟人类审美判断。团队构建评测体系,实验显示其在内容与视觉设计上提升显著,让AI兼顾逻辑与美感。

量子位
算法论文8

清华大学x生数科技:从波形到隐空间,AudioLBM引领音频超分新范式

音频超分辨率是提升音频体验的关键技术,但高频细节损失是挑战。OpenAI的Sora 2树立高保真音频生成标杆,现有学术模型有局限。清华与生数科技团队发表两项成果,AudioLBM展现通用高分辨率音频生成潜力。

量子位
新闻资讯7

Nano Banana核心团队:图像生成质量几乎到顶了,下一步是让模型读懂用户的intention

这是对Nano Banana核心团队的专访。团队认为图像生成质量提升空间有限,未来关键在模型可表达性和读懂用户意图。还探讨了图像模型发展趋势、应用场景、产品设计、评估方式等,提及与传统工具将长期共存。

Founder Park
推荐文章8

CUDA-MODE第77课课程笔记:用于GPU kernels的DSL

该课程笔记由Tri Dao介绍GPU kernel开发的DSL生态,涵盖PyTorch、Triton、Cute - DSL等。提出计算效率评估公式,对比不同DSL在Softmax、GEMM等操作的性能。还提及其他DSL工具与Triton扩展项目,并给出使用建议。

GiantPandaLLM
新闻资讯8

专治智能体盲跑!微软发布AI Agent 5大可观测性,打通任督二脉

今天凌晨微软官网发布AI Agent 5大可观测性最佳实践,解决智能体盲跑等难题。介绍了智能体可观测性概念和好处,展示5个应用案例,还阐述5大实践,如选模型、持续评估、集成CI/CD等。

AIGC开放社区
新闻资讯7

老外给中国 AI 开源厂商打分:第一梯队是 DeepSeek 和 Qwen。

Nathan Lambert发布“中国开源模型开发商排名”,评估19家实验室贡献,第一梯队是DeepSeek和Qwen。还介绍字节跳动豆包、小米、百度文心一言发展情况,如豆包月活全球第二,小米模型效率突破,文心一言企业应用领先。

AI进修生