「榜单分析」共找到 1699 篇相关文章
AI圈最准的消息,都藏在这个小小的Web3网站里。
文章介绍了Web3平台Polymarket,它能提前预测AI模型发布日期等事件,准确率颇高。其玩法基于群体智慧,参与者用钱下注表达观点,价格反映事件发生概率,比KOL分析更靠谱。
从第一性原理出发的RAG推理新范式来了,蚂蚁DIVER登顶权威基准
当前RAG系统处理多步逻辑推理任务有局限,蚂蚁集团团队提出DIVER框架解决推理密集型检索难题。它将检索任务分四阶段,在BRIGHT榜单领先,行业对比优势明显,医疗应用效果好。
马斯克Grok-4卖货创收碾压GPT-5!AI卖货排行榜曝光,AGI的尽头是卖薯片?
新智元报道,「Vending Bench」榜单让大模型经营自动售货机一较高下。Grok - 4卖货能力超GPT - 5,销量约高2倍,营收增31%。此测试揭示AI长周期决策挑战,引发AGI定义讨论。
VDC+VBench双榜第一!强化学习打磨的国产视频大模型,超越Sora、Pika
复旦大学等机构将强化学习引入视频生成领域。提出的Cockatiel方法在VDC榜单夺冠,IPO方法在VBench登顶,超越Sora、Pika等模型,优化后视频生成效果在多方面显著提升。
CodeClash 通过多轮编程竞赛对大型语言模型进行基准测试
为评估大型语言模型(LLM)编码能力,斯坦福、普林斯顿和康奈尔研究人员开发 CodeClash 基准测试,让多个 LLM 在多轮比赛中较量,涉及多种代码竞技场,还评估模型分析代码库能力,未来将处理更大代码库。
给 OpenClaw 接上钉钉之后,我的龙虾终于把生产力拉满了
作者在深圳做OpenClaw线下Workshop时,发现国内用户用Telegram与它对话不便。后找到接入钉钉的解决方案,介绍了接入原因、配置教程,还分享用其监控AI热点和做竞品分析的使用体验。
微调重要表征以增强思维链的推理能力
团队提出关键表征微调(CRFT)方法,通过信息流分析识别和优化关键表征。在八个数学和常识推理基准及两个模型系列验证其有效性,能提高推理准确率,学习参数量低,还适应少样本场景。
上下文就是一切!行业热议话题:提示工程是否应该改名
AI圈热议提示工程是否应改名“上下文工程”。Shopify CEO等发表看法,指出其在LLM应用和AI Agent构建中很重要,还分析了重要性、优化方法,给出实践经验,强调要在性能、成本和准确性间平衡。
直播预约 | 推理模型的“过思考”现象与高效推理,2.5h的深度分享
本期GenTalk学术分享邀请刘梓辰、齐朋辉等4位博士生,在2025年6月6日15:00 - 17:30带来“推理模型的‘过思考’现象与高效推理”报告,由夏鹤明主持,NICE学术等支持。将分析‘过思考’因素,总结高效推理思路。
AI「看见」实验,哈佛颠覆性突破!一副AR眼镜,新手秒变资深专家
哈佛大学刘嘉教授团队研发人机共融智能系统,含APEX和Agentic Lab。前者用于微纳加工,后者用于生命实验。实测显示,它们能实时纠错、自动记录分析、实现技能迁移,让AI与人类在科研制造中深度融合。