LLM评估」共找到 1596 篇相关文章

新闻资讯7

反转!LeCun刚转发「全球最快开源推理模型」,ETH苏黎世就直接打假

上周,MBZUAI与G42等开源号称「全球最快的开源AI推理模型」K2 - Think,引发广泛关注,图灵奖得主Yann LeCun也转发相关推文。但三天后,ETH苏黎世研究员发文指出该模型存在数据污染、评估方式不合理等问题。

新智元
产品应用7

Anthropic总想摔碎程序员饭碗,甩出了“以后只招两种人”名单。

昨天Anthropic发布新产品Claude Tag,被Karpathy赞为LLM交互第三范式。Claude Tag与之前的Claude Code远程插件有4方面差别。产品负责人Fiona Fung分享,Anthropic人均代码交付量剧增,招人只看两类人。

探索AGI
算法论文8

对话清华商宇丨从生成视频到支撑行动,世界模型需要新的评测标准

文章围绕清华团队提出的 WorldArena 评测框架展开。它针对具身世界模型,对过去沿用视频生成的评测逻辑重新审视,从视觉质量和功能性任务两维度评估,推动世界模型从‘生成世界’迈向‘使用世界’。

AI科技评论
产品应用8

让问题不过夜:交易领域“问诊”Agent实践

文章针对研发支持中的痛点,构建智能Agent系统,将问题抽象为业务答疑与问题诊断两类能力。介绍了系统架构、构建演进、知识体系、质量评估等内容,还展示实战成效,指出当前边界与下一步方向。

阿里云开发者
新闻资讯7

咖啡机变聪明后,我连咖啡都喝不上了

一位科技记者用升级到Alexa Plus的博世咖啡机煮咖啡遭拒,社区也有诸多类似吐槽。生成式AI助手虽能力提升,但因LLM随机性,在控制场景易翻车,新旧技术切换引发混乱,边界待明确。

机器之心
算法论文8

机器人的「GPT时刻」来了?丰田研究院悄悄做了一场最严谨的VLA验证实验

丰田研究院(TRI)团队研究大型行为模型(LBM),在近1700小时机器人数据上训练并大量部署评估。发现LBM性能提升显著,预训练小数据量也能带来增益,预示机器人通用大模型或到来。

机器之心
新闻资讯8

谷歌大脑之父首次坦白!茶水间闲聊引爆万亿帝国,AI自我突破触及门槛

AI界传奇Jeff Dean在「登月播客」深度访谈中,回顾个人成长、Google Brain早期故事及AI未来思考。他揭秘诸多细节,还谈到神经网络发展、注意力机制突破、LLM可解释性等内容,也提及未来五年规划。

新智元
算法论文8

TACL 综述 | 别只卷架构了——长文本模型的能力天花板,其实是数据决定的

该 TACL 综述首次从数据视角审视长上下文语言模型,指出长上下文能力本质是数据驱动。它建立分类体系,明确高质量长文数据条件,给出核心能力的数据配方与评估法,还整理数据集和基准,提出待解问题。

深度学习自然语言处理
新闻资讯8

奥数金牌只是序章!OpenAI谷歌彻底打脸预言家,AI巨浪势不可挡

2022年专家预言AI到2025年赢得IMO金牌概率低,结果OpenAI和谷歌DeepMind的LLM提前摘金。此前多项AI基准测试预测也失准,AI发展远超预期。GPT - 5降低使用门槛,群体智能时代到来,各机构需重新思考生存之道。

新智元
开源动态8

256块NPU训成8B视频模型、超越Sora等一众闭源!抖音内容技术团队开源ContentV

近日,抖音内容技术团队开源ContentV,这是面向视频生成任务的高效训练方案。用256块NPU约4周训成8B参数模型,在多评估维度效果与主流方案相近,还探索了有限算力下训练路径,现推理代码与权重已开放。

机器之心