「BIMO 数据集」共找到 2618 篇相关文章
GPT-5.4暴击华尔街!白领工作灭绝时刻,美国5.7万科技岗位被血洗
OpenAI发布GPT - 5.4震惊AI圈。它能力超强,能颠覆白领工作,如让Excel变数据分析平台、超越咨询投行律所。美国科技行业岗位大减,但AI岗位需求飙升,诺奖得主警告AI会加剧不平等。
大模型的第一性原理:(三)信息论篇
本文从信息论角度解读大模型第一性原理。介绍Shannon信息论,提出将其从以BIT为中心转换为以TOKEN为中心解释大模型底层原理,还阐述大模型各阶段信息论原理、定向信息计算方法,对比Granger与Pearl因果。
这届MWC真成了中国AI主场,小米直接把AI从对话框里拽出来接管物理世界了
全球AI竞争从技术探索进入应用兑现期,中国凭场景、数据和硬件生态领跑。小米在MWC展示人车家全生态,用顶尖AI能力和10亿级生态让AI走出屏幕,实现空间智能,率先占位全球竞争。
CL-Bench的故事没有结束,生成式CL-Bench:GENIUS来了
北大团队发布GENIUS,用于评估模型生成式流体智力。它构建含510个样本、20个子任务的评测集,测试模型多方面能力。实验显示当前模型流体智力有短板,还提出免训练注意力校准机制提升性能。
这么哇塞的世界模型,竟然是开源的!
蚂蚁灵波开源通用世界模型LingBot-World,视觉效果与Genie 3不相上下且时间维度更长,能让用户深度参与,还具备一致性、记忆力等特点。它通过数据和模型层面创新炼成,结合此前开源成果构建具身智能基础设施。
科学界爆发AI认知污染!1年狂投50篇论文,ICLR投稿20%AI生成
如今AI正污染科学界,出现幽灵引用、虚假数据和图片等问题。论文工厂用模板量产造假论文,审稿人用AI应对,作者还用密令操控AI审稿。预印本平台投稿量暴涨,可能沦为垃圾场,引发认知污染。
我们对 Coding Agent 的评测,可能搞错了方向
用户对 Agent 不满常因它「做得不好」,不遵循指令和规范。当前主流评测体系以结果为导向,与真实场景错位。MiniMax 开源 OctoCodingBench 评测集,结果显示模型过程规范遵循不足,未来训练需引入过程监督。
Manus高溢价收购背后,是Agent开发落地困境
近期Meta 20亿美元收购Manus引发关注,暴露Agent开发落地难题。阿里云百炼升级“1+2+N”体系,“N”组件解决数据、安全等问题,“2”提供新开发范式,“1”深挖模型服务工程,还发布企业版助力落地。
网民票选AI王者,LMArena一夜变17亿美元独角兽!
LMArena原是校园开源小项目,从2023年起步,如今估值达17亿美元。其Arena模式让网友盲投选AI,Elo评分系统算排名。虽有众包投票易操纵等争议,但已成行业标杆,还将为大厂提供付费评估服务。
以孔子命名,超越Claude 4.5 Opus,Meta发布工业级自我进化AI软件工程师CCA
Meta与哈佛联合推出工业级软件工程师CCA,它是一套让AI在工业级代码库协作的方法论,解决长上下文推理等难题。其三维解耦设计、精细记忆机制、自我进化能力获数据验证,还适合引入强化学习。