「V5 Fast」共找到 2363 篇相关文章
「纳米香蕉」LMArena两周500万投票,引爆10倍流量!谷歌、OpenAI扎堆打擂台
8月,「纳米香蕉」登顶LMArena文生图像榜单,带动社区流量暴增10倍,月活超300万。其盲测两周吸引超500万次投票。LMArena前身是Chatbot Arena,为大模型提供比拼舞台,厂商借此获曝光和反馈。
刚刚,大模型棋王诞生!40轮血战,OpenAI o3豪夺第一,人类大师地位不保?
国际象棋积分赛成果出炉,OpenAI o3以人类等效Elo 1685分夺冠,Grok 4和Gemini 2.5 Pro紧随其后。Kaggle发布国际象棋文本排行榜,评估模型战略推理等能力,还推出相关数据集,虽有局限但意义重大。
OpenAI华人露头就被小扎挖!95后北大校友1个月前上直播,今天已是Meta人
OpenAI华人工程师露脸易被Meta挖角,此次主角是95后北大校友孙之清,他刚参与ChatGPT Agent发布直播就加盟Meta。此前Jason Wei等也被挖,网友调侃让奥特曼别让亚洲面孔上直播,OpenAI也在加强人才保护。
追剧不断网,可能背后有个AI在加班,故障诊断准度破91.79%
中兴通讯和中国移动团队针对电信网络故障诊断难题,提出 TN - RCA530 基准和 Auto - RCA 框架。测试多个大模型,初始准确率低,经框架优化后,Gemini - 2.5 - Pro 准确率从 58.99% 升至 91.79%,超人工水平。
Anthropic刚刚宣布Claude Sonnet 4支持100万token上下文窗口
Anthropic官方公告,Claude Sonnet 4上下文窗口扩大到100万tokens,是之前5倍。能一次读懂大代码库或多篇论文,可用于代码分析、文档处理等。超20万tokens价格翻倍,现仅对Tier 4用户测试。
密室逃脱成AI新考场,通关率不足50%,暴露空间推理短板丨清华ICCV25
清华大学团队受密室逃脱游戏启发,提出EscapeCraft:一个3D密室逃脱环境,用于评估多模态大模型在视觉环境中完成复杂任务推理的能力。该论文已入选ICCV 2025。研究评测了多个热门模型,发现它们在推理和探索行为方面存在诸多问题。
面壁MiniCPM4推理速度3倍,碾压同尺寸Qwen3,阿里上眼药了~
面壁发布包含10个模型的MiniCPM4系列,其推理速度快。它有高效模型架构、学习算法、高质量训练数据和推理系统等创新点,还给出了MiniCPM4实战代码及启用InfLLM v2的参数设置。
OpenAI新模型,被曝秘密训练中!万字硬核长文直指o4核心秘密
SemiAnalysis爆料,OpenAI正训练规模介于GPT - 4.1和GPT - 4.5间的新模型,下一代推理模型o4基于GPT - 4.1训练。强化学习成推理模型进步功臣,但面临基础设施瓶颈,奖励函数难定等问题。
Google研究发现:Multi-Agent的核心竟然是Prompt设计!
Google和剑桥大学研究多智能体系统,发现提示设计影响大,有效拓扑结构占比小。提出Mass框架分三阶段优化,实验用Gemini 1.5 Pro和Flash模型,对比多种方法,在多任务上性能显著提升。
刚刚,DeepMind开源全栈「Deep Research」项目,AI 研究将人人可用
谷歌DeepMind团队开源基于Gemini 2.5的全栈「Deep Research」项目,能让每个人拥有智能研究助手。它可动态搜索、反思结果,以流式传输提供带引用答案,前后端结合,还介绍了特性、原理、技术栈等。