「新词新站比赛」共找到 3626 篇相关文章
面向 AI Agent 的搜索服务,小宿科技有机会成为百亿美金的新巨头吗?
文章围绕AI搜索展开,分析微软Bing停用API原因,探讨小宿科技做Agent时代AI搜索服务的机会。从多方面剖析小宿优势,如全球通能力、贴合需求打法等,指出AI时代搜索是B端基建博弈。
美团提出多模态推理新范式:RL+SFT非传统顺序组合突破传统训练瓶颈
美团研究者提出Metis - RISE框架,将RL激励和SFT增强以非传统顺序结合提升多模态大语言模型推理能力。先RL激发潜能,再SFT补齐短板,训练的两模型在OpenCompass榜单成绩优异。
OpenAI 的“编程”新范式?其实是瀑布模型的回魂:“听 PM 的话、写需求文档”
在AI工程师大会上,OpenAI研究员Sean Grove提出“规范驱动开发”,认为清晰规范将取代代码成软件开发核心。此观点引发讨论,有人认同,有人反对,也代表了AI编程从“造轮子”到“定方向”的转折。
OpenAI 的“编程”新范式?其实是瀑布模型的回魂:“听 PM 的话、写需求文档”
在今年AI工程师大会上,OpenAI研究员Sean Grove提出在AI驱动时代,清晰规范将取代传统代码成软件开发核心产物。他认为编程核心是结构化沟通,该转变是工程实践未来方向,但引发诸多讨论。
1万tokens是检验长文本的新基准,超过后18款大模型集体失智
Chroma团队研究发现,将上下文扩展至1万tokens,18款主流大模型集体“失智”,“智商”非均匀下降,在一些节点会断崖式下跌。研究还设计四项对照实验,证明LLMs性能随输入长度增加显著且非均匀下降。
UIUC提出隐式监督新范式:无需标注/RM即可全面提升多模态Reasoning的感知能力
大型多模态模型在复杂多模态推理中面临挑战,67%错误源于视觉感知缺陷。为此,UIUC提出PAPO,通过隐式感知损失提升模型感知能力,无需额外标注,在多模态基准上表现优异,还解决了KL黑客问题。
强化学习也能预训练?效果可提升20倍,华人新作引爆RL新范式!
伯克利团队提出新方法InFOM,不依赖奖励信号,能在多任务中超强迁移与推理。在36个基于状态和4个基于图像的任务测试中,InFOM表现出色,在jaco任务上改进达20倍。
美7000万人或被取代,Agent光速卷入职场!北大校友、杨笛一新作
斯坦福大学研究团队调查104个职业领域1500名专家及52名AI研究员,构建WORKBank数据库。研究发现职场AI需求与能力错配,工人对AI态度不一,还揭示未来人类技能变化趋势。
谢赛宁团队新基准让LLM集体自闭,DeepSeek R1、Gemini 2.5 Pro都是零分
纽约大学等8家机构研究者提出LiveCodeBench Pro竞技编程基准测试,评估了Gemini 2.5 Pro等前沿大模型。发现当前模型有显著不足,在无外部工具时,高难度题通过率为0,LLM与人类大师级水平差距明显。
小扎豪掷143亿美元赌新「王」!28岁华人亿万富翁入职Meta,与谷歌决裂
Meta豪赌143亿美元,扎克伯格押注28岁天才Alexandr Wang掌舵超级智能项目。Alexandr宣布离任Scale,谷歌强烈反对并终止合作,此举或引发AI行业大地震。