康奈尔大学」共找到 5303 篇相关文章

算法论文8

Transformer祖传设计遭暴击,COLM顶会三篇论文发难

COLM 2026上,三篇论文对Transformer关键技术发难。《Cracks in the Foundation》指出长上下文架构选择影响;《Lost in Backpropagation》揭示输出投影层信息损耗严重;《When Fewer Layers Break More Chains》表明层剪枝影响长链推理。

量子位
开源动态8

小模型推理极限在哪里?微博开源3B小模型,比肩顶级闭源

微博新开源的VibeThinker - 3B小模型,将特定能力维度性能推向极限。它在数竞赛、编程等可验证推理基准上表现优异,成绩直逼顶尖模型。其训练流程层层叠加,还提出参数压缩 - 覆盖假说。

AIGC开放社区
新闻资讯8

中国科家首次手搓出“球状闪电”!刘慈欣科幻小说照进现实

4月16日,中科院上海光机所团队在《自然·光子》发文,首次在实验室可控生成具球状闪电典型特征的宏观电磁孤子。其存活时间长、空间尺寸,还能为研究提供受控平台,有潜在应用价值。

DeepTech深科技
开源动态7

DeepSeek-OCR降本增效,10×暴力压缩还能读得清

Deepseek - OCR模型发布,通过光压缩技术解决长文本处理的计算效率问题,能控制模型token消耗成本。介绍了其架构设计、数据引擎及训练流程,还展示其用较少token超越现有模型的能力。

CourseAI
算法论文7

穷人福音!MIT研究:不用堆显卡,抄顶级模型作业就成

MIT研究把59个不同模型凑一起,发现强模型对物质理解趋同,且性能越强思维越接近。研究还指出性能不佳模型的问题,认为可通过模型蒸馏让小模型模仿模型,实现算力自由。

新智元
开源动态8

字节Seed新方法!开源8B代码模型:自己筛数据训练自己,同量级SoTA,还能超越百亿级对手

传统code模型依赖人工筛选数据,成本高、效率低。而Seed - Coder团队让LLM自己筛选数据训练自己,打造8B参数轻量级开源代码模型,性能超百亿级对手,不过也存在通用和数能力短板。

深度学习自然语言处理
新闻资讯7

机器人的“ChatGPT时刻”为何迟迟未来?

俄勒冈州立教授乔纳森和前 Google X 高管汉斯探讨机器人有无“ChatGPT 时刻”。指出机器人领域难现单一突破,需工程实践、工具配合和数据积累,还从多方面分析了面临的问题。

DeepTech深科技
新闻资讯8

Ilya交卷!黄仁勋砸50亿押注SSI,首个模型疑本周发布

Ilya Sutskever创立的SSI或本周发布首个重磅模型,引发圈内关注。英伟达砸50亿美元合作,提升其算力。该模型基于测试时训练架构,能边边进化,或终结模型“预训练时代”。

新智元
算法论文8

Meta新突破!跨模态生成告别噪声:流匹配实现任意模态无缝流转

Meta与约翰霍普金斯联合推出CrossFlow框架,实现跨模态生成新突破。它基于流匹配提出新范式,无需依赖噪声分布等,在多任务上媲美或超最优算法,训练成本低、速度快,还能适配多任务。

机器之心
算法论文8

0.25秒识破未见攻击,这套检测方法没看过任何越狱样本 | EMNLP'26

视觉语言模型带来隐蔽攻击面,现有检测器难平衡。中国人民与阿里巴巴集团联合提出Learning to Detect(LoD),不依赖攻击样本和手工规则,从模型内部激活安全模式,实验效果好且代码开源。

量子位