「技术收敛范式」共找到 3654 篇相关文章
大模型被确诊「视觉文盲」!多校联合提出MILO,为它植入空间想象力
空间推理是多模态大语言模型(MLLMs)应用关键挑战,当前‘语言描述式调优’让模型成‘视觉文盲’。多校联合提出MILO范式,结合视觉生成反馈与语言调优,还构建GeoGen数据集,经五大任务验证其有效。
调整训练数据出场顺序,大模型就能变聪明!无需扩大模型/数据规模
微软亚洲研究院提出全新文本数据组织范式DELT,通过引入数据排序策略,充分挖掘训练数据潜力,优化训练数据的组织方式,在不同模型尺寸与规模下都达到了良好性能,且不用增加数据量或扩大模型规模。
AI“压力面”,DeepSeek性能暴跌近30% | 清华&上海AI Lab
上海人工智能实验室等团队设计REST框架,在一个prompt里抛多个问题模拟多任务推理场景。测试发现即便顶级模型如DeepSeek - R1在“高压”下准确率也骤降,该框架能揭示模型差异,为评测提供新范式。
DeepSeek 把 Harness 开源了:模型、工具、Agent Loop 全是插件
8月13日,DeepSeek面向全球开发者开放DeepSeek Harness开发者预览版v0.1并开源代码。其特色是一切皆插件,提供四种运行模式,内置多Agent系统,有创新但编排范式未突破,还采用仅追加的会话日志。
ICML 2026 | 西湖大学提出 PiEvo:基于原理进化的科学发现智能体框架
西湖大学研究团队提出PiEvo框架,将科学发现重点从“搜索假设”转变为“进化科学原理”,通过不确定性最小化实现原理空间自主扩展。该框架构建双循环优化机制,实验结果显示其核心指标超越SOTA,收敛速度大幅提升。
去往 Capital One 的俞栋,曾是 Hinton 的「救命恩人」
近日原腾讯AI Lab副主任俞栋加入Capital One。此前他和邓力曾在微软为Geoffrey Hinton雪中送炭,挽救深度学习研究。如今邓力、俞栋等技术大佬纷纷投身金融公司,或是因薪资、挑战和资源等因素。
3B激活参数,干翻GPT-5.4和Opus4.6,商汤绝影把龙虾塞进了车里
商汤绝影发布端侧多模态大模型Sage,32B总参数、3B激活参数,在PinchBench评测超Claude Opus4.6等。自研SCOUT和ERL技术助力,从多维度领先同量级端侧模型,为座舱智能体提供支撑。
医疗大模型的中国战局:谁在打,打到哪了
中国医药AI赛道已有三家公司上市,是大模型赛道唯一跑通商业化闭环的方向。介绍了各梯队企业情况,分析百川智能技术领先但商业化待证明,还对2026年医药AI赛道给出关键判断。
Karpathy 亲手终结了RAG的草莽时代
Andrej Karpathy分享“LLM Wiki”工作流,将多数Token用于构建“可演化知识库”。此方法不依赖复杂架构,在中等规模数据集上展现出强大能力,引发“LLM Wiki杀死RAG”的讨论,在技术社区和企业级市场反响热烈。
复旦北大联合美团LongCat提出TDAR:用“粗思考,细求证”破解Block Diffusion的速度精度悖论
复旦大学、北京大学联合美团LongCat提出Block Diffusion推理模型Test-Time Scaling新框架TDAR,引入‘粗思考,细求证’范式与有界自适应置信度解码,打破速度与精度零和博弈,在多基准测试表现出色。