「通用推理模型」共找到 8326 篇相关文章
研究者尝试揭示扩散模型创造力的起源
斯坦福大学研究人员 Mason Kamb 与 Surya Ganguli 在论文中提出解释扩散模型创造力的机制,指出其创造力是去噪生成图像时的确定性结果,还识别出关键偏置,搭建 ELS 机模型并验证其准确性。
Token洪流的转向:当AI Agent成为Token消耗的主宰,什么样的推理服务基础设施才是刚需
Token消耗量转移,AI Agent成Token消耗主宰,大模型推理服务底层逻辑重塑。文章介绍AI Agent时代范式转变、对推理基础设施的需求,还阐述了为其打造的AI Serving Stack架构及优势,它获2025年度相关卓越奖。
对话宋亚宸:从 3D 生成到世界模型,VAST想搭一套「可交互世界」的底座
VAST是一家专注通用3D大模型研发与落地产品建设的人工智能公司。创始人宋亚宸表示,3D生成未普及是缺3D UGC平台,所以从工具和模型入手。该公司核心产品Tripo Studio成果显著,今日还宣布完成5000万美元A轮融资。
这个开源模型的UI审美碉堡了~
当下流行基于大模型生成HTML源码可视化文本内容,网页审美对模型很难。早期用Claude 3.7,后有DeepSeek V3 0324等。Tesslate开源基于Qwen微调的模型,尺寸全,审美佳,想象空间大。
训练数据爆减至1/1200!清华&生数发布国产视频具身基座模型,高效泛化复杂物理操作达SOTA水平
清华大学与生数科技联合研发Vidar模型,首次让通用视频大模型长出‘手脚’,实现从虚拟到真实世界物理执行的跨越。它降低数据门槛,突破跨本体泛化困境,为服务机器人应用奠定基础。
独家对话极映科技高鑫:我们为什么要做一个比Sora难10倍的物理世界模型?|甲子光年
本文是对极映科技创始人高鑫的独家专访。极映源于高鑫早年体验,团队具深厚经验。其模型回归底层定律,响应快。投资人看好,专家认为能解决痛点。高鑫谈技术、前景、商业化等,称有望引领物理仿真变革。
8B模型可以超过GPT-4o!并行KV Cache压缩支持的128K长度外推方法ParallelComp
大模型长文本推理存在瓶颈,作者提出 ParallelComp 方案。它有并行 Attention 分块、KV 缓存智能淘汰与注意力偏差校准三大创新,能让 8B 模型性能达 GPT - 4o 的 91.17%,特定任务超 GPT - 4o。
AST | 西交大牛笑天、陈刚等:基于多尺度网格融合技术的复杂三维构型流场时空智能推理方法
文章针对复杂三维外形的强非线性非定常流场推理难题,提出MSGF数据预处理方法与DTECAU - 3D模型联合框架。MSGF解决数据提取难题,DTECAU - 3D解决传统U - net问题,经测试验证该框架效果良好。
AI在线强化学习“边做边学”,斯坦福团队让7B小模型性能飙升,甚至超越GPT-4o
斯坦福等团队提出新范式AgentFlow,由四个智能体组成,用在线强化学习持续提升智能体系统推理能力。以Qwen - 2.5 - 7B - Instruct为基座模型的它在多基准测试表现突出,甚至超越GPT - 4o等大模型。
爆冷!字节Seed 在CCPC 决赛只做出一道签到题,而DeepSeek R1 直接挂零?
第十届 CCPC 举行,字节 Seed 携 Seed - Thinking 参赛,结果意外,仅做出一题,DeepSeek R1 挂零。不同模型架构表现差异不大,暴露出大模型做算法题短板,推理模式表现更好。