「大涡模拟网络」共找到 5442 篇相关文章
字节最新大模型秘籍:只挑能有推理潜力的数据训练!1.3B模型无需标签自动挑选
字节Seed团队发布AttentionInfluence成果,用1.3B模型给7B模型选数据,无需训练和标签。通过比较基础与弱化模型损失差异评估数据影响,在多基准测试提升模型性能,还能结合分类器全面提升表现。
全球首个具身智能开放平台来了!让大模型长出“身体”,像人一样自然表达交互
魔珐科技发布全球首个具身智能3D数字人开放平台魔珐星云,能让大模型‘长出身体’,实现自然表达交互。该平台突破了‘高质量、低延迟、高并发/低成本’的不可能三角,还可驱动虚拟和真实具身。
全能高手&科学明星,上海AI实验室开源发布『书生』科学多模态大模型Intern-S1 | WAIC 2025
7月26日,上海AI实验室在WAIC 2025上发布并开源『书生』科学多模态大模型Intern-S1。它首创‘跨模态科学解析引擎’,在多学科专业任务基准上超越顶尖闭源模型,还具备体系化技术创新。未来将持续开源,打造更懂科学的AI助手。
ICML 2026 | 大模型为什么算不对加法?南大团队提出等本位和轨迹,揭示LLM算术错误的几何机制
南大团队研究LLM在多操作数加法中的内部表征结构,发现算术状态呈高度结构化几何流形。提出等本位和轨迹与噪声量化模型,解释模型算错加法原因,还设计推理时纠错方法。
都在卷「让大模型多循环几遍」,这个7B模型LoopCoder v2说:多循环 1 次就够了
当下推理模型流行在测试时多循环,以打磨答案。但新研究发现,7B模型LoopCoder v2只多循环1次(共2次),就能大幅提升性能,继续增加循环次数,性能反而下降。研究还分析了收益与成本,给出选择循环次数的诊断方法。
NUS Show Lab 寿政教授:打通自回归与离散扩散,打造下一代具身大模型底座|ECCV 2026
本文整理自新加坡国立大学Show Lab负责人寿政教授在ECCV 2026的分享,团队研发融合自回归与离散扩散的Show-o/Show-2统一架构,解决多模态理解与生成融合痛点,延伸至具身智能领域,突破数据稀缺、推理延迟等核心瓶颈。
监督学习未死,一题训练五小时起飞!华人学者新方法20倍训练效率释放大模型推理能力
大模型推理能力研究中,RL训练资源成本高、不稳定,传统SFT低数据量易过拟合。加拿大滑铁卢大学华人团队提出One - Shot CFT方法,用一题多解多点评训练,仅需约5个GPU小时,效果好、稳定性强。
数字技术工人已到岗!时序大模型+Agent已掌握了工厂生产管控技术,比人类更懂工况
基于时序大模型和Agent的数字技术工人,能承担生产操作等关键任务,接手复杂工业环节。国内AI团队打造的河谷平台构建智能体,自研底层技术,以工艺维度训练,上岗快,极峰科技还创新商业模式。
AI顶会反噬整个学术圈!「不发表就会死」,NeurIPS爆仓,博士年肝4.5篇大崩溃
NUS研究者指出,NeurIPS等AI顶会投稿量激增,正反噬学术圈。当前模式存在结构性危机,如学术产出泡沫化、环境代价高、研究者心理负荷大等。为此,他们提出“社区联邦会议”(CFC)模型以解决问题。
大模型开发实战从入门到入坑:动手写一个MCP Server去理解MCP背后的技术原理
文章聚焦MCP协议,介绍其是规范应用向大模型提供上下文的开放协议,能让模型调用接口更简单、实现开发解耦。还深度解析技术原理,手把手教从0到1实现MCP Server,助读者理解背后技术。