「扩散大语言模型」共找到 7878 篇相关文章
0.027B手机AI模型,估值2亿美金,三个清华学霸如何获得国际大学生创新大赛冠军
10月15日,清华万格智能团队“基于类脑架构的下一代通用模型与智能体生态”获中国国际大学生创新大赛(2025)冠军。团队由三个清华本科生创立,此前已完成融资,估值达2亿美元。其智人HRM模型有诸多优势,还研发出顶尖气候预测专家模型。
ICML 2025 | M+框架来了,增加LLM隐空间记忆,不再受上下文窗口限制
本文提出M+长期隐空间记忆扩展框架,在MemoryLLM之上,将8B级模型有效记忆跨度从不到20k提升到160k+,显存占用不变。它解决了现有记忆模型冗余、冲突难解等问题,为下一代语言模型提供支撑。
NeurIPS2025 Spotlight | RobustMerge: 多模态大模型高效微调模型合并的全新范式
中科院、中山大学、北大团队针对高效微调模型合并难题,提出「方向鲁棒性」概念,揭示 PEFT 模块合并失败主因,给出 RobustMerge 解决方案,提升性能,成果开源。
浙大推出首个「多图应用题」基准GSM8K-V,全面评估 VLM数学推理能力
浙江大学团队推出视觉数学推理基准GSM8K-V,将GSM8K映射为视觉对应版本。它数据可靠、覆盖全面,经三阶段构建。实验显示,现有视觉语言模型在视觉推理上短板明显,为模型发展指明方向。
什么是系统提示词?如何逆向提示词?
大语言模型启动时会接收系统提示词,决定其角色、回答风格与安全边界。提示词逆向是试图获取或绕过该提示的行为。本文介绍其作用、逆向手法及开发者防御措施,助于安全使用和设计大模型。
AI 真能看懂物理世界吗?FysicsWorld:填补全模态交互与物理感知评测的空白
多模态大语言模型正经历范式转变,目标是实现全模态协同交互。但现有评测体系难跟上模型发展。飞捷科思和复旦团队推出 FysicsWorld 基准,可评测模型多能力,还提出 CMCS 策略,为全模态智能发展提供指引。
「流匹配」成ICML 2025超热门主题!网友:都说了学物理的不准转计算机
第42届国际机器学习大会(ICML)2025年7月将在加拿大举行,生成式AI前沿热点转向高质量、稳定、简洁、通用模型形态,流匹配技术踩中热点。它源于流体力学,能将噪声转化为数据,与扩散模型有紧密联系。
谁是2025年度最好的编程语言?
在2025年IEEE Spectrum编程语言排行榜上,Python十连冠且成三冠王,与第二名差距大,还借AI放大优势。JavaScript排名波动大,SQL宝座被冲击。同时,编程社区文化衰落,AI或终结编程语言多样性。
终结数据荒!智源开源首个Deep Research数据合成框架InfoSeek
在大模型深度研究中,高质量数据是短板。近日,智源研究院发布首个面向深度研究的开源数据集InfoSeek,提出「扩散 - 回溯」数据合成方法,用3B模型在基准测试中接近商业模型表现,且数据集可扩容。
苹果憋一年终超同参数 Qwen 2.5?三行代码即可接入 Apple Intelligence,自曝如何做推理
今年 WWDC 大会上,苹果推出专为增强 Apple Intelligence 功能的语言基座模型,含约 3B 参数紧凑型与基于服务器的混合专家模型。经优化可在苹果芯片高效运行,改进工具使用与推理能力,评测显示设备端模型表现优。