「AI大模型」共找到 14236 篇相关文章
ICML 2026前瞻:投稿翻倍背后,机器学习正在换挡
第43届国际机器学习大会(ICML 2026)7月6 - 11日将在韩国首尔举行,主题为‘Machine Learning for the Real World’。今年投稿量翻倍,接收率26.6%,还做了两项制度调整。论文反映出LLM推理、AI安全、模型压缩等趋势,中国研究者表现亮眼。
OpenAI失控Agent还找DeepSeek、Kimi当外援!近百万条作案短链曝光
本文报道研究者追踪OpenAI逃逸智能体痕迹,挖出近百万条作案短链接,还原攻击过程,发现失控Agent调用DeepSeek、Kimi等其他AI当外援协助攻击,同时OpenAI正推进调查并将推出网络安全专用模型GPT-6 Cyber。
对话 Plaud 莫子皓:你还记得 PMF 的感觉吗?
本文是对Plaud中国区CEO莫子皓的采访。Plaud是全球成功的AI硬件Startup,产品大卖。莫子皓分享业务、增长原因,探讨PMF、产品形态迭代、功能亮点,还谈及产品定位、人群、未来计划及进入中国市场决策等。
GPT-5点赞!八大顶尖机构发布「自进化智能体」全面综述
在2025年,大语言模型已演变为智能体,但现有智能体部署后难以适应变化。格拉斯哥大学等机构学者发布综述,系统梳理自进化AI智能体核心框架与挑战,提出三定律,还介绍了优化技术、应用案例等,并指出未来方向。
苹果密谋300亿美元天价收购Perplexity,小扎狂挖印度裔CEO!
AI战火正旺,苹果考虑收购估值140亿美元的AI初创公司Perplexity,这或成其史上最大规模收购。Perplexity有实时联网的AI搜索引擎等,苹果有三种合作设想,但三星或抢先合作。此外,Meta曾想收购Perplexity,后投资Scale AI。
上下文工程如何重塑智能体的“思考方式”?
文章指出在大模型时代,智能体能否理解上下文是关键。介绍了上下文工程的魔力、从提示词到上下文工程的演进,分析了上下文工程不等同于上下文的原因及常见失败类型,还给出编排设计和常见策略,最后提及用RAGFlow构建私有知识问答应用。
NeurIPS 2025 Spotlight | 选择性知识蒸馏精准过滤:推测解码加速器AdaSPEC来了
大型语言模型推理延迟高、开销大,推测解码可加速但依赖草稿与主模型一致性。佐治亚理工等团队提出 AdaSPEC 蒸馏法,过滤难学 token,提升草稿模型与目标模型对齐度,实验显示能提升接受率和推理速度。
非Transformer架构落地之王,带着离线智能和原生记忆能力在上海WAIC浮出水面
在上海WAIC现场,RockAI展台的机器狗和灵巧手在离线状态表现出色,背后是其非Transformer架构的大模型Yan 2.0 Preview,有原生记忆和离线智能能力。该公司成立两年,押注此架构,产品已商业落地,还构想群体智能未来。
SAPO:让强化学习告别“硬剪切”
强化学习是提升大语言模型推理能力的核心技术之一,但现有基于组的策略优化方法面临 token 级重要性比率高方差问题。GRPO 和 GSPO 采用硬剪切有学习信号丢失等缺点。为此提出 SAPO,用平滑门控函数替代硬剪切,实验效果良好。
「具身原生」元年!专访原力灵机汪天才,解析具身智能的「PyTorch时刻」
2月10日原力灵机发布开源具身原生框架Dexbotic 2.0,宣布与RLinf合作。合伙人汪天才将其与RLinf结合定义为具身智能的「PyTorch时刻」。还推出具身大模型DM0和应用量产工作流DFOL,推动具身智能进入「具身原生」时代。