贝叶斯自适应强化学习」共找到 760 篇相关文章

算法论文8

Agentic Deep Research新范式,推理能力再突破,可信度增加,蚂蚁安全团队出品

尽管LLM能力提升,但在复杂任务上受静态内部知识限制。业界提出Agentic Deep Research系统,不过现存系统有梯度冲突和奖励稀疏问题。蚂蚁安全团队提出Atom - Searcher,解决上述问题,实验效果良好。

机器之心
算法论文8

Discrete Tokenization:多模态大模型的关键基石,首个系统化综述发布

近年来,人们关注将LLM能力扩展至非文本模态,Discrete Tokenization成关键方案。但现有研究缺系统总结,香港科技大学等团队发布首个相关系统化综述,梳理技术脉络、方法及挑战,给出未来研究方向。

机器之心
新闻资讯7

“额度想重置就重置,不问财务”,Codex Tibo首曝幕后:产品没做好,就补偿用户

围绕 Codex 与 Claude Code 使用额度问题,社区不满额度机制不透明不可预测。Codex 团队 Tibo 公开额度重置逻辑源于补偿,并非营销。此外,还谈及产品融合、技术创新、算力决策等多方面内容。

InfoQ
推荐文章7

一个极度实用的深度思考Prompt,帮你挖出最本质的答案。

作者分享推特上一个让大模型深度思考的Prompt,调研后引入‘钢人论证’概念,指出其能避免AI谄媚。作者还写双向钢人Prompt,介绍其作用,并以公司司庆日选择为例展示效果。

数字生命卡兹克
算法论文8

只看图片就能学会压缩Token!浙大&阿里新框架多轮VQA压缩率90%,精度不掉|CVPR 2026

多轮视觉问答成LVLM推理效率“照妖镜”,现有压缩方法在多轮场景翻车。浙大宋明黎教授团队与阿里联合提出MetaCompress框架,可根据图像生成最优压缩映射,实验验证其效果优,能平衡压缩率与精度。

量子位
新闻资讯8

软件 3.0 时代来临

OpenAI 联合创始人 Karpathy 在 AI Ascent 2026 大会提出软件正经历第三次范式转移。从 Software 1.0 到 3.0,人类参与编程方式不断变化,3.0 用自然语言编程,中间层应用被模型原生能力吞噬。

AGI Hunt
8

刘壮陈丹琦新作:开源通用视觉推理RL框架,0思考数据刷新SOTA

普林斯顿刘壮团队、陈丹琦参与推出开源通用视觉推理RL框架Vero。它构建的视觉推理器在30多项测试达8B视觉语言模型SOTA,解决了开源RL方案的问题,所有数据、代码、模型均已开源。

量子位
推荐文章8

解决算力瓶颈,给多模态瘦身!Token压缩完整图谱与选型指南

给多模态大模型瘦身是解决算力瓶颈的关键。Token压缩技术可剔除视觉冗余,提升训练与推理效率。北大等团队剖析其全貌,给出完整图谱与选型指南,还揭示了未来演进路径。

AIGC开放社区
新闻资讯8

刚刚,阿里旗舰模型Qwen3-Max-Thinking发布,编程能力“踢馆”Gemini与Claude

阿里发布旗舰模型Qwen3-Max-Thinking,总参数超1万亿,在多项权威基准测试中表现优异,可与顶级闭源模型竞争。千问团队为其引入两项核心创新,提升推理性能,该模型已可免费体验。

InfoQ
新闻资讯7

战略落子!格芯收购新思科技这项业务

美国当地时间1月14日,格芯签署协议收购新思科技ARC处理器IP解决方案业务。该举措将加速其实体人工智能技术落地,强化竞争力,预计2026下半年完成,尚需监管批准。

芯师爷