「推理不确定性」共找到 2108 篇相关文章
阿里达摩院开源多模态医学大模型—灵枢
大模型在医疗领域应用有医疗知识覆盖不足、幻觉风险高、推理能力欠缺三大难题。阿里达摩院开源统一多模态医学大模型灵枢,介绍其数据体系、清洗流程及四阶段强化训练方法。
野生DeepSeek火了,速度碾压官方版,权重开源
近日,德国AI咨询公司TNG推出的「DeepSeek R1T2」模型火了,速度比R1快20%,性能不弱于R1。它采用AoE技术,融合官方三大模型,开源且在Hugging Face开放权重,获不少人期待。
Agent性能暴涨90%,刷榜GAIA可太容易了~
今年AI Agent层出不穷,当前研究缺乏统一标准、复现难。oppo Agent团队分享构建高效Agent的关键组件及刷榜GAIA的方法,从事实获取能力和逻辑推理保真度两维度分析,介绍了强化感知和提升思维的策略。
Databricks × Snowflake 纷纷下注,PostgreSQL 成 AI 时代数据库标准?
文章结合作者对数据基础设施的实践与反思,探讨生成式AI时代数据系统的挑战与机遇。介绍数据基础设施新趋势,分析Neon、Supabase等公司受关注原因,指出PostgreSQL成行业标准,还提出Data Warebase概念及优势和应用场景。
微软再放LLM量化大招!原生4bit量化,成本暴减,性能几乎0损失
微软公布BitNet v2,性能几乎0损失,占用内存和计算成本显著降低。它首次实现对1比特LLMs的原生4比特激活值量化,通过H - BitLinear模块处理异常通道,实验显示其在多方面表现优异。
Claude 4破解困扰人类4年系统bug,30年码龄程序员200小时没搞定,GPT-4.1/Gemini-2.5也做不到
30年码龄程序员4年没搞定的顽固型‘白鲸bug’,Claude Opus 4配合Code模式,用30个prompt+1次重启,几小时就破解。此前GPT - 4.1等模型都失败,凸显Claude编程与推理能力强。
Veo 3全网实测惊艳所有人!DeepMind CTO:规模是AGI全部吗?
谷歌推出视频生成模型Veo 3,一句提示词就能打造电影质感短片,还能音画同步,引发网友惊叹。DeepMind CTO在访谈中表示,规模非AGI唯一要素,还提及Deep Think模式及Veo 3进展等。
北大校友、OpenAI前安全副总裁Lilian Weng关于模型的新思考:Why We Think
北大校友Lilian Weng更新博客《Why We Think》,回顾利用测试时计算研究进展,探讨激励模型思考方式,介绍思维链、并行采样、序列修订等策略,还提及强化学习、外部工具使用及未来研究方向。
实测腾讯Hunyuan-Image2.0,首个毫秒级实时图像生成模型
今天上午腾讯发布混元图像2.0,以“更智能、更开放、更中国”为理念。其参数规模提升,推理时间大幅压缩,实现毫秒级实时生成,还在画面质量等方面升级,新增实时绘画板功能。
启发学习:让大模型认知从外化到内生
当下大模型能力多靠人为框架,能力上限受限。文章提出“启发学习”,将其集成到推理侧成Isaac框架,通过Prompt与网络层注入复用旧经验,实验显示能大幅提升大模型任务性能。