推理严谨性」共找到 2492 篇相关文章

产品应用7

这才叫AI原生应用:Google Slides

Google Slides是Google版AI PPT,与传统AI PPT不同。它像传统PPT搭配AI聊天机器人,用Nano Banana模型可直接生成图片和文字,能像素级推理,打破传统PPT结构,还可自然语言交互修改,只是中文生成效果待提升。

newtype AI
新闻资讯7

前Meta大神创业,用强化学习打造PokeeResearch-7B模型,刷新AI深度研究SOTA

Pokee AI发论文介绍70亿参数的PokeeResearch - 7B模型,用基于AI反馈的强化学习和推理框架,在深度研究基准测试中成绩领先。该公司由前Meta大神创立,产品可打通多应用,已获融资并公开测试。

AIGC开放社区
开源动态8

HAMi 2.7.0 重磅发布 | 异构芯片全面拓展,调度更稳、生态更强

Dynamia密瓜智能宣布发布HAMi 2.7.0版,在硬件生态、调度器、应用层生态等方面有显著进展。硬件上支持昆仑芯、燧原、AWS等芯片;调度器优化了资源计算和可观测;应用层与vLLM、Xinference等整合。

InfoQ
产品应用7

实测DeepSeek V3.1,不止拓展上下文长度

文章实测了DeepSeek V3.1和V3,发现V3.1在编程、写作、翻译等方面有变化,如编程更全面、写作风格变文艺等。网友测试其在aider得分71.6%成非推理模型SOTA,但线上API有问题。

量子位
开源动态8

o3 Gemini 都翻车?首个可验证长链 GUI 数据集 VeriGUI 重磅开源,探索通用 Agent 能力边界

GUI 智能体发展遇瓶颈,现有数据集难评估其长时程规划能力。2077AI 开源基金会牵头构建的 VeriGUI 应运而生,有长链复杂与子任务级可验证特征,论文登 Hugging Face 月榜第三,还证明现有模型瓶颈。

AI科技评论
7

以史为鉴:从互联网泡沫到英伟达五万亿

文章回顾互联网发展历程及泡沫破灭影响,对比当下AI浪潮,指出英伟达成首家市值破五万亿美元公司。探讨AI是否为泡沫,认为其未来发展或类似互联网,还分析英伟达走势及国产GPU替代、AI边缘推理领域前景。

芯师爷
算法论文8

智能体新范式Chain-of-Agents,多项任务新SOTA

论文提出Chain-of-Agents (CoA) 范式,结合多智能体系统与工具集成推理优势。通过多智能体蒸馏和智能体强化学习训练智能体基础模型(AFM),实验显示其在Web和Code任务上达新SOTA,效率、泛化佳。

深度学习自然语言处理
开源动态7

LM Studio宣布支持在Mac上跑Qwen3-Next 80B模型

LM Studio宣布支持基于MLX框架在Mac上运行阿里Qwen3-Next 80B模型。该模型虽总参数量达800亿,但每次推理仅激活30亿。第三方评测显示其4bit量化运行效果好,不过实现GGUF格式支持尚需时间。

AI工程化
开源动态7

24张图,从GPT-2到gpt-oss,看OpenAI开源模型技术演进

2025年8月OpenAI释出gpt-oss-20b与gpt-oss-120b两个开源权重模型。文章梳理了从GPT - 2到gpt - oss的技术演进,拆解关键创新点,对比了与Qwen3的差异,介绍训练推理细节、实测体验及与GPT - 5跑分对比情况。

PaperAgent
新闻资讯7

Axiom Math 对谈 SGLang:模型的下一步是可验证,结果层才是真正的护城河

在AGI Playground 2026圆桌论坛,Axiom Math联合创始人等探讨AI核心问题。提到AI进入生产环境,可验证或成瓶颈,还从长任务智能体、推理基建等多方面深入交流,如模型验证、基建优化等。

Founder Park