推理质量」共找到 2602 篇相关文章

推荐文章7

大模型最难的AI Infra,用Vibe Coding搞定

Andrej Karpathy 力荐的 Vibe Coding 在 AI Infra 开发中常「水土不服」,存在上下文丢失、决策偏离、质量不稳定等问题。文章提出文本驱动的 Vibe Coding 方法,并以 Agentic RL 中的资源调度系统为例验证其有效性,还介绍了相关团队和工具。

机器之心
开源动态7

1.5B参数!支持本地实时语音转录

Liquid AI发布首个端到端音频基础模型LFM2 - Audio - 1.5B,参数1.5B,能在本地设备处理高质量端到端音频任务。它是统一多模态模型,支持两种生成策略,多种应用场景,虽仅支持英文但性能出色。

AI工程化
新闻资讯8

诺奖、金牌与SOTA:谷歌2025八大领域核心突破年终回顾

2025年是AI成为社会基础能源的关键转折点,谷歌通过全栈自研与生态标准双轮驱动构建智能基础设施帝国。从模型推理到科学发现领域均有突破,如Gemini 3系列、Ironwood芯片等,还在各领域有诸多应用与探索。

AIGC开放社区
产品应用8

揭秘!腾讯如何训练多智能体像专家一样设计游戏场景

腾讯游戏提出游戏场景自动布局生成系统IntelliScene 2.0,利用图像引导生成3D场景。它构建多智能体工作流,结合高质量数据集,经模型微调、视觉解析等步骤生成场景,经评估效果良好,为AI生成三维信息提供新路径。

腾讯技术工程
算法论文8

PPO-Clip的「盲点」被补齐了?快手提出熵比裁剪方法,从局部约束到全局稳定的关键一跃

快手科技语言大模型团队提出熵比裁剪(ERC)方法,应对强化学习中信任域偏离问题。该方法从全局视角稳定策略分布,在多个数学推理基准实验中提升了模型性能,还与多种方法对比验证了泛化能力。

机器之心
推荐文章7

AI 时代,编程语言选型更难也更重要:Go、Rust、Python、TypeScript 谁该上场?

AI 写码成常态,编程语言选择更重要。创业者 Armin Ronacher 指出语言权衡需重审,会影响 Agent 代码质量。他认为 Go 在 AI 场景合适,公司绕不开 Python 和 JavaScript。还分析多种语言特点、适用场景及 AI 对编程的影响。

InfoQ
新闻资讯8

陶哲轩亲测!GPT-5 Pro 40分钟破解3年难题,登顶最难数学考试

数学家陶哲轩将几何难题交给GPT - 5 Pro,虽推理完美但无解。同一周,GPT - 5 Pro在FrontierMath测试集夺冠。陶哲轩测试发现AI在科研不同层面表现有别,也揭示了AI理解力受限及人类与AI的分工边界。

新智元
开源动态8

碾压DeepSeek V3!阿里开源新版Qwen-3,屠榜级断层第一

今天凌晨1点,阿里巴巴开源Qwen3系列新版本Qwen3 - 235B - A22B - 2507。它是非思维推理的指令微调模型,性能强劲,在多类测试基准中大幅超DeepSeek开源的新版V3 - 0324及月之暗面的kimi - k2。

AIGC开放社区
推荐文章7

醒醒吧!CEO猛吹AI写95%代码,绩效考核却还在拼程序员手速?

本文是对 Superhuman 工程负责人 Loic Houssier 的深度访谈。他分享了 AI 时代团队管理、开发流程、绩效评估等方面的变化,指出 AI 虽提升效率,但在质量评估、人才适配等方面仍需探索,还强调观望 AI 发展会有职业风险。

AI前线
开源动态8

500万视频数据集+全新评测框架!北大开源主体一致性视频生成领域新基建OpenS2V-Nexus,生成视频 「像」 又 「自然」

北大团队推出开源套件OpenS2V - Nexus,含全球首个S2V细粒度评测基准OpenS2V - Eval和500万条高质量人物文本视频三元组数据集OpenS2V - 5M,还评测18个S2V模型,揭示主流模型能力差距。

机器之心