可验证推理」共找到 6140 篇相关文章

新闻资讯7

8 位 AI Infra 高管复盘 WAIC:当堆砌「暴力美学」触顶,AI Infra 如何求变?

雷峰网与8位参展AI Infra公司的决策者交流,捕捉行业新方向和共识。今年行业关注重心从拼规模转向比效率,Token推理成算力消耗主体,AI工厂和Token工厂共生,未来竞争聚焦效率,不同玩家各有优劣。

AI科技评论
产品应用8

Kimi新出的Agent集群,到底有多恐怖?

Kimi发布K2.5模型及Agent集群功能,将国产AI推向“组织智能”新高度。K2.5全能且开源,多项评测优于GPT - 5.2 - xhigh且成本低。Agent集群按需协调子Agent,实现“角色涌现”与“3D编排”。

newtype AI
新闻资讯8

浙江,冲出一匹碳化硅芯片全球黑马!

在‘双碳’目标与数字中国建设蓝图下,电能管理机遇巨大。黄兴博士指出将供电架构优化为高压直流降低能耗,关键在于碳化硅功率芯片。其创办的派恩杰半导体,自主研发芯片,从芯片到封装助力客户,迎来产业机遇。

芯师爷
新闻资讯7

老外傻眼!明用英文提问,DeepSeek依然坚持中文思考

DeepSeek-V3.2和DeepSeek-V3.2-Speciale推理能力显著提升,海外研究者用英文提问,它却用中文思考。评论有两种观点,相关论文显示中文省token但非最有效,大模型选思考语言并非只看效率。

机器之心
产品应用7

Sora 2干翻Veo 3?超全对比实测:会中文脱口秀,但体操翻车,附有效邀请码

OpenAI推出Sora2,生成20秒1080p视频,在物理准确性等方面更优,还具备音画同步能力。文章对Sora2和谷歌Veo3进行多轮对比实测,涉及不同场景,也提及Sora2版权保护及App相关情况。

机器之心
推荐文章7

Kotlin Multiplatform 评估:跨平台开发中的优势与权衡

文章评估了 Kotlin Multiplatform(KMP)在跨平台开发中的优劣势。KMP 共享代码,编译成原生代码获出色性能,保留原生 UI 选项。虽生态小、有学习曲线等问题,但 Netflix 等大公司已用,未来潜力大。

InfoQ
算法论文7

DeepSeek的GRPO会导致模型崩溃?看下Qwen3新范式GSPO

文章围绕大语言模型后训练阶段的强化学习算法展开。介绍了OpenAI的RLHF、DeepSeek的GRPO,重点指出Qwen团队发现GRPO有稳定性问题,会致模型崩溃,进而提出新算法GSPO,实验显示其效率和扩展性更佳。

机器之心
算法论文8

无需标注和奖励模型!仅靠自信度RL,16个样本训练20步,效果飙升21%!

论文提出RLSC,让大语言模型用自身答案置信度作奖励信号,摆脱人类标注依赖。它以模型自信度内部信号替代多数投票外部信号,小成本提升模型数学能力,还让模型学会快推理,不过也存在安全隐忧。

深度学习自然语言处理
算法论文8

算法1年翻倍,芯片2年翻倍?重磅实锤:AI正在自我加速,拦不住了

NBER论文证明AI研发自我加速反馈环强度远超其他科技领域,芯片效率每2年、算法效率每1年翻倍。部分自动化就能引爆反馈环,全行业13%自动化率或软硬件17%自动化率触发奇点,6年内AI能实现自我迭代。

新智元
产品应用7

Anthropic更新了Skill Creator,评测框架上线

Anthropic更新Skill Creator,上线评测框架。该框架无需写代码,能处理两类技能测试需求,测试和改进技能,有捕获质量回归等用途。还增加基准模式、多Agent支持等,能让技能触发更靠,更新已在Claude.ai等用。

AI工程化