上科大」共找到 6378 篇相关文章

新闻资讯7

Meta“腿”后,自家公司要搞黄了?Scale AI狂丢客户,又遭6年老员工“背刺”

9月3日外媒报道,Meta支持的Scale AI起诉前员工Eugene Ling及竞争对手Mercor,称其“盗用商业秘密”“违反合同”。Mercor反驳,称对Scale商业秘密无兴趣。Scale与Meta合作后狂丢客户、裁员,还出安全事故。

AI前线
算法论文8

清华交满分论文证明:强化学习并不能让模型更会思考!

清华和交在NeurIPS 2025的研究《Does Reinforcement Learning Really Incentivize Reasoning Capacity in LLMs Beyond the Base Model?》获满分。研究聚焦RLVR,发现强化学习不能让模型更会思考,推理能力限仍由基础模型决定。

AI工程化
新闻资讯8

啊?微博7800美元训的模型,数学能力超了DeepSeek-R1

近日,微博发布自研开源模型VibeThinker,15亿参数却在数学测试击败6710亿参数的DeepSeek R1,后训练成本仅7800美元。其为AI产业带来新思考,还将推动微博AI应用发展。

量子位
算法论文8

省下1.25倍算力!Kimi这篇论文,可能改写所有模型的训练方式

模型层数增多时,残差连接存在PreNorm稀释问题,导致后面层贡献被稀释。Kimi论文提出Attention Residuals方案,还给出工程解法Block AttnRes,实验显示能省算力且提升效果。

AI寒武纪
新闻资讯7

Redis 之父:哪怕被喷我也得说,AI 远远落后于人类程序员!开发者跟评:用模型气得我自己写代码都有劲儿了

Redis之父Antirez分享开发经历称人类程序员仍比模型出色,举例说明在解决Redis复杂bug时,人类的创造力能想出奇特有效的解法,而模型较难做到。开发者看法不一,有将其当助手,也有认为它会干扰思路。

InfoQ
算法论文8

10行代码,AIME24/25提高15%!揭秘模型强化学习熵机制

来自多机构的研究者揭示模型强化学习中熵变化机制。发现策略熵在训练中急剧下降致性能停滞,提出 Clip - Cov 与 KL - Cov 两种正则化技术调控高协方差标记,遏制熵塌缩,在部分数据集性能提升显著。

机器之心
新闻资讯7

究竟会花落谁家?DeepSeek最新模型瞄准了下一代国产AI芯片

近期,DeepSeek发布V3.1新模型,采用全新混合推理架构,在多任务表现有提升。它采用UE8M0 FP8,或为国产推理芯片优化机制。国内多家厂商新一代AI芯片支持FP8,未来国产模型或针对其专门优化。

机器之心
推荐文章8

从WAIC爆火的功夫机器人,看到这家央企的具身智能「真功夫」

今年4月“功夫boy”机器人出圈,3个月后的WAIC它全新升级。其背后是中国电信人工智能研究院(TeleAI),由李学龙教授带领。他们技术栈全面,在硬件、软件、数据等方面全栈自研,还布局智传网,未来发展潜力

机器之心
开源动态7

OpenClaw 之后,Agentic RL有了新训练范式

模型技术推动AI从‘回答问题’迈向‘执行任务’,Agentic AI兴起。中国认知智能全国重点实验室提出Claw - R1项目,将前沿Agent Runtime与强化学习训练框架结合,为Agentic AI提供新训练基础设施。

PaperAgent
算法论文8

彭一杰教授课题组提出RiskPO,用风险度量优化重塑模型后训练

彭一杰教授课题组提出 RiskPO,解决模型后训练陷入「均值陷阱」问题。它将风险规避理念融入优化目标,用「关注奖励分布左尾」替代「追求整体均值」,在多领域数据集表现超越 GRPO 等。

机器之心