上科大」共找到 6413 篇相关文章

算法论文8

ICLR 2026 | LongHorizonUI:让 GUI 智能体不再"半途而废"——面向长链路任务的统一鲁棒自动化框架

近年来,基于多模态语言模型的GUI智能体在自动化操作虽有进展,但任务步数超10 - 15步时成功率断崖下跌。研究人员提出LongHorizonUI框架,构建LongGUIBench评测基准,推动GUI自动化在复杂场景落地。

机器之心
算法论文8

DeepSeek-GRPO重要性权重设计错误?详解Qwen3新强化学习算法GSPO

论文指出GRPO在语言模型训练中不稳定,因其重要性权重设计错误易引入高方差噪声。为此提出GSPO算法,从序列维度计算梯度,解决了MoE模型RL训练的稳定性问题,在Qwen3效率更高。

深度学习自然语言处理
算法论文8

苹果再发论文:精准定位LLM幻觉,GPT-5、o3都办不到

近日苹果发布重磅论文,提出 RL4HS 方法,用强化学习训练模型,能准确标出答案中幻觉部分,还使用片段级奖励和类别感知的 GRPO,在片段级幻觉检测任务超 GPT - 5 和 o3。

机器之心
开源动态8

2M小模型定义表格理解极限,清华学崔鹏团队开源LimiX-2M

语言模型在结构化表格数据处理表现不佳,清华学崔鹏团队开源的 LimiX-2M 模型,仅 2M 参数,却能同时支持分类、回归等任务,性能超越经典模型,且训练、运行成本低,研友好。

机器之心
产品应用8

刚刚,MiniMax直接让龙虾学会自我进化,也认识「马嘉祺」了

在 GTC 2026 ,英伟达推出 NemoClaw。国内 MiniMax 加快‘AI 养虾’布局,推出 MaxClaw 模式。新发布的 M2.7 能力升级,在多方面表现出色,还在研评测中获佳绩,实测效果良好,开启自我进化。

机器之心
7

统治AI十年的Transformer,要被亲爹亲手砸碎?

5月5日旧金山的辩论赛,Transformer联合发明人Łukasz Kaiser为其作品辩护,三位挑战者指出Transformer五死穴。Kaiser称除非新架构证明有更好的scaling曲线,否则Transformer仍是主流,还给出具体辩护。

新智元
新闻资讯7

2025年了,AI还看不懂时钟!90%人都能答对,顶尖AI全军覆没

AI基准ClockBench测试AI读模拟时钟能力,人类平均准确率89.1%,11个主流模型最好仅13.3%。研究展示了LLM局限性,分析了可能原因,还对比了不同模型表现及在各类问题的差异。

新智元
产品应用8

刚刚,豆包「成精」了!一夜告别机械感,亿人手机全量线

字节跳动Seed团队发布原生全双工语音模型Seeduplex,已在豆包App全量线。它边听边说、懂思考停顿、抗干扰强,解决了精准抗干扰与动态判停难题,工程也有突破,提升了交互体验。

新智元
开源动态8

多模态长文本理解测评首发:46款模型无一攻克128K难关

香港等研究者联合提出MMLongBench,用于评估多模态模型长文本理解能力。它覆盖5类型任务的16个数据集,对46个模型测试显示,闭源和开源模型在长下文任务均面临挑战,OCR和跨模态检索能力是瓶颈。

量子位
开源动态8

OpenAI携手五巨头开源革命性超算协议:一举解决超集群LLM训练不稳定和网络性能难题

OpenAI联合英伟达等五巨头推出超算开放网络协议MRC并正式向行业开放。MRC目标是性能可预期,有多平面网络、自适应包喷射、SRv6源路由三核心机制,已在OpenAI多台超级计算机部署。

AI寒武纪