研究任务」共找到 3560 篇相关文章

算法论文8

告别海量标注!浙大团队提出GUI-RCPO,让GUI定位在无标签数据上自我进化

浙大等机构研究人员提出GUI - RCPO,这是自我监督强化学习方法,能让模型在无标注数据上提升GUI grounding能力。其通过迁移思想,利用区域一致性自我提升,实验表明该方法有效且有泛化能力。

量子位
新闻资讯7

Anthropic承认模型降智后仍放任其偷懒?Claude Code用户信任崩塌中

此前大模型厂商未正面承认‘降智’,OpenAI 研究科学家称是心理错觉。但 Anthropic 公开承认旗下 Claude Opus 4.1 和 Opus 4 质量降级,然而问题未解决,Claude Code 用户信任崩塌,纷纷转向 GPT - 5。

机器之心
推荐文章7

一文讲清三种AI应用系统的架构及及TOP威胁框架

文章从AI系统分类及架构出发,分析不同类型AI系统的威胁特征,并介绍现有的威胁分析框架。目前AI应用架构经历从GenAI到AI Agents,再到Agentic AI的演进,各方向独立发展,且威胁各有特点又有重合。

AI与安全
新闻资讯7

GPT正面对决Claude!OpenAI竟没全赢,AI安全「极限大测」真相曝光

OpenAI和Anthropic罕见合作,测试双方模型在幻觉等四大安全方面的表现。这场合作是AI安全的里程碑,百万用户每天的互动推动安全边界扩展。文中详细对比了GPT和Claude模型在各安全测试中的表现。

新智元
算法论文8

Agentic Deep Research新范式,推理能力再突破,可信度增加,蚂蚁安全团队出品

尽管LLM能力提升,但在复杂任务上受静态内部知识限制。业界提出Agentic Deep Research系统,不过现存系统有梯度冲突和奖励稀疏问题。蚂蚁安全团队提出Atom - Searcher,解决上述问题,实验效果良好。

机器之心
开源动态8

打破瓶颈,让RAG学会思考:中科大、智源等发布推理检索框架BGE-Reasoner

人工智能浪潮下,推理密集型信息检索是RAG和AI Agent技术发展瓶颈。中科大、智源等机构联合研发推理检索框架BGE - Reasoner,在BRIGHT基准测试中刷新纪录,还将开放相关代码等推动研究

机器之心
产品应用8

文库 GenFlow2.0,这个特性让我大吃一惊

作者作为创业者和 Agent 重度用户,分享了使用文库 GenFlow2.0 的体验。它是全球首个全端通用 Agent,支持多 Agent 并行工作,过程可干预,整合多维生态,交付形态接近专业生产工具,还支持 MCP 协议开放能力。

MacTalk
算法论文8

Make SFT Great Again!从SFT到DFT:一权重之差,泛化之跃

大型语言模型的监督微调(SFT)简单高效,但泛化能力弱于强化学习(RL)。本文直击 SFT 核心缺陷,揭示其泛化瓶颈源于隐含的“病态奖励结构”,并提出仅需单行代码修改的动态微调(DFT),实验表明其效果显著。

深度学习自然语言处理
新闻资讯7

GPT-5 的秘密武器:Universal Verifiers

OpenAI开发「Universal Verifier」(通用验证器)技术助力GPT - 5。该技术让一个AI模型检查另一个模型输出质量,解决了强化学习难题,使GPT - 5在多领域表现出色,不过技术可能因人员流动扩散。

AGI Hunt
推荐文章7

普通人也能用得上的 Context Engineering 技巧

现在讨论Context Engineering大多关注高级AI Agent,对普通用户实用性不强。本文总结普通人用AI时的上下文工程技巧,如用更少、更准确的上下文控制输出,从精简和准确两方面展开阐述。

宝玉AI