善意的混乱」共找到 10488 篇相关文章

产品应用8

小模型,大能量!200美金GPT Pro竟然输给了它?

博主用11个场景深度测试昆仑万维Skywork R1V4 - Lite,它能做到Gemini 2.5 Pro才能干事,速度快、成本低。在定位、人物识别、生活实用、专业鉴定、学术研究等场景表现出色,核心突破在于主动图像操作与深度推理。

AI产品黄叔
新闻资讯7

OpenAI最新技术报告:GPT-4o变谄媚原因万万没想到

OpenAI发布技术报告解释GPT-4o更新后“变谄媚”原因,是强化学习及用户记忆等因素共同导致。还分享了上线前未发现问题缘由及后续改进流程多方面举措,同时提到对用系统提示词控制模型行为存疑。

量子位
新闻资讯7

对话蚂蚁 AWorld 庄晨熠:Workflow 不是“伪智能体”,而是 Agent 里程碑

文章围绕AI Agent展开,蚂蚁集团AWorld算法负责人庄晨熠认为,当前AI陷入‘应试狂热’,Workflow是智能体发展里程碑,群体智能与大模型相辅相成,还分享了智能体应用实例及对未来规划。

AI科技大本营
算法论文8

Self-evolving Agents过程并非总是良性,要警惕这些“错误进化”风险

近年来,基于大语言模型智能代理成为热点,自进化代理可自我改进。但论文指出其进化可能“跑偏”,出现“错误进化”,并揭示了不同进化路径风险,还提出缓解策略,呼吁重视其安全性。

深度学习自然语言处理
算法论文8

研究者警告:强化学习暗藏「策略悬崖」危机,AI对齐根本性挑战浮现

强化学习是大模型推理与对齐核心方法,但常带来模型行为脆弱等问题。上海人工智能实验室徐兴成博士论文揭示‘策略悬崖’挑战,分析其成因,解释多种对齐失败现象,并提出对AI研究启示。

机器之心
开源动态7

视频推理界“福尔摩斯测试”:所有大模型,统统不及格 | 论文代码开源

腾讯ARC Lab和香港城市大学推出Video - Holmes,这是视频推理界‘福尔摩斯测试’,能展现多模态大模型复杂视频推理能力边界,规避现有Benchmark痛点,测试中所有大模型全部不及格,代码已开源。

量子位
算法论文8

以星为舵:LLMPost-Train与Rest-Time奖励学习综述

这篇论文提出奖励信号像AI“导航星”,引导模型优化行为。介绍奖励学习概念、来源、形式和策略,阐述其贯穿LLM生命周期三个阶段,探讨奖励模型设计选择,还提及实际应用、挑战与未来方向。

深度学习自然语言处理
推荐文章7

装了N个skills之后,鹅厂员工觉得“最香”是哪一个?

文章围绕技能使用展开,介绍鹅厂员工推荐各类实用技能,如腾讯文档 skill、westock - data、小区避坑神器等,还鼓励读者分享自己宝藏 skill 或想法,关注有奖励。

腾讯技术工程
新闻资讯7

第一批用Clawdbot赚钱人类出现,一晚上狂赚300万!全球金融变天了?

新智元报道,已有人类用Clawdbot集成到Polymarket一晚上狂赚49.3万美元,Moltbook上Agent还发布供AI赚钱指南。AI自建文明加速,未来赚钱是否带人类成疑问。

新智元
产品应用8

一文读懂DeepSeek-V3.2核心技术DSA:API疯狂降价性能不减背后

DeepSeek发布实验模型DeepSeek V3.2,引入自研稀疏注意力机制DSA,API价格最高降75%。DSA先筛选后计算,含闪电索引器和稀疏多潜在注意力两组件,分四步工作,权衡了精确性与速度。

AI寒武纪