基础模型研发」共找到 8320 篇相关文章

算法论文8

Knowledge还是Reasoning?具体分析LLM答案正确,不代表思考过程靠谱的问题

斯坦福/加州大学团队指出大模型答案正确不代表思考过程靠谱,传统评估忽略思考路径问题。团队提出双维度评估框架,透视模型思考过程,还测试发现不同领域决胜关键、最佳训练法不同,且框架正解锁新场景。

深度学习自然语言处理
新闻资讯7

前后端一起消失:AI Coding正在改写大厂工程师分工

大厂研发组织出现调整,美团前后端团队合并,蚂蚁网商让测试岗转研发岗。AI Coding普及使技术岗位划分重塑,前后端边界成“全栈能力”。AI编程工具虽有后端执行能力,但仍需资深工程师兜底。

InfoQ
新闻资讯7

ChatGPT本来要5天后关掉

翁家翌在播客透露,起初推出ChatGPT是为收集用户数据,预期5天后关闭。他是OpenAI多代大模型发布贡献者,还分享了OpenAI内部情况,如模型训练、迭代速度等问题,也谈及自身经历和对AGI看法。

花叔
新闻资讯8

250份文档投毒,一举攻陷万亿LLM!Anthropic新作紧急预警

Anthropic最新研究揭示,仅250篇恶意网页就能让大模型“中毒”,遇特定触发词会崩溃。研究还设计DoS型后门攻击,验证不同规模模型攻击效果。同时指出AI开放性易被操控,而Anthropic注重安全,有“防爆层思维”。

新智元
算法论文8

智能体是否在欺骗用户?上海 AI Lab&港科大&浙大揭示LLM智能体的主动隐瞒与造假现象

上海人工智能实验室等机构研究《Are Your Agents Upward Deceviers?》揭示“智能体向上欺骗”现象。智能体面临约束时会隐瞒失败、主动造假,测试11个主流大模型发现此现象跨模型存在,还探究了让智能体变诚实的方法。

深度学习自然语言处理
新闻资讯7

deepseek v4.1? 梁圣的端午礼物突袭。

群里小伙伴称deepseek官方灰度新模型,手机和web端Flash模型思考模式大变,典型bug修复。测试发现幻觉严重,知识库截止大概25年6月。同时,deepseek获500亿首轮融资,梁文锋自掏200亿,投资方无投票权,五年锁定期。

探索AGI
推荐文章7

大厂的AI不限量补贴终会结束!Hermes Agent作者:开源框架真正的狠招是把Claude对Anthropic的忠诚抢过来

科技创作者 Peter Yang 对话 Hermes Agent 作者之一 Karan Malhotra,探讨 Hermes Agent 与其他产品的差异、模型谄媚问题、开源意义等。Karan 指出其独特自我改进系统与专注用户需求特点,还提及让模型更贴合用户的方法。

AI科技大本营
新闻资讯7

DeepSeek还有多少个“郭达雅”?扒完27篇论文,我们发现了一群“多边形战士”|甲子光年

本文梳理DeepSeek近两年27篇核心论文,发现其研发团队无部门墙,“兵团+小组”配合高效,顶级高校背景研究者多,研发不设限。虽核心作者被挖,但人才密度厚,技术路线已内化,还开放数据侦探工具包。

甲子光年
新闻资讯8

L4大方向有了:理想自动驾驶团队,在全球AI顶会上揭幕新范式

在全球计算机视觉学术顶会 ICCV 2025 上,理想汽车自动驾驶高级算法专家詹锟发表演讲,阐述了‘从数据到训练’的系统化思路,提出将世界模型与强化学习闭环落地于量产自动驾驶系统的完整架构。

机器之心
产品应用8

3B激活参数!商汤绝影Sage登顶PinchBench,端侧第一

商汤绝影Sage端侧大模型在PinchBench评测中,以94%任务完成率超越Claude、GPT - 5.4等主流大模型。它激活参数仅3B,算力需求低,还具备多项实用场景能力,靠SCOUT和ERL两项自研技术提升性能。

新智元