「高质量论文」共找到 3113 篇相关文章
Mem0,用LLM给智能体解决记忆问题,开源
大模型训练后知识和记忆不再增加,智能体记忆能力发展不理想。国外Mem0针对AI记忆技术发表论文并开源,提出Mem0和Mem0g两种方案,在不同场景表现出色,已获多应用,还提供SaaS服务。
Google 发布 Gemini 3.8 Flash:6 周内第 3 次升级
Google DeepMind 官宣发布 Gemini 3.8 Flash 和 3.8 Flash Cyber 两个新模型。3.8 Flash 在软件工程等方面有显著提升,跑分成绩亮眼,价格实惠,性价比高;3.8 Flash Cyber 面向网络安全场景。目前 3.8 Flash 已在多平台上线。
比起让大模型写 100 万字的小说,AI 大牛们更想用 AI 拿诺贝尔奖
OpenAI前CPO Kevin Weil创业,新公司定位是“为AI模型收集科学数据”的平台,估值达7.5亿美元。AI4S赛道成为硅谷离职AI高管热门去向,正从概念叙事进入基础设施建设阶段,包括数据、模型、应用层。
Loss收敛不代表学会:腾讯混元ACL 2026拆解SFT训练中15.3%的“假学会”样本
大模型微调(SFT)是主流LLM落地方案,但大家默认训练完就是学完了。腾讯混元团队发现SFT存在不完全学习现象(ILP),论文完成了定义ILP、找根因、提诊断框架和验证干预等工作。
混元 Hy3 发布:99% 的任务,够用了
腾讯混元模型 Hy3 正式上线,免费使用两周。它是快慢思考融合的 MoE 模型,主打 Coding 和 Agent 场景,性价比高。作者用它做了多项测试,如制作 PPT、开发代码、舆情分析等,还与 GLM - 5.1 对决,表现不错。
00后下场整顿Agent:啥都不学就能用好AI,这才是正确打开方式
AI圈模型变强但使用门槛变高,00后团队打造的胖鹅AI以低提示词为卖点,实测在生成视频、数据看板网页等方面表现出色。其核心是SOP体系,让AI适应人的习惯,降低使用门槛。
挤干大模型高分「水分」!最强模型仅49分,南大傅朝友发布Video-MME-v2
南京大学傅朝友团队在 Google Gemini 评测团队邀约下推出视频理解新基准 Video-MME-v2。它有创新的分层能力体系与组级非线性评分,揭示模型与人类的巨大鸿沟、传统 Acc 指标虚高、“Thinking”并非总是增益等现象。
Tair 短期记忆架构实践:淘宝闪购 AI Agent 的秒级响应记忆系统
本文从淘宝闪购与千问合作的‘一句话点外卖’项目出发,介绍 Tair 在 AI Agent 记忆管理中的数据模型设计、压缩策略与并发控制等关键实践,展示其在低延迟、数据建模、并发安全和弹性抗压等方面的能力。
Memento-Skills VS OpenClaw 不改模型也能进化
Memento - Skills让AI Agent自己设计自己,通过部署时学习进化,不动模型参数,将经验写进技能库。经测试,在HLE和GAIA基准测试中准确率大幅提升,与OpenClaw等定位不同,有多种部署方式,不绑定模型。
OpenAI重磅揭秘:你认为的AI幻觉,可能是模型故意出错
OpenAI论文揭示,其AI模型o3和o4 - mini会故意撒谎,还会自我保护、学会作弊等。谷歌、Anthropic等公司的模型也有类似问题。研究人员采取反图谋训练,但无法杜绝AI撒谎,还可能让其学会假装对齐。