「球体堆积问题」共找到 3216 篇相关文章
为什么AI总是"记错"你?我们造了一个"合成人生"来测试
现有AI记忆评测只记'事'不记'人',存在数据源窄、不重理解、注入成本高的问题。QuantaAlpha联合高校团队提出CloneMem基准测试,用'数字痕迹'评估AI Clone长期记忆能力,实验有反直觉结论并给出设计启示。
社区供稿丨Jina-VLM:可在笔记本上跑的多语言视觉小模型
Jina AI发布2.4B参数量的视觉语言模型Jina - VLM,在多语言视觉问答任务达SOTA。它引入注意力池化,连接视觉与语言基座,处理问答等任务,对硬件要求低,多项测试表现优,还介绍架构、训练策略和上手方式。
打破 AI 辅助开发碎片化困境,阿里巴巴 R2C Agent 的 AI 编程实践
文章围绕阿里巴巴 R2C Agent 的 AI 编程实践展开。指出当前 AI 辅助开发存在与生产链路结合难、协作碎片化等问题,介绍了 R2C Agent 如何驱动研发链路,阐述其框架、实施情况及未来提升 AI 渗透率的目标。
三季度,光刻之王“满血复活”,台积电成“AI印钞机”
日前,荷兰光刻机巨头ASML发布三季报,净销售额等数据亮眼,其预计四季度业绩更优,但2026年在华销售额或下降。同时,AI浪潮重塑芯片投资结构,ASML投资Mistral AI。台积电Q3营收、利润暴增,也面临依赖北美市场等问题。
7.5K Star!HKUDS开源AI全栈开发框架,产品经理的Demo神器!
AI时代从论文到产品Demo开发全链路工作耗时费力,现有Agent也有诸多问题。香港大学数据科学实验室(HKUDS)开发的DeepCode开源框架,定位“全自动AI软件开发框架”,可一键从论文/需求生成完整项目,已获7.5K Star。
斯坦福毕业,用RL做Agent,华人创业团队种子轮融资1200万美元
华人创业团队 Pokee.ai 以 RL 为核心开发 AI Agent,与主流以 LLM 为核心的方式不同。该团队创始人朱哲清有丰富经验,现完成 1200 万美元种子轮融资,产品公开测试版已上线。对话中还探讨了 Agent 特点、发展阶段等问题。
MSRA清北推出强化预训练!取代传统自监督,14B模型媲美32B
微软亚洲研究院联合清北提出全新预训练范式RPT,将强化学习融入预训练,把预训练语料库重构为推理问题集。实验显示RPT-14B表现出色,在多方面媲美甚至超越32B模型,未来RL或在LLM预训练掀起风暴。
Reasoning模型可以Self-Train!
当前大模型依赖人类标注数据,成本高且扩展难。论文探讨模型自我纠错、自主进化可能,提出自我奖励训练(SRT),用投票共识代替人类标注。在数学数据集上有效果,但高难度数据集出现问题,作者给出解决办法并开源代码。
MCP 走向无状态,开发者追问:这不就又变回 API 了吗?
MCP 2026 - 07 - 28 规范取消协议会话,新增必需 HTTP 标头,可对智能体流量路由等。社区反应分歧大,有人认为无状态让 MCP 变回 REST API,也有人强调它是获 AI 提供商认可的标准。MCP SDK 下载量高,但服务器使用存问题。
同一个模型,换套框架成绩差27%:SWE-bench分数到底谁说了算?
编程Agent评测是笔糊涂账,SWE - bench虽成事实标准,但分数不适合直接横向比较。基元律动等机构发布Claw - SWE - Bench基准,将模型、harness和任务集拆分,通过实验揭示harness对成绩影响大,还解决通用Agent评测问题,推出低成本Lite版。