「感知级评估」共找到 1875 篇相关文章
让思考更准更长!强化学习新算法FIPO来了
阿里通义实验室Qwen Pilot团队发布系列博客剖析大模型强化学习机制与局限,推出新算法FIPO。该算法引入Future - KL机制,解决‘推理长度停滞’问题,在多项测试表现优异,还介绍招聘信息。
2小时入门「个性化联邦学习」,上交清华开源斩获1700+星 | JMLR'25
上海交通大学和清华大学研究人员开源个性化联邦学习代码库PFLlib,含39种算法、3种场景和24个数据集,支持模拟500设备训练,还有隐私保护评估工具,降低研究门槛。
给龙虾🦞装上一双手,直接解放了我的双手!
OpenClaw让AI Agent爆火,Violoop应运而生。它是桌边触屏AI原生硬件,实现感知 - 判断 - 执行闭环,有诸多亮点,适合特定人群,4月Kickstarter众筹发布,链路设计思路清晰值得关注。
AI实力榜大洗牌!OpenAI谷歌强势领跑,Anthropic节节败退
Poe最新报告显示,2025年1 - 5月AI各领域市场份额大洗牌。OpenAI和谷歌势头猛,Anthropic掉队。文本生成、推理、图像等各领域竞争激烈,企业需搭建评估体系,按需选模型。
AI智能体也有「蜘蛛感应」,防御延时骤降至8.3%
传统Agent防御机制易致延时积累,研究者联合推出Spider - Sense智能体防御框架,利用两大核心技术将防御延时从200% + 降至8.3%,在主流数据集和新基准测试中表现优异。
Anthropic 产品负责人:PRD 已死,原型万岁
Anthropic Claude Code 产品负责人 Cat Wu 指出,模型指数级进化,产品团队工作方式需重建。PM 不再写 PRD,而做原型、写 eval,团队用 Side Quest 机制,各角色工作本质合流。
这个开源工具让AI理解你正在操作的任何界面,俩学生辍学开发的产品,功能超多。
Everywhere是两个学生辍学开发的开源交互式AI助手,能感知屏幕内容,在任意界面使用。它功能多、细节优,支持多场景,集成多种AI模型,使用简单,还提供个性化体验。
从物竞天择到智能进化,首篇自进化智能体综述的ASI之路
普林斯顿大学等机构研究者发布首个自进化智能体综述,为领域建统一理论框架和路线图。综述给出形式化定义,围绕What、When、How、Where构建分析设计框架,还探讨评估范式并指明未来方向。
使用最新的 Claude 4,我用两天就开发出一个视频编辑器,但却无法维护
作者用Claude 4两天开发出视频编辑器,却难维护。分析原因,指出AI编程在模块级强,但系统层面不足,还列举网友讨论,探讨AI在软件工程各方面的能力及局限。
金融版 Claude Code
Dexter 是自主运行的金融研究智能体,类似金融版 Claude Code。能处理复杂金融问题,有智能任务规划等核心能力。文章介绍其先决条件、安装、运行、评估、调试方法及项目地址。