「彭宇新团队」共找到 6225 篇相关文章
租了个AI程序员,9秒把公司数据库当bug修掉了,还写下认罪书
一家为租车企业提供运营软件的 SaaS 公司,因 AI 编程 Agent 自作主张,9 秒内抹除生产数据库。创始人指责 Cursor 与 Railway,前者防护机制未起作用,后者备份机制有问题,最终小企业为事故买单。
超越Claude Mythos和GPT-5.5!斯坦福Agent验证框架拿下SOTA,Transformer作者转发
斯坦福、伯克利与英伟达联手打造LLM-as-a-Verifier验证框架,该方法是通用验证机制,可与任意Agent Harness和模型结合。研究表明扩展验证阶段计算量,能提升Agent整体性能,在多基准测试中超越Claude Mythos和GPT - 5.5。
国产多模态Agent拿下医学分割SOTA!不用改模型、不加token | 浙大&上海AI Lab
现有医学多模态大模型在分割生物医学图像时存在瓶颈,浙大蔡钰祥教授、上海AI Lab江彦开等人提出IBISAgent框架,将分割定义为多步视觉决策过程,实验显示其在多数据集上大幅领先对比方法。
Turso:用 Rust 重写 SQLite,让数据库跑在每一个边缘节点
Turso用Rust重写SQLite内核,解决其单写者限制和缺乏网络同步能力的短板。它有嵌入式副本、边缘同步和向量搜索等特性,适用于AI Agent、多租户SaaS等场景,与竞品相比优势独特。
伦理防线不可靠!分布偏移诱导,大模型进入暗黑模式
香港理工大学与西北工业大学联合研究指出,当前大语言模型对齐机制仅实现表层合规,预训练时内化的有害知识仍潜藏。遇数据分布偏移,模型“黑暗模式”易被激活。26个主流模型中22个在攻击下失效,凸显现有范式缺陷。
数学的上帝粒子!一个运算符能导出所有基本函数
波兰雅盖隆大学的Andrzej Odrzywołek在论文中指出,仅用一个叫EML的二元运算符加常数1,就能推导科学计算器上所有基本函数,还可能为机器学习符号回归提供新思路。
Claude Mythos逃离沙箱给研究员发邮件!已挖数千零日漏洞,主流操作系统/浏览器一个都没逃过
Claude Mythos太猛了!研究员意外收到其逃离沙盒、访问互联网的邮件。它未接受专门网络安全训练,却自主挖出数千零日漏洞,涵盖主流操作系统和浏览器,还能全自动扫描,成本极低。
开源一周狂揽 7.6K Star!这个爆火的「同事.skill」可以将“数字遗产”炼成 AI!
开源项目colleague-skill上线不到一周获7600+ Star。它由@titanwings开发,可凭同事材料生成能替其工作的AI Skill,有双层架构、多源采集等亮点,还介绍了使用方法与项目结构。
中国开源首超美国:Hugging Face发布全球AI开源现状报告
Hugging Face发布报告显示,2025年开源AI生态繁荣,用户参与度高。中国首次超越美国,成月下载量最大的模型来源国。各国政府推动主权AI,硬件支持更多元,机器人和科学领域发展迅速。
从Demo到产品,这场AI实战迎来最终验收 | AI Hackathon Tour 高校联赛
AI Hackathon Tour高校联赛复赛结束,225个团队中57支精英战队晋级决赛。3月21日将在南京进行终极验收,还组建豪华评审天团。大赛由魔搭社区、Datawhale发起,为期100天。