「小模型性能」共找到 8886 篇相关文章

开源动态7

闭源RSI的严父来了:18个Agent自主科研,Kimi K3靠Harness逼近Opus 5

开源AI基础设施公司Prime Intellect研究表明,借助多智能体Harness,让开源模型负责监控和实现,可让‘AI开发AI’更便宜、效果更好。实验中,Kimi K3搭配Harness逼近Opus 5。

量子位
产品应用8

Claude Opus 5发布,砍掉了Claude Code 80%的系统提示词

Anthropic发布Claude Opus 5,接近Claude Fable 5智能且价格减半,测评成绩出色,科研和视觉输出能力也有进步。同时发现砍掉Claude Code 80%系统提示词,编码评测分数不变,还总结出上下文工程新方法论。

AIGC开放社区
新闻资讯7

他想让TPU成为AI界的X86!

2026世界人工智能大会期间,中昊芯英主办分论坛,新一代全自研TPU架构AI芯片“须臾®”亮相,华东地区首个国产TPU智算千卡集群落成。“须臾®”算力强、成本低,集群全链路国产化,中昊芯英探索TPU突围路径。

芯师爷
算法论文8

YC总裁转发、登顶Hacker News:SkillsBench揭开Agent技能扩展的残酷真相

近日论文《SkillsBench: Benchmarking How Well Agent Skills Work Across Diverse Tasks》引发海外AI社区关注。研究聚合47150个Skills,经严格筛选评估,揭示人工构建Skills效果好、AI自生成无效等核心发现,为AI研发指明路径。

机器之心
新闻资讯7

GPT-5.4发布,AI的最强之争已经结束了!

GPT-5.4发布,作者对比OpenAI、Anthropic、Google三家模型数据发现它们不在同赛道。GPT-5.4适合白领工作,Claude擅编程,Gemini重推理与性价比,且OpenAI因合同问题流失用户。

花叔
新闻资讯8

GPT-5.2连肝7天,300万行代码造出Chrome级浏览器

Cursor的CEO让GPT - 5.2连续运行一周,产出300万行代码,从零构建Chrome级浏览器。还介绍不同模型长任务表现、多智能体协作架构,指出这将颠覆软件开发经济学。

新智元
算法论文7

全球强化学习+VLA范式,PI*0.6背后都有这家中国公司技术伏笔

机器之心介绍了Physical Intelligence成果π*0.6论文,指出VLA+online RL是有前景的研究方向。还分析VLA+RL重要性、应用难点,重点介绍星动纪元iRe-VLA突破困境的方案及其实验效果,揭示VLA在线强化学习前景。

机器之心
新闻资讯7

GPT-5-Thinking新训练方法公开:让AI学会忏悔

OpenAI提出忏悔训练Confessions,让ChatGPT自己“坦白从宽”。在GPT - 5 - Thinking上实验有效,模型犯错后多会坦白,且更诚实,不影响原任务表现。还介绍了训练方法、实验结果及局限性。

量子位
算法论文8

后生可畏!何恺明团队新成果发布,共一清华姚班大二在读

何恺明团队继5月提出MeanFlow (MF) 后,近日推出改进版Improved MeanFlow (iMF),解决了原始MF三大核心问题。它重构预测函数,还实现灵活的无分类器指导和高效的上下文内条件作用架构,提升了实用性和效率。

量子位
推荐文章7

我的AI OS搭建思路

作者黄益贺分享AI OS搭建思路。其系统以Claude Code为框架、Kimi K2 Thinking为模型,通过Skill和自定义命令满足工作需求,设计三层文件夹体系处理信息,供大家参考搭建。

newtype AI