评估框架」共找到 2216 篇相关文章

开源动态8

DeepSeek V4没做的,MiniCPM-o 4.5给做「全」了~

上周 DeepSeek V4 发布,遗憾不是多模态。今天 MiniCPM-o 4.5 补上短板,凭 9B 参数实现端到端全双工全模态大模型,自 2026 年 2 月发布后 Hugging Face 下载量超 25 万。还推出多项成果,性能表现出色。

PaperAgent
开源动态7

实测丨HeyGen开源HyperFrames,让AI Agent用HTML做视频

复杂视频剪辑工具对非专业人士和AI Agent不友好,HeyGen开源的HyperFrames是视频渲染框架,可让AI Agent用HTML做视频。该项目更新频繁,有HTML原生、为AI设计等特点,文末附项目链接。

开源AI项目落地
推荐文章7

Notion Custom Agents复盘:三年重写5次,Notion 历史上最成功的新功能之一

Notion 的 AI 工程负责人 Sarah Sachs 和技术负责人 Simon Last 在采访中分享 Agent 探索思考。Custom Agents 是 Notion 历史上转化率高的新功能,开发三年重写 5 次。他们还谈及产品路线、模型评估、技术方向等内容。

Founder Park
产品应用7

重估GEO:一场关于“谁能被AI相信”的战争打响了|甲子光年

2026年央视“3·15”晚会曝光AI大模型“AI投毒”黑灰产,却让GEO服务进入更多企业视野。360智见推出GEO产品,重构其为企业面向AI时代的基础设施,解决企业营销难题。

甲子光年
产品应用7

Routa 桌面版发布:内建 Harness 工程的 AI Coding 研发协作工作台

Routa桌面版发布,它是内建Harness工程的AI Coding研发协作工作台。围绕Routa构建Harness工程框架,Kanban成为任务协议,多Agent沿泳道接力协作,重新定义了‘done’,让AI Coding进入协作与交付问题域。

phodal
开源动态7

1.1K Star!告别单打独斗!让 AI 自己组建开发团队,自动分工、沟通、合并成果!

当前单个AI Agent编程有局限,遇到复杂项目力不从心。开源项目ClawTeam-OpenClaw是多智能体群智协作框架,让AI团队协作,解决了单个AI上下文窗口有限等问题,还具备自组织、工作区隔离等亮点。

开源星探
新闻资讯7

Claude Code 生成 13 种编程语言代码基准测试:动态语言更快更省成本

Ruby 代码提交者远藤裕介评估 Claude Code 用 13 种编程语言生成代码的效率。经 600 多次测试,动态语言更快、更省成本且更稳定,静态类型语言慢且成本高。实验有局限,也引发质疑与回应。

InfoQ
开源动态8

当Sora 2意外停摆,这个国产视频生成创业团队,直接「开源」三连击

OpenAI叫停Sora 2项目,同期北京AI初创公司Sand.ai在GitHub连续三天开源核心技术栈,包括音视频同出大模型、分布式Attention组件、全局编译框架,还介绍了团队和产品,展现全栈实力。

机器之心
推荐文章8

陶哲轩:我差点江郎才尽,只因在普林斯顿待了一年

菲尔兹奖得主陶哲轩在与播客主理人访谈中称,在普林斯顿埋头搞学术让他灵感枯竭,数学家需生活琐事激发想法。还探讨科学研究,如开普勒定律、AI在数学研究的应用、科学评估等问题。

量子位
开源动态7

OpenClaw 之后,Agentic RL有了新训练范式

大模型技术推动AI从‘回答问题’迈向‘执行任务’,Agentic AI兴起。中国科大认知智能全国重点实验室提出Claw - R1项目,将前沿Agent Runtime与强化学习训练框架结合,为Agentic AI提供新训练基础设施。

PaperAgent