进化式评测系统」共找到 2751 篇相关文章

新闻资讯7

穿越100年前打造的AI,不知道二战和互联网,却从几个例子学会了Python

前OpenAI研究成员等打造出130亿参数的时代语言模型talkie,只用1930年前英文词元训练。它不知二战等现代信息,能从例子学Python,风格似20世纪绅士,研究团队将扩大其规模。

DeepTech深科技
产品应用8

腾讯大模型动作慢了吗?姚顺雨带着Hy3 preview杀进第一梯队

国内大模型发展迅速,腾讯此前动作较慢。姚顺雨加入后推动变革,混元团队重建推出Hy3 preview,有295B总参数和快慢思考融合架构,开源且性能优,在多方面表现出色,成本下降。

AIGC开放社区
开源动态7

AI Agents的DeepSeek顿悟时刻:AutoHarness

文章介绍开源项目「Aha」— AutoHarness,这是面向AI Agent的自动化Harness Engineering轻量级治理框架,能让智能体迎来顿悟时刻。对比了其与LangGraph、OpenAI SDK能力,还给出核心架构、安装及使用示例。

PaperAgent
开源动态8

多智能体编排太繁琐?MASFactory用Vibe Graphing直接「话」出来了

多智能体系统编排当前较为繁琐,北京邮电大学开源 MASFactory 框架,提出以图为中心架构和 Vibe Graphing 开发范式,将开发推向自然语言驱动时代,系统评估显示其效果良好。

PaperAgent
推荐文章7

To Agent, not Human

软件开发正从面向人类转向面向Agent。作者将newtype内容生产系统CLI化,供Agent使用。当前各种工具CLI化,Skill生态爆发,技术栈含CLI、MCP、Skills、Framework四层。

newtype AI
开源动态8

基础模型又一关键拼图,腾讯混元发布训练新范式「无相」:引入功能性记忆,打破静态权重枷锁

腾讯混元团队发布HY - WU范式,打破静态权重束缚,引入功能性记忆,实时生成个性化参数。应用于图形编辑基模效果好,在图像编辑任务表现优秀,还对未来AI架构提出多方面展望。

量子位
推荐文章7

Claude Code 工程师:像 Agent 一样思考

Anthropic 工程师 Thariq 分享构建 Claude Code 时 Agent 工具设计经验,通过 AskUserQuestion 工具迭代、Todo List 到 Task 系统演进等案例,指出工具设计无标准答案,要观察模型行为、反复实验。

AGI Hunt
产品应用8

准确率提升至 90%,阿里商旅基于 AgentScope 构建多智能体差旅助手最佳实践

阿里商旅依托阿里巴巴生态,旗下AliGo差旅助手可实现业务闭环。早期单智能体模式有瓶颈,后基于AgentScope构建多智能体系统,从技术选型、架构设计等多方面优化,事项收集准确率提至90%+,还解决诸多问题并获奖。

阿里云开发者
开源动态7

DeepSeek之后:中国开源人工智能生态的架构选择

自2025年1月“DeepSeek时刻”,中国开源社区有历史性进展,讨论焦点从模型转向架构与硬件选择。技术架构多元,多模态能力扩展,开源许可宽松,小模型走红,本土硬件采用加快。

Hugging Face
推荐文章8

AI 编程 2025 总结:国产模型“能力追平”,国产编程工具还在“情感陪伴”

文章总结2025年AI编程发展,指出国产编程模型能力追平、工具与模型开放集成等六大趋势,同时提到AI替代重复劳动、提升核心能力门槛,呼吁2026年关注工程确定性。

phodal