同质化评估」共找到 1447 篇相关文章

新闻资讯7

国产算力正在进入Token标准时代

2026年6月17日,是石科技攒局国产异构算力创新发展论坛。其创始人闫博文认为国产算力瓶颈在工程能力。是石科技正将异构算力转为标准Token生产能力,还启动B轮融资。

量子位
新闻资讯7

AI实力榜大洗牌!OpenAI谷歌强势领跑,Anthropic节节败退

Poe最新报告显示,2025年1 - 5月AI各领域市场份额大洗牌。OpenAI和谷歌势头猛,Anthropic掉队。文本生成、推理、图像等各领域竞争激烈,企业需搭建评估体系,按需选模型。

新智元
开源动态7

Lucide 1.0 发布,移除品牌图标,并缩减数百万个项目的包大小

Lucide 1.0 发布,它是开源图标工具包,是 Feather Icons 分支。此次移除品牌图标,缩减 lucide - react 包大小,还引入上下文提供程序等改进,社区反响有赞有弹。

InfoQ
算法论文8

上下文工程(Context Engineering)综述:大模型的下一个前沿

文章提出“上下文工程”学科,通过整合1400余篇论文构建“基础组件 - 系统实现”框架。它将上下文定义为动态结构信息集合,揭示LLMs理解强于生成的矛盾,为AI研究指明方向。

深度学习自然语言处理
算法论文8

从物竞天择到智能进,首篇自进智能体综述的ASI之路

普林斯顿大学等机构研究者发布首个自进智能体综述,为领域建统一理论框架和路线图。综述给出形式定义,围绕What、When、How、Where构建分析设计框架,还探讨评估范式并指明未来方向。

机器之心
产品应用7

使用 GPT-5 进行编程的六个技巧

OpenAI给出使用GPT - 5编程的6个提示技巧,如指令准确无冲突、选对推理力度、用类XML语法结构规则等,还提供了详细提示技巧的参考链接。

AI寒武纪
产品应用7

金融版 Claude Code

Dexter 是自主运行的金融研究智能体,类似金融版 Claude Code。能处理复杂金融问题,有智能任务规划等核心能力。文章介绍其先决条件、安装、运行、评估、调试方法及项目地址。

GitHubStore
推荐文章7

The Batch: 894 | 面向生物医学的多模态模型

过去几年联合推理模型进展快,但生物医学领域能力碎片、脆弱或难解释。2026 年,学术界应推进多模态模型建设,关注深度整合、可解释性、数据效率和适应性及模型在工作流中的整合。

DeeplearningAI
开源动态7

5.8k Star 基于LangGraph的Multi-Agents炒股框架,7种Agent形成金融交易闭环

TradingAgents是模拟真实交易公司运作的多智能体交易框架,用LangGraph构建,有灵活性与模块特点。由7种LLM驱动的专业智能体协同评估市场、制定决策,还介绍了架构和实战操作。

CourseAI
算法论文8

从需求分析到代码生成,LLM都能干点啥?一文读懂291个软工Benchmark!

大语言模型重塑软件工程各环节,但缺乏评估其在该领域表现的系统工具。浙江大学等机构团队首次对291个软件工程Benchmark系统综述,分析现状、痛点并给出改进方向。

新智元