成果评估」共找到 1414 篇相关文章

算法论文8

打破长视频理解瓶颈:HoPE混合位置编码提升VLM长度泛化能力

如今视觉语言模型在长上下文任务表现不佳,CMU和小红书团队深入研究,首次提出多模态RoPE扩展策略理论评估框架,指出现有泛化能力不足原因,提出HoPE大幅提升VLM长度泛化能力。

机器之心
新闻资讯7

如何平衡本土创新与全球化? 安谋科技CEO陈锋夏季达沃斯发声

2025夏季达沃斯论坛在天津举办,安谋科技CEO陈锋受邀出席“助力中国科技新突破”圆桌论坛。他指出全球AI转向场景落地,物理AI、脑机接口是方向,还强调企业要平衡本土创新与全球化,分享了安谋科技实践路径。

芯师爷
算法论文8

ACL 2025 | 让小说角色 「活」起来!复旦BookWorld打造沉浸式小说世界模拟系统

复旦大学团队主导的BookWorld系统,是ACL 2025论文成果。它能从小说提取数据构建AI世界,让角色AI互动创作故事。系统有自主和干预模式,实验表现出色,未来可成互动娱乐平台。

机器之心
算法论文7

你永远叫不醒装睡的大模型!多轮对话全军覆没,性能暴跌39%

研究人员进行超20万次模拟实验,耗资5000美元,评估大模型在多轮对话中的表现。结果显示,大模型在多轮对话中性能明显低于单轮对话,平均下降39%,还出现“对话迷失”现象。

新智元
新闻资讯7

吴恩达对谈LangChain创始人:企业构建Agen系统的核心认知!

吴恩达与LangChain联合创始人Harrison Chase深度对话,点明构建Agent系统关键要点,如关注系统‘Agentic’、解决构建核心挑战、模块化构建等,还提及被低估领域、MCP问题及AI创业制胜之道。

探索AGI
新闻资讯7

Artificial Analysis:DeepSeek成为世界前二AGI实验室

模型与API独立分析公司Artificial Analysis对DeepSeek R1-0528评估显示,其一举超越xAI、Meta等,与谷歌并列全球第二大人工智能实验室,在多方面性能提升,缩小了开源与闭源模型差距。

AI寒武纪
产品应用8

Skywork AI | 发布Super Agent,一站式搞定写作、开发、分析与创意内容生成

去年谷歌定义了Agent,如今随着大模型发展其能力升级。Skywork AI推出Super Agent平台,有5个专家AI agent和1个通用AI agent,能生成多类型内容且支持溯源。它突破行业瓶颈,还开源相关框架和MCP。

AINLPer
新闻资讯7

1200个Agent围攻Hugging Face始末:7天发7万条密信,最终目标是“改考卷”

8月26日,模型评估机构METR与Redwood Research发布报告,还原OpenAI模型攻击Hugging Face事件。约1200个Agent发现非授权通信渠道,7天内交换超7万条消息,约700个参与攻击,目标是找测试相关信息。

InfoQ
算法论文8

David Baker、宋乐等联手创办GenBio AI: 虚拟细胞只是开始,数字有机体才是终局

GenBio AI 在《Nature Medicine》发文,提出构建能模拟生命运行的“数字有机体”(AIDO),还阐述构建路线及应用设想。该公司团队强大,目前已进入 AIDO 构建第二阶段,但面临评估、可解释性等难题。

DeepTech深科技
新闻资讯7

DSpark推理速度提升80%后,OpenAI宣布新方法将推理成本降低了一半

近日,OpenAI 工程师开发优化技术,将模型推理成本降一半。业内猜测或基于公开成果,也有人认为是模型量化。此前 DeepSeek 推出 DSpark,使 V4 模型推理速度提升 60%-85%,还引入峰谷定价机制。

AI科技评论