好表现定义」共找到 3237 篇相关文章

开源动态8

三大核心创新公开,快手开源多模态Keye-VL 1.5拿下视频理解SOTA,8B力压GPT-4o!

快手开源多模态Keye-VL 1.5,为8B视频理解最强模型,公开3大核心创新技术。它靠Slow-Fast视频编码等,在20+基准屠榜。在多类基准测试和内部测评中表现优异,将业务经验沉淀到开源社区。

PaperAgent
开源动态8

视频世界模型困在像素网格里:腾讯开源SCoPE,用射线空间重写位置关系

香港大学、香港科大与腾讯ARC Lab联合提出SCoPE,让视频模型处理位置关系的基底从张量网格转向射线空间。它将相机射线坐标注入Video DiT,新增参数不到原模型0.1%,多方面表现获改善。

机器之心
推荐文章7

Claude Code与Codex六大组件拆解

文章指出如今如GPT - 5.6等模型的裸能力相近,但装进Claude Code 或 Codex CLI 后表现差距大,原因在于Agent Harness。它将编码智能体拆解为六个核心组件,详细阐述各组件作用与意义。

PaperAgent
开源动态8

一句话生图要过时了?开源图像生成Agent进化出「工具编排」

来自多机构的研究团队提出GenEvolve,将开放图像生成建模为「工具编排轨迹」。它配置三类工具,经多轮决策完成生成。通过构建数据集训练,实验显示在多基准上表现出色,已开源模型、代码等。

机器之心
开源动态8

自回归科学基座模型 BigBang-Proton,提出实现 AGI 的新路线

超对称公司发布自回归科学基座模型 BigBang - Proton,挑战主流 AGI 技术路线。它实现多学科问题与 LLM 统一预训练和推理,有三项创新,在多专业任务表现出色,还提出宇宙尺度压缩构想。

AI科技大本营
新闻资讯7

秒改屎山代码、最高提效 300%!AI 代码审查工具会终结技术债务还是带来新危机?

当下AI代码审查工具引发热议,虽宣称提效300%,但实际表现存争议。InfoQ采访硅心科技专家,探讨其利弊、核心能力、不同工具差异等,还提及应对问题的策略及未来审查流程演变等内容。

AI前线
新闻资讯7

GPT-5「全家桶」爆出本周上线!惊艳首测秒出网页,编程彻底起飞

传闻GPT - 5发布时间提前,本月底面世,它有4个版本。网友在LMArena实测,GPT - 5 - pro能一键生成网站,GPT - 5 - high表现出色。美国部分公司已拿到预览版,其新功能或改写编程局面。

新智元
新闻资讯7

被知乎文化所感染的第 1947 天

作者分享在知乎 1947 天的经历,受邀参加知乎第十一届新知青年大会。大会 AI 含量高,探讨多,如具身智能、模型发展方向等;社区味浓,形式多样氛围;还对年轻人友,鼓励表达畅想。

特工宇宙
产品应用8

AI编码新神登基,藏师傅一手Claude 4实测

Claude 4低调发布,Anthropic称Claude Opus 4是全球最佳编码模型。发布内容含扩展思维、新模型能力等,还公布定价。Claude Opus 4编码和记忆能力强,实测表现出色,Claude Sonnet 4也有提升且免费。

歸藏的AI工具箱
算法论文7

英伟达说,小语言模型(SLM)是智能体的未来

英伟达论文指出小语言模型(SLM)是代理人工智能未来。SLM参数小于100亿,可装在消费电子设备。英伟达认为其强大、适合代理系统且经济。微软、英伟达等多家厂商的小模型表现出色,文中还分析了SLM优势及代理架构。

AI与安全