「金牌表现」共找到 2275 篇相关文章
GPT-5惨遭零分打脸,顶级AI全军覆没!奥特曼AI博士级能力神话破灭
FormulaOne硬核测试让顶级大模型现原形,其题目分三关,基础题AI还行,进阶题和最深层题表现惨不忍睹。该测试由AAI公司出品,问题具商业价值,反映出当前AI离真正专家还有距离。
蚂蚁即将上线通用 Agent
蚂蚁百宝箱团队将在今年外滩大会正式上线 Tbox 超级智能体,其产品形态与部分平台相近,能让不同角色分工协作。实测显示它在多方面表现不错,但也存在细节不足,官网有诸多案例。
1600亿,国内PCB巨头奔向港股
7月29日,胜宏科技计划发行H股在港上市,其创始人陈涛将再迎敲钟时刻。胜宏科技靠英伟达供应商身份成十倍牛股,AI浪潮下,相关概念股表现亮眼,造富神话不断,同时也有泡沫警告声。
三大核心创新公开,快手开源多模态Keye-VL 1.5拿下视频理解SOTA,8B力压GPT-4o!
快手开源多模态Keye-VL 1.5,为8B视频理解最强模型,公开3大核心创新技术。它靠Slow-Fast视频编码等,在20+基准屠榜。在多类基准测试和内部测评中表现优异,将业务经验沉淀到开源社区。
视频世界模型困在像素网格里:腾讯开源SCoPE,用射线空间重写位置关系
香港大学、香港科大与腾讯ARC Lab联合提出SCoPE,让视频模型处理位置关系的基底从张量网格转向射线空间。它将相机射线坐标注入Video DiT,新增参数不到原模型0.1%,多方面表现获改善。
Claude Code与Codex六大组件拆解
文章指出如今如GPT - 5.6等模型的裸能力相近,但装进Claude Code 或 Codex CLI 后表现差距大,原因在于Agent Harness。它将编码智能体拆解为六个核心组件,详细阐述各组件作用与意义。
一句话生图要过时了?开源图像生成Agent进化出「工具编排」
来自多机构的研究团队提出GenEvolve,将开放图像生成建模为「工具编排轨迹」。它配置三类工具,经多轮决策完成生成。通过构建数据集训练,实验显示在多基准上表现出色,已开源模型、代码等。
豆包「打电话」升级 Seeduplex:周围再吵,只认准你的声音
作者分享使用豆包语音通话功能体验,发现它换了新语音模型 Seeduplex。该模型是原生全双工语音大模型,解决半双工问题,在复杂场景表现出色,还介绍其技术逻辑及对行业的影响。
自回归科学基座模型 BigBang-Proton,提出实现 AGI 的新路线
超对称公司发布自回归科学基座模型 BigBang - Proton,挑战主流 AGI 技术路线。它实现多学科问题与 LLM 统一预训练和推理,有三项创新,在多专业任务表现出色,还提出宇宙尺度压缩构想。
秒改屎山代码、最高提效 300%!AI 代码审查工具会终结技术债务还是带来新危机?
当下AI代码审查工具引发热议,虽宣称提效300%,但实际表现存争议。InfoQ采访硅心科技专家,探讨其利弊、核心能力、不同工具差异等,还提及应对问题的策略及未来审查流程演变等内容。