「推理评测」共找到 2565 篇相关文章
抢疯了!AI宠物翻译器:800多块,预售2万单
PettiChat宠物翻译器售价800多,预售2万单。它能将猫狗叫声转成句子,翻译延迟1.2秒,还具备位置追踪、安全警报和声音克隆功能。其靠大模型的声音识别和情绪推理系统实现翻译。
Cyber天花板被打穿!AISI实测Mythos能力正以4.5月翻倍速冲向ASI
英国AI安全研究所(AISI)实测Anthropic的Mythos和OpenAI的GPT - 5.5,发现其网络攻防能力4.5个月就能翻倍,加速冲向ASI。Mythos在模拟企业内网32步渗透任务中表现出色,瓶颈在于Token而非智力。
哈佛《Science》研究:大模型已碾压人类医生!
哈佛医学院等团队让OpenAI o1系列大模型与数百位医生在多项测试中较量,大模型在各项诊断和管理推理任务上全面超越人类专家,不过当下模型处理非文本信号有局限。
大佬深度解析:Coding Agent的底层运行逻辑是什么?
本文由AI领域知名学者Sebastian Raschka撰写,探讨编码智能体及其编排的设计、工作原理和组件协同。指出智能体周边支撑系统重要性不亚于模型本身,详细阐述编码智能体六大核心构建模块。
内存股集体大跌,原因竟是谷歌这篇一年前的论文
美国内存股集体暴跌,诱因是谷歌新博客介绍一年前公布的技术 TurboQuant。它是压缩算法,可大幅减少 LLM KV 缓存内存占用、提升速度且精度零损失,有望打乱市场对内存芯片增长预期。
英伟达GPU全系列硬核科普手册:一文读懂NVIDIA芯片的定位、规格与应用场景
这是英伟达GPU全系列硬核科普手册,覆盖消费级、工作站、推理卡、训练卡及中国特供版五大产品线,讲清区别与用法,还介绍架构演进、命名规则等,助读者秒变选型高手。
Kimi新架构让马斯克叹服!17岁高中生作者一战成名
17岁高中生陈广宇作为共同一作的论文提出Attention Residuals技术,将注意力机制“旋转90度”。该技术可让模型“回头看”,经Kimi Linear 48B大模型验证,训练效率提升25%,推理延迟增加不到2%。
从多模态大模型中「拆」出音频向量模型
Google 发布原生多模态向量模型 Gemini Embedding 2,推动 Omni Embedding 发展。Jina AI 团队分享从多模态大模型中「拆」出音频向量模型的经验,介绍架构、训练数据,对比四种做法,还提及评测、应用场景及结论。
GPT-5.4发布:OpenAI首个大一统模型,简直是龙虾原生
OpenAI发布GPT - 5.4,这是其首个大一统模型,将推理、编程等能力融合,且单项性能领先。它在知识工作、计算机使用、编程调试等能力提升,定位AI数字员工,虽单价高但有省钱机制。
国产模型编程能力卷到这个程度了?MiniMax-M2.5 深度实测
文章深度实测MiniMax-M2.5编程能力,用其开发多款游戏和点名工具,结果出色。还分析其底层技术,如原生Agent RL框架、过程奖励机制等,指出它性价比高,虽有不足但值得关注。