「视觉能力评估」共找到 4099 篇相关文章
刚刚,MiniMax来承包你的桌面了
2026 年 Agent 赛道竞争白热化,市场分化。国产 AI 大模型独角兽 MiniMax 1 月 20 日推出第二代智能体产品 MiniMax Agent 2.0,从产品形态和能力分布深度重构,是‘AI 原生工作台’,实测表现出色。
再见,程序员!马斯克宣判:奇点就在2026
马斯克断言2026年是奇点之年,起因是Claude Code强大的编程能力引发关注。Claude Opus 4.5表现优异,碾压其他模型。奇点来临,人们工作方式将改变,AI或使软件开发自动化。
让大模型“吃一堑长一智”,南理工百度等提出模型记忆新方法
南京理工大学联合百度等提出新方法ViLoMem,构建视觉流+逻辑流的双流语义记忆,让模型“从错误中学习”。它能在多模态基准提升模型表现,强模型记忆还可迁移给小模型。
解放军总医院联合南大、吉大等机构,共同提出首个「脊柱诊疗大模型」SpineGPT
解放军总医院联合多机构研发首个脊柱诊疗大模型 SpineGPT。研究指出通用 LVLM 有‘认知鸿沟’,团队构建 SpineMed 生态系统,含 SpineMed - 450K 数据集与 SpineBench 评估基准,SpineGPT 表现超越开源模型。
为什么 LLM 搞不定复杂任务?ReAct 与 Reflexion 技术综述
文章指出大语言模型处理复杂任务存在事实幻觉、缺乏实时信息等问题。介绍ReAct将推理和行动结合,及Reflexion在其基础上添加评估反思机制,探讨两者结合优势,还提及未来发展方向。
GPU为什么能取代CPU,成为计算领域无可争议的核心?
过去CPU是计算核心,如今GPU凭借并行处理能力崛起。在人工智能、大数据等领域,GPU优势明显,软件支持也推动其普及。未来,GPU将在更多领域发挥作用,还会与CPU融合。
刚刚,北大&360里程碑式突破!32B安全分碾压千亿巨兽
2025年9月23日,北大 - 360联合实验室发布TinyR1 - 32B模型,仅用20k数据微调就实现安全性能突破,兼顾推理与通用能力。还推出TinyR1 - Safety - 8B,且系列模型已全面开源。
从Debugger到Developer : 低代码时代新基准NoCode-bench,SWE-Bench作者力荐
浙江大学牵头联合多机构推出全新评估基准NoCode - bench,直面自然语言驱动功能添加任务,发现当前最佳LLM成功率仅两成。它构建严谨,任务挑战大,指明AI软件开发改进方向,且已开源。
ChatGTP 发布 Agent 了,但我更推荐 MiniMax
作者受邀内测 MiniMax Agent 新功能,体验用其搭建 AI 资讯聚合网站,无需写代码,两小时搞定。该产品全栈开发功能强大,有 MCP 生态,多模态能力出色,对比 ChatGPT Agent 更具优势。
亚马逊Alexa+助手用户数量超过100万
Techcrunch消息,亚马逊升级版AI助手Alexa+自2025年2月推出后用户稳步增长,6月底未全面公测时已超百万。它体验个性化,有新能力,还能促使用户行动,初步合作多知名平台。