「技术评估」共找到 3457 篇相关文章
国产开源LLM大爆发,Qwen、Minimax、美团、腾讯~
近期国产开源LLM大爆发,Qwen3-VL家族新增模型,有技术亮点且可免费商用;MiniMax-M2为编码和代理任务打造;美团LongCat-Video、LongCat-Audio-Codec各有专长;腾讯混元世界 - 镜像用于3D几何预测。
Codeforces难题不够刷?谢赛宁等造了个AI出题机,能生成原创编程题
LiveCodeBench Pro团队推出AutoCode框架,利用LLM自动化竞赛编程问题创建与评估。该框架结合验证器 - 生成器 - 检查器框架与双重验证协议,在测试用例生成上可靠性佳,还能生成新问题,同时揭示了LLM在创作上的优劣势。
提效40%?揭秘AI驱动的支付方式“一键接入”系统
文章围绕AI驱动的支付方式“一键接入”系统展开。先指出跨境支付接入流程痛点,介绍借助Qwen Coder + MCP工具链构建提效系统的目标。接着阐述技术架构、流程,以及提升AI采纳率的方法,最后展示效果、规划未来。
Anthropic 研究员:强化学习将推动 Transformer 实现 AGI
在 AI Agenda Live 纽约活动上,Anthropic 强化学习团队技术负责人 Sholto Douglas 称,无需新架构突破,强化学习能让 Transformer 达人类专家级别表现,接近 AGI。但定义「好表现」是难题,Anthropic 或投 10 亿美元提升模型企业应用表现。
可能是目前效果最好的开源生图模型,混元生图3.0来了
腾讯混元发布并开源原生多模态生图模型混元图像3.0,参数规模80B,是参数量最大的开源生图模型,也是首个开源工业级原生多模态生图模型,效果对标业界头部闭源模型。文中介绍其技术方案、测评效果等。
暴走东京电玩展,Game Show也AI上了
东京电玩展上,网易、腾讯等中国游戏厂商摆大展台,AI厂商也秀出肌肉。阿里展出通义千问和通义万相,拿出大模型商用化方案;3D生成受关注,混元3D、VAST Tripo等受游戏厂商青睐;AI陪玩HakkoAI海外首秀成绩亮眼。
1052篇文献!上海AI Lab发布科学LLM综述:从数据基础到Agent前沿
上海AI Lab主导,25家研究机构共同梳理270+训练集、190+评测集,提出科学数据分层框架与智能体闭环科研新范式。还介绍了模型演进、数据情况、评估基准等,指出数据缺陷并展望走向科学家智能体的三步。
1/3预算跑平 GPT-5?上海AI Lab「路由魔法」成本直降63%性能反涨 7%!
当前大模型需解决性能与效率平衡问题,GPT - 5用测试时路由技术初步平衡。Avengers - Pro测试时路由框架集成不同LLMs,通过嵌入、聚类、评分操作,调整权衡参数α,能依查询特征选模型,性能和效率优于单一模型。
Cursor只排第6!136国用户实测25款AI编码工具,第一名73%胜率,还是个新面孔
Design Arena评测平台用对抗式评测方法,让用户对AI模型生成的设计作品投票,评估其设计美学表现。文章总结了上榜的编码工具,如new.website胜率约73%排第一,还对比了不同类型模型的排名情况。
全球首款AI原生游戏引擎再进化:GTA6再不来,我们就AI一个
GTA 6跳票成梗,其场景常被用于研究。一个多月前全球首个AI原生UGC游戏引擎发布,如今Mirage迭代为更强大的Mirage 2,支持多样场景,与Genie 3有不同优势且已上线,不过仍有技术问题待解决。