「高价值任务」共找到 4160 篇相关文章
腾讯混元最新开源成“最强翻译”:国际机器翻译比赛获30个语种第一
腾讯混元团队的Hunyuan-MT-7B以7B总参数量获国际翻译比赛冠军,还开源了该模型及翻译集成模型Hunyuan-MT-Chimera-7B。其Shy框架有三大创新,在多方面表现优异,还为垂直领域优化提供模板。
LLM-based Reranker效果到底如何?一项关于SoTA模型的全面分析
在信息爆炸时代,重排序是信息检索系统核心。论文对22种重排序方法实证研究,构建无污染数据集FutureQueryEval。结果显示LLM重排序器泛化能力被高估,轻量级模型有优势,为研究和应用提供指南。
马斯克Grok-4卖货创收碾压GPT-5!AI卖货排行榜曝光,AGI的尽头是卖薯片?
新智元报道,「Vending Bench」榜单让大模型经营自动售货机一较高下。Grok - 4卖货能力超GPT - 5,销量约高2倍,营收增31%。此测试揭示AI长周期决策挑战,引发AGI定义讨论。
摆脱遥控器,波士顿动力人形机器人,开始「长脑子」干活了
世界人形机器人运动会引发对人工遥控机器人的争议。波士顿动力与丰田研究院合作为 Atlas 开发大型行为模型,展示其自主收纳整理成果,模型构建有流程,成果显著,研发遵循三项核心原则。
开源复现o3图像思考!快手让AI不再被动看图,模型自主生成代码调用工具
Kwai Keye团队提出Thyme新范式,构建技术方案,赋予开源模型“超越图像思考”能力。包括设计训练策略、构建开源配套资源,拓展多模态模型工具使用与决策水平,在基准测试中性能提升显著。
奖励模型新革命!SWIFT不读文本读“心声”,打造又快又强又省钱的AI裁判
传统Best-of-N方法中的奖励模型成本高、速度慢,限制技术普及。上海交通大学等校研究者提出轻量级技术SWIFT,直接监听模型内部隐藏状态判断信心,效率、准确率等表现出色,为AI发展提供新范式。
刚刚,Anthropic 又出新货:Claude Opus 4.1 发布,代码、推理能力再升级
Anthropic发布Claude Opus 4.1,是对Opus 4的小升级,提升智能体任务、代码处理和推理能力。付费Claude用户等已可用,价格不变。在编程评测表现佳,获多方好评,官方建议升级。
谷歌开源高效文本提取 Python 库LangExtract
谷歌开源 Python 库 LangExtract,能用大语言模型从非结构化文本提取结构化信息。它定位精确、输出可靠,支持多模型,适应多领域,还能处理长文档,通过示例介绍了使用方法。
隐藏超多上下文工程(Context Engineering)技巧的框架,来试一试吧!
文章指出多数人构建的AI Agent像Shallow Agent,处理复杂任务能力弱。以Claude Code等为例,介绍深度Agent架构的秘密,如冗长提示词、规划工具等,还推出开源包deepagents方便上手。
当智能成为主要生产资料,硅基经济学引爆「AI+金融」
华东师范大学上海人工智能金融学院院长邵怡蕾提出「硅基经济学」,它以人工智能等为生产资料与经济驱动核心。她还介绍了SAIFS金融智能引擎,认为AI应创造经济价值,提出硅基世界“权力三角形”等观点。