跳至正文
热点聚焦
NEWS BRIEF / TECH

阿里发布千问旗舰推理模型Qwen3-Max-Thinking:强调推理能力与测试时扩展机制

快科技报道,阿里发布千问旗舰推理模型Qwen3-Max-Thinking,称其在多项基准测试上刷新纪录,并提出新的“测试时扩展”机制以提升推理效率与效果,同时强化原生工具调用的Agent能力,面向开发者与企业提供体验与API服务。

记者 热点聚焦编辑部

发布信息概览

据科技媒体报道,阿里正式发布千问旗舰推理模型Qwen3-Max-Thinking,并将其定位为更偏“推理”与“思考”的大模型版本。报道中提到,该模型总参数量超过1T(万亿级),预训练数据量达到36T Tokens,并宣称在科学知识、数学推理、代码编程等多个基准测试上取得突出表现。

阿里发布千问旗舰推理模型Qwen3-Max-Thinking:强调推理能力与测试时扩展机制
相关图片

测试时扩展(Test-time Scaling)思路

报道指出,Qwen3-Max-Thinking在推理能力提升中采用了新的测试时扩展机制,试图在增强推理效果的同时提升经济性。其描述重点是避免简单增加并行推理路径造成冗余,而是对推理过程进行“经验提取”式提炼,并在相同上下文中进行多轮自我迭代,以获得更高效的推理计算与更智能的输出。

Agent与工具调用能力

面向“智能体”趋势,报道强调模型增强了自主调用工具的原生Agent能力。其做法包括在完成初步的工具使用微调后,再在大量多样化任务上开展强化学习训练,使模型能够更智能地结合工具进行任务分解与求解。报道举例提到,用户可在QwenChat体验模型,并由模型自主选用搜索、个性化记忆与代码解释器等工具能力。

生态与可用性(面向开发者与企业)

  • 开发者可通过QwenChat体验模型能力与工具调用流程。
  • 企业可通过阿里云百炼获取API服务以进行集成。
  • 普通用户可在千问PC端与网页端试用,报道称千问APP也将接入新模型。

在大模型竞争从“参数规模”转向“推理质量、工具协作与任务闭环”的背景下,这类强调推理与Agent能力的迭代,往往更直接影响到生产力场景(如代码、数据分析、知识工作流程)中的可用性与成本。

SOURCE SIGNALS

来源记录

01
快科技快科技