Model overview
Text generationDeep thinkingVision understandingMiniMax-M3 combines leading coding and agentic capability, a 1M-token context window, and native multimodal input. It is suitable for enterprise long-document understanding, high-quality content generation, code writing, bug fixing, native app building, and image-text interaction.
Company: MiniMaxProvider: Alibaba Cloud
Model capabilities
Input modalityT
Output modalityT
Model experience✓
Function calling✓
Structured output-
Web search-
Prefix completion-
Context cache✓
Batch inference✓
Fine-tuning-
Model pricing
Input$0.6269/1M tokens
Input (cache hit)$0.1254/1M tokens
Output$2.51/1M tokens
Rate limits and context
Maximum input length1M
Maximum input length (thinking mode)1M
Context length1M
Maximum output length-
RPM500
TPM20000000
API reference
EndpointPOST /v1/chat/completions
SDKOpenAI-compatible
API code examples
from openai import OpenAI client = OpenAI( api_key="$WLROUTER_API_KEY", base_url="https://api.wlrouter.com/v1" ) response = client.chat.completions.create( model="MiniMax/MiniMax-M3", messages=[ {"role": "user", "content": "Reply with one short sentence."} ], max_tokens=32 ) print(response.choices[0].message.content)