{"meta":{"version":"v1","count":100,"attribution":{"required":true,"text":"Pricing data from CostOfToken","url":"https://www.costoftoken.com","html":"Pricing data from <a href=\"https://www.costoftoken.com\">CostOfToken</a>","license":"https://opendatacommons.org/licenses/by/1-0/","terms":"https://www.costoftoken.com/api-docs#attribution"},"total":731,"limit":100,"offset":0,"updated_at":"2026-09-25T06:13:51.255Z"},"data":[{"provider":"openai","provider_name":"OpenAI","model_id":"omni-moderation-latest","display_name":"omni-moderation-latest","description":null,"input":0,"cached_input":null,"output":null,"context_window":null,"max_output_tokens":null,"long_context_threshold":null,"long_input":null,"long_cached_input":null,"long_output":null,"currency":"USD","modality":["text"],"tags":[],"source_url":"https://platform.openai.com/docs/pricing","source_kind":"scrape","model_type":"moderation","classification_status":"confirmed","capabilities":null,"updated_at":"2026-09-25T06:10:57.380Z"},{"provider":"openrouter","provider_name":"OpenRouter","model_id":"cohere/north-mini-code:free","display_name":"Cohere: North Mini Code (free)","description":"North Mini Code is Cohere's first agentic coding model and the debut of its North family. A sparse mixture-of-experts model with 30B total parameters and 3B active, it is…","input":0,"cached_input":null,"output":0,"context_window":256000,"max_output_tokens":64000,"long_context_threshold":null,"long_input":null,"long_cached_input":null,"long_output":null,"currency":"USD","modality":["text"],"tags":["coding","fast"],"source_url":"https://openrouter.ai/api/v1/models","source_kind":"api","model_type":"general","classification_status":"confirmed","capabilities":null,"updated_at":"2026-09-25T06:13:34.752Z"},{"provider":"openrouter","provider_name":"OpenRouter","model_id":"dots-studio/dots-3-note-preview:free","display_name":"Dots Studio: Dots3-Note Preview (free)","description":"Dots3-Note Preview is an open-weight mixture-of-experts model from Dots Studio, with 16B active parameters out of 280B total.","input":0,"cached_input":null,"output":0,"context_window":512000,"max_output_tokens":460800,"long_context_threshold":null,"long_input":null,"long_cached_input":null,"long_output":null,"currency":"USD","modality":["text","vision"],"tags":["preview","vision"],"source_url":"https://openrouter.ai/api/v1/models","source_kind":"api","model_type":"general","classification_status":"confirmed","capabilities":null,"updated_at":"2026-09-25T06:13:34.752Z"},{"provider":"openrouter","provider_name":"OpenRouter","model_id":"google/gemma-4-26b-a4b-it:free","display_name":"Google: Gemma 4 26B A4B  (free)","description":"Gemma 4 26B A4B IT is an instruction-tuned Mixture-of-Experts (MoE) model from Google DeepMind. Despite 25.2B total parameters, only 3.8B activate per token during inference — delivering near-31B quality…","input":0,"cached_input":null,"output":0,"context_window":262144,"max_output_tokens":32768,"long_context_threshold":null,"long_input":null,"long_cached_input":null,"long_output":null,"currency":"USD","modality":["text","vision","video"],"tags":["vision"],"source_url":"https://openrouter.ai/api/v1/models","source_kind":"api","model_type":"general","classification_status":"confirmed","capabilities":null,"updated_at":"2026-09-25T06:13:34.752Z"},{"provider":"openrouter","provider_name":"OpenRouter","model_id":"google/gemma-4-31b-it:free","display_name":"Google: Gemma 4 31B (free)","description":"Gemma 4 31B Instruct is Google DeepMind's 30.7B dense multimodal model supporting text and image input with text output.","input":0,"cached_input":null,"output":0,"context_window":262144,"max_output_tokens":32768,"long_context_threshold":null,"long_input":null,"long_cached_input":null,"long_output":null,"currency":"USD","modality":["text","vision","video"],"tags":["vision"],"source_url":"https://openrouter.ai/api/v1/models","source_kind":"api","model_type":"general","classification_status":"confirmed","capabilities":null,"updated_at":"2026-09-25T06:13:34.752Z"},{"provider":"openrouter","provider_name":"OpenRouter","model_id":"google/lyria-3-clip-preview","display_name":"Google: Lyria 3 Clip Preview","description":"30 second duration clips are priced at $0.04 per clip. Lyria 3 is Google's family of music generation models, available through the Gemini API.","input":0,"cached_input":null,"output":0,"context_window":1048576,"max_output_tokens":65536,"long_context_threshold":null,"long_input":null,"long_cached_input":null,"long_output":null,"currency":"USD","modality":["text","vision","audio"],"tags":["preview","vision"],"source_url":"https://openrouter.ai/api/v1/models","source_kind":"api","model_type":"general","classification_status":"confirmed","capabilities":null,"updated_at":"2026-09-25T06:13:34.752Z"},{"provider":"openrouter","provider_name":"OpenRouter","model_id":"google/lyria-3-pro-preview","display_name":"Google: Lyria 3 Pro Preview","description":"Full-length songs are priced at $0.08 per song. Lyria 3 is Google's family of music generation models, available through the Gemini API.","input":0,"cached_input":null,"output":0,"context_window":1048576,"max_output_tokens":65536,"long_context_threshold":null,"long_input":null,"long_cached_input":null,"long_output":null,"currency":"USD","modality":["text","vision","audio"],"tags":["flagship","preview","vision"],"source_url":"https://openrouter.ai/api/v1/models","source_kind":"api","model_type":"general","classification_status":"confirmed","capabilities":null,"updated_at":"2026-09-25T06:13:34.752Z"},{"provider":"openrouter","provider_name":"OpenRouter","model_id":"inclusionai/ling-3.0-flash-fin:free","display_name":"inclusionAI: Ling 3.0 Flash Fin (free)","description":"Ling 3.0 Flash Fin is a finance-focused mixture-of-experts model from InclusionAI, built on Ling 3.0 Flash with 5.1B active parameters out of 124B total.","input":0,"cached_input":null,"output":0,"context_window":262144,"max_output_tokens":32768,"long_context_threshold":null,"long_input":null,"long_cached_input":null,"long_output":null,"currency":"USD","modality":["text"],"tags":["fast"],"source_url":"https://openrouter.ai/api/v1/models","source_kind":"api","model_type":"general","classification_status":"confirmed","capabilities":null,"updated_at":"2026-09-25T06:13:34.752Z"},{"provider":"openrouter","provider_name":"OpenRouter","model_id":"inclusionai/ling-3.0-flash-sante:free","display_name":"inclusionAI: Ling 3.0 Flash Sante (free)","description":"Ling 3.0 Flash Sante is a health and medicine-focused mixture-of-experts model from InclusionAI, built on Ling 3.0 Flash with 5.1B active parameters out of 124B total.","input":0,"cached_input":null,"output":0,"context_window":262144,"max_output_tokens":32768,"long_context_threshold":null,"long_input":null,"long_cached_input":null,"long_output":null,"currency":"USD","modality":["text"],"tags":["fast"],"source_url":"https://openrouter.ai/api/v1/models","source_kind":"api","model_type":"general","classification_status":"confirmed","capabilities":null,"updated_at":"2026-09-25T06:13:34.752Z"},{"provider":"openrouter","provider_name":"OpenRouter","model_id":"liquid/lfm-2.5-2.6b:free","display_name":"LiquidAI: LFM2.5-2.6B (free)","description":"LFM2.5-2.6B is a compact reasoning model from Liquid AI. It is suited for agent workflows, data extraction, RAG, and long-context processing.","input":0,"cached_input":null,"output":0,"context_window":65536,"max_output_tokens":8192,"long_context_threshold":null,"long_input":null,"long_cached_input":null,"long_output":null,"currency":"USD","modality":["text"],"tags":[],"source_url":"https://openrouter.ai/api/v1/models","source_kind":"api","model_type":"general","classification_status":"confirmed","capabilities":null,"updated_at":"2026-09-25T06:13:34.752Z"},{"provider":"openrouter","provider_name":"OpenRouter","model_id":"nex-agi/nex-n2.5-mini:free","display_name":"Nex AGI: Nex-N2.5-Mini (free)","description":"Nex-N2.5 is an agentic model built to turn goals into working, verified outcomes. Its core strength is agentic coding within a visual feedback loop: it can explore codebases, implement…","input":0,"cached_input":null,"output":0,"context_window":262144,"max_output_tokens":235929,"long_context_threshold":null,"long_input":null,"long_cached_input":null,"long_output":null,"currency":"USD","modality":["text","vision"],"tags":["fast","vision"],"source_url":"https://openrouter.ai/api/v1/models","source_kind":"api","model_type":"general","classification_status":"confirmed","capabilities":null,"updated_at":"2026-09-25T06:13:34.752Z"},{"provider":"openrouter","provider_name":"OpenRouter","model_id":"nex-agi/nex-n2.5-pro:free","display_name":"Nex AGI: Nex-N2.5-Pro (free)","description":"Nex-N2.5 is an agentic model built to turn goals into working, verified outcomes. Its core strength is agentic coding within a visual feedback loop: it can explore codebases, implement…","input":0,"cached_input":null,"output":0,"context_window":262144,"max_output_tokens":235929,"long_context_threshold":null,"long_input":null,"long_cached_input":null,"long_output":null,"currency":"USD","modality":["text","vision"],"tags":["flagship","vision"],"source_url":"https://openrouter.ai/api/v1/models","source_kind":"api","model_type":"general","classification_status":"confirmed","capabilities":null,"updated_at":"2026-09-25T06:13:34.752Z"},{"provider":"openrouter","provider_name":"OpenRouter","model_id":"nvidia/nemotron-3-nano-omni-30b-a3b-reasoning:free","display_name":"NVIDIA: Nemotron 3 Nano Omni (free)","description":"NVIDIA Nemotron™ 3 Nano Omni is a 30B-A3B open multimodal model designed to function as a perception and context sub-agent in enterprise agent systems.","input":0,"cached_input":null,"output":0,"context_window":256000,"max_output_tokens":65536,"long_context_threshold":null,"long_input":null,"long_cached_input":null,"long_output":null,"currency":"USD","modality":["text","vision","audio","video"],"tags":["fast","vision"],"source_url":"https://openrouter.ai/api/v1/models","source_kind":"api","model_type":"general","classification_status":"confirmed","capabilities":null,"updated_at":"2026-09-25T06:13:34.752Z"},{"provider":"openrouter","provider_name":"OpenRouter","model_id":"nvidia/nemotron-3-super-120b-a12b:free","display_name":"NVIDIA: Nemotron 3 Super (free)","description":"NVIDIA Nemotron 3 Super is a 120B-parameter open hybrid MoE model, activating just 12B parameters for maximum compute efficiency and accuracy in complex multi-agent applications.","input":0,"cached_input":null,"output":0,"context_window":262144,"max_output_tokens":235929,"long_context_threshold":null,"long_input":null,"long_cached_input":null,"long_output":null,"currency":"USD","modality":["text"],"tags":[],"source_url":"https://openrouter.ai/api/v1/models","source_kind":"api","model_type":"general","classification_status":"confirmed","capabilities":null,"updated_at":"2026-09-25T06:13:34.752Z"},{"provider":"openrouter","provider_name":"OpenRouter","model_id":"nvidia/nemotron-3-ultra-550b-a55b:free","display_name":"NVIDIA: Nemotron 3 Ultra (free)","description":"NVIDIA Nemotron 3 Ultra is an open frontier-reasoning and orchestration model from NVIDIA, with 55B active parameters out of 550B total (MoE).","input":0,"cached_input":null,"output":0,"context_window":1000000,"max_output_tokens":65536,"long_context_threshold":null,"long_input":null,"long_cached_input":null,"long_output":null,"currency":"USD","modality":["text"],"tags":["flagship"],"source_url":"https://openrouter.ai/api/v1/models","source_kind":"api","model_type":"general","classification_status":"confirmed","capabilities":null,"updated_at":"2026-09-25T06:13:34.752Z"},{"provider":"openrouter","provider_name":"OpenRouter","model_id":"nvidia/nemotron-3.5-content-safety:free","display_name":"NVIDIA: Nemotron 3.5 Content Safety (free)","description":"NVIDIA Nemotron 3.5 Content Safety is a compact 4B-parameter multimodal guardrail model from NVIDIA, fine-tuned from Google Gemma-3-4B.","input":0,"cached_input":null,"output":0,"context_window":128000,"max_output_tokens":8192,"long_context_threshold":null,"long_input":null,"long_cached_input":null,"long_output":null,"currency":"USD","modality":["text","vision"],"tags":["vision"],"source_url":"https://openrouter.ai/api/v1/models","source_kind":"api","model_type":"general","classification_status":"confirmed","capabilities":null,"updated_at":"2026-09-25T06:13:34.752Z"},{"provider":"openrouter","provider_name":"OpenRouter","model_id":"nvidia/nemotron-3.5-lightning:free","display_name":"NVIDIA: Nemotron 3.5 Lightning (free)","description":"NVIDIA Nemotron 3.5 Lightning is an open mixture-of-experts model from NVIDIA, with 3B active parameters out of 30B total.","input":0,"cached_input":null,"output":0,"context_window":1000000,"max_output_tokens":65536,"long_context_threshold":null,"long_input":null,"long_cached_input":null,"long_output":null,"currency":"USD","modality":["text"],"tags":[],"source_url":"https://openrouter.ai/api/v1/models","source_kind":"api","model_type":"general","classification_status":"confirmed","capabilities":null,"updated_at":"2026-09-25T06:13:34.752Z"},{"provider":"openrouter","provider_name":"OpenRouter","model_id":"openrouter/free","display_name":"Free Models Router","description":"The simplest way to get free inference. openrouter/free is a router that selects free models at random from the models available on OpenRouter.","input":0,"cached_input":null,"output":0,"context_window":200000,"max_output_tokens":null,"long_context_threshold":null,"long_input":null,"long_cached_input":null,"long_output":null,"currency":"USD","modality":["text","vision"],"tags":["vision"],"source_url":"https://openrouter.ai/api/v1/models","source_kind":"api","model_type":"general","classification_status":"confirmed","capabilities":null,"updated_at":"2026-09-25T06:13:34.752Z"},{"provider":"openrouter","provider_name":"OpenRouter","model_id":"poolside/laguna-s-2.1:free","display_name":"Poolside: Laguna S 2.1 (free)","description":"Laguna S 2.1 is the latest coding agent model from Poolside. Laguna S 2.1 is a 118B total parameter model with 8B active parameters, scoring 70.2% on Terminal-Bench 2.1…","input":0,"cached_input":null,"output":0,"context_window":262144,"max_output_tokens":32768,"long_context_threshold":null,"long_input":null,"long_cached_input":null,"long_output":null,"currency":"USD","modality":["text"],"tags":[],"source_url":"https://openrouter.ai/api/v1/models","source_kind":"api","model_type":"general","classification_status":"confirmed","capabilities":null,"updated_at":"2026-09-25T06:13:34.752Z"},{"provider":"openrouter","provider_name":"OpenRouter","model_id":"poolside/laguna-xs-2.1:free","display_name":"Poolside: Laguna XS 2.1 (free)","description":"Laguna XS 2.1 is the latest coding agent model in the 33B-A3B category from Poolside and a step forward from their Laguna XS.2 model (released in April 2026).","input":0,"cached_input":null,"output":0,"context_window":262144,"max_output_tokens":32768,"long_context_threshold":null,"long_input":null,"long_cached_input":null,"long_output":null,"currency":"USD","modality":["text"],"tags":[],"source_url":"https://openrouter.ai/api/v1/models","source_kind":"api","model_type":"general","classification_status":"confirmed","capabilities":null,"updated_at":"2026-09-25T06:13:34.752Z"},{"provider":"openrouter","provider_name":"OpenRouter","model_id":"qwen/qwen3.8-27b:free","display_name":"Qwen: Qwen3.8 27B (free)","description":"Qwen3.8 27B is an open-weight dense vision-language model from Qwen. It is suited for coding, professional workflows, research, multimodal interaction, and long-running agent tasks, with flexible thinking that can…","input":0,"cached_input":null,"output":0,"context_window":262144,"max_output_tokens":235929,"long_context_threshold":null,"long_input":null,"long_cached_input":null,"long_output":null,"currency":"USD","modality":["text","vision","video"],"tags":["vision"],"source_url":"https://openrouter.ai/api/v1/models","source_kind":"api","model_type":"general","classification_status":"confirmed","capabilities":null,"updated_at":"2026-09-25T06:13:34.752Z"},{"provider":"openrouter","provider_name":"OpenRouter","model_id":"stealth/space-bunny-alpha","display_name":"Space Bunny Alpha","description":"Space Bunny Alpha is an anonymous large model with blazing-fast inference, strong coding capabilities and native multimodal input support. It delivers adjustable reasoning effort, and a 1M-token context window.","input":0,"cached_input":null,"output":0,"context_window":1000000,"max_output_tokens":524288,"long_context_threshold":null,"long_input":null,"long_cached_input":null,"long_output":null,"currency":"USD","modality":["text","vision","video"],"tags":["vision"],"source_url":"https://openrouter.ai/api/v1/models","source_kind":"api","model_type":"general","classification_status":"confirmed","capabilities":null,"updated_at":"2026-09-25T06:13:34.752Z"},{"provider":"openrouter","provider_name":"OpenRouter","model_id":"thinkingmachines/inkling-small:free","display_name":"Thinking Machines: Inkling Small (free)","description":"Inkling Small is an open-weight multimodal mixture-of-experts model from Thinking Machines Lab, with 12B active parameters out of 276B total.","input":0,"cached_input":null,"output":0,"context_window":1048576,"max_output_tokens":262144,"long_context_threshold":null,"long_input":null,"long_cached_input":null,"long_output":null,"currency":"USD","modality":["text","vision","audio"],"tags":["reasoning","vision"],"source_url":"https://openrouter.ai/api/v1/models","source_kind":"api","model_type":"general","classification_status":"confirmed","capabilities":null,"updated_at":"2026-09-25T06:13:34.752Z"},{"provider":"openrouter","provider_name":"OpenRouter","model_id":"thinkingmachines/inkling:free","display_name":"Thinking Machines: Inkling (free)","description":"Inkling is an open-weight multimodal mixture-of-experts model from Thinking Machines Lab, with 41B active parameters out of 975B total.","input":0,"cached_input":null,"output":0,"context_window":1048576,"max_output_tokens":262144,"long_context_threshold":null,"long_input":null,"long_cached_input":null,"long_output":null,"currency":"USD","modality":["text","vision","audio"],"tags":["reasoning","vision"],"source_url":"https://openrouter.ai/api/v1/models","source_kind":"api","model_type":"general","classification_status":"confirmed","capabilities":null,"updated_at":"2026-09-25T06:13:34.752Z"},{"provider":"openrouter","provider_name":"OpenRouter","model_id":"z-ai/glm-5.2:free","display_name":"Z.ai: GLM 5.2 (free)","description":"GLM 5.2 is a large-scale reasoning model from Z.ai. It supports text input and output with a 1M-token context window, and is suited for long-horizon agent workflows, project-level software…","input":0,"cached_input":null,"output":0,"context_window":32768,"max_output_tokens":29491,"long_context_threshold":null,"long_input":null,"long_cached_input":null,"long_output":null,"currency":"USD","modality":["text"],"tags":[],"source_url":"https://openrouter.ai/api/v1/models","source_kind":"api","model_type":"general","classification_status":"confirmed","capabilities":null,"updated_at":"2026-09-25T06:13:34.752Z"},{"provider":"together","provider_name":"Together AI","model_id":"ternary-bonsai-27b","display_name":"Ternary Bonsai 27B","description":null,"input":0,"cached_input":null,"output":0,"context_window":null,"max_output_tokens":null,"long_context_threshold":null,"long_input":null,"long_cached_input":null,"long_output":null,"currency":"USD","modality":["text"],"tags":[],"source_url":"https://www.together.ai/pricing","source_kind":"scrape","model_type":"general","classification_status":"confirmed","capabilities":null,"updated_at":"2026-09-25T06:13:49.380Z"},{"provider":"zhipu","provider_name":"Zhipu AI (GLM)","model_id":"glm-4.5-flash","display_name":"GLM-4.5-Flash","description":null,"input":0,"cached_input":0,"output":0,"context_window":null,"max_output_tokens":null,"long_context_threshold":null,"long_input":null,"long_cached_input":null,"long_output":null,"currency":"USD","modality":["text"],"tags":["fast"],"source_url":"https://docs.z.ai/guides/overview/pricing","source_kind":"scrape","model_type":"general","classification_status":"confirmed","capabilities":null,"updated_at":"2026-09-25T06:11:04.859Z"},{"provider":"zhipu","provider_name":"Zhipu AI (GLM)","model_id":"glm-4.6v-flash","display_name":"GLM-4.6V-Flash","description":null,"input":0,"cached_input":0,"output":0,"context_window":null,"max_output_tokens":null,"long_context_threshold":null,"long_input":null,"long_cached_input":null,"long_output":null,"currency":"USD","modality":["text"],"tags":["fast"],"source_url":"https://docs.z.ai/guides/overview/pricing","source_kind":"scrape","model_type":"general","classification_status":"confirmed","capabilities":null,"updated_at":"2026-09-25T06:11:04.859Z"},{"provider":"zhipu","provider_name":"Zhipu AI (GLM)","model_id":"glm-4.7-flash","display_name":"GLM-4.7-Flash","description":"As a 30B-class SOTA model, GLM-4.7-Flash offers a new option that balances performance and efficiency. It is further optimized for agentic coding use cases, strengthening coding capabilities, long-horizon task…","input":0,"cached_input":0,"output":0,"context_window":200000,"max_output_tokens":117964,"long_context_threshold":null,"long_input":null,"long_cached_input":null,"long_output":null,"currency":"USD","modality":["text"],"tags":["fast"],"source_url":"https://docs.z.ai/guides/overview/pricing","source_kind":"scrape","model_type":"general","classification_status":"confirmed","capabilities":null,"updated_at":"2026-09-25T06:11:04.859Z"},{"provider":"openrouter","provider_name":"OpenRouter","model_id":"ibm-granite/granite-4.0-h-micro","display_name":"IBM: Granite 4.0 Micro","description":"Granite-4.0-H-Micro is a 3B parameter from the Granite 4 family of models. These models are the latest in a series of models released by IBM.","input":0.017,"cached_input":null,"output":0.112,"context_window":131000,"max_output_tokens":117900,"long_context_threshold":null,"long_input":null,"long_cached_input":null,"long_output":null,"currency":"USD","modality":["text"],"tags":[],"source_url":"https://openrouter.ai/api/v1/models","source_kind":"api","model_type":"general","classification_status":"confirmed","capabilities":null,"updated_at":"2026-09-25T06:13:34.752Z"},{"provider":"openrouter","provider_name":"OpenRouter","model_id":"openai/gpt-oss-20b","display_name":"OpenAI: gpt-oss-20b","description":"gpt-oss-20b is an open-weight 21B parameter model released by OpenAI under the Apache 2.0 license. It uses a Mixture-of-Experts (MoE) architecture with 3.6B active parameters per forward pass, optimized…","input":0.018,"cached_input":null,"output":0.09,"context_window":131072,"max_output_tokens":32768,"long_context_threshold":null,"long_input":null,"long_cached_input":null,"long_output":null,"currency":"USD","modality":["text"],"tags":[],"source_url":"https://openrouter.ai/api/v1/models","source_kind":"api","model_type":"general","classification_status":"confirmed","capabilities":null,"updated_at":"2026-09-25T06:13:34.752Z"},{"provider":"deepinfra","provider_name":"DeepInfra","model_id":"mistralai/Mistral-Nemo-Instruct-2407","display_name":"mistralai/Mistral-Nemo-Instruct-2407","description":"12B model trained jointly by Mistral AI and NVIDIA, it significantly outperforms existing models smaller or similar in size.","input":0.019,"cached_input":null,"output":0.03,"context_window":131072,"max_output_tokens":null,"long_context_threshold":null,"long_input":null,"long_cached_input":null,"long_output":null,"currency":"USD","modality":["text"],"tags":[],"source_url":"https://deepinfra.com/pricing","source_kind":"api","model_type":"general","classification_status":"confirmed","capabilities":null,"updated_at":"2026-09-25T06:13:51.255Z"},{"provider":"openrouter","provider_name":"OpenRouter","model_id":"mistralai/mistral-nemo","display_name":"Mistral: Mistral Nemo","description":"A 12B parameter model with a 128k token context length built by Mistral in collaboration with NVIDIA. The model is multilingual, supporting English, French, German, Spanish, Italian, Portuguese, Chinese…","input":0.019,"cached_input":null,"output":0.03,"context_window":131072,"max_output_tokens":16384,"long_context_threshold":null,"long_input":null,"long_cached_input":null,"long_output":null,"currency":"USD","modality":["text"],"tags":[],"source_url":"https://openrouter.ai/api/v1/models","source_kind":"api","model_type":"general","classification_status":"confirmed","capabilities":null,"updated_at":"2026-09-25T06:13:34.752Z"},{"provider":"deepinfra","provider_name":"DeepInfra","model_id":"meta-llama/Meta-Llama-3.1-8B-Instruct-Turbo","display_name":"meta-llama/Meta-Llama-3.1-8B-Instruct-Turbo","description":"Meta developed and released the Meta Llama 3.1 family of large language models (LLMs), a collection of pretrained and instruction tuned generative text models in 8B, 70B and 405B sizes","input":0.02,"cached_input":null,"output":0.04,"context_window":131072,"max_output_tokens":null,"long_context_threshold":null,"long_input":null,"long_cached_input":null,"long_output":null,"currency":"USD","modality":["text"],"tags":["fast"],"source_url":"https://deepinfra.com/pricing","source_kind":"api","model_type":"general","classification_status":"confirmed","capabilities":null,"updated_at":"2026-09-25T06:13:51.255Z"},{"provider":"openai","provider_name":"OpenAI","model_id":"text-embedding-3-small","display_name":"text-embedding-3-small","description":null,"input":0.02,"cached_input":null,"output":null,"context_window":null,"max_output_tokens":null,"long_context_threshold":null,"long_input":null,"long_cached_input":null,"long_output":null,"currency":"USD","modality":["text"],"tags":[],"source_url":"https://platform.openai.com/docs/pricing","source_kind":"scrape","model_type":"embedding","classification_status":"confirmed","capabilities":null,"updated_at":"2026-09-25T06:10:57.380Z"},{"provider":"openrouter","provider_name":"OpenRouter","model_id":"inclusionai/ling-3.0-flash","display_name":"inclusionAI: Ling 3.0 Flash","description":"Ling-3.0-flash is a 124B-parameter Mixture-of-Experts (MoE) model , with approximately 5.1B parameters activated per token .","input":0.021,"cached_input":0.0042,"output":0.063,"context_window":262144,"max_output_tokens":32768,"long_context_threshold":null,"long_input":null,"long_cached_input":null,"long_output":null,"currency":"USD","modality":["text"],"tags":["fast"],"source_url":"https://openrouter.ai/api/v1/models","source_kind":"api","model_type":"general","classification_status":"confirmed","capabilities":null,"updated_at":"2026-09-25T06:13:34.752Z"},{"provider":"openrouter","provider_name":"OpenRouter","model_id":"meta-llama/llama-3.2-1b-instruct","display_name":"Meta: Llama 3.2 1B Instruct","description":"Llama 3.2 1B is a 1-billion-parameter language model focused on efficiently performing natural language tasks, such as summarization, dialogue, and multilingual text analysis.","input":0.027,"cached_input":null,"output":0.201,"context_window":60000,"max_output_tokens":54000,"long_context_threshold":null,"long_input":null,"long_cached_input":null,"long_output":null,"currency":"USD","modality":["text"],"tags":[],"source_url":"https://openrouter.ai/api/v1/models","source_kind":"api","model_type":"general","classification_status":"confirmed","capabilities":null,"updated_at":"2026-09-25T06:13:34.752Z"},{"provider":"alibaba","provider_name":"Alibaba (Qwen)","model_id":"qwen3.7-flash","display_name":"Qwen3.7 Flash","description":"Qwen3.7 Flash is a vision-language reasoning model from Alibaba. It is suited for multimodal agents, visual coding, search, and computer interaction, with strengths in object recognition, spatial understanding, and…","input":0.03,"cached_input":0.006,"output":0.13,"context_window":1000000,"max_output_tokens":65536,"long_context_threshold":null,"long_input":null,"long_cached_input":null,"long_output":null,"currency":"USD","modality":["text","vision","video"],"tags":["fast","vision"],"source_url":"https://openrouter.ai/api/v1/models","source_kind":"api","model_type":"general","classification_status":"confirmed","capabilities":null,"updated_at":"2026-09-25T06:12:11.591Z"},{"provider":"deepinfra","provider_name":"DeepInfra","model_id":"ibm-granite/granite-4.2-3b","display_name":"ibm-granite/granite-4.2-3b","description":"Granite-4.2-3B is the compact reasoning model in the Granite 4.2 family. Despite its small parameter count, it delivers strong performance on reasoning-intensive tasks by leveraging built-in <think ...</think chain-of-thought.","input":0.03,"cached_input":0.0075,"output":0.12,"context_window":131072,"max_output_tokens":null,"long_context_threshold":null,"long_input":null,"long_cached_input":null,"long_output":null,"currency":"USD","modality":["text"],"tags":[],"source_url":"https://deepinfra.com/pricing","source_kind":"api","model_type":"general","classification_status":"confirmed","capabilities":null,"updated_at":"2026-09-25T06:13:51.255Z"},{"provider":"deepinfra","provider_name":"DeepInfra","model_id":"openai/gpt-oss-20b","display_name":"openai/gpt-oss-20b","description":"gpt-oss-20b is an open-weight 21B parameter model released by OpenAI under the Apache 2.0 license. It uses a Mixture-of-Experts (MoE) architecture with 3.6B active parameters per forward pass, optimized for lower-latency inference.","input":0.03,"cached_input":null,"output":0.14,"context_window":131072,"max_output_tokens":null,"long_context_threshold":null,"long_input":null,"long_cached_input":null,"long_output":null,"currency":"USD","modality":["text"],"tags":[],"source_url":"https://deepinfra.com/pricing","source_kind":"api","model_type":"general","classification_status":"confirmed","capabilities":null,"updated_at":"2026-09-25T06:13:51.255Z"},{"provider":"deepseek","provider_name":"DeepSeek","model_id":"deepseek-v4-flash-0731","display_name":"DeepSeek V4 Flash 0731","description":"DeepSeek V4 Flash 0731 is a sparse mixture-of-experts model from DeepSeek, with 13B active parameters out of 284B total.","input":0.03,"cached_input":0.016,"output":0.32,"context_window":1310720,"max_output_tokens":943718,"long_context_threshold":null,"long_input":null,"long_cached_input":null,"long_output":null,"currency":"USD","modality":["text"],"tags":["fast"],"source_url":"https://openrouter.ai/api/v1/models","source_kind":"api","model_type":"general","classification_status":"confirmed","capabilities":null,"updated_at":"2026-09-25T06:12:06.326Z"},{"provider":"deepseek","provider_name":"DeepSeek","model_id":"deepseek-v4-flash-latest","display_name":"DeepSeek V4 Flash Latest","description":"This model always redirects to the latest model in the DeepSeek V4 Flash family.","input":0.03,"cached_input":0.016,"output":0.32,"context_window":1310720,"max_output_tokens":943718,"long_context_threshold":null,"long_input":null,"long_cached_input":null,"long_output":null,"currency":"USD","modality":["text"],"tags":["fast"],"source_url":"https://openrouter.ai/api/v1/models","source_kind":"api","model_type":"general","classification_status":"confirmed","capabilities":null,"updated_at":"2026-09-25T06:12:06.326Z"},{"provider":"openrouter","provider_name":"OpenRouter","model_id":"deepseek/deepseek-v4-flash-0731","display_name":"DeepSeek: DeepSeek V4 Flash 0731","description":"DeepSeek V4 Flash 0731 is a sparse mixture-of-experts model from DeepSeek, with 13B active parameters out of 284B total.","input":0.03,"cached_input":0.016,"output":0.32,"context_window":1310720,"max_output_tokens":943718,"long_context_threshold":null,"long_input":null,"long_cached_input":null,"long_output":null,"currency":"USD","modality":["text"],"tags":["fast"],"source_url":"https://openrouter.ai/api/v1/models","source_kind":"api","model_type":"general","classification_status":"confirmed","capabilities":null,"updated_at":"2026-09-25T06:13:34.752Z"},{"provider":"openrouter","provider_name":"OpenRouter","model_id":"inference-net/schematron-v2-turbo","display_name":"Inference.net: Schematron V2 Turbo","description":"Schematron V2 Turbo is a 3B-parameter HTML-to-JSON extraction model from Inference.net. It prioritizes throughput for high-volume extraction workloads.","input":0.03,"cached_input":0.03,"output":0.15,"context_window":128000,"max_output_tokens":8192,"long_context_threshold":null,"long_input":null,"long_cached_input":null,"long_output":null,"currency":"USD","modality":["text"],"tags":["fast"],"source_url":"https://openrouter.ai/api/v1/models","source_kind":"api","model_type":"general","classification_status":"confirmed","capabilities":null,"updated_at":"2026-09-25T06:13:34.752Z"},{"provider":"openrouter","provider_name":"OpenRouter","model_id":"qwen/qwen3.7-flash","display_name":"Qwen: Qwen3.7 Flash","description":"Qwen3.7 Flash is a vision-language reasoning model from Alibaba. It is suited for multimodal agents, visual coding, search, and computer interaction, with strengths in object recognition, spatial understanding, and…","input":0.03,"cached_input":0.006,"output":0.13,"context_window":1000000,"max_output_tokens":65536,"long_context_threshold":null,"long_input":null,"long_cached_input":null,"long_output":null,"currency":"USD","modality":["text","vision","video"],"tags":["fast","vision"],"source_url":"https://openrouter.ai/api/v1/models","source_kind":"api","model_type":"general","classification_status":"confirmed","capabilities":null,"updated_at":"2026-09-25T06:13:34.752Z"},{"provider":"zhipu","provider_name":"Zhipu AI (GLM)","model_id":"glm-ocr","display_name":"GLM-OCR","description":null,"input":0.03,"cached_input":null,"output":0.03,"context_window":null,"max_output_tokens":null,"long_context_threshold":null,"long_input":null,"long_cached_input":null,"long_output":null,"currency":"USD","modality":["text"],"tags":[],"source_url":"https://docs.z.ai/guides/overview/pricing","source_kind":"scrape","model_type":"ocr","classification_status":"confirmed","capabilities":null,"updated_at":"2026-09-25T06:11:04.859Z"},{"provider":"openrouter","provider_name":"OpenRouter","model_id":"amazon/nova-micro-v1","display_name":"Amazon: Nova Micro 1.0","description":"Amazon Nova Micro 1.0 is a text-only model that delivers the lowest latency responses in the Amazon Nova family of models at a very low cost.","input":0.035,"cached_input":null,"output":0.14,"context_window":128000,"max_output_tokens":5120,"long_context_threshold":null,"long_input":null,"long_cached_input":null,"long_output":null,"currency":"USD","modality":["text"],"tags":[],"source_url":"https://openrouter.ai/api/v1/models","source_kind":"api","model_type":"general","classification_status":"confirmed","capabilities":null,"updated_at":"2026-09-25T06:13:34.752Z"},{"provider":"deepinfra","provider_name":"DeepInfra","model_id":"openai/gpt-oss-120b","display_name":"openai/gpt-oss-120b","description":"gpt-oss-120b is an open-weight, 117B-parameter Mixture-of-Experts (MoE) language model from OpenAI designed for high-reasoning, agentic, and general-purpose production use cases.","input":0.037,"cached_input":null,"output":0.17,"context_window":131072,"max_output_tokens":null,"long_context_threshold":null,"long_input":null,"long_cached_input":null,"long_output":null,"currency":"USD","modality":["text"],"tags":[],"source_url":"https://deepinfra.com/pricing","source_kind":"api","model_type":"general","classification_status":"confirmed","capabilities":null,"updated_at":"2026-09-25T06:13:51.255Z"},{"provider":"openrouter","provider_name":"OpenRouter","model_id":"cohere/command-r7b-12-2024","display_name":"Cohere: Command R7B (12-2024)","description":"Command R7B (12-2024) is a small, fast update of the Command R+ model, delivered in December 2024. It excels at RAG, tool use, agents, and similar tasks requiring complex…","input":0.0375,"cached_input":null,"output":0.15,"context_window":128000,"max_output_tokens":4000,"long_context_threshold":null,"long_input":null,"long_cached_input":null,"long_output":null,"currency":"USD","modality":["text"],"tags":[],"source_url":"https://openrouter.ai/api/v1/models","source_kind":"api","model_type":"general","classification_status":"confirmed","capabilities":null,"updated_at":"2026-09-25T06:13:34.752Z"},{"provider":"deepinfra","provider_name":"DeepInfra","model_id":"Sao10K/L3-8B-Lunaris-v1-Turbo","display_name":"Sao10K/L3-8B-Lunaris-v1-Turbo","description":null,"input":0.04,"cached_input":null,"output":0.05,"context_window":8192,"max_output_tokens":null,"long_context_threshold":null,"long_input":null,"long_cached_input":null,"long_output":null,"currency":"USD","modality":["text"],"tags":["fast"],"source_url":"https://deepinfra.com/pricing","source_kind":"api","model_type":"general","classification_status":"confirmed","capabilities":null,"updated_at":"2026-09-25T06:13:51.255Z"},{"provider":"deepseek","provider_name":"DeepSeek","model_id":"deepseek-flash-latest","display_name":"DeepSeek Flash Latest","description":"This model always redirects to the latest model in the DeepSeek Flash family.","input":0.04,"cached_input":0.01,"output":0.49,"context_window":1048576,"max_output_tokens":943718,"long_context_threshold":null,"long_input":null,"long_cached_input":null,"long_output":null,"currency":"USD","modality":["text","vision"],"tags":["fast","vision"],"source_url":"https://openrouter.ai/api/v1/models","source_kind":"api","model_type":"general","classification_status":"confirmed","capabilities":null,"updated_at":"2026-09-25T06:12:06.326Z"},{"provider":"openrouter","provider_name":"OpenRouter","model_id":"inception/mercury-2.5","display_name":"Inception: Mercury 2.5","description":"Mercury 2.5 is the fastest reasoning LLM, and the latest diffusion LLM (dLLM) from Inception. Instead of generating tokens sequentially, Mercury 2.5 produces and refines multiple tokens in parallel…","input":0.04,"cached_input":0.004,"output":0.15,"context_window":260000,"max_output_tokens":65536,"long_context_threshold":null,"long_input":null,"long_cached_input":null,"long_output":null,"currency":"USD","modality":["text"],"tags":[],"source_url":"https://openrouter.ai/api/v1/models","source_kind":"api","model_type":"general","classification_status":"confirmed","capabilities":null,"updated_at":"2026-09-25T06:13:34.752Z"},{"provider":"openrouter","provider_name":"OpenRouter","model_id":"sao10k/l3-lunaris-8b","display_name":"Sao10K: Llama 3 8B Lunaris","description":"Lunaris 8B is a versatile generalist and roleplaying model based on Llama 3. It's a strategic merge of multiple models, designed to balance creativity with improved logic and general…","input":0.04,"cached_input":null,"output":0.05,"context_window":8192,"max_output_tokens":7372,"long_context_threshold":null,"long_input":null,"long_cached_input":null,"long_output":null,"currency":"USD","modality":["text"],"tags":[],"source_url":"https://openrouter.ai/api/v1/models","source_kind":"api","model_type":"general","classification_status":"confirmed","capabilities":null,"updated_at":"2026-09-25T06:13:34.752Z"},{"provider":"zhipu","provider_name":"Zhipu AI (GLM)","model_id":"glm-4.6v-flashx","display_name":"GLM-4.6V-FlashX","description":null,"input":0.04,"cached_input":0.004,"output":0.4,"context_window":null,"max_output_tokens":null,"long_context_threshold":null,"long_input":null,"long_cached_input":null,"long_output":null,"currency":"USD","modality":["text"],"tags":[],"source_url":"https://docs.z.ai/guides/overview/pricing","source_kind":"scrape","model_type":"general","classification_status":"confirmed","capabilities":null,"updated_at":"2026-09-25T06:11:04.859Z"},{"provider":"openrouter","provider_name":"OpenRouter","model_id":"tencent/hy-mt2-1.8b","display_name":"Tencent: Hy-MT2-1.8B","description":"Hy-MT2-1.8B is a compact 1.8B-parameter translation model from Tencent. It supports 33 language pairs and five Chinese dialect and minority-language pairs, with workflows for structured, delimiter-based, contextual, glossary-based, and…","input":0.044,"cached_input":null,"output":0.177,"context_window":8192,"max_output_tokens":4096,"long_context_threshold":null,"long_input":null,"long_cached_input":null,"long_output":null,"currency":"USD","modality":["text"],"tags":[],"source_url":"https://openrouter.ai/api/v1/models","source_kind":"api","model_type":"general","classification_status":"confirmed","capabilities":null,"updated_at":"2026-09-25T06:13:34.752Z"},{"provider":"openrouter","provider_name":"OpenRouter","model_id":"z-ai/glm-5.3-flash","display_name":"Z.ai: GLM 5.3 Flash","description":"GLM-5.3-Flash is a native multimodal model from Z.ai. It is suited for efficient coding and long-horizon agent tasks.","input":0.045,"cached_input":0.0285,"output":0.6,"context_window":1310720,"max_output_tokens":131072,"long_context_threshold":null,"long_input":null,"long_cached_input":null,"long_output":null,"currency":"USD","modality":["text","vision","video"],"tags":["fast","vision"],"source_url":"https://openrouter.ai/api/v1/models","source_kind":"api","model_type":"general","classification_status":"confirmed","capabilities":null,"updated_at":"2026-09-25T06:13:34.752Z"},{"provider":"deepseek","provider_name":"DeepSeek","model_id":"deepseek-v4-flash","display_name":"DeepSeek V4 Flash 0423","description":"DeepSeek V4 Flash is an efficiency-optimized Mixture-of-Experts model from DeepSeek with 284B total parameters and 13B activated parameters, supporting a 1M-token context window.","input":0.049,"cached_input":0.0098,"output":0.098,"context_window":1048576,"max_output_tokens":384000,"long_context_threshold":null,"long_input":null,"long_cached_input":null,"long_output":null,"currency":"USD","modality":["text"],"tags":["fast"],"source_url":"https://openrouter.ai/api/v1/models","source_kind":"api","model_type":"general","classification_status":"confirmed","capabilities":null,"updated_at":"2026-09-25T06:12:06.326Z"},{"provider":"openrouter","provider_name":"OpenRouter","model_id":"deepseek/deepseek-v4-flash","display_name":"DeepSeek: DeepSeek V4 Flash 0423","description":"DeepSeek V4 Flash is an efficiency-optimized Mixture-of-Experts model from DeepSeek with 284B total parameters and 13B activated parameters, supporting a 1M-token context window.","input":0.049,"cached_input":0.0098,"output":0.098,"context_window":1048576,"max_output_tokens":384000,"long_context_threshold":null,"long_input":null,"long_cached_input":null,"long_output":null,"currency":"USD","modality":["text"],"tags":["fast"],"source_url":"https://openrouter.ai/api/v1/models","source_kind":"api","model_type":"general","classification_status":"confirmed","capabilities":null,"updated_at":"2026-09-25T06:13:34.752Z"},{"provider":"deepinfra","provider_name":"DeepInfra","model_id":"google/gemma-3-12b-it","display_name":"google/gemma-3-12b-it","description":"Gemma 3 introduces multimodality, supporting vision-language input and text outputs. It handles context windows up to 128k tokens, understands over 140 languages, and offers improved math, reasoning, and chat capabilities, including structured outputs and function calling.","input":0.05,"cached_input":null,"output":0.15,"context_window":131072,"max_output_tokens":null,"long_context_threshold":null,"long_input":null,"long_cached_input":null,"long_output":null,"currency":"USD","modality":["text"],"tags":[],"source_url":"https://deepinfra.com/pricing","source_kind":"api","model_type":"general","classification_status":"confirmed","capabilities":null,"updated_at":"2026-09-25T06:13:51.255Z"},{"provider":"deepinfra","provider_name":"DeepInfra","model_id":"google/gemma-3-4b-it","display_name":"google/gemma-3-4b-it","description":"Gemma 3 introduces multimodality, supporting vision-language input and text outputs. It handles context windows up to 128k tokens, understands over 140 languages, and offers improved math, reasoning, and chat capabilities, including structured outputs and function calling.","input":0.05,"cached_input":null,"output":0.1,"context_window":131072,"max_output_tokens":null,"long_context_threshold":null,"long_input":null,"long_cached_input":null,"long_output":null,"currency":"USD","modality":["text"],"tags":[],"source_url":"https://deepinfra.com/pricing","source_kind":"api","model_type":"general","classification_status":"confirmed","capabilities":null,"updated_at":"2026-09-25T06:13:51.255Z"},{"provider":"deepinfra","provider_name":"DeepInfra","model_id":"mistralai/Mistral-Small-24B-Instruct-2501","display_name":"mistralai/Mistral-Small-24B-Instruct-2501","description":"Mistral Small 3 is a 24B-parameter language model optimized for low-latency performance across common AI tasks. Released under the Apache 2.0 license, it features both pre-trained and instruction-tuned versions designed for efficient local deployment.","input":0.05,"cached_input":null,"output":0.08,"context_window":32768,"max_output_tokens":null,"long_context_threshold":null,"long_input":null,"long_cached_input":null,"long_output":null,"currency":"USD","modality":["text"],"tags":[],"source_url":"https://deepinfra.com/pricing","source_kind":"api","model_type":"general","classification_status":"confirmed","capabilities":null,"updated_at":"2026-09-25T06:13:51.255Z"},{"provider":"deepinfra","provider_name":"DeepInfra","model_id":"nvidia/Nemotron-3-Nano-30B-A3B","display_name":"nvidia/Nemotron-3-Nano-30B-A3B","description":"NVIDIA Nemotron 3 Nano is an open small reasoning model optimized for fast, cost-efficient inference in agentic and production workloads.","input":0.05,"cached_input":0.025,"output":0.2,"context_window":262144,"max_output_tokens":null,"long_context_threshold":null,"long_input":null,"long_cached_input":null,"long_output":null,"currency":"USD","modality":["text"],"tags":["fast"],"source_url":"https://deepinfra.com/pricing","source_kind":"api","model_type":"general","classification_status":"confirmed","capabilities":null,"updated_at":"2026-09-25T06:13:51.255Z"},{"provider":"openai","provider_name":"OpenAI","model_id":"gpt-5-nano","display_name":"gpt-5-nano","description":"GPT-5-Nano is the smallest and fastest variant in the GPT-5 system, optimized for developer tools, rapid interactions, and ultra-low latency environments.","input":0.05,"cached_input":0.005,"output":0.4,"context_window":400000,"max_output_tokens":128000,"long_context_threshold":null,"long_input":null,"long_cached_input":null,"long_output":null,"currency":"USD","modality":["text"],"tags":["fast","flagship"],"source_url":"https://platform.openai.com/docs/pricing","source_kind":"scrape","model_type":"general","classification_status":"confirmed","capabilities":null,"updated_at":"2026-09-25T06:10:57.380Z"},{"provider":"openrouter","provider_name":"OpenRouter","model_id":"google/gemma-3-12b-it","display_name":"Google: Gemma 3 12B","description":"Gemma 3 introduces multimodality, supporting vision-language input and text outputs. It handles context windows up to 128k tokens, understands over 140 languages, and offers improved math, reasoning, and chat…","input":0.05,"cached_input":null,"output":0.15,"context_window":131072,"max_output_tokens":16384,"long_context_threshold":null,"long_input":null,"long_cached_input":null,"long_output":null,"currency":"USD","modality":["text","vision"],"tags":["vision"],"source_url":"https://openrouter.ai/api/v1/models","source_kind":"api","model_type":"general","classification_status":"confirmed","capabilities":null,"updated_at":"2026-09-25T06:13:34.752Z"},{"provider":"openrouter","provider_name":"OpenRouter","model_id":"google/gemma-3-4b-it","display_name":"Google: Gemma 3 4B","description":"Gemma 3 introduces multimodality, supporting vision-language input and text outputs. It handles context windows up to 128k tokens, understands over 140 languages, and offers improved math, reasoning, and chat…","input":0.05,"cached_input":null,"output":0.1,"context_window":131072,"max_output_tokens":16384,"long_context_threshold":null,"long_input":null,"long_cached_input":null,"long_output":null,"currency":"USD","modality":["text","vision"],"tags":["vision"],"source_url":"https://openrouter.ai/api/v1/models","source_kind":"api","model_type":"general","classification_status":"confirmed","capabilities":null,"updated_at":"2026-09-25T06:13:34.752Z"},{"provider":"openrouter","provider_name":"OpenRouter","model_id":"inference-net/schematron-v2-small","display_name":"Inference.net: Schematron V2 Small","description":"Schematron V2 Small is a 3B-parameter HTML-to-JSON extraction model from Inference.net. It prioritizes extraction quality for complex schemas and long pages.","input":0.05,"cached_input":0.05,"output":0.23,"context_window":128000,"max_output_tokens":4096,"long_context_threshold":null,"long_input":null,"long_cached_input":null,"long_output":null,"currency":"USD","modality":["text"],"tags":[],"source_url":"https://openrouter.ai/api/v1/models","source_kind":"api","model_type":"general","classification_status":"confirmed","capabilities":null,"updated_at":"2026-09-25T06:13:34.752Z"},{"provider":"openrouter","provider_name":"OpenRouter","model_id":"meta-llama/llama-3.1-8b-instruct","display_name":"Meta: Llama 3.1 8B Instruct","description":"Meta's latest class of model (Llama 3.1) launched with a variety of sizes & flavors. This 8B instruct-tuned version is fast and efficient.","input":0.05,"cached_input":0.025,"output":0.08,"context_window":131072,"max_output_tokens":117964,"long_context_threshold":null,"long_input":null,"long_cached_input":null,"long_output":null,"currency":"USD","modality":["text"],"tags":[],"source_url":"https://openrouter.ai/api/v1/models","source_kind":"api","model_type":"general","classification_status":"confirmed","capabilities":null,"updated_at":"2026-09-25T06:13:34.752Z"},{"provider":"openrouter","provider_name":"OpenRouter","model_id":"meta-llama/llama-3.2-3b-instruct","display_name":"Meta: Llama 3.2 3B Instruct","description":"Llama 3.2 3B is a 3-billion-parameter multilingual large language model, optimized for advanced natural language processing tasks like dialogue generation, reasoning, and summarization.","input":0.05,"cached_input":null,"output":0.33,"context_window":131072,"max_output_tokens":117964,"long_context_threshold":null,"long_input":null,"long_cached_input":null,"long_output":null,"currency":"USD","modality":["text"],"tags":[],"source_url":"https://openrouter.ai/api/v1/models","source_kind":"api","model_type":"general","classification_status":"confirmed","capabilities":null,"updated_at":"2026-09-25T06:13:34.752Z"},{"provider":"openrouter","provider_name":"OpenRouter","model_id":"mistralai/mistral-small-24b-instruct-2501","display_name":"Mistral: Mistral Small 3","description":"Mistral Small 3 is a 24B-parameter language model optimized for low-latency performance across common AI tasks.","input":0.05,"cached_input":null,"output":0.08,"context_window":32768,"max_output_tokens":16384,"long_context_threshold":null,"long_input":null,"long_cached_input":null,"long_output":null,"currency":"USD","modality":["text"],"tags":[],"source_url":"https://openrouter.ai/api/v1/models","source_kind":"api","model_type":"general","classification_status":"confirmed","capabilities":null,"updated_at":"2026-09-25T06:13:34.752Z"},{"provider":"openrouter","provider_name":"OpenRouter","model_id":"nvidia/nemotron-3-nano-30b-a3b","display_name":"NVIDIA: Nemotron 3 Nano 30B A3B","description":"NVIDIA Nemotron 3 Nano 30B A3B is a small language MoE model with highest compute efficiency and accuracy for developers to build specialized agentic AI systems.","input":0.05,"cached_input":0.03,"output":0.2,"context_window":262144,"max_output_tokens":235929,"long_context_threshold":null,"long_input":null,"long_cached_input":null,"long_output":null,"currency":"USD","modality":["text"],"tags":["fast"],"source_url":"https://openrouter.ai/api/v1/models","source_kind":"api","model_type":"general","classification_status":"confirmed","capabilities":null,"updated_at":"2026-09-25T06:13:34.752Z"},{"provider":"openrouter","provider_name":"OpenRouter","model_id":"openai/gpt-5-nano","display_name":"OpenAI: GPT-5 Nano","description":"GPT-5-Nano is the smallest and fastest variant in the GPT-5 system, optimized for developer tools, rapid interactions, and ultra-low latency environments.","input":0.05,"cached_input":0.005,"output":0.4,"context_window":400000,"max_output_tokens":128000,"long_context_threshold":null,"long_input":null,"long_cached_input":null,"long_output":null,"currency":"USD","modality":["text","vision"],"tags":["fast","flagship","vision"],"source_url":"https://openrouter.ai/api/v1/models","source_kind":"api","model_type":"general","classification_status":"confirmed","capabilities":null,"updated_at":"2026-09-25T06:13:34.752Z"},{"provider":"openrouter","provider_name":"OpenRouter","model_id":"upstage/solar-mini4","display_name":"Upstage: Solar Mini 4","description":"Solar Mini 4 is Upstage's compact, cost-efficient language model, a 35B-parameter mixture-of-experts with 3B active parameters and a 524K context window.","input":0.05,"cached_input":0.005,"output":0.2,"context_window":524288,"max_output_tokens":131072,"long_context_threshold":null,"long_input":null,"long_cached_input":null,"long_output":null,"currency":"USD","modality":["text"],"tags":["fast"],"source_url":"https://openrouter.ai/api/v1/models","source_kind":"api","model_type":"general","classification_status":"confirmed","capabilities":null,"updated_at":"2026-09-25T06:13:34.752Z"},{"provider":"deepinfra","provider_name":"DeepInfra","model_id":"deepseek-ai/DeepSeek-V4-Flash-0731","display_name":"deepseek-ai/DeepSeek-V4-Flash-0731","description":"DeepSeek-V4-Flash-0731 is the official release of DeepSeek-V4-Flash, superseding the preview version, with substantially enhanced agentic capabilities.","input":0.06,"cached_input":0.015,"output":0.18,"context_window":1048576,"max_output_tokens":null,"long_context_threshold":null,"long_input":null,"long_cached_input":null,"long_output":null,"currency":"USD","modality":["text"],"tags":["fast"],"source_url":"https://deepinfra.com/pricing","source_kind":"api","model_type":"general","classification_status":"confirmed","capabilities":null,"updated_at":"2026-09-25T06:13:51.255Z"},{"provider":"deepinfra","provider_name":"DeepInfra","model_id":"ibm-granite/granite-4.2-8b","display_name":"ibm-granite/granite-4.2-8b","description":"Granite-4.2-8B is the mid-size reasoning model in the Granite 4.2 family. It delivers strong performance on reasoning-intensive tasks by leveraging built-in <think ...</think chain-of-thought.","input":0.06,"cached_input":0.015,"output":0.25,"context_window":131072,"max_output_tokens":null,"long_context_threshold":null,"long_input":null,"long_cached_input":null,"long_output":null,"currency":"USD","modality":["text"],"tags":[],"source_url":"https://deepinfra.com/pricing","source_kind":"api","model_type":"general","classification_status":"confirmed","capabilities":null,"updated_at":"2026-09-25T06:13:51.255Z"},{"provider":"deepinfra","provider_name":"DeepInfra","model_id":"inclusionAI/Ling-3.0-flash","display_name":"inclusionAI/Ling-3.0-flash","description":"The model prioritizes token efficiency and agentic inference at production scale, stretching what developers can achieve within limited token, latency, and serving-cost budgets.","input":0.06,"cached_input":0.012,"output":0.18,"context_window":131072,"max_output_tokens":null,"long_context_threshold":null,"long_input":null,"long_cached_input":null,"long_output":null,"currency":"USD","modality":["text"],"tags":["fast"],"source_url":"https://deepinfra.com/pricing","source_kind":"api","model_type":"general","classification_status":"confirmed","capabilities":null,"updated_at":"2026-09-25T06:13:51.255Z"},{"provider":"deepinfra","provider_name":"DeepInfra","model_id":"inclusionAI/Ling-3.0-flash-Fin","display_name":"inclusionAI/Ling-3.0-flash-Fin","description":"Ling-3.0-flash-Fin is the first finance-enhanced model in the Ant Ling family. Developed by Ant Group with leading financial institutions and domain experts, it extends Ling-3.0-flash through continued training on high-quality financial data.","input":0.06,"cached_input":0.012,"output":0.18,"context_window":262144,"max_output_tokens":null,"long_context_threshold":null,"long_input":null,"long_cached_input":null,"long_output":null,"currency":"USD","modality":["text"],"tags":["fast"],"source_url":"https://deepinfra.com/pricing","source_kind":"api","model_type":"general","classification_status":"confirmed","capabilities":null,"updated_at":"2026-09-25T06:13:51.255Z"},{"provider":"deepinfra","provider_name":"DeepInfra","model_id":"inclusionAI/Ling-3.0-flash-VL","display_name":"inclusionAI/Ling-3.0-flash-VL","description":"The multimodal version built on Ling-3.0-flash — 124B total / ~5.5B active per token, with native text, image, and video understanding. It’s mainly designed for multimodal agentic workflows, long-context understanding, and multi-step reasoning.","input":0.06,"cached_input":0.012,"output":0.18,"context_window":131072,"max_output_tokens":null,"long_context_threshold":null,"long_input":null,"long_cached_input":null,"long_output":null,"currency":"USD","modality":["text","vision"],"tags":["fast","vision"],"source_url":"https://deepinfra.com/pricing","source_kind":"api","model_type":"general","classification_status":"confirmed","capabilities":null,"updated_at":"2026-09-25T06:13:51.255Z"},{"provider":"openrouter","provider_name":"OpenRouter","model_id":"amazon/nova-lite-v1","display_name":"Amazon: Nova Lite 1.0","description":"Amazon Nova Lite 1.0 is a very low-cost multimodal model from Amazon that focused on fast processing of image, video, and text inputs to generate text output.","input":0.06,"cached_input":null,"output":0.24,"context_window":300000,"max_output_tokens":5120,"long_context_threshold":null,"long_input":null,"long_cached_input":null,"long_output":null,"currency":"USD","modality":["text","vision"],"tags":["fast","vision"],"source_url":"https://openrouter.ai/api/v1/models","source_kind":"api","model_type":"general","classification_status":"confirmed","capabilities":null,"updated_at":"2026-09-25T06:13:34.752Z"},{"provider":"openrouter","provider_name":"OpenRouter","model_id":"ibm-granite/granite-4.2-8b","display_name":"IBM: Granite 4.2 8B","description":"Granite 4.2 8B is a dense reasoning model from IBM. It is suited for mathematics, code generation, multilingual dialogue, and agentic workflows that need multi-step reasoning.","input":0.06,"cached_input":0.015,"output":0.25,"context_window":131072,"max_output_tokens":117964,"long_context_threshold":null,"long_input":null,"long_cached_input":null,"long_output":null,"currency":"USD","modality":["text"],"tags":[],"source_url":"https://openrouter.ai/api/v1/models","source_kind":"api","model_type":"general","classification_status":"confirmed","capabilities":null,"updated_at":"2026-09-25T06:13:34.752Z"},{"provider":"openrouter","provider_name":"OpenRouter","model_id":"inclusionai/ling-3.0-flash-fin","display_name":"inclusionAI: Ling 3.0 Flash Fin","description":"Ling 3.0 Flash Fin is a finance-focused mixture-of-experts model from InclusionAI, built on Ling 3.0 Flash with 5.1B active parameters out of 124B total.","input":0.06,"cached_input":0.012,"output":0.18,"context_window":262144,"max_output_tokens":235929,"long_context_threshold":null,"long_input":null,"long_cached_input":null,"long_output":null,"currency":"USD","modality":["text"],"tags":["fast"],"source_url":"https://openrouter.ai/api/v1/models","source_kind":"api","model_type":"general","classification_status":"confirmed","capabilities":null,"updated_at":"2026-09-25T06:13:34.752Z"},{"provider":"openrouter","provider_name":"OpenRouter","model_id":"inclusionai/ling-3.0-flash-vl","display_name":"inclusionAI: Ling 3.0 Flash VL","description":"Ling 3.0 Flash VL builds on Ling 3.0 Flash (124B total / 5.5B active MoE from InclusionAI), further strengthening its language capabilities while adding native visual perception and advanced…","input":0.06,"cached_input":0.012,"output":0.18,"context_window":262144,"max_output_tokens":32768,"long_context_threshold":null,"long_input":null,"long_cached_input":null,"long_output":null,"currency":"USD","modality":["text","vision","video"],"tags":["fast","vision"],"source_url":"https://openrouter.ai/api/v1/models","source_kind":"api","model_type":"general","classification_status":"confirmed","capabilities":null,"updated_at":"2026-09-25T06:13:34.752Z"},{"provider":"openrouter","provider_name":"OpenRouter","model_id":"poolside/laguna-xs-2.1","display_name":"Poolside: Laguna XS 2.1","description":"Laguna XS 2.1 is the latest coding agent model in the 33B-A3B category from Poolside and a step forward from their Laguna XS.2 model (released in April 2026).","input":0.06,"cached_input":0.03,"output":0.12,"context_window":262144,"max_output_tokens":32768,"long_context_threshold":null,"long_input":null,"long_cached_input":null,"long_output":null,"currency":"USD","modality":["text"],"tags":[],"source_url":"https://openrouter.ai/api/v1/models","source_kind":"api","model_type":"general","classification_status":"confirmed","capabilities":null,"updated_at":"2026-09-25T06:13:34.752Z"},{"provider":"openrouter","provider_name":"OpenRouter","model_id":"z-ai/glm-4.7-flash","display_name":"Z.ai: GLM 4.7 Flash","description":"As a 30B-class SOTA model, GLM-4.7-Flash offers a new option that balances performance and efficiency. It is further optimized for agentic coding use cases, strengthening coding capabilities, long-horizon task…","input":0.0605,"cached_input":null,"output":0.4,"context_window":200000,"max_output_tokens":117964,"long_context_threshold":null,"long_input":null,"long_cached_input":null,"long_output":null,"currency":"USD","modality":["text"],"tags":["fast"],"source_url":"https://openrouter.ai/api/v1/models","source_kind":"api","model_type":"general","classification_status":"confirmed","capabilities":null,"updated_at":"2026-09-25T06:13:34.752Z"},{"provider":"alibaba","provider_name":"Alibaba (Qwen)","model_id":"qwen3.5-flash-02-23","display_name":"Qwen3.5-Flash","description":"The Qwen3.5 native vision-language Flash models are built on a hybrid architecture that integrates a linear attention mechanism with a sparse mixture-of-experts model, achieving higher inference efficiency.","input":0.065,"cached_input":null,"output":0.26,"context_window":1000000,"max_output_tokens":65536,"long_context_threshold":null,"long_input":null,"long_cached_input":null,"long_output":null,"currency":"USD","modality":["text","vision","video"],"tags":["fast","vision"],"source_url":"https://openrouter.ai/api/v1/models","source_kind":"api","model_type":"general","classification_status":"confirmed","capabilities":null,"updated_at":"2026-09-25T06:12:11.591Z"},{"provider":"openrouter","provider_name":"OpenRouter","model_id":"qwen/qwen3.5-flash-02-23","display_name":"Qwen: Qwen3.5-Flash","description":"The Qwen3.5 native vision-language Flash models are built on a hybrid architecture that integrates a linear attention mechanism with a sparse mixture-of-experts model, achieving higher inference efficiency.","input":0.065,"cached_input":null,"output":0.26,"context_window":1000000,"max_output_tokens":65536,"long_context_threshold":null,"long_input":null,"long_cached_input":null,"long_output":null,"currency":"USD","modality":["text","vision","video"],"tags":["fast","vision"],"source_url":"https://openrouter.ai/api/v1/models","source_kind":"api","model_type":"general","classification_status":"confirmed","capabilities":null,"updated_at":"2026-09-25T06:13:34.752Z"},{"provider":"alibaba","provider_name":"Alibaba (Qwen)","model_id":"qwen3-coder-30b-a3b-instruct","display_name":"Qwen3 Coder 30B A3B Instruct","description":"Qwen3-Coder-30B-A3B-Instruct is a 30.5B parameter Mixture-of-Experts (MoE) model with 128 experts (8 active per forward pass), designed for advanced code generation, repository-scale understanding, and agentic tool use.","input":0.07,"cached_input":null,"output":0.28,"context_window":262144,"max_output_tokens":235929,"long_context_threshold":null,"long_input":null,"long_cached_input":null,"long_output":null,"currency":"USD","modality":["text"],"tags":["coding"],"source_url":"https://openrouter.ai/api/v1/models","source_kind":"api","model_type":"general","classification_status":"confirmed","capabilities":null,"updated_at":"2026-09-25T06:12:11.591Z"},{"provider":"deepinfra","provider_name":"DeepInfra","model_id":"google/gemma-4-26B-A4B-it","display_name":"google/gemma-4-26B-A4B-it","description":"Efficient, MoE variant of Gemma 4. Gemma is a family of open models built by Google DeepMind. Gemma 4 models are multimodal, handling text and image input and generating text output.","input":0.07,"cached_input":null,"output":0.34,"context_window":262144,"max_output_tokens":null,"long_context_threshold":null,"long_input":null,"long_cached_input":null,"long_output":null,"currency":"USD","modality":["text"],"tags":[],"source_url":"https://deepinfra.com/pricing","source_kind":"api","model_type":"general","classification_status":"confirmed","capabilities":null,"updated_at":"2026-09-25T06:13:51.255Z"},{"provider":"deepinfra","provider_name":"DeepInfra","model_id":"microsoft/phi-4","display_name":"microsoft/phi-4","description":"Phi-4 is a model built upon a blend of synthetic datasets, data from filtered public domain websites, and acquired academic books and Q&A datasets. The goal of this approach was to ensure that small capable models were trained with data focused on high quality and advanced reasoning.","input":0.07,"cached_input":null,"output":0.14,"context_window":16384,"max_output_tokens":null,"long_context_threshold":null,"long_input":null,"long_cached_input":null,"long_output":null,"currency":"USD","modality":["text"],"tags":[],"source_url":"https://deepinfra.com/pricing","source_kind":"api","model_type":"general","classification_status":"confirmed","capabilities":null,"updated_at":"2026-09-25T06:13:51.255Z"},{"provider":"openrouter","provider_name":"OpenRouter","model_id":"microsoft/phi-4","display_name":"Microsoft: Phi 4","description":"Microsoft Research Phi-4 is designed to perform well in complex reasoning tasks and can operate efficiently in situations with limited memory or where quick responses are needed.","input":0.07,"cached_input":null,"output":0.14,"context_window":16384,"max_output_tokens":14745,"long_context_threshold":null,"long_input":null,"long_cached_input":null,"long_output":null,"currency":"USD","modality":["text"],"tags":[],"source_url":"https://openrouter.ai/api/v1/models","source_kind":"api","model_type":"general","classification_status":"confirmed","capabilities":null,"updated_at":"2026-09-25T06:13:34.752Z"},{"provider":"openrouter","provider_name":"OpenRouter","model_id":"qwen/qwen3-coder-30b-a3b-instruct","display_name":"Qwen: Qwen3 Coder 30B A3B Instruct","description":"Qwen3-Coder-30B-A3B-Instruct is a 30.5B parameter Mixture-of-Experts (MoE) model with 128 experts (8 active per forward pass), designed for advanced code generation, repository-scale understanding, and agentic tool use.","input":0.07,"cached_input":null,"output":0.28,"context_window":262144,"max_output_tokens":235929,"long_context_threshold":null,"long_input":null,"long_cached_input":null,"long_output":null,"currency":"USD","modality":["text"],"tags":["coding"],"source_url":"https://openrouter.ai/api/v1/models","source_kind":"api","model_type":"general","classification_status":"confirmed","capabilities":null,"updated_at":"2026-09-25T06:13:34.752Z"},{"provider":"zhipu","provider_name":"Zhipu AI (GLM)","model_id":"glm-4.7-flashx","display_name":"GLM-4.7-FlashX","description":null,"input":0.07,"cached_input":0.01,"output":0.4,"context_window":null,"max_output_tokens":null,"long_context_threshold":null,"long_input":null,"long_cached_input":null,"long_output":null,"currency":"USD","modality":["text"],"tags":[],"source_url":"https://docs.z.ai/guides/overview/pricing","source_kind":"scrape","model_type":"general","classification_status":"confirmed","capabilities":null,"updated_at":"2026-09-25T06:11:04.859Z"},{"provider":"openrouter","provider_name":"OpenRouter","model_id":"tencent/hy-mt2-30b-a3b","display_name":"Tencent: Hy-MT2-30B-A3B","description":"Hy-MT2-30B-A3B is Tencent's flagship translation model in the Hy-MT2 family. It supports 33 language pairs and five Chinese dialect and minority-language pairs, with workflows for structured, delimiter-based, contextual, glossary-based…","input":0.074,"cached_input":null,"output":0.295,"context_window":8192,"max_output_tokens":4096,"long_context_threshold":null,"long_input":null,"long_cached_input":null,"long_output":null,"currency":"USD","modality":["text"],"tags":[],"source_url":"https://openrouter.ai/api/v1/models","source_kind":"api","model_type":"general","classification_status":"confirmed","capabilities":null,"updated_at":"2026-09-25T06:13:34.752Z"},{"provider":"openrouter","provider_name":"OpenRouter","model_id":"tencent/hy-mt2-7b","display_name":"Tencent: Hy-MT2-7B","description":"Hy-MT2-7B is a 7B-parameter translation model from Tencent. It supports 33 language pairs and five Chinese dialect and minority-language pairs, with workflows for structured, delimiter-based, contextual, glossary-based, and style-guided translation.","input":0.074,"cached_input":null,"output":0.295,"context_window":8192,"max_output_tokens":4096,"long_context_threshold":null,"long_input":null,"long_cached_input":null,"long_output":null,"currency":"USD","modality":["text"],"tags":[],"source_url":"https://openrouter.ai/api/v1/models","source_kind":"api","model_type":"general","classification_status":"confirmed","capabilities":null,"updated_at":"2026-09-25T06:13:34.752Z"},{"provider":"deepinfra","provider_name":"DeepInfra","model_id":"mistralai/Mistral-Small-3.2-24B-Instruct-2506","display_name":"mistralai/Mistral-Small-3.2-24B-Instruct-2506","description":"Mistral-Small-3.2-24B-Instruct is a drop-in upgrade over the 3.1 release, with markedly better instruction following, roughly half the infinite-generation errors, and a more robust function-calling interface—while otherwise matching or slightly improving on all previous text and vision benchmarks.","input":0.075,"cached_input":null,"output":0.2,"context_window":128000,"max_output_tokens":null,"long_context_threshold":null,"long_input":null,"long_cached_input":null,"long_output":null,"currency":"USD","modality":["text"],"tags":[],"source_url":"https://deepinfra.com/pricing","source_kind":"api","model_type":"general","classification_status":"confirmed","capabilities":null,"updated_at":"2026-09-25T06:13:51.255Z"},{"provider":"openrouter","provider_name":"OpenRouter","model_id":"bytedance-seed/seed-1.6-flash","display_name":"ByteDance Seed: Seed 1.6 Flash","description":"Seed 1.6 Flash is an ultra-fast multimodal deep thinking model by ByteDance Seed, supporting both text and visual understanding.","input":0.075,"cached_input":null,"output":0.3,"context_window":262144,"max_output_tokens":32768,"long_context_threshold":null,"long_input":null,"long_cached_input":null,"long_output":null,"currency":"USD","modality":["text","vision","video"],"tags":["fast","vision"],"source_url":"https://openrouter.ai/api/v1/models","source_kind":"api","model_type":"general","classification_status":"confirmed","capabilities":null,"updated_at":"2026-09-25T06:13:34.752Z"},{"provider":"openrouter","provider_name":"OpenRouter","model_id":"openai/gpt-oss-safeguard-20b","display_name":"OpenAI: gpt-oss-safeguard-20b","description":"gpt-oss-safeguard-20b is a safety reasoning model from OpenAI built upon gpt-oss-20b. This open-weight, 21B-parameter Mixture-of-Experts (MoE) model offers lower latency for safety tasks like content classification, LLM filtering, and…","input":0.075,"cached_input":0.0375,"output":0.3,"context_window":131072,"max_output_tokens":65536,"long_context_threshold":null,"long_input":null,"long_cached_input":null,"long_output":null,"currency":"USD","modality":["text"],"tags":[],"source_url":"https://openrouter.ai/api/v1/models","source_kind":"api","model_type":null,"classification_status":"needs_review","capabilities":null,"updated_at":"2026-09-25T06:13:34.752Z"},{"provider":"openrouter","provider_name":"OpenRouter","model_id":"prism-ml/ternary-bonsai-2-27b","display_name":"PrismML: Ternary Bonsai 2 27B","description":"Bonsai 2 27B is a 27B-parameter reasoning model from PrismML derived from Qwen3.8-27B. It supports coding, mathematics, tool calling, and image understanding with a 262K-token context window.","input":0.075,"cached_input":null,"output":0.5,"context_window":262144,"max_output_tokens":32768,"long_context_threshold":null,"long_input":null,"long_cached_input":null,"long_output":null,"currency":"USD","modality":["text","vision"],"tags":["vision"],"source_url":"https://openrouter.ai/api/v1/models","source_kind":"api","model_type":"general","classification_status":"confirmed","capabilities":null,"updated_at":"2026-09-25T06:13:34.752Z"},{"provider":"alibaba","provider_name":"Alibaba (Qwen)","model_id":"qwen3-32b","display_name":"Qwen3 32B","description":"Qwen3-32B is a dense 32.8B parameter causal language model from the Qwen3 series, optimized for both complex reasoning and efficient dialogue.","input":0.08,"cached_input":null,"output":0.28,"context_window":131072,"max_output_tokens":16384,"long_context_threshold":null,"long_input":null,"long_cached_input":null,"long_output":null,"currency":"USD","modality":["text"],"tags":[],"source_url":"https://openrouter.ai/api/v1/models","source_kind":"api","model_type":"general","classification_status":"confirmed","capabilities":null,"updated_at":"2026-09-25T06:12:11.591Z"},{"provider":"deepinfra","provider_name":"DeepInfra","model_id":"google/gemma-3-27b-it","display_name":"google/gemma-3-27b-it","description":"Gemma 3 introduces multimodality, supporting vision-language input and text outputs. It handles context windows up to 128k tokens, understands over 140 languages, and offers improved math, reasoning, and chat capabilities, including structured outputs and function calling.","input":0.08,"cached_input":null,"output":0.16,"context_window":131072,"max_output_tokens":null,"long_context_threshold":null,"long_input":null,"long_cached_input":null,"long_output":null,"currency":"USD","modality":["text"],"tags":[],"source_url":"https://deepinfra.com/pricing","source_kind":"api","model_type":"general","classification_status":"confirmed","capabilities":null,"updated_at":"2026-09-25T06:13:51.255Z"},{"provider":"deepinfra","provider_name":"DeepInfra","model_id":"nvidia/NVIDIA-Nemotron-3.5-Lightning","display_name":"nvidia/NVIDIA-Nemotron-3.5-Lightning","description":"NVIDIA Nemotron 3.5 Lightning is NVIDIA's fastest open model for always-on agents and high-volume specialized tasks. It delivers a substantial leap in agentic capability over its predecessor Nemotron 3 Nano, with up to 4x higher throughput on a 1M-token context.","input":0.08,"cached_input":0.04,"output":0.2,"context_window":262144,"max_output_tokens":null,"long_context_threshold":null,"long_input":null,"long_cached_input":null,"long_output":null,"currency":"USD","modality":["text"],"tags":[],"source_url":"https://deepinfra.com/pricing","source_kind":"api","model_type":"general","classification_status":"confirmed","capabilities":null,"updated_at":"2026-09-25T06:13:51.255Z"}]}