{"object":"list","data":[{"id":"gpt-6-astra","object":"model","created":0,"owned_by":"pleum","provider":"openai","display_name":"GPT-6 Astra","modality":"text","price_unit":"token","input_price_usd":10.0,"output_price_usd":50.0,"markup_tier":"low","effective_markup_percent":0.0,"context_window":1050000,"max_output":128000,"is_active":true,"operations":["chat.generate"],"maker":"OpenAI","context_length":1050000,"max_output_tokens":128000,"architecture":{"input_modalities":["text","image"],"output_modalities":["text"]},"supported_parameters":["temperature","max_tokens","top_p","stop","seed","frequency_penalty","presence_penalty","tools","tool_choice","response_format","parallel_tool_calls","logit_bias","stream","reasoning_effort","service_tier"],"supports_thinking":true,"thinking_forced":false,"pricing":{"prompt":"0.00001","completion":"0.00005"},"pricing_krw":{"prompt":"0.013527300","completion":"0.067636500"},"pricing_tiers":[{"input_tokens_lte":272000,"input_price_usd_per_m":10.0,"output_price_usd_per_m":50.0,"cache_read_price_usd_per_m":1.0,"cache_write_price_usd_per_m":12.5},{"input_tokens_lte":1050000,"input_price_usd_per_m":20.0,"output_price_usd_per_m":75.0,"cache_read_price_usd_per_m":2.0,"cache_write_price_usd_per_m":25.0}],"pricing_variants":[],"providers":[{"provider":"openai","input_price_usd":10.0,"output_price_usd":50.0,"markup_tier":"low","effective_markup_percent":0.0,"context_window":1050000,"max_output":128000,"cache_read_usd":1.0,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.00001","completion":"0.00005"},"pricing_krw":{"prompt":"0.013527300","completion":"0.067636500"},"peak_pricing":null,"pricing_policy":{"version":1,"kind":"token_tiers","tiers":[{"input_tokens_lte":272000,"input_price_usd_per_m":10.0,"output_price_usd_per_m":50.0,"cache_read_price_usd_per_m":1.0,"cache_write_price_usd_per_m":12.5},{"input_tokens_lte":1050000,"input_price_usd_per_m":20.0,"output_price_usd_per_m":75.0,"cache_read_price_usd_per_m":2.0,"cache_write_price_usd_per_m":25.0}]},"pricing_tiers":[{"input_tokens_lte":272000,"input_price_usd_per_m":10.0,"output_price_usd_per_m":50.0,"cache_read_price_usd_per_m":1.0,"cache_write_price_usd_per_m":12.5},{"input_tokens_lte":1050000,"input_price_usd_per_m":20.0,"output_price_usd_per_m":75.0,"cache_read_price_usd_per_m":2.0,"cache_write_price_usd_per_m":25.0}],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text","image"],"output_modalities":["text"],"description":"GPT-6 Astra is OpenAI's current reasoning model with text and image input plus text output. It supports a 1,050,000-token context window, up to 128,000 output tokens, and a long-context rate above 272,000 input tokens.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"gpt-5.6-sol","object":"model","created":0,"owned_by":"pleum","provider":"openai","display_name":"GPT-5.6 Sol","modality":"text","price_unit":"token","input_price_usd":4.0,"output_price_usd":20.0,"markup_tier":"low","effective_markup_percent":0.0,"context_window":1050000,"max_output":128000,"is_active":true,"operations":["chat.generate"],"maker":"OpenAI","context_length":1050000,"max_output_tokens":128000,"architecture":{"input_modalities":["text"],"output_modalities":["text"]},"supported_parameters":["temperature","max_tokens","top_p","stop","seed","frequency_penalty","presence_penalty","tools","tool_choice","response_format","parallel_tool_calls","logit_bias","stream","reasoning_effort","service_tier","reasoning_mode"],"supports_thinking":true,"thinking_forced":false,"pricing":{"prompt":"0.000004","completion":"0.00002"},"pricing_krw":{"prompt":"0.0054109200","completion":"0.027054600"},"pricing_tiers":[{"input_tokens_lte":272000,"input_price_usd_per_m":4.0,"output_price_usd_per_m":20.0,"cache_read_price_usd_per_m":0.4,"cache_write_price_usd_per_m":5.0},{"input_tokens_lte":1050000,"input_price_usd_per_m":8.0,"output_price_usd_per_m":30.0,"cache_read_price_usd_per_m":0.8,"cache_write_price_usd_per_m":10.0}],"pricing_variants":[],"providers":[{"provider":"openai","input_price_usd":4.0,"output_price_usd":20.0,"markup_tier":"low","effective_markup_percent":0.0,"context_window":1050000,"max_output":128000,"cache_read_usd":0.4,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.000004","completion":"0.00002"},"pricing_krw":{"prompt":"0.0054109200","completion":"0.027054600"},"peak_pricing":null,"pricing_policy":{"version":1,"kind":"token_tiers","tiers":[{"input_tokens_lte":272000,"input_price_usd_per_m":4.0,"output_price_usd_per_m":20.0,"cache_read_price_usd_per_m":0.4,"cache_write_price_usd_per_m":5.0},{"input_tokens_lte":1050000,"input_price_usd_per_m":8.0,"output_price_usd_per_m":30.0,"cache_read_price_usd_per_m":0.8,"cache_write_price_usd_per_m":10.0}]},"pricing_tiers":[{"input_tokens_lte":272000,"input_price_usd_per_m":4.0,"output_price_usd_per_m":20.0,"cache_read_price_usd_per_m":0.4,"cache_write_price_usd_per_m":5.0},{"input_tokens_lte":1050000,"input_price_usd_per_m":8.0,"output_price_usd_per_m":30.0,"cache_read_price_usd_per_m":0.8,"cache_write_price_usd_per_m":10.0}],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text"],"output_modalities":["text"],"description":"GPT-5.6 Sol is OpenAI's frontier reasoning model in the GPT-5.6 family for complex professional work, with text input and output plus image input. It supports a 1,050,000-token context window and up to 128,000 output tokens.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"gpt-5.6-terra","object":"model","created":0,"owned_by":"pleum","provider":"openai","display_name":"GPT-5.6 Terra","modality":"text","price_unit":"token","input_price_usd":2.0,"output_price_usd":12.0,"markup_tier":"low","effective_markup_percent":0.0,"context_window":1050000,"max_output":128000,"is_active":true,"operations":["chat.generate"],"maker":"OpenAI","context_length":1050000,"max_output_tokens":128000,"architecture":{"input_modalities":["text"],"output_modalities":["text"]},"supported_parameters":["temperature","max_tokens","top_p","stop","seed","frequency_penalty","presence_penalty","tools","tool_choice","response_format","parallel_tool_calls","logit_bias","stream","reasoning_effort","service_tier","reasoning_mode"],"supports_thinking":true,"thinking_forced":false,"pricing":{"prompt":"0.000002","completion":"0.000012"},"pricing_krw":{"prompt":"0.0027054600","completion":"0.0162327600"},"pricing_tiers":[{"input_tokens_lte":272000,"input_price_usd_per_m":2.0,"output_price_usd_per_m":12.0,"cache_read_price_usd_per_m":0.2,"cache_write_price_usd_per_m":2.5},{"input_tokens_lte":1050000,"input_price_usd_per_m":4.0,"output_price_usd_per_m":18.0,"cache_read_price_usd_per_m":0.4,"cache_write_price_usd_per_m":5.0}],"pricing_variants":[],"providers":[{"provider":"openai","input_price_usd":2.0,"output_price_usd":12.0,"markup_tier":"low","effective_markup_percent":0.0,"context_window":1050000,"max_output":128000,"cache_read_usd":0.2,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.000002","completion":"0.000012"},"pricing_krw":{"prompt":"0.0027054600","completion":"0.0162327600"},"peak_pricing":null,"pricing_policy":{"version":1,"kind":"token_tiers","tiers":[{"input_tokens_lte":272000,"input_price_usd_per_m":2.0,"output_price_usd_per_m":12.0,"cache_read_price_usd_per_m":0.2,"cache_write_price_usd_per_m":2.5},{"input_tokens_lte":1050000,"input_price_usd_per_m":4.0,"output_price_usd_per_m":18.0,"cache_read_price_usd_per_m":0.4,"cache_write_price_usd_per_m":5.0}]},"pricing_tiers":[{"input_tokens_lte":272000,"input_price_usd_per_m":2.0,"output_price_usd_per_m":12.0,"cache_read_price_usd_per_m":0.2,"cache_write_price_usd_per_m":2.5},{"input_tokens_lte":1050000,"input_price_usd_per_m":4.0,"output_price_usd_per_m":18.0,"cache_read_price_usd_per_m":0.4,"cache_write_price_usd_per_m":5.0}],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text"],"output_modalities":["text"],"description":"OpenAI positions GPT-5.6 Terra in the GPT family for general dialogue, document understanding, and text generation. PleumRouter catalogs this standard entry with up to 1,050,000 context tokens and 128,000 output tokens.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"gpt-5.6-luna","object":"model","created":0,"owned_by":"pleum","provider":"openai","display_name":"GPT-5.6 Luna","modality":"text","price_unit":"token","input_price_usd":0.2,"output_price_usd":1.2,"markup_tier":"medium","effective_markup_percent":0.0,"context_window":1050000,"max_output":128000,"is_active":true,"operations":["chat.generate"],"maker":"OpenAI","context_length":1050000,"max_output_tokens":128000,"architecture":{"input_modalities":["text"],"output_modalities":["text"]},"supported_parameters":["temperature","max_tokens","top_p","stop","seed","frequency_penalty","presence_penalty","tools","tool_choice","response_format","parallel_tool_calls","logit_bias","stream","reasoning_effort","service_tier","reasoning_mode"],"supports_thinking":true,"thinking_forced":false,"pricing":{"prompt":"0.0000002","completion":"0.0000012"},"pricing_krw":{"prompt":"0.00027054600","completion":"0.00162327600"},"pricing_tiers":[{"input_tokens_lte":272000,"input_price_usd_per_m":0.2,"output_price_usd_per_m":1.2,"cache_read_price_usd_per_m":0.02,"cache_write_price_usd_per_m":0.25},{"input_tokens_lte":1050000,"input_price_usd_per_m":0.4,"output_price_usd_per_m":1.8,"cache_read_price_usd_per_m":0.04,"cache_write_price_usd_per_m":0.5}],"pricing_variants":[],"providers":[{"provider":"openai","input_price_usd":0.2,"output_price_usd":1.2,"markup_tier":"medium","effective_markup_percent":0.0,"context_window":1050000,"max_output":128000,"cache_read_usd":0.02,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.0000002","completion":"0.0000012"},"pricing_krw":{"prompt":"0.00027054600","completion":"0.00162327600"},"peak_pricing":null,"pricing_policy":{"version":1,"kind":"token_tiers","tiers":[{"input_tokens_lte":272000,"input_price_usd_per_m":0.2,"output_price_usd_per_m":1.2,"cache_read_price_usd_per_m":0.02,"cache_write_price_usd_per_m":0.25},{"input_tokens_lte":1050000,"input_price_usd_per_m":0.4,"output_price_usd_per_m":1.8,"cache_read_price_usd_per_m":0.04,"cache_write_price_usd_per_m":0.5}]},"pricing_tiers":[{"input_tokens_lte":272000,"input_price_usd_per_m":0.2,"output_price_usd_per_m":1.2,"cache_read_price_usd_per_m":0.02,"cache_write_price_usd_per_m":0.25},{"input_tokens_lte":1050000,"input_price_usd_per_m":0.4,"output_price_usd_per_m":1.8,"cache_read_price_usd_per_m":0.04,"cache_write_price_usd_per_m":0.5}],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text"],"output_modalities":["text"],"description":"OpenAI positions GPT-5.6 Luna in the GPT family for general dialogue, document understanding, and text generation. Its cataloged standard profile provides 1,050,000 tokens of context with a maximum output of 128,000 tokens.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"benchmark_smart","object":"model","created":0,"owned_by":"pleum","provider":"pleum","display_name":"Pleum Benchmark Smart","modality":"text","price_unit":"token","input_price_usd":0.0,"output_price_usd":0.0,"markup_tier":"medium","effective_markup_percent":0.0,"context_window":1000000,"max_output":128000,"is_active":true,"operations":["chat.generate"],"maker":"Pleum","context_length":1000000,"max_output_tokens":128000,"architecture":{"input_modalities":["text"],"output_modalities":["text"]},"supported_parameters":["temperature","max_tokens","top_p","stop","seed","frequency_penalty","presence_penalty","tools","tool_choice","response_format","parallel_tool_calls","logit_bias","stream"],"supports_thinking":false,"thinking_forced":false,"pricing":{"prompt":"0.00","completion":"0.00"},"pricing_krw":{"prompt":"0.000000","completion":"0.000000"},"pricing_tiers":[],"pricing_variants":[],"providers":[{"provider":"pleum","input_price_usd":0.0,"output_price_usd":0.0,"markup_tier":"medium","effective_markup_percent":0.0,"context_window":1000000,"max_output":128000,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.00","completion":"0.00"},"pricing_krw":{"prompt":"0.000000","completion":"0.000000"},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text"],"output_modalities":["text"],"description":"Sorts each request into a kind of work — coding, translation, summarizing — then picks the model that scores highest on it. You never name a model, and newly added models join the candidate pool without a code change.","billing_mode":"routed_payg","cost_basis":"Only the input and output tokens of the model actually selected — no routing fee","promo_discount_factor":null,"promo_ends_at":null},{"id":"perfect","object":"model","created":0,"owned_by":"pleum","provider":"pleum","display_name":"Pleum Perfect","modality":"text","price_unit":"token","input_price_usd":0.0,"output_price_usd":0.0,"markup_tier":"medium","effective_markup_percent":0.0,"context_window":1000000,"max_output":128000,"is_active":true,"operations":["chat.generate"],"maker":"Pleum","context_length":1000000,"max_output_tokens":128000,"architecture":{"input_modalities":["text"],"output_modalities":["text"]},"supported_parameters":["temperature","max_tokens","top_p","stop","seed","frequency_penalty","presence_penalty","tools","tool_choice","response_format","parallel_tool_calls","logit_bias","stream"],"supports_thinking":false,"thinking_forced":false,"pricing":{"prompt":"0.00","completion":"0.00"},"pricing_krw":{"prompt":"0.000000","completion":"0.000000"},"pricing_tiers":[],"pricing_variants":[],"providers":[{"provider":"pleum","input_price_usd":0.0,"output_price_usd":0.0,"markup_tier":"medium","effective_markup_percent":0.0,"context_window":1000000,"max_output":128000,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.00","completion":"0.00"},"pricing_krw":{"prompt":"0.000000","completion":"0.000000"},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text"],"output_modalities":["text"],"description":"Hard requests go to several top models at once and their answers are merged into one. Easy requests take a single-model fast path instead of burning credits. What one model misses, another fills in.","billing_mode":"routed_payg","cost_basis":"Combined usage of every model run in parallel plus the model that merges them — costs more than a single model","promo_discount_factor":null,"promo_ends_at":null},{"id":"preset/chatbot","object":"model","created":0,"owned_by":"pleum","provider":"pleum","display_name":"Pleum Chatbot Preset","modality":"text","price_unit":"token","input_price_usd":0.0,"output_price_usd":0.0,"markup_tier":"medium","effective_markup_percent":0.0,"context_window":1000000,"max_output":128000,"is_active":true,"operations":["chat.generate"],"maker":"Pleum","context_length":1000000,"max_output_tokens":128000,"architecture":{"input_modalities":["text"],"output_modalities":["text"]},"supported_parameters":["temperature","max_tokens","top_p","stop","seed","frequency_penalty","presence_penalty","tools","tool_choice","response_format","parallel_tool_calls","logit_bias","stream"],"supports_thinking":false,"thinking_forced":false,"pricing":{"prompt":"0.00","completion":"0.00"},"pricing_krw":{"prompt":"0.000000","completion":"0.000000"},"pricing_tiers":[],"pricing_variants":[],"providers":[{"provider":"pleum","input_price_usd":0.0,"output_price_usd":0.0,"markup_tier":"medium","effective_markup_percent":0.0,"context_window":1000000,"max_output":128000,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.00","completion":"0.00"},"pricing_krw":{"prompt":"0.000000","completion":"0.000000"},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text"],"output_modalities":["text"],"description":"Pleum Chatbot Preset is a text model available through PleumRouter. Review its catalog metadata for supported capabilities and pricing.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"preset/coding","object":"model","created":0,"owned_by":"pleum","provider":"pleum","display_name":"Pleum Coding Preset","modality":"text","price_unit":"token","input_price_usd":0.0,"output_price_usd":0.0,"markup_tier":"medium","effective_markup_percent":0.0,"context_window":1000000,"max_output":128000,"is_active":true,"operations":["chat.generate"],"maker":"Pleum","context_length":1000000,"max_output_tokens":128000,"architecture":{"input_modalities":["text"],"output_modalities":["text"]},"supported_parameters":["temperature","max_tokens","top_p","stop","seed","frequency_penalty","presence_penalty","tools","tool_choice","response_format","parallel_tool_calls","logit_bias","stream"],"supports_thinking":false,"thinking_forced":false,"pricing":{"prompt":"0.00","completion":"0.00"},"pricing_krw":{"prompt":"0.000000","completion":"0.000000"},"pricing_tiers":[],"pricing_variants":[],"providers":[{"provider":"pleum","input_price_usd":0.0,"output_price_usd":0.0,"markup_tier":"medium","effective_markup_percent":0.0,"context_window":1000000,"max_output":128000,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.00","completion":"0.00"},"pricing_krw":{"prompt":"0.000000","completion":"0.000000"},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text"],"output_modalities":["text"],"description":"Pleum Coding Preset is a text model available through PleumRouter. Review its catalog metadata for supported capabilities and pricing.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"preset/research","object":"model","created":0,"owned_by":"pleum","provider":"pleum","display_name":"Pleum Research Preset","modality":"text","price_unit":"token","input_price_usd":0.0,"output_price_usd":0.0,"markup_tier":"medium","effective_markup_percent":0.0,"context_window":1000000,"max_output":128000,"is_active":true,"operations":["chat.generate"],"maker":"Pleum","context_length":1000000,"max_output_tokens":128000,"architecture":{"input_modalities":["text"],"output_modalities":["text"]},"supported_parameters":["temperature","max_tokens","top_p","stop","seed","frequency_penalty","presence_penalty","tools","tool_choice","response_format","parallel_tool_calls","logit_bias","stream"],"supports_thinking":false,"thinking_forced":false,"pricing":{"prompt":"0.00","completion":"0.00"},"pricing_krw":{"prompt":"0.000000","completion":"0.000000"},"pricing_tiers":[],"pricing_variants":[],"providers":[{"provider":"pleum","input_price_usd":0.0,"output_price_usd":0.0,"markup_tier":"medium","effective_markup_percent":0.0,"context_window":1000000,"max_output":128000,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.00","completion":"0.00"},"pricing_krw":{"prompt":"0.000000","completion":"0.000000"},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text"],"output_modalities":["text"],"description":"Pleum Research Preset is a text model available through PleumRouter. Review its catalog metadata for supported capabilities and pricing.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"preset/translation","object":"model","created":0,"owned_by":"pleum","provider":"pleum","display_name":"Pleum Translation Preset","modality":"text","price_unit":"token","input_price_usd":0.0,"output_price_usd":0.0,"markup_tier":"medium","effective_markup_percent":0.0,"context_window":1000000,"max_output":128000,"is_active":true,"operations":["chat.generate"],"maker":"Pleum","context_length":1000000,"max_output_tokens":128000,"architecture":{"input_modalities":["text"],"output_modalities":["text"]},"supported_parameters":["temperature","max_tokens","top_p","stop","seed","frequency_penalty","presence_penalty","tools","tool_choice","response_format","parallel_tool_calls","logit_bias","stream"],"supports_thinking":false,"thinking_forced":false,"pricing":{"prompt":"0.00","completion":"0.00"},"pricing_krw":{"prompt":"0.000000","completion":"0.000000"},"pricing_tiers":[],"pricing_variants":[],"providers":[{"provider":"pleum","input_price_usd":0.0,"output_price_usd":0.0,"markup_tier":"medium","effective_markup_percent":0.0,"context_window":1000000,"max_output":128000,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.00","completion":"0.00"},"pricing_krw":{"prompt":"0.000000","completion":"0.000000"},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text"],"output_modalities":["text"],"description":"Pleum Translation Preset is a text model available through PleumRouter. Review its catalog metadata for supported capabilities and pricing.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"gpt-5.5","object":"model","created":0,"owned_by":"pleum","provider":"openai","display_name":"GPT-5.5","modality":"text","price_unit":"token","input_price_usd":5.0,"output_price_usd":30.0,"markup_tier":"low","effective_markup_percent":0.0,"context_window":1050000,"max_output":128000,"is_active":true,"operations":["chat.generate"],"maker":"OpenAI","context_length":1050000,"max_output_tokens":128000,"architecture":{"input_modalities":["text"],"output_modalities":["text"]},"supported_parameters":["temperature","max_tokens","top_p","stop","seed","frequency_penalty","presence_penalty","tools","tool_choice","response_format","parallel_tool_calls","logit_bias","stream","reasoning_effort","service_tier"],"supports_thinking":true,"thinking_forced":true,"pricing":{"prompt":"0.000005","completion":"0.00003"},"pricing_krw":{"prompt":"0.0067636500","completion":"0.040581900"},"pricing_tiers":[{"input_tokens_lte":272000,"input_price_usd_per_m":5.0,"output_price_usd_per_m":30.0,"cache_read_price_usd_per_m":0.5},{"input_tokens_lte":1050000,"input_price_usd_per_m":10.0,"output_price_usd_per_m":45.0,"cache_read_price_usd_per_m":1.0}],"pricing_variants":[],"providers":[{"provider":"openai","input_price_usd":5.0,"output_price_usd":30.0,"markup_tier":"low","effective_markup_percent":0.0,"context_window":1050000,"max_output":128000,"cache_read_usd":0.5,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.000005","completion":"0.00003"},"pricing_krw":{"prompt":"0.0067636500","completion":"0.040581900"},"peak_pricing":null,"pricing_policy":{"version":1,"kind":"token_tiers","tiers":[{"input_tokens_lte":272000,"input_price_usd_per_m":5.0,"output_price_usd_per_m":30.0,"cache_read_price_usd_per_m":0.5},{"input_tokens_lte":1050000,"input_price_usd_per_m":10.0,"output_price_usd_per_m":45.0,"cache_read_price_usd_per_m":1.0}]},"pricing_tiers":[{"input_tokens_lte":272000,"input_price_usd_per_m":5.0,"output_price_usd_per_m":30.0,"cache_read_price_usd_per_m":0.5},{"input_tokens_lte":1050000,"input_price_usd_per_m":10.0,"output_price_usd_per_m":45.0,"cache_read_price_usd_per_m":1.0}],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text"],"output_modalities":["text"],"description":"OpenAI positions GPT-5.5 in the GPT family for general dialogue, document understanding, and text generation. PleumRouter catalogs this standard entry with up to 1,050,000 context tokens and 128,000 output tokens.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"gpt-5.4","object":"model","created":0,"owned_by":"pleum","provider":"openai","display_name":"GPT-5.4","modality":"text","price_unit":"token","input_price_usd":2.5,"output_price_usd":15.0,"markup_tier":"low","effective_markup_percent":0.0,"context_window":1050000,"max_output":128000,"is_active":true,"operations":["chat.generate"],"maker":"OpenAI","context_length":1050000,"max_output_tokens":128000,"architecture":{"input_modalities":["text"],"output_modalities":["text"]},"supported_parameters":["temperature","max_tokens","top_p","stop","seed","frequency_penalty","presence_penalty","tools","tool_choice","response_format","parallel_tool_calls","logit_bias","stream","reasoning_effort","service_tier"],"supports_thinking":true,"thinking_forced":true,"pricing":{"prompt":"0.0000025","completion":"0.000015"},"pricing_krw":{"prompt":"0.00338182500","completion":"0.0202909500"},"pricing_tiers":[{"input_tokens_lte":272000,"input_price_usd_per_m":2.5,"output_price_usd_per_m":15.0,"cache_read_price_usd_per_m":0.25},{"input_tokens_lte":1050000,"input_price_usd_per_m":5.0,"output_price_usd_per_m":22.5,"cache_read_price_usd_per_m":0.5}],"pricing_variants":[],"providers":[{"provider":"openai","input_price_usd":2.5,"output_price_usd":15.0,"markup_tier":"low","effective_markup_percent":0.0,"context_window":1050000,"max_output":128000,"cache_read_usd":0.25,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.0000025","completion":"0.000015"},"pricing_krw":{"prompt":"0.00338182500","completion":"0.0202909500"},"peak_pricing":null,"pricing_policy":{"version":1,"kind":"token_tiers","tiers":[{"input_tokens_lte":272000,"input_price_usd_per_m":2.5,"output_price_usd_per_m":15.0,"cache_read_price_usd_per_m":0.25},{"input_tokens_lte":1050000,"input_price_usd_per_m":5.0,"output_price_usd_per_m":22.5,"cache_read_price_usd_per_m":0.5}]},"pricing_tiers":[{"input_tokens_lte":272000,"input_price_usd_per_m":2.5,"output_price_usd_per_m":15.0,"cache_read_price_usd_per_m":0.25},{"input_tokens_lte":1050000,"input_price_usd_per_m":5.0,"output_price_usd_per_m":22.5,"cache_read_price_usd_per_m":0.5}],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text"],"output_modalities":["text"],"description":"OpenAI positions GPT-5.4 in the GPT family for general dialogue, document understanding, and text generation. The public catalog limits for the standard release are 1,050,000 context tokens and 128,000 output tokens.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"gpt-5.4-mini","object":"model","created":0,"owned_by":"pleum","provider":"openai","display_name":"GPT-5.4 Mini","modality":"text","price_unit":"token","input_price_usd":0.75,"output_price_usd":4.5,"markup_tier":"high","effective_markup_percent":0.0,"context_window":400000,"max_output":128000,"is_active":true,"operations":["chat.generate"],"maker":"OpenAI","context_length":400000,"max_output_tokens":128000,"architecture":{"input_modalities":["text"],"output_modalities":["text"]},"supported_parameters":["temperature","max_tokens","top_p","stop","seed","frequency_penalty","presence_penalty","tools","tool_choice","response_format","parallel_tool_calls","logit_bias","stream","reasoning_effort","service_tier"],"supports_thinking":true,"thinking_forced":true,"pricing":{"prompt":"0.00000075","completion":"0.0000045"},"pricing_krw":{"prompt":"0.001014547500","completion":"0.00608728500"},"pricing_tiers":[],"pricing_variants":[],"providers":[{"provider":"openai","input_price_usd":0.75,"output_price_usd":4.5,"markup_tier":"high","effective_markup_percent":0.0,"context_window":400000,"max_output":128000,"cache_read_usd":0.075,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.00000075","completion":"0.0000045"},"pricing_krw":{"prompt":"0.001014547500","completion":"0.00608728500"},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text"],"output_modalities":["text"],"description":"OpenAI positions GPT-5.4 Mini in the GPT family for general dialogue, document understanding, and text generation. For this Mini variant, the catalog lists a 400,000-token context window and up to 128,000 output tokens.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"gpt-5","object":"model","created":0,"owned_by":"pleum","provider":"openai","display_name":"GPT-5","modality":"text","price_unit":"token","input_price_usd":1.25,"output_price_usd":10.0,"markup_tier":"medium","effective_markup_percent":0.0,"context_window":400000,"max_output":128000,"is_active":true,"operations":["chat.generate"],"maker":"OpenAI","context_length":400000,"max_output_tokens":128000,"architecture":{"input_modalities":["text"],"output_modalities":["text"]},"supported_parameters":["temperature","max_tokens","top_p","stop","seed","frequency_penalty","presence_penalty","tools","tool_choice","response_format","parallel_tool_calls","logit_bias","stream","reasoning_effort","service_tier"],"supports_thinking":true,"thinking_forced":true,"pricing":{"prompt":"0.00000125","completion":"0.00001"},"pricing_krw":{"prompt":"0.001690912500","completion":"0.013527300"},"pricing_tiers":[],"pricing_variants":[],"providers":[{"provider":"openai","input_price_usd":1.25,"output_price_usd":10.0,"markup_tier":"medium","effective_markup_percent":0.0,"context_window":400000,"max_output":128000,"cache_read_usd":0.125,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.00000125","completion":"0.00001"},"pricing_krw":{"prompt":"0.001690912500","completion":"0.013527300"},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text"],"output_modalities":["text"],"description":"GPT-5 is OpenAI's previous intelligent reasoning model for coding and agentic tasks, with configurable reasoning effort. It supports a 400,000-token context window and up to 128,000 output tokens.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"gpt-5.4-nano","object":"model","created":0,"owned_by":"pleum","provider":"openai","display_name":"GPT-5.4 Nano","modality":"text","price_unit":"token","input_price_usd":0.2,"output_price_usd":1.25,"markup_tier":"high","effective_markup_percent":0.0,"context_window":400000,"max_output":128000,"is_active":true,"operations":["chat.generate"],"maker":"OpenAI","context_length":400000,"max_output_tokens":128000,"architecture":{"input_modalities":["text"],"output_modalities":["text"]},"supported_parameters":["temperature","max_tokens","top_p","stop","seed","frequency_penalty","presence_penalty","tools","tool_choice","response_format","parallel_tool_calls","logit_bias","stream","reasoning_effort","service_tier"],"supports_thinking":true,"thinking_forced":true,"pricing":{"prompt":"0.0000002","completion":"0.00000125"},"pricing_krw":{"prompt":"0.00027054600","completion":"0.001690912500"},"pricing_tiers":[],"pricing_variants":[],"providers":[{"provider":"openai","input_price_usd":0.2,"output_price_usd":1.25,"markup_tier":"high","effective_markup_percent":0.0,"context_window":400000,"max_output":128000,"cache_read_usd":0.02,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.0000002","completion":"0.00000125"},"pricing_krw":{"prompt":"0.00027054600","completion":"0.001690912500"},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text"],"output_modalities":["text"],"description":"OpenAI positions GPT-5.4 Nano in the GPT family for general dialogue, document understanding, and text generation. PleumRouter catalogs this Nano entry with up to 400,000 context tokens and 128,000 output tokens.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"gpt-5-mini","object":"model","created":0,"owned_by":"pleum","provider":"openai","display_name":"GPT-5 Mini","modality":"text","price_unit":"token","input_price_usd":0.25,"output_price_usd":2.0,"markup_tier":"high","effective_markup_percent":0.0,"context_window":400000,"max_output":128000,"is_active":true,"operations":["chat.generate"],"maker":"OpenAI","context_length":400000,"max_output_tokens":128000,"architecture":{"input_modalities":["text"],"output_modalities":["text"]},"supported_parameters":["temperature","max_tokens","top_p","stop","seed","frequency_penalty","presence_penalty","tools","tool_choice","response_format","parallel_tool_calls","logit_bias","stream","reasoning_effort","service_tier"],"supports_thinking":true,"thinking_forced":true,"pricing":{"prompt":"0.00000025","completion":"0.000002"},"pricing_krw":{"prompt":"0.000338182500","completion":"0.0027054600"},"pricing_tiers":[],"pricing_variants":[],"providers":[{"provider":"openai","input_price_usd":0.25,"output_price_usd":2.0,"markup_tier":"high","effective_markup_percent":0.0,"context_window":400000,"max_output":128000,"cache_read_usd":0.025,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.00000025","completion":"0.000002"},"pricing_krw":{"prompt":"0.000338182500","completion":"0.0027054600"},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text"],"output_modalities":["text"],"description":"OpenAI positions GPT-5 Mini in the GPT family for general dialogue, document understanding, and text generation. The public catalog limits for the Mini release are 400,000 context tokens and 128,000 output tokens.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"gpt-chat-latest","object":"model","created":0,"owned_by":"pleum","provider":"openai","display_name":"GPT Chat Latest","modality":"text","price_unit":"token","input_price_usd":5.0,"output_price_usd":30.0,"markup_tier":"low","effective_markup_percent":0.0,"context_window":400000,"max_output":128000,"is_active":true,"operations":["chat.generate"],"maker":"OpenAI","context_length":400000,"max_output_tokens":128000,"architecture":{"input_modalities":["text"],"output_modalities":["text"]},"supported_parameters":["temperature","max_tokens","top_p","stop","seed","frequency_penalty","presence_penalty","tools","tool_choice","response_format","parallel_tool_calls","logit_bias","stream","service_tier"],"supports_thinking":false,"thinking_forced":false,"pricing":{"prompt":"0.000005","completion":"0.00003"},"pricing_krw":{"prompt":"0.0067636500","completion":"0.040581900"},"pricing_tiers":[],"pricing_variants":[],"providers":[{"provider":"openai","input_price_usd":5.0,"output_price_usd":30.0,"markup_tier":"low","effective_markup_percent":0.0,"context_window":400000,"max_output":128000,"cache_read_usd":0.5,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.000005","completion":"0.00003"},"pricing_krw":{"prompt":"0.0067636500","completion":"0.040581900"},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text"],"output_modalities":["text"],"description":"OpenAI positions GPT Chat Latest in the GPT family for general dialogue, document understanding, and text generation. Its cataloged standard profile provides 400,000 tokens of context with a maximum output of 128,000 tokens.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"gpt-5-nano","object":"model","created":0,"owned_by":"pleum","provider":"openai","display_name":"GPT-5 Nano","modality":"text","price_unit":"token","input_price_usd":0.05,"output_price_usd":0.4,"markup_tier":"high","effective_markup_percent":0.0,"context_window":400000,"max_output":128000,"is_active":true,"operations":["chat.generate"],"maker":"OpenAI","context_length":400000,"max_output_tokens":128000,"architecture":{"input_modalities":["text"],"output_modalities":["text"]},"supported_parameters":["temperature","max_tokens","top_p","stop","seed","frequency_penalty","presence_penalty","tools","tool_choice","response_format","parallel_tool_calls","logit_bias","stream","reasoning_effort","service_tier"],"supports_thinking":true,"thinking_forced":true,"pricing":{"prompt":"0.00000005","completion":"0.0000004"},"pricing_krw":{"prompt":"0.000067636500","completion":"0.00054109200"},"pricing_tiers":[],"pricing_variants":[],"providers":[{"provider":"openai","input_price_usd":0.05,"output_price_usd":0.4,"markup_tier":"high","effective_markup_percent":0.0,"context_window":400000,"max_output":128000,"cache_read_usd":0.005,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.00000005","completion":"0.0000004"},"pricing_krw":{"prompt":"0.000067636500","completion":"0.00054109200"},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text"],"output_modalities":["text"],"description":"OpenAI positions GPT-5 Nano in the GPT family for general dialogue, document understanding, and text generation. Its cataloged Nano profile provides 400,000 tokens of context with a maximum output of 128,000 tokens.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"gpt-5.1","object":"model","created":0,"owned_by":"pleum","provider":"openai","display_name":"GPT-5.1","modality":"text","price_unit":"token","input_price_usd":1.25,"output_price_usd":10.0,"markup_tier":"medium","effective_markup_percent":0.0,"context_window":400000,"max_output":128000,"is_active":true,"operations":["chat.generate"],"maker":"OpenAI","context_length":400000,"max_output_tokens":128000,"architecture":{"input_modalities":["text"],"output_modalities":["text"]},"supported_parameters":["temperature","max_tokens","top_p","stop","seed","frequency_penalty","presence_penalty","tools","tool_choice","response_format","parallel_tool_calls","logit_bias","stream","reasoning_effort","service_tier"],"supports_thinking":true,"thinking_forced":false,"pricing":{"prompt":"0.00000125","completion":"0.00001"},"pricing_krw":{"prompt":"0.001690912500","completion":"0.013527300"},"pricing_tiers":[],"pricing_variants":[],"providers":[{"provider":"openai","input_price_usd":1.25,"output_price_usd":10.0,"markup_tier":"medium","effective_markup_percent":0.0,"context_window":400000,"max_output":128000,"cache_read_usd":0.125,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.00000125","completion":"0.00001"},"pricing_krw":{"prompt":"0.001690912500","completion":"0.013527300"},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text"],"output_modalities":["text"],"description":"OpenAI positions GPT-5.1 in the GPT family for general dialogue, document understanding, and text generation. PleumRouter catalogs this standard entry with up to 400,000 context tokens and 128,000 output tokens.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"gpt-5.2","object":"model","created":0,"owned_by":"pleum","provider":"openai","display_name":"GPT-5.2","modality":"text","price_unit":"token","input_price_usd":1.75,"output_price_usd":14.0,"markup_tier":"medium","effective_markup_percent":0.0,"context_window":400000,"max_output":128000,"is_active":true,"operations":["chat.generate"],"maker":"OpenAI","context_length":400000,"max_output_tokens":128000,"architecture":{"input_modalities":["text"],"output_modalities":["text"]},"supported_parameters":["temperature","max_tokens","top_p","stop","seed","frequency_penalty","presence_penalty","tools","tool_choice","response_format","parallel_tool_calls","logit_bias","stream","reasoning_effort","service_tier"],"supports_thinking":true,"thinking_forced":false,"pricing":{"prompt":"0.00000175","completion":"0.000014"},"pricing_krw":{"prompt":"0.002367277500","completion":"0.0189382200"},"pricing_tiers":[],"pricing_variants":[],"providers":[{"provider":"openai","input_price_usd":1.75,"output_price_usd":14.0,"markup_tier":"medium","effective_markup_percent":0.0,"context_window":400000,"max_output":128000,"cache_read_usd":0.175,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.00000175","completion":"0.000014"},"pricing_krw":{"prompt":"0.002367277500","completion":"0.0189382200"},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text"],"output_modalities":["text"],"description":"GPT-5.2 is OpenAI's previous frontier model for complex professional work, with configurable reasoning effort. It supports a 400,000-token context window and up to 128,000 output tokens.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"kimi-k3","object":"model","created":0,"owned_by":"pleum","provider":"moonshot","display_name":"Kimi K3","modality":"text","price_unit":"token","input_price_usd":3.0,"output_price_usd":15.0,"markup_tier":"low","effective_markup_percent":0.0,"context_window":1049000,"max_output":262000,"is_active":true,"operations":["chat.generate"],"maker":"Moonshot","context_length":1049000,"max_output_tokens":262000,"architecture":{"input_modalities":["text","image","video"],"output_modalities":["text"]},"supported_parameters":["temperature","max_tokens","top_p","stop","seed","frequency_penalty","presence_penalty","tools","tool_choice","response_format","parallel_tool_calls","logit_bias","stream"],"supports_thinking":false,"thinking_forced":false,"pricing":{"prompt":"0.000003","completion":"0.000015"},"pricing_krw":{"prompt":"0.0040581900","completion":"0.0202909500"},"pricing_tiers":[],"pricing_variants":[],"providers":[{"provider":"moonshot","input_price_usd":3.0,"output_price_usd":15.0,"markup_tier":"low","effective_markup_percent":0.0,"context_window":1048576,"max_output":1048576,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.000003","completion":"0.000015"},"pricing_krw":{"prompt":"0.0040581900","completion":"0.0202909500"},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text","image","video"],"output_modalities":["text"],"description":"Kimi K3 is Moonshot's text model for general dialogue, document understanding, and agent work. Multiple providers serve the same logical model, with provider-specific limits retained in the offerings list.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"gpt-5.3-codex","object":"model","created":0,"owned_by":"pleum","provider":"openai","display_name":"GPT-5.3 Codex","modality":"text","price_unit":"token","input_price_usd":1.75,"output_price_usd":14.0,"markup_tier":"low","effective_markup_percent":0.0,"context_window":400000,"max_output":128000,"is_active":true,"operations":["chat.generate"],"maker":"OpenAI","context_length":400000,"max_output_tokens":128000,"architecture":{"input_modalities":["text"],"output_modalities":["text"]},"supported_parameters":["temperature","max_tokens","top_p","stop","seed","frequency_penalty","presence_penalty","tools","tool_choice","response_format","parallel_tool_calls","logit_bias","stream","reasoning_effort","service_tier"],"supports_thinking":true,"thinking_forced":true,"pricing":{"prompt":"0.00000175","completion":"0.000014"},"pricing_krw":{"prompt":"0.002367277500","completion":"0.0189382200"},"pricing_tiers":[],"pricing_variants":[],"providers":[{"provider":"openai","input_price_usd":1.75,"output_price_usd":14.0,"markup_tier":"low","effective_markup_percent":0.0,"context_window":400000,"max_output":128000,"cache_read_usd":0.175,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.00000175","completion":"0.000014"},"pricing_krw":{"prompt":"0.002367277500","completion":"0.0189382200"},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text"],"output_modalities":["text"],"description":"OpenAI positions GPT-5.3 Codex in the GPT family for code generation, software engineering, and tool-driven agent work. Its cataloged standard profile provides 400,000 tokens of context with a maximum output of 128,000 tokens.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"solar-pro3","object":"model","created":0,"owned_by":"pleum","provider":"upstage","display_name":"Solar Pro 3","modality":"text","price_unit":"token","input_price_usd":0.15,"output_price_usd":0.6,"markup_tier":"medium","effective_markup_percent":0.0,"context_window":131072,"max_output":4096,"is_active":true,"operations":["chat.generate"],"maker":"Upstage","context_length":131072,"max_output_tokens":4096,"architecture":{"input_modalities":["text"],"output_modalities":["text"]},"supported_parameters":["temperature","max_tokens","top_p","stop","seed","frequency_penalty","presence_penalty","tools","tool_choice","response_format","parallel_tool_calls","logit_bias","stream"],"supports_thinking":false,"thinking_forced":false,"pricing":{"prompt":"0.00000015","completion":"0.0000006"},"pricing_krw":{"prompt":"0.000202909500","completion":"0.00081163800"},"pricing_tiers":[],"pricing_variants":[],"providers":[{"provider":"upstage","input_price_usd":0.15,"output_price_usd":0.6,"markup_tier":"medium","effective_markup_percent":0.0,"context_window":131072,"max_output":4096,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.00000015","completion":"0.0000006"},"pricing_krw":{"prompt":"0.000202909500","completion":"0.00081163800"},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text"],"output_modalities":["text"],"description":"Within Upstage's Solar lineup, Solar Pro 3 is intended for general dialogue, document understanding, and text generation. Its cataloged Pro profile provides 131,072 tokens of context with a maximum output of 4,096 tokens.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"solar-pro4","object":"model","created":0,"owned_by":"pleum","provider":"upstage","display_name":"Solar Pro 4","modality":"text","price_unit":"token","input_price_usd":0.3,"output_price_usd":1.2,"markup_tier":"medium","effective_markup_percent":0.0,"context_window":512000,"max_output":128000,"is_active":true,"operations":["chat.generate"],"maker":"Upstage","context_length":512000,"max_output_tokens":128000,"architecture":{"input_modalities":["text"],"output_modalities":["text"]},"supported_parameters":["temperature","max_tokens","top_p","stop","seed","frequency_penalty","presence_penalty","tools","tool_choice","response_format","parallel_tool_calls","logit_bias","stream"],"supports_thinking":false,"thinking_forced":false,"pricing":{"prompt":"0.0000003","completion":"0.0000012"},"pricing_krw":{"prompt":"0.00040581900","completion":"0.00162327600"},"pricing_tiers":[{"input_tokens_lte":512000,"input_price_usd_per_m":0.3,"output_price_usd_per_m":1.2,"cache_read_price_usd_per_m":0.06}],"pricing_variants":[],"providers":[{"provider":"upstage","input_price_usd":0.3,"output_price_usd":1.2,"markup_tier":"medium","effective_markup_percent":0.0,"context_window":512000,"max_output":128000,"cache_read_usd":0.06,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.0000003","completion":"0.0000012"},"pricing_krw":{"prompt":"0.00040581900","completion":"0.00162327600"},"peak_pricing":null,"pricing_policy":{"version":1,"kind":"token_tiers","tiers":[{"input_tokens_lte":512000,"input_price_usd_per_m":0.3,"output_price_usd_per_m":1.2,"cache_read_price_usd_per_m":0.06}]},"pricing_tiers":[{"input_tokens_lte":512000,"input_price_usd_per_m":0.3,"output_price_usd_per_m":1.2,"cache_read_price_usd_per_m":0.06}],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text"],"output_modalities":["text"],"description":"Solar Pro 4 is Upstage's long-context text generation model. The catalog uses the official stable alias and token and cache pricing.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"claude-fable-5-1","object":"model","created":0,"owned_by":"pleum","provider":"anthropic","display_name":"Claude Fable 5.1","modality":"text","price_unit":"token","input_price_usd":10.0,"output_price_usd":50.0,"markup_tier":"low","effective_markup_percent":0.0,"context_window":1000000,"max_output":128000,"is_active":true,"operations":["chat.generate"],"maker":"Anthropic","context_length":1000000,"max_output_tokens":128000,"architecture":{"input_modalities":["text"],"output_modalities":["text"]},"supported_parameters":["temperature","max_tokens","top_p","stop","seed","frequency_penalty","presence_penalty","tools","tool_choice","response_format","parallel_tool_calls","logit_bias","stream"],"supports_thinking":false,"thinking_forced":false,"pricing":{"prompt":"0.00001","completion":"0.00005"},"pricing_krw":{"prompt":"0.013527300","completion":"0.067636500"},"pricing_tiers":[],"pricing_variants":[],"providers":[{"provider":"anthropic","input_price_usd":10.0,"output_price_usd":50.0,"markup_tier":"low","effective_markup_percent":0.0,"context_window":1000000,"max_output":128000,"cache_read_usd":1.0,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.00001","completion":"0.00005"},"pricing_krw":{"prompt":"0.013527300","completion":"0.067636500"},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text"],"output_modalities":["text"],"description":"Claude Fable 5.1 is Anthropic's current high-capability text model, with a 1,000,000-token context window and up to 128,000 output tokens. Its published API price is $10 input / $50 output per 1M tokens.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"solar-pro2","object":"model","created":0,"owned_by":"pleum","provider":"upstage","display_name":"Solar Pro 2","modality":"text","price_unit":"token","input_price_usd":0.15,"output_price_usd":0.6,"markup_tier":"medium","effective_markup_percent":0.0,"context_window":65536,"max_output":4096,"is_active":true,"operations":["chat.generate"],"maker":"Upstage","context_length":65536,"max_output_tokens":4096,"architecture":{"input_modalities":["text"],"output_modalities":["text"]},"supported_parameters":["temperature","max_tokens","top_p","stop","seed","frequency_penalty","presence_penalty","tools","tool_choice","response_format","parallel_tool_calls","logit_bias","stream"],"supports_thinking":false,"thinking_forced":false,"pricing":{"prompt":"0.00000015","completion":"0.0000006"},"pricing_krw":{"prompt":"0.000202909500","completion":"0.00081163800"},"pricing_tiers":[],"pricing_variants":[],"providers":[{"provider":"upstage","input_price_usd":0.15,"output_price_usd":0.6,"markup_tier":"medium","effective_markup_percent":0.0,"context_window":65536,"max_output":4096,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.00000015","completion":"0.0000006"},"pricing_krw":{"prompt":"0.000202909500","completion":"0.00081163800"},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text"],"output_modalities":["text"],"description":"Within Upstage's Solar lineup, Solar Pro 2 is intended for general dialogue, document understanding, and text generation. For this Pro variant, the catalog lists a 65,536-token context window and up to 4,096 output tokens.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"claude-opus-5","object":"model","created":0,"owned_by":"pleum","provider":"anthropic","display_name":"Claude Opus 5","modality":"text","price_unit":"token","input_price_usd":5.0,"output_price_usd":25.0,"markup_tier":"low","effective_markup_percent":0.0,"context_window":1000000,"max_output":128000,"is_active":true,"operations":["chat.generate"],"maker":"Anthropic","context_length":1000000,"max_output_tokens":128000,"architecture":{"input_modalities":["text"],"output_modalities":["text"]},"supported_parameters":["temperature","max_tokens","top_p","stop","seed","frequency_penalty","presence_penalty","tools","tool_choice","response_format","parallel_tool_calls","logit_bias","stream"],"supports_thinking":false,"thinking_forced":false,"pricing":{"prompt":"0.000005","completion":"0.000025"},"pricing_krw":{"prompt":"0.0067636500","completion":"0.0338182500"},"pricing_tiers":[],"pricing_variants":[],"providers":[{"provider":"anthropic","input_price_usd":5.0,"output_price_usd":25.0,"markup_tier":"low","effective_markup_percent":0.0,"context_window":1000000,"max_output":128000,"cache_read_usd":0.5,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.000005","completion":"0.000025"},"pricing_krw":{"prompt":"0.0067636500","completion":"0.0338182500"},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text"],"output_modalities":["text"],"description":"Claude Opus 5 is Anthropic's deep-reasoning model for complex agentic coding and enterprise work. It maintains tool use and instruction following across long-horizon tasks and supports a 1,000,000-token context window with up to 128,000 output tokens.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"claude-sonnet-5","object":"model","created":0,"owned_by":"pleum","provider":"anthropic","display_name":"Claude Sonnet 5","modality":"text","price_unit":"token","input_price_usd":2.0,"output_price_usd":10.0,"markup_tier":"medium","effective_markup_percent":0.0,"context_window":1000000,"max_output":128000,"is_active":true,"operations":["chat.generate"],"maker":"Anthropic","context_length":1000000,"max_output_tokens":128000,"architecture":{"input_modalities":["text"],"output_modalities":["text"]},"supported_parameters":["temperature","max_tokens","top_p","stop","seed","frequency_penalty","presence_penalty","tools","tool_choice","response_format","parallel_tool_calls","logit_bias","stream"],"supports_thinking":false,"thinking_forced":false,"pricing":{"prompt":"0.000002","completion":"0.00001"},"pricing_krw":{"prompt":"0.0027054600","completion":"0.013527300"},"pricing_tiers":[],"pricing_variants":[],"providers":[{"provider":"anthropic","input_price_usd":2.0,"output_price_usd":10.0,"markup_tier":"medium","effective_markup_percent":0.0,"context_window":1000000,"max_output":128000,"cache_read_usd":0.2,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.000002","completion":"0.00001"},"pricing_krw":{"prompt":"0.0027054600","completion":"0.013527300"},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]},{"provider":"deepinfra","input_price_usd":3.0,"output_price_usd":15.0,"markup_tier":"low","effective_markup_percent":0.0,"context_window":1000000,"max_output":32768,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.000003","completion":"0.000015"},"pricing_krw":{"prompt":"0.0040581900","completion":"0.0202909500"},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text"],"output_modalities":["text"],"description":"Claude Sonnet 5 is Anthropic's Claude Sonnet-line option for general dialogue, document understanding, and text generation. PleumRouter catalogs this standard entry with up to 1,000,000 context tokens and 128,000 output tokens.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"solar-mini","object":"model","created":0,"owned_by":"pleum","provider":"upstage","display_name":"Solar Mini","modality":"text","price_unit":"token","input_price_usd":0.15,"output_price_usd":0.15,"markup_tier":"high","effective_markup_percent":0.0,"context_window":32768,"max_output":4096,"is_active":true,"operations":["chat.generate"],"maker":"Upstage","context_length":32768,"max_output_tokens":4096,"architecture":{"input_modalities":["text"],"output_modalities":["text"]},"supported_parameters":["temperature","max_tokens","top_p","stop","seed","frequency_penalty","presence_penalty","tools","tool_choice","response_format","parallel_tool_calls","logit_bias","stream"],"supports_thinking":false,"thinking_forced":false,"pricing":{"prompt":"0.00000015","completion":"0.00000015"},"pricing_krw":{"prompt":"0.000202909500","completion":"0.000202909500"},"pricing_tiers":[],"pricing_variants":[],"providers":[{"provider":"upstage","input_price_usd":0.15,"output_price_usd":0.15,"markup_tier":"high","effective_markup_percent":0.0,"context_window":32768,"max_output":4096,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.00000015","completion":"0.00000015"},"pricing_krw":{"prompt":"0.000202909500","completion":"0.000202909500"},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text"],"output_modalities":["text"],"description":"Within Upstage's Solar lineup, Solar Mini is intended for general dialogue, document understanding, and text generation. The public catalog limits for the Mini release are 32,768 context tokens and 4,096 output tokens.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"claude-fable-5","object":"model","created":0,"owned_by":"pleum","provider":"anthropic","display_name":"Claude Fable 5","modality":"text","price_unit":"token","input_price_usd":10.0,"output_price_usd":50.0,"markup_tier":"low","effective_markup_percent":0.0,"context_window":1000000,"max_output":128000,"is_active":true,"operations":["chat.generate"],"maker":"Anthropic","context_length":1000000,"max_output_tokens":128000,"architecture":{"input_modalities":["text"],"output_modalities":["text"]},"supported_parameters":["temperature","max_tokens","top_p","stop","seed","frequency_penalty","presence_penalty","tools","tool_choice","response_format","parallel_tool_calls","logit_bias","stream","reasoning_effort"],"supports_thinking":true,"thinking_forced":true,"pricing":{"prompt":"0.00001","completion":"0.00005"},"pricing_krw":{"prompt":"0.013527300","completion":"0.067636500"},"pricing_tiers":[],"pricing_variants":[],"providers":[{"provider":"anthropic","input_price_usd":10.0,"output_price_usd":50.0,"markup_tier":"low","effective_markup_percent":0.0,"context_window":1000000,"max_output":128000,"cache_read_usd":1.0,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.00001","completion":"0.00005"},"pricing_krw":{"prompt":"0.013527300","completion":"0.067636500"},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]},{"provider":"deepinfra","input_price_usd":10.0,"output_price_usd":50.0,"markup_tier":"low","effective_markup_percent":0.0,"context_window":1000000,"max_output":32768,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.00001","completion":"0.00005"},"pricing_krw":{"prompt":"0.013527300","completion":"0.067636500"},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text"],"output_modalities":["text"],"description":"Claude Fable 5 is Anthropic's most capable widely released model for demanding reasoning and long-horizon agentic work. It provides a default 1,000,000-token context window and up to 128,000 output tokens.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"claude-opus-4-8","object":"model","created":0,"owned_by":"pleum","provider":"anthropic","display_name":"Claude Opus 4.8","modality":"text","price_unit":"token","input_price_usd":5.0,"output_price_usd":25.0,"markup_tier":"low","effective_markup_percent":0.0,"context_window":1000000,"max_output":128000,"is_active":true,"operations":["chat.generate"],"maker":"Anthropic","context_length":1000000,"max_output_tokens":128000,"architecture":{"input_modalities":["text"],"output_modalities":["text"]},"supported_parameters":["temperature","max_tokens","top_p","stop","seed","frequency_penalty","presence_penalty","tools","tool_choice","response_format","parallel_tool_calls","logit_bias","stream","reasoning_effort"],"supports_thinking":true,"thinking_forced":false,"pricing":{"prompt":"0.000005","completion":"0.000025"},"pricing_krw":{"prompt":"0.0067636500","completion":"0.0338182500"},"pricing_tiers":[],"pricing_variants":[],"providers":[{"provider":"deepinfra","input_price_usd":5.0,"output_price_usd":25.0,"markup_tier":"low","effective_markup_percent":0.0,"context_window":1000000,"max_output":32768,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.000005","completion":"0.000025"},"pricing_krw":{"prompt":"0.0067636500","completion":"0.0338182500"},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]},{"provider":"anthropic","input_price_usd":5.0,"output_price_usd":25.0,"markup_tier":"low","effective_markup_percent":0.0,"context_window":1000000,"max_output":128000,"cache_read_usd":0.5,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.000005","completion":"0.000025"},"pricing_krw":{"prompt":"0.0067636500","completion":"0.0338182500"},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text"],"output_modalities":["text"],"description":"Anthropic positions Claude Opus 4.8 in the Claude Opus family for general dialogue, document understanding, and text generation. PleumRouter catalogs this standard entry with up to 1,000,000 context tokens and 128,000 output tokens.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"LGAI-EXAONE/K-EXAONE-2.0-750B-A37B","object":"model","created":0,"owned_by":"pleum","provider":"friendli","display_name":"EXAONE 2.0 (K-EXAONE 750B)","modality":"text","price_unit":"token","input_price_usd":1.2,"output_price_usd":4.8,"markup_tier":"medium","effective_markup_percent":0.0,"context_window":262144,"max_output":32768,"is_active":true,"operations":["chat.generate"],"maker":"LG","context_length":262144,"max_output_tokens":32768,"architecture":{"input_modalities":["text"],"output_modalities":["text"]},"supported_parameters":["temperature","max_tokens","top_p","stop","seed","frequency_penalty","presence_penalty","tools","tool_choice","response_format","parallel_tool_calls","logit_bias","stream"],"supports_thinking":false,"thinking_forced":false,"pricing":{"prompt":"0.0000012","completion":"0.0000048"},"pricing_krw":{"prompt":"0.00162327600","completion":"0.00649310400"},"pricing_tiers":[],"pricing_variants":[],"providers":[{"provider":"friendli","input_price_usd":1.2,"output_price_usd":4.8,"markup_tier":"medium","effective_markup_percent":0.0,"context_window":262144,"max_output":32768,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.0000012","completion":"0.0000048"},"pricing_krw":{"prompt":"0.00162327600","completion":"0.00649310400"},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text"],"output_modalities":["text"],"description":"EXAONE 2.0 (K-EXAONE 750B) is a text model available through PleumRouter. Review its catalog metadata for supported capabilities and pricing.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"claude-sonnet-4-6","object":"model","created":0,"owned_by":"pleum","provider":"anthropic","display_name":"Claude Sonnet 4.6","modality":"text","price_unit":"token","input_price_usd":3.0,"output_price_usd":15.0,"markup_tier":"medium","effective_markup_percent":0.0,"context_window":1000000,"max_output":128000,"is_active":true,"operations":["chat.generate"],"maker":"Anthropic","context_length":1000000,"max_output_tokens":128000,"architecture":{"input_modalities":["text"],"output_modalities":["text"]},"supported_parameters":["temperature","max_tokens","top_p","stop","seed","frequency_penalty","presence_penalty","tools","tool_choice","response_format","parallel_tool_calls","logit_bias","stream","reasoning_effort"],"supports_thinking":true,"thinking_forced":false,"pricing":{"prompt":"0.000003","completion":"0.000015"},"pricing_krw":{"prompt":"0.0040581900","completion":"0.0202909500"},"pricing_tiers":[],"pricing_variants":[],"providers":[{"provider":"anthropic","input_price_usd":3.0,"output_price_usd":15.0,"markup_tier":"medium","effective_markup_percent":0.0,"context_window":1000000,"max_output":128000,"cache_read_usd":0.3,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.000003","completion":"0.000015"},"pricing_krw":{"prompt":"0.0040581900","completion":"0.0202909500"},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]},{"provider":"deepinfra","input_price_usd":3.0,"output_price_usd":15.0,"markup_tier":"medium","effective_markup_percent":0.0,"context_window":1000000,"max_output":32768,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.000003","completion":"0.000015"},"pricing_krw":{"prompt":"0.0040581900","completion":"0.0202909500"},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text"],"output_modalities":["text"],"description":"Claude Sonnet 4.6 is Anthropic's Claude Sonnet-line option for general dialogue, document understanding, and text generation. Its cataloged standard profile provides 1,000,000 tokens of context with a maximum output of 128,000 tokens.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"claude-haiku-4-5","object":"model","created":0,"owned_by":"pleum","provider":"anthropic","display_name":"Claude Haiku 4.5","modality":"text","price_unit":"token","input_price_usd":1.0,"output_price_usd":5.0,"markup_tier":"high","effective_markup_percent":0.0,"context_window":200000,"max_output":64000,"is_active":true,"operations":["chat.generate"],"maker":"Anthropic","context_length":200000,"max_output_tokens":64000,"architecture":{"input_modalities":["text"],"output_modalities":["text"]},"supported_parameters":["temperature","max_tokens","top_p","stop","seed","frequency_penalty","presence_penalty","tools","tool_choice","response_format","parallel_tool_calls","logit_bias","stream"],"supports_thinking":false,"thinking_forced":false,"pricing":{"prompt":"0.000001","completion":"0.000005"},"pricing_krw":{"prompt":"0.0013527300","completion":"0.0067636500"},"pricing_tiers":[],"pricing_variants":[],"providers":[{"provider":"deepinfra","input_price_usd":1.0,"output_price_usd":5.0,"markup_tier":"high","effective_markup_percent":0.0,"context_window":200000,"max_output":32768,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.000001","completion":"0.000005"},"pricing_krw":{"prompt":"0.0013527300","completion":"0.0067636500"},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]},{"provider":"anthropic","input_price_usd":1.0,"output_price_usd":5.0,"markup_tier":"high","effective_markup_percent":0.0,"context_window":200000,"max_output":64000,"cache_read_usd":0.1,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.000001","completion":"0.000005"},"pricing_krw":{"prompt":"0.0013527300","completion":"0.0067636500"},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text"],"output_modalities":["text"],"description":"The Claude Haiku 4.5 release extends Anthropic's Claude Haiku family to general dialogue, document understanding, and text generation. PleumRouter catalogs this standard entry with up to 200,000 context tokens and 64,000 output tokens.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"gemini-3-flash-preview","object":"model","created":0,"owned_by":"pleum","provider":"google","display_name":"Gemini 3 Flash (Preview)","modality":"text","price_unit":"token","input_price_usd":0.5,"output_price_usd":3.0,"markup_tier":"medium","effective_markup_percent":0.0,"context_window":1000000,"max_output":65536,"is_active":true,"operations":["chat.generate"],"maker":"Google","context_length":1000000,"max_output_tokens":65536,"architecture":{"input_modalities":["text"],"output_modalities":["text"]},"supported_parameters":["temperature","max_tokens","top_p","stop","seed","frequency_penalty","presence_penalty","tools","tool_choice","response_format","parallel_tool_calls","logit_bias","stream","reasoning_effort"],"supports_thinking":true,"thinking_forced":true,"pricing":{"prompt":"0.0000005","completion":"0.000003"},"pricing_krw":{"prompt":"0.00067636500","completion":"0.0040581900"},"pricing_tiers":[],"pricing_variants":[],"providers":[{"provider":"google","input_price_usd":0.5,"output_price_usd":3.0,"markup_tier":"medium","effective_markup_percent":0.0,"context_window":1000000,"max_output":65536,"cache_read_usd":0.05,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.0000005","completion":"0.000003"},"pricing_krw":{"prompt":"0.00067636500","completion":"0.0040581900"},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text"],"output_modalities":["text"],"description":"Within Google's Gemini lineup, Gemini 3 Flash (Preview) is intended for general dialogue, document understanding, and text generation. The public catalog limits for the preview release are 1,000,000 context tokens and 65,536 output tokens.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"grok-4.6","object":"model","created":0,"owned_by":"pleum","provider":"xai","display_name":"Grok 4.6","modality":"text","price_unit":"token","input_price_usd":2.0,"output_price_usd":6.0,"markup_tier":"medium","effective_markup_percent":0.0,"context_window":500000,"max_output":131072,"is_active":true,"operations":["chat.generate"],"maker":"xAI","context_length":500000,"max_output_tokens":131072,"architecture":{"input_modalities":["text"],"output_modalities":["text"]},"supported_parameters":["temperature","max_tokens","top_p","stop","seed","frequency_penalty","presence_penalty","tools","tool_choice","response_format","parallel_tool_calls","logit_bias","stream"],"supports_thinking":false,"thinking_forced":false,"pricing":{"prompt":"0.000002","completion":"0.000006"},"pricing_krw":{"prompt":"0.0027054600","completion":"0.0081163800"},"pricing_tiers":[{"input_tokens_lte":199999,"input_price_usd_per_m":2.0,"output_price_usd_per_m":6.0,"cache_read_price_usd_per_m":0.5},{"input_tokens_lte":500000,"input_price_usd_per_m":4.0,"output_price_usd_per_m":12.0,"cache_read_price_usd_per_m":1.0}],"pricing_variants":[],"providers":[{"provider":"xai","input_price_usd":2.0,"output_price_usd":6.0,"markup_tier":"medium","effective_markup_percent":0.0,"context_window":500000,"max_output":131072,"cache_read_usd":0.5,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.000002","completion":"0.000006"},"pricing_krw":{"prompt":"0.0027054600","completion":"0.0081163800"},"peak_pricing":null,"pricing_policy":{"version":1,"kind":"token_tiers","tiers":[{"input_tokens_lte":199999,"input_price_usd_per_m":2.0,"output_price_usd_per_m":6.0,"cache_read_price_usd_per_m":0.5},{"input_tokens_lte":500000,"input_price_usd_per_m":4.0,"output_price_usd_per_m":12.0,"cache_read_price_usd_per_m":1.0}]},"pricing_tiers":[{"input_tokens_lte":199999,"input_price_usd_per_m":2.0,"output_price_usd_per_m":6.0,"cache_read_price_usd_per_m":0.5},{"input_tokens_lte":500000,"input_price_usd_per_m":4.0,"output_price_usd_per_m":12.0,"cache_read_price_usd_per_m":1.0}],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text"],"output_modalities":["text"],"description":"Grok 4.6 is xAI's current Grok-family text model for general dialogue and document understanding.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"grok-4.5","object":"model","created":0,"owned_by":"pleum","provider":"xai","display_name":"Grok 4.5","modality":"text","price_unit":"token","input_price_usd":2.0,"output_price_usd":6.0,"markup_tier":"medium","effective_markup_percent":0.0,"context_window":500000,"max_output":131072,"is_active":true,"operations":["chat.generate"],"maker":"xAI","context_length":500000,"max_output_tokens":131072,"architecture":{"input_modalities":["text"],"output_modalities":["text"]},"supported_parameters":["temperature","max_tokens","top_p","stop","seed","frequency_penalty","presence_penalty","tools","tool_choice","response_format","parallel_tool_calls","logit_bias","stream"],"supports_thinking":false,"thinking_forced":false,"pricing":{"prompt":"0.000002","completion":"0.000006"},"pricing_krw":{"prompt":"0.0027054600","completion":"0.0081163800"},"pricing_tiers":[{"input_tokens_lte":199999,"input_price_usd_per_m":2.0,"output_price_usd_per_m":6.0,"cache_read_price_usd_per_m":0.3},{"input_tokens_lte":500000,"input_price_usd_per_m":4.0,"output_price_usd_per_m":12.0,"cache_read_price_usd_per_m":0.6}],"pricing_variants":[],"providers":[{"provider":"xai","input_price_usd":2.0,"output_price_usd":6.0,"markup_tier":"medium","effective_markup_percent":0.0,"context_window":500000,"max_output":131072,"cache_read_usd":0.3,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.000002","completion":"0.000006"},"pricing_krw":{"prompt":"0.0027054600","completion":"0.0081163800"},"peak_pricing":null,"pricing_policy":{"version":1,"kind":"token_tiers","tiers":[{"input_tokens_lte":199999,"input_price_usd_per_m":2.0,"output_price_usd_per_m":6.0,"cache_read_price_usd_per_m":0.3},{"input_tokens_lte":500000,"input_price_usd_per_m":4.0,"output_price_usd_per_m":12.0,"cache_read_price_usd_per_m":0.6}]},"pricing_tiers":[{"input_tokens_lte":199999,"input_price_usd_per_m":2.0,"output_price_usd_per_m":6.0,"cache_read_price_usd_per_m":0.3},{"input_tokens_lte":500000,"input_price_usd_per_m":4.0,"output_price_usd_per_m":12.0,"cache_read_price_usd_per_m":0.6}],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text"],"output_modalities":["text"],"description":"xAI positions Grok 4.5 in the Grok family for general dialogue, document understanding, and text generation. The public catalog limits for the standard release are 500,000 context tokens and 131,072 output tokens.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"grok-4.3","object":"model","created":0,"owned_by":"pleum","provider":"xai","display_name":"Grok 4.3","modality":"text","price_unit":"token","input_price_usd":1.25,"output_price_usd":2.5,"markup_tier":"medium","effective_markup_percent":0.0,"context_window":1000000,"max_output":131072,"is_active":true,"operations":["chat.generate"],"maker":"xAI","context_length":1000000,"max_output_tokens":131072,"architecture":{"input_modalities":["text"],"output_modalities":["text"]},"supported_parameters":["temperature","max_tokens","top_p","stop","seed","frequency_penalty","presence_penalty","tools","tool_choice","response_format","parallel_tool_calls","logit_bias","stream","reasoning_effort"],"supports_thinking":true,"thinking_forced":false,"pricing":{"prompt":"0.00000125","completion":"0.0000025"},"pricing_krw":{"prompt":"0.001690912500","completion":"0.00338182500"},"pricing_tiers":[{"input_tokens_lte":199999,"input_price_usd_per_m":1.25,"output_price_usd_per_m":2.5,"cache_read_price_usd_per_m":0.2},{"input_tokens_lte":1000000,"input_price_usd_per_m":2.5,"output_price_usd_per_m":5.0,"cache_read_price_usd_per_m":0.4}],"pricing_variants":[],"providers":[{"provider":"xai","input_price_usd":1.25,"output_price_usd":2.5,"markup_tier":"medium","effective_markup_percent":0.0,"context_window":1000000,"max_output":131072,"cache_read_usd":0.2,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.00000125","completion":"0.0000025"},"pricing_krw":{"prompt":"0.001690912500","completion":"0.00338182500"},"peak_pricing":null,"pricing_policy":{"version":1,"kind":"token_tiers","tiers":[{"input_tokens_lte":199999,"input_price_usd_per_m":1.25,"output_price_usd_per_m":2.5,"cache_read_price_usd_per_m":0.2},{"input_tokens_lte":1000000,"input_price_usd_per_m":2.5,"output_price_usd_per_m":5.0,"cache_read_price_usd_per_m":0.4}]},"pricing_tiers":[{"input_tokens_lte":199999,"input_price_usd_per_m":1.25,"output_price_usd_per_m":2.5,"cache_read_price_usd_per_m":0.2},{"input_tokens_lte":1000000,"input_price_usd_per_m":2.5,"output_price_usd_per_m":5.0,"cache_read_price_usd_per_m":0.4}],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text"],"output_modalities":["text"],"description":"xAI positions Grok 4.3 in the Grok family for general dialogue, document understanding, and text generation. For this standard variant, the catalog lists a 1,000,000-token context window and up to 131,072 output tokens.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"grok-4.20","object":"model","created":0,"owned_by":"pleum","provider":"xai","display_name":"Grok 4.20","modality":"text","price_unit":"token","input_price_usd":1.25,"output_price_usd":2.5,"markup_tier":"medium","effective_markup_percent":0.0,"context_window":1000000,"max_output":32768,"is_active":true,"operations":["chat.generate"],"maker":"xAI","context_length":1000000,"max_output_tokens":32768,"architecture":{"input_modalities":["text"],"output_modalities":["text"]},"supported_parameters":["temperature","max_tokens","top_p","stop","seed","frequency_penalty","presence_penalty","tools","tool_choice","response_format","parallel_tool_calls","logit_bias","stream","reasoning_effort"],"supports_thinking":true,"thinking_forced":false,"pricing":{"prompt":"0.00000125","completion":"0.0000025"},"pricing_krw":{"prompt":"0.001690912500","completion":"0.00338182500"},"pricing_tiers":[{"input_tokens_lte":199999,"input_price_usd_per_m":1.25,"output_price_usd_per_m":2.5,"cache_read_price_usd_per_m":0.2},{"input_tokens_lte":1000000,"input_price_usd_per_m":2.5,"output_price_usd_per_m":5.0,"cache_read_price_usd_per_m":0.4}],"pricing_variants":[],"providers":[{"provider":"xai","input_price_usd":1.25,"output_price_usd":2.5,"markup_tier":"medium","effective_markup_percent":0.0,"context_window":1000000,"max_output":32768,"cache_read_usd":0.2,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.00000125","completion":"0.0000025"},"pricing_krw":{"prompt":"0.001690912500","completion":"0.00338182500"},"peak_pricing":null,"pricing_policy":{"version":1,"kind":"token_tiers","tiers":[{"input_tokens_lte":199999,"input_price_usd_per_m":1.25,"output_price_usd_per_m":2.5,"cache_read_price_usd_per_m":0.2},{"input_tokens_lte":1000000,"input_price_usd_per_m":2.5,"output_price_usd_per_m":5.0,"cache_read_price_usd_per_m":0.4}]},"pricing_tiers":[{"input_tokens_lte":199999,"input_price_usd_per_m":1.25,"output_price_usd_per_m":2.5,"cache_read_price_usd_per_m":0.2},{"input_tokens_lte":1000000,"input_price_usd_per_m":2.5,"output_price_usd_per_m":5.0,"cache_read_price_usd_per_m":0.4}],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text"],"output_modalities":["text"],"description":"xAI positions Grok 4.20 in the Grok family for general dialogue, document understanding, and text generation. PleumRouter catalogs this standard entry with up to 1,000,000 context tokens and 32,768 output tokens.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"grok-4.20-multi-agent","object":"model","created":0,"owned_by":"pleum","provider":"xai","display_name":"Grok 4.20 Multi-Agent","modality":"text","price_unit":"token","input_price_usd":1.25,"output_price_usd":2.5,"markup_tier":"medium","effective_markup_percent":0.0,"context_window":1000000,"max_output":32768,"is_active":true,"operations":["chat.generate"],"maker":"xAI","context_length":1000000,"max_output_tokens":32768,"architecture":{"input_modalities":["text"],"output_modalities":["text"]},"supported_parameters":["temperature","max_tokens","top_p","stop","seed","frequency_penalty","presence_penalty","tools","tool_choice","response_format","parallel_tool_calls","logit_bias","stream"],"supports_thinking":false,"thinking_forced":false,"pricing":{"prompt":"0.00000125","completion":"0.0000025"},"pricing_krw":{"prompt":"0.001690912500","completion":"0.00338182500"},"pricing_tiers":[{"input_tokens_lte":199999,"input_price_usd_per_m":1.25,"output_price_usd_per_m":2.5,"cache_read_price_usd_per_m":0.2},{"input_tokens_lte":1000000,"input_price_usd_per_m":2.5,"output_price_usd_per_m":5.0,"cache_read_price_usd_per_m":0.4}],"pricing_variants":[],"providers":[{"provider":"xai","input_price_usd":1.25,"output_price_usd":2.5,"markup_tier":"medium","effective_markup_percent":0.0,"context_window":1000000,"max_output":32768,"cache_read_usd":0.2,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.00000125","completion":"0.0000025"},"pricing_krw":{"prompt":"0.001690912500","completion":"0.00338182500"},"peak_pricing":null,"pricing_policy":{"version":1,"kind":"token_tiers","tiers":[{"input_tokens_lte":199999,"input_price_usd_per_m":1.25,"output_price_usd_per_m":2.5,"cache_read_price_usd_per_m":0.2},{"input_tokens_lte":1000000,"input_price_usd_per_m":2.5,"output_price_usd_per_m":5.0,"cache_read_price_usd_per_m":0.4}]},"pricing_tiers":[{"input_tokens_lte":199999,"input_price_usd_per_m":1.25,"output_price_usd_per_m":2.5,"cache_read_price_usd_per_m":0.2},{"input_tokens_lte":1000000,"input_price_usd_per_m":2.5,"output_price_usd_per_m":5.0,"cache_read_price_usd_per_m":0.4}],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text"],"output_modalities":["text"],"description":"xAI positions Grok 4.20 Multi-Agent in the Grok family for general dialogue, document understanding, and text generation. PleumRouter catalogs this standard entry with up to 1,000,000 context tokens and 32,768 output tokens.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"grok-build-0.1","object":"model","created":0,"owned_by":"pleum","provider":"xai","display_name":"Grok Build 0.1 (Composer)","modality":"text","price_unit":"token","input_price_usd":1.0,"output_price_usd":2.0,"markup_tier":"medium","effective_markup_percent":0.0,"context_window":256000,"max_output":32768,"is_active":true,"operations":["chat.generate"],"maker":"xAI","context_length":256000,"max_output_tokens":32768,"architecture":{"input_modalities":["text","image"],"output_modalities":["text"]},"supported_parameters":["temperature","max_tokens","top_p","stop","seed","frequency_penalty","presence_penalty","tools","tool_choice","response_format","parallel_tool_calls","logit_bias","stream"],"supports_thinking":false,"thinking_forced":false,"pricing":{"prompt":"0.000001","completion":"0.000002"},"pricing_krw":{"prompt":"0.0013527300","completion":"0.0027054600"},"pricing_tiers":[{"input_tokens_lte":199999,"input_price_usd_per_m":1.0,"output_price_usd_per_m":2.0,"cache_read_price_usd_per_m":0.2},{"input_tokens_lte":256000,"input_price_usd_per_m":2.0,"output_price_usd_per_m":4.0,"cache_read_price_usd_per_m":0.4}],"pricing_variants":[],"providers":[{"provider":"xai","input_price_usd":1.0,"output_price_usd":2.0,"markup_tier":"medium","effective_markup_percent":0.0,"context_window":256000,"max_output":32768,"cache_read_usd":0.2,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.000001","completion":"0.000002"},"pricing_krw":{"prompt":"0.0013527300","completion":"0.0027054600"},"peak_pricing":null,"pricing_policy":{"version":1,"kind":"token_tiers","tiers":[{"input_tokens_lte":199999,"input_price_usd_per_m":1.0,"output_price_usd_per_m":2.0,"cache_read_price_usd_per_m":0.2},{"input_tokens_lte":256000,"input_price_usd_per_m":2.0,"output_price_usd_per_m":4.0,"cache_read_price_usd_per_m":0.4}]},"pricing_tiers":[{"input_tokens_lte":199999,"input_price_usd_per_m":1.0,"output_price_usd_per_m":2.0,"cache_read_price_usd_per_m":0.2},{"input_tokens_lte":256000,"input_price_usd_per_m":2.0,"output_price_usd_per_m":4.0,"cache_read_price_usd_per_m":0.4}],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text","image"],"output_modalities":["text"],"description":"xAI positions Grok Build 0.1 (Composer) in the Grok family for code generation, software engineering, and tool-driven agent work. PleumRouter catalogs this standard entry with up to 256,000 context tokens and 32,768 output tokens.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"nvidia/NVIDIA-Nemotron-3-Super-120B-A12B","object":"model","created":0,"owned_by":"pleum","provider":"deepinfra","display_name":"NVIDIA Nemotron 3 Super 120B","modality":"text","price_unit":"token","input_price_usd":0.085,"output_price_usd":0.4,"markup_tier":"low","effective_markup_percent":0.0,"context_window":262144,"max_output":32768,"is_active":true,"operations":["chat.generate"],"maker":"NVIDIA","context_length":262144,"max_output_tokens":32768,"architecture":{"input_modalities":["text"],"output_modalities":["text"]},"supported_parameters":["temperature","max_tokens","top_p","stop","seed","frequency_penalty","presence_penalty","tools","tool_choice","response_format","parallel_tool_calls","logit_bias","stream"],"supports_thinking":false,"thinking_forced":false,"pricing":{"prompt":"0.000000085","completion":"0.0000004"},"pricing_krw":{"prompt":"0.0001149820500","completion":"0.00054109200"},"pricing_tiers":[],"pricing_variants":[],"providers":[{"provider":"deepinfra","input_price_usd":0.085,"output_price_usd":0.4,"markup_tier":"low","effective_markup_percent":0.0,"context_window":262144,"max_output":32768,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.000000085","completion":"0.0000004"},"pricing_krw":{"prompt":"0.0001149820500","completion":"0.00054109200"},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text"],"output_modalities":["text"],"description":"Built in NVIDIA's Nemotron line, NVIDIA Nemotron 3 Super 120B handles general dialogue, document understanding, and text generation. For this 120B-class variant, the catalog lists a 262,144-token context window and up to 32,768 output tokens.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"nvidia/Nemotron-3-Nano-30B-A3B","object":"model","created":0,"owned_by":"pleum","provider":"deepinfra","display_name":"NVIDIA Nemotron 3 Nano 30B","modality":"text","price_unit":"token","input_price_usd":0.05,"output_price_usd":0.2,"markup_tier":"low","effective_markup_percent":0.0,"context_window":262144,"max_output":32768,"is_active":true,"operations":["chat.generate"],"maker":"NVIDIA","context_length":262144,"max_output_tokens":32768,"architecture":{"input_modalities":["text"],"output_modalities":["text"]},"supported_parameters":["temperature","max_tokens","top_p","stop","seed","frequency_penalty","presence_penalty","tools","tool_choice","response_format","parallel_tool_calls","logit_bias","stream"],"supports_thinking":false,"thinking_forced":false,"pricing":{"prompt":"0.00000005","completion":"0.0000002"},"pricing_krw":{"prompt":"0.000067636500","completion":"0.00027054600"},"pricing_tiers":[],"pricing_variants":[],"providers":[{"provider":"deepinfra","input_price_usd":0.05,"output_price_usd":0.2,"markup_tier":"low","effective_markup_percent":0.0,"context_window":262144,"max_output":32768,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.00000005","completion":"0.0000002"},"pricing_krw":{"prompt":"0.000067636500","completion":"0.00027054600"},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text"],"output_modalities":["text"],"description":"Built in NVIDIA's Nemotron line, NVIDIA Nemotron 3 Nano 30B handles general dialogue, document understanding, and text generation. Its cataloged Nano profile provides 262,144 tokens of context with a maximum output of 32,768 tokens.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"deepseek-v4-flash-vision-exp","object":"model","created":0,"owned_by":"pleum","provider":"deepseek","display_name":"DeepSeek V4 Flash Vision Experimental","modality":"text","price_unit":"token","input_price_usd":0.22,"output_price_usd":0.66,"markup_tier":"high","effective_markup_percent":0.0,"context_window":1040000,"max_output":8192,"is_active":true,"operations":["chat.generate"],"maker":"DeepSeek","context_length":1040000,"max_output_tokens":8192,"architecture":{"input_modalities":["text","image"],"output_modalities":["text"]},"supported_parameters":["temperature","max_tokens","top_p","stop","seed","frequency_penalty","presence_penalty","tools","tool_choice","response_format","parallel_tool_calls","logit_bias","stream","reasoning_effort"],"supports_thinking":true,"thinking_forced":false,"pricing":{"prompt":"0.00000022","completion":"0.00000066"},"pricing_krw":{"prompt":"0.000297600600","completion":"0.000892801800"},"pricing_tiers":[{"input_tokens_lte":1000000,"input_price_usd_per_m":0.22,"output_price_usd_per_m":0.66,"cache_read_price_usd_per_m":0.007}],"pricing_variants":[],"providers":[{"provider":"deepseek","input_price_usd":0.22,"output_price_usd":0.66,"markup_tier":"high","effective_markup_percent":0.0,"context_window":1000000,"max_output":384000,"cache_read_usd":0.007,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.00000022","completion":"0.00000066"},"pricing_krw":{"prompt":"0.000297600600","completion":"0.000892801800"},"peak_pricing":null,"pricing_policy":{"version":1,"kind":"token_tiers","tiers":[{"input_tokens_lte":1000000,"input_price_usd_per_m":0.22,"output_price_usd_per_m":0.66,"cache_read_price_usd_per_m":0.007}]},"pricing_tiers":[{"input_tokens_lte":1000000,"input_price_usd_per_m":0.22,"output_price_usd_per_m":0.66,"cache_read_price_usd_per_m":0.007}],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text","image"],"output_modalities":["text"],"description":"DeepSeek V4 Flash Vision Exp is DeepSeek's experimental vision model for image-and-text input. The official guide documents its OpenAI-compatible chat format and image input, with a 1M-token context.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"seed-2-0-lite-260228","object":"model","created":0,"owned_by":"pleum","provider":"modelark","display_name":"ByteDance Seed 2.0 Lite","modality":"text","price_unit":"token","input_price_usd":0.25,"output_price_usd":2.0,"markup_tier":"medium","effective_markup_percent":0.0,"context_window":256000,"max_output":128000,"is_active":true,"operations":["chat.generate"],"maker":"ByteDance","context_length":256000,"max_output_tokens":128000,"architecture":{"input_modalities":["text"],"output_modalities":["text"]},"supported_parameters":["temperature","max_tokens","top_p","stop","seed","frequency_penalty","presence_penalty","tools","tool_choice","response_format","parallel_tool_calls","logit_bias","stream","reasoning_effort"],"supports_thinking":true,"thinking_forced":false,"pricing":{"prompt":"0.00000025","completion":"0.000002"},"pricing_krw":{"prompt":"0.000338182500","completion":"0.0027054600"},"pricing_tiers":[{"input_tokens_lte":128000,"input_price_usd_per_m":0.25,"output_price_usd_per_m":2.0,"cache_read_price_usd_per_m":0.05},{"input_tokens_lte":256000,"input_price_usd_per_m":0.5,"output_price_usd_per_m":4.0,"cache_read_price_usd_per_m":0.1}],"pricing_variants":[],"providers":[{"provider":"modelark","input_price_usd":0.25,"output_price_usd":2.0,"markup_tier":"medium","effective_markup_percent":0.0,"context_window":256000,"max_output":128000,"cache_read_usd":0.05,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.00000025","completion":"0.000002"},"pricing_krw":{"prompt":"0.000338182500","completion":"0.0027054600"},"peak_pricing":null,"pricing_policy":{"version":1,"kind":"token_tiers","tiers":[{"input_tokens_lte":128000,"input_price_usd_per_m":0.25,"output_price_usd_per_m":2.0,"cache_read_price_usd_per_m":0.05},{"input_tokens_lte":256000,"input_price_usd_per_m":0.5,"output_price_usd_per_m":4.0,"cache_read_price_usd_per_m":0.1}]},"pricing_tiers":[{"input_tokens_lte":128000,"input_price_usd_per_m":0.25,"output_price_usd_per_m":2.0,"cache_read_price_usd_per_m":0.05},{"input_tokens_lte":256000,"input_price_usd_per_m":0.5,"output_price_usd_per_m":4.0,"cache_read_price_usd_per_m":0.1}],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text"],"output_modalities":["text"],"description":"ByteDance Seed 2.0 Lite applies ByteDance's Seed 2 family to general dialogue, document understanding, and text generation. For this Lite variant, the catalog lists a 256,000-token context window and up to 128,000 output tokens.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"seed-1-6-250915","object":"model","created":0,"owned_by":"pleum","provider":"modelark","display_name":"ByteDance Seed 1.6 (250915)","modality":"text","price_unit":"token","input_price_usd":0.25,"output_price_usd":2.0,"markup_tier":"medium","effective_markup_percent":0.0,"context_window":256000,"max_output":32768,"is_active":true,"operations":["chat.generate"],"maker":"ByteDance","context_length":256000,"max_output_tokens":32768,"architecture":{"input_modalities":["text","image","video"],"output_modalities":["text"]},"supported_parameters":["temperature","max_tokens","top_p","stop","seed","frequency_penalty","presence_penalty","tools","tool_choice","response_format","parallel_tool_calls","logit_bias","stream","reasoning_effort"],"supports_thinking":true,"thinking_forced":false,"pricing":{"prompt":"0.00000025","completion":"0.000002"},"pricing_krw":{"prompt":"0.000338182500","completion":"0.0027054600"},"pricing_tiers":[{"input_tokens_lte":128000,"input_price_usd_per_m":0.25,"output_price_usd_per_m":2.0,"cache_read_price_usd_per_m":0.05},{"input_tokens_lte":256000,"input_price_usd_per_m":0.5,"output_price_usd_per_m":4.0,"cache_read_price_usd_per_m":0.05}],"pricing_variants":[],"providers":[{"provider":"modelark","input_price_usd":0.25,"output_price_usd":2.0,"markup_tier":"medium","effective_markup_percent":0.0,"context_window":256000,"max_output":32768,"cache_read_usd":0.05,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.00000025","completion":"0.000002"},"pricing_krw":{"prompt":"0.000338182500","completion":"0.0027054600"},"peak_pricing":null,"pricing_policy":{"version":1,"kind":"token_tiers","tiers":[{"input_tokens_lte":128000,"input_price_usd_per_m":0.25,"output_price_usd_per_m":2.0,"cache_read_price_usd_per_m":0.05},{"input_tokens_lte":256000,"input_price_usd_per_m":0.5,"output_price_usd_per_m":4.0,"cache_read_price_usd_per_m":0.05}]},"pricing_tiers":[{"input_tokens_lte":128000,"input_price_usd_per_m":0.25,"output_price_usd_per_m":2.0,"cache_read_price_usd_per_m":0.05},{"input_tokens_lte":256000,"input_price_usd_per_m":0.5,"output_price_usd_per_m":4.0,"cache_read_price_usd_per_m":0.05}],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text","image","video"],"output_modalities":["text"],"description":"ByteDance positions ByteDance Seed 1.6 (250915) in the Seed 1 family for general dialogue, document understanding, and text generation. For this dated snapshot variant, the catalog lists a 256,000-token context window and up to 32,768 output tokens.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"dola-seed-2-1-turbo-260628","object":"model","created":0,"owned_by":"pleum","provider":"modelark","display_name":"ByteDance Dola Seed 2.1 Turbo","modality":"text","price_unit":"token","input_price_usd":0.5,"output_price_usd":2.5,"markup_tier":"medium","effective_markup_percent":0.0,"context_window":256000,"max_output":256000,"is_active":true,"operations":["chat.generate"],"maker":"ByteDance","context_length":256000,"max_output_tokens":256000,"architecture":{"input_modalities":["text"],"output_modalities":["text"]},"supported_parameters":["temperature","max_tokens","top_p","stop","seed","frequency_penalty","presence_penalty","tools","tool_choice","response_format","parallel_tool_calls","logit_bias","stream","reasoning_effort"],"supports_thinking":true,"thinking_forced":false,"pricing":{"prompt":"0.0000005","completion":"0.0000025"},"pricing_krw":{"prompt":"0.00067636500","completion":"0.00338182500"},"pricing_tiers":[{"input_tokens_lte":256000,"input_price_usd_per_m":0.5,"output_price_usd_per_m":2.5}],"pricing_variants":[],"providers":[{"provider":"modelark","input_price_usd":0.5,"output_price_usd":2.5,"markup_tier":"medium","effective_markup_percent":0.0,"context_window":256000,"max_output":256000,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.0000005","completion":"0.0000025"},"pricing_krw":{"prompt":"0.00067636500","completion":"0.00338182500"},"peak_pricing":null,"pricing_policy":{"version":1,"kind":"token_tiers","tiers":[{"input_tokens_lte":256000,"input_price_usd_per_m":0.5,"output_price_usd_per_m":2.5}]},"pricing_tiers":[{"input_tokens_lte":256000,"input_price_usd_per_m":0.5,"output_price_usd_per_m":2.5}],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text"],"output_modalities":["text"],"description":"ByteDance Dola Seed 2.1 Turbo applies ByteDance's Seed 2 family to general dialogue, document understanding, and text generation. For this Turbo variant, the catalog lists a 256,000-token context window and up to 256,000 output tokens.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"seed-2-0-lite-260428","object":"model","created":0,"owned_by":"pleum","provider":"modelark","display_name":"ByteDance Seed 2.0 Lite (260428)","modality":"text","price_unit":"token","input_price_usd":0.25,"output_price_usd":2.0,"markup_tier":"medium","effective_markup_percent":0.0,"context_window":256000,"max_output":128000,"is_active":true,"operations":["chat.generate"],"maker":"ByteDance","context_length":256000,"max_output_tokens":128000,"architecture":{"input_modalities":["text"],"output_modalities":["text"]},"supported_parameters":["temperature","max_tokens","top_p","stop","seed","frequency_penalty","presence_penalty","tools","tool_choice","response_format","parallel_tool_calls","logit_bias","stream","reasoning_effort"],"supports_thinking":true,"thinking_forced":false,"pricing":{"prompt":"0.00000025","completion":"0.000002"},"pricing_krw":{"prompt":"0.000338182500","completion":"0.0027054600"},"pricing_tiers":[{"input_tokens_lte":128000,"input_price_usd_per_m":0.25,"output_price_usd_per_m":2.0,"cache_read_price_usd_per_m":0.05},{"input_tokens_lte":256000,"input_price_usd_per_m":0.5,"output_price_usd_per_m":4.0,"cache_read_price_usd_per_m":0.1}],"pricing_variants":[],"providers":[{"provider":"modelark","input_price_usd":0.25,"output_price_usd":2.0,"markup_tier":"medium","effective_markup_percent":0.0,"context_window":256000,"max_output":128000,"cache_read_usd":0.05,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.00000025","completion":"0.000002"},"pricing_krw":{"prompt":"0.000338182500","completion":"0.0027054600"},"peak_pricing":null,"pricing_policy":{"version":1,"kind":"token_tiers","tiers":[{"input_tokens_lte":128000,"input_price_usd_per_m":0.25,"output_price_usd_per_m":2.0,"cache_read_price_usd_per_m":0.05},{"input_tokens_lte":256000,"input_price_usd_per_m":0.5,"output_price_usd_per_m":4.0,"cache_read_price_usd_per_m":0.1}]},"pricing_tiers":[{"input_tokens_lte":128000,"input_price_usd_per_m":0.25,"output_price_usd_per_m":2.0,"cache_read_price_usd_per_m":0.05},{"input_tokens_lte":256000,"input_price_usd_per_m":0.5,"output_price_usd_per_m":4.0,"cache_read_price_usd_per_m":0.1}],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text"],"output_modalities":["text"],"description":"ByteDance Seed 2.0 Lite (260428) applies ByteDance's Seed 2 family to general dialogue, document understanding, and text generation. The public catalog limits for the Lite release are 256,000 context tokens and 128,000 output tokens.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"seed-2-0-mini-260428","object":"model","created":0,"owned_by":"pleum","provider":"modelark","display_name":"ByteDance Seed 2.0 Mini (260428)","modality":"text","price_unit":"token","input_price_usd":0.1,"output_price_usd":0.4,"markup_tier":"high","effective_markup_percent":0.0,"context_window":256000,"max_output":128000,"is_active":true,"operations":["chat.generate"],"maker":"ByteDance","context_length":256000,"max_output_tokens":128000,"architecture":{"input_modalities":["text"],"output_modalities":["text"]},"supported_parameters":["temperature","max_tokens","top_p","stop","seed","frequency_penalty","presence_penalty","tools","tool_choice","response_format","parallel_tool_calls","logit_bias","stream","reasoning_effort"],"supports_thinking":true,"thinking_forced":false,"pricing":{"prompt":"0.0000001","completion":"0.0000004"},"pricing_krw":{"prompt":"0.00013527300","completion":"0.00054109200"},"pricing_tiers":[{"input_tokens_lte":128000,"input_price_usd_per_m":0.1,"output_price_usd_per_m":0.4,"cache_read_price_usd_per_m":0.02},{"input_tokens_lte":256000,"input_price_usd_per_m":0.2,"output_price_usd_per_m":0.8,"cache_read_price_usd_per_m":0.04}],"pricing_variants":[],"providers":[{"provider":"modelark","input_price_usd":0.1,"output_price_usd":0.4,"markup_tier":"high","effective_markup_percent":0.0,"context_window":256000,"max_output":128000,"cache_read_usd":0.02,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.0000001","completion":"0.0000004"},"pricing_krw":{"prompt":"0.00013527300","completion":"0.00054109200"},"peak_pricing":null,"pricing_policy":{"version":1,"kind":"token_tiers","tiers":[{"input_tokens_lte":128000,"input_price_usd_per_m":0.1,"output_price_usd_per_m":0.4,"cache_read_price_usd_per_m":0.02},{"input_tokens_lte":256000,"input_price_usd_per_m":0.2,"output_price_usd_per_m":0.8,"cache_read_price_usd_per_m":0.04}]},"pricing_tiers":[{"input_tokens_lte":128000,"input_price_usd_per_m":0.1,"output_price_usd_per_m":0.4,"cache_read_price_usd_per_m":0.02},{"input_tokens_lte":256000,"input_price_usd_per_m":0.2,"output_price_usd_per_m":0.8,"cache_read_price_usd_per_m":0.04}],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text"],"output_modalities":["text"],"description":"ByteDance Seed 2.0 Mini (260428) applies ByteDance's Seed 2 family to general dialogue, document understanding, and text generation. Its cataloged Mini profile provides 256,000 tokens of context with a maximum output of 128,000 tokens.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"mistral-medium-3-5","object":"model","created":0,"owned_by":"pleum","provider":"mistral","display_name":"Mistral Medium 3.5","modality":"text","price_unit":"token","input_price_usd":1.5,"output_price_usd":7.5,"markup_tier":"medium","effective_markup_percent":0.0,"context_window":262144,"max_output":65536,"is_active":true,"operations":["chat.generate"],"maker":"Mistral","context_length":262144,"max_output_tokens":65536,"architecture":{"input_modalities":["text"],"output_modalities":["text"]},"supported_parameters":["temperature","max_tokens","top_p","stop","seed","frequency_penalty","presence_penalty","tools","tool_choice","response_format","parallel_tool_calls","logit_bias","stream"],"supports_thinking":false,"thinking_forced":false,"pricing":{"prompt":"0.0000015","completion":"0.0000075"},"pricing_krw":{"prompt":"0.00202909500","completion":"0.01014547500"},"pricing_tiers":[],"pricing_variants":[],"providers":[{"provider":"mistral","input_price_usd":1.5,"output_price_usd":7.5,"markup_tier":"medium","effective_markup_percent":0.0,"context_window":262144,"max_output":65536,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.0000015","completion":"0.0000075"},"pricing_krw":{"prompt":"0.00202909500","completion":"0.01014547500"},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text"],"output_modalities":["text"],"description":"Mistral Medium 3.5 is a Mistral model for general dialogue, document understanding, and text generation. PleumRouter catalogs this standard entry with up to 262,144 context tokens and 65,536 output tokens.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"seed-2-0-pro-260328","object":"model","created":0,"owned_by":"pleum","provider":"modelark","display_name":"ByteDance Seed 2.0 Pro","modality":"text","price_unit":"token","input_price_usd":0.5,"output_price_usd":3.0,"markup_tier":"low","effective_markup_percent":0.0,"context_window":256000,"max_output":128000,"is_active":true,"operations":["chat.generate"],"maker":"ByteDance","context_length":256000,"max_output_tokens":128000,"architecture":{"input_modalities":["text"],"output_modalities":["text"]},"supported_parameters":["temperature","max_tokens","top_p","stop","seed","frequency_penalty","presence_penalty","tools","tool_choice","response_format","parallel_tool_calls","logit_bias","stream","reasoning_effort"],"supports_thinking":true,"thinking_forced":false,"pricing":{"prompt":"0.0000005","completion":"0.000003"},"pricing_krw":{"prompt":"0.00067636500","completion":"0.0040581900"},"pricing_tiers":[{"input_tokens_lte":128000,"input_price_usd_per_m":0.5,"output_price_usd_per_m":3.0,"cache_read_price_usd_per_m":0.1},{"input_tokens_lte":256000,"input_price_usd_per_m":1.0,"output_price_usd_per_m":6.0,"cache_read_price_usd_per_m":0.2}],"pricing_variants":[],"providers":[{"provider":"modelark","input_price_usd":0.5,"output_price_usd":3.0,"markup_tier":"low","effective_markup_percent":0.0,"context_window":256000,"max_output":128000,"cache_read_usd":0.1,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.0000005","completion":"0.000003"},"pricing_krw":{"prompt":"0.00067636500","completion":"0.0040581900"},"peak_pricing":null,"pricing_policy":{"version":1,"kind":"token_tiers","tiers":[{"input_tokens_lte":128000,"input_price_usd_per_m":0.5,"output_price_usd_per_m":3.0,"cache_read_price_usd_per_m":0.1},{"input_tokens_lte":256000,"input_price_usd_per_m":1.0,"output_price_usd_per_m":6.0,"cache_read_price_usd_per_m":0.2}]},"pricing_tiers":[{"input_tokens_lte":128000,"input_price_usd_per_m":0.5,"output_price_usd_per_m":3.0,"cache_read_price_usd_per_m":0.1},{"input_tokens_lte":256000,"input_price_usd_per_m":1.0,"output_price_usd_per_m":6.0,"cache_read_price_usd_per_m":0.2}],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text"],"output_modalities":["text"],"description":"ByteDance Seed 2.0 Pro applies ByteDance's Seed 2 family to general dialogue, document understanding, and text generation. For this Pro variant, the catalog lists a 256,000-token context window and up to 128,000 output tokens.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"mistral-large-latest","object":"model","created":0,"owned_by":"pleum","provider":"mistral","display_name":"Mistral Large 3","modality":"text","price_unit":"token","input_price_usd":0.5,"output_price_usd":1.5,"markup_tier":"medium","effective_markup_percent":0.0,"context_window":262144,"max_output":16384,"is_active":true,"operations":["chat.generate"],"maker":"Mistral","context_length":262144,"max_output_tokens":16384,"architecture":{"input_modalities":["text"],"output_modalities":["text"]},"supported_parameters":["temperature","max_tokens","top_p","stop","seed","frequency_penalty","presence_penalty","tools","tool_choice","response_format","parallel_tool_calls","logit_bias","stream"],"supports_thinking":false,"thinking_forced":false,"pricing":{"prompt":"0.0000005","completion":"0.0000015"},"pricing_krw":{"prompt":"0.00067636500","completion":"0.00202909500"},"pricing_tiers":[],"pricing_variants":[],"providers":[{"provider":"mistral","input_price_usd":0.5,"output_price_usd":1.5,"markup_tier":"medium","effective_markup_percent":0.0,"context_window":262144,"max_output":16384,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.0000005","completion":"0.0000015"},"pricing_krw":{"prompt":"0.00067636500","completion":"0.00202909500"},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]}],"parameters_b":null,"architecture_class":"dense","license":"other","released_at":"2025-07-28","input_modalities":["text"],"output_modalities":["text"],"description":"Mistral Large 3 is a Mistral model for general dialogue, document understanding, and text generation. Its cataloged Large profile provides 262,144 tokens of context with a maximum output of 16,384 tokens.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"seed-2-0-mini-260215","object":"model","created":0,"owned_by":"pleum","provider":"modelark","display_name":"ByteDance Seed 2.0 Mini (260215)","modality":"text","price_unit":"token","input_price_usd":0.1,"output_price_usd":0.4,"markup_tier":"high","effective_markup_percent":0.0,"context_window":256000,"max_output":128000,"is_active":true,"operations":["chat.generate"],"maker":"ByteDance","context_length":256000,"max_output_tokens":128000,"architecture":{"input_modalities":["text"],"output_modalities":["text"]},"supported_parameters":["temperature","max_tokens","top_p","stop","seed","frequency_penalty","presence_penalty","tools","tool_choice","response_format","parallel_tool_calls","logit_bias","stream","reasoning_effort"],"supports_thinking":true,"thinking_forced":false,"pricing":{"prompt":"0.0000001","completion":"0.0000004"},"pricing_krw":{"prompt":"0.00013527300","completion":"0.00054109200"},"pricing_tiers":[{"input_tokens_lte":128000,"input_price_usd_per_m":0.1,"output_price_usd_per_m":0.4,"cache_read_price_usd_per_m":0.02},{"input_tokens_lte":256000,"input_price_usd_per_m":0.2,"output_price_usd_per_m":0.8,"cache_read_price_usd_per_m":0.04}],"pricing_variants":[],"providers":[{"provider":"modelark","input_price_usd":0.1,"output_price_usd":0.4,"markup_tier":"high","effective_markup_percent":0.0,"context_window":256000,"max_output":128000,"cache_read_usd":0.02,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.0000001","completion":"0.0000004"},"pricing_krw":{"prompt":"0.00013527300","completion":"0.00054109200"},"peak_pricing":null,"pricing_policy":{"version":1,"kind":"token_tiers","tiers":[{"input_tokens_lte":128000,"input_price_usd_per_m":0.1,"output_price_usd_per_m":0.4,"cache_read_price_usd_per_m":0.02},{"input_tokens_lte":256000,"input_price_usd_per_m":0.2,"output_price_usd_per_m":0.8,"cache_read_price_usd_per_m":0.04}]},"pricing_tiers":[{"input_tokens_lte":128000,"input_price_usd_per_m":0.1,"output_price_usd_per_m":0.4,"cache_read_price_usd_per_m":0.02},{"input_tokens_lte":256000,"input_price_usd_per_m":0.2,"output_price_usd_per_m":0.8,"cache_read_price_usd_per_m":0.04}],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text"],"output_modalities":["text"],"description":"ByteDance Seed 2.0 Mini (260215) applies ByteDance's Seed 2 family to general dialogue, document understanding, and text generation. PleumRouter catalogs this Mini entry with up to 256,000 context tokens and 128,000 output tokens.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"mistral-small-latest","object":"model","created":0,"owned_by":"pleum","provider":"mistral","display_name":"Mistral Small 4","modality":"text","price_unit":"token","input_price_usd":0.15,"output_price_usd":0.6,"markup_tier":"high","effective_markup_percent":0.0,"context_window":262144,"max_output":8192,"is_active":true,"operations":["chat.generate"],"maker":"Mistral","context_length":262144,"max_output_tokens":8192,"architecture":{"input_modalities":["text"],"output_modalities":["text"]},"supported_parameters":["temperature","max_tokens","top_p","stop","seed","frequency_penalty","presence_penalty","tools","tool_choice","response_format","parallel_tool_calls","logit_bias","stream"],"supports_thinking":false,"thinking_forced":false,"pricing":{"prompt":"0.00000015","completion":"0.0000006"},"pricing_krw":{"prompt":"0.000202909500","completion":"0.00081163800"},"pricing_tiers":[],"pricing_variants":[],"providers":[{"provider":"mistral","input_price_usd":0.15,"output_price_usd":0.6,"markup_tier":"high","effective_markup_percent":0.0,"context_window":262144,"max_output":8192,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.00000015","completion":"0.0000006"},"pricing_krw":{"prompt":"0.000202909500","completion":"0.00081163800"},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]}],"parameters_b":null,"architecture_class":"dense","license":"other","released_at":"2025-07-28","input_modalities":["text"],"output_modalities":["text"],"description":"Mistral Small 4 is a Mistral model for general dialogue, document understanding, and text generation. PleumRouter catalogs this Small entry with up to 262,144 context tokens and 8,192 output tokens.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"seed-2-0-code-preview-260328","object":"model","created":0,"owned_by":"pleum","provider":"modelark","display_name":"ByteDance Seed 2.0 Code Preview","modality":"text","price_unit":"token","input_price_usd":0.5,"output_price_usd":3.0,"markup_tier":"medium","effective_markup_percent":0.0,"context_window":256000,"max_output":128000,"is_active":true,"operations":["chat.generate"],"maker":"ByteDance","context_length":256000,"max_output_tokens":128000,"architecture":{"input_modalities":["text"],"output_modalities":["text"]},"supported_parameters":["temperature","max_tokens","top_p","stop","seed","frequency_penalty","presence_penalty","tools","tool_choice","response_format","parallel_tool_calls","logit_bias","stream","reasoning_effort"],"supports_thinking":true,"thinking_forced":false,"pricing":{"prompt":"0.0000005","completion":"0.000003"},"pricing_krw":{"prompt":"0.00067636500","completion":"0.0040581900"},"pricing_tiers":[{"input_tokens_lte":128000,"input_price_usd_per_m":0.5,"output_price_usd_per_m":3.0,"cache_read_price_usd_per_m":0.1},{"input_tokens_lte":256000,"input_price_usd_per_m":1.0,"output_price_usd_per_m":6.0,"cache_read_price_usd_per_m":0.2}],"pricing_variants":[],"providers":[{"provider":"modelark","input_price_usd":0.5,"output_price_usd":3.0,"markup_tier":"medium","effective_markup_percent":0.0,"context_window":256000,"max_output":128000,"cache_read_usd":0.1,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.0000005","completion":"0.000003"},"pricing_krw":{"prompt":"0.00067636500","completion":"0.0040581900"},"peak_pricing":null,"pricing_policy":{"version":1,"kind":"token_tiers","tiers":[{"input_tokens_lte":128000,"input_price_usd_per_m":0.5,"output_price_usd_per_m":3.0,"cache_read_price_usd_per_m":0.1},{"input_tokens_lte":256000,"input_price_usd_per_m":1.0,"output_price_usd_per_m":6.0,"cache_read_price_usd_per_m":0.2}]},"pricing_tiers":[{"input_tokens_lte":128000,"input_price_usd_per_m":0.5,"output_price_usd_per_m":3.0,"cache_read_price_usd_per_m":0.1},{"input_tokens_lte":256000,"input_price_usd_per_m":1.0,"output_price_usd_per_m":6.0,"cache_read_price_usd_per_m":0.2}],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text"],"output_modalities":["text"],"description":"ByteDance Seed 2.0 Code Preview applies ByteDance's Seed 2 family to code generation, software engineering, and tool-driven agent work. Its cataloged preview profile provides 256,000 tokens of context with a maximum output of 128,000 tokens.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"codestral-latest","object":"model","created":0,"owned_by":"pleum","provider":"mistral","display_name":"Codestral (Code)","modality":"text","price_unit":"token","input_price_usd":0.3,"output_price_usd":0.9,"markup_tier":"high","effective_markup_percent":0.0,"context_window":128000,"max_output":16384,"is_active":true,"operations":["chat.generate"],"maker":"Mistral","context_length":128000,"max_output_tokens":16384,"architecture":{"input_modalities":["text"],"output_modalities":["text"]},"supported_parameters":["temperature","max_tokens","top_p","stop","seed","frequency_penalty","presence_penalty","tools","tool_choice","response_format","parallel_tool_calls","logit_bias","stream"],"supports_thinking":false,"thinking_forced":false,"pricing":{"prompt":"0.0000003","completion":"0.0000009"},"pricing_krw":{"prompt":"0.00040581900","completion":"0.00121745700"},"pricing_tiers":[],"pricing_variants":[],"providers":[{"provider":"mistral","input_price_usd":0.3,"output_price_usd":0.9,"markup_tier":"high","effective_markup_percent":0.0,"context_window":128000,"max_output":16384,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.0000003","completion":"0.0000009"},"pricing_krw":{"prompt":"0.00040581900","completion":"0.00121745700"},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text"],"output_modalities":["text"],"description":"Codestral (Code) is Mistral's Codestral-line option for code generation, software engineering, and tool-driven agent work. The public catalog limits for the standard release are 128,000 context tokens and 16,384 output tokens.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"seed-1-8-251228","object":"model","created":0,"owned_by":"pleum","provider":"modelark","display_name":"ByteDance Seed 1.8 (Beta)","modality":"text","price_unit":"token","input_price_usd":0.25,"output_price_usd":2.0,"markup_tier":"medium","effective_markup_percent":0.0,"context_window":256000,"max_output":64000,"is_active":true,"operations":["chat.generate"],"maker":"ByteDance","context_length":256000,"max_output_tokens":64000,"architecture":{"input_modalities":["text"],"output_modalities":["text"]},"supported_parameters":["temperature","max_tokens","top_p","stop","seed","frequency_penalty","presence_penalty","tools","tool_choice","response_format","parallel_tool_calls","logit_bias","stream","reasoning_effort"],"supports_thinking":true,"thinking_forced":true,"pricing":{"prompt":"0.00000025","completion":"0.000002"},"pricing_krw":{"prompt":"0.000338182500","completion":"0.0027054600"},"pricing_tiers":[{"input_tokens_lte":128000,"input_price_usd_per_m":0.25,"output_price_usd_per_m":2.0,"cache_read_price_usd_per_m":0.05},{"input_tokens_lte":256000,"input_price_usd_per_m":0.5,"output_price_usd_per_m":4.0,"cache_read_price_usd_per_m":0.05}],"pricing_variants":[],"providers":[{"provider":"modelark","input_price_usd":0.25,"output_price_usd":2.0,"markup_tier":"medium","effective_markup_percent":0.0,"context_window":256000,"max_output":64000,"cache_read_usd":0.05,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.00000025","completion":"0.000002"},"pricing_krw":{"prompt":"0.000338182500","completion":"0.0027054600"},"peak_pricing":null,"pricing_policy":{"version":1,"kind":"token_tiers","tiers":[{"input_tokens_lte":128000,"input_price_usd_per_m":0.25,"output_price_usd_per_m":2.0,"cache_read_price_usd_per_m":0.05},{"input_tokens_lte":256000,"input_price_usd_per_m":0.5,"output_price_usd_per_m":4.0,"cache_read_price_usd_per_m":0.05}]},"pricing_tiers":[{"input_tokens_lte":128000,"input_price_usd_per_m":0.25,"output_price_usd_per_m":2.0,"cache_read_price_usd_per_m":0.05},{"input_tokens_lte":256000,"input_price_usd_per_m":0.5,"output_price_usd_per_m":4.0,"cache_read_price_usd_per_m":0.05}],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text"],"output_modalities":["text"],"description":"ByteDance positions ByteDance Seed 1.8 (Beta) in the Seed 1 family for general dialogue, document understanding, and text generation. For this preview variant, the catalog lists a 256,000-token context window and up to 64,000 output tokens.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"seed-1-6-250615","object":"model","created":0,"owned_by":"pleum","provider":"modelark","display_name":"ByteDance Seed 1.6 (250615)","modality":"text","price_unit":"token","input_price_usd":0.25,"output_price_usd":2.0,"markup_tier":"medium","effective_markup_percent":0.0,"context_window":256000,"max_output":32768,"is_active":true,"operations":["chat.generate"],"maker":"ByteDance","context_length":256000,"max_output_tokens":32768,"architecture":{"input_modalities":["text","image","video"],"output_modalities":["text"]},"supported_parameters":["temperature","max_tokens","top_p","stop","seed","frequency_penalty","presence_penalty","tools","tool_choice","response_format","parallel_tool_calls","logit_bias","stream","reasoning_effort"],"supports_thinking":true,"thinking_forced":false,"pricing":{"prompt":"0.00000025","completion":"0.000002"},"pricing_krw":{"prompt":"0.000338182500","completion":"0.0027054600"},"pricing_tiers":[{"input_tokens_lte":128000,"input_price_usd_per_m":0.25,"output_price_usd_per_m":2.0,"cache_read_price_usd_per_m":0.05},{"input_tokens_lte":256000,"input_price_usd_per_m":0.5,"output_price_usd_per_m":4.0,"cache_read_price_usd_per_m":0.05}],"pricing_variants":[],"providers":[{"provider":"modelark","input_price_usd":0.25,"output_price_usd":2.0,"markup_tier":"medium","effective_markup_percent":0.0,"context_window":256000,"max_output":32768,"cache_read_usd":0.05,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.00000025","completion":"0.000002"},"pricing_krw":{"prompt":"0.000338182500","completion":"0.0027054600"},"peak_pricing":null,"pricing_policy":{"version":1,"kind":"token_tiers","tiers":[{"input_tokens_lte":128000,"input_price_usd_per_m":0.25,"output_price_usd_per_m":2.0,"cache_read_price_usd_per_m":0.05},{"input_tokens_lte":256000,"input_price_usd_per_m":0.5,"output_price_usd_per_m":4.0,"cache_read_price_usd_per_m":0.05}]},"pricing_tiers":[{"input_tokens_lte":128000,"input_price_usd_per_m":0.25,"output_price_usd_per_m":2.0,"cache_read_price_usd_per_m":0.05},{"input_tokens_lte":256000,"input_price_usd_per_m":0.5,"output_price_usd_per_m":4.0,"cache_read_price_usd_per_m":0.05}],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text","image","video"],"output_modalities":["text"],"description":"ByteDance positions ByteDance Seed 1.6 (250615, price pending) in the Seed 1 family for general dialogue, document understanding, and text generation. Its cataloged dated snapshot profile provides 256,000 tokens of context with a maximum output of 32,768 tokens.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"seed-1-6-flash-250715","object":"model","created":0,"owned_by":"pleum","provider":"modelark","display_name":"ByteDance Seed 1.6 Flash (250715)","modality":"text","price_unit":"token","input_price_usd":0.075,"output_price_usd":0.3,"markup_tier":"high","effective_markup_percent":0.0,"context_window":256000,"max_output":32768,"is_active":true,"operations":["chat.generate"],"maker":"ByteDance","context_length":256000,"max_output_tokens":32768,"architecture":{"input_modalities":["text"],"output_modalities":["text"]},"supported_parameters":["temperature","max_tokens","top_p","stop","seed","frequency_penalty","presence_penalty","tools","tool_choice","response_format","parallel_tool_calls","logit_bias","stream","reasoning_effort"],"supports_thinking":true,"thinking_forced":false,"pricing":{"prompt":"0.000000075","completion":"0.0000003"},"pricing_krw":{"prompt":"0.0001014547500","completion":"0.00040581900"},"pricing_tiers":[{"input_tokens_lte":128000,"input_price_usd_per_m":0.075,"output_price_usd_per_m":0.3,"cache_read_price_usd_per_m":0.015},{"input_tokens_lte":256000,"input_price_usd_per_m":0.1,"output_price_usd_per_m":0.8,"cache_read_price_usd_per_m":0.015}],"pricing_variants":[],"providers":[{"provider":"modelark","input_price_usd":0.075,"output_price_usd":0.3,"markup_tier":"high","effective_markup_percent":0.0,"context_window":256000,"max_output":32768,"cache_read_usd":0.015,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.000000075","completion":"0.0000003"},"pricing_krw":{"prompt":"0.0001014547500","completion":"0.00040581900"},"peak_pricing":null,"pricing_policy":{"version":1,"kind":"token_tiers","tiers":[{"input_tokens_lte":128000,"input_price_usd_per_m":0.075,"output_price_usd_per_m":0.3,"cache_read_price_usd_per_m":0.015},{"input_tokens_lte":256000,"input_price_usd_per_m":0.1,"output_price_usd_per_m":0.8,"cache_read_price_usd_per_m":0.015}]},"pricing_tiers":[{"input_tokens_lte":128000,"input_price_usd_per_m":0.075,"output_price_usd_per_m":0.3,"cache_read_price_usd_per_m":0.015},{"input_tokens_lte":256000,"input_price_usd_per_m":0.1,"output_price_usd_per_m":0.8,"cache_read_price_usd_per_m":0.015}],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text"],"output_modalities":["text"],"description":"ByteDance positions ByteDance Seed 1.6 Flash (250715) in the Seed 1 family for general dialogue, document understanding, and text generation. Its cataloged Flash profile provides 256,000 tokens of context with a maximum output of 32,768 tokens.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"meta-llama/Llama-4-Maverick-17B-128E-Instruct-FP8","object":"model","created":0,"owned_by":"pleum","provider":"deepinfra","display_name":"Llama 4 Maverick (Together)","modality":"text","price_unit":"token","input_price_usd":0.2,"output_price_usd":0.8,"markup_tier":"high","effective_markup_percent":0.0,"context_window":1048576,"max_output":32768,"is_active":true,"operations":["chat.generate"],"maker":"Meta","context_length":1048576,"max_output_tokens":32768,"architecture":{"input_modalities":["text"],"output_modalities":["text"]},"supported_parameters":["temperature","max_tokens","top_p","stop","seed","frequency_penalty","presence_penalty","tools","tool_choice","response_format","parallel_tool_calls","logit_bias","stream"],"supports_thinking":false,"thinking_forced":false,"pricing":{"prompt":"0.0000002","completion":"0.0000008"},"pricing_krw":{"prompt":"0.00027054600","completion":"0.00108218400"},"pricing_tiers":[],"pricing_variants":[],"providers":[{"provider":"deepinfra","input_price_usd":0.2,"output_price_usd":0.8,"markup_tier":"high","effective_markup_percent":0.0,"context_window":1048576,"max_output":32768,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.0000002","completion":"0.0000008"},"pricing_krw":{"prompt":"0.00027054600","completion":"0.00108218400"},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text"],"output_modalities":["text"],"description":"Llama 4 Maverick (Together) applies Meta's Llama 4 family to general dialogue, document understanding, and text generation. For this FP8-quantized variant, the catalog lists a 1,048,576-token context window and up to 32,768 output tokens.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"llama-4-scout-17b","object":"model","created":0,"owned_by":"pleum","provider":"deepinfra","display_name":"Llama 4 Scout 17B","modality":"text","price_unit":"token","input_price_usd":0.1,"output_price_usd":0.3,"markup_tier":"high","effective_markup_percent":0.0,"context_window":327680,"max_output":32768,"is_active":true,"operations":["chat.generate"],"maker":"Meta","context_length":327680,"max_output_tokens":32768,"architecture":{"input_modalities":["text"],"output_modalities":["text"]},"supported_parameters":["temperature","max_tokens","top_p","stop","seed","frequency_penalty","presence_penalty","tools","tool_choice","response_format","parallel_tool_calls","logit_bias","stream"],"supports_thinking":false,"thinking_forced":false,"pricing":{"prompt":"0.0000001","completion":"0.0000003"},"pricing_krw":{"prompt":"0.00013527300","completion":"0.00040581900"},"pricing_tiers":[],"pricing_variants":[],"providers":[{"provider":"deepinfra","input_price_usd":0.1,"output_price_usd":0.3,"markup_tier":"high","effective_markup_percent":0.0,"context_window":327680,"max_output":32768,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.0000001","completion":"0.0000003"},"pricing_krw":{"prompt":"0.00013527300","completion":"0.00040581900"},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text"],"output_modalities":["text"],"description":"Llama 4 Scout 17B applies Meta's Llama 4 family to general dialogue, document understanding, and text generation. Its currently callable offering profile provides 327,680 tokens of context with a maximum output of 32,768 tokens.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"deepseek-v4-pro","object":"model","created":0,"owned_by":"pleum","provider":"deepseek","display_name":"DeepSeek V4 Pro","modality":"text","price_unit":"token","input_price_usd":0.66,"output_price_usd":1.98,"markup_tier":"medium","effective_markup_percent":0.0,"context_window":1048576,"max_output":384000,"is_active":true,"operations":["chat.generate"],"maker":"DeepSeek","context_length":1048576,"max_output_tokens":384000,"architecture":{"input_modalities":["text"],"output_modalities":["text"]},"supported_parameters":["temperature","max_tokens","top_p","stop","seed","frequency_penalty","presence_penalty","tools","tool_choice","response_format","parallel_tool_calls","logit_bias","stream","reasoning_effort"],"supports_thinking":true,"thinking_forced":false,"pricing":{"prompt":"0.00000066","completion":"0.00000198"},"pricing_krw":{"prompt":"0.000892801800","completion":"0.002678405400"},"pricing_tiers":[{"input_tokens_lte":1000000,"input_price_usd_per_m":0.66,"output_price_usd_per_m":1.98,"cache_read_price_usd_per_m":0.022}],"pricing_variants":[],"providers":[{"provider":"deepseek","input_price_usd":0.66,"output_price_usd":1.98,"markup_tier":"medium","effective_markup_percent":0.0,"context_window":1000000,"max_output":384000,"cache_read_usd":0.022,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.00000066","completion":"0.00000198"},"pricing_krw":{"prompt":"0.000892801800","completion":"0.002678405400"},"peak_pricing":null,"pricing_policy":{"version":1,"kind":"token_tiers","tiers":[{"input_tokens_lte":1000000,"input_price_usd_per_m":0.66,"output_price_usd_per_m":1.98,"cache_read_price_usd_per_m":0.022}]},"pricing_tiers":[{"input_tokens_lte":1000000,"input_price_usd_per_m":0.66,"output_price_usd_per_m":1.98,"cache_read_price_usd_per_m":0.022}],"pricing_variants":[]},{"provider":"deepinfra","input_price_usd":1.3,"output_price_usd":2.6,"markup_tier":"medium","effective_markup_percent":0.0,"context_window":1048576,"max_output":32768,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.0000013","completion":"0.0000026"},"pricing_krw":{"prompt":"0.00175854900","completion":"0.00351709800"},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]},{"provider":"qwen","input_price_usd":2.4,"output_price_usd":4.8,"markup_tier":"medium","effective_markup_percent":0.0,"context_window":1000000,"max_output":32768,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.0000024","completion":"0.0000048"},"pricing_krw":{"prompt":"0.00324655200","completion":"0.00649310400"},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]}],"parameters_b":null,"architecture_class":"dense","license":"mit","released_at":"2025-09-05","input_modalities":["text"],"output_modalities":["text"],"description":"DeepSeek V4 Pro is the V4 model for deep reasoning on complex agent tasks and long-horizon coding. It supports thinking and non-thinking modes plus function calling; this PleumRouter offering provides up to 1,024,000 context tokens and 384,000 output tokens.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"deepseek-ai/DeepSeek-V3","object":"model","created":0,"owned_by":"pleum","provider":"deepinfra","display_name":"DeepSeek V3","modality":"text","price_unit":"token","input_price_usd":0.32,"output_price_usd":0.89,"markup_tier":"high","effective_markup_percent":0.0,"context_window":163840,"max_output":32768,"is_active":true,"operations":["chat.generate"],"maker":"DeepSeek","context_length":163840,"max_output_tokens":32768,"architecture":{"input_modalities":["text"],"output_modalities":["text"]},"supported_parameters":["temperature","max_tokens","top_p","stop","seed","frequency_penalty","presence_penalty","tools","tool_choice","response_format","parallel_tool_calls","logit_bias","stream"],"supports_thinking":false,"thinking_forced":false,"pricing":{"prompt":"0.00000032","completion":"0.00000089"},"pricing_krw":{"prompt":"0.000432873600","completion":"0.001203929700"},"pricing_tiers":[],"pricing_variants":[],"providers":[{"provider":"deepinfra","input_price_usd":0.32,"output_price_usd":0.89,"markup_tier":"high","effective_markup_percent":0.0,"context_window":163840,"max_output":32768,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.00000032","completion":"0.00000089"},"pricing_krw":{"prompt":"0.000432873600","completion":"0.001203929700"},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text"],"output_modalities":["text"],"description":"DeepSeek positions DeepSeek V3 (hyperbolic) in the DeepSeek V3 family for general dialogue, document understanding, and text generation. PleumRouter's widest-context offering supports 163,840 context tokens and 32,768 output tokens together.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"deepseek-v4-flash","object":"model","created":0,"owned_by":"pleum","provider":"deepinfra","display_name":"DeepSeek V4 Flash","modality":"text","price_unit":"token","input_price_usd":0.09,"output_price_usd":0.18,"markup_tier":"high","effective_markup_percent":0.0,"context_window":1048576,"max_output":32768,"is_active":true,"operations":["chat.generate"],"maker":"DeepSeek","context_length":1048576,"max_output_tokens":32768,"architecture":{"input_modalities":["text"],"output_modalities":["text"]},"supported_parameters":["temperature","max_tokens","top_p","stop","seed","frequency_penalty","presence_penalty","tools","tool_choice","response_format","parallel_tool_calls","logit_bias","stream","reasoning_effort"],"supports_thinking":true,"thinking_forced":false,"pricing":{"prompt":"0.00000009","completion":"0.00000018"},"pricing_krw":{"prompt":"0.000121745700","completion":"0.000243491400"},"pricing_tiers":[],"pricing_variants":[],"providers":[{"provider":"deepinfra","input_price_usd":0.09,"output_price_usd":0.18,"markup_tier":"high","effective_markup_percent":0.0,"context_window":1048576,"max_output":32768,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.00000009","completion":"0.00000018"},"pricing_krw":{"prompt":"0.000121745700","completion":"0.000243491400"},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]},{"provider":"deepseek","input_price_usd":0.22,"output_price_usd":0.66,"markup_tier":"high","effective_markup_percent":0.0,"context_window":1000000,"max_output":384000,"cache_read_usd":0.007,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.00000022","completion":"0.00000066"},"pricing_krw":{"prompt":"0.000297600600","completion":"0.000892801800"},"peak_pricing":null,"pricing_policy":{"version":1,"kind":"token_tiers","tiers":[{"input_tokens_lte":1000000,"input_price_usd_per_m":0.22,"output_price_usd_per_m":0.66,"cache_read_price_usd_per_m":0.007}]},"pricing_tiers":[{"input_tokens_lte":1000000,"input_price_usd_per_m":0.22,"output_price_usd_per_m":0.66,"cache_read_price_usd_per_m":0.007}],"pricing_variants":[]}],"parameters_b":null,"architecture_class":"dense","license":"mit","released_at":"2025-09-05","input_modalities":["text"],"output_modalities":["text"],"description":"DeepSeek V4 Flash is the lighter V4 variant for faster, more cost-efficient reasoning close to V4 Pro. Exact context and output limits are listed for each provider offering in the catalog.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"deepseek-v3.2","object":"model","created":0,"owned_by":"pleum","provider":"deepinfra","display_name":"DeepSeek-V3.2","modality":"text","price_unit":"token","input_price_usd":0.26,"output_price_usd":0.38,"markup_tier":"high","effective_markup_percent":0.0,"context_window":164000,"max_output":164000,"is_active":true,"operations":["chat.generate"],"maker":"DeepSeek","context_length":164000,"max_output_tokens":164000,"architecture":{"input_modalities":["text"],"output_modalities":["text"]},"supported_parameters":["temperature","max_tokens","top_p","stop","seed","frequency_penalty","presence_penalty","tools","tool_choice","response_format","parallel_tool_calls","logit_bias","stream","reasoning_effort"],"supports_thinking":true,"thinking_forced":false,"pricing":{"prompt":"0.00000026","completion":"0.00000038"},"pricing_krw":{"prompt":"0.000351709800","completion":"0.000514037400"},"pricing_tiers":[],"pricing_variants":[],"providers":[{"provider":"deepinfra","input_price_usd":0.26,"output_price_usd":0.38,"markup_tier":"high","effective_markup_percent":0.0,"context_window":163840,"max_output":32768,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.00000026","completion":"0.00000038"},"pricing_krw":{"prompt":"0.000351709800","completion":"0.000514037400"},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]},{"provider":"modelark","input_price_usd":0.28,"output_price_usd":0.42,"markup_tier":"high","effective_markup_percent":0.0,"context_window":128000,"max_output":32000,"cache_read_usd":0.056,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.00000028","completion":"0.00000042"},"pricing_krw":{"prompt":"0.000378764400","completion":"0.000568146600"},"peak_pricing":null,"pricing_policy":{"version":1,"kind":"token_tiers","tiers":[{"input_tokens_lte":32000,"input_price_usd_per_m":0.28,"output_price_usd_per_m":0.42,"cache_read_price_usd_per_m":0.056},{"input_tokens_lte":128000,"input_price_usd_per_m":0.56,"output_price_usd_per_m":0.84,"cache_read_price_usd_per_m":0.056}]},"pricing_tiers":[{"input_tokens_lte":32000,"input_price_usd_per_m":0.28,"output_price_usd_per_m":0.42,"cache_read_price_usd_per_m":0.056},{"input_tokens_lte":128000,"input_price_usd_per_m":0.56,"output_price_usd_per_m":0.84,"cache_read_price_usd_per_m":0.056}],"pricing_variants":[]},{"provider":"friendli","input_price_usd":0.5,"output_price_usd":1.5,"markup_tier":"medium","effective_markup_percent":0.0,"context_window":163840,"max_output":65536,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.0000005","completion":"0.0000015"},"pricing_krw":{"prompt":"0.00067636500","completion":"0.00202909500"},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text"],"output_modalities":["text"],"description":"DeepSeek positions DeepSeek-V3.2 in the DeepSeek V3.2 family for general dialogue, document understanding, and text generation. PleumRouter catalogs this standard entry with up to 163,840 context tokens and 163,840 output tokens.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"openai/gpt-oss-120b","object":"model","created":0,"owned_by":"pleum","provider":"deepinfra","display_name":"GPT-OSS 120B","modality":"text","price_unit":"token","input_price_usd":0.037,"output_price_usd":0.17,"markup_tier":"high","effective_markup_percent":0.0,"context_window":131072,"max_output":131072,"is_active":true,"operations":["chat.generate"],"maker":"OpenAI","context_length":131072,"max_output_tokens":131072,"architecture":{"input_modalities":["text"],"output_modalities":["text"]},"supported_parameters":["temperature","max_tokens","top_p","stop","seed","frequency_penalty","presence_penalty","tools","tool_choice","response_format","parallel_tool_calls","logit_bias","stream","reasoning_effort"],"supports_thinking":true,"thinking_forced":false,"pricing":{"prompt":"0.000000037","completion":"0.00000017"},"pricing_krw":{"prompt":"0.0000500510100","completion":"0.000229964100"},"pricing_tiers":[],"pricing_variants":[],"providers":[{"provider":"deepinfra","input_price_usd":0.037,"output_price_usd":0.17,"markup_tier":"high","effective_markup_percent":0.0,"context_window":131072,"max_output":32768,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.000000037","completion":"0.00000017"},"pricing_krw":{"prompt":"0.0000500510100","completion":"0.000229964100"},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]},{"provider":"modelark","input_price_usd":0.1,"output_price_usd":0.5,"markup_tier":"high","effective_markup_percent":0.0,"context_window":128000,"max_output":64000,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.0000001","completion":"0.0000005"},"pricing_krw":{"prompt":"0.00013527300","completion":"0.00067636500"},"peak_pricing":null,"pricing_policy":{"version":1,"kind":"token_tiers","tiers":[{"input_tokens_lte":128000,"input_price_usd_per_m":0.1,"output_price_usd_per_m":0.5}]},"pricing_tiers":[{"input_tokens_lte":128000,"input_price_usd_per_m":0.1,"output_price_usd_per_m":0.5}],"pricing_variants":[]},{"provider":"together","input_price_usd":0.15,"output_price_usd":0.6,"markup_tier":"high","effective_markup_percent":0.0,"context_window":128000,"max_output":8192,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.00000015","completion":"0.0000006"},"pricing_krw":{"prompt":"0.000202909500","completion":"0.00081163800"},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]},{"provider":"groq","input_price_usd":0.15,"output_price_usd":0.6,"markup_tier":"high","effective_markup_percent":0.0,"context_window":131072,"max_output":65536,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.00000015","completion":"0.0000006"},"pricing_krw":{"prompt":"0.000202909500","completion":"0.00081163800"},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text"],"output_modalities":["text"],"description":"GPT-OSS 120B is OpenAI's open-weight text model for dialogue, document understanding, and agent work. Multiple providers serve the same 120B model, while each offering retains its own limits and pricing.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"openai/gpt-oss-20b","object":"model","created":0,"owned_by":"pleum","provider":"deepinfra","display_name":"GPT-OSS 20B","modality":"text","price_unit":"token","input_price_usd":0.03,"output_price_usd":0.14,"markup_tier":"high","effective_markup_percent":0.0,"context_window":131072,"max_output":65536,"is_active":true,"operations":["chat.generate"],"maker":"OpenAI","context_length":131072,"max_output_tokens":65536,"architecture":{"input_modalities":["text"],"output_modalities":["text"]},"supported_parameters":["temperature","max_tokens","top_p","stop","seed","frequency_penalty","presence_penalty","tools","tool_choice","response_format","parallel_tool_calls","logit_bias","stream"],"supports_thinking":false,"thinking_forced":false,"pricing":{"prompt":"0.00000003","completion":"0.00000014"},"pricing_krw":{"prompt":"0.000040581900","completion":"0.000189382200"},"pricing_tiers":[],"pricing_variants":[],"providers":[{"provider":"deepinfra","input_price_usd":0.03,"output_price_usd":0.14,"markup_tier":"high","effective_markup_percent":0.0,"context_window":131072,"max_output":32768,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.00000003","completion":"0.00000014"},"pricing_krw":{"prompt":"0.000040581900","completion":"0.000189382200"},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]},{"provider":"together","input_price_usd":0.05,"output_price_usd":0.2,"markup_tier":"high","effective_markup_percent":0.0,"context_window":128000,"max_output":8192,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.00000005","completion":"0.0000002"},"pricing_krw":{"prompt":"0.000067636500","completion":"0.00027054600"},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]},{"provider":"groq","input_price_usd":0.075,"output_price_usd":0.3,"markup_tier":"high","effective_markup_percent":0.0,"context_window":131072,"max_output":65536,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.000000075","completion":"0.0000003"},"pricing_krw":{"prompt":"0.0001014547500","completion":"0.00040581900"},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text"],"output_modalities":["text"],"description":"Built in OpenAI's GPT-OSS line, GPT-OSS 20B handles general dialogue, document understanding, and text generation. For this 20B-class variant, the catalog lists a 131,072-token context window and up to 32,768 output tokens.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"gpt-oss-safeguard-20b","object":"model","created":0,"owned_by":"pleum","provider":"groq","display_name":"GPT OSS Safeguard 20B (Groq)","modality":"text","price_unit":"token","input_price_usd":0.075,"output_price_usd":0.3,"markup_tier":"high","effective_markup_percent":0.0,"context_window":131072,"max_output":65536,"is_active":true,"operations":["chat.generate"],"maker":"OpenAI","context_length":131072,"max_output_tokens":65536,"architecture":{"input_modalities":["text"],"output_modalities":["text"]},"supported_parameters":["temperature","max_tokens","top_p","stop","seed","frequency_penalty","presence_penalty","tools","tool_choice","response_format","parallel_tool_calls","logit_bias","stream"],"supports_thinking":false,"thinking_forced":false,"pricing":{"prompt":"0.000000075","completion":"0.0000003"},"pricing_krw":{"prompt":"0.0001014547500","completion":"0.00040581900"},"pricing_tiers":[],"pricing_variants":[],"providers":[{"provider":"groq","input_price_usd":0.075,"output_price_usd":0.3,"markup_tier":"high","effective_markup_percent":0.0,"context_window":131072,"max_output":65536,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.000000075","completion":"0.0000003"},"pricing_krw":{"prompt":"0.0001014547500","completion":"0.00040581900"},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text"],"output_modalities":["text"],"description":"GPT OSS Safeguard 20B is Groq's text model for content-safety and moderation workloads. Groq's public catalog lists a 131,072-token context window and up to 65,536 output tokens.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"llama-prompt-guard-2-22m","object":"model","created":0,"owned_by":"pleum","provider":"groq","display_name":"Llama Prompt Guard 2 22M (Groq)","modality":"text","price_unit":"token","input_price_usd":0.03,"output_price_usd":0.03,"markup_tier":"high","effective_markup_percent":0.0,"context_window":512,"max_output":512,"is_active":true,"operations":["chat.generate"],"maker":"Meta","context_length":512,"max_output_tokens":512,"architecture":{"input_modalities":["text"],"output_modalities":["text"]},"supported_parameters":["temperature","max_tokens","top_p","stop","seed","frequency_penalty","presence_penalty","tools","tool_choice","response_format","parallel_tool_calls","logit_bias","stream"],"supports_thinking":false,"thinking_forced":false,"pricing":{"prompt":"0.00000003","completion":"0.00000003"},"pricing_krw":{"prompt":"0.000040581900","completion":"0.000040581900"},"pricing_tiers":[],"pricing_variants":[],"providers":[{"provider":"groq","input_price_usd":0.03,"output_price_usd":0.03,"markup_tier":"high","effective_markup_percent":0.0,"context_window":512,"max_output":512,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.00000003","completion":"0.00000003"},"pricing_krw":{"prompt":"0.000040581900","completion":"0.000040581900"},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text"],"output_modalities":["text"],"description":"Llama Prompt Guard 2 22M is a lightweight prompt-injection classifier hosted on Groq that classifies 512-token inputs as safe or unsafe.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"llama-prompt-guard-2-86m","object":"model","created":0,"owned_by":"pleum","provider":"groq","display_name":"Llama Prompt Guard 2 86M (Groq)","modality":"text","price_unit":"token","input_price_usd":0.04,"output_price_usd":0.04,"markup_tier":"high","effective_markup_percent":0.0,"context_window":512,"max_output":512,"is_active":true,"operations":["chat.generate"],"maker":"Meta","context_length":512,"max_output_tokens":512,"architecture":{"input_modalities":["text"],"output_modalities":["text"]},"supported_parameters":["temperature","max_tokens","top_p","stop","seed","frequency_penalty","presence_penalty","tools","tool_choice","response_format","parallel_tool_calls","logit_bias","stream"],"supports_thinking":false,"thinking_forced":false,"pricing":{"prompt":"0.00000004","completion":"0.00000004"},"pricing_krw":{"prompt":"0.000054109200","completion":"0.000054109200"},"pricing_tiers":[],"pricing_variants":[],"providers":[{"provider":"groq","input_price_usd":0.04,"output_price_usd":0.04,"markup_tier":"high","effective_markup_percent":0.0,"context_window":512,"max_output":512,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.00000004","completion":"0.00000004"},"pricing_krw":{"prompt":"0.000054109200","completion":"0.000054109200"},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text"],"output_modalities":["text"],"description":"Llama Prompt Guard 2 86M is the larger sibling of the 22M classifier, offering higher-accuracy prompt-injection classification on Groq.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"glm-5.3-flash","object":"model","created":0,"owned_by":"pleum","provider":"glm","display_name":"GLM-5.3 Flash","modality":"text","price_unit":"token","input_price_usd":0.15,"output_price_usd":0.5,"markup_tier":"medium","effective_markup_percent":0.0,"context_window":1048576,"max_output":1048576,"is_active":true,"operations":["chat.generate"],"maker":"Zhipu","context_length":1048576,"max_output_tokens":1048576,"architecture":{"input_modalities":["text","image","video"],"output_modalities":["text"]},"supported_parameters":["temperature","max_tokens","top_p","stop","seed","frequency_penalty","presence_penalty","tools","tool_choice","response_format","parallel_tool_calls","logit_bias","stream","reasoning_effort"],"supports_thinking":true,"thinking_forced":true,"pricing":{"prompt":"0.00000015","completion":"0.0000005"},"pricing_krw":{"prompt":"0.000202909500","completion":"0.00067636500"},"pricing_tiers":[{"input_tokens_lte":1000000,"input_price_usd_per_m":0.15,"output_price_usd_per_m":0.5,"cache_read_price_usd_per_m":0.03}],"pricing_variants":[],"providers":[{"provider":"together","input_price_usd":0.15,"output_price_usd":0.5,"markup_tier":"high","effective_markup_percent":0.0,"context_window":1000000,"max_output":8192,"cache_read_usd":0.03,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.00000015","completion":"0.0000005"},"pricing_krw":{"prompt":"0.000202909500","completion":"0.00067636500"},"peak_pricing":null,"pricing_policy":{"version":1,"kind":"token_tiers","tiers":[{"input_tokens_lte":1000000,"input_price_usd_per_m":0.15,"output_price_usd_per_m":0.5,"cache_read_price_usd_per_m":0.03}]},"pricing_tiers":[{"input_tokens_lte":1000000,"input_price_usd_per_m":0.15,"output_price_usd_per_m":0.5,"cache_read_price_usd_per_m":0.03}],"pricing_variants":[]},{"provider":"friendli","input_price_usd":0.15,"output_price_usd":0.5,"markup_tier":"high","effective_markup_percent":0.0,"context_window":1048576,"max_output":131072,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.00000015","completion":"0.0000005"},"pricing_krw":{"prompt":"0.000202909500","completion":"0.00067636500"},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]},{"provider":"deepinfra","input_price_usd":0.15,"output_price_usd":0.5,"markup_tier":"high","effective_markup_percent":0.0,"context_window":1048576,"max_output":32768,"cache_read_usd":0.03,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.00000015","completion":"0.0000005"},"pricing_krw":{"prompt":"0.000202909500","completion":"0.00067636500"},"peak_pricing":null,"pricing_policy":{"version":1,"kind":"token_tiers","tiers":[{"input_tokens_lte":1048576,"input_price_usd_per_m":0.15,"output_price_usd_per_m":0.5,"cache_read_price_usd_per_m":0.03}]},"pricing_tiers":[{"input_tokens_lte":1048576,"input_price_usd_per_m":0.15,"output_price_usd_per_m":0.5,"cache_read_price_usd_per_m":0.03}],"pricing_variants":[]},{"provider":"glm","input_price_usd":0.15,"output_price_usd":0.5,"markup_tier":"medium","effective_markup_percent":0.0,"context_window":1000000,"max_output":131072,"cache_read_usd":0.03,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.00000015","completion":"0.0000005"},"pricing_krw":{"prompt":"0.000202909500","completion":"0.00067636500"},"peak_pricing":null,"pricing_policy":{"version":1,"kind":"token_tiers","tiers":[{"input_tokens_lte":1000000,"input_price_usd_per_m":0.15,"output_price_usd_per_m":0.5,"cache_read_price_usd_per_m":0.03}]},"pricing_tiers":[{"input_tokens_lte":1000000,"input_price_usd_per_m":0.15,"output_price_usd_per_m":0.5,"cache_read_price_usd_per_m":0.03}],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text","image","video"],"output_modalities":["text"],"description":"GLM-5.3 Flash is Z.AI's multimodal reasoning model, accepting text, image, and video inputs and producing text. Its official documentation lists a 1M-token context and thinking enabled by default.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"qwen3.8-max","object":"model","created":0,"owned_by":"pleum","provider":"qwen","display_name":"Qwen3.8 Max","modality":"text","price_unit":"token","input_price_usd":2.0,"output_price_usd":6.0,"markup_tier":"medium","effective_markup_percent":0.0,"context_window":1000000,"max_output":262144,"is_active":true,"operations":["chat.generate"],"maker":"Qwen","context_length":1000000,"max_output_tokens":262144,"architecture":{"input_modalities":["text","image","video"],"output_modalities":["text"]},"supported_parameters":["temperature","max_tokens","top_p","stop","seed","frequency_penalty","presence_penalty","tools","tool_choice","response_format","parallel_tool_calls","logit_bias","stream","reasoning_effort"],"supports_thinking":true,"thinking_forced":false,"pricing":{"prompt":"0.000002","completion":"0.000006"},"pricing_krw":{"prompt":"0.0027054600","completion":"0.0081163800"},"pricing_tiers":[{"input_tokens_lte":1000000,"input_price_usd_per_m":2.0,"output_price_usd_per_m":6.0,"cache_read_price_usd_per_m":0.25}],"pricing_variants":[],"providers":[{"provider":"qwen","input_price_usd":2.0,"output_price_usd":6.0,"markup_tier":"medium","effective_markup_percent":0.0,"context_window":1000000,"max_output":131072,"cache_read_usd":0.25,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.000002","completion":"0.000006"},"pricing_krw":{"prompt":"0.0027054600","completion":"0.0081163800"},"peak_pricing":null,"pricing_policy":{"version":1,"kind":"token_tiers","tiers":[{"input_tokens_lte":1000000,"input_price_usd_per_m":2.0,"output_price_usd_per_m":6.0,"cache_read_price_usd_per_m":0.25}]},"pricing_tiers":[{"input_tokens_lte":1000000,"input_price_usd_per_m":2.0,"output_price_usd_per_m":6.0,"cache_read_price_usd_per_m":0.25}],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text","image","video"],"output_modalities":["text"],"description":"Qwen3.8 Max is a Qwen multimodal model with up to a 1M-token context, accepting text, image, and video inputs and producing text. The official documentation also specifies thinking mode and context-cache pricing.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"qwen3.7-max","object":"model","created":0,"owned_by":"pleum","provider":"together","display_name":"Qwen3.7 Max","modality":"text","price_unit":"token","input_price_usd":1.25,"output_price_usd":3.75,"markup_tier":"medium","effective_markup_percent":0.0,"context_window":1000000,"max_output":65536,"is_active":true,"operations":["chat.generate"],"maker":"Qwen","context_length":1000000,"max_output_tokens":65536,"architecture":{"input_modalities":["text"],"output_modalities":["text"]},"supported_parameters":["temperature","max_tokens","top_p","stop","seed","frequency_penalty","presence_penalty","tools","tool_choice","response_format","parallel_tool_calls","logit_bias","stream"],"supports_thinking":false,"thinking_forced":false,"pricing":{"prompt":"0.00000125","completion":"0.00000375"},"pricing_krw":{"prompt":"0.001690912500","completion":"0.005072737500"},"pricing_tiers":[{"input_tokens_lte":1000000,"input_price_usd_per_m":1.25,"output_price_usd_per_m":3.75,"cache_read_price_usd_per_m":0.13}],"pricing_variants":[],"providers":[{"provider":"together","input_price_usd":1.25,"output_price_usd":3.75,"markup_tier":"medium","effective_markup_percent":0.0,"context_window":1000000,"max_output":8192,"cache_read_usd":0.13,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.00000125","completion":"0.00000375"},"pricing_krw":{"prompt":"0.001690912500","completion":"0.005072737500"},"peak_pricing":null,"pricing_policy":{"version":1,"kind":"token_tiers","tiers":[{"input_tokens_lte":1000000,"input_price_usd_per_m":1.25,"output_price_usd_per_m":3.75,"cache_read_price_usd_per_m":0.13}]},"pricing_tiers":[{"input_tokens_lte":1000000,"input_price_usd_per_m":1.25,"output_price_usd_per_m":3.75,"cache_read_price_usd_per_m":0.13}],"pricing_variants":[]},{"provider":"deepinfra","input_price_usd":2.5,"output_price_usd":7.5,"markup_tier":"medium","effective_markup_percent":0.0,"context_window":256000,"max_output":32768,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.0000025","completion":"0.0000075"},"pricing_krw":{"prompt":"0.00338182500","completion":"0.01014547500"},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]},{"provider":"qwen","input_price_usd":2.5,"output_price_usd":7.5,"markup_tier":"medium","effective_markup_percent":0.0,"context_window":1000000,"max_output":65536,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.0000025","completion":"0.0000075"},"pricing_krw":{"prompt":"0.00338182500","completion":"0.01014547500"},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]}],"parameters_b":null,"architecture_class":"dense","license":"apache-2.0","released_at":"2025-09-17","input_modalities":["text"],"output_modalities":["text"],"description":"Qwen3.7 Max is the flagship Qwen Max reasoning model for complex multi-step work and long-horizon autonomous execution. It supports thinking and non-thinking modes plus function calling, with up to 1,000,000 context tokens on PleumRouter.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"qwen3.7-flash","object":"model","created":0,"owned_by":"pleum","provider":"qwen","display_name":"Qwen3.7 Flash","modality":"text","price_unit":"token","input_price_usd":0.03,"output_price_usd":0.13,"markup_tier":"high","effective_markup_percent":0.0,"context_window":1000000,"max_output":65536,"is_active":true,"operations":["chat.generate"],"maker":"Qwen","context_length":1000000,"max_output_tokens":65536,"architecture":{"input_modalities":["text"],"output_modalities":["text"]},"supported_parameters":["temperature","max_tokens","top_p","stop","seed","frequency_penalty","presence_penalty","tools","tool_choice","response_format","parallel_tool_calls","logit_bias","stream"],"supports_thinking":false,"thinking_forced":false,"pricing":{"prompt":"0.00000003","completion":"0.00000013"},"pricing_krw":{"prompt":"0.000040581900","completion":"0.000175854900"},"pricing_tiers":[{"input_tokens_lte":32000,"input_price_usd_per_m":0.03,"output_price_usd_per_m":0.13},{"input_tokens_lte":256000,"input_price_usd_per_m":0.1,"output_price_usd_per_m":0.4},{"input_tokens_lte":1000000,"input_price_usd_per_m":0.2,"output_price_usd_per_m":0.8}],"pricing_variants":[],"providers":[{"provider":"qwen","input_price_usd":0.03,"output_price_usd":0.13,"markup_tier":"high","effective_markup_percent":0.0,"context_window":1000000,"max_output":65536,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.00000003","completion":"0.00000013"},"pricing_krw":{"prompt":"0.000040581900","completion":"0.000175854900"},"peak_pricing":null,"pricing_policy":{"version":1,"kind":"token_tiers","tiers":[{"input_tokens_lte":32000,"input_price_usd_per_m":0.03,"output_price_usd_per_m":0.13},{"input_tokens_lte":256000,"input_price_usd_per_m":0.1,"output_price_usd_per_m":0.4},{"input_tokens_lte":1000000,"input_price_usd_per_m":0.2,"output_price_usd_per_m":0.8}]},"pricing_tiers":[{"input_tokens_lte":32000,"input_price_usd_per_m":0.03,"output_price_usd_per_m":0.13},{"input_tokens_lte":256000,"input_price_usd_per_m":0.1,"output_price_usd_per_m":0.4},{"input_tokens_lte":1000000,"input_price_usd_per_m":0.2,"output_price_usd_per_m":0.8}],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text"],"output_modalities":["text"],"description":"Qwen3.7 Flash is a text model available through PleumRouter. Review its catalog metadata for supported capabilities and pricing.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"qwen3.7-plus","object":"model","created":0,"owned_by":"pleum","provider":"together","display_name":"Qwen3.7 Plus","modality":"text","price_unit":"token","input_price_usd":0.32,"output_price_usd":1.28,"markup_tier":"high","effective_markup_percent":0.0,"context_window":1000000,"max_output":65536,"is_active":true,"operations":["chat.generate"],"maker":"Qwen","context_length":1000000,"max_output_tokens":65536,"architecture":{"input_modalities":["text","image","video"],"output_modalities":["text"]},"supported_parameters":["temperature","max_tokens","top_p","stop","seed","frequency_penalty","presence_penalty","tools","tool_choice","response_format","parallel_tool_calls","logit_bias","stream"],"supports_thinking":false,"thinking_forced":false,"pricing":{"prompt":"0.00000032","completion":"0.00000128"},"pricing_krw":{"prompt":"0.000432873600","completion":"0.001731494400"},"pricing_tiers":[],"pricing_variants":[],"providers":[{"provider":"together","input_price_usd":0.32,"output_price_usd":1.28,"markup_tier":"high","effective_markup_percent":0.0,"context_window":1000000,"max_output":8192,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.00000032","completion":"0.00000128"},"pricing_krw":{"prompt":"0.000432873600","completion":"0.001731494400"},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]},{"provider":"qwen","input_price_usd":0.4,"output_price_usd":1.6,"markup_tier":"medium","effective_markup_percent":0.0,"context_window":1000000,"max_output":65536,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.0000004","completion":"0.0000016"},"pricing_krw":{"prompt":"0.00054109200","completion":"0.00216436800"},"peak_pricing":null,"pricing_policy":{"version":1,"kind":"token_tiers","tiers":[{"input_tokens_lte":256000,"input_price_usd_per_m":0.4,"output_price_usd_per_m":1.6},{"input_tokens_lte":1000000,"input_price_usd_per_m":1.2,"output_price_usd_per_m":4.8}]},"pricing_tiers":[{"input_tokens_lte":256000,"input_price_usd_per_m":0.4,"output_price_usd_per_m":1.6},{"input_tokens_lte":1000000,"input_price_usd_per_m":1.2,"output_price_usd_per_m":4.8}],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text","image","video"],"output_modalities":["text"],"description":"Qwen3.7 Plus is a Qwen3.7 reasoning model with vision-language understanding, coding, tool-use, and agent capabilities. PleumRouter catalogs it with up to 1,000,000 context tokens.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"qwen3.8-flash","object":"model","created":0,"owned_by":"pleum","provider":"qwen","display_name":"Qwen3.8 Flash","modality":"text","price_unit":"token","input_price_usd":0.15,"output_price_usd":0.47,"markup_tier":"high","effective_markup_percent":0.0,"context_window":1000000,"max_output":131072,"is_active":true,"operations":["chat.generate"],"maker":"Qwen","context_length":1000000,"max_output_tokens":131072,"architecture":{"input_modalities":["text","image"],"output_modalities":["text"]},"supported_parameters":["temperature","max_tokens","top_p","stop","seed","frequency_penalty","presence_penalty","tools","tool_choice","response_format","parallel_tool_calls","logit_bias","stream","reasoning_effort"],"supports_thinking":true,"thinking_forced":false,"pricing":{"prompt":"0.00000015","completion":"0.00000047"},"pricing_krw":{"prompt":"0.000202909500","completion":"0.000635783100"},"pricing_tiers":[],"pricing_variants":[],"providers":[{"provider":"qwen","input_price_usd":0.15,"output_price_usd":0.47,"markup_tier":"high","effective_markup_percent":0.0,"context_window":1000000,"max_output":131072,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.00000015","completion":"0.00000047"},"pricing_krw":{"prompt":"0.000202909500","completion":"0.000635783100"},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]},{"provider":"together","input_price_usd":0.15,"output_price_usd":0.47,"markup_tier":"high","effective_markup_percent":0.0,"context_window":1000000,"max_output":8192,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.00000015","completion":"0.00000047"},"pricing_krw":{"prompt":"0.000202909500","completion":"0.000635783100"},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text","image"],"output_modalities":["text"],"description":"Qwen3.8 Flash is the lightweight fast tier of Qwen 3.8 with up to a 1,000,000-token context, supporting both thinking and non-thinking modes at the same price.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"qwen3.6-max-preview","object":"model","created":0,"owned_by":"pleum","provider":"qwen","display_name":"Qwen3.6 Max Preview","modality":"text","price_unit":"token","input_price_usd":1.3,"output_price_usd":7.8,"markup_tier":"medium","effective_markup_percent":0.0,"context_window":262144,"max_output":65536,"is_active":true,"operations":["chat.generate"],"maker":"Qwen","context_length":262144,"max_output_tokens":65536,"architecture":{"input_modalities":["text"],"output_modalities":["text"]},"supported_parameters":["temperature","max_tokens","top_p","stop","seed","frequency_penalty","presence_penalty","tools","tool_choice","response_format","parallel_tool_calls","logit_bias","stream"],"supports_thinking":false,"thinking_forced":false,"pricing":{"prompt":"0.0000013","completion":"0.0000078"},"pricing_krw":{"prompt":"0.00175854900","completion":"0.01055129400"},"pricing_tiers":[{"input_tokens_lte":128000,"input_price_usd_per_m":1.3,"output_price_usd_per_m":7.8},{"input_tokens_lte":262144,"input_price_usd_per_m":2.0,"output_price_usd_per_m":12.0}],"pricing_variants":[],"providers":[{"provider":"qwen","input_price_usd":1.3,"output_price_usd":7.8,"markup_tier":"medium","effective_markup_percent":0.0,"context_window":262144,"max_output":65536,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.0000013","completion":"0.0000078"},"pricing_krw":{"prompt":"0.00175854900","completion":"0.01055129400"},"peak_pricing":null,"pricing_policy":{"version":1,"kind":"token_tiers","tiers":[{"input_tokens_lte":128000,"input_price_usd_per_m":1.3,"output_price_usd_per_m":7.8},{"input_tokens_lte":262144,"input_price_usd_per_m":2.0,"output_price_usd_per_m":12.0}]},"pricing_tiers":[{"input_tokens_lte":128000,"input_price_usd_per_m":1.3,"output_price_usd_per_m":7.8},{"input_tokens_lte":262144,"input_price_usd_per_m":2.0,"output_price_usd_per_m":12.0}],"pricing_variants":[]}],"parameters_b":null,"architecture_class":"dense","license":"apache-2.0","released_at":"2025-09-17","input_modalities":["text"],"output_modalities":["text"],"description":"Qwen positions Qwen3.6 Max Preview in the Qwen3.6 family for understanding visual inputs such as images and documents and returning text. PleumRouter catalogs this preview entry with up to 262,144 context tokens and 65,536 output tokens.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"qwen3.8-27b","object":"model","created":0,"owned_by":"pleum","provider":"vultr","display_name":"Qwen3.8 27B","modality":"text","price_unit":"token","input_price_usd":0.15,"output_price_usd":1.0,"markup_tier":"high","effective_markup_percent":0.0,"context_window":1000000,"max_output":131072,"is_active":true,"operations":["chat.generate"],"maker":"Qwen","context_length":1000000,"max_output_tokens":131072,"architecture":{"input_modalities":["text","image"],"output_modalities":["text"]},"supported_parameters":["temperature","max_tokens","top_p","stop","seed","frequency_penalty","presence_penalty","tools","tool_choice","response_format","parallel_tool_calls","logit_bias","stream","reasoning_effort"],"supports_thinking":true,"thinking_forced":false,"pricing":{"prompt":"0.00000015","completion":"0.000001"},"pricing_krw":{"prompt":"0.000202909500","completion":"0.0013527300"},"pricing_tiers":[],"pricing_variants":[],"providers":[{"provider":"vultr","input_price_usd":0.15,"output_price_usd":1.0,"markup_tier":"high","effective_markup_percent":0.0,"context_window":262144,"max_output":262144,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.00000015","completion":"0.000001"},"pricing_krw":{"prompt":"0.000202909500","completion":"0.0013527300"},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]},{"provider":"qwen","input_price_usd":0.5,"output_price_usd":3.0,"markup_tier":"high","effective_markup_percent":0.0,"context_window":1000000,"max_output":131072,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.0000005","completion":"0.000003"},"pricing_krw":{"prompt":"0.00067636500","completion":"0.0040581900"},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]},{"provider":"groq","input_price_usd":0.8,"output_price_usd":4.0,"markup_tier":"high","effective_markup_percent":0.0,"context_window":131042,"max_output":16384,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.0000008","completion":"0.000004"},"pricing_krw":{"prompt":"0.00108218400","completion":"0.0054109200"},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text","image"],"output_modalities":["text"],"description":"Qwen3.8 27B is a 27-billion-parameter model that accepts text and images and produces text. Groq's official catalog lists a 131,042-token context, up to 16,384 output tokens, and $0.80 input/$4.00 output per million tokens; the same DeepInfra offering stays inactive until authenticated deployment smoke checks pass.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"qwen3-coder-480b-a35b-instruct","object":"model","created":0,"owned_by":"pleum","provider":"qwen","display_name":"Qwen3 Coder 480B A35B","modality":"text","price_unit":"token","input_price_usd":1.5,"output_price_usd":7.5,"markup_tier":"medium","effective_markup_percent":0.0,"context_window":262144,"max_output":65536,"is_active":true,"operations":["chat.generate"],"maker":"Qwen","context_length":262144,"max_output_tokens":65536,"architecture":{"input_modalities":["text"],"output_modalities":["text"]},"supported_parameters":["temperature","max_tokens","top_p","stop","seed","frequency_penalty","presence_penalty","tools","tool_choice","response_format","parallel_tool_calls","logit_bias","stream"],"supports_thinking":false,"thinking_forced":false,"pricing":{"prompt":"0.0000015","completion":"0.0000075"},"pricing_krw":{"prompt":"0.00202909500","completion":"0.01014547500"},"pricing_tiers":[{"input_tokens_lte":32000,"input_price_usd_per_m":1.5,"output_price_usd_per_m":7.5},{"input_tokens_lte":128000,"input_price_usd_per_m":2.7,"output_price_usd_per_m":13.5},{"input_price_usd_per_m":4.5,"output_price_usd_per_m":22.5}],"pricing_variants":[],"providers":[{"provider":"qwen","input_price_usd":1.5,"output_price_usd":7.5,"markup_tier":"medium","effective_markup_percent":0.0,"context_window":262144,"max_output":65536,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.0000015","completion":"0.0000075"},"pricing_krw":{"prompt":"0.00202909500","completion":"0.01014547500"},"peak_pricing":null,"pricing_policy":{"version":1,"kind":"token_tiers","tiers":[{"input_tokens_lte":32000,"input_price_usd_per_m":1.5,"output_price_usd_per_m":7.5},{"input_tokens_lte":128000,"input_price_usd_per_m":2.7,"output_price_usd_per_m":13.5},{"input_price_usd_per_m":4.5,"output_price_usd_per_m":22.5}]},"pricing_tiers":[{"input_tokens_lte":32000,"input_price_usd_per_m":1.5,"output_price_usd_per_m":7.5},{"input_tokens_lte":128000,"input_price_usd_per_m":2.7,"output_price_usd_per_m":13.5},{"input_price_usd_per_m":4.5,"output_price_usd_per_m":22.5}],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text"],"output_modalities":["text"],"description":"Qwen3 Coder 480B A35B is a 480B-parameter (35B active) MoE coding model with a 262,144-token context and up to 65,536 output tokens, billed in three input-length tiers at 32K, 128K, and 200K.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"qwen3.6-plus","object":"model","created":0,"owned_by":"pleum","provider":"qwen","display_name":"Qwen3.6 Plus","modality":"text","price_unit":"token","input_price_usd":0.5,"output_price_usd":3.0,"markup_tier":"medium","effective_markup_percent":0.0,"context_window":1000000,"max_output":65536,"is_active":true,"operations":["chat.generate"],"maker":"Qwen","context_length":1000000,"max_output_tokens":65536,"architecture":{"input_modalities":["text","image","video"],"output_modalities":["text"]},"supported_parameters":["temperature","max_tokens","top_p","stop","seed","frequency_penalty","presence_penalty","tools","tool_choice","response_format","parallel_tool_calls","logit_bias","stream"],"supports_thinking":false,"thinking_forced":false,"pricing":{"prompt":"0.0000005","completion":"0.000003"},"pricing_krw":{"prompt":"0.00067636500","completion":"0.0040581900"},"pricing_tiers":[{"input_tokens_lte":256000,"input_price_usd_per_m":0.5,"output_price_usd_per_m":3.0},{"input_tokens_lte":1000000,"input_price_usd_per_m":2.0,"output_price_usd_per_m":6.0}],"pricing_variants":[],"providers":[{"provider":"together","input_price_usd":0.5,"output_price_usd":3.0,"markup_tier":"medium","effective_markup_percent":0.0,"context_window":1000000,"max_output":8192,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.0000005","completion":"0.000003"},"pricing_krw":{"prompt":"0.00067636500","completion":"0.0040581900"},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]},{"provider":"qwen","input_price_usd":0.5,"output_price_usd":3.0,"markup_tier":"medium","effective_markup_percent":0.0,"context_window":1000000,"max_output":65536,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.0000005","completion":"0.000003"},"pricing_krw":{"prompt":"0.00067636500","completion":"0.0040581900"},"peak_pricing":null,"pricing_policy":{"version":1,"kind":"token_tiers","tiers":[{"input_tokens_lte":256000,"input_price_usd_per_m":0.5,"output_price_usd_per_m":3.0},{"input_tokens_lte":1000000,"input_price_usd_per_m":2.0,"output_price_usd_per_m":6.0}]},"pricing_tiers":[{"input_tokens_lte":256000,"input_price_usd_per_m":0.5,"output_price_usd_per_m":3.0},{"input_tokens_lte":1000000,"input_price_usd_per_m":2.0,"output_price_usd_per_m":6.0}],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text","image","video"],"output_modalities":["text"],"description":"Qwen positions Qwen3.6 Plus in the Qwen3.6 family for understanding visual inputs such as images and documents and returning text. The public catalog limits for the standard release are 1,000,000 context tokens and 65,536 output tokens.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"qwen3.8-max-0902","object":"model","created":0,"owned_by":"pleum","provider":"qwen","display_name":"Qwen3.8 Max 0902","modality":"text","price_unit":"token","input_price_usd":2.0,"output_price_usd":6.0,"markup_tier":"medium","effective_markup_percent":0.0,"context_window":1000000,"max_output":131072,"is_active":true,"operations":["chat.generate"],"maker":"Qwen","context_length":1000000,"max_output_tokens":131072,"architecture":{"input_modalities":["text","image","video"],"output_modalities":["text"]},"supported_parameters":["temperature","max_tokens","top_p","stop","seed","frequency_penalty","presence_penalty","tools","tool_choice","response_format","parallel_tool_calls","logit_bias","stream"],"supports_thinking":false,"thinking_forced":false,"pricing":{"prompt":"0.000002","completion":"0.000006"},"pricing_krw":{"prompt":"0.0027054600","completion":"0.0081163800"},"pricing_tiers":[{"input_tokens_lte":1000000,"input_price_usd_per_m":2.0,"output_price_usd_per_m":6.0,"cache_read_price_usd_per_m":0.25}],"pricing_variants":[],"providers":[{"provider":"qwen","input_price_usd":2.0,"output_price_usd":6.0,"markup_tier":"medium","effective_markup_percent":0.0,"context_window":1000000,"max_output":131072,"cache_read_usd":0.25,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.000002","completion":"0.000006"},"pricing_krw":{"prompt":"0.0027054600","completion":"0.0081163800"},"peak_pricing":null,"pricing_policy":{"version":1,"kind":"token_tiers","tiers":[{"input_tokens_lte":1000000,"input_price_usd_per_m":2.0,"output_price_usd_per_m":6.0,"cache_read_price_usd_per_m":0.25}]},"pricing_tiers":[{"input_tokens_lte":1000000,"input_price_usd_per_m":2.0,"output_price_usd_per_m":6.0,"cache_read_price_usd_per_m":0.25}],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text","image","video"],"output_modalities":["text"],"description":"Qwen3.8 Max 0902 is Alibaba Cloud Model Studio's September 2, 2026 global snapshot. It accepts text, image, and video input, returns text, supports a 1M-token context and 131,072 output tokens, and is priced at $2.00 input, $6.00 output, and $0.25 cached reads per 1M tokens.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"qwen-plus-character","object":"model","created":0,"owned_by":"pleum","provider":"qwen","display_name":"Qwen Plus Character","modality":"text","price_unit":"token","input_price_usd":0.5,"output_price_usd":1.4,"markup_tier":"medium","effective_markup_percent":0.0,"context_window":131072,"max_output":32768,"is_active":true,"operations":["chat.generate"],"maker":"Qwen","context_length":131072,"max_output_tokens":32768,"architecture":{"input_modalities":["text"],"output_modalities":["text"]},"supported_parameters":["temperature","max_tokens","top_p","stop","seed","frequency_penalty","presence_penalty","tools","tool_choice","response_format","parallel_tool_calls","logit_bias","stream"],"supports_thinking":false,"thinking_forced":false,"pricing":{"prompt":"0.0000005","completion":"0.0000014"},"pricing_krw":{"prompt":"0.00067636500","completion":"0.00189382200"},"pricing_tiers":[{"input_tokens_lte":131072,"input_price_usd_per_m":0.5,"output_price_usd_per_m":1.4,"cache_read_price_usd_per_m":0.1}],"pricing_variants":[],"providers":[{"provider":"qwen","input_price_usd":0.5,"output_price_usd":1.4,"markup_tier":"medium","effective_markup_percent":0.0,"context_window":131072,"max_output":32768,"cache_read_usd":0.1,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.0000005","completion":"0.0000014"},"pricing_krw":{"prompt":"0.00067636500","completion":"0.00189382200"},"peak_pricing":null,"pricing_policy":{"version":1,"kind":"token_tiers","tiers":[{"input_tokens_lte":131072,"input_price_usd_per_m":0.5,"output_price_usd_per_m":1.4,"cache_read_price_usd_per_m":0.1}]},"pricing_tiers":[{"input_tokens_lte":131072,"input_price_usd_per_m":0.5,"output_price_usd_per_m":1.4,"cache_read_price_usd_per_m":0.1}],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text"],"output_modalities":["text"],"description":"Qwen Plus Character is Alibaba Cloud Model Studio's international text model for role-play and character dialogue. The Singapore-region table lists 131,072 context tokens, 32,768 maximum output tokens, and $0.50 input, $1.40 output, and $0.10 cached reads per 1M tokens.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"qwen3-max","object":"model","created":0,"owned_by":"pleum","provider":"qwen","display_name":"Qwen3-Max","modality":"text","price_unit":"token","input_price_usd":1.2,"output_price_usd":6.0,"markup_tier":"medium","effective_markup_percent":0.0,"context_window":262144,"max_output":65536,"is_active":true,"operations":["chat.generate"],"maker":"Qwen","context_length":262144,"max_output_tokens":65536,"architecture":{"input_modalities":["text"],"output_modalities":["text"]},"supported_parameters":["temperature","max_tokens","top_p","stop","seed","frequency_penalty","presence_penalty","tools","tool_choice","response_format","parallel_tool_calls","logit_bias","stream"],"supports_thinking":false,"thinking_forced":false,"pricing":{"prompt":"0.0000012","completion":"0.000006"},"pricing_krw":{"prompt":"0.00162327600","completion":"0.0081163800"},"pricing_tiers":[{"input_tokens_lte":32768,"input_price_usd_per_m":1.2,"output_price_usd_per_m":6.0},{"input_tokens_lte":131072,"input_price_usd_per_m":2.4,"output_price_usd_per_m":12.0},{"input_tokens_lte":262144,"input_price_usd_per_m":3.0,"output_price_usd_per_m":15.0}],"pricing_variants":[],"providers":[{"provider":"qwen","input_price_usd":1.2,"output_price_usd":6.0,"markup_tier":"medium","effective_markup_percent":0.0,"context_window":262144,"max_output":65536,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.0000012","completion":"0.000006"},"pricing_krw":{"prompt":"0.00162327600","completion":"0.0081163800"},"peak_pricing":null,"pricing_policy":{"version":1,"kind":"token_tiers","tiers":[{"input_tokens_lte":32768,"input_price_usd_per_m":1.2,"output_price_usd_per_m":6.0},{"input_tokens_lte":131072,"input_price_usd_per_m":2.4,"output_price_usd_per_m":12.0},{"input_tokens_lte":262144,"input_price_usd_per_m":3.0,"output_price_usd_per_m":15.0}]},"pricing_tiers":[{"input_tokens_lte":32768,"input_price_usd_per_m":1.2,"output_price_usd_per_m":6.0},{"input_tokens_lte":131072,"input_price_usd_per_m":2.4,"output_price_usd_per_m":12.0},{"input_tokens_lte":262144,"input_price_usd_per_m":3.0,"output_price_usd_per_m":15.0}],"pricing_variants":[]},{"provider":"deepinfra","input_price_usd":1.2,"output_price_usd":6.0,"markup_tier":"medium","effective_markup_percent":0.0,"context_window":256000,"max_output":32768,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.0000012","completion":"0.000006"},"pricing_krw":{"prompt":"0.00162327600","completion":"0.0081163800"},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text"],"output_modalities":["text"],"description":"Qwen3-Max is a Qwen model for general dialogue, document understanding, and text generation. For this Max variant, the catalog lists a 262,144-token context window and up to 65,536 output tokens.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"qwen3-next-80b-a3b-instruct","object":"model","created":0,"owned_by":"pleum","provider":"deepinfra","display_name":"Qwen3 Next 80B A3B","modality":"text","price_unit":"token","input_price_usd":0.09,"output_price_usd":1.1,"markup_tier":"high","effective_markup_percent":0.0,"context_window":262144,"max_output":32768,"is_active":true,"operations":["chat.generate"],"maker":"Qwen","context_length":262144,"max_output_tokens":32768,"architecture":{"input_modalities":["text"],"output_modalities":["text"]},"supported_parameters":["temperature","max_tokens","top_p","stop","seed","frequency_penalty","presence_penalty","tools","tool_choice","response_format","parallel_tool_calls","logit_bias","stream"],"supports_thinking":false,"thinking_forced":false,"pricing":{"prompt":"0.00000009","completion":"0.0000011"},"pricing_krw":{"prompt":"0.000121745700","completion":"0.00148800300"},"pricing_tiers":[],"pricing_variants":[],"providers":[{"provider":"deepinfra","input_price_usd":0.09,"output_price_usd":1.1,"markup_tier":"high","effective_markup_percent":0.0,"context_window":262144,"max_output":32768,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.00000009","completion":"0.0000011"},"pricing_krw":{"prompt":"0.000121745700","completion":"0.00148800300"},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]},{"provider":"qwen","input_price_usd":0.15,"output_price_usd":1.2,"markup_tier":"high","effective_markup_percent":0.0,"context_window":131072,"max_output":32768,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.00000015","completion":"0.0000012"},"pricing_krw":{"prompt":"0.000202909500","completion":"0.00162327600"},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text"],"output_modalities":["text"],"description":"Qwen3 Next 80B A3B is the instruct variant of an 80B-parameter (~3B active) MoE lightweight model with a 131,072-token context at $0.15 input / $1.20 output per 1M tokens.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"qwen-flash-character","object":"model","created":0,"owned_by":"pleum","provider":"qwen","display_name":"Qwen Flash Character","modality":"text","price_unit":"token","input_price_usd":0.05,"output_price_usd":0.4,"markup_tier":"high","effective_markup_percent":0.0,"context_window":32768,"max_output":32768,"is_active":true,"operations":["chat.generate"],"maker":"Qwen","context_length":32768,"max_output_tokens":32768,"architecture":{"input_modalities":["text"],"output_modalities":["text"]},"supported_parameters":["temperature","max_tokens","top_p","stop","seed","frequency_penalty","presence_penalty","tools","tool_choice","response_format","parallel_tool_calls","logit_bias","stream"],"supports_thinking":false,"thinking_forced":false,"pricing":{"prompt":"0.00000005","completion":"0.0000004"},"pricing_krw":{"prompt":"0.000067636500","completion":"0.00054109200"},"pricing_tiers":[{"input_tokens_lte":32768,"input_price_usd_per_m":0.05,"output_price_usd_per_m":0.4,"cache_read_price_usd_per_m":0.01}],"pricing_variants":[],"providers":[{"provider":"qwen","input_price_usd":0.05,"output_price_usd":0.4,"markup_tier":"high","effective_markup_percent":0.0,"context_window":32768,"max_output":32768,"cache_read_usd":0.01,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.00000005","completion":"0.0000004"},"pricing_krw":{"prompt":"0.000067636500","completion":"0.00054109200"},"peak_pricing":null,"pricing_policy":{"version":1,"kind":"token_tiers","tiers":[{"input_tokens_lte":32768,"input_price_usd_per_m":0.05,"output_price_usd_per_m":0.4,"cache_read_price_usd_per_m":0.01}]},"pricing_tiers":[{"input_tokens_lte":32768,"input_price_usd_per_m":0.05,"output_price_usd_per_m":0.4,"cache_read_price_usd_per_m":0.01}],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text"],"output_modalities":["text"],"description":"Qwen Flash Character is Alibaba Cloud Model Studio's international low-latency text model for character dialogue. The Singapore-region table lists 32,768 context and maximum output tokens, with $0.05 input, $0.40 output, and $0.01 cached reads per 1M tokens.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"qwen3-next-80b-a3b-thinking","object":"model","created":0,"owned_by":"pleum","provider":"qwen","display_name":"Qwen3 Next 80B A3B Thinking","modality":"text","price_unit":"token","input_price_usd":0.15,"output_price_usd":1.2,"markup_tier":"high","effective_markup_percent":0.0,"context_window":131072,"max_output":32768,"is_active":true,"operations":["chat.generate"],"maker":"Qwen","context_length":131072,"max_output_tokens":32768,"architecture":{"input_modalities":["text"],"output_modalities":["text"]},"supported_parameters":["temperature","max_tokens","top_p","stop","seed","frequency_penalty","presence_penalty","tools","tool_choice","response_format","parallel_tool_calls","logit_bias","stream"],"supports_thinking":false,"thinking_forced":false,"pricing":{"prompt":"0.00000015","completion":"0.0000012"},"pricing_krw":{"prompt":"0.000202909500","completion":"0.00162327600"},"pricing_tiers":[],"pricing_variants":[],"providers":[{"provider":"qwen","input_price_usd":0.15,"output_price_usd":1.2,"markup_tier":"high","effective_markup_percent":0.0,"context_window":131072,"max_output":32768,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.00000015","completion":"0.0000012"},"pricing_krw":{"prompt":"0.000202909500","completion":"0.00162327600"},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text"],"output_modalities":["text"],"description":"Qwen3 Next 80B A3B Thinking is the reasoning (thinking) variant of the same 80B MoE lightweight model, performing step-by-step reasoning over a 131,072-token context at the same price as the instruct variant.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"qwen3.5-flash","object":"model","created":0,"owned_by":"pleum","provider":"qwen","display_name":"Qwen3.5 Flash","modality":"text","price_unit":"token","input_price_usd":0.1,"output_price_usd":0.4,"markup_tier":"high","effective_markup_percent":0.0,"context_window":1000000,"max_output":65536,"is_active":true,"operations":["chat.generate"],"maker":"Qwen","context_length":1000000,"max_output_tokens":65536,"architecture":{"input_modalities":["text"],"output_modalities":["text"]},"supported_parameters":["temperature","max_tokens","top_p","stop","seed","frequency_penalty","presence_penalty","tools","tool_choice","response_format","parallel_tool_calls","logit_bias","stream","reasoning_effort"],"supports_thinking":true,"thinking_forced":false,"pricing":{"prompt":"0.0000001","completion":"0.0000004"},"pricing_krw":{"prompt":"0.00013527300","completion":"0.00054109200"},"pricing_tiers":[],"pricing_variants":[],"providers":[{"provider":"qwen","input_price_usd":0.1,"output_price_usd":0.4,"markup_tier":"high","effective_markup_percent":0.0,"context_window":1000000,"max_output":65536,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.0000001","completion":"0.0000004"},"pricing_krw":{"prompt":"0.00013527300","completion":"0.00054109200"},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text"],"output_modalities":["text"],"description":"Within the Qwen3.5 lineup, Qwen3.5 Flash is intended for understanding visual inputs such as images and documents and returning text. PleumRouter catalogs this Flash entry with up to 1,000,000 context tokens and 65,536 output tokens.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"qwq-plus","object":"model","created":0,"owned_by":"pleum","provider":"qwen","display_name":"QwQ Plus","modality":"text","price_unit":"token","input_price_usd":0.8,"output_price_usd":2.4,"markup_tier":"medium","effective_markup_percent":0.0,"context_window":131072,"max_output":32768,"is_active":true,"operations":["chat.generate"],"maker":"Qwen","context_length":131072,"max_output_tokens":32768,"architecture":{"input_modalities":["text"],"output_modalities":["text"]},"supported_parameters":["temperature","max_tokens","top_p","stop","seed","frequency_penalty","presence_penalty","tools","tool_choice","response_format","parallel_tool_calls","logit_bias","stream"],"supports_thinking":false,"thinking_forced":false,"pricing":{"prompt":"0.0000008","completion":"0.0000024"},"pricing_krw":{"prompt":"0.00108218400","completion":"0.00324655200"},"pricing_tiers":[],"pricing_variants":[],"providers":[{"provider":"qwen","input_price_usd":0.8,"output_price_usd":2.4,"markup_tier":"medium","effective_markup_percent":0.0,"context_window":131072,"max_output":32768,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.0000008","completion":"0.0000024"},"pricing_krw":{"prompt":"0.00108218400","completion":"0.00324655200"},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text"],"output_modalities":["text"],"description":"QwQ Plus is a Qwen model for multi-step analysis and reasoning. Its cataloged standard profile provides 131,072 tokens of context with a maximum output of 32,768 tokens.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"qwen-long-latest","object":"model","created":0,"owned_by":"pleum","provider":"qwen","display_name":"Qwen Long","modality":"text","price_unit":"token","input_price_usd":0.072,"output_price_usd":0.287,"markup_tier":"high","effective_markup_percent":0.0,"context_window":10000000,"max_output":32768,"is_active":true,"operations":["chat.generate"],"maker":"Qwen","context_length":10000000,"max_output_tokens":32768,"architecture":{"input_modalities":["text"],"output_modalities":["text"]},"supported_parameters":["temperature","max_tokens","top_p","stop","seed","frequency_penalty","presence_penalty","tools","tool_choice","response_format","parallel_tool_calls","logit_bias","stream"],"supports_thinking":false,"thinking_forced":false,"pricing":{"prompt":"0.000000072","completion":"0.000000287"},"pricing_krw":{"prompt":"0.0000973965600","completion":"0.0003882335100"},"pricing_tiers":[],"pricing_variants":[],"providers":[{"provider":"qwen","input_price_usd":0.072,"output_price_usd":0.287,"markup_tier":"high","effective_markup_percent":0.0,"context_window":10000000,"max_output":32768,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.000000072","completion":"0.000000287"},"pricing_krw":{"prompt":"0.0000973965600","completion":"0.0003882335100"},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text"],"output_modalities":["text"],"description":"Qwen Long is a Qwen model for general dialogue, document understanding, and text generation. Its cataloged standard profile provides 10,000,000 tokens of context with a maximum output of 32,768 tokens.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"qwen-plus-character-ja","object":"model","created":0,"owned_by":"pleum","provider":"qwen","display_name":"Qwen Plus Character Japanese","modality":"text","price_unit":"token","input_price_usd":0.5,"output_price_usd":1.4,"markup_tier":"medium","effective_markup_percent":0.0,"context_window":8192,"max_output":4096,"is_active":true,"operations":["chat.generate"],"maker":"Qwen","context_length":8192,"max_output_tokens":4096,"architecture":{"input_modalities":["text"],"output_modalities":["text"]},"supported_parameters":["temperature","max_tokens","top_p","stop","seed","frequency_penalty","presence_penalty","tools","tool_choice","response_format","parallel_tool_calls","logit_bias","stream"],"supports_thinking":false,"thinking_forced":false,"pricing":{"prompt":"0.0000005","completion":"0.0000014"},"pricing_krw":{"prompt":"0.00067636500","completion":"0.00189382200"},"pricing_tiers":[],"pricing_variants":[],"providers":[{"provider":"qwen","input_price_usd":0.5,"output_price_usd":1.4,"markup_tier":"medium","effective_markup_percent":0.0,"context_window":8192,"max_output":4096,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.0000005","completion":"0.0000014"},"pricing_krw":{"prompt":"0.00067636500","completion":"0.00189382200"},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text"],"output_modalities":["text"],"description":"Qwen Plus Character Japanese is Alibaba Cloud Model Studio's international text model tuned for Japanese character dialogue. The Singapore-region table lists 8,192 context tokens, 4,096 maximum output tokens, and $0.50 input / $1.40 output per 1M tokens.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"qwen3-235b-a22b","object":"model","created":0,"owned_by":"pleum","provider":"qwen","display_name":"Qwen3 235B","modality":"text","price_unit":"token","input_price_usd":0.7,"output_price_usd":2.8,"markup_tier":"medium","effective_markup_percent":0.0,"context_window":262144,"max_output":16384,"is_active":true,"operations":["chat.generate"],"maker":"Qwen","context_length":262144,"max_output_tokens":16384,"architecture":{"input_modalities":["text"],"output_modalities":["text"]},"supported_parameters":["temperature","max_tokens","top_p","stop","seed","frequency_penalty","presence_penalty","tools","tool_choice","response_format","parallel_tool_calls","logit_bias","stream","reasoning_effort"],"supports_thinking":true,"thinking_forced":false,"pricing":{"prompt":"0.0000007","completion":"0.0000028"},"pricing_krw":{"prompt":"0.00094691100","completion":"0.00378764400"},"pricing_tiers":[],"pricing_variants":[],"providers":[{"provider":"qwen","input_price_usd":0.7,"output_price_usd":2.8,"markup_tier":"medium","effective_markup_percent":0.0,"context_window":262144,"max_output":16384,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.0000007","completion":"0.0000028"},"pricing_krw":{"prompt":"0.00094691100","completion":"0.00378764400"},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text"],"output_modalities":["text"],"description":"Qwen3 235B is a Qwen model for general dialogue, document understanding, and text generation. The public catalog limits for the 235B-class release are 131,072 context tokens and 16,384 output tokens.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"qwen3-vl-235b-a22b-instruct","object":"model","created":0,"owned_by":"pleum","provider":"deepinfra","display_name":"Qwen3 VL 235B A22B","modality":"text","price_unit":"token","input_price_usd":0.2,"output_price_usd":0.88,"markup_tier":"high","effective_markup_percent":0.0,"context_window":262144,"max_output":32768,"is_active":true,"operations":["chat.generate"],"maker":"Qwen","context_length":262144,"max_output_tokens":32768,"architecture":{"input_modalities":["text","image"],"output_modalities":["text"]},"supported_parameters":["temperature","max_tokens","top_p","stop","seed","frequency_penalty","presence_penalty","tools","tool_choice","response_format","parallel_tool_calls","logit_bias","stream"],"supports_thinking":false,"thinking_forced":false,"pricing":{"prompt":"0.0000002","completion":"0.00000088"},"pricing_krw":{"prompt":"0.00027054600","completion":"0.001190402400"},"pricing_tiers":[],"pricing_variants":[],"providers":[{"provider":"deepinfra","input_price_usd":0.2,"output_price_usd":0.88,"markup_tier":"high","effective_markup_percent":0.0,"context_window":262144,"max_output":32768,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.0000002","completion":"0.00000088"},"pricing_krw":{"prompt":"0.00027054600","completion":"0.001190402400"},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]},{"provider":"qwen","input_price_usd":0.4,"output_price_usd":1.6,"markup_tier":"medium","effective_markup_percent":0.0,"context_window":131072,"max_output":32768,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.0000004","completion":"0.0000016"},"pricing_krw":{"prompt":"0.00054109200","completion":"0.00216436800"},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text","image"],"output_modalities":["text"],"description":"Qwen3 VL 235B A22B is a 235B-parameter (22B active) MoE vision-language model that accepts text and images through chat extensions and generates text over a 131,072-token context.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"qwen3.6-35b-a3b","object":"model","created":0,"owned_by":"pleum","provider":"deepinfra","display_name":"Qwen3.6 35B","modality":"text","price_unit":"token","input_price_usd":0.1,"output_price_usd":0.95,"markup_tier":"high","effective_markup_percent":0.0,"context_window":262144,"max_output":81920,"is_active":true,"operations":["chat.generate"],"maker":"Qwen","context_length":262144,"max_output_tokens":81920,"architecture":{"input_modalities":["text"],"output_modalities":["text"]},"supported_parameters":["temperature","max_tokens","top_p","stop","seed","frequency_penalty","presence_penalty","tools","tool_choice","response_format","parallel_tool_calls","logit_bias","stream"],"supports_thinking":false,"thinking_forced":false,"pricing":{"prompt":"0.0000001","completion":"0.00000095"},"pricing_krw":{"prompt":"0.00013527300","completion":"0.001285093500"},"pricing_tiers":[],"pricing_variants":[],"providers":[{"provider":"deepinfra","input_price_usd":0.1,"output_price_usd":0.95,"markup_tier":"high","effective_markup_percent":0.0,"context_window":262144,"max_output":32768,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.0000001","completion":"0.00000095"},"pricing_krw":{"prompt":"0.00013527300","completion":"0.001285093500"},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]},{"provider":"qwen","input_price_usd":0.375,"output_price_usd":2.25,"markup_tier":"high","effective_markup_percent":0.0,"context_window":262144,"max_output":81920,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.000000375","completion":"0.00000225"},"pricing_krw":{"prompt":"0.0005072737500","completion":"0.003043642500"},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text"],"output_modalities":["text"],"description":"Qwen positions Qwen3.6 35B in the Qwen3.6 family for understanding visual inputs such as images and documents and returning text. PleumRouter catalogs this 35B-class entry with up to 262,144 context tokens and 81,920 output tokens.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"qwen3.6-27b","object":"model","created":0,"owned_by":"pleum","provider":"deepinfra","display_name":"Qwen3.6 27B","modality":"text","price_unit":"token","input_price_usd":0.32,"output_price_usd":3.2,"markup_tier":"high","effective_markup_percent":0.0,"context_window":262144,"max_output":81920,"is_active":true,"operations":["chat.generate"],"maker":"Qwen","context_length":262144,"max_output_tokens":81920,"architecture":{"input_modalities":["text"],"output_modalities":["text"]},"supported_parameters":["temperature","max_tokens","top_p","stop","seed","frequency_penalty","presence_penalty","tools","tool_choice","response_format","parallel_tool_calls","logit_bias","stream","reasoning_effort"],"supports_thinking":true,"thinking_forced":false,"pricing":{"prompt":"0.00000032","completion":"0.0000032"},"pricing_krw":{"prompt":"0.000432873600","completion":"0.00432873600"},"pricing_tiers":[],"pricing_variants":[],"providers":[{"provider":"deepinfra","input_price_usd":0.32,"output_price_usd":3.2,"markup_tier":"high","effective_markup_percent":0.0,"context_window":262144,"max_output":32768,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.00000032","completion":"0.0000032"},"pricing_krw":{"prompt":"0.000432873600","completion":"0.00432873600"},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]},{"provider":"groq","input_price_usd":0.6,"output_price_usd":3.0,"markup_tier":"high","effective_markup_percent":0.0,"context_window":131072,"max_output":16384,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.0000006","completion":"0.000003"},"pricing_krw":{"prompt":"0.00081163800","completion":"0.0040581900"},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]},{"provider":"qwen","input_price_usd":0.6,"output_price_usd":3.6,"markup_tier":"high","effective_markup_percent":0.0,"context_window":262144,"max_output":81920,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.0000006","completion":"0.0000036"},"pricing_krw":{"prompt":"0.00081163800","completion":"0.00486982800"},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text"],"output_modalities":["text"],"description":"Qwen positions Qwen3.6 27B in the Qwen3.6 family for understanding visual inputs such as images and documents and returning text. Its cataloged 27B-class profile provides 262,144 tokens of context with a maximum output of 81,920 tokens.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"qwen-flash","object":"model","created":0,"owned_by":"pleum","provider":"qwen","display_name":"Qwen-Flash","modality":"text","price_unit":"token","input_price_usd":0.05,"output_price_usd":0.4,"markup_tier":"high","effective_markup_percent":0.0,"context_window":1000000,"max_output":32768,"is_active":true,"operations":["chat.generate"],"maker":"Qwen","context_length":1000000,"max_output_tokens":32768,"architecture":{"input_modalities":["text"],"output_modalities":["text"]},"supported_parameters":["temperature","max_tokens","top_p","stop","seed","frequency_penalty","presence_penalty","tools","tool_choice","response_format","parallel_tool_calls","logit_bias","stream"],"supports_thinking":false,"thinking_forced":false,"pricing":{"prompt":"0.00000005","completion":"0.0000004"},"pricing_krw":{"prompt":"0.000067636500","completion":"0.00054109200"},"pricing_tiers":[{"input_tokens_lte":256000,"input_price_usd_per_m":0.05,"output_price_usd_per_m":0.4},{"input_tokens_lte":1000000,"input_price_usd_per_m":0.25,"output_price_usd_per_m":2.0}],"pricing_variants":[],"providers":[{"provider":"qwen","input_price_usd":0.05,"output_price_usd":0.4,"markup_tier":"high","effective_markup_percent":0.0,"context_window":1000000,"max_output":32768,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.00000005","completion":"0.0000004"},"pricing_krw":{"prompt":"0.000067636500","completion":"0.00054109200"},"peak_pricing":null,"pricing_policy":{"version":1,"kind":"token_tiers","tiers":[{"input_tokens_lte":256000,"input_price_usd_per_m":0.05,"output_price_usd_per_m":0.4},{"input_tokens_lte":1000000,"input_price_usd_per_m":0.25,"output_price_usd_per_m":2.0}]},"pricing_tiers":[{"input_tokens_lte":256000,"input_price_usd_per_m":0.05,"output_price_usd_per_m":0.4},{"input_tokens_lte":1000000,"input_price_usd_per_m":0.25,"output_price_usd_per_m":2.0}],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text"],"output_modalities":["text"],"description":"Qwen-Flash is a Qwen model for general dialogue, document understanding, and text generation. Its cataloged Flash profile provides 1,000,000 tokens of context with a maximum output of 32,768 tokens.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"qwen3.5-35b-a3b","object":"model","created":0,"owned_by":"pleum","provider":"deepinfra","display_name":"Qwen3.5 35B","modality":"text","price_unit":"token","input_price_usd":0.14,"output_price_usd":1.0,"markup_tier":"high","effective_markup_percent":0.0,"context_window":262144,"max_output":81920,"is_active":true,"operations":["chat.generate"],"maker":"Qwen","context_length":262144,"max_output_tokens":81920,"architecture":{"input_modalities":["text"],"output_modalities":["text"]},"supported_parameters":["temperature","max_tokens","top_p","stop","seed","frequency_penalty","presence_penalty","tools","tool_choice","response_format","parallel_tool_calls","logit_bias","stream"],"supports_thinking":false,"thinking_forced":false,"pricing":{"prompt":"0.00000014","completion":"0.000001"},"pricing_krw":{"prompt":"0.000189382200","completion":"0.0013527300"},"pricing_tiers":[],"pricing_variants":[],"providers":[{"provider":"deepinfra","input_price_usd":0.14,"output_price_usd":1.0,"markup_tier":"high","effective_markup_percent":0.0,"context_window":262144,"max_output":32768,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.00000014","completion":"0.000001"},"pricing_krw":{"prompt":"0.000189382200","completion":"0.0013527300"},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]},{"provider":"qwen","input_price_usd":0.25,"output_price_usd":2.0,"markup_tier":"high","effective_markup_percent":0.0,"context_window":262144,"max_output":81920,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.00000025","completion":"0.000002"},"pricing_krw":{"prompt":"0.000338182500","completion":"0.0027054600"},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text"],"output_modalities":["text"],"description":"Within the Qwen3.5 lineup, Qwen3.5 35B is intended for understanding visual inputs such as images and documents and returning text. The public catalog limits for the 35B-class release are 262,144 context tokens and 81,920 output tokens.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"qwen3-coder-plus","object":"model","created":0,"owned_by":"pleum","provider":"qwen","display_name":"Qwen3-Coder-Plus","modality":"text","price_unit":"token","input_price_usd":1.0,"output_price_usd":5.0,"markup_tier":"medium","effective_markup_percent":0.0,"context_window":1000000,"max_output":65536,"is_active":true,"operations":["chat.generate"],"maker":"Qwen","context_length":1000000,"max_output_tokens":65536,"architecture":{"input_modalities":["text"],"output_modalities":["text"]},"supported_parameters":["temperature","max_tokens","top_p","stop","seed","frequency_penalty","presence_penalty","tools","tool_choice","response_format","parallel_tool_calls","logit_bias","stream"],"supports_thinking":false,"thinking_forced":false,"pricing":{"prompt":"0.000001","completion":"0.000005"},"pricing_krw":{"prompt":"0.0013527300","completion":"0.0067636500"},"pricing_tiers":[{"input_tokens_lte":32768,"input_price_usd_per_m":1.0,"output_price_usd_per_m":5.0},{"input_tokens_lte":131072,"input_price_usd_per_m":1.8,"output_price_usd_per_m":9.0},{"input_tokens_lte":262144,"input_price_usd_per_m":3.0,"output_price_usd_per_m":15.0},{"input_tokens_lte":1000000,"input_price_usd_per_m":6.0,"output_price_usd_per_m":60.0}],"pricing_variants":[],"providers":[{"provider":"qwen","input_price_usd":1.0,"output_price_usd":5.0,"markup_tier":"medium","effective_markup_percent":0.0,"context_window":1000000,"max_output":65536,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.000001","completion":"0.000005"},"pricing_krw":{"prompt":"0.0013527300","completion":"0.0067636500"},"peak_pricing":null,"pricing_policy":{"version":1,"kind":"token_tiers","tiers":[{"input_tokens_lte":32768,"input_price_usd_per_m":1.0,"output_price_usd_per_m":5.0},{"input_tokens_lte":131072,"input_price_usd_per_m":1.8,"output_price_usd_per_m":9.0},{"input_tokens_lte":262144,"input_price_usd_per_m":3.0,"output_price_usd_per_m":15.0},{"input_tokens_lte":1000000,"input_price_usd_per_m":6.0,"output_price_usd_per_m":60.0}]},"pricing_tiers":[{"input_tokens_lte":32768,"input_price_usd_per_m":1.0,"output_price_usd_per_m":5.0},{"input_tokens_lte":131072,"input_price_usd_per_m":1.8,"output_price_usd_per_m":9.0},{"input_tokens_lte":262144,"input_price_usd_per_m":3.0,"output_price_usd_per_m":15.0},{"input_tokens_lte":1000000,"input_price_usd_per_m":6.0,"output_price_usd_per_m":60.0}],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text"],"output_modalities":["text"],"description":"Within the Qwen3 Coder lineup, Qwen3-Coder-Plus is intended for code generation, software engineering, and tool-driven agent work. For this standard variant, the catalog lists a 1,000,000-token context window and up to 65,536 output tokens.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"qwen3.5-27b","object":"model","created":0,"owned_by":"pleum","provider":"deepinfra","display_name":"Qwen3.5 27B","modality":"text","price_unit":"token","input_price_usd":0.26,"output_price_usd":2.6,"markup_tier":"high","effective_markup_percent":0.0,"context_window":262144,"max_output":81920,"is_active":true,"operations":["chat.generate"],"maker":"Qwen","context_length":262144,"max_output_tokens":81920,"architecture":{"input_modalities":["text"],"output_modalities":["text"]},"supported_parameters":["temperature","max_tokens","top_p","stop","seed","frequency_penalty","presence_penalty","tools","tool_choice","response_format","parallel_tool_calls","logit_bias","stream"],"supports_thinking":false,"thinking_forced":false,"pricing":{"prompt":"0.00000026","completion":"0.0000026"},"pricing_krw":{"prompt":"0.000351709800","completion":"0.00351709800"},"pricing_tiers":[],"pricing_variants":[],"providers":[{"provider":"deepinfra","input_price_usd":0.26,"output_price_usd":2.6,"markup_tier":"high","effective_markup_percent":0.0,"context_window":262144,"max_output":32768,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.00000026","completion":"0.0000026"},"pricing_krw":{"prompt":"0.000351709800","completion":"0.00351709800"},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]},{"provider":"qwen","input_price_usd":0.3,"output_price_usd":2.4,"markup_tier":"high","effective_markup_percent":0.0,"context_window":262144,"max_output":81920,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.0000003","completion":"0.0000024"},"pricing_krw":{"prompt":"0.00040581900","completion":"0.00324655200"},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text"],"output_modalities":["text"],"description":"Within the Qwen3.5 lineup, Qwen3.5 27B is intended for understanding visual inputs such as images and documents and returning text. For this 27B-class variant, the catalog lists a 262,144-token context window and up to 81,920 output tokens.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"qwen3.5-122b-a10b","object":"model","created":0,"owned_by":"pleum","provider":"deepinfra","display_name":"Qwen3.5 122B","modality":"text","price_unit":"token","input_price_usd":0.29,"output_price_usd":2.4,"markup_tier":"high","effective_markup_percent":0.0,"context_window":262144,"max_output":81920,"is_active":true,"operations":["chat.generate"],"maker":"Qwen","context_length":262144,"max_output_tokens":81920,"architecture":{"input_modalities":["text"],"output_modalities":["text"]},"supported_parameters":["temperature","max_tokens","top_p","stop","seed","frequency_penalty","presence_penalty","tools","tool_choice","response_format","parallel_tool_calls","logit_bias","stream"],"supports_thinking":false,"thinking_forced":false,"pricing":{"prompt":"0.00000029","completion":"0.0000024"},"pricing_krw":{"prompt":"0.000392291700","completion":"0.00324655200"},"pricing_tiers":[],"pricing_variants":[],"providers":[{"provider":"deepinfra","input_price_usd":0.29,"output_price_usd":2.4,"markup_tier":"high","effective_markup_percent":0.0,"context_window":262144,"max_output":32768,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.00000029","completion":"0.0000024"},"pricing_krw":{"prompt":"0.000392291700","completion":"0.00324655200"},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]},{"provider":"qwen","input_price_usd":0.4,"output_price_usd":3.2,"markup_tier":"high","effective_markup_percent":0.0,"context_window":262144,"max_output":81920,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.0000004","completion":"0.0000032"},"pricing_krw":{"prompt":"0.00054109200","completion":"0.00432873600"},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text"],"output_modalities":["text"],"description":"Within the Qwen3.5 lineup, Qwen3.5 122B is intended for understanding visual inputs such as images and documents and returning text. Its cataloged 122B-class profile provides 262,144 tokens of context with a maximum output of 81,920 tokens.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"qwen3.5-397b-a17b","object":"model","created":0,"owned_by":"pleum","provider":"deepinfra","display_name":"Qwen3.5 397B","modality":"text","price_unit":"token","input_price_usd":0.45,"output_price_usd":3.0,"markup_tier":"high","effective_markup_percent":0.0,"context_window":262144,"max_output":81920,"is_active":true,"operations":["chat.generate"],"maker":"Qwen","context_length":262144,"max_output_tokens":81920,"architecture":{"input_modalities":["text","image"],"output_modalities":["text"]},"supported_parameters":["temperature","max_tokens","top_p","stop","seed","frequency_penalty","presence_penalty","tools","tool_choice","response_format","parallel_tool_calls","logit_bias","stream"],"supports_thinking":false,"thinking_forced":false,"pricing":{"prompt":"0.00000045","completion":"0.000003"},"pricing_krw":{"prompt":"0.000608728500","completion":"0.0040581900"},"pricing_tiers":[],"pricing_variants":[],"providers":[{"provider":"deepinfra","input_price_usd":0.45,"output_price_usd":3.0,"markup_tier":"high","effective_markup_percent":0.0,"context_window":262144,"max_output":32768,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.00000045","completion":"0.000003"},"pricing_krw":{"prompt":"0.000608728500","completion":"0.0040581900"},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]},{"provider":"together","input_price_usd":0.6,"output_price_usd":3.6,"markup_tier":"medium","effective_markup_percent":0.0,"context_window":262144,"max_output":8192,"cache_read_usd":0.35,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.0000006","completion":"0.0000036"},"pricing_krw":{"prompt":"0.00081163800","completion":"0.00486982800"},"peak_pricing":null,"pricing_policy":{"version":1,"kind":"token_tiers","tiers":[{"input_tokens_lte":262144,"input_price_usd_per_m":0.6,"output_price_usd_per_m":3.6,"cache_read_price_usd_per_m":0.35}]},"pricing_tiers":[{"input_tokens_lte":262144,"input_price_usd_per_m":0.6,"output_price_usd_per_m":3.6,"cache_read_price_usd_per_m":0.35}],"pricing_variants":[]},{"provider":"qwen","input_price_usd":0.6,"output_price_usd":3.6,"markup_tier":"high","effective_markup_percent":0.0,"context_window":262144,"max_output":81920,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.0000006","completion":"0.0000036"},"pricing_krw":{"prompt":"0.00081163800","completion":"0.00486982800"},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text","image"],"output_modalities":["text"],"description":"Within the Qwen3.5 lineup, Qwen3.5 397B is intended for understanding visual inputs such as images and documents and returning text. The public catalog limits for the 397B-class release are 262,144 context tokens and 81,920 output tokens.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"nousresearch/hermes-4-70b","object":"model","created":0,"owned_by":"pleum","provider":"nousresearch","display_name":"Hermes 4 70B","modality":"text","price_unit":"token","input_price_usd":0.13,"output_price_usd":0.4,"markup_tier":"high","effective_markup_percent":0.0,"context_window":131072,"max_output":16384,"is_active":true,"operations":["chat.generate"],"maker":"NousResearch","context_length":131072,"max_output_tokens":16384,"architecture":{"input_modalities":["text"],"output_modalities":["text"]},"supported_parameters":["temperature","max_tokens","top_p","stop","seed","frequency_penalty","presence_penalty","tools","tool_choice","response_format","parallel_tool_calls","logit_bias","stream"],"supports_thinking":false,"thinking_forced":false,"pricing":{"prompt":"0.00000013","completion":"0.0000004"},"pricing_krw":{"prompt":"0.000175854900","completion":"0.00054109200"},"pricing_tiers":[],"pricing_variants":[],"providers":[{"provider":"nousresearch","input_price_usd":0.13,"output_price_usd":0.4,"markup_tier":"high","effective_markup_percent":0.0,"context_window":131072,"max_output":16384,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.00000013","completion":"0.0000004"},"pricing_krw":{"prompt":"0.000175854900","completion":"0.00054109200"},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]}],"parameters_b":null,"architecture_class":"dense","license":"llama3","released_at":"2025-09-02","input_modalities":["text"],"output_modalities":["text"],"description":"The Hermes 4 70B release extends NousResearch's Hermes family to general dialogue, document understanding, and text generation. PleumRouter catalogs this 70B-class entry with up to 131,072 context tokens and 16,384 output tokens.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"qwen3-coder-next","object":"model","created":0,"owned_by":"pleum","provider":"qwen","display_name":"Qwen3 Coder Next","modality":"text","price_unit":"token","input_price_usd":0.3,"output_price_usd":1.5,"markup_tier":"high","effective_markup_percent":0.0,"context_window":262144,"max_output":65536,"is_active":true,"operations":["chat.generate"],"maker":"Qwen","context_length":262144,"max_output_tokens":65536,"architecture":{"input_modalities":["text"],"output_modalities":["text"]},"supported_parameters":["temperature","max_tokens","top_p","stop","seed","frequency_penalty","presence_penalty","tools","tool_choice","response_format","parallel_tool_calls","logit_bias","stream"],"supports_thinking":false,"thinking_forced":false,"pricing":{"prompt":"0.0000003","completion":"0.0000015"},"pricing_krw":{"prompt":"0.00040581900","completion":"0.00202909500"},"pricing_tiers":[{"input_tokens_lte":32768,"input_price_usd_per_m":0.3,"output_price_usd_per_m":1.5},{"input_tokens_lte":131072,"input_price_usd_per_m":0.5,"output_price_usd_per_m":2.5},{"input_tokens_lte":262144,"input_price_usd_per_m":0.8,"output_price_usd_per_m":4.0}],"pricing_variants":[],"providers":[{"provider":"qwen","input_price_usd":0.3,"output_price_usd":1.5,"markup_tier":"high","effective_markup_percent":0.0,"context_window":262144,"max_output":65536,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.0000003","completion":"0.0000015"},"pricing_krw":{"prompt":"0.00040581900","completion":"0.00202909500"},"peak_pricing":null,"pricing_policy":{"version":1,"kind":"token_tiers","tiers":[{"input_tokens_lte":32768,"input_price_usd_per_m":0.3,"output_price_usd_per_m":1.5},{"input_tokens_lte":131072,"input_price_usd_per_m":0.5,"output_price_usd_per_m":2.5},{"input_tokens_lte":262144,"input_price_usd_per_m":0.8,"output_price_usd_per_m":4.0}]},"pricing_tiers":[{"input_tokens_lte":32768,"input_price_usd_per_m":0.3,"output_price_usd_per_m":1.5},{"input_tokens_lte":131072,"input_price_usd_per_m":0.5,"output_price_usd_per_m":2.5},{"input_tokens_lte":262144,"input_price_usd_per_m":0.8,"output_price_usd_per_m":4.0}],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text"],"output_modalities":["text"],"description":"Within the Qwen3 Coder lineup, Qwen3 Coder Next is intended for code generation, software engineering, and tool-driven agent work. PleumRouter catalogs this standard entry with up to 262,144 context tokens and 65,536 output tokens.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"glm-5.3","object":"model","created":0,"owned_by":"pleum","provider":"vultr","display_name":"GLM-5.3","modality":"text","price_unit":"token","input_price_usd":0.75,"output_price_usd":3.0,"markup_tier":"medium","effective_markup_percent":0.0,"context_window":1048576,"max_output":1048576,"is_active":true,"operations":["chat.generate"],"maker":"Zhipu","context_length":1048576,"max_output_tokens":1048576,"architecture":{"input_modalities":["text"],"output_modalities":["text"]},"supported_parameters":["temperature","max_tokens","top_p","stop","seed","frequency_penalty","presence_penalty","tools","tool_choice","response_format","parallel_tool_calls","logit_bias","stream","reasoning_effort"],"supports_thinking":true,"thinking_forced":true,"pricing":{"prompt":"0.00000075","completion":"0.000003"},"pricing_krw":{"prompt":"0.001014547500","completion":"0.0040581900"},"pricing_tiers":[],"pricing_variants":[],"providers":[{"provider":"vultr","input_price_usd":0.75,"output_price_usd":3.0,"markup_tier":"medium","effective_markup_percent":0.0,"context_window":1048576,"max_output":1048576,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.00000075","completion":"0.000003"},"pricing_krw":{"prompt":"0.001014547500","completion":"0.0040581900"},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]},{"provider":"deepinfra","input_price_usd":1.2,"output_price_usd":4.0,"markup_tier":"medium","effective_markup_percent":0.0,"context_window":1048576,"max_output":32768,"cache_read_usd":0.12,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.0000012","completion":"0.000004"},"pricing_krw":{"prompt":"0.00162327600","completion":"0.0054109200"},"peak_pricing":null,"pricing_policy":{"version":1,"kind":"token_tiers","tiers":[{"input_tokens_lte":1048576,"input_price_usd_per_m":1.2,"output_price_usd_per_m":4.0,"cache_read_price_usd_per_m":0.12}]},"pricing_tiers":[{"input_tokens_lte":1048576,"input_price_usd_per_m":1.2,"output_price_usd_per_m":4.0,"cache_read_price_usd_per_m":0.12}],"pricing_variants":[]},{"provider":"friendli","input_price_usd":1.4,"output_price_usd":4.4,"markup_tier":"medium","effective_markup_percent":0.0,"context_window":1048576,"max_output":131072,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.0000014","completion":"0.0000044"},"pricing_krw":{"prompt":"0.00189382200","completion":"0.00595201200"},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]},{"provider":"together","input_price_usd":1.4,"output_price_usd":4.4,"markup_tier":"medium","effective_markup_percent":0.0,"context_window":1000000,"max_output":8192,"cache_read_usd":0.26,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.0000014","completion":"0.0000044"},"pricing_krw":{"prompt":"0.00189382200","completion":"0.00595201200"},"peak_pricing":null,"pricing_policy":{"version":1,"kind":"token_tiers","tiers":[{"input_tokens_lte":1000000,"input_price_usd_per_m":1.4,"output_price_usd_per_m":4.4,"cache_read_price_usd_per_m":0.26}]},"pricing_tiers":[{"input_tokens_lte":1000000,"input_price_usd_per_m":1.4,"output_price_usd_per_m":4.4,"cache_read_price_usd_per_m":0.26}],"pricing_variants":[]},{"provider":"glm","input_price_usd":1.4,"output_price_usd":4.4,"markup_tier":"medium","effective_markup_percent":0.0,"context_window":1000000,"max_output":131072,"cache_read_usd":0.26,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.0000014","completion":"0.0000044"},"pricing_krw":{"prompt":"0.00189382200","completion":"0.00595201200"},"peak_pricing":null,"pricing_policy":{"version":1,"kind":"token_tiers","tiers":[{"input_tokens_lte":1000000,"input_price_usd_per_m":1.4,"output_price_usd_per_m":4.4,"cache_read_price_usd_per_m":0.26}]},"pricing_tiers":[{"input_tokens_lte":1000000,"input_price_usd_per_m":1.4,"output_price_usd_per_m":4.4,"cache_read_price_usd_per_m":0.26}],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text"],"output_modalities":["text"],"description":"GLM-5.3 is Z.AI's latest GLM-family text reasoning model for general dialogue and agentic work. Its official model page lists up to 1,000,000 context tokens and 131,072 output tokens.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"nousresearch/hermes-4-405b","object":"model","created":0,"owned_by":"pleum","provider":"nousresearch","display_name":"Hermes 4 405B","modality":"text","price_unit":"token","input_price_usd":1.0,"output_price_usd":3.0,"markup_tier":"medium","effective_markup_percent":0.0,"context_window":131072,"max_output":16384,"is_active":true,"operations":["chat.generate"],"maker":"NousResearch","context_length":131072,"max_output_tokens":16384,"architecture":{"input_modalities":["text"],"output_modalities":["text"]},"supported_parameters":["temperature","max_tokens","top_p","stop","seed","frequency_penalty","presence_penalty","tools","tool_choice","response_format","parallel_tool_calls","logit_bias","stream"],"supports_thinking":false,"thinking_forced":false,"pricing":{"prompt":"0.000001","completion":"0.000003"},"pricing_krw":{"prompt":"0.0013527300","completion":"0.0040581900"},"pricing_tiers":[],"pricing_variants":[],"providers":[{"provider":"nousresearch","input_price_usd":1.0,"output_price_usd":3.0,"markup_tier":"medium","effective_markup_percent":0.0,"context_window":131072,"max_output":16384,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.000001","completion":"0.000003"},"pricing_krw":{"prompt":"0.0013527300","completion":"0.0040581900"},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]}],"parameters_b":null,"architecture_class":"dense","license":"llama3","released_at":"2025-09-02","input_modalities":["text"],"output_modalities":["text"],"description":"The Hermes 4 405B release extends NousResearch's Hermes family to general dialogue, document understanding, and text generation. Its cataloged 405B-class profile provides 131,072 tokens of context with a maximum output of 16,384 tokens.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"qwen3-coder-flash","object":"model","created":0,"owned_by":"pleum","provider":"qwen","display_name":"Qwen3 Coder Flash","modality":"text","price_unit":"token","input_price_usd":0.3,"output_price_usd":1.5,"markup_tier":"high","effective_markup_percent":0.0,"context_window":1000000,"max_output":65536,"is_active":true,"operations":["chat.generate"],"maker":"Qwen","context_length":1000000,"max_output_tokens":65536,"architecture":{"input_modalities":["text"],"output_modalities":["text"]},"supported_parameters":["temperature","max_tokens","top_p","stop","seed","frequency_penalty","presence_penalty","tools","tool_choice","response_format","parallel_tool_calls","logit_bias","stream"],"supports_thinking":false,"thinking_forced":false,"pricing":{"prompt":"0.0000003","completion":"0.0000015"},"pricing_krw":{"prompt":"0.00040581900","completion":"0.00202909500"},"pricing_tiers":[{"input_tokens_lte":32768,"input_price_usd_per_m":0.3,"output_price_usd_per_m":1.5},{"input_tokens_lte":131072,"input_price_usd_per_m":0.5,"output_price_usd_per_m":2.5},{"input_tokens_lte":262144,"input_price_usd_per_m":0.8,"output_price_usd_per_m":4.0},{"input_tokens_lte":1000000,"input_price_usd_per_m":1.6,"output_price_usd_per_m":9.6}],"pricing_variants":[],"providers":[{"provider":"qwen","input_price_usd":0.3,"output_price_usd":1.5,"markup_tier":"high","effective_markup_percent":0.0,"context_window":1000000,"max_output":65536,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.0000003","completion":"0.0000015"},"pricing_krw":{"prompt":"0.00040581900","completion":"0.00202909500"},"peak_pricing":null,"pricing_policy":{"version":1,"kind":"token_tiers","tiers":[{"input_tokens_lte":32768,"input_price_usd_per_m":0.3,"output_price_usd_per_m":1.5},{"input_tokens_lte":131072,"input_price_usd_per_m":0.5,"output_price_usd_per_m":2.5},{"input_tokens_lte":262144,"input_price_usd_per_m":0.8,"output_price_usd_per_m":4.0},{"input_tokens_lte":1000000,"input_price_usd_per_m":1.6,"output_price_usd_per_m":9.6}]},"pricing_tiers":[{"input_tokens_lte":32768,"input_price_usd_per_m":0.3,"output_price_usd_per_m":1.5},{"input_tokens_lte":131072,"input_price_usd_per_m":0.5,"output_price_usd_per_m":2.5},{"input_tokens_lte":262144,"input_price_usd_per_m":0.8,"output_price_usd_per_m":4.0},{"input_tokens_lte":1000000,"input_price_usd_per_m":1.6,"output_price_usd_per_m":9.6}],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text"],"output_modalities":["text"],"description":"Within the Qwen3 Coder lineup, Qwen3 Coder Flash is intended for code generation, software engineering, and tool-driven agent work. Its active offering profile provides a 1,000,000-token context window with a maximum output of 65,536 tokens.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"glm-5.2","object":"model","created":0,"owned_by":"pleum","provider":"deepinfra","display_name":"GLM-5.2","modality":"text","price_unit":"token","input_price_usd":0.75,"output_price_usd":2.4,"markup_tier":"high","effective_markup_percent":0.0,"context_window":1049000,"max_output":262000,"is_active":true,"operations":["chat.generate"],"maker":"Zhipu","context_length":1049000,"max_output_tokens":262000,"architecture":{"input_modalities":["text"],"output_modalities":["text"]},"supported_parameters":["temperature","max_tokens","top_p","stop","seed","frequency_penalty","presence_penalty","tools","tool_choice","response_format","parallel_tool_calls","logit_bias","stream","reasoning_effort"],"supports_thinking":true,"thinking_forced":false,"pricing":{"prompt":"0.00000075","completion":"0.0000024"},"pricing_krw":{"prompt":"0.001014547500","completion":"0.00324655200"},"pricing_tiers":[],"pricing_variants":[],"providers":[{"provider":"deepinfra","input_price_usd":0.75,"output_price_usd":2.4,"markup_tier":"high","effective_markup_percent":0.0,"context_window":1048576,"max_output":32768,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.00000075","completion":"0.0000024"},"pricing_krw":{"prompt":"0.001014547500","completion":"0.00324655200"},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]},{"provider":"modelark","input_price_usd":1.4,"output_price_usd":4.4,"markup_tier":"medium","effective_markup_percent":0.0,"context_window":1024000,"max_output":128000,"cache_read_usd":0.26,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.0000014","completion":"0.0000044"},"pricing_krw":{"prompt":"0.00189382200","completion":"0.00595201200"},"peak_pricing":null,"pricing_policy":{"version":1,"kind":"token_tiers","tiers":[{"input_tokens_lte":1024000,"input_price_usd_per_m":1.4,"output_price_usd_per_m":4.4,"cache_read_price_usd_per_m":0.26}]},"pricing_tiers":[{"input_tokens_lte":1024000,"input_price_usd_per_m":1.4,"output_price_usd_per_m":4.4,"cache_read_price_usd_per_m":0.26}],"pricing_variants":[]},{"provider":"glm","input_price_usd":1.4,"output_price_usd":4.4,"markup_tier":"medium","effective_markup_percent":0.0,"context_window":1000000,"max_output":131072,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.0000014","completion":"0.0000044"},"pricing_krw":{"prompt":"0.00189382200","completion":"0.00595201200"},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]},{"provider":"friendli","input_price_usd":1.4,"output_price_usd":4.4,"markup_tier":"medium","effective_markup_percent":0.0,"context_window":1048576,"max_output":65536,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.0000014","completion":"0.0000044"},"pricing_krw":{"prompt":"0.00189382200","completion":"0.00595201200"},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]},{"provider":"together","input_price_usd":1.4,"output_price_usd":4.4,"markup_tier":"medium","effective_markup_percent":0.0,"context_window":1000000,"max_output":131072,"cache_read_usd":0.26,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.0000014","completion":"0.0000044"},"pricing_krw":{"prompt":"0.00189382200","completion":"0.00595201200"},"peak_pricing":null,"pricing_policy":{"version":1,"kind":"token_tiers","tiers":[{"input_tokens_lte":1000000,"input_price_usd_per_m":1.4,"output_price_usd_per_m":4.4,"cache_read_price_usd_per_m":0.26}]},"pricing_tiers":[{"input_tokens_lte":1000000,"input_price_usd_per_m":1.4,"output_price_usd_per_m":4.4,"cache_read_price_usd_per_m":0.26}],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text"],"output_modalities":["text"],"description":"The GLM-5.2 release extends Zhipu's GLM-5 family to general dialogue, document understanding, and text generation. Its widest-context catalog profile provides 1,048,576 tokens of context with a maximum output of 65,536 tokens from that same offering.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"glm-5.1","object":"model","created":0,"owned_by":"pleum","provider":"deepinfra","display_name":"GLM-5.1","modality":"text","price_unit":"token","input_price_usd":1.05,"output_price_usd":3.5,"markup_tier":"medium","effective_markup_percent":0.0,"context_window":205000,"max_output":131000,"is_active":true,"operations":["chat.generate"],"maker":"Zhipu","context_length":205000,"max_output_tokens":131000,"architecture":{"input_modalities":["text"],"output_modalities":["text"]},"supported_parameters":["temperature","max_tokens","top_p","stop","seed","frequency_penalty","presence_penalty","tools","tool_choice","response_format","parallel_tool_calls","logit_bias","stream","reasoning_effort"],"supports_thinking":true,"thinking_forced":false,"pricing":{"prompt":"0.00000105","completion":"0.0000035"},"pricing_krw":{"prompt":"0.001420366500","completion":"0.00473455500"},"pricing_tiers":[],"pricing_variants":[],"providers":[{"provider":"deepinfra","input_price_usd":1.05,"output_price_usd":3.5,"markup_tier":"medium","effective_markup_percent":0.0,"context_window":202752,"max_output":32768,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.00000105","completion":"0.0000035"},"pricing_krw":{"prompt":"0.001420366500","completion":"0.00473455500"},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]},{"provider":"glm","input_price_usd":1.4,"output_price_usd":4.4,"markup_tier":"medium","effective_markup_percent":0.0,"context_window":200000,"max_output":131072,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.0000014","completion":"0.0000044"},"pricing_krw":{"prompt":"0.00189382200","completion":"0.00595201200"},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]},{"provider":"friendli","input_price_usd":1.4,"output_price_usd":4.4,"markup_tier":"medium","effective_markup_percent":0.0,"context_window":202752,"max_output":65536,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.0000014","completion":"0.0000044"},"pricing_krw":{"prompt":"0.00189382200","completion":"0.00595201200"},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text"],"output_modalities":["text"],"description":"The GLM-5.1 release extends Zhipu's GLM-5 family to general dialogue, document understanding, and text generation. Its widest-context offering supports a 203,000-token context window and up to 65,536 output tokens together.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"glm-5","object":"model","created":0,"owned_by":"pleum","provider":"deepinfra","display_name":"GLM-5","modality":"text","price_unit":"token","input_price_usd":0.6,"output_price_usd":2.08,"markup_tier":"medium","effective_markup_percent":0.0,"context_window":205000,"max_output":131000,"is_active":true,"operations":["chat.generate"],"maker":"Zhipu","context_length":205000,"max_output_tokens":131000,"architecture":{"input_modalities":["text"],"output_modalities":["text"]},"supported_parameters":["temperature","max_tokens","top_p","stop","seed","frequency_penalty","presence_penalty","tools","tool_choice","response_format","parallel_tool_calls","logit_bias","stream","reasoning_effort"],"supports_thinking":true,"thinking_forced":false,"pricing":{"prompt":"0.0000006","completion":"0.00000208"},"pricing_krw":{"prompt":"0.00081163800","completion":"0.002813678400"},"pricing_tiers":[],"pricing_variants":[],"providers":[{"provider":"deepinfra","input_price_usd":0.6,"output_price_usd":2.08,"markup_tier":"medium","effective_markup_percent":0.0,"context_window":202752,"max_output":32768,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.0000006","completion":"0.00000208"},"pricing_krw":{"prompt":"0.00081163800","completion":"0.002813678400"},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]},{"provider":"glm","input_price_usd":1.0,"output_price_usd":3.2,"markup_tier":"medium","effective_markup_percent":0.0,"context_window":200000,"max_output":131072,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.000001","completion":"0.0000032"},"pricing_krw":{"prompt":"0.0013527300","completion":"0.00432873600"},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text"],"output_modalities":["text"],"description":"The GLM-5 release extends Zhipu's GLM-5 family to general dialogue, document understanding, and text generation. Its widest-context catalog profile supports 205,000 context tokens and a 131,000-token maximum output together.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"glm-4.6","object":"model","created":0,"owned_by":"pleum","provider":"deepinfra","display_name":"GLM-4.6","modality":"text","price_unit":"token","input_price_usd":0.5,"output_price_usd":2.0,"markup_tier":"medium","effective_markup_percent":0.0,"context_window":202752,"max_output":32768,"is_active":true,"operations":["chat.generate"],"maker":"Zhipu","context_length":202752,"max_output_tokens":32768,"architecture":{"input_modalities":["text"],"output_modalities":["text"]},"supported_parameters":["temperature","max_tokens","top_p","stop","seed","frequency_penalty","presence_penalty","tools","tool_choice","response_format","parallel_tool_calls","logit_bias","stream","reasoning_effort"],"supports_thinking":true,"thinking_forced":false,"pricing":{"prompt":"0.0000005","completion":"0.000002"},"pricing_krw":{"prompt":"0.00067636500","completion":"0.0027054600"},"pricing_tiers":[],"pricing_variants":[],"providers":[{"provider":"deepinfra","input_price_usd":0.5,"output_price_usd":2.0,"markup_tier":"medium","effective_markup_percent":0.0,"context_window":202752,"max_output":32768,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.0000005","completion":"0.000002"},"pricing_krw":{"prompt":"0.00067636500","completion":"0.0027054600"},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]},{"provider":"glm","input_price_usd":0.6,"output_price_usd":2.2,"markup_tier":"medium","effective_markup_percent":0.0,"context_window":200000,"max_output":131072,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.0000006","completion":"0.0000022"},"pricing_krw":{"prompt":"0.00081163800","completion":"0.00297600600"},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text"],"output_modalities":["text"],"description":"Zhipu positions GLM-4.6 in the GLM-4.6 family for general dialogue, document understanding, and text generation. For this standard variant, the catalog lists a 200,000-token context window and up to 131,072 output tokens.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"glm-4.7","object":"model","created":0,"owned_by":"pleum","provider":"deepinfra","display_name":"GLM-4.7","modality":"text","price_unit":"token","input_price_usd":0.4,"output_price_usd":1.75,"markup_tier":"medium","effective_markup_percent":0.0,"context_window":256000,"max_output":128000,"is_active":true,"operations":["chat.generate"],"maker":"Zhipu","context_length":256000,"max_output_tokens":128000,"architecture":{"input_modalities":["text"],"output_modalities":["text"]},"supported_parameters":["temperature","max_tokens","top_p","stop","seed","frequency_penalty","presence_penalty","tools","tool_choice","response_format","parallel_tool_calls","logit_bias","stream","reasoning_effort"],"supports_thinking":true,"thinking_forced":false,"pricing":{"prompt":"0.0000004","completion":"0.00000175"},"pricing_krw":{"prompt":"0.00054109200","completion":"0.002367277500"},"pricing_tiers":[],"pricing_variants":[],"providers":[{"provider":"deepinfra","input_price_usd":0.4,"output_price_usd":1.75,"markup_tier":"medium","effective_markup_percent":0.0,"context_window":202752,"max_output":32768,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.0000004","completion":"0.00000175"},"pricing_krw":{"prompt":"0.00054109200","completion":"0.002367277500"},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]},{"provider":"glm","input_price_usd":0.6,"output_price_usd":2.2,"markup_tier":"medium","effective_markup_percent":0.0,"context_window":200000,"max_output":131072,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.0000006","completion":"0.0000022"},"pricing_krw":{"prompt":"0.00081163800","completion":"0.00297600600"},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]},{"provider":"modelark","input_price_usd":0.6,"output_price_usd":2.2,"markup_tier":"medium","effective_markup_percent":0.0,"context_window":256000,"max_output":128000,"cache_read_usd":0.11,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.0000006","completion":"0.0000022"},"pricing_krw":{"prompt":"0.00081163800","completion":"0.00297600600"},"peak_pricing":null,"pricing_policy":{"version":1,"kind":"token_tiers","tiers":[{"input_tokens_lte":256000,"input_price_usd_per_m":0.6,"output_price_usd_per_m":2.2,"cache_read_price_usd_per_m":0.11}]},"pricing_tiers":[{"input_tokens_lte":256000,"input_price_usd_per_m":0.6,"output_price_usd_per_m":2.2,"cache_read_price_usd_per_m":0.11}],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text"],"output_modalities":["text"],"description":"GLM-4.7 applies Zhipu's GLM-4.7 family to general dialogue, document understanding, and text generation. Its widest-context catalog profile supports 256,000 context tokens and a 128,000-token maximum output together.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"glm-4.5-air","object":"model","created":0,"owned_by":"pleum","provider":"glm","display_name":"GLM-4.5-Air","modality":"text","price_unit":"token","input_price_usd":0.2,"output_price_usd":1.1,"markup_tier":"high","effective_markup_percent":0.0,"context_window":131072,"max_output":131072,"is_active":true,"operations":["chat.generate"],"maker":"Zhipu","context_length":131072,"max_output_tokens":131072,"architecture":{"input_modalities":["text"],"output_modalities":["text"]},"supported_parameters":["temperature","max_tokens","top_p","stop","seed","frequency_penalty","presence_penalty","tools","tool_choice","response_format","parallel_tool_calls","logit_bias","stream","reasoning_effort"],"supports_thinking":true,"thinking_forced":false,"pricing":{"prompt":"0.0000002","completion":"0.0000011"},"pricing_krw":{"prompt":"0.00027054600","completion":"0.00148800300"},"pricing_tiers":[],"pricing_variants":[],"providers":[{"provider":"glm","input_price_usd":0.2,"output_price_usd":1.1,"markup_tier":"high","effective_markup_percent":0.0,"context_window":131072,"max_output":98304,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.0000002","completion":"0.0000011"},"pricing_krw":{"prompt":"0.00027054600","completion":"0.00148800300"},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text"],"output_modalities":["text"],"description":"GLM-4.5-Air is the lightweight, cost-effective GLM-4.5 variant for reasoning, coding, and agent-oriented work. It supports 131,072 context tokens and up to 98,304 output tokens.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"glm-4.7-flash","object":"model","created":0,"owned_by":"pleum","provider":"glm","display_name":"GLM-4.7-Flash","modality":"text","price_unit":"token","input_price_usd":0.0,"output_price_usd":0.0,"markup_tier":"high","effective_markup_percent":0.0,"context_window":202752,"max_output":32768,"is_active":true,"operations":["chat.generate"],"maker":"Zhipu","context_length":202752,"max_output_tokens":32768,"architecture":{"input_modalities":["text"],"output_modalities":["text"]},"supported_parameters":["temperature","max_tokens","top_p","stop","seed","frequency_penalty","presence_penalty","tools","tool_choice","response_format","parallel_tool_calls","logit_bias","stream"],"supports_thinking":false,"thinking_forced":false,"pricing":{"prompt":"0.00","completion":"0.00"},"pricing_krw":{"prompt":"0.000000","completion":"0.000000"},"pricing_tiers":[],"pricing_variants":[],"providers":[{"provider":"glm","input_price_usd":0.0,"output_price_usd":0.0,"markup_tier":"high","effective_markup_percent":0.0,"context_window":200000,"max_output":131072,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.00","completion":"0.00"},"pricing_krw":{"prompt":"0.000000","completion":"0.000000"},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]},{"provider":"deepinfra","input_price_usd":0.06,"output_price_usd":0.4,"markup_tier":"high","effective_markup_percent":0.0,"context_window":202752,"max_output":32768,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.00000006","completion":"0.0000004"},"pricing_krw":{"prompt":"0.000081163800","completion":"0.00054109200"},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text"],"output_modalities":["text"],"description":"GLM-4.7-Flash applies Zhipu's GLM-4.7 family to general dialogue, document understanding, and text generation. For this Flash variant, the catalog lists a 202,752-token context window and up to 4,096 output tokens.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"glm-4.5-flash","object":"model","created":0,"owned_by":"pleum","provider":"glm","display_name":"GLM-4.5 Flash","modality":"text","price_unit":"token","input_price_usd":0.0,"output_price_usd":0.0,"markup_tier":"high","effective_markup_percent":0.0,"context_window":131072,"max_output":98304,"is_active":true,"operations":["chat.generate"],"maker":"Zhipu","context_length":131072,"max_output_tokens":98304,"architecture":{"input_modalities":["text"],"output_modalities":["text"]},"supported_parameters":["temperature","max_tokens","top_p","stop","seed","frequency_penalty","presence_penalty","tools","tool_choice","response_format","parallel_tool_calls","logit_bias","stream"],"supports_thinking":false,"thinking_forced":false,"pricing":{"prompt":"0.00","completion":"0.00"},"pricing_krw":{"prompt":"0.000000","completion":"0.000000"},"pricing_tiers":[],"pricing_variants":[],"providers":[{"provider":"glm","input_price_usd":0.0,"output_price_usd":0.0,"markup_tier":"high","effective_markup_percent":0.0,"context_window":131072,"max_output":98304,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.00","completion":"0.00"},"pricing_krw":{"prompt":"0.000000","completion":"0.000000"},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text"],"output_modalities":["text"],"description":"GLM-4.5-Flash is Z.AI's free long-context text model, served through OpenAI-compatible Chat Completions.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"glm-4.5v","object":"model","created":0,"owned_by":"pleum","provider":"glm","display_name":"GLM-4.5V (Vision)","modality":"text","price_unit":"token","input_price_usd":0.6,"output_price_usd":1.8,"markup_tier":"medium","effective_markup_percent":0.0,"context_window":65536,"max_output":16384,"is_active":true,"operations":["chat.generate"],"maker":"Zhipu","context_length":65536,"max_output_tokens":16384,"architecture":{"input_modalities":["text","image","video"],"output_modalities":["text"]},"supported_parameters":["temperature","max_tokens","top_p","stop","seed","frequency_penalty","presence_penalty","tools","tool_choice","response_format","parallel_tool_calls","logit_bias","stream","reasoning_effort"],"supports_thinking":true,"thinking_forced":true,"pricing":{"prompt":"0.0000006","completion":"0.0000018"},"pricing_krw":{"prompt":"0.00081163800","completion":"0.00243491400"},"pricing_tiers":[],"pricing_variants":[],"providers":[{"provider":"glm","input_price_usd":0.6,"output_price_usd":1.8,"markup_tier":"medium","effective_markup_percent":0.0,"context_window":65536,"max_output":16384,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.0000006","completion":"0.0000018"},"pricing_krw":{"prompt":"0.00081163800","completion":"0.00243491400"},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text","image","video"],"output_modalities":["text"],"description":"Within Zhipu's GLM-4.5 lineup, GLM-4.5V (Vision) is intended for understanding visual inputs such as images and documents and returning text. Its cataloged standard profile provides 65,536 tokens of context with a maximum output of 16,384 tokens.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"glm-4.5-x","object":"model","created":0,"owned_by":"pleum","provider":"glm","display_name":"GLM-4.5-X","modality":"text","price_unit":"token","input_price_usd":2.2,"output_price_usd":8.9,"markup_tier":"low","effective_markup_percent":0.0,"context_window":131072,"max_output":98304,"is_active":true,"operations":["chat.generate"],"maker":"Zhipu","context_length":131072,"max_output_tokens":98304,"architecture":{"input_modalities":["text"],"output_modalities":["text"]},"supported_parameters":["temperature","max_tokens","top_p","stop","seed","frequency_penalty","presence_penalty","tools","tool_choice","response_format","parallel_tool_calls","logit_bias","stream"],"supports_thinking":false,"thinking_forced":false,"pricing":{"prompt":"0.0000022","completion":"0.0000089"},"pricing_krw":{"prompt":"0.00297600600","completion":"0.01203929700"},"pricing_tiers":[],"pricing_variants":[],"providers":[{"provider":"glm","input_price_usd":2.2,"output_price_usd":8.9,"markup_tier":"low","effective_markup_percent":0.0,"context_window":131072,"max_output":98304,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.0000022","completion":"0.0000089"},"pricing_krw":{"prompt":"0.00297600600","completion":"0.01203929700"},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text"],"output_modalities":["text"],"description":"Within Zhipu's GLM-4.5 lineup, GLM-4.5-X is intended for general dialogue, document understanding, and text generation. For this standard variant, the catalog lists a 131,072-token context window and up to 98,304 output tokens.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"glm-4.5-airx","object":"model","created":0,"owned_by":"pleum","provider":"glm","display_name":"GLM-4.5-AirX","modality":"text","price_unit":"token","input_price_usd":1.1,"output_price_usd":4.5,"markup_tier":"medium","effective_markup_percent":0.0,"context_window":131072,"max_output":98304,"is_active":true,"operations":["chat.generate"],"maker":"Zhipu","context_length":131072,"max_output_tokens":98304,"architecture":{"input_modalities":["text"],"output_modalities":["text"]},"supported_parameters":["temperature","max_tokens","top_p","stop","seed","frequency_penalty","presence_penalty","tools","tool_choice","response_format","parallel_tool_calls","logit_bias","stream"],"supports_thinking":false,"thinking_forced":false,"pricing":{"prompt":"0.0000011","completion":"0.0000045"},"pricing_krw":{"prompt":"0.00148800300","completion":"0.00608728500"},"pricing_tiers":[],"pricing_variants":[],"providers":[{"provider":"glm","input_price_usd":1.1,"output_price_usd":4.5,"markup_tier":"medium","effective_markup_percent":0.0,"context_window":131072,"max_output":98304,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.0000011","completion":"0.0000045"},"pricing_krw":{"prompt":"0.00148800300","completion":"0.00608728500"},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text"],"output_modalities":["text"],"description":"GLM-4.5-AirX is the lightweight, high-speed GLM-4.5 variant for reasoning, coding, and agent-oriented work. It supports 131,072 context tokens and up to 98,304 output tokens.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"glm-4-32b-0414-128k","object":"model","created":0,"owned_by":"pleum","provider":"glm","display_name":"GLM-4-32B-0414 (128K)","modality":"text","price_unit":"token","input_price_usd":0.1,"output_price_usd":0.1,"markup_tier":"high","effective_markup_percent":0.0,"context_window":131072,"max_output":16384,"is_active":true,"operations":["chat.generate"],"maker":"Zhipu","context_length":131072,"max_output_tokens":16384,"architecture":{"input_modalities":["text"],"output_modalities":["text"]},"supported_parameters":["temperature","max_tokens","top_p","stop","seed","frequency_penalty","presence_penalty","tools","tool_choice","response_format","parallel_tool_calls","logit_bias","stream"],"supports_thinking":false,"thinking_forced":false,"pricing":{"prompt":"0.0000001","completion":"0.0000001"},"pricing_krw":{"prompt":"0.00013527300","completion":"0.00013527300"},"pricing_tiers":[],"pricing_variants":[],"providers":[{"provider":"glm","input_price_usd":0.1,"output_price_usd":0.1,"markup_tier":"high","effective_markup_percent":0.0,"context_window":131072,"max_output":16384,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.0000001","completion":"0.0000001"},"pricing_krw":{"prompt":"0.00013527300","completion":"0.00013527300"},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text"],"output_modalities":["text"],"description":"GLM-4-32B-0414 (128K) is a Zhipu model for general dialogue, document understanding, and text generation. Its cataloged dated snapshot profile provides 131,072 tokens of context with a maximum output of 32,768 tokens.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"MiniMax-M3","object":"model","created":0,"owned_by":"pleum","provider":"vultr","display_name":"MiniMax M3","modality":"text","price_unit":"token","input_price_usd":0.2,"output_price_usd":0.9,"markup_tier":"high","effective_markup_percent":0.0,"context_window":1049000,"max_output":131000,"is_active":true,"operations":["chat.generate"],"maker":"MiniMax","context_length":1049000,"max_output_tokens":131000,"architecture":{"input_modalities":["text","image","video"],"output_modalities":["text"]},"supported_parameters":["temperature","max_tokens","top_p","stop","seed","frequency_penalty","presence_penalty","tools","tool_choice","response_format","parallel_tool_calls","logit_bias","stream"],"supports_thinking":false,"thinking_forced":false,"pricing":{"prompt":"0.0000002","completion":"0.0000009"},"pricing_krw":{"prompt":"0.00027054600","completion":"0.00121745700"},"pricing_tiers":[],"pricing_variants":[],"providers":[{"provider":"vultr","input_price_usd":0.2,"output_price_usd":0.9,"markup_tier":"high","effective_markup_percent":0.0,"context_window":524288,"max_output":524288,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.0000002","completion":"0.0000009"},"pricing_krw":{"prompt":"0.00027054600","completion":"0.00121745700"},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]},{"provider":"together","input_price_usd":0.3,"output_price_usd":1.2,"markup_tier":"high","effective_markup_percent":0.0,"context_window":524288,"max_output":8192,"cache_read_usd":0.06,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.0000003","completion":"0.0000012"},"pricing_krw":{"prompt":"0.00040581900","completion":"0.00162327600"},"peak_pricing":null,"pricing_policy":{"version":1,"kind":"token_tiers","tiers":[{"input_tokens_lte":524288,"input_price_usd_per_m":0.3,"output_price_usd_per_m":1.2,"cache_read_price_usd_per_m":0.06}]},"pricing_tiers":[{"input_tokens_lte":524288,"input_price_usd_per_m":0.3,"output_price_usd_per_m":1.2,"cache_read_price_usd_per_m":0.06}],"pricing_variants":[]},{"provider":"minimax","input_price_usd":0.3,"output_price_usd":1.2,"markup_tier":"medium","effective_markup_percent":0.0,"context_window":1000000,"max_output":524288,"cache_read_usd":0.06,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.0000003","completion":"0.0000012"},"pricing_krw":{"prompt":"0.00040581900","completion":"0.00162327600"},"peak_pricing":null,"pricing_policy":{"version":1,"kind":"token_tiers","tiers":[{"input_tokens_lte":512000,"input_price_usd_per_m":0.3,"output_price_usd_per_m":1.2,"cache_read_price_usd_per_m":0.06},{"input_tokens_lte":1000000,"input_price_usd_per_m":0.6,"output_price_usd_per_m":2.4,"cache_read_price_usd_per_m":0.12}]},"pricing_tiers":[{"input_tokens_lte":512000,"input_price_usd_per_m":0.3,"output_price_usd_per_m":1.2,"cache_read_price_usd_per_m":0.06},{"input_tokens_lte":1000000,"input_price_usd_per_m":0.6,"output_price_usd_per_m":2.4,"cache_read_price_usd_per_m":0.12}],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text","image","video"],"output_modalities":["text"],"description":"MiniMax M3 is a MiniMax text model for general dialogue, document understanding, and text generation. PleumRouter's catalog provides up to 1,048,576 context tokens, and the SambaNova offering publishes up to 1,048,576 output tokens.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"minimax-m2.5","object":"model","created":0,"owned_by":"pleum","provider":"minimax","display_name":"MiniMax-M2.5","modality":"text","price_unit":"token","input_price_usd":0.3,"output_price_usd":1.2,"markup_tier":"high","effective_markup_percent":0.0,"context_window":204800,"max_output":204800,"is_active":true,"operations":["chat.generate"],"maker":"MiniMax","context_length":204800,"max_output_tokens":204800,"architecture":{"input_modalities":["text"],"output_modalities":["text"]},"supported_parameters":["temperature","max_tokens","top_p","stop","seed","frequency_penalty","presence_penalty","tools","tool_choice","response_format","parallel_tool_calls","logit_bias","stream"],"supports_thinking":false,"thinking_forced":false,"pricing":{"prompt":"0.0000003","completion":"0.0000012"},"pricing_krw":{"prompt":"0.00040581900","completion":"0.00162327600"},"pricing_tiers":[{"input_tokens_lte":204800,"input_price_usd_per_m":0.3,"output_price_usd_per_m":1.2,"cache_read_price_usd_per_m":0.03}],"pricing_variants":[],"providers":[{"provider":"friendli","input_price_usd":0.3,"output_price_usd":1.2,"markup_tier":"high","effective_markup_percent":0.0,"context_window":196608,"max_output":32768,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.0000003","completion":"0.0000012"},"pricing_krw":{"prompt":"0.00040581900","completion":"0.00162327600"},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]},{"provider":"minimax","input_price_usd":0.3,"output_price_usd":1.2,"markup_tier":"high","effective_markup_percent":0.0,"context_window":204800,"max_output":204800,"cache_read_usd":0.03,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.0000003","completion":"0.0000012"},"pricing_krw":{"prompt":"0.00040581900","completion":"0.00162327600"},"peak_pricing":null,"pricing_policy":{"version":1,"kind":"token_tiers","tiers":[{"input_tokens_lte":204800,"input_price_usd_per_m":0.3,"output_price_usd_per_m":1.2,"cache_read_price_usd_per_m":0.03}]},"pricing_tiers":[{"input_tokens_lte":204800,"input_price_usd_per_m":0.3,"output_price_usd_per_m":1.2,"cache_read_price_usd_per_m":0.03}],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text"],"output_modalities":["text"],"description":"MiniMax-M2.5 is the M2.5 version of the MiniMax M2 family for general dialogue, document understanding, and text generation. Its catalog limits are 1,048,576 context tokens and 131,000 output tokens.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"MiniMax-M2.7","object":"model","created":0,"owned_by":"pleum","provider":"deepinfra","display_name":"MiniMax M2.7","modality":"text","price_unit":"token","input_price_usd":0.25,"output_price_usd":1.0,"markup_tier":"high","effective_markup_percent":0.0,"context_window":204800,"max_output":204800,"is_active":true,"operations":["chat.generate"],"maker":"MiniMax","context_length":204800,"max_output_tokens":204800,"architecture":{"input_modalities":["text"],"output_modalities":["text"]},"supported_parameters":["temperature","max_tokens","top_p","stop","seed","frequency_penalty","presence_penalty","tools","tool_choice","response_format","parallel_tool_calls","logit_bias","stream"],"supports_thinking":false,"thinking_forced":false,"pricing":{"prompt":"0.00000025","completion":"0.000001"},"pricing_krw":{"prompt":"0.000338182500","completion":"0.0013527300"},"pricing_tiers":[],"pricing_variants":[],"providers":[{"provider":"deepinfra","input_price_usd":0.25,"output_price_usd":1.0,"markup_tier":"high","effective_markup_percent":0.0,"context_window":196608,"max_output":32768,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.00000025","completion":"0.000001"},"pricing_krw":{"prompt":"0.000338182500","completion":"0.0013527300"},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]},{"provider":"minimax","input_price_usd":0.3,"output_price_usd":1.2,"markup_tier":"high","effective_markup_percent":0.0,"context_window":204800,"max_output":204800,"cache_read_usd":0.06,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.0000003","completion":"0.0000012"},"pricing_krw":{"prompt":"0.00040581900","completion":"0.00162327600"},"peak_pricing":null,"pricing_policy":{"version":1,"kind":"token_tiers","tiers":[{"input_tokens_lte":204800,"input_price_usd_per_m":0.3,"output_price_usd_per_m":1.2,"cache_read_price_usd_per_m":0.06}]},"pricing_tiers":[{"input_tokens_lte":204800,"input_price_usd_per_m":0.3,"output_price_usd_per_m":1.2,"cache_read_price_usd_per_m":0.06}],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text"],"output_modalities":["text"],"description":"MiniMax M2.7 is the M2.7 version of the MiniMax M2 family for general dialogue, document understanding, and text generation. PleumRouter catalogs 204,800 context tokens and up to 204,800 output tokens.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"MiniMax-M2-her","object":"model","created":0,"owned_by":"pleum","provider":"minimax","display_name":"MiniMax M2-her","modality":"text","price_unit":"token","input_price_usd":0.3,"output_price_usd":1.2,"markup_tier":"high","effective_markup_percent":0.0,"context_window":65536,"max_output":2048,"is_active":true,"operations":["chat.generate"],"maker":"MiniMax","context_length":65536,"max_output_tokens":2048,"architecture":{"input_modalities":["text"],"output_modalities":["text"]},"supported_parameters":["temperature","max_tokens","top_p","stop","seed","frequency_penalty","presence_penalty","tools","tool_choice","response_format","parallel_tool_calls","logit_bias","stream"],"supports_thinking":false,"thinking_forced":false,"pricing":{"prompt":"0.0000003","completion":"0.0000012"},"pricing_krw":{"prompt":"0.00040581900","completion":"0.00162327600"},"pricing_tiers":[],"pricing_variants":[],"providers":[{"provider":"minimax","input_price_usd":0.3,"output_price_usd":1.2,"markup_tier":"high","effective_markup_percent":0.0,"context_window":65536,"max_output":2048,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.0000003","completion":"0.0000012"},"pricing_krw":{"prompt":"0.00040581900","completion":"0.00162327600"},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text"],"output_modalities":["text"],"description":"MiniMax M2-her is the M2-her version of the MiniMax M2 family for role-based, long-running multi-turn dialogue. Its public catalog limits are 65,536 context tokens and 2,048 output tokens.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"MiniMax-M2.1","object":"model","created":0,"owned_by":"pleum","provider":"minimax","display_name":"MiniMax M2.1","modality":"text","price_unit":"token","input_price_usd":0.3,"output_price_usd":1.2,"markup_tier":"high","effective_markup_percent":0.0,"context_window":204800,"max_output":204800,"is_active":true,"operations":["chat.generate"],"maker":"MiniMax","context_length":204800,"max_output_tokens":204800,"architecture":{"input_modalities":["text"],"output_modalities":["text"]},"supported_parameters":["temperature","max_tokens","top_p","stop","seed","frequency_penalty","presence_penalty","tools","tool_choice","response_format","parallel_tool_calls","logit_bias","stream"],"supports_thinking":false,"thinking_forced":false,"pricing":{"prompt":"0.0000003","completion":"0.0000012"},"pricing_krw":{"prompt":"0.00040581900","completion":"0.00162327600"},"pricing_tiers":[{"input_tokens_lte":204800,"input_price_usd_per_m":0.3,"output_price_usd_per_m":1.2,"cache_read_price_usd_per_m":0.03}],"pricing_variants":[],"providers":[{"provider":"minimax","input_price_usd":0.3,"output_price_usd":1.2,"markup_tier":"high","effective_markup_percent":0.0,"context_window":204800,"max_output":204800,"cache_read_usd":0.03,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.0000003","completion":"0.0000012"},"pricing_krw":{"prompt":"0.00040581900","completion":"0.00162327600"},"peak_pricing":null,"pricing_policy":{"version":1,"kind":"token_tiers","tiers":[{"input_tokens_lte":204800,"input_price_usd_per_m":0.3,"output_price_usd_per_m":1.2,"cache_read_price_usd_per_m":0.03}]},"pricing_tiers":[{"input_tokens_lte":204800,"input_price_usd_per_m":0.3,"output_price_usd_per_m":1.2,"cache_read_price_usd_per_m":0.03}],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text"],"output_modalities":["text"],"description":"MiniMax M2.1 is the M2.1 version of the MiniMax M2 family for general dialogue, document understanding, and text generation. Its catalog limits are 204,800 context tokens and 49,152 output tokens.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"MiniMax-M2.7-highspeed","object":"model","created":0,"owned_by":"pleum","provider":"minimax","display_name":"MiniMax M2.7 Highspeed","modality":"text","price_unit":"token","input_price_usd":0.6,"output_price_usd":2.4,"markup_tier":"high","effective_markup_percent":0.0,"context_window":204800,"max_output":204800,"is_active":true,"operations":["chat.generate"],"maker":"MiniMax","context_length":204800,"max_output_tokens":204800,"architecture":{"input_modalities":["text"],"output_modalities":["text"]},"supported_parameters":["temperature","max_tokens","top_p","stop","seed","frequency_penalty","presence_penalty","tools","tool_choice","response_format","parallel_tool_calls","logit_bias","stream"],"supports_thinking":false,"thinking_forced":false,"pricing":{"prompt":"0.0000006","completion":"0.0000024"},"pricing_krw":{"prompt":"0.00081163800","completion":"0.00324655200"},"pricing_tiers":[{"input_tokens_lte":204800,"input_price_usd_per_m":0.6,"output_price_usd_per_m":2.4,"cache_read_price_usd_per_m":0.06}],"pricing_variants":[],"providers":[{"provider":"minimax","input_price_usd":0.6,"output_price_usd":2.4,"markup_tier":"high","effective_markup_percent":0.0,"context_window":204800,"max_output":204800,"cache_read_usd":0.06,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.0000006","completion":"0.0000024"},"pricing_krw":{"prompt":"0.00081163800","completion":"0.00324655200"},"peak_pricing":null,"pricing_policy":{"version":1,"kind":"token_tiers","tiers":[{"input_tokens_lte":204800,"input_price_usd_per_m":0.6,"output_price_usd_per_m":2.4,"cache_read_price_usd_per_m":0.06}]},"pricing_tiers":[{"input_tokens_lte":204800,"input_price_usd_per_m":0.6,"output_price_usd_per_m":2.4,"cache_read_price_usd_per_m":0.06}],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text"],"output_modalities":["text"],"description":"MiniMax M2.7 Highspeed is MiniMax's M2-line option for general dialogue, document understanding, and text generation. Its cataloged Highspeed profile provides 204,800 tokens of context with a maximum output of 49,152 tokens.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"MiniMax-M2.5-highspeed","object":"model","created":0,"owned_by":"pleum","provider":"minimax","display_name":"MiniMax M2.5 Highspeed","modality":"text","price_unit":"token","input_price_usd":0.6,"output_price_usd":2.4,"markup_tier":"high","effective_markup_percent":0.0,"context_window":204800,"max_output":204800,"is_active":true,"operations":["chat.generate"],"maker":"MiniMax","context_length":204800,"max_output_tokens":204800,"architecture":{"input_modalities":["text"],"output_modalities":["text"]},"supported_parameters":["temperature","max_tokens","top_p","stop","seed","frequency_penalty","presence_penalty","tools","tool_choice","response_format","parallel_tool_calls","logit_bias","stream"],"supports_thinking":false,"thinking_forced":false,"pricing":{"prompt":"0.0000006","completion":"0.0000024"},"pricing_krw":{"prompt":"0.00081163800","completion":"0.00324655200"},"pricing_tiers":[{"input_tokens_lte":204800,"input_price_usd_per_m":0.6,"output_price_usd_per_m":2.4,"cache_read_price_usd_per_m":0.03}],"pricing_variants":[],"providers":[{"provider":"minimax","input_price_usd":0.6,"output_price_usd":2.4,"markup_tier":"high","effective_markup_percent":0.0,"context_window":204800,"max_output":204800,"cache_read_usd":0.03,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.0000006","completion":"0.0000024"},"pricing_krw":{"prompt":"0.00081163800","completion":"0.00324655200"},"peak_pricing":null,"pricing_policy":{"version":1,"kind":"token_tiers","tiers":[{"input_tokens_lte":204800,"input_price_usd_per_m":0.6,"output_price_usd_per_m":2.4,"cache_read_price_usd_per_m":0.03}]},"pricing_tiers":[{"input_tokens_lte":204800,"input_price_usd_per_m":0.6,"output_price_usd_per_m":2.4,"cache_read_price_usd_per_m":0.03}],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text"],"output_modalities":["text"],"description":"MiniMax M2.5 Highspeed is MiniMax's low-latency text model option.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"MiniMax-M2.1-highspeed","object":"model","created":0,"owned_by":"pleum","provider":"minimax","display_name":"MiniMax M2.1 Highspeed","modality":"text","price_unit":"token","input_price_usd":0.6,"output_price_usd":2.4,"markup_tier":"high","effective_markup_percent":0.0,"context_window":204800,"max_output":204800,"is_active":true,"operations":["chat.generate"],"maker":"MiniMax","context_length":204800,"max_output_tokens":204800,"architecture":{"input_modalities":["text"],"output_modalities":["text"]},"supported_parameters":["temperature","max_tokens","top_p","stop","seed","frequency_penalty","presence_penalty","tools","tool_choice","response_format","parallel_tool_calls","logit_bias","stream"],"supports_thinking":false,"thinking_forced":false,"pricing":{"prompt":"0.0000006","completion":"0.0000024"},"pricing_krw":{"prompt":"0.00081163800","completion":"0.00324655200"},"pricing_tiers":[{"input_tokens_lte":204800,"input_price_usd_per_m":0.6,"output_price_usd_per_m":2.4,"cache_read_price_usd_per_m":0.03}],"pricing_variants":[],"providers":[{"provider":"minimax","input_price_usd":0.6,"output_price_usd":2.4,"markup_tier":"high","effective_markup_percent":0.0,"context_window":204800,"max_output":204800,"cache_read_usd":0.03,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.0000006","completion":"0.0000024"},"pricing_krw":{"prompt":"0.00081163800","completion":"0.00324655200"},"peak_pricing":null,"pricing_policy":{"version":1,"kind":"token_tiers","tiers":[{"input_tokens_lte":204800,"input_price_usd_per_m":0.6,"output_price_usd_per_m":2.4,"cache_read_price_usd_per_m":0.03}]},"pricing_tiers":[{"input_tokens_lte":204800,"input_price_usd_per_m":0.6,"output_price_usd_per_m":2.4,"cache_read_price_usd_per_m":0.03}],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text"],"output_modalities":["text"],"description":"MiniMax M2.1 Highspeed is MiniMax's low-latency text model option.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"o3","object":"model","created":0,"owned_by":"pleum","provider":"openai","display_name":"o3","modality":"text","price_unit":"token","input_price_usd":2.0,"output_price_usd":8.0,"markup_tier":"low","effective_markup_percent":0.0,"context_window":200000,"max_output":100000,"is_active":true,"operations":["chat.generate"],"maker":"OpenAI","context_length":200000,"max_output_tokens":100000,"architecture":{"input_modalities":["text"],"output_modalities":["text"]},"supported_parameters":["temperature","max_tokens","top_p","stop","seed","frequency_penalty","presence_penalty","tools","tool_choice","response_format","parallel_tool_calls","logit_bias","stream","reasoning_effort","service_tier"],"supports_thinking":true,"thinking_forced":true,"pricing":{"prompt":"0.000002","completion":"0.000008"},"pricing_krw":{"prompt":"0.0027054600","completion":"0.0108218400"},"pricing_tiers":[],"pricing_variants":[],"providers":[{"provider":"openai","input_price_usd":2.0,"output_price_usd":8.0,"markup_tier":"low","effective_markup_percent":0.0,"context_window":200000,"max_output":100000,"cache_read_usd":0.2,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.000002","completion":"0.000008"},"pricing_krw":{"prompt":"0.0027054600","completion":"0.0108218400"},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text"],"output_modalities":["text"],"description":"o3 is an OpenAI model for general dialogue, document understanding, and text generation. Its cataloged standard profile provides 200,000 tokens of context with a maximum output of 100,000 tokens.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"gpt-4.1","object":"model","created":0,"owned_by":"pleum","provider":"openai","display_name":"GPT-4.1","modality":"text","price_unit":"token","input_price_usd":2.0,"output_price_usd":8.0,"markup_tier":"medium","effective_markup_percent":0.0,"context_window":1000000,"max_output":32768,"is_active":true,"operations":["chat.generate"],"maker":"OpenAI","context_length":1000000,"max_output_tokens":32768,"architecture":{"input_modalities":["text"],"output_modalities":["text"]},"supported_parameters":["temperature","max_tokens","top_p","stop","seed","frequency_penalty","presence_penalty","tools","tool_choice","response_format","parallel_tool_calls","logit_bias","stream","service_tier"],"supports_thinking":false,"thinking_forced":false,"pricing":{"prompt":"0.000002","completion":"0.000008"},"pricing_krw":{"prompt":"0.0027054600","completion":"0.0108218400"},"pricing_tiers":[],"pricing_variants":[],"providers":[{"provider":"openai","input_price_usd":2.0,"output_price_usd":8.0,"markup_tier":"medium","effective_markup_percent":0.0,"context_window":1000000,"max_output":32768,"cache_read_usd":0.2,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.000002","completion":"0.000008"},"pricing_krw":{"prompt":"0.0027054600","completion":"0.0108218400"},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text"],"output_modalities":["text"],"description":"OpenAI positions GPT-4.1 in the GPT family for general dialogue, document understanding, and text generation. The public catalog limits for the standard release are 1,000,000 context tokens and 32,768 output tokens.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"gpt-4.1-mini","object":"model","created":0,"owned_by":"pleum","provider":"openai","display_name":"GPT-4.1 Mini","modality":"text","price_unit":"token","input_price_usd":0.4,"output_price_usd":1.6,"markup_tier":"high","effective_markup_percent":0.0,"context_window":1000000,"max_output":32768,"is_active":true,"operations":["chat.generate"],"maker":"OpenAI","context_length":1000000,"max_output_tokens":32768,"architecture":{"input_modalities":["text"],"output_modalities":["text"]},"supported_parameters":["temperature","max_tokens","top_p","stop","seed","frequency_penalty","presence_penalty","tools","tool_choice","response_format","parallel_tool_calls","logit_bias","stream","service_tier"],"supports_thinking":false,"thinking_forced":false,"pricing":{"prompt":"0.0000004","completion":"0.0000016"},"pricing_krw":{"prompt":"0.00054109200","completion":"0.00216436800"},"pricing_tiers":[],"pricing_variants":[],"providers":[{"provider":"openai","input_price_usd":0.4,"output_price_usd":1.6,"markup_tier":"high","effective_markup_percent":0.0,"context_window":1000000,"max_output":32768,"cache_read_usd":0.04,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.0000004","completion":"0.0000016"},"pricing_krw":{"prompt":"0.00054109200","completion":"0.00216436800"},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text"],"output_modalities":["text"],"description":"OpenAI positions GPT-4.1 Mini in the GPT family for general dialogue, document understanding, and text generation. For this Mini variant, the catalog lists a 1,000,000-token context window and up to 32,768 output tokens.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"gemini-3.8-flash","object":"model","created":0,"owned_by":"pleum","provider":"google","display_name":"Gemini 3.8 Flash","modality":"text","price_unit":"token","input_price_usd":0.75,"output_price_usd":3.75,"markup_tier":"medium","effective_markup_percent":0.0,"context_window":1048576,"max_output":65536,"is_active":true,"operations":["chat.generate"],"maker":"Google","context_length":1048576,"max_output_tokens":65536,"architecture":{"input_modalities":["text"],"output_modalities":["text"]},"supported_parameters":["temperature","max_tokens","top_p","stop","seed","frequency_penalty","presence_penalty","tools","tool_choice","response_format","parallel_tool_calls","logit_bias","stream"],"supports_thinking":false,"thinking_forced":false,"pricing":{"prompt":"0.00000075","completion":"0.00000375"},"pricing_krw":{"prompt":"0.001014547500","completion":"0.005072737500"},"pricing_tiers":[],"pricing_variants":[],"providers":[{"provider":"google","input_price_usd":0.75,"output_price_usd":3.75,"markup_tier":"medium","effective_markup_percent":0.0,"context_window":1048576,"max_output":65536,"cache_read_usd":0.075,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.00000075","completion":"0.00000375"},"pricing_krw":{"prompt":"0.001014547500","completion":"0.005072737500"},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text"],"output_modalities":["text"],"description":"Gemini 3.8 Flash is Google's stable Flash model for text, image, video, audio, and PDF inputs with text output. It has a 1,048,576-token context window, up to 65,536 output tokens, and a standard price of $0.75 input / $3.75 output per 1M tokens.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"gpt-4o","object":"model","created":0,"owned_by":"pleum","provider":"openai","display_name":"GPT-4o","modality":"text","price_unit":"token","input_price_usd":2.5,"output_price_usd":10.0,"markup_tier":"medium","effective_markup_percent":0.0,"context_window":128000,"max_output":16384,"is_active":true,"operations":["chat.generate"],"maker":"OpenAI","context_length":128000,"max_output_tokens":16384,"architecture":{"input_modalities":["text"],"output_modalities":["text"]},"supported_parameters":["temperature","max_tokens","top_p","stop","seed","frequency_penalty","presence_penalty","tools","tool_choice","response_format","parallel_tool_calls","logit_bias","stream","service_tier"],"supports_thinking":false,"thinking_forced":false,"pricing":{"prompt":"0.0000025","completion":"0.00001"},"pricing_krw":{"prompt":"0.00338182500","completion":"0.013527300"},"pricing_tiers":[],"pricing_variants":[],"providers":[{"provider":"openai","input_price_usd":2.5,"output_price_usd":10.0,"markup_tier":"medium","effective_markup_percent":0.0,"context_window":128000,"max_output":16384,"cache_read_usd":0.25,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.0000025","completion":"0.00001"},"pricing_krw":{"prompt":"0.00338182500","completion":"0.013527300"},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text"],"output_modalities":["text"],"description":"OpenAI positions GPT-4o in the GPT family for general dialogue, document understanding, and text generation. The public catalog limits for the standard release are 128,000 context tokens and 16,384 output tokens.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"gemini-3.1-pro-preview","object":"model","created":0,"owned_by":"pleum","provider":"google","display_name":"Gemini 3.1 Pro","modality":"text","price_unit":"token","input_price_usd":2.0,"output_price_usd":12.0,"markup_tier":"low","effective_markup_percent":0.0,"context_window":1048576,"max_output":65536,"is_active":true,"operations":["chat.generate"],"maker":"Google","context_length":1048576,"max_output_tokens":65536,"architecture":{"input_modalities":["text"],"output_modalities":["text"]},"supported_parameters":["temperature","max_tokens","top_p","stop","seed","frequency_penalty","presence_penalty","tools","tool_choice","response_format","parallel_tool_calls","logit_bias","stream","reasoning_effort"],"supports_thinking":true,"thinking_forced":false,"pricing":{"prompt":"0.000002","completion":"0.000012"},"pricing_krw":{"prompt":"0.0027054600","completion":"0.0162327600"},"pricing_tiers":[],"pricing_variants":[],"providers":[{"provider":"deepinfra","input_price_usd":2.0,"output_price_usd":12.0,"markup_tier":"low","effective_markup_percent":0.0,"context_window":1000000,"max_output":32768,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.000002","completion":"0.000012"},"pricing_krw":{"prompt":"0.0027054600","completion":"0.0162327600"},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]},{"provider":"google","input_price_usd":2.0,"output_price_usd":12.0,"markup_tier":"low","effective_markup_percent":0.0,"context_window":1048576,"max_output":65536,"cache_read_usd":0.2,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.000002","completion":"0.000012"},"pricing_krw":{"prompt":"0.0027054600","completion":"0.0162327600"},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text"],"output_modalities":["text"],"description":"Within Google's Gemini lineup, Gemini 3.1 Pro is intended for general dialogue, document understanding, and text generation. For this preview variant, the catalog lists a 1,000,000-token context window and up to 65,536 output tokens.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"gemini-3.6-flash","object":"model","created":0,"owned_by":"pleum","provider":"google","display_name":"Gemini 3.6 Flash","modality":"text","price_unit":"token","input_price_usd":0.75,"output_price_usd":3.75,"markup_tier":"medium","effective_markup_percent":0.0,"context_window":1048576,"max_output":65536,"is_active":true,"operations":["chat.generate"],"maker":"Google","context_length":1048576,"max_output_tokens":65536,"architecture":{"input_modalities":["text"],"output_modalities":["text"]},"supported_parameters":["temperature","max_tokens","top_p","stop","seed","frequency_penalty","presence_penalty","tools","tool_choice","response_format","parallel_tool_calls","logit_bias","stream"],"supports_thinking":false,"thinking_forced":false,"pricing":{"prompt":"0.00000075","completion":"0.00000375"},"pricing_krw":{"prompt":"0.001014547500","completion":"0.005072737500"},"pricing_tiers":[],"pricing_variants":[],"providers":[{"provider":"google","input_price_usd":0.75,"output_price_usd":3.75,"markup_tier":"medium","effective_markup_percent":0.0,"context_window":1048576,"max_output":65536,"cache_read_usd":0.075,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.00000075","completion":"0.00000375"},"pricing_krw":{"prompt":"0.001014547500","completion":"0.005072737500"},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text"],"output_modalities":["text"],"description":"Gemini 3.6 Flash is Google's multimodal model for code generation, agentic execution, and spatial reasoning across text, image, video, audio, and PDF inputs. It supports up to 1,048,576 input tokens and 65,536 output tokens.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"gemini-3.7-flash","object":"model","created":0,"owned_by":"pleum","provider":"google","display_name":"Gemini 3.7 Flash","modality":"text","price_unit":"token","input_price_usd":0.75,"output_price_usd":3.75,"markup_tier":"medium","effective_markup_percent":0.0,"context_window":1048576,"max_output":1000000,"is_active":true,"operations":["chat.generate"],"maker":"Google","context_length":1048576,"max_output_tokens":1000000,"architecture":{"input_modalities":["text"],"output_modalities":["text"]},"supported_parameters":["temperature","max_tokens","top_p","stop","seed","frequency_penalty","presence_penalty","tools","tool_choice","response_format","parallel_tool_calls","logit_bias","stream"],"supports_thinking":false,"thinking_forced":false,"pricing":{"prompt":"0.00000075","completion":"0.00000375"},"pricing_krw":{"prompt":"0.001014547500","completion":"0.005072737500"},"pricing_tiers":[],"pricing_variants":[],"providers":[{"provider":"deepinfra","input_price_usd":0.75,"output_price_usd":3.75,"markup_tier":"medium","effective_markup_percent":0.0,"context_window":1048576,"max_output":1000000,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.00000075","completion":"0.00000375"},"pricing_krw":{"prompt":"0.001014547500","completion":"0.005072737500"},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]},{"provider":"google","input_price_usd":0.75,"output_price_usd":3.75,"markup_tier":"medium","effective_markup_percent":0.0,"context_window":1048576,"max_output":65536,"cache_read_usd":0.075,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.00000075","completion":"0.00000375"},"pricing_krw":{"prompt":"0.001014547500","completion":"0.005072737500"},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text"],"output_modalities":["text"],"description":"Gemini 3.7 Flash is Google's newest flagship Flash model for complex coding and agent workflows, with a 1M-token context and 65,536-token output. Intro pricing applies until 2026-12-31, after which rates double.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"gpt-4o-mini","object":"model","created":0,"owned_by":"pleum","provider":"openai","display_name":"GPT-4o Mini","modality":"text","price_unit":"token","input_price_usd":0.15,"output_price_usd":0.6,"markup_tier":"high","effective_markup_percent":0.0,"context_window":128000,"max_output":16384,"is_active":true,"operations":["chat.generate"],"maker":"OpenAI","context_length":128000,"max_output_tokens":16384,"architecture":{"input_modalities":["text"],"output_modalities":["text"]},"supported_parameters":["temperature","max_tokens","top_p","stop","seed","frequency_penalty","presence_penalty","tools","tool_choice","response_format","parallel_tool_calls","logit_bias","stream","service_tier"],"supports_thinking":false,"thinking_forced":false,"pricing":{"prompt":"0.00000015","completion":"0.0000006"},"pricing_krw":{"prompt":"0.000202909500","completion":"0.00081163800"},"pricing_tiers":[],"pricing_variants":[],"providers":[{"provider":"openai","input_price_usd":0.15,"output_price_usd":0.6,"markup_tier":"high","effective_markup_percent":0.0,"context_window":128000,"max_output":16384,"cache_read_usd":0.015,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.00000015","completion":"0.0000006"},"pricing_krw":{"prompt":"0.000202909500","completion":"0.00081163800"},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text"],"output_modalities":["text"],"description":"OpenAI positions GPT-4o Mini in the GPT family for general dialogue, document understanding, and text generation. For this Mini variant, the catalog lists a 128,000-token context window and up to 16,384 output tokens.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"gemini-3.1-pro-preview-customtools","object":"model","created":0,"owned_by":"pleum","provider":"google","display_name":"Gemini 3.1 Pro Preview (Custom Tools)","modality":"text","price_unit":"token","input_price_usd":2.0,"output_price_usd":12.0,"markup_tier":"low","effective_markup_percent":0.0,"context_window":1048576,"max_output":65536,"is_active":true,"operations":["chat.generate"],"maker":"Google","context_length":1048576,"max_output_tokens":65536,"architecture":{"input_modalities":["text"],"output_modalities":["text"]},"supported_parameters":["temperature","max_tokens","top_p","stop","seed","frequency_penalty","presence_penalty","tools","tool_choice","response_format","parallel_tool_calls","logit_bias","stream"],"supports_thinking":false,"thinking_forced":false,"pricing":{"prompt":"0.000002","completion":"0.000012"},"pricing_krw":{"prompt":"0.0027054600","completion":"0.0162327600"},"pricing_tiers":[],"pricing_variants":[],"providers":[{"provider":"google","input_price_usd":2.0,"output_price_usd":12.0,"markup_tier":"low","effective_markup_percent":0.0,"context_window":1048576,"max_output":65536,"cache_read_usd":0.2,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.000002","completion":"0.000012"},"pricing_krw":{"prompt":"0.0027054600","completion":"0.0162327600"},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text"],"output_modalities":["text"],"description":"Within Google's Gemini lineup, Gemini 3.1 Pro Preview (Custom Tools) is intended for general dialogue, document understanding, and text generation. Its cataloged preview profile provides 1,000,000 tokens of context with a maximum output of 65,536 tokens.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"gemini-3.5-flash","object":"model","created":0,"owned_by":"pleum","provider":"google","display_name":"Gemini 3.5 Flash","modality":"text","price_unit":"token","input_price_usd":1.5,"output_price_usd":9.0,"markup_tier":"medium","effective_markup_percent":0.0,"context_window":1048576,"max_output":65536,"is_active":true,"operations":["chat.generate"],"maker":"Google","context_length":1048576,"max_output_tokens":65536,"architecture":{"input_modalities":["text"],"output_modalities":["text"]},"supported_parameters":["temperature","max_tokens","top_p","stop","seed","frequency_penalty","presence_penalty","tools","tool_choice","response_format","parallel_tool_calls","logit_bias","stream","reasoning_effort"],"supports_thinking":true,"thinking_forced":false,"pricing":{"prompt":"0.0000015","completion":"0.000009"},"pricing_krw":{"prompt":"0.00202909500","completion":"0.0121745700"},"pricing_tiers":[],"pricing_variants":[],"providers":[{"provider":"deepinfra","input_price_usd":1.5,"output_price_usd":9.0,"markup_tier":"medium","effective_markup_percent":0.0,"context_window":1000000,"max_output":32768,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.0000015","completion":"0.000009"},"pricing_krw":{"prompt":"0.00202909500","completion":"0.0121745700"},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]},{"provider":"google","input_price_usd":1.5,"output_price_usd":9.0,"markup_tier":"medium","effective_markup_percent":0.0,"context_window":1048576,"max_output":65536,"cache_read_usd":0.15,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.0000015","completion":"0.000009"},"pricing_krw":{"prompt":"0.00202909500","completion":"0.0121745700"},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text"],"output_modalities":["text"],"description":"Within Google's Gemini lineup, Gemini 3.5 Flash is intended for general dialogue, document understanding, and text generation. The public catalog limits for the Flash release are 1,000,000 context tokens and 65,536 output tokens.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"gemini-3.5-flash-lite","object":"model","created":0,"owned_by":"pleum","provider":"google","display_name":"Gemini 3.5 Flash-Lite","modality":"text","price_unit":"token","input_price_usd":0.3,"output_price_usd":2.5,"markup_tier":"high","effective_markup_percent":0.0,"context_window":1000000,"max_output":65536,"is_active":true,"operations":["chat.generate"],"maker":"Google","context_length":1000000,"max_output_tokens":65536,"architecture":{"input_modalities":["text"],"output_modalities":["text"]},"supported_parameters":["temperature","max_tokens","top_p","stop","seed","frequency_penalty","presence_penalty","tools","tool_choice","response_format","parallel_tool_calls","logit_bias","stream"],"supports_thinking":false,"thinking_forced":false,"pricing":{"prompt":"0.0000003","completion":"0.0000025"},"pricing_krw":{"prompt":"0.00040581900","completion":"0.00338182500"},"pricing_tiers":[],"pricing_variants":[],"providers":[{"provider":"google","input_price_usd":0.3,"output_price_usd":2.5,"markup_tier":"high","effective_markup_percent":0.0,"context_window":1000000,"max_output":65536,"cache_read_usd":0.03,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.0000003","completion":"0.0000025"},"pricing_krw":{"prompt":"0.00040581900","completion":"0.00338182500"},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text"],"output_modalities":["text"],"description":"Gemini 3.5 Flash-Lite is a text model available through PleumRouter. Review its catalog metadata for supported capabilities and pricing.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"gemini-3.1-flash-lite","object":"model","created":0,"owned_by":"pleum","provider":"google","display_name":"Gemini 3.1 Flash-Lite","modality":"text","price_unit":"token","input_price_usd":0.25,"output_price_usd":1.5,"markup_tier":"high","effective_markup_percent":0.0,"context_window":1000000,"max_output":65536,"is_active":true,"operations":["chat.generate"],"maker":"Google","context_length":1000000,"max_output_tokens":65536,"architecture":{"input_modalities":["text"],"output_modalities":["text"]},"supported_parameters":["temperature","max_tokens","top_p","stop","seed","frequency_penalty","presence_penalty","tools","tool_choice","response_format","parallel_tool_calls","logit_bias","stream","reasoning_effort"],"supports_thinking":true,"thinking_forced":false,"pricing":{"prompt":"0.00000025","completion":"0.0000015"},"pricing_krw":{"prompt":"0.000338182500","completion":"0.00202909500"},"pricing_tiers":[],"pricing_variants":[],"providers":[{"provider":"deepinfra","input_price_usd":0.25,"output_price_usd":1.5,"markup_tier":"high","effective_markup_percent":0.0,"context_window":1000000,"max_output":32768,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.00000025","completion":"0.0000015"},"pricing_krw":{"prompt":"0.000338182500","completion":"0.00202909500"},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]},{"provider":"google","input_price_usd":0.25,"output_price_usd":1.5,"markup_tier":"high","effective_markup_percent":0.0,"context_window":1000000,"max_output":65536,"cache_read_usd":0.025,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.00000025","completion":"0.0000015"},"pricing_krw":{"prompt":"0.000338182500","completion":"0.00202909500"},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text"],"output_modalities":["text"],"description":"Within Google's Gemini lineup, Gemini 3.1 Flash-Lite is intended for general dialogue, document understanding, and text generation. Its cataloged Flash profile provides 1,000,000 tokens of context with a maximum output of 65,536 tokens.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"gemini-2.5-pro","object":"model","created":0,"owned_by":"pleum","provider":"google","display_name":"Gemini 2.5 Pro","modality":"text","price_unit":"token","input_price_usd":1.25,"output_price_usd":10.0,"markup_tier":"low","effective_markup_percent":0.0,"context_window":1000000,"max_output":65536,"is_active":true,"operations":["chat.generate"],"maker":"Google","context_length":1000000,"max_output_tokens":65536,"architecture":{"input_modalities":["text"],"output_modalities":["text"]},"supported_parameters":["temperature","max_tokens","top_p","stop","seed","frequency_penalty","presence_penalty","tools","tool_choice","response_format","parallel_tool_calls","logit_bias","stream","reasoning_effort"],"supports_thinking":true,"thinking_forced":true,"pricing":{"prompt":"0.00000125","completion":"0.00001"},"pricing_krw":{"prompt":"0.001690912500","completion":"0.013527300"},"pricing_tiers":[],"pricing_variants":[],"providers":[{"provider":"google","input_price_usd":1.25,"output_price_usd":10.0,"markup_tier":"low","effective_markup_percent":0.0,"context_window":1000000,"max_output":65536,"cache_read_usd":0.125,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.00000125","completion":"0.00001"},"pricing_krw":{"prompt":"0.001690912500","completion":"0.013527300"},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]},{"provider":"deepinfra","input_price_usd":1.25,"output_price_usd":10.0,"markup_tier":"low","effective_markup_percent":0.0,"context_window":1000000,"max_output":32768,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.00000125","completion":"0.00001"},"pricing_krw":{"prompt":"0.001690912500","completion":"0.013527300"},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text"],"output_modalities":["text"],"description":"Gemini 2.5 Pro is Google's thinking model for reasoning over complex code, math, and STEM problems and analyzing large datasets, codebases, and documents with long context. PleumRouter provides up to 1,000,000 context tokens and 65,536 output tokens.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"gemini-2.5-flash","object":"model","created":0,"owned_by":"pleum","provider":"google","display_name":"Gemini 2.5 Flash","modality":"text","price_unit":"token","input_price_usd":0.3,"output_price_usd":2.5,"markup_tier":"high","effective_markup_percent":0.0,"context_window":1000000,"max_output":65536,"is_active":true,"operations":["chat.generate"],"maker":"Google","context_length":1000000,"max_output_tokens":65536,"architecture":{"input_modalities":["text"],"output_modalities":["text"]},"supported_parameters":["temperature","max_tokens","top_p","stop","seed","frequency_penalty","presence_penalty","tools","tool_choice","response_format","parallel_tool_calls","logit_bias","stream","reasoning_effort"],"supports_thinking":true,"thinking_forced":false,"pricing":{"prompt":"0.0000003","completion":"0.0000025"},"pricing_krw":{"prompt":"0.00040581900","completion":"0.00338182500"},"pricing_tiers":[],"pricing_variants":[],"providers":[{"provider":"deepinfra","input_price_usd":0.3,"output_price_usd":2.5,"markup_tier":"high","effective_markup_percent":0.0,"context_window":1000000,"max_output":32768,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.0000003","completion":"0.0000025"},"pricing_krw":{"prompt":"0.00040581900","completion":"0.00338182500"},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]},{"provider":"google","input_price_usd":0.3,"output_price_usd":2.5,"markup_tier":"high","effective_markup_percent":0.0,"context_window":1000000,"max_output":65536,"cache_read_usd":0.03,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.0000003","completion":"0.0000025"},"pricing_krw":{"prompt":"0.00040581900","completion":"0.00338182500"},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text"],"output_modalities":["text"],"description":"Within Google's Gemini lineup, Gemini 2.5 Flash is intended for general dialogue, document understanding, and text generation. Its cataloged Flash profile provides 1,000,000 tokens of context with a maximum output of 65,536 tokens.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"gemini-2.5-flash-lite","object":"model","created":0,"owned_by":"pleum","provider":"google","display_name":"Gemini 2.5 Flash-Lite","modality":"text","price_unit":"token","input_price_usd":0.1,"output_price_usd":0.4,"markup_tier":"high","effective_markup_percent":0.0,"context_window":1000000,"max_output":65536,"is_active":true,"operations":["chat.generate"],"maker":"Google","context_length":1000000,"max_output_tokens":65536,"architecture":{"input_modalities":["text"],"output_modalities":["text"]},"supported_parameters":["temperature","max_tokens","top_p","stop","seed","frequency_penalty","presence_penalty","tools","tool_choice","response_format","parallel_tool_calls","logit_bias","stream","reasoning_effort"],"supports_thinking":true,"thinking_forced":false,"pricing":{"prompt":"0.0000001","completion":"0.0000004"},"pricing_krw":{"prompt":"0.00013527300","completion":"0.00054109200"},"pricing_tiers":[],"pricing_variants":[],"providers":[{"provider":"google","input_price_usd":0.1,"output_price_usd":0.4,"markup_tier":"high","effective_markup_percent":0.0,"context_window":1000000,"max_output":65536,"cache_read_usd":0.01,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.0000001","completion":"0.0000004"},"pricing_krw":{"prompt":"0.00013527300","completion":"0.00054109200"},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text"],"output_modalities":["text"],"description":"Within Google's Gemini lineup, Gemini 2.5 Flash-Lite is intended for general dialogue, document understanding, and text generation. For this Flash variant, the catalog lists a 1,000,000-token context window and up to 65,536 output tokens.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"qwen-max","object":"model","created":0,"owned_by":"pleum","provider":"qwen","display_name":"Qwen Max","modality":"text","price_unit":"token","input_price_usd":1.6,"output_price_usd":6.4,"markup_tier":"medium","effective_markup_percent":0.0,"context_window":131072,"max_output":8192,"is_active":true,"operations":["chat.generate"],"maker":"Qwen","context_length":131072,"max_output_tokens":8192,"architecture":{"input_modalities":["text"],"output_modalities":["text"]},"supported_parameters":["temperature","max_tokens","top_p","stop","seed","frequency_penalty","presence_penalty","tools","tool_choice","response_format","parallel_tool_calls","logit_bias","stream"],"supports_thinking":false,"thinking_forced":false,"pricing":{"prompt":"0.0000016","completion":"0.0000064"},"pricing_krw":{"prompt":"0.00216436800","completion":"0.00865747200"},"pricing_tiers":[],"pricing_variants":[],"providers":[{"provider":"qwen","input_price_usd":1.6,"output_price_usd":6.4,"markup_tier":"medium","effective_markup_percent":0.0,"context_window":131072,"max_output":8192,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.0000016","completion":"0.0000064"},"pricing_krw":{"prompt":"0.00216436800","completion":"0.00865747200"},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text"],"output_modalities":["text"],"description":"Qwen Max is a Qwen model for general dialogue, document understanding, and text generation. Its cataloged Max profile provides 32,000 tokens of context with a maximum output of 8,192 tokens.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"qwen-plus","object":"model","created":0,"owned_by":"pleum","provider":"qwen","display_name":"Qwen Plus","modality":"text","price_unit":"token","input_price_usd":0.4,"output_price_usd":1.2,"markup_tier":"high","effective_markup_percent":0.0,"context_window":1000000,"max_output":32768,"is_active":true,"operations":["chat.generate"],"maker":"Qwen","context_length":1000000,"max_output_tokens":32768,"architecture":{"input_modalities":["text"],"output_modalities":["text"]},"supported_parameters":["temperature","max_tokens","top_p","stop","seed","frequency_penalty","presence_penalty","tools","tool_choice","response_format","parallel_tool_calls","logit_bias","stream"],"supports_thinking":false,"thinking_forced":false,"pricing":{"prompt":"0.0000004","completion":"0.0000012"},"pricing_krw":{"prompt":"0.00054109200","completion":"0.00162327600"},"pricing_tiers":[{"input_tokens_lte":256000,"input_price_usd_per_m":0.4,"output_price_usd_per_m":1.2},{"input_tokens_lte":1000000,"input_price_usd_per_m":1.2,"output_price_usd_per_m":3.6}],"pricing_variants":[],"providers":[{"provider":"qwen","input_price_usd":0.4,"output_price_usd":1.2,"markup_tier":"high","effective_markup_percent":0.0,"context_window":1000000,"max_output":32768,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.0000004","completion":"0.0000012"},"pricing_krw":{"prompt":"0.00054109200","completion":"0.00162327600"},"peak_pricing":null,"pricing_policy":{"version":1,"kind":"token_tiers","tiers":[{"input_tokens_lte":256000,"input_price_usd_per_m":0.4,"output_price_usd_per_m":1.2},{"input_tokens_lte":1000000,"input_price_usd_per_m":1.2,"output_price_usd_per_m":3.6}]},"pricing_tiers":[{"input_tokens_lte":256000,"input_price_usd_per_m":0.4,"output_price_usd_per_m":1.2},{"input_tokens_lte":1000000,"input_price_usd_per_m":1.2,"output_price_usd_per_m":3.6}],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text"],"output_modalities":["text"],"description":"Qwen Plus is a Qwen model for general dialogue, document understanding, and text generation. PleumRouter catalogs this standard entry with up to 131,072 context tokens and 8,192 output tokens.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"qwen-vl-max","object":"model","created":0,"owned_by":"pleum","provider":"qwen","display_name":"Qwen-VL Max (Vision)","modality":"text","price_unit":"token","input_price_usd":0.8,"output_price_usd":3.2,"markup_tier":"medium","effective_markup_percent":0.0,"context_window":32768,"max_output":8192,"is_active":true,"operations":["chat.generate"],"maker":"Qwen","context_length":32768,"max_output_tokens":8192,"architecture":{"input_modalities":["text","image"],"output_modalities":["text"]},"supported_parameters":["temperature","max_tokens","top_p","stop","seed","frequency_penalty","presence_penalty","tools","tool_choice","response_format","parallel_tool_calls","logit_bias","stream"],"supports_thinking":false,"thinking_forced":false,"pricing":{"prompt":"0.0000008","completion":"0.0000032"},"pricing_krw":{"prompt":"0.00108218400","completion":"0.00432873600"},"pricing_tiers":[],"pricing_variants":[],"providers":[{"provider":"qwen","input_price_usd":0.8,"output_price_usd":3.2,"markup_tier":"medium","effective_markup_percent":0.0,"context_window":32768,"max_output":8192,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.0000008","completion":"0.0000032"},"pricing_krw":{"prompt":"0.00108218400","completion":"0.00432873600"},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text","image"],"output_modalities":["text"],"description":"Qwen-VL Max (Vision) is a Qwen vision-language model that understands visual inputs such as images and documents and returns text. This Max entry supports 32,768 context tokens and up to 8,192 output tokens.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"qwen-vl-plus","object":"model","created":0,"owned_by":"pleum","provider":"qwen","display_name":"Qwen-VL Plus (Vision)","modality":"text","price_unit":"token","input_price_usd":0.21,"output_price_usd":0.63,"markup_tier":"high","effective_markup_percent":0.0,"context_window":32768,"max_output":8192,"is_active":true,"operations":["chat.generate"],"maker":"Qwen","context_length":32768,"max_output_tokens":8192,"architecture":{"input_modalities":["text","image"],"output_modalities":["text"]},"supported_parameters":["temperature","max_tokens","top_p","stop","seed","frequency_penalty","presence_penalty","tools","tool_choice","response_format","parallel_tool_calls","logit_bias","stream"],"supports_thinking":false,"thinking_forced":false,"pricing":{"prompt":"0.00000021","completion":"0.00000063"},"pricing_krw":{"prompt":"0.000284073300","completion":"0.000852219900"},"pricing_tiers":[],"pricing_variants":[],"providers":[{"provider":"qwen","input_price_usd":0.21,"output_price_usd":0.63,"markup_tier":"high","effective_markup_percent":0.0,"context_window":32768,"max_output":8192,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.00000021","completion":"0.00000063"},"pricing_krw":{"prompt":"0.000284073300","completion":"0.000852219900"},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text","image"],"output_modalities":["text"],"description":"Qwen-VL Plus (Vision) is a Qwen vision-language model that understands visual inputs such as images and documents and returns text. This Plus entry supports 32,768 context tokens and up to 8,192 output tokens.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"qvq-max","object":"model","created":0,"owned_by":"pleum","provider":"qwen","display_name":"QVQ Max","modality":"text","price_unit":"token","input_price_usd":1.2,"output_price_usd":4.8,"markup_tier":"medium","effective_markup_percent":0.0,"context_window":131072,"max_output":32768,"is_active":true,"operations":["chat.generate"],"maker":"Qwen","context_length":131072,"max_output_tokens":32768,"architecture":{"input_modalities":["text","image"],"output_modalities":["text"]},"supported_parameters":["temperature","max_tokens","top_p","stop","seed","frequency_penalty","presence_penalty","tools","tool_choice","response_format","parallel_tool_calls","logit_bias","stream"],"supports_thinking":false,"thinking_forced":false,"pricing":{"prompt":"0.0000012","completion":"0.0000048"},"pricing_krw":{"prompt":"0.00162327600","completion":"0.00649310400"},"pricing_tiers":[],"pricing_variants":[],"providers":[{"provider":"qwen","input_price_usd":1.2,"output_price_usd":4.8,"markup_tier":"medium","effective_markup_percent":0.0,"context_window":131072,"max_output":32768,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.0000012","completion":"0.0000048"},"pricing_krw":{"prompt":"0.00162327600","completion":"0.00649310400"},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text","image"],"output_modalities":["text"],"description":"QVQ Max is Qwen's vision-reasoning text model with image input.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"gpt-image-2","object":"model","created":0,"owned_by":"pleum","provider":"openai","display_name":"GPT Image 2","modality":"image","price_unit":"image","input_price_usd":0.0,"output_price_usd":0.053,"markup_tier":"medium","effective_markup_percent":0.0,"context_window":4096,"max_output":1,"is_active":true,"operations":["image.edit","image.generate"],"maker":"OpenAI","context_length":4096,"max_output_tokens":1,"architecture":{"input_modalities":["text","image"],"output_modalities":["image"]},"supported_parameters":[],"supports_thinking":false,"thinking_forced":false,"pricing":{},"pricing_krw":{},"pricing_tiers":[],"pricing_variants":[],"providers":[{"provider":"openai","input_price_usd":0.0,"output_price_usd":0.053,"markup_tier":"medium","effective_markup_percent":0.0,"context_window":4096,"max_output":1,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{},"pricing_krw":{},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text","image"],"output_modalities":["image"],"description":"OpenAI positions GPT Image 2 in the OpenAI image family for image generation from text or reference inputs.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"seedream-4-0-250828","object":"model","created":0,"owned_by":"pleum","provider":"modelark","display_name":"ByteDance Seedream 4.0","modality":"image","price_unit":"image","input_price_usd":0.0,"output_price_usd":0.03,"markup_tier":"medium","effective_markup_percent":0.0,"context_window":4096,"max_output":1,"is_active":true,"operations":["image.generate"],"maker":"ByteDance","context_length":4096,"max_output_tokens":1,"architecture":{"input_modalities":["text","image"],"output_modalities":["image"]},"supported_parameters":[],"supports_thinking":false,"thinking_forced":false,"pricing":{},"pricing_krw":{},"pricing_tiers":[],"pricing_variants":[],"providers":[{"provider":"modelark","input_price_usd":0.0,"output_price_usd":0.03,"markup_tier":"medium","effective_markup_percent":0.0,"context_window":4096,"max_output":1,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{},"pricing_krw":{},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text","image"],"output_modalities":["image"],"description":"ByteDance Seedream 4.0 is ByteDance's Seedream-line option for image generation from text or reference inputs.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"dola-seedream-5-0-pro-260628","object":"model","created":0,"owned_by":"pleum","provider":"modelark","display_name":"ByteDance Dola Seedream 5.0 Pro","modality":"image","price_unit":"image","input_price_usd":0.003,"output_price_usd":0.045,"markup_tier":"medium","effective_markup_percent":0.0,"context_window":4096,"max_output":1,"is_active":true,"operations":["image.generate"],"maker":"ByteDance","context_length":4096,"max_output_tokens":1,"architecture":{"input_modalities":["text","image"],"output_modalities":["image"]},"supported_parameters":[],"supports_thinking":false,"thinking_forced":false,"pricing":{},"pricing_krw":{},"pricing_tiers":[],"pricing_variants":[{"id":"up_to_2_36mp","match":{"output_pixels":{"lte":2359296}},"input_price_usd":0.003,"output_price_usd":0.045,"input_free_quantity":1,"price_unit":"image"},{"id":"over_2_36mp","match":{"output_pixels":{"gt":2359296}},"input_price_usd":0.003,"output_price_usd":0.09,"input_free_quantity":1,"price_unit":"image"},{"id":"default","match":{},"input_price_usd":0.003,"output_price_usd":0.09,"input_free_quantity":1,"price_unit":"image"}],"providers":[{"provider":"modelark","input_price_usd":0.003,"output_price_usd":0.045,"markup_tier":"medium","effective_markup_percent":0.0,"context_window":4096,"max_output":1,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{},"pricing_krw":{},"peak_pricing":null,"pricing_policy":{"version":1,"kind":"variants","variants":[{"id":"up_to_2_36mp","match":{"output_pixels":{"lte":2359296}},"input_price_usd":0.003,"output_price_usd":0.045,"input_free_quantity":1,"price_unit":"image"},{"id":"over_2_36mp","match":{"output_pixels":{"gt":2359296}},"input_price_usd":0.003,"output_price_usd":0.09,"input_free_quantity":1,"price_unit":"image"},{"id":"default","match":{},"input_price_usd":0.003,"output_price_usd":0.09,"input_free_quantity":1,"price_unit":"image"}]},"pricing_tiers":[],"pricing_variants":[{"id":"up_to_2_36mp","match":{"output_pixels":{"lte":2359296}},"input_price_usd":0.003,"output_price_usd":0.045,"input_free_quantity":1,"price_unit":"image"},{"id":"over_2_36mp","match":{"output_pixels":{"gt":2359296}},"input_price_usd":0.003,"output_price_usd":0.09,"input_free_quantity":1,"price_unit":"image"},{"id":"default","match":{},"input_price_usd":0.003,"output_price_usd":0.09,"input_free_quantity":1,"price_unit":"image"}]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text","image"],"output_modalities":["image"],"description":"ByteDance Dola Seedream 5.0 Pro is ByteDance's Seedream-line option for image generation from text or reference inputs.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"seedream-5-0-260128","object":"model","created":0,"owned_by":"pleum","provider":"modelark","display_name":"ByteDance Seedream 5.0 Lite","modality":"image","price_unit":"image","input_price_usd":0.0,"output_price_usd":0.035,"markup_tier":"medium","effective_markup_percent":0.0,"context_window":4096,"max_output":1,"is_active":true,"operations":["image.generate"],"maker":"ByteDance","context_length":4096,"max_output_tokens":1,"architecture":{"input_modalities":["text","image"],"output_modalities":["image"]},"supported_parameters":[],"supports_thinking":false,"thinking_forced":false,"pricing":{},"pricing_krw":{},"pricing_tiers":[],"pricing_variants":[{"id":"default","match":{},"input_price_usd":0.0,"output_price_usd":0.035,"price_unit":"image"}],"providers":[{"provider":"modelark","input_price_usd":0.0,"output_price_usd":0.035,"markup_tier":"medium","effective_markup_percent":0.0,"context_window":4096,"max_output":1,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{},"pricing_krw":{},"peak_pricing":null,"pricing_policy":{"version":1,"kind":"variants","variants":[{"id":"default","match":{},"input_price_usd":0.0,"output_price_usd":0.035,"price_unit":"image"}]},"pricing_tiers":[],"pricing_variants":[{"id":"default","match":{},"input_price_usd":0.0,"output_price_usd":0.035,"price_unit":"image"}]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text","image"],"output_modalities":["image"],"description":"ByteDance Seedream 5.0 Lite is ByteDance's Seedream-line option for image generation from text or reference inputs.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"google/gemma-4-26B-A4B-it","object":"model","created":0,"owned_by":"pleum","provider":"deepinfra","display_name":"Gemma 4 26B A4B","modality":"text","price_unit":"token","input_price_usd":0.07,"output_price_usd":0.34,"markup_tier":"high","effective_markup_percent":0.0,"context_window":262144,"max_output":32768,"is_active":true,"operations":["chat.generate"],"maker":"Google","context_length":262144,"max_output_tokens":32768,"architecture":{"input_modalities":["text"],"output_modalities":["text"]},"supported_parameters":["temperature","max_tokens","top_p","stop","seed","frequency_penalty","presence_penalty","tools","tool_choice","response_format","parallel_tool_calls","logit_bias","stream"],"supports_thinking":false,"thinking_forced":false,"pricing":{"prompt":"0.00000007","completion":"0.00000034"},"pricing_krw":{"prompt":"0.000094691100","completion":"0.000459928200"},"pricing_tiers":[],"pricing_variants":[],"providers":[{"provider":"deepinfra","input_price_usd":0.07,"output_price_usd":0.34,"markup_tier":"high","effective_markup_percent":0.0,"context_window":262144,"max_output":32768,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.00000007","completion":"0.00000034"},"pricing_krw":{"prompt":"0.000094691100","completion":"0.000459928200"},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text"],"output_modalities":["text"],"description":"Within Google's Gemma lineup, gemma 4 26B A4B it is intended for understanding visual inputs such as images and documents and returning text. For this 26B-class variant, the catalog lists a 262,144-token context window and up to 32,768 output tokens.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"seedream-4-5-251128","object":"model","created":0,"owned_by":"pleum","provider":"modelark","display_name":"ByteDance Seedream 4.5","modality":"image","price_unit":"image","input_price_usd":0.0,"output_price_usd":0.04,"markup_tier":"medium","effective_markup_percent":0.0,"context_window":4096,"max_output":1,"is_active":true,"operations":["image.generate"],"maker":"ByteDance","context_length":4096,"max_output_tokens":1,"architecture":{"input_modalities":["text","image"],"output_modalities":["image"]},"supported_parameters":[],"supports_thinking":false,"thinking_forced":false,"pricing":{},"pricing_krw":{},"pricing_tiers":[],"pricing_variants":[{"id":"default","match":{},"input_price_usd":0.0,"output_price_usd":0.04,"price_unit":"image"}],"providers":[{"provider":"modelark","input_price_usd":0.0,"output_price_usd":0.04,"markup_tier":"medium","effective_markup_percent":0.0,"context_window":4096,"max_output":1,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{},"pricing_krw":{},"peak_pricing":null,"pricing_policy":{"version":1,"kind":"variants","variants":[{"id":"default","match":{},"input_price_usd":0.0,"output_price_usd":0.04,"price_unit":"image"}]},"pricing_tiers":[],"pricing_variants":[{"id":"default","match":{},"input_price_usd":0.0,"output_price_usd":0.04,"price_unit":"image"}]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text","image"],"output_modalities":["image"],"description":"ByteDance Seedream 4.5 is ByteDance's Seedream-line option for image generation from text or reference inputs.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"google/gemma-4-31B-it","object":"model","created":0,"owned_by":"pleum","provider":"deepinfra","display_name":"Gemma 4 31B","modality":"text","price_unit":"token","input_price_usd":0.13,"output_price_usd":0.38,"markup_tier":"high","effective_markup_percent":0.0,"context_window":262144,"max_output":32768,"is_active":true,"operations":["chat.generate"],"maker":"Google","context_length":262144,"max_output_tokens":32768,"architecture":{"input_modalities":["text","image"],"output_modalities":["text"]},"supported_parameters":["temperature","max_tokens","top_p","stop","seed","frequency_penalty","presence_penalty","tools","tool_choice","response_format","parallel_tool_calls","logit_bias","stream"],"supports_thinking":false,"thinking_forced":false,"pricing":{"prompt":"0.00000013","completion":"0.00000038"},"pricing_krw":{"prompt":"0.000175854900","completion":"0.000514037400"},"pricing_tiers":[],"pricing_variants":[],"providers":[{"provider":"deepinfra","input_price_usd":0.13,"output_price_usd":0.38,"markup_tier":"high","effective_markup_percent":0.0,"context_window":262144,"max_output":32768,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.00000013","completion":"0.00000038"},"pricing_krw":{"prompt":"0.000175854900","completion":"0.000514037400"},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]},{"provider":"friendli","input_price_usd":0.14,"output_price_usd":0.4,"markup_tier":"medium","effective_markup_percent":0.0,"context_window":262144,"max_output":32768,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.00000014","completion":"0.0000004"},"pricing_krw":{"prompt":"0.000189382200","completion":"0.00054109200"},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]},{"provider":"together","input_price_usd":0.39,"output_price_usd":0.97,"markup_tier":"medium","effective_markup_percent":0.0,"context_window":262144,"max_output":8192,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.00000039","completion":"0.00000097"},"pricing_krw":{"prompt":"0.000527564700","completion":"0.001312148100"},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text","image"],"output_modalities":["text"],"description":"Within Google's Gemma lineup, Gemma 4 31B (friendli) is intended for understanding visual inputs such as images and documents and returning text. For this 31B-class variant, the catalog lists a 262,144-token context window and up to 32,768 output tokens.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"veo-3.1-generate-preview","object":"model","created":0,"owned_by":"pleum","provider":"google","display_name":"Veo 3.1 (Preview)","modality":"video","price_unit":"second","input_price_usd":0.0,"output_price_usd":0.4,"markup_tier":"medium","effective_markup_percent":0.0,"context_window":1024,"max_output":1,"is_active":true,"operations":["video.generate"],"maker":"Google","context_length":1024,"max_output_tokens":1,"architecture":{"input_modalities":["text"],"output_modalities":["video"]},"supported_parameters":[],"supports_thinking":false,"thinking_forced":false,"pricing":{},"pricing_krw":{},"pricing_tiers":[],"pricing_variants":[],"providers":[{"provider":"google","input_price_usd":0.0,"output_price_usd":0.4,"markup_tier":"medium","effective_markup_percent":0.0,"context_window":1024,"max_output":1,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{},"pricing_krw":{},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text"],"output_modalities":["video"],"description":"Veo 3.1 Preview is Google's model for generating high-fidelity video with native audio at 720p, 1080p, or 4K. The current PleumRouter transport exposes prompt-based video generation only.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"veo-3.1-fast-generate-preview","object":"model","created":0,"owned_by":"pleum","provider":"google","display_name":"Veo 3.1 Fast (Preview)","modality":"video","price_unit":"second","input_price_usd":0.0,"output_price_usd":0.1,"markup_tier":"medium","effective_markup_percent":0.0,"context_window":1024,"max_output":1,"is_active":true,"operations":["video.generate"],"maker":"Google","context_length":1024,"max_output_tokens":1,"architecture":{"input_modalities":["text"],"output_modalities":["video"]},"supported_parameters":[],"supports_thinking":false,"thinking_forced":false,"pricing":{},"pricing_krw":{},"pricing_tiers":[],"pricing_variants":[],"providers":[{"provider":"google","input_price_usd":0.0,"output_price_usd":0.1,"markup_tier":"medium","effective_markup_percent":0.0,"context_window":1024,"max_output":1,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{},"pricing_krw":{},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text"],"output_modalities":["video"],"description":"Veo 3.1 Fast (Preview) is a video model available through PleumRouter. Review its catalog metadata for supported capabilities and pricing.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"veo-3.1-lite-generate-preview","object":"model","created":0,"owned_by":"pleum","provider":"google","display_name":"Veo 3.1 Lite (Preview)","modality":"video","price_unit":"second","input_price_usd":0.0,"output_price_usd":0.05,"markup_tier":"high","effective_markup_percent":0.0,"context_window":1024,"max_output":1,"is_active":true,"operations":["video.generate"],"maker":"Google","context_length":1024,"max_output_tokens":1,"architecture":{"input_modalities":["text"],"output_modalities":["video"]},"supported_parameters":[],"supports_thinking":false,"thinking_forced":false,"pricing":{},"pricing_krw":{},"pricing_tiers":[],"pricing_variants":[],"providers":[{"provider":"google","input_price_usd":0.0,"output_price_usd":0.05,"markup_tier":"high","effective_markup_percent":0.0,"context_window":1024,"max_output":1,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{},"pricing_krw":{},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text"],"output_modalities":["video"],"description":"Veo 3.1 Lite (Preview) is a video model available through PleumRouter. Review its catalog metadata for supported capabilities and pricing.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"kling-v3","object":"model","created":0,"owned_by":"pleum","provider":"kling","display_name":"Kling V3","modality":"video","price_unit":"second","input_price_usd":0.0,"output_price_usd":0.42,"markup_tier":"medium","effective_markup_percent":0.0,"context_window":1024,"max_output":1,"is_active":true,"operations":["video.generate"],"maker":"Kling","context_length":1024,"max_output_tokens":1,"architecture":{"input_modalities":["text","image"],"output_modalities":["video"]},"supported_parameters":[],"supports_thinking":false,"thinking_forced":false,"pricing":{},"pricing_krw":{},"pricing_tiers":[],"pricing_variants":[{"id":"720p","match":{"resolution":"720p"},"input_price_usd":0.0,"output_price_usd":0.084,"price_unit":"second"},{"id":"1080p","match":{"resolution":"1080p"},"input_price_usd":0.0,"output_price_usd":0.112,"price_unit":"second"},{"id":"4k","match":{"resolution":"4k"},"input_price_usd":0.0,"output_price_usd":0.42,"price_unit":"second"},{"id":"default","match":{},"input_price_usd":0.0,"output_price_usd":0.42,"price_unit":"second"}],"providers":[{"provider":"kling","input_price_usd":0.0,"output_price_usd":0.42,"markup_tier":"medium","effective_markup_percent":0.0,"context_window":1024,"max_output":1,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{},"pricing_krw":{},"peak_pricing":null,"pricing_policy":{"version":1,"kind":"variants","variants":[{"id":"720p","match":{"resolution":"720p"},"input_price_usd":0.0,"output_price_usd":0.084,"price_unit":"second"},{"id":"1080p","match":{"resolution":"1080p"},"input_price_usd":0.0,"output_price_usd":0.112,"price_unit":"second"},{"id":"4k","match":{"resolution":"4k"},"input_price_usd":0.0,"output_price_usd":0.42,"price_unit":"second"},{"id":"default","match":{},"input_price_usd":0.0,"output_price_usd":0.42,"price_unit":"second"}]},"pricing_tiers":[],"pricing_variants":[{"id":"720p","match":{"resolution":"720p"},"input_price_usd":0.0,"output_price_usd":0.084,"price_unit":"second"},{"id":"1080p","match":{"resolution":"1080p"},"input_price_usd":0.0,"output_price_usd":0.112,"price_unit":"second"},{"id":"4k","match":{"resolution":"4k"},"input_price_usd":0.0,"output_price_usd":0.42,"price_unit":"second"},{"id":"default","match":{},"input_price_usd":0.0,"output_price_usd":0.42,"price_unit":"second"}]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text","image"],"output_modalities":["video"],"description":"Kling V3 is Kling's video-generation model from text or an image; Pleum currently exposes text and one image only.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":0.8,"promo_ends_at":"2027-01-01T00:00:00+09:00"},{"id":"seedance-1-0-pro-250528","object":"model","created":0,"owned_by":"pleum","provider":"modelark","display_name":"ByteDance Seedance 1.0 Pro","modality":"video","price_unit":"token","input_price_usd":0.0,"output_price_usd":2.5,"markup_tier":"medium","effective_markup_percent":0.0,"context_window":1024,"max_output":1,"is_active":true,"operations":["video.generate"],"maker":"ByteDance","context_length":1024,"max_output_tokens":1,"architecture":{"input_modalities":["text","image"],"output_modalities":["video"]},"supported_parameters":[],"supports_thinking":false,"thinking_forced":false,"pricing":{"prompt":"0.00","completion":"0.0000025"},"pricing_krw":{"prompt":"0.000000","completion":"0.00338182500"},"pricing_tiers":[],"pricing_variants":[{"id":"online","match":{},"input_price_usd":0.0,"output_price_usd":2.5,"price_unit":"token"}],"providers":[{"provider":"modelark","input_price_usd":0.0,"output_price_usd":2.5,"markup_tier":"medium","effective_markup_percent":0.0,"context_window":1024,"max_output":1,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.00","completion":"0.0000025"},"pricing_krw":{"prompt":"0.000000","completion":"0.00338182500"},"peak_pricing":null,"pricing_policy":{"version":1,"kind":"variants","variants":[{"id":"online","match":{},"input_price_usd":0.0,"output_price_usd":2.5,"price_unit":"token"}]},"pricing_tiers":[],"pricing_variants":[{"id":"online","match":{},"input_price_usd":0.0,"output_price_usd":2.5,"price_unit":"token"}]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text","image"],"output_modalities":["video"],"description":"Built in ByteDance's Seedance line, ByteDance Seedance 1.0 Pro handles video generation from text or visual inputs.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"seedance-1-5-pro-251215","object":"model","created":0,"owned_by":"pleum","provider":"modelark","display_name":"ByteDance Seedance 1.5 Pro","modality":"video","price_unit":"token","input_price_usd":0.0,"output_price_usd":1.2,"markup_tier":"medium","effective_markup_percent":0.0,"context_window":1024,"max_output":1,"is_active":true,"operations":["video.generate"],"maker":"ByteDance","context_length":1024,"max_output_tokens":1,"architecture":{"input_modalities":["text","image"],"output_modalities":["video"]},"supported_parameters":[],"supports_thinking":false,"thinking_forced":false,"pricing":{"prompt":"0.00","completion":"0.0000012"},"pricing_krw":{"prompt":"0.000000","completion":"0.00162327600"},"pricing_tiers":[],"pricing_variants":[{"id":"online_silent","match":{"generate_audio":false},"input_price_usd":0.0,"output_price_usd":1.2,"price_unit":"token"},{"id":"online_audio","match":{"generate_audio":true},"input_price_usd":0.0,"output_price_usd":2.4,"price_unit":"token"},{"id":"default","match":{},"input_price_usd":0.0,"output_price_usd":2.4,"price_unit":"token"}],"providers":[{"provider":"modelark","input_price_usd":0.0,"output_price_usd":1.2,"markup_tier":"medium","effective_markup_percent":0.0,"context_window":1024,"max_output":1,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.00","completion":"0.0000012"},"pricing_krw":{"prompt":"0.000000","completion":"0.00162327600"},"peak_pricing":null,"pricing_policy":{"version":1,"kind":"variants","variants":[{"id":"online_silent","match":{"generate_audio":false},"input_price_usd":0.0,"output_price_usd":1.2,"price_unit":"token"},{"id":"online_audio","match":{"generate_audio":true},"input_price_usd":0.0,"output_price_usd":2.4,"price_unit":"token"},{"id":"default","match":{},"input_price_usd":0.0,"output_price_usd":2.4,"price_unit":"token"}]},"pricing_tiers":[],"pricing_variants":[{"id":"online_silent","match":{"generate_audio":false},"input_price_usd":0.0,"output_price_usd":1.2,"price_unit":"token"},{"id":"online_audio","match":{"generate_audio":true},"input_price_usd":0.0,"output_price_usd":2.4,"price_unit":"token"},{"id":"default","match":{},"input_price_usd":0.0,"output_price_usd":2.4,"price_unit":"token"}]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text","image"],"output_modalities":["video"],"description":"Built in ByteDance's Seedance line, ByteDance Seedance 1.5 Pro handles video generation from text or visual inputs.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"dreamina-seedance-2-0-260128","object":"model","created":0,"owned_by":"pleum","provider":"modelark","display_name":"Dreamina Seedance 2.0","modality":"video","price_unit":"token","input_price_usd":0.0,"output_price_usd":7.0,"markup_tier":"medium","effective_markup_percent":0.0,"context_window":1024,"max_output":1,"is_active":true,"operations":["video.generate"],"maker":"ByteDance","context_length":1024,"max_output_tokens":1,"architecture":{"input_modalities":["text","image","video","audio"],"output_modalities":["video"]},"supported_parameters":[],"supports_thinking":false,"thinking_forced":false,"pricing":{"prompt":"0.00","completion":"0.000007"},"pricing_krw":{"prompt":"0.000000","completion":"0.0094691100"},"pricing_tiers":[],"pricing_variants":[{"id":"480_720p_video_input","match":{"resolution":["480p","720p"],"has_input_video":true},"input_price_usd":0.0,"output_price_usd":4.3,"price_unit":"token"},{"id":"480_720p_without_video_input","match":{"resolution":["480p","720p"],"has_input_video":false},"input_price_usd":0.0,"output_price_usd":7.0,"price_unit":"token"},{"id":"1080p_video_input","match":{"resolution":"1080p","has_input_video":true},"input_price_usd":0.0,"output_price_usd":4.7,"price_unit":"token"},{"id":"1080p_without_video_input","match":{"resolution":"1080p","has_input_video":false},"input_price_usd":0.0,"output_price_usd":7.7,"price_unit":"token"},{"id":"4k_video_input","match":{"resolution":"4k","has_input_video":true},"input_price_usd":0.0,"output_price_usd":2.4,"price_unit":"token"},{"id":"4k_without_video_input","match":{"resolution":"4k","has_input_video":false},"input_price_usd":0.0,"output_price_usd":4.0,"price_unit":"token"},{"id":"default","match":{},"input_price_usd":0.0,"output_price_usd":7.7,"price_unit":"token"}],"providers":[{"provider":"modelark","input_price_usd":0.0,"output_price_usd":7.0,"markup_tier":"medium","effective_markup_percent":0.0,"context_window":1024,"max_output":1,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.00","completion":"0.000007"},"pricing_krw":{"prompt":"0.000000","completion":"0.0094691100"},"peak_pricing":null,"pricing_policy":{"version":1,"kind":"variants","variants":[{"id":"480_720p_video_input","match":{"resolution":["480p","720p"],"has_input_video":true},"input_price_usd":0.0,"output_price_usd":4.3,"price_unit":"token"},{"id":"480_720p_without_video_input","match":{"resolution":["480p","720p"],"has_input_video":false},"input_price_usd":0.0,"output_price_usd":7.0,"price_unit":"token"},{"id":"1080p_video_input","match":{"resolution":"1080p","has_input_video":true},"input_price_usd":0.0,"output_price_usd":4.7,"price_unit":"token"},{"id":"1080p_without_video_input","match":{"resolution":"1080p","has_input_video":false},"input_price_usd":0.0,"output_price_usd":7.7,"price_unit":"token"},{"id":"4k_video_input","match":{"resolution":"4k","has_input_video":true},"input_price_usd":0.0,"output_price_usd":2.4,"price_unit":"token"},{"id":"4k_without_video_input","match":{"resolution":"4k","has_input_video":false},"input_price_usd":0.0,"output_price_usd":4.0,"price_unit":"token"},{"id":"default","match":{},"input_price_usd":0.0,"output_price_usd":7.7,"price_unit":"token"}]},"pricing_tiers":[],"pricing_variants":[{"id":"480_720p_video_input","match":{"resolution":["480p","720p"],"has_input_video":true},"input_price_usd":0.0,"output_price_usd":4.3,"price_unit":"token"},{"id":"480_720p_without_video_input","match":{"resolution":["480p","720p"],"has_input_video":false},"input_price_usd":0.0,"output_price_usd":7.0,"price_unit":"token"},{"id":"1080p_video_input","match":{"resolution":"1080p","has_input_video":true},"input_price_usd":0.0,"output_price_usd":4.7,"price_unit":"token"},{"id":"1080p_without_video_input","match":{"resolution":"1080p","has_input_video":false},"input_price_usd":0.0,"output_price_usd":7.7,"price_unit":"token"},{"id":"4k_video_input","match":{"resolution":"4k","has_input_video":true},"input_price_usd":0.0,"output_price_usd":2.4,"price_unit":"token"},{"id":"4k_without_video_input","match":{"resolution":"4k","has_input_video":false},"input_price_usd":0.0,"output_price_usd":4.0,"price_unit":"token"},{"id":"default","match":{},"input_price_usd":0.0,"output_price_usd":7.7,"price_unit":"token"}]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text","image","video","audio"],"output_modalities":["video"],"description":"Built in ByteDance's Seedance line, Dreamina Seedance 2.0 handles video generation from text or visual inputs.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"dreamina-seedance-2-0-fast-260128","object":"model","created":0,"owned_by":"pleum","provider":"modelark","display_name":"Dreamina Seedance 2.0 Fast","modality":"video","price_unit":"token","input_price_usd":0.0,"output_price_usd":5.6,"markup_tier":"medium","effective_markup_percent":0.0,"context_window":1024,"max_output":1,"is_active":true,"operations":["video.generate"],"maker":"ByteDance","context_length":1024,"max_output_tokens":1,"architecture":{"input_modalities":["text","image","video","audio"],"output_modalities":["video"]},"supported_parameters":[],"supports_thinking":false,"thinking_forced":false,"pricing":{"prompt":"0.00","completion":"0.0000056"},"pricing_krw":{"prompt":"0.000000","completion":"0.00757528800"},"pricing_tiers":[],"pricing_variants":[{"id":"480_720p_video_input","match":{"resolution":["480p","720p"],"has_input_video":true},"input_price_usd":0.0,"output_price_usd":3.3,"price_unit":"token"},{"id":"480_720p_without_video_input","match":{"resolution":["480p","720p"],"has_input_video":false},"input_price_usd":0.0,"output_price_usd":5.6,"price_unit":"token"},{"id":"default","match":{},"input_price_usd":0.0,"output_price_usd":5.6,"price_unit":"token"}],"providers":[{"provider":"modelark","input_price_usd":0.0,"output_price_usd":5.6,"markup_tier":"medium","effective_markup_percent":0.0,"context_window":1024,"max_output":1,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.00","completion":"0.0000056"},"pricing_krw":{"prompt":"0.000000","completion":"0.00757528800"},"peak_pricing":null,"pricing_policy":{"version":1,"kind":"variants","variants":[{"id":"480_720p_video_input","match":{"resolution":["480p","720p"],"has_input_video":true},"input_price_usd":0.0,"output_price_usd":3.3,"price_unit":"token"},{"id":"480_720p_without_video_input","match":{"resolution":["480p","720p"],"has_input_video":false},"input_price_usd":0.0,"output_price_usd":5.6,"price_unit":"token"},{"id":"default","match":{},"input_price_usd":0.0,"output_price_usd":5.6,"price_unit":"token"}]},"pricing_tiers":[],"pricing_variants":[{"id":"480_720p_video_input","match":{"resolution":["480p","720p"],"has_input_video":true},"input_price_usd":0.0,"output_price_usd":3.3,"price_unit":"token"},{"id":"480_720p_without_video_input","match":{"resolution":["480p","720p"],"has_input_video":false},"input_price_usd":0.0,"output_price_usd":5.6,"price_unit":"token"},{"id":"default","match":{},"input_price_usd":0.0,"output_price_usd":5.6,"price_unit":"token"}]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text","image","video","audio"],"output_modalities":["video"],"description":"Built in ByteDance's Seedance line, Dreamina Seedance 2.0 Fast handles video generation from text or visual inputs.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"dreamina-seedance-2-0-mini-260615","object":"model","created":0,"owned_by":"pleum","provider":"modelark","display_name":"Dreamina Seedance 2.0 Mini","modality":"video","price_unit":"token","input_price_usd":0.0,"output_price_usd":3.5,"markup_tier":"high","effective_markup_percent":0.0,"context_window":1024,"max_output":1,"is_active":true,"operations":["video.generate"],"maker":"ByteDance","context_length":1024,"max_output_tokens":1,"architecture":{"input_modalities":["text","image"],"output_modalities":["video"]},"supported_parameters":[],"supports_thinking":false,"thinking_forced":false,"pricing":{"prompt":"0.00","completion":"0.0000035"},"pricing_krw":{"prompt":"0.000000","completion":"0.00473455500"},"pricing_tiers":[],"pricing_variants":[{"id":"480_720p_video_input","match":{"resolution":["480p","720p"],"has_input_video":true},"input_price_usd":0.0,"output_price_usd":2.1,"price_unit":"token"},{"id":"480_720p_without_video_input","match":{"resolution":["480p","720p"],"has_input_video":false},"input_price_usd":0.0,"output_price_usd":3.5,"price_unit":"token"},{"id":"default","match":{},"input_price_usd":0.0,"output_price_usd":3.5,"price_unit":"token"}],"providers":[{"provider":"modelark","input_price_usd":0.0,"output_price_usd":3.5,"markup_tier":"high","effective_markup_percent":0.0,"context_window":1024,"max_output":1,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.00","completion":"0.0000035"},"pricing_krw":{"prompt":"0.000000","completion":"0.00473455500"},"peak_pricing":null,"pricing_policy":{"version":1,"kind":"variants","variants":[{"id":"480_720p_video_input","match":{"resolution":["480p","720p"],"has_input_video":true},"input_price_usd":0.0,"output_price_usd":2.1,"price_unit":"token"},{"id":"480_720p_without_video_input","match":{"resolution":["480p","720p"],"has_input_video":false},"input_price_usd":0.0,"output_price_usd":3.5,"price_unit":"token"},{"id":"default","match":{},"input_price_usd":0.0,"output_price_usd":3.5,"price_unit":"token"}]},"pricing_tiers":[],"pricing_variants":[{"id":"480_720p_video_input","match":{"resolution":["480p","720p"],"has_input_video":true},"input_price_usd":0.0,"output_price_usd":2.1,"price_unit":"token"},{"id":"480_720p_without_video_input","match":{"resolution":["480p","720p"],"has_input_video":false},"input_price_usd":0.0,"output_price_usd":3.5,"price_unit":"token"},{"id":"default","match":{},"input_price_usd":0.0,"output_price_usd":3.5,"price_unit":"token"}]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text","image"],"output_modalities":["video"],"description":"Built in ByteDance's Seedance line, Dreamina Seedance 2.0 Mini handles video generation from text or visual inputs.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"seedance-1-0-pro-fast-251015","object":"model","created":0,"owned_by":"pleum","provider":"modelark","display_name":"ByteDance Seedance 1.0 Pro Fast","modality":"video","price_unit":"token","input_price_usd":0.0,"output_price_usd":1.0,"markup_tier":"high","effective_markup_percent":0.0,"context_window":1024,"max_output":1,"is_active":true,"operations":["video.generate"],"maker":"ByteDance","context_length":1024,"max_output_tokens":1,"architecture":{"input_modalities":["text","image"],"output_modalities":["video"]},"supported_parameters":[],"supports_thinking":false,"thinking_forced":false,"pricing":{"prompt":"0.00","completion":"0.000001"},"pricing_krw":{"prompt":"0.000000","completion":"0.0013527300"},"pricing_tiers":[],"pricing_variants":[{"id":"online","match":{},"input_price_usd":0.0,"output_price_usd":1.0,"price_unit":"token"}],"providers":[{"provider":"modelark","input_price_usd":0.0,"output_price_usd":1.0,"markup_tier":"high","effective_markup_percent":0.0,"context_window":1024,"max_output":1,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.00","completion":"0.000001"},"pricing_krw":{"prompt":"0.000000","completion":"0.0013527300"},"peak_pricing":null,"pricing_policy":{"version":1,"kind":"variants","variants":[{"id":"online","match":{},"input_price_usd":0.0,"output_price_usd":1.0,"price_unit":"token"}]},"pricing_tiers":[],"pricing_variants":[{"id":"online","match":{},"input_price_usd":0.0,"output_price_usd":1.0,"price_unit":"token"}]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text","image"],"output_modalities":["video"],"description":"Built in ByteDance's Seedance line, ByteDance Seedance 1.0 Pro Fast handles video generation from text or visual inputs.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"dreamina-seedance-2-5-260628","object":"model","created":0,"owned_by":"pleum","provider":"modelark","display_name":"Dreamina Seedance 2.5","modality":"video","price_unit":"token","input_price_usd":0.0,"output_price_usd":10.7,"markup_tier":"medium","effective_markup_percent":0.0,"context_window":1024,"max_output":1,"is_active":true,"operations":["video.generate"],"maker":"ByteDance","context_length":1024,"max_output_tokens":1,"architecture":{"input_modalities":["text","image","video","audio"],"output_modalities":["video"]},"supported_parameters":[],"supports_thinking":false,"thinking_forced":false,"pricing":{"prompt":"0.00","completion":"0.0000107"},"pricing_krw":{"prompt":"0.000000","completion":"0.01447421100"},"pricing_tiers":[],"pricing_variants":[{"id":"480_720p_video_input","match":{"resolution":["480p","720p"],"has_input_video":true},"input_price_usd":0.0,"output_price_usd":6.4,"price_unit":"token"},{"id":"480_720p_without_video_input","match":{"resolution":["480p","720p"],"has_input_video":false},"input_price_usd":0.0,"output_price_usd":10.7,"price_unit":"token"},{"id":"default","match":{},"input_price_usd":0.0,"output_price_usd":10.7,"price_unit":"token"}],"providers":[{"provider":"modelark","input_price_usd":0.0,"output_price_usd":10.7,"markup_tier":"medium","effective_markup_percent":0.0,"context_window":1024,"max_output":1,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.00","completion":"0.0000107"},"pricing_krw":{"prompt":"0.000000","completion":"0.01447421100"},"peak_pricing":null,"pricing_policy":{"version":1,"kind":"variants","variants":[{"id":"480_720p_video_input","match":{"resolution":["480p","720p"],"has_input_video":true},"input_price_usd":0.0,"output_price_usd":6.4,"price_unit":"token"},{"id":"480_720p_without_video_input","match":{"resolution":["480p","720p"],"has_input_video":false},"input_price_usd":0.0,"output_price_usd":10.7,"price_unit":"token"},{"id":"default","match":{},"input_price_usd":0.0,"output_price_usd":10.7,"price_unit":"token"}]},"pricing_tiers":[],"pricing_variants":[{"id":"480_720p_video_input","match":{"resolution":["480p","720p"],"has_input_video":true},"input_price_usd":0.0,"output_price_usd":6.4,"price_unit":"token"},{"id":"480_720p_without_video_input","match":{"resolution":["480p","720p"],"has_input_video":false},"input_price_usd":0.0,"output_price_usd":10.7,"price_unit":"token"},{"id":"default","match":{},"input_price_usd":0.0,"output_price_usd":10.7,"price_unit":"token"}]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text","image","video","audio"],"output_modalities":["video"],"description":"Built in ByteDance's Seedance line, Dreamina Seedance 2.5 generates up to 30-second single-pass video with multimodal reference inputs and region-level editing.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"kling-v3-turbo","object":"model","created":0,"owned_by":"pleum","provider":"kling","display_name":"Kling V3 Turbo","modality":"video","price_unit":"second","input_price_usd":0.0,"output_price_usd":0.14,"markup_tier":"medium","effective_markup_percent":0.0,"context_window":1024,"max_output":1,"is_active":true,"operations":["video.generate"],"maker":"Kling","context_length":1024,"max_output_tokens":1,"architecture":{"input_modalities":["text","image"],"output_modalities":["video"]},"supported_parameters":[],"supports_thinking":false,"thinking_forced":false,"pricing":{},"pricing_krw":{},"pricing_tiers":[],"pricing_variants":[{"id":"720p","match":{"resolution":"720p"},"input_price_usd":0.0,"output_price_usd":0.112,"price_unit":"second"},{"id":"1080p","match":{"resolution":"1080p"},"input_price_usd":0.0,"output_price_usd":0.14,"price_unit":"second"},{"id":"default","match":{},"input_price_usd":0.0,"output_price_usd":0.14,"price_unit":"second"}],"providers":[{"provider":"kling","input_price_usd":0.0,"output_price_usd":0.14,"markup_tier":"medium","effective_markup_percent":0.0,"context_window":1024,"max_output":1,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{},"pricing_krw":{},"peak_pricing":null,"pricing_policy":{"version":1,"kind":"variants","variants":[{"id":"720p","match":{"resolution":"720p"},"input_price_usd":0.0,"output_price_usd":0.112,"price_unit":"second"},{"id":"1080p","match":{"resolution":"1080p"},"input_price_usd":0.0,"output_price_usd":0.14,"price_unit":"second"},{"id":"default","match":{},"input_price_usd":0.0,"output_price_usd":0.14,"price_unit":"second"}]},"pricing_tiers":[],"pricing_variants":[{"id":"720p","match":{"resolution":"720p"},"input_price_usd":0.0,"output_price_usd":0.112,"price_unit":"second"},{"id":"1080p","match":{"resolution":"1080p"},"input_price_usd":0.0,"output_price_usd":0.14,"price_unit":"second"},{"id":"default","match":{},"input_price_usd":0.0,"output_price_usd":0.14,"price_unit":"second"}]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text","image"],"output_modalities":["video"],"description":"Kling V3 Turbo is Kling's fast V3 video model with native audio; Pleum does not expose separate voice controls.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":0.8,"promo_ends_at":"2027-01-01T00:00:00+09:00"},{"id":"kling-v3-omni","object":"model","created":0,"owned_by":"pleum","provider":"kling","display_name":"Kling V3 Omni","modality":"video","price_unit":"second","input_price_usd":0.0,"output_price_usd":0.42,"markup_tier":"medium","effective_markup_percent":0.0,"context_window":1024,"max_output":1,"is_active":true,"operations":["video.generate"],"maker":"Kling","context_length":1024,"max_output_tokens":1,"architecture":{"input_modalities":["text","image"],"output_modalities":["video"]},"supported_parameters":[],"supports_thinking":false,"thinking_forced":false,"pricing":{},"pricing_krw":{},"pricing_tiers":[],"pricing_variants":[{"id":"720p","match":{"resolution":"720p"},"input_price_usd":0.0,"output_price_usd":0.084,"price_unit":"second"},{"id":"1080p","match":{"resolution":"1080p"},"input_price_usd":0.0,"output_price_usd":0.112,"price_unit":"second"},{"id":"4k","match":{"resolution":"4k"},"input_price_usd":0.0,"output_price_usd":0.42,"price_unit":"second"},{"id":"default","match":{},"input_price_usd":0.0,"output_price_usd":0.42,"price_unit":"second"}],"providers":[{"provider":"kling","input_price_usd":0.0,"output_price_usd":0.42,"markup_tier":"medium","effective_markup_percent":0.0,"context_window":1024,"max_output":1,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{},"pricing_krw":{},"peak_pricing":null,"pricing_policy":{"version":1,"kind":"variants","variants":[{"id":"720p","match":{"resolution":"720p"},"input_price_usd":0.0,"output_price_usd":0.084,"price_unit":"second"},{"id":"1080p","match":{"resolution":"1080p"},"input_price_usd":0.0,"output_price_usd":0.112,"price_unit":"second"},{"id":"4k","match":{"resolution":"4k"},"input_price_usd":0.0,"output_price_usd":0.42,"price_unit":"second"},{"id":"default","match":{},"input_price_usd":0.0,"output_price_usd":0.42,"price_unit":"second"}]},"pricing_tiers":[],"pricing_variants":[{"id":"720p","match":{"resolution":"720p"},"input_price_usd":0.0,"output_price_usd":0.084,"price_unit":"second"},{"id":"1080p","match":{"resolution":"1080p"},"input_price_usd":0.0,"output_price_usd":0.112,"price_unit":"second"},{"id":"4k","match":{"resolution":"4k"},"input_price_usd":0.0,"output_price_usd":0.42,"price_unit":"second"},{"id":"default","match":{},"input_price_usd":0.0,"output_price_usd":0.42,"price_unit":"second"}]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text","image"],"output_modalities":["video"],"description":"Kling V3 Omni is a Kling V3 composite video model; Pleum currently exposes neither native voice controls nor composite references.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":0.8,"promo_ends_at":"2027-01-01T00:00:00+09:00"},{"id":"kling-v2-5-turbo","object":"model","created":0,"owned_by":"pleum","provider":"kling","display_name":"Kling V2.5 Turbo","modality":"video","price_unit":"second","input_price_usd":0.0,"output_price_usd":0.07,"markup_tier":"medium","effective_markup_percent":0.0,"context_window":1024,"max_output":1,"is_active":true,"operations":["video.generate"],"maker":"Kling","context_length":1024,"max_output_tokens":1,"architecture":{"input_modalities":["text","image"],"output_modalities":["video"]},"supported_parameters":[],"supports_thinking":false,"thinking_forced":false,"pricing":{},"pricing_krw":{},"pricing_tiers":[],"pricing_variants":[{"id":"720p","match":{"resolution":"720p"},"input_price_usd":0.0,"output_price_usd":0.042,"price_unit":"second"},{"id":"1080p","match":{"resolution":"1080p"},"input_price_usd":0.0,"output_price_usd":0.07,"price_unit":"second"},{"id":"default","match":{},"input_price_usd":0.0,"output_price_usd":0.07,"price_unit":"second"}],"providers":[{"provider":"kling","input_price_usd":0.0,"output_price_usd":0.07,"markup_tier":"medium","effective_markup_percent":0.0,"context_window":1024,"max_output":1,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{},"pricing_krw":{},"peak_pricing":null,"pricing_policy":{"version":1,"kind":"variants","variants":[{"id":"720p","match":{"resolution":"720p"},"input_price_usd":0.0,"output_price_usd":0.042,"price_unit":"second"},{"id":"1080p","match":{"resolution":"1080p"},"input_price_usd":0.0,"output_price_usd":0.07,"price_unit":"second"},{"id":"default","match":{},"input_price_usd":0.0,"output_price_usd":0.07,"price_unit":"second"}]},"pricing_tiers":[],"pricing_variants":[{"id":"720p","match":{"resolution":"720p"},"input_price_usd":0.0,"output_price_usd":0.042,"price_unit":"second"},{"id":"1080p","match":{"resolution":"1080p"},"input_price_usd":0.0,"output_price_usd":0.07,"price_unit":"second"},{"id":"default","match":{},"input_price_usd":0.0,"output_price_usd":0.07,"price_unit":"second"}]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text","image"],"output_modalities":["video"],"description":"Kling V2.5 Turbo is Kling's low-latency video-generation model.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":0.8,"promo_ends_at":"2027-01-01T00:00:00+09:00"},{"id":"ltx-2-3-fast","object":"model","created":0,"owned_by":"pleum","provider":"ltx","display_name":"LTX 2.3 Fast","modality":"video","price_unit":"second","input_price_usd":0.0,"output_price_usd":0.24,"markup_tier":"medium","effective_markup_percent":0.0,"context_window":1024,"max_output":1,"is_active":true,"operations":["video.generate"],"maker":"LTX","context_length":1024,"max_output_tokens":1,"architecture":{"input_modalities":["text"],"output_modalities":["video"]},"supported_parameters":[],"supports_thinking":false,"thinking_forced":false,"pricing":{},"pricing_krw":{},"pricing_tiers":[],"pricing_variants":[{"id":"720p","match":{"resolution":["480p","720p"]},"input_price_usd":0.0,"output_price_usd":0.03,"price_unit":"second"},{"id":"1080p","match":{"resolution":"1080p"},"input_price_usd":0.0,"output_price_usd":0.06,"price_unit":"second"},{"id":"1440p","match":{"resolution":"1440p"},"input_price_usd":0.0,"output_price_usd":0.12,"price_unit":"second"},{"id":"4k","match":{"resolution":"4k"},"input_price_usd":0.0,"output_price_usd":0.24,"price_unit":"second"},{"id":"default","match":{},"input_price_usd":0.0,"output_price_usd":0.24,"price_unit":"second"}],"providers":[{"provider":"ltx","input_price_usd":0.0,"output_price_usd":0.24,"markup_tier":"medium","effective_markup_percent":0.0,"context_window":1024,"max_output":1,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{},"pricing_krw":{},"peak_pricing":null,"pricing_policy":{"version":1,"kind":"variants","variants":[{"id":"720p","match":{"resolution":["480p","720p"]},"input_price_usd":0.0,"output_price_usd":0.03,"price_unit":"second"},{"id":"1080p","match":{"resolution":"1080p"},"input_price_usd":0.0,"output_price_usd":0.06,"price_unit":"second"},{"id":"1440p","match":{"resolution":"1440p"},"input_price_usd":0.0,"output_price_usd":0.12,"price_unit":"second"},{"id":"4k","match":{"resolution":"4k"},"input_price_usd":0.0,"output_price_usd":0.24,"price_unit":"second"},{"id":"default","match":{},"input_price_usd":0.0,"output_price_usd":0.24,"price_unit":"second"}]},"pricing_tiers":[],"pricing_variants":[{"id":"720p","match":{"resolution":["480p","720p"]},"input_price_usd":0.0,"output_price_usd":0.03,"price_unit":"second"},{"id":"1080p","match":{"resolution":"1080p"},"input_price_usd":0.0,"output_price_usd":0.06,"price_unit":"second"},{"id":"1440p","match":{"resolution":"1440p"},"input_price_usd":0.0,"output_price_usd":0.12,"price_unit":"second"},{"id":"4k","match":{"resolution":"4k"},"input_price_usd":0.0,"output_price_usd":0.24,"price_unit":"second"},{"id":"default","match":{},"input_price_usd":0.0,"output_price_usd":0.24,"price_unit":"second"}]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text"],"output_modalities":["video"],"description":"The LTX 2.3 Fast release extends LTX's model family to video generation from text or visual inputs.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"ltx-2-3-pro","object":"model","created":0,"owned_by":"pleum","provider":"ltx","display_name":"LTX 2.3 Pro","modality":"video","price_unit":"second","input_price_usd":0.0,"output_price_usd":0.32,"markup_tier":"medium","effective_markup_percent":0.0,"context_window":1024,"max_output":1,"is_active":true,"operations":["video.generate"],"maker":"LTX","context_length":1024,"max_output_tokens":1,"architecture":{"input_modalities":["text"],"output_modalities":["video"]},"supported_parameters":[],"supports_thinking":false,"thinking_forced":false,"pricing":{},"pricing_krw":{},"pricing_tiers":[],"pricing_variants":[{"id":"720p","match":{"resolution":["480p","720p"]},"input_price_usd":0.0,"output_price_usd":0.04,"price_unit":"second"},{"id":"1080p","match":{"resolution":"1080p"},"input_price_usd":0.0,"output_price_usd":0.08,"price_unit":"second"},{"id":"1440p","match":{"resolution":"1440p"},"input_price_usd":0.0,"output_price_usd":0.16,"price_unit":"second"},{"id":"4k","match":{"resolution":"4k"},"input_price_usd":0.0,"output_price_usd":0.32,"price_unit":"second"},{"id":"default","match":{},"input_price_usd":0.0,"output_price_usd":0.32,"price_unit":"second"}],"providers":[{"provider":"ltx","input_price_usd":0.0,"output_price_usd":0.32,"markup_tier":"medium","effective_markup_percent":0.0,"context_window":1024,"max_output":1,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{},"pricing_krw":{},"peak_pricing":null,"pricing_policy":{"version":1,"kind":"variants","variants":[{"id":"720p","match":{"resolution":["480p","720p"]},"input_price_usd":0.0,"output_price_usd":0.04,"price_unit":"second"},{"id":"1080p","match":{"resolution":"1080p"},"input_price_usd":0.0,"output_price_usd":0.08,"price_unit":"second"},{"id":"1440p","match":{"resolution":"1440p"},"input_price_usd":0.0,"output_price_usd":0.16,"price_unit":"second"},{"id":"4k","match":{"resolution":"4k"},"input_price_usd":0.0,"output_price_usd":0.32,"price_unit":"second"},{"id":"default","match":{},"input_price_usd":0.0,"output_price_usd":0.32,"price_unit":"second"}]},"pricing_tiers":[],"pricing_variants":[{"id":"720p","match":{"resolution":["480p","720p"]},"input_price_usd":0.0,"output_price_usd":0.04,"price_unit":"second"},{"id":"1080p","match":{"resolution":"1080p"},"input_price_usd":0.0,"output_price_usd":0.08,"price_unit":"second"},{"id":"1440p","match":{"resolution":"1440p"},"input_price_usd":0.0,"output_price_usd":0.16,"price_unit":"second"},{"id":"4k","match":{"resolution":"4k"},"input_price_usd":0.0,"output_price_usd":0.32,"price_unit":"second"},{"id":"default","match":{},"input_price_usd":0.0,"output_price_usd":0.32,"price_unit":"second"}]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text"],"output_modalities":["video"],"description":"The LTX 2.3 Pro release extends LTX's model family to video generation from text or visual inputs.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"kling-v2-6","object":"model","created":0,"owned_by":"pleum","provider":"kling","display_name":"Kling V2.6","modality":"video","price_unit":"second","input_price_usd":0.0,"output_price_usd":0.07,"markup_tier":"medium","effective_markup_percent":0.0,"context_window":1024,"max_output":1,"is_active":true,"operations":["video.generate"],"maker":"Kling","context_length":1024,"max_output_tokens":1,"architecture":{"input_modalities":["text","image"],"output_modalities":["video"]},"supported_parameters":[],"supports_thinking":false,"thinking_forced":false,"pricing":{},"pricing_krw":{},"pricing_tiers":[],"pricing_variants":[{"id":"720p","match":{"resolution":"720p"},"input_price_usd":0.0,"output_price_usd":0.042,"price_unit":"second"},{"id":"1080p","match":{"resolution":"1080p"},"input_price_usd":0.0,"output_price_usd":0.07,"price_unit":"second"},{"id":"default","match":{},"input_price_usd":0.0,"output_price_usd":0.07,"price_unit":"second"}],"providers":[{"provider":"kling","input_price_usd":0.0,"output_price_usd":0.07,"markup_tier":"medium","effective_markup_percent":0.0,"context_window":1024,"max_output":1,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{},"pricing_krw":{},"peak_pricing":null,"pricing_policy":{"version":1,"kind":"variants","variants":[{"id":"720p","match":{"resolution":"720p"},"input_price_usd":0.0,"output_price_usd":0.042,"price_unit":"second"},{"id":"1080p","match":{"resolution":"1080p"},"input_price_usd":0.0,"output_price_usd":0.07,"price_unit":"second"},{"id":"default","match":{},"input_price_usd":0.0,"output_price_usd":0.07,"price_unit":"second"}]},"pricing_tiers":[],"pricing_variants":[{"id":"720p","match":{"resolution":"720p"},"input_price_usd":0.0,"output_price_usd":0.042,"price_unit":"second"},{"id":"1080p","match":{"resolution":"1080p"},"input_price_usd":0.0,"output_price_usd":0.07,"price_unit":"second"},{"id":"default","match":{},"input_price_usd":0.0,"output_price_usd":0.07,"price_unit":"second"}]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text","image"],"output_modalities":["video"],"description":"Kling V2.6 is a current-generation Kling video model; Pleum currently exposes no native-audio or voice controls.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":0.8,"promo_ends_at":"2027-01-01T00:00:00+09:00"},{"id":"ltx-2-5-fast","object":"model","created":0,"owned_by":"pleum","provider":"ltx","display_name":"LTX 2.5 Fast","modality":"video","price_unit":"second","input_price_usd":0.0,"output_price_usd":0.3,"markup_tier":"medium","effective_markup_percent":0.0,"context_window":1024,"max_output":1,"is_active":true,"operations":["video.generate"],"maker":"LTX","context_length":1024,"max_output_tokens":1,"architecture":{"input_modalities":["text"],"output_modalities":["video"]},"supported_parameters":[],"supports_thinking":false,"thinking_forced":false,"pricing":{},"pricing_krw":{},"pricing_tiers":[],"pricing_variants":[{"id":"720p","match":{"resolution":["480p","720p"]},"input_price_usd":0.0,"output_price_usd":0.09,"price_unit":"second"},{"id":"1080p","match":{"resolution":"1080p"},"input_price_usd":0.0,"output_price_usd":0.13,"price_unit":"second"},{"id":"1440p","match":{"resolution":"1440p"},"input_price_usd":0.0,"output_price_usd":0.19,"price_unit":"second"},{"id":"4k","match":{"resolution":"4k"},"input_price_usd":0.0,"output_price_usd":0.3,"price_unit":"second"},{"id":"default","match":{},"input_price_usd":0.0,"output_price_usd":0.3,"price_unit":"second"}],"providers":[{"provider":"ltx","input_price_usd":0.0,"output_price_usd":0.3,"markup_tier":"medium","effective_markup_percent":0.0,"context_window":1024,"max_output":1,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{},"pricing_krw":{},"peak_pricing":null,"pricing_policy":{"version":1,"kind":"variants","variants":[{"id":"720p","match":{"resolution":["480p","720p"]},"input_price_usd":0.0,"output_price_usd":0.09,"price_unit":"second"},{"id":"1080p","match":{"resolution":"1080p"},"input_price_usd":0.0,"output_price_usd":0.13,"price_unit":"second"},{"id":"1440p","match":{"resolution":"1440p"},"input_price_usd":0.0,"output_price_usd":0.19,"price_unit":"second"},{"id":"4k","match":{"resolution":"4k"},"input_price_usd":0.0,"output_price_usd":0.3,"price_unit":"second"},{"id":"default","match":{},"input_price_usd":0.0,"output_price_usd":0.3,"price_unit":"second"}]},"pricing_tiers":[],"pricing_variants":[{"id":"720p","match":{"resolution":["480p","720p"]},"input_price_usd":0.0,"output_price_usd":0.09,"price_unit":"second"},{"id":"1080p","match":{"resolution":"1080p"},"input_price_usd":0.0,"output_price_usd":0.13,"price_unit":"second"},{"id":"1440p","match":{"resolution":"1440p"},"input_price_usd":0.0,"output_price_usd":0.19,"price_unit":"second"},{"id":"4k","match":{"resolution":"4k"},"input_price_usd":0.0,"output_price_usd":0.3,"price_unit":"second"},{"id":"default","match":{},"input_price_usd":0.0,"output_price_usd":0.3,"price_unit":"second"}]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text"],"output_modalities":["video"],"description":"LTX 2.5 Fast is LTX's fast video model with official 6–20 second duration limits depending on resolution.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"ltx-2-5-pro","object":"model","created":0,"owned_by":"pleum","provider":"ltx","display_name":"LTX 2.5 Pro","modality":"video","price_unit":"second","input_price_usd":0.0,"output_price_usd":0.17,"markup_tier":"medium","effective_markup_percent":0.0,"context_window":1024,"max_output":1,"is_active":true,"operations":["video.generate"],"maker":"LTX","context_length":1024,"max_output_tokens":1,"architecture":{"input_modalities":["text"],"output_modalities":["video"]},"supported_parameters":[],"supports_thinking":false,"thinking_forced":false,"pricing":{},"pricing_krw":{},"pricing_tiers":[],"pricing_variants":[{"id":"720p","match":{"resolution":["480p","720p"]},"input_price_usd":0.0,"output_price_usd":0.12,"price_unit":"second"},{"id":"1080p","match":{"resolution":"1080p"},"input_price_usd":0.0,"output_price_usd":0.17,"price_unit":"second"},{"id":"default","match":{},"input_price_usd":0.0,"output_price_usd":0.17,"price_unit":"second"}],"providers":[{"provider":"ltx","input_price_usd":0.0,"output_price_usd":0.17,"markup_tier":"medium","effective_markup_percent":0.0,"context_window":1024,"max_output":1,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{},"pricing_krw":{},"peak_pricing":null,"pricing_policy":{"version":1,"kind":"variants","variants":[{"id":"720p","match":{"resolution":["480p","720p"]},"input_price_usd":0.0,"output_price_usd":0.12,"price_unit":"second"},{"id":"1080p","match":{"resolution":"1080p"},"input_price_usd":0.0,"output_price_usd":0.17,"price_unit":"second"},{"id":"default","match":{},"input_price_usd":0.0,"output_price_usd":0.17,"price_unit":"second"}]},"pricing_tiers":[],"pricing_variants":[{"id":"720p","match":{"resolution":["480p","720p"]},"input_price_usd":0.0,"output_price_usd":0.12,"price_unit":"second"},{"id":"1080p","match":{"resolution":"1080p"},"input_price_usd":0.0,"output_price_usd":0.17,"price_unit":"second"},{"id":"default","match":{},"input_price_usd":0.0,"output_price_usd":0.17,"price_unit":"second"}]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text"],"output_modalities":["video"],"description":"LTX 2.5 Pro is LTX's pro video model supporting 6, 8, and 10 seconds at 720p and 1080p.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"skylark-embedding-vision-251215","object":"model","created":0,"owned_by":"pleum","provider":"modelark","display_name":"ByteDance Skylark Embedding Vision (251215)","modality":"embedding","price_unit":"token","input_price_usd":0.125,"output_price_usd":0.0,"markup_tier":"high","effective_markup_percent":0.0,"context_window":128000,"max_output":2048,"is_active":true,"operations":["embedding.create"],"maker":"ByteDance","context_length":128000,"max_output_tokens":2048,"architecture":{"input_modalities":["text","image","video"],"output_modalities":["embedding"]},"supported_parameters":[],"supports_thinking":false,"thinking_forced":false,"pricing":{"prompt":"0.000000125","completion":"0.00"},"pricing_krw":{"prompt":"0.0001690912500","completion":"0.000000"},"pricing_tiers":[],"pricing_variants":[{"id":"text","match":{"content_types":"text"},"input_price_usd_per_m":0.125,"output_price_usd_per_m":0.0,"price_unit":"token"},{"id":"image","match":{"content_types":"image"},"input_price_usd_per_m":0.325,"output_price_usd_per_m":0.0,"price_unit":"token"},{"id":"video","match":{"content_types":"video"},"input_price_usd_per_m":0.325,"output_price_usd_per_m":0.0,"price_unit":"token"},{"id":"default","match":{},"input_price_usd_per_m":0.325,"output_price_usd_per_m":0.0,"price_unit":"token"}],"providers":[{"provider":"modelark","input_price_usd":0.125,"output_price_usd":0.0,"markup_tier":"high","effective_markup_percent":0.0,"context_window":128000,"max_output":2048,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.000000125","completion":"0.00"},"pricing_krw":{"prompt":"0.0001690912500","completion":"0.000000"},"peak_pricing":null,"pricing_policy":{"version":1,"kind":"variants","input_prices_usd_per_m_by_content_type":{"text":0.125,"visual":0.325},"variants":[{"id":"text","match":{"content_types":"text"},"input_price_usd_per_m":0.125,"output_price_usd_per_m":0.0,"price_unit":"token"},{"id":"image","match":{"content_types":"image"},"input_price_usd_per_m":0.325,"output_price_usd_per_m":0.0,"price_unit":"token"},{"id":"video","match":{"content_types":"video"},"input_price_usd_per_m":0.325,"output_price_usd_per_m":0.0,"price_unit":"token"},{"id":"default","match":{},"input_price_usd_per_m":0.325,"output_price_usd_per_m":0.0,"price_unit":"token"}]},"pricing_tiers":[],"pricing_variants":[{"id":"text","match":{"content_types":"text"},"input_price_usd_per_m":0.125,"output_price_usd_per_m":0.0,"price_unit":"token"},{"id":"image","match":{"content_types":"image"},"input_price_usd_per_m":0.325,"output_price_usd_per_m":0.0,"price_unit":"token"},{"id":"video","match":{"content_types":"video"},"input_price_usd_per_m":0.325,"output_price_usd_per_m":0.0,"price_unit":"token"},{"id":"default","match":{},"input_price_usd_per_m":0.325,"output_price_usd_per_m":0.0,"price_unit":"token"}]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text","image","video"],"output_modalities":["embedding"],"description":"ByteDance Skylark Embedding Vision (251215) applies ByteDance's Skylark family to vector representations for retrieval, clustering, and similarity. The public catalog limits for the dated snapshot release are 128,000 context tokens and 2,048 output tokens.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"skylark-embedding-vision-250615","object":"model","created":0,"owned_by":"pleum","provider":"modelark","display_name":"ByteDance Skylark Embedding Vision (250615)","modality":"embedding","price_unit":"token","input_price_usd":0.125,"output_price_usd":0.0,"markup_tier":"high","effective_markup_percent":0.0,"context_window":128000,"max_output":2048,"is_active":true,"operations":["embedding.create"],"maker":"ByteDance","context_length":128000,"max_output_tokens":2048,"architecture":{"input_modalities":["text","image","video"],"output_modalities":["embedding"]},"supported_parameters":[],"supports_thinking":false,"thinking_forced":false,"pricing":{"prompt":"0.000000125","completion":"0.00"},"pricing_krw":{"prompt":"0.0001690912500","completion":"0.000000"},"pricing_tiers":[],"pricing_variants":[{"id":"text","match":{"content_types":"text"},"input_price_usd_per_m":0.125,"output_price_usd_per_m":0.0,"price_unit":"token"},{"id":"image","match":{"content_types":"image"},"input_price_usd_per_m":0.325,"output_price_usd_per_m":0.0,"price_unit":"token"},{"id":"video","match":{"content_types":"video"},"input_price_usd_per_m":0.325,"output_price_usd_per_m":0.0,"price_unit":"token"},{"id":"default","match":{},"input_price_usd_per_m":0.325,"output_price_usd_per_m":0.0,"price_unit":"token"}],"providers":[{"provider":"modelark","input_price_usd":0.125,"output_price_usd":0.0,"markup_tier":"high","effective_markup_percent":0.0,"context_window":128000,"max_output":2048,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.000000125","completion":"0.00"},"pricing_krw":{"prompt":"0.0001690912500","completion":"0.000000"},"peak_pricing":null,"pricing_policy":{"version":1,"kind":"variants","input_prices_usd_per_m_by_content_type":{"text":0.125,"visual":0.325},"variants":[{"id":"text","match":{"content_types":"text"},"input_price_usd_per_m":0.125,"output_price_usd_per_m":0.0,"price_unit":"token"},{"id":"image","match":{"content_types":"image"},"input_price_usd_per_m":0.325,"output_price_usd_per_m":0.0,"price_unit":"token"},{"id":"video","match":{"content_types":"video"},"input_price_usd_per_m":0.325,"output_price_usd_per_m":0.0,"price_unit":"token"},{"id":"default","match":{},"input_price_usd_per_m":0.325,"output_price_usd_per_m":0.0,"price_unit":"token"}]},"pricing_tiers":[],"pricing_variants":[{"id":"text","match":{"content_types":"text"},"input_price_usd_per_m":0.125,"output_price_usd_per_m":0.0,"price_unit":"token"},{"id":"image","match":{"content_types":"image"},"input_price_usd_per_m":0.325,"output_price_usd_per_m":0.0,"price_unit":"token"},{"id":"video","match":{"content_types":"video"},"input_price_usd_per_m":0.325,"output_price_usd_per_m":0.0,"price_unit":"token"},{"id":"default","match":{},"input_price_usd_per_m":0.325,"output_price_usd_per_m":0.0,"price_unit":"token"}]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text","image","video"],"output_modalities":["embedding"],"description":"ByteDance Skylark Embedding Vision (250615) applies ByteDance's Skylark family to vector representations for retrieval, clustering, and similarity. Its cataloged dated snapshot profile provides 128,000 tokens of context with a maximum output of 2,048 tokens.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"Hyper3d-Rodin-Gen2","object":"model","created":0,"owned_by":"pleum","provider":"modelark","display_name":"Hyper3D Rodin Gen2","modality":"3d","price_unit":"request","input_price_usd":0.0,"output_price_usd":0.399,"markup_tier":"medium","effective_markup_percent":0.0,"context_window":4096,"max_output":1,"is_active":true,"operations":["three_d.generate"],"maker":"Hyper3D","context_length":4096,"max_output_tokens":1,"architecture":{"input_modalities":["text","image"],"output_modalities":["3d"]},"supported_parameters":[],"supports_thinking":false,"thinking_forced":false,"pricing":{},"pricing_krw":{},"pricing_tiers":[],"pricing_variants":[{"id":"all_modes","match":{},"input_price_usd":0.0,"output_price_usd":0.399,"price_unit":"request"}],"providers":[{"provider":"modelark","input_price_usd":0.0,"output_price_usd":0.399,"markup_tier":"medium","effective_markup_percent":0.0,"context_window":4096,"max_output":1,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{},"pricing_krw":{},"peak_pricing":null,"pricing_policy":{"version":1,"kind":"variants","variants":[{"id":"all_modes","match":{},"input_price_usd":0.0,"output_price_usd":0.399,"price_unit":"request"}]},"pricing_tiers":[],"pricing_variants":[{"id":"all_modes","match":{},"input_price_usd":0.0,"output_price_usd":0.399,"price_unit":"request"}]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text","image"],"output_modalities":["3d"],"description":"Hyper3D Rodin Gen-2 is a 10-billion-parameter model for generating 3D assets from text or images. Its BANG architecture, recursive part generation, and baked-normal support combine surface detail with regular mesh structure.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"Hitem3d-2.0","object":"model","created":0,"owned_by":"pleum","provider":"modelark","display_name":"Hitem3D 2.0","modality":"3d","price_unit":"request","input_price_usd":0.0,"output_price_usd":1.8,"markup_tier":"medium","effective_markup_percent":0.0,"context_window":4096,"max_output":1,"is_active":true,"operations":["three_d.generate"],"maker":"Hitem3D","context_length":4096,"max_output_tokens":1,"architecture":{"input_modalities":["image"],"output_modalities":["3d"]},"supported_parameters":[],"supports_thinking":false,"thinking_forced":false,"pricing":{},"pricing_krw":{},"pricing_tiers":[],"pricing_variants":[{"id":"standard_white","match":{"generation_mode":"standard_white"},"input_price_usd":0.0,"output_price_usd":0.8,"price_unit":"request"},{"id":"standard_textured","match":{"generation_mode":"standard_textured"},"input_price_usd":0.0,"output_price_usd":1.4,"price_unit":"request"},{"id":"high_precision_white","match":{"generation_mode":"high_precision_white"},"input_price_usd":0.0,"output_price_usd":1.2,"price_unit":"request"},{"id":"high_precision_textured","match":{"generation_mode":"high_precision_textured"},"input_price_usd":0.0,"output_price_usd":1.8,"price_unit":"request"},{"id":"default","match":{},"input_price_usd":0.0,"output_price_usd":1.8,"price_unit":"request"}],"providers":[{"provider":"modelark","input_price_usd":0.0,"output_price_usd":1.8,"markup_tier":"medium","effective_markup_percent":0.0,"context_window":4096,"max_output":1,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{},"pricing_krw":{},"peak_pricing":null,"pricing_policy":{"version":1,"kind":"variants","variants":[{"id":"standard_white","match":{"generation_mode":"standard_white"},"input_price_usd":0.0,"output_price_usd":0.8,"price_unit":"request"},{"id":"standard_textured","match":{"generation_mode":"standard_textured"},"input_price_usd":0.0,"output_price_usd":1.4,"price_unit":"request"},{"id":"high_precision_white","match":{"generation_mode":"high_precision_white"},"input_price_usd":0.0,"output_price_usd":1.2,"price_unit":"request"},{"id":"high_precision_textured","match":{"generation_mode":"high_precision_textured"},"input_price_usd":0.0,"output_price_usd":1.8,"price_unit":"request"},{"id":"default","match":{},"input_price_usd":0.0,"output_price_usd":1.8,"price_unit":"request"}]},"pricing_tiers":[],"pricing_variants":[{"id":"standard_white","match":{"generation_mode":"standard_white"},"input_price_usd":0.0,"output_price_usd":0.8,"price_unit":"request"},{"id":"standard_textured","match":{"generation_mode":"standard_textured"},"input_price_usd":0.0,"output_price_usd":1.4,"price_unit":"request"},{"id":"high_precision_white","match":{"generation_mode":"high_precision_white"},"input_price_usd":0.0,"output_price_usd":1.2,"price_unit":"request"},{"id":"high_precision_textured","match":{"generation_mode":"high_precision_textured"},"input_price_usd":0.0,"output_price_usd":1.8,"price_unit":"request"},{"id":"default","match":{},"input_price_usd":0.0,"output_price_usd":1.8,"price_unit":"request"}]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["image"],"output_modalities":["3d"],"description":"Hitem3D 2.0 is cataloged by BytePlus ModelArk for generating 3D assets from text or image inputs.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"tts-1","object":"model","created":0,"owned_by":"pleum","provider":"openai","display_name":"OpenAI TTS","modality":"audio","price_unit":"char_1m","input_price_usd":15.0,"output_price_usd":0.0,"markup_tier":"medium","effective_markup_percent":0.0,"context_window":4096,"max_output":1,"is_active":true,"operations":["speech.synthesize"],"maker":"OpenAI","context_length":4096,"max_output_tokens":1,"architecture":{"input_modalities":["text"],"output_modalities":["audio"]},"supported_parameters":[],"supports_thinking":false,"thinking_forced":false,"pricing":{},"pricing_krw":{},"pricing_tiers":[],"pricing_variants":[],"providers":[{"provider":"openai","input_price_usd":15.0,"output_price_usd":0.0,"markup_tier":"medium","effective_markup_percent":0.0,"context_window":4096,"max_output":1,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{},"pricing_krw":{},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text"],"output_modalities":["audio"],"description":"OpenAI TTS is an OpenAI model for synthesizing input text into spoken audio.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"tts-1-hd","object":"model","created":0,"owned_by":"pleum","provider":"openai","display_name":"OpenAI TTS HD","modality":"audio","price_unit":"char_1m","input_price_usd":30.0,"output_price_usd":0.0,"markup_tier":"medium","effective_markup_percent":0.0,"context_window":4096,"max_output":1,"is_active":true,"operations":["speech.synthesize"],"maker":"OpenAI","context_length":4096,"max_output_tokens":1,"architecture":{"input_modalities":["text"],"output_modalities":["audio"]},"supported_parameters":[],"supports_thinking":false,"thinking_forced":false,"pricing":{},"pricing_krw":{},"pricing_tiers":[],"pricing_variants":[],"providers":[{"provider":"openai","input_price_usd":30.0,"output_price_usd":0.0,"markup_tier":"medium","effective_markup_percent":0.0,"context_window":4096,"max_output":1,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{},"pricing_krw":{},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text"],"output_modalities":["audio"],"description":"OpenAI TTS HD is an OpenAI model for synthesizing input text into spoken audio.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"gpt-4o-mini-tts","object":"model","created":0,"owned_by":"pleum","provider":"openai","display_name":"GPT-4o Mini TTS","modality":"audio","price_unit":"token","input_price_usd":0.6,"output_price_usd":12.0,"markup_tier":"high","effective_markup_percent":0.0,"context_window":2000,"max_output":1,"is_active":true,"operations":["speech.synthesize"],"maker":"OpenAI","context_length":2000,"max_output_tokens":1,"architecture":{"input_modalities":["text"],"output_modalities":["audio"]},"supported_parameters":[],"supports_thinking":false,"thinking_forced":false,"pricing":{"prompt":"0.0000006","completion":"0.000012"},"pricing_krw":{"prompt":"0.00081163800","completion":"0.0162327600"},"pricing_tiers":[],"pricing_variants":[],"providers":[{"provider":"openai","input_price_usd":0.6,"output_price_usd":12.0,"markup_tier":"high","effective_markup_percent":0.0,"context_window":2000,"max_output":1,"cache_read_usd":0.06,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.0000006","completion":"0.000012"},"pricing_krw":{"prompt":"0.00081163800","completion":"0.0162327600"},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text"],"output_modalities":["audio"],"description":"OpenAI positions GPT-4o Mini TTS in the GPT family for synthesizing input text into spoken audio.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"whisper-1","object":"model","created":0,"owned_by":"pleum","provider":"openai","display_name":"OpenAI Whisper (STT)","modality":"audio","price_unit":"minute","input_price_usd":0.006,"output_price_usd":0.0,"markup_tier":"medium","effective_markup_percent":0.0,"context_window":1,"max_output":1,"is_active":true,"operations":["audio.transcribe"],"maker":"OpenAI","context_length":1,"max_output_tokens":1,"architecture":{"input_modalities":["audio"],"output_modalities":["text"]},"supported_parameters":[],"supports_thinking":false,"thinking_forced":false,"pricing":{},"pricing_krw":{},"pricing_tiers":[],"pricing_variants":[],"providers":[{"provider":"openai","input_price_usd":0.006,"output_price_usd":0.0,"markup_tier":"medium","effective_markup_percent":0.0,"context_window":1,"max_output":1,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{},"pricing_krw":{},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["audio"],"output_modalities":["text"],"description":"Within OpenAI's Whisper lineup, OpenAI Whisper (STT) is intended for speech transcription and conversion of audio into text.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"gpt-audio-1.5","object":"model","created":0,"owned_by":"pleum","provider":"openai","display_name":"GPT Audio 1.5","modality":"audio","price_unit":"token","input_price_usd":2.5,"output_price_usd":10.0,"markup_tier":"medium","effective_markup_percent":0.0,"context_window":128000,"max_output":16384,"is_active":true,"operations":["chat.generate"],"maker":"OpenAI","context_length":128000,"max_output_tokens":16384,"architecture":{"input_modalities":["text","audio"],"output_modalities":["text","audio"]},"supported_parameters":[],"supports_thinking":false,"thinking_forced":false,"pricing":{"prompt":"0.0000025","completion":"0.00001"},"pricing_krw":{"prompt":"0.00338182500","completion":"0.013527300"},"pricing_tiers":[],"pricing_variants":[],"providers":[{"provider":"openai","input_price_usd":2.5,"output_price_usd":10.0,"markup_tier":"medium","effective_markup_percent":0.0,"context_window":128000,"max_output":16384,"cache_read_usd":0.25,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.0000025","completion":"0.00001"},"pricing_krw":{"prompt":"0.00338182500","completion":"0.013527300"},"peak_pricing":null,"pricing_policy":{"version":1,"input_prices_usd_per_m_by_content_type":{"text":2.5,"audio":32.0},"output_prices_usd_per_m_by_content_type":{"text":10.0,"audio":64.0}},"pricing_tiers":[],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text","audio"],"output_modalities":["text","audio"],"description":"GPT Audio 1.5 is OpenAI's audio input and output conversation model. PleumRouter serves it through non-streaming Chat Completions and accounts for text and audio tokens separately.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"qwen3.5-omni-plus","object":"model","created":0,"owned_by":"pleum","provider":"qwen","display_name":"Qwen3.5 Omni Plus","modality":"audio","price_unit":"token","input_price_usd":1.4,"output_price_usd":8.3,"markup_tier":"medium","effective_markup_percent":0.0,"context_window":65536,"max_output":8192,"is_active":true,"operations":["chat.generate"],"maker":"Qwen","context_length":65536,"max_output_tokens":8192,"architecture":{"input_modalities":["text","audio"],"output_modalities":["text","audio"]},"supported_parameters":[],"supports_thinking":false,"thinking_forced":false,"pricing":{"prompt":"0.0000014","completion":"0.0000083"},"pricing_krw":{"prompt":"0.00189382200","completion":"0.01122765900"},"pricing_tiers":[],"pricing_variants":[],"providers":[{"provider":"qwen","input_price_usd":1.4,"output_price_usd":8.3,"markup_tier":"medium","effective_markup_percent":0.0,"context_window":65536,"max_output":8192,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.0000014","completion":"0.0000083"},"pricing_krw":{"prompt":"0.00189382200","completion":"0.01122765900"},"peak_pricing":null,"pricing_policy":{"version":1,"input_prices_usd_per_m_by_content_type":{"text":1.4,"audio":11.0},"output_prices_usd_per_m_by_content_type":{"text":0.0,"audio":44.0}},"pricing_tiers":[],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text","audio"],"output_modalities":["text","audio"],"description":"Qwen3.5 Omni Plus is a audio model available through PleumRouter. Review its catalog metadata for supported capabilities and pricing.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"gpt-realtime-2.1","object":"model","created":0,"owned_by":"pleum","provider":"openai","display_name":"GPT Realtime 2.1","modality":"audio","price_unit":"token","input_price_usd":4.0,"output_price_usd":24.0,"markup_tier":"low","effective_markup_percent":0.0,"context_window":128000,"max_output":32000,"is_active":true,"operations":["realtime.session"],"maker":"OpenAI","context_length":128000,"max_output_tokens":32000,"architecture":{"input_modalities":["text","audio"],"output_modalities":["text","audio"]},"supported_parameters":[],"supports_thinking":false,"thinking_forced":false,"pricing":{"prompt":"0.000004","completion":"0.000024"},"pricing_krw":{"prompt":"0.0054109200","completion":"0.0324655200"},"pricing_tiers":[],"pricing_variants":[],"providers":[{"provider":"openai","input_price_usd":4.0,"output_price_usd":24.0,"markup_tier":"low","effective_markup_percent":0.0,"context_window":128000,"max_output":32000,"cache_read_usd":0.4,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.000004","completion":"0.000024"},"pricing_krw":{"prompt":"0.0054109200","completion":"0.0324655200"},"peak_pricing":null,"pricing_policy":{"version":1,"input_prices_usd_per_m_by_content_type":{"text":4.0,"audio":32.0},"output_prices_usd_per_m_by_content_type":{"text":24.0,"audio":64.0}},"pricing_tiers":[],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text","audio"],"output_modalities":["text","audio"],"description":"GPT Realtime 2.1 is a audio model available through PleumRouter. Review its catalog metadata for supported capabilities and pricing.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"qwen3.5-omni-flash","object":"model","created":0,"owned_by":"pleum","provider":"qwen","display_name":"Qwen3.5 Omni Flash","modality":"audio","price_unit":"token","input_price_usd":0.4,"output_price_usd":2.2,"markup_tier":"high","effective_markup_percent":0.0,"context_window":65536,"max_output":8192,"is_active":true,"operations":["chat.generate"],"maker":"Qwen","context_length":65536,"max_output_tokens":8192,"architecture":{"input_modalities":["text","audio"],"output_modalities":["text","audio"]},"supported_parameters":[],"supports_thinking":false,"thinking_forced":false,"pricing":{"prompt":"0.0000004","completion":"0.0000022"},"pricing_krw":{"prompt":"0.00054109200","completion":"0.00297600600"},"pricing_tiers":[],"pricing_variants":[],"providers":[{"provider":"qwen","input_price_usd":0.4,"output_price_usd":2.2,"markup_tier":"high","effective_markup_percent":0.0,"context_window":65536,"max_output":8192,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.0000004","completion":"0.0000022"},"pricing_krw":{"prompt":"0.00054109200","completion":"0.00297600600"},"peak_pricing":null,"pricing_policy":{"version":1,"input_prices_usd_per_m_by_content_type":{"text":0.4,"audio":3.0},"output_prices_usd_per_m_by_content_type":{"text":0.0,"audio":11.9}},"pricing_tiers":[],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text","audio"],"output_modalities":["text","audio"],"description":"Qwen3.5 Omni Flash is a audio model available through PleumRouter. Review its catalog metadata for supported capabilities and pricing.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"gpt-realtime-2.1-mini","object":"model","created":0,"owned_by":"pleum","provider":"openai","display_name":"GPT Realtime 2.1 Mini","modality":"audio","price_unit":"token","input_price_usd":0.6,"output_price_usd":2.4,"markup_tier":"medium","effective_markup_percent":0.0,"context_window":128000,"max_output":32000,"is_active":true,"operations":["realtime.session"],"maker":"OpenAI","context_length":128000,"max_output_tokens":32000,"architecture":{"input_modalities":["text","audio"],"output_modalities":["text","audio"]},"supported_parameters":[],"supports_thinking":false,"thinking_forced":false,"pricing":{"prompt":"0.0000006","completion":"0.0000024"},"pricing_krw":{"prompt":"0.00081163800","completion":"0.00324655200"},"pricing_tiers":[],"pricing_variants":[],"providers":[{"provider":"openai","input_price_usd":0.6,"output_price_usd":2.4,"markup_tier":"medium","effective_markup_percent":0.0,"context_window":128000,"max_output":32000,"cache_read_usd":0.06,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.0000006","completion":"0.0000024"},"pricing_krw":{"prompt":"0.00081163800","completion":"0.00324655200"},"peak_pricing":null,"pricing_policy":{"version":1,"input_prices_usd_per_m_by_content_type":{"text":0.6,"audio":10.0},"output_prices_usd_per_m_by_content_type":{"text":2.4,"audio":20.0}},"pricing_tiers":[],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text","audio"],"output_modalities":["text","audio"],"description":"GPT Realtime 2.1 Mini is a audio model available through PleumRouter. Review its catalog metadata for supported capabilities and pricing.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"eleven_multilingual_v2","object":"model","created":0,"owned_by":"pleum","provider":"elevenlabs","display_name":"ElevenLabs Multilingual v2","modality":"audio","price_unit":"char_1k","input_price_usd":0.0,"output_price_usd":0.1,"markup_tier":"medium","effective_markup_percent":0.0,"context_window":10000,"max_output":1,"is_active":true,"operations":["speech.synthesize"],"maker":"ElevenLabs","context_length":10000,"max_output_tokens":1,"architecture":{"input_modalities":["text"],"output_modalities":["audio"]},"supported_parameters":[],"supports_thinking":false,"thinking_forced":false,"pricing":{},"pricing_krw":{},"pricing_tiers":[],"pricing_variants":[],"providers":[{"provider":"elevenlabs","input_price_usd":0.0,"output_price_usd":0.1,"markup_tier":"medium","effective_markup_percent":0.0,"context_window":10000,"max_output":1,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{},"pricing_krw":{},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text"],"output_modalities":["audio"],"description":"ElevenLabs Multilingual v2 is a high-fidelity speech model that preserves natural, consistent voice quality and speaker identity across 29 languages. It is suited to long-form narration and professional content where stability matters.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"eleven_v3","object":"model","created":0,"owned_by":"pleum","provider":"elevenlabs","display_name":"ElevenLabs v3","modality":"audio","price_unit":"char_1k","input_price_usd":0.0,"output_price_usd":0.1,"markup_tier":"medium","effective_markup_percent":0.0,"context_window":5000,"max_output":1,"is_active":true,"operations":["speech.synthesize"],"maker":"ElevenLabs","context_length":5000,"max_output_tokens":1,"architecture":{"input_modalities":["text"],"output_modalities":["audio"]},"supported_parameters":[],"supports_thinking":false,"thinking_forced":false,"pricing":{},"pricing_krw":{},"pricing_tiers":[],"pricing_variants":[],"providers":[{"provider":"elevenlabs","input_price_usd":0.0,"output_price_usd":0.1,"markup_tier":"medium","effective_markup_percent":0.0,"context_window":5000,"max_output":1,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{},"pricing_krw":{},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text"],"output_modalities":["audio"],"description":"ElevenLabs v3 is an expressive speech synthesis model for broad emotional range and natural multi-speaker dialogue in more than 70 languages. It is designed for dramatic performance, character conversations, and emotionally nuanced narration.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"eleven_flash_v2_5","object":"model","created":0,"owned_by":"pleum","provider":"elevenlabs","display_name":"ElevenLabs Flash v2.5","modality":"audio","price_unit":"char_1k","input_price_usd":0.0,"output_price_usd":0.05,"markup_tier":"high","effective_markup_percent":0.0,"context_window":40000,"max_output":1,"is_active":true,"operations":["speech.synthesize"],"maker":"ElevenLabs","context_length":40000,"max_output_tokens":1,"architecture":{"input_modalities":["text"],"output_modalities":["audio"]},"supported_parameters":[],"supports_thinking":false,"thinking_forced":false,"pricing":{},"pricing_krw":{},"pricing_tiers":[],"pricing_variants":[],"providers":[{"provider":"elevenlabs","input_price_usd":0.0,"output_price_usd":0.05,"markup_tier":"high","effective_markup_percent":0.0,"context_window":40000,"max_output":1,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{},"pricing_krw":{},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text"],"output_modalities":["audio"],"description":"ElevenLabs Flash v2.5 is a real-time speech model with roughly 75 ms ultra-low latency across 32 languages. It is suited to voice agents, interactive applications, and large-scale conversion where speed and cost efficiency matter.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"eleven_v3_conversational","object":"model","created":0,"owned_by":"pleum","provider":"elevenlabs","display_name":"ElevenLabs v3 Conversational","modality":"audio","price_unit":"char_1k","input_price_usd":0.0,"output_price_usd":0.05,"markup_tier":"high","effective_markup_percent":0.0,"context_window":5000,"max_output":1,"is_active":true,"operations":["speech.synthesize"],"maker":"ElevenLabs","context_length":5000,"max_output_tokens":1,"architecture":{"input_modalities":["text"],"output_modalities":["audio"]},"supported_parameters":[],"supports_thinking":false,"thinking_forced":false,"pricing":{},"pricing_krw":{},"pricing_tiers":[],"pricing_variants":[],"providers":[{"provider":"elevenlabs","input_price_usd":0.0,"output_price_usd":0.05,"markup_tier":"high","effective_markup_percent":0.0,"context_window":5000,"max_output":1,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{},"pricing_krw":{},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text"],"output_modalities":["audio"],"description":"ElevenLabs v3 Conversational is the latest TTS model optimized for realtime conversation, billed at the Flash tier ($0.05 per 1,000 characters).","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"eleven_flash_v2","object":"model","created":0,"owned_by":"pleum","provider":"elevenlabs","display_name":"ElevenLabs Flash v2","modality":"audio","price_unit":"char_1k","input_price_usd":0.0,"output_price_usd":0.05,"markup_tier":"high","effective_markup_percent":0.0,"context_window":30000,"max_output":1,"is_active":true,"operations":["speech.synthesize"],"maker":"ElevenLabs","context_length":30000,"max_output_tokens":1,"architecture":{"input_modalities":["text"],"output_modalities":["audio"]},"supported_parameters":[],"supports_thinking":false,"thinking_forced":false,"pricing":{},"pricing_krw":{},"pricing_tiers":[],"pricing_variants":[],"providers":[{"provider":"elevenlabs","input_price_usd":0.0,"output_price_usd":0.05,"markup_tier":"high","effective_markup_percent":0.0,"context_window":30000,"max_output":1,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{},"pricing_krw":{},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text"],"output_modalities":["audio"],"description":"Eleven Flash v2 is ElevenLabs' English text-to-speech model.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"scribe_v2","object":"model","created":0,"owned_by":"pleum","provider":"elevenlabs","display_name":"ElevenLabs Scribe v2 (STT)","modality":"audio","price_unit":"hour","input_price_usd":0.0,"output_price_usd":0.22,"markup_tier":"medium","effective_markup_percent":0.0,"context_window":1,"max_output":1,"is_active":true,"operations":["audio.transcribe"],"maker":"ElevenLabs","context_length":1,"max_output_tokens":1,"architecture":{"input_modalities":["audio"],"output_modalities":["text"]},"supported_parameters":[],"supports_thinking":false,"thinking_forced":false,"pricing":{},"pricing_krw":{},"pricing_tiers":[],"pricing_variants":[],"providers":[{"provider":"elevenlabs","input_price_usd":0.0,"output_price_usd":0.22,"markup_tier":"medium","effective_markup_percent":0.0,"context_window":1,"max_output":1,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{},"pricing_krw":{},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["audio"],"output_modalities":["text"],"description":"ElevenLabs Scribe v2 is a multilingual speech-recognition model for transcribing audio in more than 90 languages. It supports word-level timestamps, speaker diarization, dynamic audio tagging, entity detection, and keyterm prompting.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"whisper-large-v3","object":"model","created":0,"owned_by":"pleum","provider":"friendli","display_name":"Whisper Large v3","modality":"audio","price_unit":"minute","input_price_usd":0.0015,"output_price_usd":0.0,"markup_tier":"high","effective_markup_percent":0.0,"context_window":1,"max_output":1,"is_active":true,"operations":["audio.transcribe"],"maker":"OpenAI","context_length":1,"max_output_tokens":1,"architecture":{"input_modalities":["audio"],"output_modalities":["text"]},"supported_parameters":[],"supports_thinking":false,"thinking_forced":false,"pricing":{},"pricing_krw":{},"pricing_tiers":[],"pricing_variants":[],"providers":[{"provider":"friendli","input_price_usd":0.0015,"output_price_usd":0.0,"markup_tier":"high","effective_markup_percent":0.0,"context_window":1,"max_output":1,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{},"pricing_krw":{},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]},{"provider":"groq","input_price_usd":0.111,"output_price_usd":0.0,"markup_tier":"high","effective_markup_percent":0.0,"context_window":1,"max_output":1,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{},"pricing_krw":{},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["audio"],"output_modalities":["text"],"description":"Within OpenAI's Whisper lineup, Whisper Large V3 (Groq) is intended for speech transcription and conversion of audio into text.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"orpheus-v1-english","object":"model","created":0,"owned_by":"pleum","provider":"groq","display_name":"Orpheus V1 English TTS (Groq)","modality":"audio","price_unit":"char_1m","input_price_usd":0.0,"output_price_usd":22.0,"markup_tier":"high","effective_markup_percent":0.0,"context_window":4000,"max_output":50000,"is_active":true,"operations":["speech.synthesize"],"maker":"Canopy Labs","context_length":4000,"max_output_tokens":50000,"architecture":{"input_modalities":["text"],"output_modalities":["audio"]},"supported_parameters":[],"supports_thinking":false,"thinking_forced":false,"pricing":{},"pricing_krw":{},"pricing_tiers":[],"pricing_variants":[],"providers":[{"provider":"groq","input_price_usd":0.0,"output_price_usd":22.0,"markup_tier":"high","effective_markup_percent":0.0,"context_window":4000,"max_output":50000,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{},"pricing_krw":{},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text"],"output_modalities":["audio"],"description":"Orpheus V1 English TTS is Groq's English text-to-speech model, the successor to the deprecated PlayAI TTS, priced at $22 per 1,000,000 characters.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"orpheus-arabic-saudi","object":"model","created":0,"owned_by":"pleum","provider":"groq","display_name":"Orpheus Arabic Saudi TTS (Groq)","modality":"audio","price_unit":"char_1m","input_price_usd":0.0,"output_price_usd":40.0,"markup_tier":"high","effective_markup_percent":0.0,"context_window":4000,"max_output":50000,"is_active":true,"operations":["speech.synthesize"],"maker":"Canopy Labs","context_length":4000,"max_output_tokens":50000,"architecture":{"input_modalities":["text"],"output_modalities":["audio"]},"supported_parameters":[],"supports_thinking":false,"thinking_forced":false,"pricing":{},"pricing_krw":{},"pricing_tiers":[],"pricing_variants":[],"providers":[{"provider":"groq","input_price_usd":0.0,"output_price_usd":40.0,"markup_tier":"high","effective_markup_percent":0.0,"context_window":4000,"max_output":50000,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{},"pricing_krw":{},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text"],"output_modalities":["audio"],"description":"Orpheus Arabic Saudi TTS is Groq's Saudi Arabic text-to-speech model, priced at $40 per 1,000,000 characters.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"s2.1-pro","object":"model","created":0,"owned_by":"pleum","provider":"fishaudio","display_name":"Fish Audio S2.1 Pro","modality":"audio","price_unit":"char_1m","input_price_usd":0.0,"output_price_usd":15.0,"markup_tier":"medium","effective_markup_percent":0.0,"context_window":5000,"max_output":1,"is_active":true,"operations":["speech.synthesize"],"maker":"Udio","context_length":5000,"max_output_tokens":1,"architecture":{"input_modalities":["text"],"output_modalities":["audio"]},"supported_parameters":[],"supports_thinking":false,"thinking_forced":false,"pricing":{},"pricing_krw":{},"pricing_tiers":[],"pricing_variants":[],"providers":[{"provider":"fishaudio","input_price_usd":0.0,"output_price_usd":15.0,"markup_tier":"medium","effective_markup_percent":0.0,"context_window":5000,"max_output":1,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{},"pricing_krw":{},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text"],"output_modalities":["audio"],"description":"Fish Audio S2.1 Pro is a Fish Audio model for synthesizing input text into spoken audio.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"s1","object":"model","created":0,"owned_by":"pleum","provider":"fishaudio","display_name":"Fish Audio S1","modality":"audio","price_unit":"char_1m","input_price_usd":0.0,"output_price_usd":15.0,"markup_tier":"medium","effective_markup_percent":0.0,"context_window":5000,"max_output":1,"is_active":true,"operations":["speech.synthesize"],"maker":"Udio","context_length":5000,"max_output_tokens":1,"architecture":{"input_modalities":["text"],"output_modalities":["audio"]},"supported_parameters":[],"supports_thinking":false,"thinking_forced":false,"pricing":{},"pricing_krw":{},"pricing_tiers":[],"pricing_variants":[],"providers":[{"provider":"fishaudio","input_price_usd":0.0,"output_price_usd":15.0,"markup_tier":"medium","effective_markup_percent":0.0,"context_window":5000,"max_output":1,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{},"pricing_krw":{},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text"],"output_modalities":["audio"],"description":"Fish Audio S1 is a Fish Audio model for synthesizing input text into spoken audio.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"s2.1-pro-free","object":"model","created":0,"owned_by":"pleum","provider":"fishaudio","display_name":"Fish Audio S2.1 Pro Free","modality":"audio","price_unit":"char_1m","input_price_usd":0.0,"output_price_usd":0.0,"markup_tier":"high","effective_markup_percent":0.0,"context_window":5000,"max_output":1,"is_active":true,"operations":["speech.synthesize"],"maker":"Udio","context_length":5000,"max_output_tokens":1,"architecture":{"input_modalities":["text"],"output_modalities":["audio"]},"supported_parameters":[],"supports_thinking":false,"thinking_forced":false,"pricing":{},"pricing_krw":{},"pricing_tiers":[],"pricing_variants":[],"providers":[{"provider":"fishaudio","input_price_usd":0.0,"output_price_usd":0.0,"markup_tier":"high","effective_markup_percent":0.0,"context_window":5000,"max_output":1,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{},"pricing_krw":{},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text"],"output_modalities":["audio"],"description":"S2.1 Pro Free is Fish Audio's free text-to-speech model option.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"s2-pro","object":"model","created":0,"owned_by":"pleum","provider":"fishaudio","display_name":"Fish Audio S2 Pro","modality":"audio","price_unit":"char_1m","input_price_usd":0.0,"output_price_usd":15.0,"markup_tier":"medium","effective_markup_percent":0.0,"context_window":5000,"max_output":1,"is_active":true,"operations":["speech.synthesize"],"maker":"Udio","context_length":5000,"max_output_tokens":1,"architecture":{"input_modalities":["text"],"output_modalities":["audio"]},"supported_parameters":[],"supports_thinking":false,"thinking_forced":false,"pricing":{},"pricing_krw":{},"pricing_tiers":[],"pricing_variants":[],"providers":[{"provider":"fishaudio","input_price_usd":0.0,"output_price_usd":15.0,"markup_tier":"medium","effective_markup_percent":0.0,"context_window":5000,"max_output":1,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{},"pricing_krw":{},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text"],"output_modalities":["audio"],"description":"Fish Audio S2 Pro is a Fish Audio model for synthesizing input text into spoken audio.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"speech-2.8-turbo","object":"model","created":0,"owned_by":"pleum","provider":"minimax","display_name":"MiniMax Speech 2.8 Turbo","modality":"audio","price_unit":"char_1m","input_price_usd":0.0,"output_price_usd":60.0,"markup_tier":"medium","effective_markup_percent":0.0,"context_window":10000,"max_output":1,"is_active":true,"operations":["speech.synthesize"],"maker":"MiniMax","context_length":10000,"max_output_tokens":1,"architecture":{"input_modalities":["text"],"output_modalities":["audio"]},"supported_parameters":[],"supports_thinking":false,"thinking_forced":false,"pricing":{},"pricing_krw":{},"pricing_tiers":[],"pricing_variants":[],"providers":[{"provider":"minimax","input_price_usd":0.0,"output_price_usd":60.0,"markup_tier":"medium","effective_markup_percent":0.0,"context_window":10000,"max_output":1,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{},"pricing_krw":{},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text"],"output_modalities":["audio"],"description":"MiniMax Speech 2.8 Turbo is the low-latency speech synthesis model that combines speed with natural vocal flow. It supports 40 languages and targets real-time dialogue and other response-sensitive workloads.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"speech-2.8-hd","object":"model","created":0,"owned_by":"pleum","provider":"minimax","display_name":"MiniMax Speech 2.8 HD","modality":"audio","price_unit":"char_1m","input_price_usd":0.0,"output_price_usd":100.0,"markup_tier":"low","effective_markup_percent":0.0,"context_window":10000,"max_output":1,"is_active":true,"operations":["speech.synthesize"],"maker":"MiniMax","context_length":10000,"max_output_tokens":1,"architecture":{"input_modalities":["text"],"output_modalities":["audio"]},"supported_parameters":[],"supports_thinking":false,"thinking_forced":false,"pricing":{},"pricing_krw":{},"pricing_tiers":[],"pricing_variants":[],"providers":[{"provider":"minimax","input_price_usd":0.0,"output_price_usd":100.0,"markup_tier":"low","effective_markup_percent":0.0,"context_window":10000,"max_output":1,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{},"pricing_krw":{},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text"],"output_modalities":["audio"],"description":"MiniMax Speech 2.8 HD is the quality-focused speech synthesis model for ultra-realistic audio and natural sound-tag rendering. It supports 40 languages and seven emotions.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"voxtral-mini-tts-2603","object":"model","created":0,"owned_by":"pleum","provider":"mistral","display_name":"Mistral Voxtral Mini TTS","modality":"audio","price_unit":"char_1m","input_price_usd":0.0,"output_price_usd":16.0,"markup_tier":"high","effective_markup_percent":0.0,"context_window":2000,"max_output":1,"is_active":true,"operations":["speech.synthesize"],"maker":"Mistral","context_length":2000,"max_output_tokens":1,"architecture":{"input_modalities":["text"],"output_modalities":["audio"]},"supported_parameters":[],"supports_thinking":false,"thinking_forced":false,"pricing":{},"pricing_krw":{},"pricing_tiers":[],"pricing_variants":[],"providers":[{"provider":"mistral","input_price_usd":0.0,"output_price_usd":16.0,"markup_tier":"high","effective_markup_percent":0.0,"context_window":2000,"max_output":1,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{},"pricing_krw":{},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text"],"output_modalities":["audio"],"description":"Mistral Voxtral Mini TTS is a Mistral model for synthesizing input text into spoken audio.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"text-embedding-3-large","object":"model","created":0,"owned_by":"pleum","provider":"openai","display_name":"OpenAI Embedding 3 Large","modality":"embedding","price_unit":"token","input_price_usd":0.13,"output_price_usd":0.0,"markup_tier":"high","effective_markup_percent":0.0,"context_window":8191,"max_output":1,"is_active":true,"operations":["embedding.create"],"maker":"OpenAI","context_length":8191,"max_output_tokens":1,"architecture":{"input_modalities":["text"],"output_modalities":["embedding"]},"supported_parameters":[],"supports_thinking":false,"thinking_forced":false,"pricing":{"prompt":"0.00000013","completion":"0.00"},"pricing_krw":{"prompt":"0.000175854900","completion":"0.000000"},"pricing_tiers":[],"pricing_variants":[],"providers":[{"provider":"openai","input_price_usd":0.13,"output_price_usd":0.0,"markup_tier":"high","effective_markup_percent":0.0,"context_window":8191,"max_output":1,"cache_read_usd":0.013,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.00000013","completion":"0.00"},"pricing_krw":{"prompt":"0.000175854900","completion":"0.000000"},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text"],"output_modalities":["embedding"],"description":"OpenAI Text Embedding 3 Large is a large embedding model that converts text into vector representations for retrieval, clustering, and similarity comparison.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"gemini-embedding-2","object":"model","created":0,"owned_by":"pleum","provider":"google","display_name":"Gemini Embedding 2","modality":"embedding","price_unit":"token","input_price_usd":0.2,"output_price_usd":0.0,"markup_tier":"high","effective_markup_percent":0.0,"context_window":8192,"max_output":1,"is_active":true,"operations":["embedding.create"],"maker":"Google","context_length":8192,"max_output_tokens":1,"architecture":{"input_modalities":["text"],"output_modalities":["embedding"]},"supported_parameters":[],"supports_thinking":false,"thinking_forced":false,"pricing":{"prompt":"0.0000002","completion":"0.00"},"pricing_krw":{"prompt":"0.00027054600","completion":"0.000000"},"pricing_tiers":[],"pricing_variants":[],"providers":[{"provider":"google","input_price_usd":0.2,"output_price_usd":0.0,"markup_tier":"high","effective_markup_percent":0.0,"context_window":8192,"max_output":1,"cache_read_usd":0.02,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.0000002","completion":"0.00"},"pricing_krw":{"prompt":"0.00027054600","completion":"0.000000"},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text"],"output_modalities":["embedding"],"description":"Gemini Embedding 2 is Google's first multimodal embedding model, mapping text, images, video, audio, and PDFs into one unified space for cross-modal search, retrieval, and recommendations. It accepts 8,192 input tokens and supports output dimensions from 128 to 3,072.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"text-embedding-3-small","object":"model","created":0,"owned_by":"pleum","provider":"openai","display_name":"Text Embedding 3 Small","modality":"embedding","price_unit":"token","input_price_usd":0.02,"output_price_usd":0.0,"markup_tier":"high","effective_markup_percent":0.0,"context_window":8191,"max_output":1,"is_active":true,"operations":["embedding.create"],"maker":"OpenAI","context_length":8191,"max_output_tokens":1,"architecture":{"input_modalities":["text"],"output_modalities":["embedding"]},"supported_parameters":[],"supports_thinking":false,"thinking_forced":false,"pricing":{"prompt":"0.00000002","completion":"0.00"},"pricing_krw":{"prompt":"0.000027054600","completion":"0.000000"},"pricing_tiers":[],"pricing_variants":[],"providers":[{"provider":"openai","input_price_usd":0.02,"output_price_usd":0.0,"markup_tier":"high","effective_markup_percent":0.0,"context_window":8191,"max_output":1,"cache_read_usd":0.002,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.00000002","completion":"0.00"},"pricing_krw":{"prompt":"0.000027054600","completion":"0.000000"},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text"],"output_modalities":["embedding"],"description":"OpenAI Text Embedding 3 Small converts text into vector representations for retrieval, clustering, and similarity comparison.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"text-embedding-ada-002","object":"model","created":0,"owned_by":"pleum","provider":"openai","display_name":"OpenAI Embedding Ada 002","modality":"embedding","price_unit":"token","input_price_usd":0.1,"output_price_usd":0.0,"markup_tier":"high","effective_markup_percent":0.0,"context_window":8191,"max_output":1,"is_active":true,"operations":["embedding.create"],"maker":"OpenAI","context_length":8191,"max_output_tokens":1,"architecture":{"input_modalities":["text"],"output_modalities":["embedding"]},"supported_parameters":[],"supports_thinking":false,"thinking_forced":false,"pricing":{"prompt":"0.0000001","completion":"0.00"},"pricing_krw":{"prompt":"0.00013527300","completion":"0.000000"},"pricing_tiers":[],"pricing_variants":[],"providers":[{"provider":"openai","input_price_usd":0.1,"output_price_usd":0.0,"markup_tier":"high","effective_markup_percent":0.0,"context_window":8191,"max_output":1,"cache_read_usd":0.01,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.0000001","completion":"0.00"},"pricing_krw":{"prompt":"0.00013527300","completion":"0.000000"},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text"],"output_modalities":["embedding"],"description":"OpenAI Text Embedding Ada 002 is an older embedding model that converts text into vector representations for retrieval, clustering, and similarity comparison.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"text-embedding-v4","object":"model","created":0,"owned_by":"pleum","provider":"qwen","display_name":"Qwen Text-Embedding v4","modality":"embedding","price_unit":"token","input_price_usd":0.07,"output_price_usd":0.0,"markup_tier":"high","effective_markup_percent":0.0,"context_window":8192,"max_output":1,"is_active":true,"operations":["embedding.create"],"maker":"Qwen","context_length":8192,"max_output_tokens":1,"architecture":{"input_modalities":["text"],"output_modalities":["embedding"]},"supported_parameters":[],"supports_thinking":false,"thinking_forced":false,"pricing":{"prompt":"0.00000007","completion":"0.00"},"pricing_krw":{"prompt":"0.000094691100","completion":"0.000000"},"pricing_tiers":[],"pricing_variants":[],"providers":[{"provider":"qwen","input_price_usd":0.07,"output_price_usd":0.0,"markup_tier":"high","effective_markup_percent":0.0,"context_window":8192,"max_output":1,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.00000007","completion":"0.00"},"pricing_krw":{"prompt":"0.000094691100","completion":"0.000000"},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text"],"output_modalities":["embedding"],"description":"Alibaba Cloud's Qwen Text-Embedding v4 is a text embedding model that produces vector representations for retrieval, clustering, and similarity comparison.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"solar-embedding-2-query","object":"model","created":0,"owned_by":"pleum","provider":"upstage","display_name":"Solar Embedding 2 Query","modality":"embedding","price_unit":"token","input_price_usd":0.02,"output_price_usd":0.0,"markup_tier":"high","effective_markup_percent":0.0,"context_window":8192,"max_output":1,"is_active":true,"operations":["embedding.create"],"maker":"Upstage","context_length":8192,"max_output_tokens":1,"architecture":{"input_modalities":["text"],"output_modalities":["embedding"]},"supported_parameters":[],"supports_thinking":false,"thinking_forced":false,"pricing":{"prompt":"0.00000002","completion":"0.00"},"pricing_krw":{"prompt":"0.000027054600","completion":"0.000000"},"pricing_tiers":[],"pricing_variants":[],"providers":[{"provider":"upstage","input_price_usd":0.02,"output_price_usd":0.0,"markup_tier":"high","effective_markup_percent":0.0,"context_window":8192,"max_output":1,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.00000002","completion":"0.00"},"pricing_krw":{"prompt":"0.000027054600","completion":"0.000000"},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text"],"output_modalities":["embedding"],"description":"Solar Embedding 2 Query is Upstage's text embedding model for retrieval queries.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"solar-embedding-2-passage","object":"model","created":0,"owned_by":"pleum","provider":"upstage","display_name":"Solar Embedding 2 Passage","modality":"embedding","price_unit":"token","input_price_usd":0.02,"output_price_usd":0.0,"markup_tier":"high","effective_markup_percent":0.0,"context_window":8192,"max_output":1,"is_active":true,"operations":["embedding.create"],"maker":"Upstage","context_length":8192,"max_output_tokens":1,"architecture":{"input_modalities":["text"],"output_modalities":["embedding"]},"supported_parameters":[],"supports_thinking":false,"thinking_forced":false,"pricing":{"prompt":"0.00000002","completion":"0.00"},"pricing_krw":{"prompt":"0.000027054600","completion":"0.000000"},"pricing_tiers":[],"pricing_variants":[],"providers":[{"provider":"upstage","input_price_usd":0.02,"output_price_usd":0.0,"markup_tier":"high","effective_markup_percent":0.0,"context_window":8192,"max_output":1,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.00000002","completion":"0.00"},"pricing_krw":{"prompt":"0.000027054600","completion":"0.000000"},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text"],"output_modalities":["embedding"],"description":"Solar Embedding 2 Passage is Upstage's text embedding model for retrieval documents.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"Qwen/Qwen3-235B-A22B-Instruct-2507","object":"model","created":0,"owned_by":"pleum","provider":"deepinfra","display_name":"Qwen3 235B A22B (friendli)","modality":"text","price_unit":"token","input_price_usd":0.09,"output_price_usd":0.55,"markup_tier":"high","effective_markup_percent":0.0,"context_window":262144,"max_output":32768,"is_active":true,"operations":["chat.generate"],"maker":"Qwen","context_length":262144,"max_output_tokens":32768,"architecture":{"input_modalities":["text"],"output_modalities":["text"]},"supported_parameters":["temperature","max_tokens","top_p","stop","seed","frequency_penalty","presence_penalty","tools","tool_choice","response_format","parallel_tool_calls","logit_bias","stream"],"supports_thinking":false,"thinking_forced":false,"pricing":{"prompt":"0.00000009","completion":"0.00000055"},"pricing_krw":{"prompt":"0.000121745700","completion":"0.000744001500"},"pricing_tiers":[],"pricing_variants":[],"providers":[{"provider":"deepinfra","input_price_usd":0.09,"output_price_usd":0.55,"markup_tier":"high","effective_markup_percent":0.0,"context_window":262144,"max_output":32768,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.00000009","completion":"0.00000055"},"pricing_krw":{"prompt":"0.000121745700","completion":"0.000744001500"},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text"],"output_modalities":["text"],"description":"Qwen3 235B A22B (friendli) is a Qwen model for general dialogue, document understanding, and text generation. Its currently callable instruction-tuned offering profile provides 262,144 tokens of context with a maximum output of 32,768 tokens.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"deepseek-ai/DeepSeek-R1-0528","object":"model","created":0,"owned_by":"pleum","provider":"deepinfra","display_name":"DeepSeek R1 (0528)","modality":"text","price_unit":"token","input_price_usd":0.5,"output_price_usd":2.15,"markup_tier":"high","effective_markup_percent":0.0,"context_window":163840,"max_output":163840,"is_active":true,"operations":["chat.generate"],"maker":"DeepSeek","context_length":163840,"max_output_tokens":163840,"architecture":{"input_modalities":["text"],"output_modalities":["text"]},"supported_parameters":["temperature","max_tokens","top_p","stop","seed","frequency_penalty","presence_penalty","tools","tool_choice","response_format","parallel_tool_calls","logit_bias","stream","reasoning_effort"],"supports_thinking":true,"thinking_forced":true,"pricing":{"prompt":"0.0000005","completion":"0.00000215"},"pricing_krw":{"prompt":"0.00067636500","completion":"0.002908369500"},"pricing_tiers":[],"pricing_variants":[],"providers":[{"provider":"deepinfra","input_price_usd":0.5,"output_price_usd":2.15,"markup_tier":"high","effective_markup_percent":0.0,"context_window":163840,"max_output":32768,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.0000005","completion":"0.00000215"},"pricing_krw":{"prompt":"0.00067636500","completion":"0.002908369500"},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text"],"output_modalities":["text"],"description":"DeepSeek positions DeepSeek R1 (0528) (nebius) in the DeepSeek R1 family for multi-step analysis and reasoning. Its cataloged dated snapshot profile provides 163,840 tokens of context with a maximum output of 163,840 tokens.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"Qwen/Qwen3-32B","object":"model","created":0,"owned_by":"pleum","provider":"deepinfra","display_name":"Qwen3-32B (siliconflow)","modality":"text","price_unit":"token","input_price_usd":0.08,"output_price_usd":0.28,"markup_tier":"high","effective_markup_percent":0.0,"context_window":131072,"max_output":131072,"is_active":true,"operations":["chat.generate"],"maker":"Qwen","context_length":131072,"max_output_tokens":131072,"architecture":{"input_modalities":["text"],"output_modalities":["text"]},"supported_parameters":["temperature","max_tokens","top_p","stop","seed","frequency_penalty","presence_penalty","tools","tool_choice","response_format","parallel_tool_calls","logit_bias","stream","reasoning_effort"],"supports_thinking":true,"thinking_forced":false,"pricing":{"prompt":"0.00000008","completion":"0.00000028"},"pricing_krw":{"prompt":"0.000108218400","completion":"0.000378764400"},"pricing_tiers":[],"pricing_variants":[],"providers":[{"provider":"deepinfra","input_price_usd":0.08,"output_price_usd":0.28,"markup_tier":"high","effective_markup_percent":0.0,"context_window":40960,"max_output":32768,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.00000008","completion":"0.00000028"},"pricing_krw":{"prompt":"0.000108218400","completion":"0.000378764400"},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text"],"output_modalities":["text"],"description":"Qwen3-32B (siliconflow) is a Qwen model for general dialogue, document understanding, and text generation. PleumRouter catalogs this 32B-class entry with up to 131,072 context tokens and 131,072 output tokens.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"Qwen/Qwen2.5-72B-Instruct","object":"model","created":0,"owned_by":"pleum","provider":"deepinfra","display_name":"Qwen2.5 72B Instruct (hyperbolic)","modality":"text","price_unit":"token","input_price_usd":0.36,"output_price_usd":0.4,"markup_tier":"high","effective_markup_percent":0.0,"context_window":131072,"max_output":131072,"is_active":true,"operations":["chat.generate"],"maker":"Qwen","context_length":131072,"max_output_tokens":131072,"architecture":{"input_modalities":["text"],"output_modalities":["text"]},"supported_parameters":["temperature","max_tokens","top_p","stop","seed","frequency_penalty","presence_penalty","tools","tool_choice","response_format","parallel_tool_calls","logit_bias","stream"],"supports_thinking":false,"thinking_forced":false,"pricing":{"prompt":"0.00000036","completion":"0.0000004"},"pricing_krw":{"prompt":"0.000486982800","completion":"0.00054109200"},"pricing_tiers":[],"pricing_variants":[],"providers":[{"provider":"deepinfra","input_price_usd":0.36,"output_price_usd":0.4,"markup_tier":"high","effective_markup_percent":0.0,"context_window":32768,"max_output":32000,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.00000036","completion":"0.0000004"},"pricing_krw":{"prompt":"0.000486982800","completion":"0.00054109200"},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text"],"output_modalities":["text"],"description":"Qwen2.5 72B Instruct (hyperbolic) is a Qwen2.5-family model for general dialogue, document understanding, and text generation. The public catalog limits for the instruction-tuned release are 131,072 context tokens and 131,072 output tokens.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"deepseek-ai/DeepSeek-V3-0324","object":"model","created":0,"owned_by":"pleum","provider":"deepinfra","display_name":"DeepSeek-V3 (0324) (gmi)","modality":"text","price_unit":"token","input_price_usd":0.24,"output_price_usd":0.9,"markup_tier":"high","effective_markup_percent":0.0,"context_window":163840,"max_output":163840,"is_active":true,"operations":["chat.generate"],"maker":"DeepSeek","context_length":163840,"max_output_tokens":163840,"architecture":{"input_modalities":["text"],"output_modalities":["text"]},"supported_parameters":["temperature","max_tokens","top_p","stop","seed","frequency_penalty","presence_penalty","tools","tool_choice","response_format","parallel_tool_calls","logit_bias","stream"],"supports_thinking":false,"thinking_forced":false,"pricing":{"prompt":"0.00000024","completion":"0.0000009"},"pricing_krw":{"prompt":"0.000324655200","completion":"0.00121745700"},"pricing_tiers":[],"pricing_variants":[],"providers":[{"provider":"deepinfra","input_price_usd":0.24,"output_price_usd":0.9,"markup_tier":"high","effective_markup_percent":0.0,"context_window":163840,"max_output":32768,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.00000024","completion":"0.0000009"},"pricing_krw":{"prompt":"0.000324655200","completion":"0.00121745700"},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text"],"output_modalities":["text"],"description":"DeepSeek positions DeepSeek-V3 (0324) (gmi) in the DeepSeek V3 family for general dialogue, document understanding, and text generation. Its cataloged dated snapshot profile provides 163,840 tokens of context with a maximum output of 163,840 tokens.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"kimi-k2.6","object":"model","created":0,"owned_by":"pleum","provider":"deepinfra","display_name":"Kimi K2.6","modality":"text","price_unit":"token","input_price_usd":0.75,"output_price_usd":3.5,"markup_tier":"high","effective_markup_percent":0.0,"context_window":262144,"max_output":262144,"is_active":true,"operations":["chat.generate"],"maker":"Moonshot","context_length":262144,"max_output_tokens":262144,"architecture":{"input_modalities":["text","image","video"],"output_modalities":["text"]},"supported_parameters":["temperature","max_tokens","top_p","stop","seed","frequency_penalty","presence_penalty","tools","tool_choice","response_format","parallel_tool_calls","logit_bias","stream"],"supports_thinking":false,"thinking_forced":false,"pricing":{"prompt":"0.00000075","completion":"0.0000035"},"pricing_krw":{"prompt":"0.001014547500","completion":"0.00473455500"},"pricing_tiers":[],"pricing_variants":[],"providers":[{"provider":"deepinfra","input_price_usd":0.75,"output_price_usd":3.5,"markup_tier":"high","effective_markup_percent":0.0,"context_window":262144,"max_output":32768,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.00000075","completion":"0.0000035"},"pricing_krw":{"prompt":"0.001014547500","completion":"0.00473455500"},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]},{"provider":"moonshot","input_price_usd":0.95,"output_price_usd":4.0,"markup_tier":"high","effective_markup_percent":0.0,"context_window":262144,"max_output":32768,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.00000095","completion":"0.000004"},"pricing_krw":{"prompt":"0.001285093500","completion":"0.0054109200"},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text","image","video"],"output_modalities":["text"],"description":"Within Moonshot's Kimi K2.6 lineup, Kimi K2.6 (avian) is intended for general dialogue, document understanding, and text generation. PleumRouter's widest-context offering supports 262,144 context tokens and 32,768 output tokens together.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"deepseek-v4-pro-0813","object":"model","created":0,"owned_by":"pleum","provider":"deepinfra","display_name":"DeepSeek V4 Pro 0813","modality":"text","price_unit":"token","input_price_usd":1.3,"output_price_usd":2.6,"markup_tier":"medium","effective_markup_percent":0.0,"context_window":1048576,"max_output":1048576,"is_active":true,"operations":["chat.generate"],"maker":"DeepSeek","context_length":1048576,"max_output_tokens":1048576,"architecture":{"input_modalities":["text"],"output_modalities":["text"]},"supported_parameters":["temperature","max_tokens","top_p","stop","seed","frequency_penalty","presence_penalty","tools","tool_choice","response_format","parallel_tool_calls","logit_bias","stream"],"supports_thinking":false,"thinking_forced":false,"pricing":{"prompt":"0.0000013","completion":"0.0000026"},"pricing_krw":{"prompt":"0.00175854900","completion":"0.00351709800"},"pricing_tiers":[],"pricing_variants":[],"providers":[{"provider":"deepinfra","input_price_usd":1.3,"output_price_usd":2.6,"markup_tier":"medium","effective_markup_percent":0.0,"context_window":1048576,"max_output":32768,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.0000013","completion":"0.0000026"},"pricing_krw":{"prompt":"0.00175854900","completion":"0.00351709800"},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text"],"output_modalities":["text"],"description":"DeepSeek V4 Pro 0813 is the V4 Pro checkpoint that reached GA on 2026-08-13, with strengthened agent benchmarks and native Responses API support. It offers a 1M-token context.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"step-3.7-flash","object":"model","created":0,"owned_by":"pleum","provider":"deepinfra","display_name":"Step 3.7 Flash","modality":"text","price_unit":"token","input_price_usd":0.2,"output_price_usd":1.15,"markup_tier":"high","effective_markup_percent":0.0,"context_window":262144,"max_output":250000,"is_active":true,"operations":["chat.generate"],"maker":"StepFun","context_length":262144,"max_output_tokens":250000,"architecture":{"input_modalities":["text"],"output_modalities":["text"]},"supported_parameters":["temperature","max_tokens","top_p","stop","seed","frequency_penalty","presence_penalty","tools","tool_choice","response_format","parallel_tool_calls","logit_bias","stream"],"supports_thinking":false,"thinking_forced":false,"pricing":{"prompt":"0.0000002","completion":"0.00000115"},"pricing_krw":{"prompt":"0.00027054600","completion":"0.001555639500"},"pricing_tiers":[],"pricing_variants":[],"providers":[{"provider":"deepinfra","input_price_usd":0.2,"output_price_usd":1.15,"markup_tier":"high","effective_markup_percent":0.0,"context_window":262144,"max_output":32768,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.0000002","completion":"0.00000115"},"pricing_krw":{"prompt":"0.00027054600","completion":"0.001555639500"},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text"],"output_modalities":["text"],"description":"Step 3.7 Flash applies StepFun's model family to general dialogue, document understanding, and text generation. PleumRouter catalogs this Flash entry with up to 262,144 context tokens and 32,768 output tokens.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"claude-opus-4-7","object":"model","created":0,"owned_by":"pleum","provider":"anthropic","display_name":"Claude Opus 4.7","modality":"text","price_unit":"token","input_price_usd":5.0,"output_price_usd":25.0,"markup_tier":"medium","effective_markup_percent":0.0,"context_window":1000000,"max_output":128000,"is_active":true,"operations":["chat.generate"],"maker":"Anthropic","context_length":1000000,"max_output_tokens":128000,"architecture":{"input_modalities":["text"],"output_modalities":["text"]},"supported_parameters":["temperature","max_tokens","top_p","stop","seed","frequency_penalty","presence_penalty","tools","tool_choice","response_format","parallel_tool_calls","logit_bias","stream"],"supports_thinking":false,"thinking_forced":false,"pricing":{"prompt":"0.000005","completion":"0.000025"},"pricing_krw":{"prompt":"0.0067636500","completion":"0.0338182500"},"pricing_tiers":[],"pricing_variants":[],"providers":[{"provider":"deepinfra","input_price_usd":5.0,"output_price_usd":25.0,"markup_tier":"medium","effective_markup_percent":0.0,"context_window":1000000,"max_output":32768,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.000005","completion":"0.000025"},"pricing_krw":{"prompt":"0.0067636500","completion":"0.0338182500"},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]},{"provider":"anthropic","input_price_usd":5.0,"output_price_usd":25.0,"markup_tier":"medium","effective_markup_percent":0.0,"context_window":1000000,"max_output":128000,"cache_read_usd":0.5,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.000005","completion":"0.000025"},"pricing_krw":{"prompt":"0.0067636500","completion":"0.0338182500"},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text"],"output_modalities":["text"],"description":"Anthropic positions Claude Opus 4.7 in the Claude Opus family for general dialogue, document understanding, and text generation. The public catalog limits for the standard release are 1,000,000 context tokens and 128,000 output tokens.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"claude-opus-4-6","object":"model","created":0,"owned_by":"pleum","provider":"anthropic","display_name":"Claude Opus 4.6","modality":"text","price_unit":"token","input_price_usd":5.0,"output_price_usd":25.0,"markup_tier":"medium","effective_markup_percent":0.0,"context_window":1000000,"max_output":128000,"is_active":true,"operations":["chat.generate"],"maker":"Anthropic","context_length":1000000,"max_output_tokens":128000,"architecture":{"input_modalities":["text"],"output_modalities":["text"]},"supported_parameters":["temperature","max_tokens","top_p","stop","seed","frequency_penalty","presence_penalty","tools","tool_choice","response_format","parallel_tool_calls","logit_bias","stream"],"supports_thinking":false,"thinking_forced":false,"pricing":{"prompt":"0.000005","completion":"0.000025"},"pricing_krw":{"prompt":"0.0067636500","completion":"0.0338182500"},"pricing_tiers":[],"pricing_variants":[],"providers":[{"provider":"anthropic","input_price_usd":5.0,"output_price_usd":25.0,"markup_tier":"medium","effective_markup_percent":0.0,"context_window":1000000,"max_output":128000,"cache_read_usd":0.5,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.000005","completion":"0.000025"},"pricing_krw":{"prompt":"0.0067636500","completion":"0.0338182500"},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text"],"output_modalities":["text"],"description":"Anthropic positions Claude Opus 4.6 in the Claude Opus family for general dialogue, document understanding, and text generation. Its cataloged standard profile provides 1,000,000 tokens of context with a maximum output of 128,000 tokens.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"claude-opus-4-5-20251101","object":"model","created":0,"owned_by":"pleum","provider":"anthropic","display_name":"Claude Opus 4.5","modality":"text","price_unit":"token","input_price_usd":5.0,"output_price_usd":25.0,"markup_tier":"medium","effective_markup_percent":0.0,"context_window":200000,"max_output":64000,"is_active":true,"operations":["chat.generate"],"maker":"Anthropic","context_length":200000,"max_output_tokens":64000,"architecture":{"input_modalities":["text"],"output_modalities":["text"]},"supported_parameters":["temperature","max_tokens","top_p","stop","seed","frequency_penalty","presence_penalty","tools","tool_choice","response_format","parallel_tool_calls","logit_bias","stream"],"supports_thinking":false,"thinking_forced":false,"pricing":{"prompt":"0.000005","completion":"0.000025"},"pricing_krw":{"prompt":"0.0067636500","completion":"0.0338182500"},"pricing_tiers":[],"pricing_variants":[],"providers":[{"provider":"anthropic","input_price_usd":5.0,"output_price_usd":25.0,"markup_tier":"medium","effective_markup_percent":0.0,"context_window":200000,"max_output":64000,"cache_read_usd":0.5,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.000005","completion":"0.000025"},"pricing_krw":{"prompt":"0.0067636500","completion":"0.0338182500"},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text"],"output_modalities":["text"],"description":"Anthropic positions Claude Opus 4.5 in the Claude Opus family for general dialogue, document understanding, and text generation. Its cataloged dated snapshot profile provides 200,000 tokens of context with a maximum output of 64,000 tokens.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"claude-sonnet-4-5-20250929","object":"model","created":0,"owned_by":"pleum","provider":"anthropic","display_name":"Claude Sonnet 4.5","modality":"text","price_unit":"token","input_price_usd":3.0,"output_price_usd":15.0,"markup_tier":"medium","effective_markup_percent":0.0,"context_window":200000,"max_output":64000,"is_active":true,"operations":["chat.generate"],"maker":"Anthropic","context_length":200000,"max_output_tokens":64000,"architecture":{"input_modalities":["text"],"output_modalities":["text"]},"supported_parameters":["temperature","max_tokens","top_p","stop","seed","frequency_penalty","presence_penalty","tools","tool_choice","response_format","parallel_tool_calls","logit_bias","stream"],"supports_thinking":false,"thinking_forced":false,"pricing":{"prompt":"0.000003","completion":"0.000015"},"pricing_krw":{"prompt":"0.0040581900","completion":"0.0202909500"},"pricing_tiers":[],"pricing_variants":[],"providers":[{"provider":"anthropic","input_price_usd":3.0,"output_price_usd":15.0,"markup_tier":"medium","effective_markup_percent":0.0,"context_window":200000,"max_output":64000,"cache_read_usd":0.3,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.000003","completion":"0.000015"},"pricing_krw":{"prompt":"0.0040581900","completion":"0.0202909500"},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text"],"output_modalities":["text"],"description":"Claude Sonnet 4.5 is Anthropic's Claude Sonnet-line option for general dialogue, document understanding, and text generation. The public catalog limits for the dated snapshot release are 200,000 context tokens and 64,000 output tokens.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"gemini-embedding-001","object":"model","created":0,"owned_by":"pleum","provider":"google","display_name":"Gemini Embedding 001","modality":"embedding","price_unit":"token","input_price_usd":0.15,"output_price_usd":0.0,"markup_tier":"high","effective_markup_percent":0.0,"context_window":2048,"max_output":1,"is_active":true,"operations":["embedding.create"],"maker":"Google","context_length":2048,"max_output_tokens":1,"architecture":{"input_modalities":["text"],"output_modalities":["embedding"]},"supported_parameters":[],"supports_thinking":false,"thinking_forced":false,"pricing":{"prompt":"0.00000015","completion":"0.00"},"pricing_krw":{"prompt":"0.000202909500","completion":"0.000000"},"pricing_tiers":[],"pricing_variants":[],"providers":[{"provider":"google","input_price_usd":0.15,"output_price_usd":0.0,"markup_tier":"high","effective_markup_percent":0.0,"context_window":2048,"max_output":1,"cache_read_usd":0.015,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.00000015","completion":"0.00"},"pricing_krw":{"prompt":"0.000202909500","completion":"0.000000"},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text"],"output_modalities":["embedding"],"description":"Built in Google's Gemini Embedding line, Gemini Embedding 001 handles vector representations for retrieval, clustering, and similarity.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"nvidia/NVIDIA-Nemotron-3-Ultra-550B-A55B","object":"model","created":0,"owned_by":"pleum","provider":"deepinfra","display_name":"Nemotron 3 Ultra 550B (baseten)","modality":"text","price_unit":"token","input_price_usd":0.5,"output_price_usd":2.2,"markup_tier":"high","effective_markup_percent":0.0,"context_window":1000000,"max_output":32768,"is_active":true,"operations":["chat.generate"],"maker":"NVIDIA","context_length":1000000,"max_output_tokens":32768,"architecture":{"input_modalities":["text"],"output_modalities":["text"]},"supported_parameters":["temperature","max_tokens","top_p","stop","seed","frequency_penalty","presence_penalty","tools","tool_choice","response_format","parallel_tool_calls","logit_bias","stream"],"supports_thinking":false,"thinking_forced":false,"pricing":{"prompt":"0.0000005","completion":"0.0000022"},"pricing_krw":{"prompt":"0.00067636500","completion":"0.00297600600"},"pricing_tiers":[],"pricing_variants":[],"providers":[{"provider":"deepinfra","input_price_usd":0.5,"output_price_usd":2.2,"markup_tier":"high","effective_markup_percent":0.0,"context_window":262144,"max_output":32768,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.0000005","completion":"0.0000022"},"pricing_krw":{"prompt":"0.00067636500","completion":"0.00297600600"},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text"],"output_modalities":["text"],"description":"Built in NVIDIA's Nemotron line, Nemotron 3 Ultra 550B (baseten) handles general dialogue, document understanding, and text generation. PleumRouter catalogs this 550B-class entry with up to 262,144 context tokens and 32,768 output tokens.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"gemini-2.5-computer-use-preview-10-2025","object":"model","created":0,"owned_by":"pleum","provider":"google","display_name":"Gemini 2.5 Computer Use Preview 10 2025","modality":"text","price_unit":"token","input_price_usd":1.25,"output_price_usd":10.0,"markup_tier":"medium","effective_markup_percent":0.0,"context_window":128000,"max_output":64000,"is_active":true,"operations":["chat.generate"],"maker":"Google","context_length":128000,"max_output_tokens":64000,"architecture":{"input_modalities":["text"],"output_modalities":["text"]},"supported_parameters":["temperature","max_tokens","top_p","stop","seed","frequency_penalty","presence_penalty","tools","tool_choice","response_format","parallel_tool_calls","logit_bias","stream"],"supports_thinking":false,"thinking_forced":false,"pricing":{"prompt":"0.00000125","completion":"0.00001"},"pricing_krw":{"prompt":"0.001690912500","completion":"0.013527300"},"pricing_tiers":[],"pricing_variants":[],"providers":[{"provider":"google","input_price_usd":1.25,"output_price_usd":10.0,"markup_tier":"medium","effective_markup_percent":0.0,"context_window":128000,"max_output":64000,"cache_read_usd":0.125,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.00000125","completion":"0.00001"},"pricing_krw":{"prompt":"0.001690912500","completion":"0.013527300"},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text"],"output_modalities":["text"],"description":"Within Google's Gemini lineup, Gemini 2.5 Computer Use Preview 10 2025 is intended for general dialogue, document understanding, and text generation. PleumRouter catalogs this preview entry with up to 1,000,000 context tokens and 32,768 output tokens.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"gemini-robotics-er-2-preview","object":"model","created":0,"owned_by":"pleum","provider":"google","display_name":"Gemini Robotics ER 2 Preview","modality":"text","price_unit":"token","input_price_usd":2.0,"output_price_usd":10.0,"markup_tier":"medium","effective_markup_percent":0.0,"context_window":1000000,"max_output":65536,"is_active":true,"operations":["chat.generate"],"maker":"Google","context_length":1000000,"max_output_tokens":65536,"architecture":{"input_modalities":["text"],"output_modalities":["text"]},"supported_parameters":["temperature","max_tokens","top_p","stop","seed","frequency_penalty","presence_penalty","tools","tool_choice","response_format","parallel_tool_calls","logit_bias","stream"],"supports_thinking":false,"thinking_forced":false,"pricing":{"prompt":"0.000002","completion":"0.00001"},"pricing_krw":{"prompt":"0.0027054600","completion":"0.013527300"},"pricing_tiers":[],"pricing_variants":[],"providers":[{"provider":"google","input_price_usd":2.0,"output_price_usd":10.0,"markup_tier":"medium","effective_markup_percent":0.0,"context_window":1000000,"max_output":65536,"cache_read_usd":0.2,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.000002","completion":"0.00001"},"pricing_krw":{"prompt":"0.0027054600","completion":"0.013527300"},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text"],"output_modalities":["text"],"description":"Gemini Robotics ER 2 Preview is Google's successor preview model in the Robotics ER family.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"ministral-3-8b-2512","object":"model","created":0,"owned_by":"pleum","provider":"mistral","display_name":"Ministral 3 8b","modality":"text","price_unit":"token","input_price_usd":0.15,"output_price_usd":0.15,"markup_tier":"high","effective_markup_percent":0.0,"context_window":262144,"max_output":32768,"is_active":true,"operations":["chat.generate"],"maker":"Mistral","context_length":262144,"max_output_tokens":32768,"architecture":{"input_modalities":["text"],"output_modalities":["text"]},"supported_parameters":["temperature","max_tokens","top_p","stop","seed","frequency_penalty","presence_penalty","tools","tool_choice","response_format","parallel_tool_calls","logit_bias","stream"],"supports_thinking":false,"thinking_forced":false,"pricing":{"prompt":"0.00000015","completion":"0.00000015"},"pricing_krw":{"prompt":"0.000202909500","completion":"0.000202909500"},"pricing_tiers":[],"pricing_variants":[],"providers":[{"provider":"mistral","input_price_usd":0.15,"output_price_usd":0.15,"markup_tier":"high","effective_markup_percent":0.0,"context_window":262144,"max_output":32768,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.00000015","completion":"0.00000015"},"pricing_krw":{"prompt":"0.000202909500","completion":"0.000202909500"},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text"],"output_modalities":["text"],"description":"Ministral 3 8b is a Mistral model for general dialogue, document understanding, and text generation. For this Mini variant, the catalog lists a 262,144-token context window and up to 32,768 output tokens.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"ministral-3-3b-2512","object":"model","created":0,"owned_by":"pleum","provider":"mistral","display_name":"Ministral 3 3b","modality":"text","price_unit":"token","input_price_usd":0.1,"output_price_usd":0.1,"markup_tier":"high","effective_markup_percent":0.0,"context_window":262144,"max_output":32768,"is_active":true,"operations":["chat.generate"],"maker":"Mistral","context_length":262144,"max_output_tokens":32768,"architecture":{"input_modalities":["text"],"output_modalities":["text"]},"supported_parameters":["temperature","max_tokens","top_p","stop","seed","frequency_penalty","presence_penalty","tools","tool_choice","response_format","parallel_tool_calls","logit_bias","stream"],"supports_thinking":false,"thinking_forced":false,"pricing":{"prompt":"0.0000001","completion":"0.0000001"},"pricing_krw":{"prompt":"0.00013527300","completion":"0.00013527300"},"pricing_tiers":[],"pricing_variants":[],"providers":[{"provider":"mistral","input_price_usd":0.1,"output_price_usd":0.1,"markup_tier":"high","effective_markup_percent":0.0,"context_window":262144,"max_output":32768,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.0000001","completion":"0.0000001"},"pricing_krw":{"prompt":"0.00013527300","completion":"0.00013527300"},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text"],"output_modalities":["text"],"description":"Ministral 3 3b is a Mistral model for general dialogue, document understanding, and text generation. PleumRouter catalogs this Mini entry with up to 262,144 context tokens and 32,768 output tokens.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"ministral-3-14b-2512","object":"model","created":0,"owned_by":"pleum","provider":"mistral","display_name":"Ministral 3 14b","modality":"text","price_unit":"token","input_price_usd":0.2,"output_price_usd":0.2,"markup_tier":"high","effective_markup_percent":0.0,"context_window":262144,"max_output":32768,"is_active":true,"operations":["chat.generate"],"maker":"Mistral","context_length":262144,"max_output_tokens":32768,"architecture":{"input_modalities":["text"],"output_modalities":["text"]},"supported_parameters":["temperature","max_tokens","top_p","stop","seed","frequency_penalty","presence_penalty","tools","tool_choice","response_format","parallel_tool_calls","logit_bias","stream"],"supports_thinking":false,"thinking_forced":false,"pricing":{"prompt":"0.0000002","completion":"0.0000002"},"pricing_krw":{"prompt":"0.00027054600","completion":"0.00027054600"},"pricing_tiers":[],"pricing_variants":[],"providers":[{"provider":"mistral","input_price_usd":0.2,"output_price_usd":0.2,"markup_tier":"high","effective_markup_percent":0.0,"context_window":262144,"max_output":32768,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.0000002","completion":"0.0000002"},"pricing_krw":{"prompt":"0.00027054600","completion":"0.00027054600"},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text"],"output_modalities":["text"],"description":"Ministral 3 14b is a Mistral model for general dialogue, document understanding, and text generation. Its cataloged Mini profile provides 262,144 tokens of context with a maximum output of 32,768 tokens.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"mistral-embed","object":"model","created":0,"owned_by":"pleum","provider":"mistral","display_name":"Mistral Embed","modality":"embedding","price_unit":"token","input_price_usd":0.1,"output_price_usd":0.0,"markup_tier":"high","effective_markup_percent":0.0,"context_window":8000,"max_output":1,"is_active":true,"operations":["embedding.create"],"maker":"Mistral","context_length":8000,"max_output_tokens":1,"architecture":{"input_modalities":["text"],"output_modalities":["embedding"]},"supported_parameters":[],"supports_thinking":false,"thinking_forced":false,"pricing":{"prompt":"0.0000001","completion":"0.00"},"pricing_krw":{"prompt":"0.00013527300","completion":"0.000000"},"pricing_tiers":[],"pricing_variants":[],"providers":[{"provider":"mistral","input_price_usd":0.1,"output_price_usd":0.0,"markup_tier":"high","effective_markup_percent":0.0,"context_window":8000,"max_output":1,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.0000001","completion":"0.00"},"pricing_krw":{"prompt":"0.00013527300","completion":"0.000000"},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text"],"output_modalities":["embedding"],"description":"Mistral Embed is a Mistral model for vector representations for retrieval, clustering, and similarity.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"codestral-embed-2505","object":"model","created":0,"owned_by":"pleum","provider":"mistral","display_name":"Codestral Embed","modality":"embedding","price_unit":"token","input_price_usd":0.15,"output_price_usd":0.0,"markup_tier":"high","effective_markup_percent":0.0,"context_window":8000,"max_output":1,"is_active":true,"operations":["embedding.create"],"maker":"Mistral","context_length":8000,"max_output_tokens":1,"architecture":{"input_modalities":["text"],"output_modalities":["embedding"]},"supported_parameters":[],"supports_thinking":false,"thinking_forced":false,"pricing":{"prompt":"0.00000015","completion":"0.00"},"pricing_krw":{"prompt":"0.000202909500","completion":"0.000000"},"pricing_tiers":[],"pricing_variants":[],"providers":[{"provider":"mistral","input_price_usd":0.15,"output_price_usd":0.0,"markup_tier":"high","effective_markup_percent":0.0,"context_window":8000,"max_output":1,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.00000015","completion":"0.00"},"pricing_krw":{"prompt":"0.000202909500","completion":"0.000000"},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text"],"output_modalities":["embedding"],"description":"Codestral Embed is Mistral's Codestral-line option for vector representations for retrieval, clustering, and similarity.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"glm-4.5","object":"model","created":0,"owned_by":"pleum","provider":"glm","display_name":"GLM 4.5","modality":"text","price_unit":"token","input_price_usd":0.6,"output_price_usd":2.2,"markup_tier":"high","effective_markup_percent":0.0,"context_window":131072,"max_output":98304,"is_active":true,"operations":["chat.generate"],"maker":"Zhipu","context_length":131072,"max_output_tokens":98304,"architecture":{"input_modalities":["text"],"output_modalities":["text"]},"supported_parameters":["temperature","max_tokens","top_p","stop","seed","frequency_penalty","presence_penalty","tools","tool_choice","response_format","parallel_tool_calls","logit_bias","stream"],"supports_thinking":false,"thinking_forced":false,"pricing":{"prompt":"0.0000006","completion":"0.0000022"},"pricing_krw":{"prompt":"0.00081163800","completion":"0.00297600600"},"pricing_tiers":[],"pricing_variants":[],"providers":[{"provider":"glm","input_price_usd":0.6,"output_price_usd":2.2,"markup_tier":"high","effective_markup_percent":0.0,"context_window":131072,"max_output":98304,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.0000006","completion":"0.0000022"},"pricing_krw":{"prompt":"0.00081163800","completion":"0.00297600600"},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text"],"output_modalities":["text"],"description":"Within Zhipu's GLM-4.5 lineup, GLM 4.5 is intended for general dialogue, document understanding, and text generation. PleumRouter catalogs this standard entry with up to 131,072 context tokens and 32,768 output tokens.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"glm-5-turbo","object":"model","created":0,"owned_by":"pleum","provider":"glm","display_name":"GLM 5 Turbo","modality":"text","price_unit":"token","input_price_usd":1.2,"output_price_usd":4.0,"markup_tier":"medium","effective_markup_percent":0.0,"context_window":200000,"max_output":131072,"is_active":true,"operations":["chat.generate"],"maker":"Zhipu","context_length":200000,"max_output_tokens":131072,"architecture":{"input_modalities":["text"],"output_modalities":["text"]},"supported_parameters":["temperature","max_tokens","top_p","stop","seed","frequency_penalty","presence_penalty","tools","tool_choice","response_format","parallel_tool_calls","logit_bias","stream"],"supports_thinking":false,"thinking_forced":false,"pricing":{"prompt":"0.0000012","completion":"0.000004"},"pricing_krw":{"prompt":"0.00162327600","completion":"0.0054109200"},"pricing_tiers":[],"pricing_variants":[],"providers":[{"provider":"glm","input_price_usd":1.2,"output_price_usd":4.0,"markup_tier":"medium","effective_markup_percent":0.0,"context_window":200000,"max_output":131072,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.0000012","completion":"0.000004"},"pricing_krw":{"prompt":"0.00162327600","completion":"0.0054109200"},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text"],"output_modalities":["text"],"description":"The GLM 5 Turbo release extends Zhipu's GLM-5 family to general dialogue, document understanding, and text generation. The public catalog limits for the Turbo release are 262,144 context tokens and 32,768 output tokens.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"glm-4.7-flashx","object":"model","created":0,"owned_by":"pleum","provider":"glm","display_name":"GLM 4.7 Flashx","modality":"text","price_unit":"token","input_price_usd":0.07,"output_price_usd":0.4,"markup_tier":"high","effective_markup_percent":0.0,"context_window":200000,"max_output":131072,"is_active":true,"operations":["chat.generate"],"maker":"Zhipu","context_length":200000,"max_output_tokens":131072,"architecture":{"input_modalities":["text"],"output_modalities":["text"]},"supported_parameters":["temperature","max_tokens","top_p","stop","seed","frequency_penalty","presence_penalty","tools","tool_choice","response_format","parallel_tool_calls","logit_bias","stream"],"supports_thinking":false,"thinking_forced":false,"pricing":{"prompt":"0.00000007","completion":"0.0000004"},"pricing_krw":{"prompt":"0.000094691100","completion":"0.00054109200"},"pricing_tiers":[],"pricing_variants":[],"providers":[{"provider":"glm","input_price_usd":0.07,"output_price_usd":0.4,"markup_tier":"high","effective_markup_percent":0.0,"context_window":200000,"max_output":131072,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.00000007","completion":"0.0000004"},"pricing_krw":{"prompt":"0.000094691100","completion":"0.00054109200"},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text"],"output_modalities":["text"],"description":"GLM 4.7 Flashx applies Zhipu's GLM-4.7 family to general dialogue, document understanding, and text generation. For this Flash variant, the catalog lists a 202,752-token context window and up to 32,768 output tokens.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"glm-5v-turbo","object":"model","created":0,"owned_by":"pleum","provider":"glm","display_name":"GLM 5v Turbo","modality":"text","price_unit":"token","input_price_usd":1.2,"output_price_usd":4.0,"markup_tier":"medium","effective_markup_percent":0.0,"context_window":200000,"max_output":131072,"is_active":true,"operations":["chat.generate"],"maker":"Zhipu","context_length":200000,"max_output_tokens":131072,"architecture":{"input_modalities":["text","image"],"output_modalities":["text"]},"supported_parameters":["temperature","max_tokens","top_p","stop","seed","frequency_penalty","presence_penalty","tools","tool_choice","response_format","parallel_tool_calls","logit_bias","stream"],"supports_thinking":false,"thinking_forced":false,"pricing":{"prompt":"0.0000012","completion":"0.000004"},"pricing_krw":{"prompt":"0.00162327600","completion":"0.0054109200"},"pricing_tiers":[],"pricing_variants":[],"providers":[{"provider":"glm","input_price_usd":1.2,"output_price_usd":4.0,"markup_tier":"medium","effective_markup_percent":0.0,"context_window":200000,"max_output":131072,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.0000012","completion":"0.000004"},"pricing_krw":{"prompt":"0.00162327600","completion":"0.0054109200"},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text","image"],"output_modalities":["text"],"description":"The GLM 5v Turbo release extends Zhipu's GLM-5 family to understanding visual inputs such as images and documents and returning text. For this Turbo variant, the catalog lists a 262,144-token context window and up to 32,768 output tokens.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"glm-4.6v","object":"model","created":0,"owned_by":"pleum","provider":"glm","display_name":"GLM 4.6v","modality":"text","price_unit":"token","input_price_usd":0.3,"output_price_usd":0.9,"markup_tier":"high","effective_markup_percent":0.0,"context_window":131072,"max_output":32768,"is_active":true,"operations":["chat.generate"],"maker":"Zhipu","context_length":131072,"max_output_tokens":32768,"architecture":{"input_modalities":["text","image"],"output_modalities":["text"]},"supported_parameters":["temperature","max_tokens","top_p","stop","seed","frequency_penalty","presence_penalty","tools","tool_choice","response_format","parallel_tool_calls","logit_bias","stream"],"supports_thinking":false,"thinking_forced":false,"pricing":{"prompt":"0.0000003","completion":"0.0000009"},"pricing_krw":{"prompt":"0.00040581900","completion":"0.00121745700"},"pricing_tiers":[],"pricing_variants":[],"providers":[{"provider":"glm","input_price_usd":0.3,"output_price_usd":0.9,"markup_tier":"high","effective_markup_percent":0.0,"context_window":131072,"max_output":32768,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.0000003","completion":"0.0000009"},"pricing_krw":{"prompt":"0.00040581900","completion":"0.00121745700"},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text","image"],"output_modalities":["text"],"description":"Zhipu positions GLM 4.6v in the GLM-4.6 family for understanding visual inputs such as images and documents and returning text. The public catalog limits for the standard release are 131,072 context tokens and 32,768 output tokens.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"glm-4.6v-flashx","object":"model","created":0,"owned_by":"pleum","provider":"glm","display_name":"GLM 4.6v Flashx","modality":"text","price_unit":"token","input_price_usd":0.04,"output_price_usd":0.4,"markup_tier":"high","effective_markup_percent":0.0,"context_window":131072,"max_output":32768,"is_active":true,"operations":["chat.generate"],"maker":"Zhipu","context_length":131072,"max_output_tokens":32768,"architecture":{"input_modalities":["text","image"],"output_modalities":["text"]},"supported_parameters":["temperature","max_tokens","top_p","stop","seed","frequency_penalty","presence_penalty","tools","tool_choice","response_format","parallel_tool_calls","logit_bias","stream"],"supports_thinking":false,"thinking_forced":false,"pricing":{"prompt":"0.00000004","completion":"0.0000004"},"pricing_krw":{"prompt":"0.000054109200","completion":"0.00054109200"},"pricing_tiers":[],"pricing_variants":[],"providers":[{"provider":"glm","input_price_usd":0.04,"output_price_usd":0.4,"markup_tier":"high","effective_markup_percent":0.0,"context_window":131072,"max_output":32768,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.00000004","completion":"0.0000004"},"pricing_krw":{"prompt":"0.000054109200","completion":"0.00054109200"},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text","image"],"output_modalities":["text"],"description":"Zhipu positions GLM 4.6v Flashx in the GLM-4.6 family for understanding visual inputs such as images and documents and returning text. Its cataloged Flash profile provides 131,072 tokens of context with a maximum output of 32,768 tokens.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"glm-4.6v-flash","object":"model","created":0,"owned_by":"pleum","provider":"glm","display_name":"GLM 4.6v Flash (Free)","modality":"text","price_unit":"token","input_price_usd":0.0,"output_price_usd":0.0,"markup_tier":"high","effective_markup_percent":0.0,"context_window":131072,"max_output":32768,"is_active":true,"operations":["chat.generate"],"maker":"Zhipu","context_length":131072,"max_output_tokens":32768,"architecture":{"input_modalities":["text","image"],"output_modalities":["text"]},"supported_parameters":["temperature","max_tokens","top_p","stop","seed","frequency_penalty","presence_penalty","tools","tool_choice","response_format","parallel_tool_calls","logit_bias","stream"],"supports_thinking":false,"thinking_forced":false,"pricing":{"prompt":"0.00","completion":"0.00"},"pricing_krw":{"prompt":"0.000000","completion":"0.000000"},"pricing_tiers":[],"pricing_variants":[],"providers":[{"provider":"glm","input_price_usd":0.0,"output_price_usd":0.0,"markup_tier":"high","effective_markup_percent":0.0,"context_window":131072,"max_output":32768,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.00","completion":"0.00"},"pricing_krw":{"prompt":"0.000000","completion":"0.000000"},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text","image"],"output_modalities":["text"],"description":"Zhipu positions GLM 4.6v Flash (Free) in the GLM-4.6 family for understanding visual inputs such as images and documents and returning text. Its cataloged Flash profile provides 131,072 tokens of context with a maximum output of 32,768 tokens.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"glm-ocr","object":"model","created":0,"owned_by":"pleum","provider":"glm","display_name":"GLM OCR","modality":"text","price_unit":"token","input_price_usd":0.03,"output_price_usd":0.03,"markup_tier":"high","effective_markup_percent":0.0,"context_window":131072,"max_output":32768,"is_active":true,"operations":["chat.generate"],"maker":"Zhipu","context_length":131072,"max_output_tokens":32768,"architecture":{"input_modalities":["text","image"],"output_modalities":["text"]},"supported_parameters":["temperature","max_tokens","top_p","stop","seed","frequency_penalty","presence_penalty","tools","tool_choice","response_format","parallel_tool_calls","logit_bias","stream"],"supports_thinking":false,"thinking_forced":false,"pricing":{"prompt":"0.00000003","completion":"0.00000003"},"pricing_krw":{"prompt":"0.000040581900","completion":"0.000040581900"},"pricing_tiers":[],"pricing_variants":[],"providers":[{"provider":"glm","input_price_usd":0.03,"output_price_usd":0.03,"markup_tier":"high","effective_markup_percent":0.0,"context_window":131072,"max_output":32768,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.00000003","completion":"0.00000003"},"pricing_krw":{"prompt":"0.000040581900","completion":"0.000040581900"},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text","image"],"output_modalities":["text"],"description":"GLM OCR is Zhipu's GLM-OCR-line option for recognizing and extracting text from documents and images. For this standard variant, the catalog lists a 131,072-token context window and up to 32,768 output tokens.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"kimi-k2.7-code","object":"model","created":0,"owned_by":"pleum","provider":"deepinfra","display_name":"Kimi K2.7 Code","modality":"text","price_unit":"token","input_price_usd":0.68,"output_price_usd":3.4,"markup_tier":"high","effective_markup_percent":0.0,"context_window":262144,"max_output":262144,"is_active":true,"operations":["chat.generate"],"maker":"Moonshot","context_length":262144,"max_output_tokens":262144,"architecture":{"input_modalities":["text","image","video"],"output_modalities":["text"]},"supported_parameters":["temperature","max_tokens","top_p","stop","seed","frequency_penalty","presence_penalty","tools","tool_choice","response_format","parallel_tool_calls","logit_bias","stream"],"supports_thinking":false,"thinking_forced":false,"pricing":{"prompt":"0.00000068","completion":"0.0000034"},"pricing_krw":{"prompt":"0.000919856400","completion":"0.00459928200"},"pricing_tiers":[],"pricing_variants":[],"providers":[{"provider":"deepinfra","input_price_usd":0.68,"output_price_usd":3.4,"markup_tier":"high","effective_markup_percent":0.0,"context_window":262144,"max_output":32768,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.00000068","completion":"0.0000034"},"pricing_krw":{"prompt":"0.000919856400","completion":"0.00459928200"},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]},{"provider":"moonshot","input_price_usd":0.95,"output_price_usd":4.0,"markup_tier":"high","effective_markup_percent":0.0,"context_window":262144,"max_output":32768,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.00000095","completion":"0.000004"},"pricing_krw":{"prompt":"0.001285093500","completion":"0.0054109200"},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text","image","video"],"output_modalities":["text"],"description":"Moonshot positions Kimi k2.7 Code in the Kimi K2.7 family for code generation, software engineering, and tool-driven agent work. For this standard variant, the catalog lists a 262,144-token context window and up to 32,768 output tokens.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"kimi-k2.7-code-highspeed","object":"model","created":0,"owned_by":"pleum","provider":"moonshot","display_name":"Kimi k2.7 Code Highspeed","modality":"text","price_unit":"token","input_price_usd":1.9,"output_price_usd":8.0,"markup_tier":"medium","effective_markup_percent":0.0,"context_window":262144,"max_output":32768,"is_active":true,"operations":["chat.generate"],"maker":"Moonshot","context_length":262144,"max_output_tokens":32768,"architecture":{"input_modalities":["text"],"output_modalities":["text"]},"supported_parameters":["temperature","max_tokens","top_p","stop","seed","frequency_penalty","presence_penalty","tools","tool_choice","response_format","parallel_tool_calls","logit_bias","stream"],"supports_thinking":false,"thinking_forced":false,"pricing":{"prompt":"0.0000019","completion":"0.000008"},"pricing_krw":{"prompt":"0.00257018700","completion":"0.0108218400"},"pricing_tiers":[],"pricing_variants":[],"providers":[{"provider":"moonshot","input_price_usd":1.9,"output_price_usd":8.0,"markup_tier":"medium","effective_markup_percent":0.0,"context_window":262144,"max_output":32768,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.0000019","completion":"0.000008"},"pricing_krw":{"prompt":"0.00257018700","completion":"0.0108218400"},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text"],"output_modalities":["text"],"description":"Moonshot positions Kimi k2.7 Code Highspeed in the Kimi K2.7 family for code generation, software engineering, and tool-driven agent work. The public catalog limits for the Highspeed release are 262,144 context tokens and 32,768 output tokens.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"MiniMax-M2","object":"model","created":0,"owned_by":"pleum","provider":"minimax","display_name":"Minimax M2","modality":"text","price_unit":"token","input_price_usd":0.3,"output_price_usd":1.2,"markup_tier":"high","effective_markup_percent":0.0,"context_window":204800,"max_output":128000,"is_active":true,"operations":["chat.generate"],"maker":"MiniMax","context_length":204800,"max_output_tokens":128000,"architecture":{"input_modalities":["text"],"output_modalities":["text"]},"supported_parameters":["temperature","max_tokens","top_p","stop","seed","frequency_penalty","presence_penalty","tools","tool_choice","response_format","parallel_tool_calls","logit_bias","stream"],"supports_thinking":false,"thinking_forced":false,"pricing":{"prompt":"0.0000003","completion":"0.0000012"},"pricing_krw":{"prompt":"0.00040581900","completion":"0.00162327600"},"pricing_tiers":[{"input_tokens_lte":204800,"input_price_usd_per_m":0.3,"output_price_usd_per_m":1.2,"cache_read_price_usd_per_m":0.03}],"pricing_variants":[],"providers":[{"provider":"minimax","input_price_usd":0.3,"output_price_usd":1.2,"markup_tier":"high","effective_markup_percent":0.0,"context_window":204800,"max_output":128000,"cache_read_usd":0.03,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.0000003","completion":"0.0000012"},"pricing_krw":{"prompt":"0.00040581900","completion":"0.00162327600"},"peak_pricing":null,"pricing_policy":{"version":1,"kind":"token_tiers","tiers":[{"input_tokens_lte":204800,"input_price_usd_per_m":0.3,"output_price_usd_per_m":1.2,"cache_read_price_usd_per_m":0.03}]},"pricing_tiers":[{"input_tokens_lte":204800,"input_price_usd_per_m":0.3,"output_price_usd_per_m":1.2,"cache_read_price_usd_per_m":0.03}],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text"],"output_modalities":["text"],"description":"MiniMax M2 is the M2 version of the MiniMax M2 family for general dialogue, document understanding, and text generation. Its public catalog limits are 204,800 context tokens and 32,768 output tokens.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"deepseek-v3.1","object":"model","created":0,"owned_by":"pleum","provider":"deepinfra","display_name":"DeepSeek V3.1","modality":"text","price_unit":"token","input_price_usd":0.25,"output_price_usd":0.95,"markup_tier":"high","effective_markup_percent":0.0,"context_window":163840,"max_output":32768,"is_active":true,"operations":["chat.generate"],"maker":"DeepSeek","context_length":163840,"max_output_tokens":32768,"architecture":{"input_modalities":["text"],"output_modalities":["text"]},"supported_parameters":["temperature","max_tokens","top_p","stop","seed","frequency_penalty","presence_penalty","tools","tool_choice","response_format","parallel_tool_calls","logit_bias","stream"],"supports_thinking":false,"thinking_forced":false,"pricing":{"prompt":"0.00000025","completion":"0.00000095"},"pricing_krw":{"prompt":"0.000338182500","completion":"0.001285093500"},"pricing_tiers":[],"pricing_variants":[],"providers":[{"provider":"deepinfra","input_price_usd":0.25,"output_price_usd":0.95,"markup_tier":"high","effective_markup_percent":0.0,"context_window":163840,"max_output":32768,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.00000025","completion":"0.00000095"},"pricing_krw":{"prompt":"0.000338182500","completion":"0.001285093500"},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text"],"output_modalities":["text"],"description":"DeepSeek V3.1 is the DeepSeek V3.1 model served at high speed on the SambaNova Cloud with a 128K context.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"meta-llama/Llama-3.3-70B-Instruct-Turbo","object":"model","created":0,"owned_by":"pleum","provider":"deepinfra","display_name":"Llama 3.3 70B Instruct Turbo","modality":"text","price_unit":"token","input_price_usd":0.1,"output_price_usd":0.32,"markup_tier":"high","effective_markup_percent":0.0,"context_window":131072,"max_output":32768,"is_active":true,"operations":["chat.generate"],"maker":"Meta","context_length":131072,"max_output_tokens":32768,"architecture":{"input_modalities":["text"],"output_modalities":["text"]},"supported_parameters":["temperature","max_tokens","top_p","stop","seed","frequency_penalty","presence_penalty","tools","tool_choice","response_format","parallel_tool_calls","logit_bias","stream"],"supports_thinking":false,"thinking_forced":false,"pricing":{"prompt":"0.0000001","completion":"0.00000032"},"pricing_krw":{"prompt":"0.00013527300","completion":"0.000432873600"},"pricing_tiers":[],"pricing_variants":[],"providers":[{"provider":"deepinfra","input_price_usd":0.1,"output_price_usd":0.32,"markup_tier":"high","effective_markup_percent":0.0,"context_window":131072,"max_output":32768,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.0000001","completion":"0.00000032"},"pricing_krw":{"prompt":"0.00013527300","completion":"0.000432873600"},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]},{"provider":"together","input_price_usd":1.04,"output_price_usd":1.04,"markup_tier":"medium","effective_markup_percent":0.0,"context_window":131072,"max_output":8192,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.00000104","completion":"0.00000104"},"pricing_krw":{"prompt":"0.001406839200","completion":"0.001406839200"},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text"],"output_modalities":["text"],"description":"Llama 3.3 70B Instruct Turbo applies Meta's Llama 3.3 family to general dialogue, document understanding, and text generation. Its cataloged instruction-tuned profile provides 131,072 tokens of context with a maximum output of 32,768 tokens.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"meta-llama/Meta-Llama-3.1-70B-Instruct-Turbo","object":"model","created":0,"owned_by":"pleum","provider":"deepinfra","display_name":"Meta Llama 3.1 70B Instruct Turbo","modality":"text","price_unit":"token","input_price_usd":0.4,"output_price_usd":0.4,"markup_tier":"high","effective_markup_percent":0.0,"context_window":131072,"max_output":32768,"is_active":true,"operations":["chat.generate"],"maker":"Meta","context_length":131072,"max_output_tokens":32768,"architecture":{"input_modalities":["text"],"output_modalities":["text"]},"supported_parameters":["temperature","max_tokens","top_p","stop","seed","frequency_penalty","presence_penalty","tools","tool_choice","response_format","parallel_tool_calls","logit_bias","stream"],"supports_thinking":false,"thinking_forced":false,"pricing":{"prompt":"0.0000004","completion":"0.0000004"},"pricing_krw":{"prompt":"0.00054109200","completion":"0.00054109200"},"pricing_tiers":[],"pricing_variants":[],"providers":[{"provider":"deepinfra","input_price_usd":0.4,"output_price_usd":0.4,"markup_tier":"high","effective_markup_percent":0.0,"context_window":131072,"max_output":32768,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.0000004","completion":"0.0000004"},"pricing_krw":{"prompt":"0.00054109200","completion":"0.00054109200"},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text"],"output_modalities":["text"],"description":"Within Meta's Llama 3.1 lineup, Meta Llama 3.1 70B Instruct Turbo is intended for general dialogue, document understanding, and text generation. PleumRouter catalogs this instruction-tuned entry with up to 131,072 context tokens and 32,768 output tokens.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"meta-llama/Meta-Llama-3.1-8B-Instruct-Turbo","object":"model","created":0,"owned_by":"pleum","provider":"deepinfra","display_name":"Meta Llama 3.1 8B Instruct Turbo","modality":"text","price_unit":"token","input_price_usd":0.02,"output_price_usd":0.04,"markup_tier":"high","effective_markup_percent":0.0,"context_window":131072,"max_output":32768,"is_active":true,"operations":["chat.generate"],"maker":"Meta","context_length":131072,"max_output_tokens":32768,"architecture":{"input_modalities":["text"],"output_modalities":["text"]},"supported_parameters":["temperature","max_tokens","top_p","stop","seed","frequency_penalty","presence_penalty","tools","tool_choice","response_format","parallel_tool_calls","logit_bias","stream"],"supports_thinking":false,"thinking_forced":false,"pricing":{"prompt":"0.00000002","completion":"0.00000004"},"pricing_krw":{"prompt":"0.000027054600","completion":"0.000054109200"},"pricing_tiers":[],"pricing_variants":[],"providers":[{"provider":"deepinfra","input_price_usd":0.02,"output_price_usd":0.04,"markup_tier":"high","effective_markup_percent":0.0,"context_window":131072,"max_output":32768,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.00000002","completion":"0.00000004"},"pricing_krw":{"prompt":"0.000027054600","completion":"0.000054109200"},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text"],"output_modalities":["text"],"description":"Within Meta's Llama 3.1 lineup, Meta Llama 3.1 8B Instruct Turbo is intended for general dialogue, document understanding, and text generation. For this instruction-tuned variant, the catalog lists a 131,072-token context window and up to 32,768 output tokens.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"Qwen/Qwen3-Max-Thinking","object":"model","created":0,"owned_by":"pleum","provider":"deepinfra","display_name":"Qwen3 Max Thinking","modality":"text","price_unit":"token","input_price_usd":1.2,"output_price_usd":6.0,"markup_tier":"medium","effective_markup_percent":0.0,"context_window":256000,"max_output":32768,"is_active":true,"operations":["chat.generate"],"maker":"Qwen","context_length":256000,"max_output_tokens":32768,"architecture":{"input_modalities":["text"],"output_modalities":["text"]},"supported_parameters":["temperature","max_tokens","top_p","stop","seed","frequency_penalty","presence_penalty","tools","tool_choice","response_format","parallel_tool_calls","logit_bias","stream"],"supports_thinking":false,"thinking_forced":false,"pricing":{"prompt":"0.0000012","completion":"0.000006"},"pricing_krw":{"prompt":"0.00162327600","completion":"0.0081163800"},"pricing_tiers":[],"pricing_variants":[],"providers":[{"provider":"deepinfra","input_price_usd":1.2,"output_price_usd":6.0,"markup_tier":"medium","effective_markup_percent":0.0,"context_window":256000,"max_output":32768,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.0000012","completion":"0.000006"},"pricing_krw":{"prompt":"0.00162327600","completion":"0.0081163800"},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text"],"output_modalities":["text"],"description":"Qwen3 Max Thinking is a Qwen model for multi-step analysis and reasoning. PleumRouter catalogs this reasoning entry with up to 256,000 context tokens and 32,768 output tokens.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"google/gemma-4-31B-it-turbo","object":"model","created":0,"owned_by":"pleum","provider":"deepinfra","display_name":"gemma 4 31B it turbo","modality":"text","price_unit":"token","input_price_usd":0.09,"output_price_usd":0.34,"markup_tier":"high","effective_markup_percent":0.0,"context_window":262144,"max_output":32768,"is_active":true,"operations":["chat.generate"],"maker":"Google","context_length":262144,"max_output_tokens":32768,"architecture":{"input_modalities":["text"],"output_modalities":["text"]},"supported_parameters":["temperature","max_tokens","top_p","stop","seed","frequency_penalty","presence_penalty","tools","tool_choice","response_format","parallel_tool_calls","logit_bias","stream"],"supports_thinking":false,"thinking_forced":false,"pricing":{"prompt":"0.00000009","completion":"0.00000034"},"pricing_krw":{"prompt":"0.000121745700","completion":"0.000459928200"},"pricing_tiers":[],"pricing_variants":[],"providers":[{"provider":"deepinfra","input_price_usd":0.09,"output_price_usd":0.34,"markup_tier":"high","effective_markup_percent":0.0,"context_window":262144,"max_output":32768,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.00000009","completion":"0.00000034"},"pricing_krw":{"prompt":"0.000121745700","completion":"0.000459928200"},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text"],"output_modalities":["text"],"description":"Within Google's Gemma lineup, gemma 4 31B it turbo is intended for understanding visual inputs such as images and documents and returning text. Its cataloged Turbo profile provides 262,144 tokens of context with a maximum output of 32,768 tokens.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"google/gemma-3-27b-it","object":"model","created":0,"owned_by":"pleum","provider":"deepinfra","display_name":"gemma 3 27b it","modality":"text","price_unit":"token","input_price_usd":0.08,"output_price_usd":0.16,"markup_tier":"high","effective_markup_percent":0.0,"context_window":131072,"max_output":32768,"is_active":true,"operations":["chat.generate"],"maker":"Google","context_length":131072,"max_output_tokens":32768,"architecture":{"input_modalities":["text"],"output_modalities":["text"]},"supported_parameters":["temperature","max_tokens","top_p","stop","seed","frequency_penalty","presence_penalty","tools","tool_choice","response_format","parallel_tool_calls","logit_bias","stream"],"supports_thinking":false,"thinking_forced":false,"pricing":{"prompt":"0.00000008","completion":"0.00000016"},"pricing_krw":{"prompt":"0.000108218400","completion":"0.000216436800"},"pricing_tiers":[],"pricing_variants":[],"providers":[{"provider":"deepinfra","input_price_usd":0.08,"output_price_usd":0.16,"markup_tier":"high","effective_markup_percent":0.0,"context_window":131072,"max_output":32768,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.00000008","completion":"0.00000016"},"pricing_krw":{"prompt":"0.000108218400","completion":"0.000216436800"},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text"],"output_modalities":["text"],"description":"Within Google's Gemma lineup, gemma 3 27b it is intended for understanding visual inputs such as images and documents and returning text. For this 27B-class variant, the catalog lists a 131,072-token context window and up to 32,768 output tokens.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"google/gemma-3-12b-it","object":"model","created":0,"owned_by":"pleum","provider":"deepinfra","display_name":"gemma 3 12b it","modality":"text","price_unit":"token","input_price_usd":0.05,"output_price_usd":0.15,"markup_tier":"high","effective_markup_percent":0.0,"context_window":131072,"max_output":32768,"is_active":true,"operations":["chat.generate"],"maker":"Google","context_length":131072,"max_output_tokens":32768,"architecture":{"input_modalities":["text"],"output_modalities":["text"]},"supported_parameters":["temperature","max_tokens","top_p","stop","seed","frequency_penalty","presence_penalty","tools","tool_choice","response_format","parallel_tool_calls","logit_bias","stream"],"supports_thinking":false,"thinking_forced":false,"pricing":{"prompt":"0.00000005","completion":"0.00000015"},"pricing_krw":{"prompt":"0.000067636500","completion":"0.000202909500"},"pricing_tiers":[],"pricing_variants":[],"providers":[{"provider":"deepinfra","input_price_usd":0.05,"output_price_usd":0.15,"markup_tier":"high","effective_markup_percent":0.0,"context_window":131072,"max_output":32768,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.00000005","completion":"0.00000015"},"pricing_krw":{"prompt":"0.000067636500","completion":"0.000202909500"},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text"],"output_modalities":["text"],"description":"Within Google's Gemma lineup, gemma 3 12b it is intended for understanding visual inputs such as images and documents and returning text. The public catalog limits for the 12B-class release are 131,072 context tokens and 32,768 output tokens.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"google/gemma-3-4b-it","object":"model","created":0,"owned_by":"pleum","provider":"deepinfra","display_name":"gemma 3 4b it","modality":"text","price_unit":"token","input_price_usd":0.05,"output_price_usd":0.1,"markup_tier":"high","effective_markup_percent":0.0,"context_window":131072,"max_output":32768,"is_active":true,"operations":["chat.generate"],"maker":"Google","context_length":131072,"max_output_tokens":32768,"architecture":{"input_modalities":["text"],"output_modalities":["text"]},"supported_parameters":["temperature","max_tokens","top_p","stop","seed","frequency_penalty","presence_penalty","tools","tool_choice","response_format","parallel_tool_calls","logit_bias","stream"],"supports_thinking":false,"thinking_forced":false,"pricing":{"prompt":"0.00000005","completion":"0.0000001"},"pricing_krw":{"prompt":"0.000067636500","completion":"0.00013527300"},"pricing_tiers":[],"pricing_variants":[],"providers":[{"provider":"deepinfra","input_price_usd":0.05,"output_price_usd":0.1,"markup_tier":"high","effective_markup_percent":0.0,"context_window":131072,"max_output":32768,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.00000005","completion":"0.0000001"},"pricing_krw":{"prompt":"0.000067636500","completion":"0.00013527300"},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text"],"output_modalities":["text"],"description":"Within Google's Gemma lineup, gemma 3 4b it is intended for understanding visual inputs such as images and documents and returning text. PleumRouter catalogs this 4B-class entry with up to 131,072 context tokens and 32,768 output tokens.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"mistralai/Mistral-Small-3.2-24B-Instruct-2506","object":"model","created":0,"owned_by":"pleum","provider":"deepinfra","display_name":"Mistral Small 3.2 24B Instruct 2506","modality":"text","price_unit":"token","input_price_usd":0.075,"output_price_usd":0.2,"markup_tier":"high","effective_markup_percent":0.0,"context_window":128000,"max_output":32768,"is_active":true,"operations":["chat.generate"],"maker":"Mistral","context_length":128000,"max_output_tokens":32768,"architecture":{"input_modalities":["text"],"output_modalities":["text"]},"supported_parameters":["temperature","max_tokens","top_p","stop","seed","frequency_penalty","presence_penalty","tools","tool_choice","response_format","parallel_tool_calls","logit_bias","stream"],"supports_thinking":false,"thinking_forced":false,"pricing":{"prompt":"0.000000075","completion":"0.0000002"},"pricing_krw":{"prompt":"0.0001014547500","completion":"0.00027054600"},"pricing_tiers":[],"pricing_variants":[],"providers":[{"provider":"deepinfra","input_price_usd":0.075,"output_price_usd":0.2,"markup_tier":"high","effective_markup_percent":0.0,"context_window":128000,"max_output":32768,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.000000075","completion":"0.0000002"},"pricing_krw":{"prompt":"0.0001014547500","completion":"0.00027054600"},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text"],"output_modalities":["text"],"description":"Mistral Small 3.2 24B Instruct 2506 is a Mistral model for general dialogue, document understanding, and text generation. The public catalog limits for the instruction-tuned release are 128,000 context tokens and 32,768 output tokens.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"mistralai/Mistral-Small-24B-Instruct-2501","object":"model","created":0,"owned_by":"pleum","provider":"deepinfra","display_name":"Mistral Small 24B Instruct 2501","modality":"text","price_unit":"token","input_price_usd":0.05,"output_price_usd":0.08,"markup_tier":"high","effective_markup_percent":0.0,"context_window":32768,"max_output":32000,"is_active":true,"operations":["chat.generate"],"maker":"Mistral","context_length":32768,"max_output_tokens":32000,"architecture":{"input_modalities":["text"],"output_modalities":["text"]},"supported_parameters":["temperature","max_tokens","top_p","stop","seed","frequency_penalty","presence_penalty","tools","tool_choice","response_format","parallel_tool_calls","logit_bias","stream"],"supports_thinking":false,"thinking_forced":false,"pricing":{"prompt":"0.00000005","completion":"0.00000008"},"pricing_krw":{"prompt":"0.000067636500","completion":"0.000108218400"},"pricing_tiers":[],"pricing_variants":[],"providers":[{"provider":"deepinfra","input_price_usd":0.05,"output_price_usd":0.08,"markup_tier":"high","effective_markup_percent":0.0,"context_window":32768,"max_output":32000,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.00000005","completion":"0.00000008"},"pricing_krw":{"prompt":"0.000067636500","completion":"0.000108218400"},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text"],"output_modalities":["text"],"description":"Mistral Small 24B Instruct 2501 is a Mistral model for general dialogue, document understanding, and text generation. Its cataloged instruction-tuned profile provides 32,768 tokens of context with a maximum output of 32,000 tokens.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"mistralai/Mistral-Nemo-Instruct-2407","object":"model","created":0,"owned_by":"pleum","provider":"deepinfra","display_name":"Mistral Nemo Instruct 2407","modality":"text","price_unit":"token","input_price_usd":0.019,"output_price_usd":0.03,"markup_tier":"high","effective_markup_percent":0.0,"context_window":131072,"max_output":32768,"is_active":true,"operations":["chat.generate"],"maker":"Mistral","context_length":131072,"max_output_tokens":32768,"architecture":{"input_modalities":["text"],"output_modalities":["text"]},"supported_parameters":["temperature","max_tokens","top_p","stop","seed","frequency_penalty","presence_penalty","tools","tool_choice","response_format","parallel_tool_calls","logit_bias","stream"],"supports_thinking":false,"thinking_forced":false,"pricing":{"prompt":"0.000000019","completion":"0.00000003"},"pricing_krw":{"prompt":"0.0000257018700","completion":"0.000040581900"},"pricing_tiers":[],"pricing_variants":[],"providers":[{"provider":"deepinfra","input_price_usd":0.019,"output_price_usd":0.03,"markup_tier":"high","effective_markup_percent":0.0,"context_window":131072,"max_output":32768,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.000000019","completion":"0.00000003"},"pricing_krw":{"prompt":"0.0000257018700","completion":"0.000040581900"},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text"],"output_modalities":["text"],"description":"Mistral Nemo Instruct 2407 is a Mistral model for general dialogue, document understanding, and text generation. PleumRouter catalogs this instruction-tuned entry with up to 131,072 context tokens and 32,768 output tokens.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"microsoft/phi-4","object":"model","created":0,"owned_by":"pleum","provider":"deepinfra","display_name":"phi 4","modality":"text","price_unit":"token","input_price_usd":0.07,"output_price_usd":0.14,"markup_tier":"high","effective_markup_percent":0.0,"context_window":16384,"max_output":16000,"is_active":true,"operations":["chat.generate"],"maker":"Microsoft","context_length":16384,"max_output_tokens":16000,"architecture":{"input_modalities":["text"],"output_modalities":["text"]},"supported_parameters":["temperature","max_tokens","top_p","stop","seed","frequency_penalty","presence_penalty","tools","tool_choice","response_format","parallel_tool_calls","logit_bias","stream"],"supports_thinking":false,"thinking_forced":false,"pricing":{"prompt":"0.00000007","completion":"0.00000014"},"pricing_krw":{"prompt":"0.000094691100","completion":"0.000189382200"},"pricing_tiers":[],"pricing_variants":[],"providers":[{"provider":"deepinfra","input_price_usd":0.07,"output_price_usd":0.14,"markup_tier":"high","effective_markup_percent":0.0,"context_window":16384,"max_output":16000,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.00000007","completion":"0.00000014"},"pricing_krw":{"prompt":"0.000094691100","completion":"0.000189382200"},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text"],"output_modalities":["text"],"description":"The phi 4 release extends Microsoft's model family to general dialogue, document understanding, and text generation. The public catalog limits for the standard release are 16,384 context tokens and 16,000 output tokens.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"XiaomiMiMo/MiMo-V2.5","object":"model","created":0,"owned_by":"pleum","provider":"deepinfra","display_name":"MiMo V2.5","modality":"text","price_unit":"token","input_price_usd":0.4,"output_price_usd":2.0,"markup_tier":"high","effective_markup_percent":0.0,"context_window":262144,"max_output":32768,"is_active":true,"operations":["chat.generate"],"maker":"Xiaomi","context_length":262144,"max_output_tokens":32768,"architecture":{"input_modalities":["text"],"output_modalities":["text"]},"supported_parameters":["temperature","max_tokens","top_p","stop","seed","frequency_penalty","presence_penalty","tools","tool_choice","response_format","parallel_tool_calls","logit_bias","stream"],"supports_thinking":false,"thinking_forced":false,"pricing":{"prompt":"0.0000004","completion":"0.000002"},"pricing_krw":{"prompt":"0.00054109200","completion":"0.0027054600"},"pricing_tiers":[],"pricing_variants":[],"providers":[{"provider":"deepinfra","input_price_usd":0.4,"output_price_usd":2.0,"markup_tier":"high","effective_markup_percent":0.0,"context_window":262144,"max_output":32768,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.0000004","completion":"0.000002"},"pricing_krw":{"prompt":"0.00054109200","completion":"0.0027054600"},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text"],"output_modalities":["text"],"description":"MiMo V2.5 is a Xiaomi model for general dialogue, document understanding, and text generation. Its cataloged standard profile provides 262,144 tokens of context with a maximum output of 32,768 tokens.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"ByteDance/Seed-1.8","object":"model","created":0,"owned_by":"pleum","provider":"deepinfra","display_name":"Seed 1.8","modality":"text","price_unit":"token","input_price_usd":0.25,"output_price_usd":2.0,"markup_tier":"high","effective_markup_percent":0.0,"context_window":256000,"max_output":32768,"is_active":true,"operations":["chat.generate"],"maker":"ByteDance","context_length":256000,"max_output_tokens":32768,"architecture":{"input_modalities":["text"],"output_modalities":["text"]},"supported_parameters":["temperature","max_tokens","top_p","stop","seed","frequency_penalty","presence_penalty","tools","tool_choice","response_format","parallel_tool_calls","logit_bias","stream"],"supports_thinking":false,"thinking_forced":false,"pricing":{"prompt":"0.00000025","completion":"0.000002"},"pricing_krw":{"prompt":"0.000338182500","completion":"0.0027054600"},"pricing_tiers":[],"pricing_variants":[],"providers":[{"provider":"deepinfra","input_price_usd":0.25,"output_price_usd":2.0,"markup_tier":"high","effective_markup_percent":0.0,"context_window":256000,"max_output":32768,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.00000025","completion":"0.000002"},"pricing_krw":{"prompt":"0.000338182500","completion":"0.0027054600"},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text"],"output_modalities":["text"],"description":"ByteDance positions Seed 1.8 in the Seed 1 family for general dialogue, document understanding, and text generation. The public catalog limits for the standard release are 256,000 context tokens and 32,768 output tokens.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"ByteDance/Seed-2.0-code","object":"model","created":0,"owned_by":"pleum","provider":"deepinfra","display_name":"Seed 2.0 Code","modality":"text","price_unit":"token","input_price_usd":0.5,"output_price_usd":3.0,"markup_tier":"high","effective_markup_percent":0.0,"context_window":256000,"max_output":32768,"is_active":true,"operations":["chat.generate"],"maker":"ByteDance","context_length":256000,"max_output_tokens":32768,"architecture":{"input_modalities":["text"],"output_modalities":["text"]},"supported_parameters":["temperature","max_tokens","top_p","stop","seed","frequency_penalty","presence_penalty","tools","tool_choice","response_format","parallel_tool_calls","logit_bias","stream"],"supports_thinking":false,"thinking_forced":false,"pricing":{"prompt":"0.0000005","completion":"0.000003"},"pricing_krw":{"prompt":"0.00067636500","completion":"0.0040581900"},"pricing_tiers":[],"pricing_variants":[],"providers":[{"provider":"deepinfra","input_price_usd":0.5,"output_price_usd":3.0,"markup_tier":"high","effective_markup_percent":0.0,"context_window":256000,"max_output":32768,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.0000005","completion":"0.000003"},"pricing_krw":{"prompt":"0.00067636500","completion":"0.0040581900"},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text"],"output_modalities":["text"],"description":"Seed 2.0 Code applies ByteDance's Seed 2 family to code generation, software engineering, and tool-driven agent work. PleumRouter catalogs this standard entry with up to 256,000 context tokens and 32,768 output tokens.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"ByteDance/Seed-2.0-mini","object":"model","created":0,"owned_by":"pleum","provider":"deepinfra","display_name":"Seed 2.0 Mini","modality":"text","price_unit":"token","input_price_usd":0.1,"output_price_usd":0.4,"markup_tier":"high","effective_markup_percent":0.0,"context_window":256000,"max_output":32768,"is_active":true,"operations":["chat.generate"],"maker":"ByteDance","context_length":256000,"max_output_tokens":32768,"architecture":{"input_modalities":["text"],"output_modalities":["text"]},"supported_parameters":["temperature","max_tokens","top_p","stop","seed","frequency_penalty","presence_penalty","tools","tool_choice","response_format","parallel_tool_calls","logit_bias","stream"],"supports_thinking":false,"thinking_forced":false,"pricing":{"prompt":"0.0000001","completion":"0.0000004"},"pricing_krw":{"prompt":"0.00013527300","completion":"0.00054109200"},"pricing_tiers":[],"pricing_variants":[],"providers":[{"provider":"deepinfra","input_price_usd":0.1,"output_price_usd":0.4,"markup_tier":"high","effective_markup_percent":0.0,"context_window":256000,"max_output":32768,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.0000001","completion":"0.0000004"},"pricing_krw":{"prompt":"0.00013527300","completion":"0.00054109200"},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text"],"output_modalities":["text"],"description":"Seed 2.0 Mini applies ByteDance's Seed 2 family to general dialogue, document understanding, and text generation. Its cataloged Mini profile provides 256,000 tokens of context with a maximum output of 32,768 tokens.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"ByteDance/Seed-2.0-pro","object":"model","created":0,"owned_by":"pleum","provider":"deepinfra","display_name":"Seed 2.0 Pro","modality":"text","price_unit":"token","input_price_usd":0.5,"output_price_usd":3.0,"markup_tier":"high","effective_markup_percent":0.0,"context_window":256000,"max_output":32768,"is_active":true,"operations":["chat.generate"],"maker":"ByteDance","context_length":256000,"max_output_tokens":32768,"architecture":{"input_modalities":["text"],"output_modalities":["text"]},"supported_parameters":["temperature","max_tokens","top_p","stop","seed","frequency_penalty","presence_penalty","tools","tool_choice","response_format","parallel_tool_calls","logit_bias","stream"],"supports_thinking":false,"thinking_forced":false,"pricing":{"prompt":"0.0000005","completion":"0.000003"},"pricing_krw":{"prompt":"0.00067636500","completion":"0.0040581900"},"pricing_tiers":[],"pricing_variants":[],"providers":[{"provider":"deepinfra","input_price_usd":0.5,"output_price_usd":3.0,"markup_tier":"high","effective_markup_percent":0.0,"context_window":256000,"max_output":32768,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.0000005","completion":"0.000003"},"pricing_krw":{"prompt":"0.00067636500","completion":"0.0040581900"},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text"],"output_modalities":["text"],"description":"Seed 2.0 Pro applies ByteDance's Seed 2 family to general dialogue, document understanding, and text generation. Its cataloged Pro profile provides 256,000 tokens of context with a maximum output of 32,768 tokens.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"Gryphe/MythoMax-L2-13b","object":"model","created":0,"owned_by":"pleum","provider":"deepinfra","display_name":"MythoMax L2 13B","modality":"text","price_unit":"token","input_price_usd":0.4,"output_price_usd":0.4,"markup_tier":"high","effective_markup_percent":0.0,"context_window":4096,"max_output":4096,"is_active":true,"operations":["chat.generate"],"maker":"Gryphe","context_length":4096,"max_output_tokens":4096,"architecture":{"input_modalities":["text"],"output_modalities":["text"]},"supported_parameters":["temperature","max_tokens","top_p","stop","seed","frequency_penalty","presence_penalty","tools","tool_choice","response_format","parallel_tool_calls","logit_bias","stream"],"supports_thinking":false,"thinking_forced":false,"pricing":{"prompt":"0.0000004","completion":"0.0000004"},"pricing_krw":{"prompt":"0.00054109200","completion":"0.00054109200"},"pricing_tiers":[],"pricing_variants":[],"providers":[{"provider":"deepinfra","input_price_usd":0.4,"output_price_usd":0.4,"markup_tier":"high","effective_markup_percent":0.0,"context_window":4096,"max_output":4096,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.0000004","completion":"0.0000004"},"pricing_krw":{"prompt":"0.00054109200","completion":"0.00054109200"},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text"],"output_modalities":["text"],"description":"The MythoMax L2 13B release extends Gryphe's model family to general dialogue, document understanding, and text generation. PleumRouter keeps the output cap at 4,096 tokens so it never exceeds the cataloged 4,096-token context window.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"MiniMaxAI/MiniMax-M2.7-Turbo","object":"model","created":0,"owned_by":"pleum","provider":"deepinfra","display_name":"MiniMax M2.7 Turbo","modality":"text","price_unit":"token","input_price_usd":0.38,"output_price_usd":1.7,"markup_tier":"high","effective_markup_percent":0.0,"context_window":196608,"max_output":32768,"is_active":true,"operations":["chat.generate"],"maker":"MiniMax","context_length":196608,"max_output_tokens":32768,"architecture":{"input_modalities":["text"],"output_modalities":["text"]},"supported_parameters":["temperature","max_tokens","top_p","stop","seed","frequency_penalty","presence_penalty","tools","tool_choice","response_format","parallel_tool_calls","logit_bias","stream"],"supports_thinking":false,"thinking_forced":false,"pricing":{"prompt":"0.00000038","completion":"0.0000017"},"pricing_krw":{"prompt":"0.000514037400","completion":"0.00229964100"},"pricing_tiers":[],"pricing_variants":[],"providers":[{"provider":"deepinfra","input_price_usd":0.38,"output_price_usd":1.7,"markup_tier":"high","effective_markup_percent":0.0,"context_window":196608,"max_output":32768,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.00000038","completion":"0.0000017"},"pricing_krw":{"prompt":"0.000514037400","completion":"0.00229964100"},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text"],"output_modalities":["text"],"description":"MiniMax M2.7 Turbo is MiniMax's M2-line option for general dialogue, document understanding, and text generation. For this Turbo variant, the catalog lists a 196,608-token context window and up to 32,768 output tokens.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"NousResearch/Hermes-3-Llama-3.1-405B","object":"model","created":0,"owned_by":"pleum","provider":"deepinfra","display_name":"Hermes 3 Llama 3.1 405B","modality":"text","price_unit":"token","input_price_usd":1.0,"output_price_usd":1.0,"markup_tier":"medium","effective_markup_percent":0.0,"context_window":131072,"max_output":32768,"is_active":true,"operations":["chat.generate"],"maker":"NousResearch","context_length":131072,"max_output_tokens":32768,"architecture":{"input_modalities":["text"],"output_modalities":["text"]},"supported_parameters":["temperature","max_tokens","top_p","stop","seed","frequency_penalty","presence_penalty","tools","tool_choice","response_format","parallel_tool_calls","logit_bias","stream"],"supports_thinking":false,"thinking_forced":false,"pricing":{"prompt":"0.000001","completion":"0.000001"},"pricing_krw":{"prompt":"0.0013527300","completion":"0.0013527300"},"pricing_tiers":[],"pricing_variants":[],"providers":[{"provider":"deepinfra","input_price_usd":1.0,"output_price_usd":1.0,"markup_tier":"medium","effective_markup_percent":0.0,"context_window":131072,"max_output":32768,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.000001","completion":"0.000001"},"pricing_krw":{"prompt":"0.0013527300","completion":"0.0013527300"},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text"],"output_modalities":["text"],"description":"Built in NousResearch's Llama 3.1 line, Hermes 3 Llama 3.1 405B handles general dialogue, document understanding, and text generation. PleumRouter catalogs this 405B-class entry with up to 131,072 context tokens and 32,768 output tokens.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"NousResearch/Hermes-3-Llama-3.1-70B","object":"model","created":0,"owned_by":"pleum","provider":"deepinfra","display_name":"Hermes 3 Llama 3.1 70B","modality":"text","price_unit":"token","input_price_usd":0.7,"output_price_usd":0.7,"markup_tier":"high","effective_markup_percent":0.0,"context_window":131072,"max_output":32768,"is_active":true,"operations":["chat.generate"],"maker":"NousResearch","context_length":131072,"max_output_tokens":32768,"architecture":{"input_modalities":["text"],"output_modalities":["text"]},"supported_parameters":["temperature","max_tokens","top_p","stop","seed","frequency_penalty","presence_penalty","tools","tool_choice","response_format","parallel_tool_calls","logit_bias","stream"],"supports_thinking":false,"thinking_forced":false,"pricing":{"prompt":"0.0000007","completion":"0.0000007"},"pricing_krw":{"prompt":"0.00094691100","completion":"0.00094691100"},"pricing_tiers":[],"pricing_variants":[],"providers":[{"provider":"deepinfra","input_price_usd":0.7,"output_price_usd":0.7,"markup_tier":"high","effective_markup_percent":0.0,"context_window":131072,"max_output":32768,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.0000007","completion":"0.0000007"},"pricing_krw":{"prompt":"0.00094691100","completion":"0.00094691100"},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text"],"output_modalities":["text"],"description":"Built in NousResearch's Llama 3.1 line, Hermes 3 Llama 3.1 70B handles general dialogue, document understanding, and text generation. Its cataloged 70B-class profile provides 131,072 tokens of context with a maximum output of 32,768 tokens.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"Qwen/Qwen3-14B","object":"model","created":0,"owned_by":"pleum","provider":"deepinfra","display_name":"Qwen3 14B","modality":"text","price_unit":"token","input_price_usd":0.12,"output_price_usd":0.24,"markup_tier":"high","effective_markup_percent":0.0,"context_window":40960,"max_output":32768,"is_active":true,"operations":["chat.generate"],"maker":"Qwen","context_length":40960,"max_output_tokens":32768,"architecture":{"input_modalities":["text"],"output_modalities":["text"]},"supported_parameters":["temperature","max_tokens","top_p","stop","seed","frequency_penalty","presence_penalty","tools","tool_choice","response_format","parallel_tool_calls","logit_bias","stream"],"supports_thinking":false,"thinking_forced":false,"pricing":{"prompt":"0.00000012","completion":"0.00000024"},"pricing_krw":{"prompt":"0.000162327600","completion":"0.000324655200"},"pricing_tiers":[],"pricing_variants":[],"providers":[{"provider":"deepinfra","input_price_usd":0.12,"output_price_usd":0.24,"markup_tier":"high","effective_markup_percent":0.0,"context_window":40960,"max_output":32768,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.00000012","completion":"0.00000024"},"pricing_krw":{"prompt":"0.000162327600","completion":"0.000324655200"},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text"],"output_modalities":["text"],"description":"Qwen3 14B is a Qwen model for general dialogue, document understanding, and text generation. PleumRouter catalogs this 14B-class entry with up to 40,960 context tokens and 32,768 output tokens.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"Qwen/Qwen3-Coder-480B-A35B-Instruct-Turbo","object":"model","created":0,"owned_by":"pleum","provider":"deepinfra","display_name":"Qwen3 Coder 480B A35B Turbo","modality":"text","price_unit":"token","input_price_usd":0.3,"output_price_usd":1.0,"markup_tier":"high","effective_markup_percent":0.0,"context_window":262144,"max_output":32768,"is_active":true,"operations":["chat.generate"],"maker":"Qwen","context_length":262144,"max_output_tokens":32768,"architecture":{"input_modalities":["text"],"output_modalities":["text"]},"supported_parameters":["temperature","max_tokens","top_p","stop","seed","frequency_penalty","presence_penalty","tools","tool_choice","response_format","parallel_tool_calls","logit_bias","stream"],"supports_thinking":false,"thinking_forced":false,"pricing":{"prompt":"0.0000003","completion":"0.000001"},"pricing_krw":{"prompt":"0.00040581900","completion":"0.0013527300"},"pricing_tiers":[],"pricing_variants":[],"providers":[{"provider":"deepinfra","input_price_usd":0.3,"output_price_usd":1.0,"markup_tier":"high","effective_markup_percent":0.0,"context_window":262144,"max_output":32768,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.0000003","completion":"0.000001"},"pricing_krw":{"prompt":"0.00040581900","completion":"0.0013527300"},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text"],"output_modalities":["text"],"description":"Within the Qwen3 Coder lineup, Qwen3 Coder 480B A35B Turbo is intended for code generation, software engineering, and tool-driven agent work. The public catalog limits for the instruction-tuned release are 262,144 context tokens and 32,768 output tokens.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"Qwen/Qwen3-VL-30B-A3B-Instruct","object":"model","created":0,"owned_by":"pleum","provider":"deepinfra","display_name":"Qwen3-VL 30B A3B Instruct","modality":"text","price_unit":"token","input_price_usd":0.15,"output_price_usd":0.6,"markup_tier":"high","effective_markup_percent":0.0,"context_window":262144,"max_output":32768,"is_active":true,"operations":["chat.generate"],"maker":"Qwen","context_length":262144,"max_output_tokens":32768,"architecture":{"input_modalities":["text","image"],"output_modalities":["text"]},"supported_parameters":["temperature","max_tokens","top_p","stop","seed","frequency_penalty","presence_penalty","tools","tool_choice","response_format","parallel_tool_calls","logit_bias","stream"],"supports_thinking":false,"thinking_forced":false,"pricing":{"prompt":"0.00000015","completion":"0.0000006"},"pricing_krw":{"prompt":"0.000202909500","completion":"0.00081163800"},"pricing_tiers":[],"pricing_variants":[],"providers":[{"provider":"deepinfra","input_price_usd":0.15,"output_price_usd":0.6,"markup_tier":"high","effective_markup_percent":0.0,"context_window":262144,"max_output":32768,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.00000015","completion":"0.0000006"},"pricing_krw":{"prompt":"0.000202909500","completion":"0.00081163800"},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text","image"],"output_modalities":["text"],"description":"Within the Qwen3-VL lineup, Qwen3-VL 30B A3B Instruct is intended for understanding visual inputs such as images and documents and returning text. For this instruction-tuned variant, the catalog lists a 262,144-token context window and up to 32,768 output tokens.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"Qwen/Qwen3.5-9B","object":"model","created":0,"owned_by":"pleum","provider":"deepinfra","display_name":"Qwen3.5 9B","modality":"text","price_unit":"token","input_price_usd":0.1,"output_price_usd":0.15,"markup_tier":"high","effective_markup_percent":0.0,"context_window":262144,"max_output":32768,"is_active":true,"operations":["chat.generate"],"maker":"Qwen","context_length":262144,"max_output_tokens":32768,"architecture":{"input_modalities":["text","image"],"output_modalities":["text"]},"supported_parameters":["temperature","max_tokens","top_p","stop","seed","frequency_penalty","presence_penalty","tools","tool_choice","response_format","parallel_tool_calls","logit_bias","stream"],"supports_thinking":false,"thinking_forced":false,"pricing":{"prompt":"0.0000001","completion":"0.00000015"},"pricing_krw":{"prompt":"0.00013527300","completion":"0.000202909500"},"pricing_tiers":[],"pricing_variants":[],"providers":[{"provider":"deepinfra","input_price_usd":0.1,"output_price_usd":0.15,"markup_tier":"high","effective_markup_percent":0.0,"context_window":262144,"max_output":32768,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.0000001","completion":"0.00000015"},"pricing_krw":{"prompt":"0.00013527300","completion":"0.000202909500"},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]},{"provider":"together","input_price_usd":0.17,"output_price_usd":0.25,"markup_tier":"high","effective_markup_percent":0.0,"context_window":262144,"max_output":8192,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.00000017","completion":"0.00000025"},"pricing_krw":{"prompt":"0.000229964100","completion":"0.000338182500"},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text","image"],"output_modalities":["text"],"description":"Within the Qwen3.5 lineup, Qwen3.5 9B is intended for understanding visual inputs such as images and documents and returning text. The public catalog limits for the 9B-class release are 262,144 context tokens and 32,768 output tokens.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"Sao10K/L3-8B-Lunaris-v1-Turbo","object":"model","created":0,"owned_by":"pleum","provider":"deepinfra","display_name":"L3 8B Lunaris v1 Turbo","modality":"text","price_unit":"token","input_price_usd":0.04,"output_price_usd":0.05,"markup_tier":"high","effective_markup_percent":0.0,"context_window":8192,"max_output":8192,"is_active":true,"operations":["chat.generate"],"maker":"Sao10K","context_length":8192,"max_output_tokens":8192,"architecture":{"input_modalities":["text"],"output_modalities":["text"]},"supported_parameters":["temperature","max_tokens","top_p","stop","seed","frequency_penalty","presence_penalty","tools","tool_choice","response_format","parallel_tool_calls","logit_bias","stream"],"supports_thinking":false,"thinking_forced":false,"pricing":{"prompt":"0.00000004","completion":"0.00000005"},"pricing_krw":{"prompt":"0.000054109200","completion":"0.000067636500"},"pricing_tiers":[],"pricing_variants":[],"providers":[{"provider":"deepinfra","input_price_usd":0.04,"output_price_usd":0.05,"markup_tier":"high","effective_markup_percent":0.0,"context_window":8192,"max_output":8192,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.00000004","completion":"0.00000005"},"pricing_krw":{"prompt":"0.000054109200","completion":"0.000067636500"},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text"],"output_modalities":["text"],"description":"L3 8B Lunaris v1 Turbo is a Sao10K model for general dialogue, document understanding, and text generation. PleumRouter applies an 8,192-token output cap so it never exceeds this entry's 8,192-token context window.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"Sao10K/L3.1-70B-Euryale-v2.2","object":"model","created":0,"owned_by":"pleum","provider":"deepinfra","display_name":"L3.1 70B Euryale v2.2","modality":"text","price_unit":"token","input_price_usd":0.85,"output_price_usd":0.85,"markup_tier":"high","effective_markup_percent":0.0,"context_window":131072,"max_output":32768,"is_active":true,"operations":["chat.generate"],"maker":"Sao10K","context_length":131072,"max_output_tokens":32768,"architecture":{"input_modalities":["text"],"output_modalities":["text"]},"supported_parameters":["temperature","max_tokens","top_p","stop","seed","frequency_penalty","presence_penalty","tools","tool_choice","response_format","parallel_tool_calls","logit_bias","stream"],"supports_thinking":false,"thinking_forced":false,"pricing":{"prompt":"0.00000085","completion":"0.00000085"},"pricing_krw":{"prompt":"0.001149820500","completion":"0.001149820500"},"pricing_tiers":[],"pricing_variants":[],"providers":[{"provider":"deepinfra","input_price_usd":0.85,"output_price_usd":0.85,"markup_tier":"high","effective_markup_percent":0.0,"context_window":131072,"max_output":32768,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.00000085","completion":"0.00000085"},"pricing_krw":{"prompt":"0.001149820500","completion":"0.001149820500"},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text"],"output_modalities":["text"],"description":"L3.1 70B Euryale v2.2 is a Sao10K model for general dialogue, document understanding, and text generation. The public catalog limits for the 70B-class release are 131,072 context tokens and 32,768 output tokens.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"XiaomiMiMo/MiMo-V2.5-Pro","object":"model","created":0,"owned_by":"pleum","provider":"deepinfra","display_name":"MiMo V2.5 Pro","modality":"text","price_unit":"token","input_price_usd":1.0,"output_price_usd":3.0,"markup_tier":"medium","effective_markup_percent":0.0,"context_window":1048576,"max_output":32768,"is_active":true,"operations":["chat.generate"],"maker":"Xiaomi","context_length":1048576,"max_output_tokens":32768,"architecture":{"input_modalities":["text"],"output_modalities":["text"]},"supported_parameters":["temperature","max_tokens","top_p","stop","seed","frequency_penalty","presence_penalty","tools","tool_choice","response_format","parallel_tool_calls","logit_bias","stream"],"supports_thinking":false,"thinking_forced":false,"pricing":{"prompt":"0.000001","completion":"0.000003"},"pricing_krw":{"prompt":"0.0013527300","completion":"0.0040581900"},"pricing_tiers":[],"pricing_variants":[],"providers":[{"provider":"deepinfra","input_price_usd":1.0,"output_price_usd":3.0,"markup_tier":"medium","effective_markup_percent":0.0,"context_window":1048576,"max_output":32768,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.000001","completion":"0.000003"},"pricing_krw":{"prompt":"0.0013527300","completion":"0.0040581900"},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text"],"output_modalities":["text"],"description":"MiMo V2.5 Pro is a Xiaomi model for general dialogue, document understanding, and text generation. PleumRouter catalogs this Pro entry with up to 1,048,576 context tokens and 32,768 output tokens.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"meta-llama/Llama-Guard-4-12B","object":"model","created":0,"owned_by":"pleum","provider":"deepinfra","display_name":"Llama Guard 4 12B","modality":"text","price_unit":"token","input_price_usd":0.18,"output_price_usd":0.18,"markup_tier":"high","effective_markup_percent":0.0,"context_window":163840,"max_output":32768,"is_active":true,"operations":["chat.generate"],"maker":"Meta","context_length":163840,"max_output_tokens":32768,"architecture":{"input_modalities":["text"],"output_modalities":["text"]},"supported_parameters":["temperature","max_tokens","top_p","stop","seed","frequency_penalty","presence_penalty","tools","tool_choice","response_format","parallel_tool_calls","logit_bias","stream"],"supports_thinking":false,"thinking_forced":false,"pricing":{"prompt":"0.00000018","completion":"0.00000018"},"pricing_krw":{"prompt":"0.000243491400","completion":"0.000243491400"},"pricing_tiers":[],"pricing_variants":[],"providers":[{"provider":"deepinfra","input_price_usd":0.18,"output_price_usd":0.18,"markup_tier":"high","effective_markup_percent":0.0,"context_window":163840,"max_output":32768,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.00000018","completion":"0.00000018"},"pricing_krw":{"prompt":"0.000243491400","completion":"0.000243491400"},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text"],"output_modalities":["text"],"description":"Llama Guard 4 12B applies Meta's model family to classifying the safety of inputs and responses against policy. PleumRouter catalogs this 12B-class entry with up to 163,840 context tokens and 32,768 output tokens.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"nvidia/Nemotron-Content-Safety-3.5","object":"model","created":0,"owned_by":"pleum","provider":"deepinfra","display_name":"Nemotron Content Safety 3.5","modality":"text","price_unit":"token","input_price_usd":0.2,"output_price_usd":0.2,"markup_tier":"high","effective_markup_percent":0.0,"context_window":131072,"max_output":32768,"is_active":true,"operations":["chat.generate"],"maker":"NVIDIA","context_length":131072,"max_output_tokens":32768,"architecture":{"input_modalities":["text"],"output_modalities":["text"]},"supported_parameters":["temperature","max_tokens","top_p","stop","seed","frequency_penalty","presence_penalty","tools","tool_choice","response_format","parallel_tool_calls","logit_bias","stream"],"supports_thinking":false,"thinking_forced":false,"pricing":{"prompt":"0.0000002","completion":"0.0000002"},"pricing_krw":{"prompt":"0.00027054600","completion":"0.00027054600"},"pricing_tiers":[],"pricing_variants":[],"providers":[{"provider":"deepinfra","input_price_usd":0.2,"output_price_usd":0.2,"markup_tier":"high","effective_markup_percent":0.0,"context_window":131072,"max_output":32768,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.0000002","completion":"0.0000002"},"pricing_krw":{"prompt":"0.00027054600","completion":"0.00027054600"},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text"],"output_modalities":["text"],"description":"Nemotron 3.5 Content Safety is NVIDIA's 4B multilingual moderator for evaluating text together with an optional image and assistant response. It supports standard taxonomy and custom-policy reasoning, returning safety labels and violated categories.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"openai/gpt-oss-120b-Turbo","object":"model","created":0,"owned_by":"pleum","provider":"deepinfra","display_name":"GPT-OSS 120B Turbo","modality":"text","price_unit":"token","input_price_usd":0.15,"output_price_usd":0.6,"markup_tier":"high","effective_markup_percent":0.0,"context_window":131072,"max_output":32768,"is_active":true,"operations":["chat.generate"],"maker":"OpenAI","context_length":131072,"max_output_tokens":32768,"architecture":{"input_modalities":["text"],"output_modalities":["text"]},"supported_parameters":["temperature","max_tokens","top_p","stop","seed","frequency_penalty","presence_penalty","tools","tool_choice","response_format","parallel_tool_calls","logit_bias","stream"],"supports_thinking":false,"thinking_forced":false,"pricing":{"prompt":"0.00000015","completion":"0.0000006"},"pricing_krw":{"prompt":"0.000202909500","completion":"0.00081163800"},"pricing_tiers":[],"pricing_variants":[],"providers":[{"provider":"deepinfra","input_price_usd":0.15,"output_price_usd":0.6,"markup_tier":"high","effective_markup_percent":0.0,"context_window":131072,"max_output":32768,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.00000015","completion":"0.0000006"},"pricing_krw":{"prompt":"0.000202909500","completion":"0.00081163800"},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text"],"output_modalities":["text"],"description":"Built in OpenAI's GPT-OSS line, GPT-OSS 120B Turbo handles general dialogue, document understanding, and text generation. The public catalog limits for the Turbo release are 131,072 context tokens and 32,768 output tokens.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"whisper-large-v3-turbo","object":"model","created":0,"owned_by":"pleum","provider":"groq","display_name":"Whisper Large v3 Turbo","modality":"audio","price_unit":"hour","input_price_usd":0.04,"output_price_usd":0.0,"markup_tier":"high","effective_markup_percent":0.0,"context_window":1,"max_output":1,"is_active":true,"operations":["audio.transcribe"],"maker":"OpenAI","context_length":1,"max_output_tokens":1,"architecture":{"input_modalities":["audio"],"output_modalities":["text"]},"supported_parameters":[],"supports_thinking":false,"thinking_forced":false,"pricing":{},"pricing_krw":{},"pricing_tiers":[],"pricing_variants":[],"providers":[{"provider":"groq","input_price_usd":0.04,"output_price_usd":0.0,"markup_tier":"high","effective_markup_percent":0.0,"context_window":1,"max_output":1,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{},"pricing_krw":{},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["audio"],"output_modalities":["text"],"description":"Whisper Large V3 Turbo is Groq's fast speech-to-text model. PleumRouter serves it through the OpenAI-compatible audio transcription endpoint.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"qwen3.5-plus","object":"model","created":0,"owned_by":"pleum","provider":"qwen","display_name":"Qwen3.5 Plus","modality":"text","price_unit":"token","input_price_usd":0.4,"output_price_usd":2.4,"markup_tier":"medium","effective_markup_percent":0.0,"context_window":1000000,"max_output":65536,"is_active":true,"operations":["chat.generate"],"maker":"Qwen","context_length":1000000,"max_output_tokens":65536,"architecture":{"input_modalities":["text","image","video"],"output_modalities":["text"]},"supported_parameters":["temperature","max_tokens","top_p","stop","seed","frequency_penalty","presence_penalty","tools","tool_choice","response_format","parallel_tool_calls","logit_bias","stream"],"supports_thinking":false,"thinking_forced":false,"pricing":{"prompt":"0.0000004","completion":"0.0000024"},"pricing_krw":{"prompt":"0.00054109200","completion":"0.00324655200"},"pricing_tiers":[{"input_tokens_lte":256000,"input_price_usd_per_m":0.4,"output_price_usd_per_m":2.4},{"input_tokens_lte":1000000,"input_price_usd_per_m":0.5,"output_price_usd_per_m":3.0}],"pricing_variants":[],"providers":[{"provider":"qwen","input_price_usd":0.4,"output_price_usd":2.4,"markup_tier":"medium","effective_markup_percent":0.0,"context_window":1000000,"max_output":65536,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.0000004","completion":"0.0000024"},"pricing_krw":{"prompt":"0.00054109200","completion":"0.00324655200"},"peak_pricing":null,"pricing_policy":{"version":1,"kind":"token_tiers","tiers":[{"input_tokens_lte":256000,"input_price_usd_per_m":0.4,"output_price_usd_per_m":2.4},{"input_tokens_lte":1000000,"input_price_usd_per_m":0.5,"output_price_usd_per_m":3.0}]},"pricing_tiers":[{"input_tokens_lte":256000,"input_price_usd_per_m":0.4,"output_price_usd_per_m":2.4},{"input_tokens_lte":1000000,"input_price_usd_per_m":0.5,"output_price_usd_per_m":3.0}],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text","image","video"],"output_modalities":["text"],"description":"Within the Qwen3.5 lineup, Qwen3.5 Plus is intended for understanding visual inputs such as images and documents and returning text. Its cataloged standard profile provides 262,144 tokens of context with a maximum output of 32,768 tokens.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"qwen3.6-flash","object":"model","created":0,"owned_by":"pleum","provider":"qwen","display_name":"Qwen3.6 Flash","modality":"text","price_unit":"token","input_price_usd":0.25,"output_price_usd":1.5,"markup_tier":"high","effective_markup_percent":0.0,"context_window":1000000,"max_output":65536,"is_active":true,"operations":["chat.generate"],"maker":"Qwen","context_length":1000000,"max_output_tokens":65536,"architecture":{"input_modalities":["text","image","video"],"output_modalities":["text"]},"supported_parameters":["temperature","max_tokens","top_p","stop","seed","frequency_penalty","presence_penalty","tools","tool_choice","response_format","parallel_tool_calls","logit_bias","stream"],"supports_thinking":false,"thinking_forced":false,"pricing":{"prompt":"0.00000025","completion":"0.0000015"},"pricing_krw":{"prompt":"0.000338182500","completion":"0.00202909500"},"pricing_tiers":[{"input_tokens_lte":256000,"input_price_usd_per_m":0.25,"output_price_usd_per_m":1.5},{"input_tokens_lte":1000000,"input_price_usd_per_m":1.0,"output_price_usd_per_m":4.0}],"pricing_variants":[],"providers":[{"provider":"qwen","input_price_usd":0.25,"output_price_usd":1.5,"markup_tier":"high","effective_markup_percent":0.0,"context_window":1000000,"max_output":65536,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.00000025","completion":"0.0000015"},"pricing_krw":{"prompt":"0.000338182500","completion":"0.00202909500"},"peak_pricing":null,"pricing_policy":{"version":1,"kind":"token_tiers","tiers":[{"input_tokens_lte":256000,"input_price_usd_per_m":0.25,"output_price_usd_per_m":1.5},{"input_tokens_lte":1000000,"input_price_usd_per_m":1.0,"output_price_usd_per_m":4.0}]},"pricing_tiers":[{"input_tokens_lte":256000,"input_price_usd_per_m":0.25,"output_price_usd_per_m":1.5},{"input_tokens_lte":1000000,"input_price_usd_per_m":1.0,"output_price_usd_per_m":4.0}],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text","image","video"],"output_modalities":["text"],"description":"Qwen positions Qwen3.6 Flash in the Qwen3.6 family for understanding visual inputs such as images and documents and returning text. For this Flash variant, the catalog lists a 1,000,000-token context window and up to 32,768 output tokens.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"qwen3-vl-plus","object":"model","created":0,"owned_by":"pleum","provider":"qwen","display_name":"Qwen3-VL Plus","modality":"text","price_unit":"token","input_price_usd":0.2,"output_price_usd":1.6,"markup_tier":"high","effective_markup_percent":0.0,"context_window":262144,"max_output":32768,"is_active":true,"operations":["chat.generate"],"maker":"Qwen","context_length":262144,"max_output_tokens":32768,"architecture":{"input_modalities":["text","image"],"output_modalities":["text"]},"supported_parameters":["temperature","max_tokens","top_p","stop","seed","frequency_penalty","presence_penalty","tools","tool_choice","response_format","parallel_tool_calls","logit_bias","stream"],"supports_thinking":false,"thinking_forced":false,"pricing":{"prompt":"0.0000002","completion":"0.0000016"},"pricing_krw":{"prompt":"0.00027054600","completion":"0.00216436800"},"pricing_tiers":[{"input_tokens_lte":32768,"input_price_usd_per_m":0.2,"output_price_usd_per_m":1.6},{"input_tokens_lte":131072,"input_price_usd_per_m":0.3,"output_price_usd_per_m":2.4},{"input_tokens_lte":262144,"input_price_usd_per_m":0.6,"output_price_usd_per_m":4.8}],"pricing_variants":[],"providers":[{"provider":"qwen","input_price_usd":0.2,"output_price_usd":1.6,"markup_tier":"high","effective_markup_percent":0.0,"context_window":262144,"max_output":32768,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.0000002","completion":"0.0000016"},"pricing_krw":{"prompt":"0.00027054600","completion":"0.00216436800"},"peak_pricing":null,"pricing_policy":{"version":1,"kind":"token_tiers","tiers":[{"input_tokens_lte":32768,"input_price_usd_per_m":0.2,"output_price_usd_per_m":1.6},{"input_tokens_lte":131072,"input_price_usd_per_m":0.3,"output_price_usd_per_m":2.4},{"input_tokens_lte":262144,"input_price_usd_per_m":0.6,"output_price_usd_per_m":4.8}]},"pricing_tiers":[{"input_tokens_lte":32768,"input_price_usd_per_m":0.2,"output_price_usd_per_m":1.6},{"input_tokens_lte":131072,"input_price_usd_per_m":0.3,"output_price_usd_per_m":2.4},{"input_tokens_lte":262144,"input_price_usd_per_m":0.6,"output_price_usd_per_m":4.8}],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text","image"],"output_modalities":["text"],"description":"Within the Qwen3-VL lineup, Qwen3-VL Plus is intended for understanding visual inputs such as images and documents and returning text. Its cataloged standard profile provides 262,144 tokens of context with a maximum output of 32,768 tokens.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"qwen3-vl-flash","object":"model","created":0,"owned_by":"pleum","provider":"qwen","display_name":"Qwen3-VL Flash","modality":"text","price_unit":"token","input_price_usd":0.05,"output_price_usd":0.4,"markup_tier":"high","effective_markup_percent":0.0,"context_window":262144,"max_output":32768,"is_active":true,"operations":["chat.generate"],"maker":"Qwen","context_length":262144,"max_output_tokens":32768,"architecture":{"input_modalities":["text","image"],"output_modalities":["text"]},"supported_parameters":["temperature","max_tokens","top_p","stop","seed","frequency_penalty","presence_penalty","tools","tool_choice","response_format","parallel_tool_calls","logit_bias","stream"],"supports_thinking":false,"thinking_forced":false,"pricing":{"prompt":"0.00000005","completion":"0.0000004"},"pricing_krw":{"prompt":"0.000067636500","completion":"0.00054109200"},"pricing_tiers":[{"input_tokens_lte":32768,"input_price_usd_per_m":0.05,"output_price_usd_per_m":0.4},{"input_tokens_lte":131072,"input_price_usd_per_m":0.075,"output_price_usd_per_m":0.6},{"input_tokens_lte":262144,"input_price_usd_per_m":0.12,"output_price_usd_per_m":0.96}],"pricing_variants":[],"providers":[{"provider":"qwen","input_price_usd":0.05,"output_price_usd":0.4,"markup_tier":"high","effective_markup_percent":0.0,"context_window":262144,"max_output":32768,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.00000005","completion":"0.0000004"},"pricing_krw":{"prompt":"0.000067636500","completion":"0.00054109200"},"peak_pricing":null,"pricing_policy":{"version":1,"kind":"token_tiers","tiers":[{"input_tokens_lte":32768,"input_price_usd_per_m":0.05,"output_price_usd_per_m":0.4},{"input_tokens_lte":131072,"input_price_usd_per_m":0.075,"output_price_usd_per_m":0.6},{"input_tokens_lte":262144,"input_price_usd_per_m":0.12,"output_price_usd_per_m":0.96}]},"pricing_tiers":[{"input_tokens_lte":32768,"input_price_usd_per_m":0.05,"output_price_usd_per_m":0.4},{"input_tokens_lte":131072,"input_price_usd_per_m":0.075,"output_price_usd_per_m":0.6},{"input_tokens_lte":262144,"input_price_usd_per_m":0.12,"output_price_usd_per_m":0.96}],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text","image"],"output_modalities":["text"],"description":"Within the Qwen3-VL lineup, Qwen3-VL Flash is intended for understanding visual inputs such as images and documents and returning text. PleumRouter catalogs this Flash entry with up to 262,144 context tokens and 32,768 output tokens.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"qwen-mt-plus","object":"model","created":0,"owned_by":"pleum","provider":"qwen","display_name":"Qwen MT Plus","modality":"text","price_unit":"token","input_price_usd":2.46,"output_price_usd":7.37,"markup_tier":"medium","effective_markup_percent":0.0,"context_window":16384,"max_output":16384,"is_active":true,"operations":["chat.generate"],"maker":"Qwen","context_length":16384,"max_output_tokens":16384,"architecture":{"input_modalities":["text"],"output_modalities":["text"]},"supported_parameters":["temperature","max_tokens","top_p","stop","seed","frequency_penalty","presence_penalty","tools","tool_choice","response_format","parallel_tool_calls","logit_bias","stream"],"supports_thinking":false,"thinking_forced":false,"pricing":{"prompt":"0.00000246","completion":"0.00000737"},"pricing_krw":{"prompt":"0.003327715800","completion":"0.009969620100"},"pricing_tiers":[],"pricing_variants":[],"providers":[{"provider":"qwen","input_price_usd":2.46,"output_price_usd":7.37,"markup_tier":"medium","effective_markup_percent":0.0,"context_window":16384,"max_output":16384,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.00000246","completion":"0.00000737"},"pricing_krw":{"prompt":"0.003327715800","completion":"0.009969620100"},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text"],"output_modalities":["text"],"description":"Qwen positions Qwen MT Plus in the Qwen MT family for translation between languages. Its cataloged standard profile provides 32,768 tokens of context with a maximum output of 32,768 tokens.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"qwen-mt-flash","object":"model","created":0,"owned_by":"pleum","provider":"qwen","display_name":"Qwen MT Flash","modality":"text","price_unit":"token","input_price_usd":0.16,"output_price_usd":0.49,"markup_tier":"high","effective_markup_percent":0.0,"context_window":16384,"max_output":16384,"is_active":true,"operations":["chat.generate"],"maker":"Qwen","context_length":16384,"max_output_tokens":16384,"architecture":{"input_modalities":["text"],"output_modalities":["text"]},"supported_parameters":["temperature","max_tokens","top_p","stop","seed","frequency_penalty","presence_penalty","tools","tool_choice","response_format","parallel_tool_calls","logit_bias","stream"],"supports_thinking":false,"thinking_forced":false,"pricing":{"prompt":"0.00000016","completion":"0.00000049"},"pricing_krw":{"prompt":"0.000216436800","completion":"0.000662837700"},"pricing_tiers":[],"pricing_variants":[],"providers":[{"provider":"qwen","input_price_usd":0.16,"output_price_usd":0.49,"markup_tier":"high","effective_markup_percent":0.0,"context_window":16384,"max_output":16384,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.00000016","completion":"0.00000049"},"pricing_krw":{"prompt":"0.000216436800","completion":"0.000662837700"},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text"],"output_modalities":["text"],"description":"Qwen positions Qwen MT Flash in the Qwen MT family for translation between languages. PleumRouter catalogs this Flash entry with up to 32,768 context tokens and 32,768 output tokens.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"qwen-vl-ocr","object":"model","created":0,"owned_by":"pleum","provider":"qwen","display_name":"Qwen-VL OCR","modality":"text","price_unit":"token","input_price_usd":0.07,"output_price_usd":0.16,"markup_tier":"high","effective_markup_percent":0.0,"context_window":32768,"max_output":32768,"is_active":true,"operations":["chat.generate"],"maker":"Qwen","context_length":32768,"max_output_tokens":32768,"architecture":{"input_modalities":["text","image"],"output_modalities":["text"]},"supported_parameters":["temperature","max_tokens","top_p","stop","seed","frequency_penalty","presence_penalty","tools","tool_choice","response_format","parallel_tool_calls","logit_bias","stream"],"supports_thinking":false,"thinking_forced":false,"pricing":{"prompt":"0.00000007","completion":"0.00000016"},"pricing_krw":{"prompt":"0.000094691100","completion":"0.000216436800"},"pricing_tiers":[],"pricing_variants":[],"providers":[{"provider":"qwen","input_price_usd":0.07,"output_price_usd":0.16,"markup_tier":"high","effective_markup_percent":0.0,"context_window":32768,"max_output":32768,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.00000007","completion":"0.00000016"},"pricing_krw":{"prompt":"0.000094691100","completion":"0.000216436800"},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text","image"],"output_modalities":["text"],"description":"Qwen-VL OCR is a Qwen vision-language model for recognizing text and extracting structured information from documents and images. It supports 32,768 context and output tokens.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"qwen-mt-lite","object":"model","created":0,"owned_by":"pleum","provider":"qwen","display_name":"Qwen MT Lite","modality":"text","price_unit":"token","input_price_usd":0.12,"output_price_usd":0.36,"markup_tier":"high","effective_markup_percent":0.0,"context_window":16384,"max_output":16384,"is_active":true,"operations":["chat.generate"],"maker":"Qwen","context_length":16384,"max_output_tokens":16384,"architecture":{"input_modalities":["text"],"output_modalities":["text"]},"supported_parameters":["temperature","max_tokens","top_p","stop","seed","frequency_penalty","presence_penalty","tools","tool_choice","response_format","parallel_tool_calls","logit_bias","stream"],"supports_thinking":false,"thinking_forced":false,"pricing":{"prompt":"0.00000012","completion":"0.00000036"},"pricing_krw":{"prompt":"0.000162327600","completion":"0.000486982800"},"pricing_tiers":[],"pricing_variants":[],"providers":[{"provider":"qwen","input_price_usd":0.12,"output_price_usd":0.36,"markup_tier":"high","effective_markup_percent":0.0,"context_window":16384,"max_output":16384,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.00000012","completion":"0.00000036"},"pricing_krw":{"prompt":"0.000162327600","completion":"0.000486982800"},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text"],"output_modalities":["text"],"description":"Qwen positions Qwen MT Lite in the Qwen MT family for translation between languages. PleumRouter catalogs this Lite entry with up to 32,768 context tokens and 32,768 output tokens.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"BAAI/bge-base-en-v1.5","object":"model","created":0,"owned_by":"pleum","provider":"deepinfra","display_name":"BGE Base EN v1.5","modality":"embedding","price_unit":"token","input_price_usd":0.005,"output_price_usd":0.0,"markup_tier":"high","effective_markup_percent":0.0,"context_window":512,"max_output":1,"is_active":true,"operations":["embedding.create"],"maker":"BAAI","context_length":512,"max_output_tokens":1,"architecture":{"input_modalities":["text"],"output_modalities":["embedding"]},"supported_parameters":[],"supports_thinking":false,"thinking_forced":false,"pricing":{"prompt":"0.000000005","completion":"0.00"},"pricing_krw":{"prompt":"0.0000067636500","completion":"0.000000"},"pricing_tiers":[],"pricing_variants":[],"providers":[{"provider":"deepinfra","input_price_usd":0.005,"output_price_usd":0.0,"markup_tier":"high","effective_markup_percent":0.0,"context_window":512,"max_output":1,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.000000005","completion":"0.00"},"pricing_krw":{"prompt":"0.0000067636500","completion":"0.000000"},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text"],"output_modalities":["embedding"],"description":"BAAI positions BGE Base EN v1.5 in the BGE family for vector representations for retrieval, clustering, and similarity.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"BAAI/bge-en-icl","object":"model","created":0,"owned_by":"pleum","provider":"deepinfra","display_name":"BGE-EN-ICL","modality":"embedding","price_unit":"token","input_price_usd":0.01,"output_price_usd":0.0,"markup_tier":"high","effective_markup_percent":0.0,"context_window":8192,"max_output":1,"is_active":true,"operations":["embedding.create"],"maker":"BAAI","context_length":8192,"max_output_tokens":1,"architecture":{"input_modalities":["text"],"output_modalities":["embedding"]},"supported_parameters":[],"supports_thinking":false,"thinking_forced":false,"pricing":{"prompt":"0.00000001","completion":"0.00"},"pricing_krw":{"prompt":"0.000013527300","completion":"0.000000"},"pricing_tiers":[],"pricing_variants":[],"providers":[{"provider":"deepinfra","input_price_usd":0.01,"output_price_usd":0.0,"markup_tier":"high","effective_markup_percent":0.0,"context_window":8192,"max_output":1,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.00000001","completion":"0.00"},"pricing_krw":{"prompt":"0.000013527300","completion":"0.000000"},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text"],"output_modalities":["embedding"],"description":"BAAI positions BGE-EN-ICL in the BGE family for vector representations for retrieval, clustering, and similarity.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"BAAI/bge-large-en-v1.5","object":"model","created":0,"owned_by":"pleum","provider":"deepinfra","display_name":"BGE Large EN v1.5","modality":"embedding","price_unit":"token","input_price_usd":0.01,"output_price_usd":0.0,"markup_tier":"high","effective_markup_percent":0.0,"context_window":512,"max_output":1,"is_active":true,"operations":["embedding.create"],"maker":"BAAI","context_length":512,"max_output_tokens":1,"architecture":{"input_modalities":["text"],"output_modalities":["embedding"]},"supported_parameters":[],"supports_thinking":false,"thinking_forced":false,"pricing":{"prompt":"0.00000001","completion":"0.00"},"pricing_krw":{"prompt":"0.000013527300","completion":"0.000000"},"pricing_tiers":[],"pricing_variants":[],"providers":[{"provider":"deepinfra","input_price_usd":0.01,"output_price_usd":0.0,"markup_tier":"high","effective_markup_percent":0.0,"context_window":512,"max_output":1,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.00000001","completion":"0.00"},"pricing_krw":{"prompt":"0.000013527300","completion":"0.000000"},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text"],"output_modalities":["embedding"],"description":"BAAI positions BGE Large EN v1.5 in the BGE family for vector representations for retrieval, clustering, and similarity.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"BAAI/bge-m3","object":"model","created":0,"owned_by":"pleum","provider":"deepinfra","display_name":"BGE-M3","modality":"embedding","price_unit":"token","input_price_usd":0.01,"output_price_usd":0.0,"markup_tier":"high","effective_markup_percent":0.0,"context_window":8192,"max_output":1,"is_active":true,"operations":["embedding.create"],"maker":"BAAI","context_length":8192,"max_output_tokens":1,"architecture":{"input_modalities":["text"],"output_modalities":["embedding"]},"supported_parameters":[],"supports_thinking":false,"thinking_forced":false,"pricing":{"prompt":"0.00000001","completion":"0.00"},"pricing_krw":{"prompt":"0.000013527300","completion":"0.000000"},"pricing_tiers":[],"pricing_variants":[],"providers":[{"provider":"deepinfra","input_price_usd":0.01,"output_price_usd":0.0,"markup_tier":"high","effective_markup_percent":0.0,"context_window":8192,"max_output":1,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.00000001","completion":"0.00"},"pricing_krw":{"prompt":"0.000013527300","completion":"0.000000"},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text"],"output_modalities":["embedding"],"description":"BAAI positions BGE-M3 in the BGE family for vector representations for retrieval, clustering, and similarity.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"BAAI/bge-m3-multi","object":"model","created":0,"owned_by":"pleum","provider":"deepinfra","display_name":"BGE-M3 Multi","modality":"embedding","price_unit":"token","input_price_usd":0.01,"output_price_usd":0.0,"markup_tier":"high","effective_markup_percent":0.0,"context_window":8192,"max_output":1,"is_active":true,"operations":["embedding.create"],"maker":"BAAI","context_length":8192,"max_output_tokens":1,"architecture":{"input_modalities":["text"],"output_modalities":["embedding"]},"supported_parameters":[],"supports_thinking":false,"thinking_forced":false,"pricing":{"prompt":"0.00000001","completion":"0.00"},"pricing_krw":{"prompt":"0.000013527300","completion":"0.000000"},"pricing_tiers":[],"pricing_variants":[],"providers":[{"provider":"deepinfra","input_price_usd":0.01,"output_price_usd":0.0,"markup_tier":"high","effective_markup_percent":0.0,"context_window":8192,"max_output":1,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.00000001","completion":"0.00"},"pricing_krw":{"prompt":"0.000013527300","completion":"0.000000"},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text"],"output_modalities":["embedding"],"description":"BAAI positions BGE-M3 Multi in the BGE family for vector representations for retrieval, clustering, and similarity.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"Qwen/Qwen3-Embedding-0.6B","object":"model","created":0,"owned_by":"pleum","provider":"deepinfra","display_name":"Qwen3 Embedding 0.6B","modality":"embedding","price_unit":"token","input_price_usd":0.01,"output_price_usd":0.0,"markup_tier":"high","effective_markup_percent":0.0,"context_window":32768,"max_output":1,"is_active":true,"operations":["embedding.create"],"maker":"Qwen","context_length":32768,"max_output_tokens":1,"architecture":{"input_modalities":["text"],"output_modalities":["embedding"]},"supported_parameters":[],"supports_thinking":false,"thinking_forced":false,"pricing":{"prompt":"0.00000001","completion":"0.00"},"pricing_krw":{"prompt":"0.000013527300","completion":"0.000000"},"pricing_tiers":[],"pricing_variants":[],"providers":[{"provider":"deepinfra","input_price_usd":0.01,"output_price_usd":0.0,"markup_tier":"high","effective_markup_percent":0.0,"context_window":32768,"max_output":1,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.00000001","completion":"0.00"},"pricing_krw":{"prompt":"0.000013527300","completion":"0.000000"},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text"],"output_modalities":["embedding"],"description":"Qwen3 Embedding 0.6B is the compact 0.6-billion-parameter member of the family for retrieval, clustering, and similarity vectors. Its model card lists a 32,768-token sequence length and embeddings up to 1,024 dimensions.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"Qwen/Qwen3-Embedding-4B","object":"model","created":0,"owned_by":"pleum","provider":"deepinfra","display_name":"Qwen3 Embedding 4B","modality":"embedding","price_unit":"token","input_price_usd":0.02,"output_price_usd":0.0,"markup_tier":"high","effective_markup_percent":0.0,"context_window":32768,"max_output":1,"is_active":true,"operations":["embedding.create"],"maker":"Qwen","context_length":32768,"max_output_tokens":1,"architecture":{"input_modalities":["text"],"output_modalities":["embedding"]},"supported_parameters":[],"supports_thinking":false,"thinking_forced":false,"pricing":{"prompt":"0.00000002","completion":"0.00"},"pricing_krw":{"prompt":"0.000027054600","completion":"0.000000"},"pricing_tiers":[],"pricing_variants":[],"providers":[{"provider":"deepinfra","input_price_usd":0.02,"output_price_usd":0.0,"markup_tier":"high","effective_markup_percent":0.0,"context_window":32768,"max_output":1,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.00000002","completion":"0.00"},"pricing_krw":{"prompt":"0.000027054600","completion":"0.000000"},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text"],"output_modalities":["embedding"],"description":"The mid-sized Qwen3 Embedding 4B model maps text into vectors for retrieval, classification, and clustering. It supports 32,768-token sequences and user-selectable embeddings up to 2,560 dimensions.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"Qwen/Qwen3-Embedding-8B","object":"model","created":0,"owned_by":"pleum","provider":"deepinfra","display_name":"Qwen3 Embedding 8B","modality":"embedding","price_unit":"token","input_price_usd":0.01,"output_price_usd":0.0,"markup_tier":"high","effective_markup_percent":0.0,"context_window":32768,"max_output":1,"is_active":true,"operations":["embedding.create"],"maker":"Qwen","context_length":32768,"max_output_tokens":1,"architecture":{"input_modalities":["text"],"output_modalities":["embedding"]},"supported_parameters":[],"supports_thinking":false,"thinking_forced":false,"pricing":{"prompt":"0.00000001","completion":"0.00"},"pricing_krw":{"prompt":"0.000013527300","completion":"0.000000"},"pricing_tiers":[],"pricing_variants":[],"providers":[{"provider":"deepinfra","input_price_usd":0.01,"output_price_usd":0.0,"markup_tier":"high","effective_markup_percent":0.0,"context_window":32768,"max_output":1,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.00000001","completion":"0.00"},"pricing_krw":{"prompt":"0.000013527300","completion":"0.000000"},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text"],"output_modalities":["embedding"],"description":"Qwen3 Embedding 8B is the family's largest, 8-billion-parameter embedding model for retrieval and similarity tasks. It handles 32,768-token sequences and produces vectors up to 4,096 dimensions.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"google/embeddinggemma-300m","object":"model","created":0,"owned_by":"pleum","provider":"deepinfra","display_name":"EmbeddingGemma 300M","modality":"embedding","price_unit":"token","input_price_usd":0.002,"output_price_usd":0.0,"markup_tier":"high","effective_markup_percent":0.0,"context_window":2048,"max_output":1,"is_active":true,"operations":["embedding.create"],"maker":"Google","context_length":2048,"max_output_tokens":1,"architecture":{"input_modalities":["text"],"output_modalities":["embedding"]},"supported_parameters":[],"supports_thinking":false,"thinking_forced":false,"pricing":{"prompt":"0.000000002","completion":"0.00"},"pricing_krw":{"prompt":"0.0000027054600","completion":"0.000000"},"pricing_tiers":[],"pricing_variants":[],"providers":[{"provider":"deepinfra","input_price_usd":0.002,"output_price_usd":0.0,"markup_tier":"high","effective_markup_percent":0.0,"context_window":2048,"max_output":1,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.000000002","completion":"0.00"},"pricing_krw":{"prompt":"0.0000027054600","completion":"0.000000"},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text"],"output_modalities":["embedding"],"description":"EmbeddingGemma 300M is Google's lightweight open text-embedding model for retrieval, classification, clustering, and semantic similarity. It covers more than 100 languages, accepts 2,048 tokens, and produces 768 dimensions reducible to 512, 256, or 128.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"intfloat/e5-base-v2","object":"model","created":0,"owned_by":"pleum","provider":"deepinfra","display_name":"E5 Base v2","modality":"embedding","price_unit":"token","input_price_usd":0.005,"output_price_usd":0.0,"markup_tier":"high","effective_markup_percent":0.0,"context_window":512,"max_output":1,"is_active":true,"operations":["embedding.create"],"maker":"Microsoft","context_length":512,"max_output_tokens":1,"architecture":{"input_modalities":["text"],"output_modalities":["embedding"]},"supported_parameters":[],"supports_thinking":false,"thinking_forced":false,"pricing":{"prompt":"0.000000005","completion":"0.00"},"pricing_krw":{"prompt":"0.0000067636500","completion":"0.000000"},"pricing_tiers":[],"pricing_variants":[],"providers":[{"provider":"deepinfra","input_price_usd":0.005,"output_price_usd":0.0,"markup_tier":"high","effective_markup_percent":0.0,"context_window":512,"max_output":1,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.000000005","completion":"0.00"},"pricing_krw":{"prompt":"0.0000067636500","completion":"0.000000"},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text"],"output_modalities":["embedding"],"description":"E5 Base v2 is intfloat's English E5 embedding model for encoding queries and passages into 768-dimensional vectors.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"intfloat/e5-large-v2","object":"model","created":0,"owned_by":"pleum","provider":"deepinfra","display_name":"E5 Large v2","modality":"embedding","price_unit":"token","input_price_usd":0.01,"output_price_usd":0.0,"markup_tier":"high","effective_markup_percent":0.0,"context_window":512,"max_output":1,"is_active":true,"operations":["embedding.create"],"maker":"Microsoft","context_length":512,"max_output_tokens":1,"architecture":{"input_modalities":["text"],"output_modalities":["embedding"]},"supported_parameters":[],"supports_thinking":false,"thinking_forced":false,"pricing":{"prompt":"0.00000001","completion":"0.00"},"pricing_krw":{"prompt":"0.000013527300","completion":"0.000000"},"pricing_tiers":[],"pricing_variants":[],"providers":[{"provider":"deepinfra","input_price_usd":0.01,"output_price_usd":0.0,"markup_tier":"high","effective_markup_percent":0.0,"context_window":512,"max_output":1,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.00000001","completion":"0.00"},"pricing_krw":{"prompt":"0.000013527300","completion":"0.000000"},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text"],"output_modalities":["embedding"],"description":"E5 Large v2 is intfloat's English E5 embedding model for encoding queries and passages into 1024-dimensional vectors.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"intfloat/multilingual-e5-large","object":"model","created":0,"owned_by":"pleum","provider":"deepinfra","display_name":"Multilingual E5 Large","modality":"embedding","price_unit":"token","input_price_usd":0.01,"output_price_usd":0.0,"markup_tier":"high","effective_markup_percent":0.0,"context_window":512,"max_output":1,"is_active":true,"operations":["embedding.create"],"maker":"Microsoft","context_length":512,"max_output_tokens":1,"architecture":{"input_modalities":["text"],"output_modalities":["embedding"]},"supported_parameters":[],"supports_thinking":false,"thinking_forced":false,"pricing":{"prompt":"0.00000001","completion":"0.00"},"pricing_krw":{"prompt":"0.000013527300","completion":"0.000000"},"pricing_tiers":[],"pricing_variants":[],"providers":[{"provider":"deepinfra","input_price_usd":0.01,"output_price_usd":0.0,"markup_tier":"high","effective_markup_percent":0.0,"context_window":512,"max_output":1,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.00000001","completion":"0.00"},"pricing_krw":{"prompt":"0.000013527300","completion":"0.000000"},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text"],"output_modalities":["embedding"],"description":"Multilingual E5 Large is intfloat's multilingual E5 embedding model for encoding queries and passages into 1024-dimensional vectors.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"intfloat/multilingual-e5-large-instruct","object":"model","created":0,"owned_by":"pleum","provider":"deepinfra","display_name":"Multilingual E5 Large Instruct","modality":"embedding","price_unit":"token","input_price_usd":0.01,"output_price_usd":0.0,"markup_tier":"high","effective_markup_percent":0.0,"context_window":514,"max_output":1,"is_active":true,"operations":["embedding.create"],"maker":"Microsoft","context_length":514,"max_output_tokens":1,"architecture":{"input_modalities":["text"],"output_modalities":["embedding"]},"supported_parameters":[],"supports_thinking":false,"thinking_forced":false,"pricing":{"prompt":"0.00000001","completion":"0.00"},"pricing_krw":{"prompt":"0.000013527300","completion":"0.000000"},"pricing_tiers":[],"pricing_variants":[],"providers":[{"provider":"deepinfra","input_price_usd":0.01,"output_price_usd":0.0,"markup_tier":"high","effective_markup_percent":0.0,"context_window":512,"max_output":1,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.00000001","completion":"0.00"},"pricing_krw":{"prompt":"0.000013527300","completion":"0.000000"},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]},{"provider":"together","input_price_usd":0.02,"output_price_usd":0.0,"markup_tier":"high","effective_markup_percent":0.0,"context_window":514,"max_output":1,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.00000002","completion":"0.00"},"pricing_krw":{"prompt":"0.000027054600","completion":"0.000000"},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text"],"output_modalities":["embedding"],"description":"Multilingual E5 Large Instruct is intfloat's multilingual E5 embedding model for encoding queries and passages into 1024-dimensional vectors and is instruction-tuned for retrieval.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"nvidia/llama-nemotron-embed-vl-1b-v2","object":"model","created":0,"owned_by":"pleum","provider":"deepinfra","display_name":"Llama Nemotron Embed VL 1B v2","modality":"embedding","price_unit":"token","input_price_usd":0.01,"output_price_usd":0.0,"markup_tier":"high","effective_markup_percent":0.0,"context_window":10240,"max_output":1,"is_active":true,"operations":["embedding.create"],"maker":"Meta","context_length":10240,"max_output_tokens":1,"architecture":{"input_modalities":["text"],"output_modalities":["embedding"]},"supported_parameters":[],"supports_thinking":false,"thinking_forced":false,"pricing":{"prompt":"0.00000001","completion":"0.00"},"pricing_krw":{"prompt":"0.000013527300","completion":"0.000000"},"pricing_tiers":[],"pricing_variants":[],"providers":[{"provider":"deepinfra","input_price_usd":0.01,"output_price_usd":0.0,"markup_tier":"high","effective_markup_percent":0.0,"context_window":10240,"max_output":1,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.00000001","completion":"0.00"},"pricing_krw":{"prompt":"0.000013527300","completion":"0.000000"},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text"],"output_modalities":["embedding"],"description":"Llama Nemotron Embed VL 1B v2 is NVIDIA's multimodal retrieval model for embedding text, document-page images, or combined image-and-text input. It handles pages with tables, charts, and infographics, was evaluated up to 10,240 input tokens, and outputs 2,048-dimensional embeddings.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"sentence-transformers/all-MiniLM-L12-v2","object":"model","created":0,"owned_by":"pleum","provider":"deepinfra","display_name":"all-MiniLM-L12-v2","modality":"embedding","price_unit":"token","input_price_usd":0.005,"output_price_usd":0.0,"markup_tier":"high","effective_markup_percent":0.0,"context_window":512,"max_output":1,"is_active":true,"operations":["embedding.create"],"maker":"Sentence Transformers","context_length":512,"max_output_tokens":1,"architecture":{"input_modalities":["text"],"output_modalities":["embedding"]},"supported_parameters":[],"supports_thinking":false,"thinking_forced":false,"pricing":{"prompt":"0.000000005","completion":"0.00"},"pricing_krw":{"prompt":"0.0000067636500","completion":"0.000000"},"pricing_tiers":[],"pricing_variants":[],"providers":[{"provider":"deepinfra","input_price_usd":0.005,"output_price_usd":0.0,"markup_tier":"high","effective_markup_percent":0.0,"context_window":512,"max_output":1,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.000000005","completion":"0.00"},"pricing_krw":{"prompt":"0.0000067636500","completion":"0.000000"},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text"],"output_modalities":["embedding"],"description":"all-MiniLM-L12-v2 is a Sentence Transformers model for vector representations for retrieval, clustering, and similarity.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"sentence-transformers/all-MiniLM-L6-v2","object":"model","created":0,"owned_by":"pleum","provider":"deepinfra","display_name":"all-MiniLM-L6-v2","modality":"embedding","price_unit":"token","input_price_usd":0.005,"output_price_usd":0.0,"markup_tier":"high","effective_markup_percent":0.0,"context_window":512,"max_output":1,"is_active":true,"operations":["embedding.create"],"maker":"Sentence Transformers","context_length":512,"max_output_tokens":1,"architecture":{"input_modalities":["text"],"output_modalities":["embedding"]},"supported_parameters":[],"supports_thinking":false,"thinking_forced":false,"pricing":{"prompt":"0.000000005","completion":"0.00"},"pricing_krw":{"prompt":"0.0000067636500","completion":"0.000000"},"pricing_tiers":[],"pricing_variants":[],"providers":[{"provider":"deepinfra","input_price_usd":0.005,"output_price_usd":0.0,"markup_tier":"high","effective_markup_percent":0.0,"context_window":512,"max_output":1,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.000000005","completion":"0.00"},"pricing_krw":{"prompt":"0.0000067636500","completion":"0.000000"},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text"],"output_modalities":["embedding"],"description":"all-MiniLM-L6-v2 is a Sentence Transformers model for vector representations for retrieval, clustering, and similarity.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"sentence-transformers/all-mpnet-base-v2","object":"model","created":0,"owned_by":"pleum","provider":"deepinfra","display_name":"all-mpnet-base-v2","modality":"embedding","price_unit":"token","input_price_usd":0.005,"output_price_usd":0.0,"markup_tier":"high","effective_markup_percent":0.0,"context_window":512,"max_output":1,"is_active":true,"operations":["embedding.create"],"maker":"Sentence Transformers","context_length":512,"max_output_tokens":1,"architecture":{"input_modalities":["text"],"output_modalities":["embedding"]},"supported_parameters":[],"supports_thinking":false,"thinking_forced":false,"pricing":{"prompt":"0.000000005","completion":"0.00"},"pricing_krw":{"prompt":"0.0000067636500","completion":"0.000000"},"pricing_tiers":[],"pricing_variants":[],"providers":[{"provider":"deepinfra","input_price_usd":0.005,"output_price_usd":0.0,"markup_tier":"high","effective_markup_percent":0.0,"context_window":512,"max_output":1,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.000000005","completion":"0.00"},"pricing_krw":{"prompt":"0.0000067636500","completion":"0.000000"},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text"],"output_modalities":["embedding"],"description":"all-mpnet-base-v2 is a Sentence Transformers model for vector representations for retrieval, clustering, and similarity.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"sentence-transformers/clip-ViT-B-32","object":"model","created":0,"owned_by":"pleum","provider":"deepinfra","display_name":"CLIP ViT-B-32","modality":"embedding","price_unit":"token","input_price_usd":0.005,"output_price_usd":0.0,"markup_tier":"high","effective_markup_percent":0.0,"context_window":77,"max_output":1,"is_active":true,"operations":["embedding.create"],"maker":"Sentence Transformers","context_length":77,"max_output_tokens":1,"architecture":{"input_modalities":["text"],"output_modalities":["embedding"]},"supported_parameters":[],"supports_thinking":false,"thinking_forced":false,"pricing":{"prompt":"0.000000005","completion":"0.00"},"pricing_krw":{"prompt":"0.0000067636500","completion":"0.000000"},"pricing_tiers":[],"pricing_variants":[],"providers":[{"provider":"deepinfra","input_price_usd":0.005,"output_price_usd":0.0,"markup_tier":"high","effective_markup_percent":0.0,"context_window":77,"max_output":1,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.000000005","completion":"0.00"},"pricing_krw":{"prompt":"0.0000067636500","completion":"0.000000"},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text"],"output_modalities":["embedding"],"description":"CLIP ViT-B-32 is a Sentence Transformers model for vector representations for retrieval, clustering, and similarity.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"sentence-transformers/clip-ViT-B-32-multilingual-v1","object":"model","created":0,"owned_by":"pleum","provider":"deepinfra","display_name":"CLIP ViT-B-32 Multilingual","modality":"embedding","price_unit":"token","input_price_usd":0.005,"output_price_usd":0.0,"markup_tier":"high","effective_markup_percent":0.0,"context_window":512,"max_output":1,"is_active":true,"operations":["embedding.create"],"maker":"Sentence Transformers","context_length":512,"max_output_tokens":1,"architecture":{"input_modalities":["text"],"output_modalities":["embedding"]},"supported_parameters":[],"supports_thinking":false,"thinking_forced":false,"pricing":{"prompt":"0.000000005","completion":"0.00"},"pricing_krw":{"prompt":"0.0000067636500","completion":"0.000000"},"pricing_tiers":[],"pricing_variants":[],"providers":[{"provider":"deepinfra","input_price_usd":0.005,"output_price_usd":0.0,"markup_tier":"high","effective_markup_percent":0.0,"context_window":512,"max_output":1,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.000000005","completion":"0.00"},"pricing_krw":{"prompt":"0.0000067636500","completion":"0.000000"},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text"],"output_modalities":["embedding"],"description":"CLIP ViT-B-32 Multilingual is a Sentence Transformers model for vector representations for retrieval, clustering, and similarity.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"sentence-transformers/multi-qa-mpnet-base-dot-v1","object":"model","created":0,"owned_by":"pleum","provider":"deepinfra","display_name":"multi-qa-mpnet-base-dot-v1","modality":"embedding","price_unit":"token","input_price_usd":0.005,"output_price_usd":0.0,"markup_tier":"high","effective_markup_percent":0.0,"context_window":512,"max_output":1,"is_active":true,"operations":["embedding.create"],"maker":"Sentence Transformers","context_length":512,"max_output_tokens":1,"architecture":{"input_modalities":["text"],"output_modalities":["embedding"]},"supported_parameters":[],"supports_thinking":false,"thinking_forced":false,"pricing":{"prompt":"0.000000005","completion":"0.00"},"pricing_krw":{"prompt":"0.0000067636500","completion":"0.000000"},"pricing_tiers":[],"pricing_variants":[],"providers":[{"provider":"deepinfra","input_price_usd":0.005,"output_price_usd":0.0,"markup_tier":"high","effective_markup_percent":0.0,"context_window":512,"max_output":1,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.000000005","completion":"0.00"},"pricing_krw":{"prompt":"0.0000067636500","completion":"0.000000"},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text"],"output_modalities":["embedding"],"description":"multi-qa-mpnet-base-dot-v1 is a Sentence Transformers model for vector representations for retrieval, clustering, and similarity.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"sentence-transformers/paraphrase-MiniLM-L6-v2","object":"model","created":0,"owned_by":"pleum","provider":"deepinfra","display_name":"paraphrase-MiniLM-L6-v2","modality":"embedding","price_unit":"token","input_price_usd":0.005,"output_price_usd":0.0,"markup_tier":"high","effective_markup_percent":0.0,"context_window":512,"max_output":1,"is_active":true,"operations":["embedding.create"],"maker":"Sentence Transformers","context_length":512,"max_output_tokens":1,"architecture":{"input_modalities":["text"],"output_modalities":["embedding"]},"supported_parameters":[],"supports_thinking":false,"thinking_forced":false,"pricing":{"prompt":"0.000000005","completion":"0.00"},"pricing_krw":{"prompt":"0.0000067636500","completion":"0.000000"},"pricing_tiers":[],"pricing_variants":[],"providers":[{"provider":"deepinfra","input_price_usd":0.005,"output_price_usd":0.0,"markup_tier":"high","effective_markup_percent":0.0,"context_window":512,"max_output":1,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.000000005","completion":"0.00"},"pricing_krw":{"prompt":"0.0000067636500","completion":"0.000000"},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text"],"output_modalities":["embedding"],"description":"paraphrase-MiniLM-L6-v2 is a Sentence Transformers model for vector representations for retrieval, clustering, and similarity.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"shibing624/text2vec-base-chinese","object":"model","created":0,"owned_by":"pleum","provider":"deepinfra","display_name":"Text2Vec Base Chinese","modality":"embedding","price_unit":"token","input_price_usd":0.005,"output_price_usd":0.0,"markup_tier":"high","effective_markup_percent":0.0,"context_window":512,"max_output":1,"is_active":true,"operations":["embedding.create"],"maker":"shibing624","context_length":512,"max_output_tokens":1,"architecture":{"input_modalities":["text"],"output_modalities":["embedding"]},"supported_parameters":[],"supports_thinking":false,"thinking_forced":false,"pricing":{"prompt":"0.000000005","completion":"0.00"},"pricing_krw":{"prompt":"0.0000067636500","completion":"0.000000"},"pricing_tiers":[],"pricing_variants":[],"providers":[{"provider":"deepinfra","input_price_usd":0.005,"output_price_usd":0.0,"markup_tier":"high","effective_markup_percent":0.0,"context_window":512,"max_output":1,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.000000005","completion":"0.00"},"pricing_krw":{"prompt":"0.0000067636500","completion":"0.000000"},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text"],"output_modalities":["embedding"],"description":"Text2Vec Base Chinese is a Chinese sentence-embedding model that creates vector representations for retrieval, clustering, and similarity comparison.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"thenlper/gte-base","object":"model","created":0,"owned_by":"pleum","provider":"deepinfra","display_name":"GTE Base","modality":"embedding","price_unit":"token","input_price_usd":0.005,"output_price_usd":0.0,"markup_tier":"high","effective_markup_percent":0.0,"context_window":512,"max_output":1,"is_active":true,"operations":["embedding.create"],"maker":"Alibaba","context_length":512,"max_output_tokens":1,"architecture":{"input_modalities":["text"],"output_modalities":["embedding"]},"supported_parameters":[],"supports_thinking":false,"thinking_forced":false,"pricing":{"prompt":"0.000000005","completion":"0.00"},"pricing_krw":{"prompt":"0.0000067636500","completion":"0.000000"},"pricing_tiers":[],"pricing_variants":[],"providers":[{"provider":"deepinfra","input_price_usd":0.005,"output_price_usd":0.0,"markup_tier":"high","effective_markup_percent":0.0,"context_window":512,"max_output":1,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.000000005","completion":"0.00"},"pricing_krw":{"prompt":"0.0000067636500","completion":"0.000000"},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text"],"output_modalities":["embedding"],"description":"The GTE Base release extends Alibaba's model family to vector representations for retrieval, clustering, and similarity.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"thenlper/gte-large","object":"model","created":0,"owned_by":"pleum","provider":"deepinfra","display_name":"GTE Large","modality":"embedding","price_unit":"token","input_price_usd":0.01,"output_price_usd":0.0,"markup_tier":"high","effective_markup_percent":0.0,"context_window":512,"max_output":1,"is_active":true,"operations":["embedding.create"],"maker":"Alibaba","context_length":512,"max_output_tokens":1,"architecture":{"input_modalities":["text"],"output_modalities":["embedding"]},"supported_parameters":[],"supports_thinking":false,"thinking_forced":false,"pricing":{"prompt":"0.00000001","completion":"0.00"},"pricing_krw":{"prompt":"0.000013527300","completion":"0.000000"},"pricing_tiers":[],"pricing_variants":[],"providers":[{"provider":"deepinfra","input_price_usd":0.01,"output_price_usd":0.0,"markup_tier":"high","effective_markup_percent":0.0,"context_window":512,"max_output":1,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.00000001","completion":"0.00"},"pricing_krw":{"prompt":"0.000013527300","completion":"0.000000"},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text"],"output_modalities":["embedding"],"description":"The GTE Large release extends Alibaba's model family to vector representations for retrieval, clustering, and similarity.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"nvidia/NVIDIA-Nemotron-3-Nano-Omni-30B-A3B-Reasoning-BF16","object":"model","created":0,"owned_by":"pleum","provider":"vultr","display_name":"Nemotron 3 Nano Omni 30B (vultr)","modality":"text","price_unit":"token","input_price_usd":0.13,"output_price_usd":0.38,"markup_tier":"medium","effective_markup_percent":0.0,"context_window":262144,"max_output":32768,"is_active":true,"operations":["chat.generate"],"maker":"NVIDIA","context_length":262144,"max_output_tokens":32768,"architecture":{"input_modalities":["text"],"output_modalities":["text"]},"supported_parameters":["temperature","max_tokens","top_p","stop","seed","frequency_penalty","presence_penalty","tools","tool_choice","response_format","parallel_tool_calls","logit_bias","stream"],"supports_thinking":false,"thinking_forced":false,"pricing":{"prompt":"0.00000013","completion":"0.00000038"},"pricing_krw":{"prompt":"0.000175854900","completion":"0.000514037400"},"pricing_tiers":[],"pricing_variants":[],"providers":[{"provider":"vultr","input_price_usd":0.13,"output_price_usd":0.38,"markup_tier":"medium","effective_markup_percent":0.0,"context_window":262144,"max_output":32768,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.00000013","completion":"0.00000038"},"pricing_krw":{"prompt":"0.000175854900","completion":"0.000514037400"},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text"],"output_modalities":["text"],"description":"Nemotron 3 Nano Omni 30B (vultr) is a text model available through PleumRouter. Review its catalog metadata for supported capabilities and pricing.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"nvidia/Nemotron-Cascade-2-30B-A3B","object":"model","created":0,"owned_by":"pleum","provider":"vultr","display_name":"Nemotron Cascade 2 30B (vultr)","modality":"text","price_unit":"token","input_price_usd":0.15,"output_price_usd":0.6,"markup_tier":"medium","effective_markup_percent":0.0,"context_window":262144,"max_output":32768,"is_active":true,"operations":["chat.generate"],"maker":"NVIDIA","context_length":262144,"max_output_tokens":32768,"architecture":{"input_modalities":["text"],"output_modalities":["text"]},"supported_parameters":["temperature","max_tokens","top_p","stop","seed","frequency_penalty","presence_penalty","tools","tool_choice","response_format","parallel_tool_calls","logit_bias","stream"],"supports_thinking":false,"thinking_forced":false,"pricing":{"prompt":"0.00000015","completion":"0.0000006"},"pricing_krw":{"prompt":"0.000202909500","completion":"0.00081163800"},"pricing_tiers":[],"pricing_variants":[],"providers":[{"provider":"vultr","input_price_usd":0.15,"output_price_usd":0.6,"markup_tier":"medium","effective_markup_percent":0.0,"context_window":262144,"max_output":32768,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.00000015","completion":"0.0000006"},"pricing_krw":{"prompt":"0.000202909500","completion":"0.00081163800"},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text"],"output_modalities":["text"],"description":"Nemotron Cascade 2 30B (vultr) is a text model available through PleumRouter. Review its catalog metadata for supported capabilities and pricing.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"zai-org/GLM-5.2-FP8","object":"model","created":0,"owned_by":"pleum","provider":"vultr","display_name":"GLM-5.2 FP8 (vultr)","modality":"text","price_unit":"token","input_price_usd":0.85,"output_price_usd":3.1,"markup_tier":"low","effective_markup_percent":0.0,"context_window":393216,"max_output":32768,"is_active":true,"operations":["chat.generate"],"maker":"Zhipu","context_length":393216,"max_output_tokens":32768,"architecture":{"input_modalities":["text"],"output_modalities":["text"]},"supported_parameters":["temperature","max_tokens","top_p","stop","seed","frequency_penalty","presence_penalty","tools","tool_choice","response_format","parallel_tool_calls","logit_bias","stream"],"supports_thinking":false,"thinking_forced":false,"pricing":{"prompt":"0.00000085","completion":"0.0000031"},"pricing_krw":{"prompt":"0.001149820500","completion":"0.00419346300"},"pricing_tiers":[],"pricing_variants":[],"providers":[{"provider":"vultr","input_price_usd":0.85,"output_price_usd":3.1,"markup_tier":"low","effective_markup_percent":0.0,"context_window":393216,"max_output":32768,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.00000085","completion":"0.0000031"},"pricing_krw":{"prompt":"0.001149820500","completion":"0.00419346300"},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text"],"output_modalities":["text"],"description":"GLM-5.2 FP8 (vultr) is a text model available through PleumRouter. Review its catalog metadata for supported capabilities and pricing.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"deepseek-v4-flash-0731","object":"model","created":0,"owned_by":"pleum","provider":"deepinfra","display_name":"DeepSeek V4 Flash 0731","modality":"text","price_unit":"token","input_price_usd":0.08,"output_price_usd":0.18,"markup_tier":"high","effective_markup_percent":0.0,"context_window":1048576,"max_output":1048576,"is_active":true,"operations":["chat.generate"],"maker":"DeepSeek","context_length":1048576,"max_output_tokens":1048576,"architecture":{"input_modalities":["text"],"output_modalities":["text"]},"supported_parameters":["temperature","max_tokens","top_p","stop","seed","frequency_penalty","presence_penalty","tools","tool_choice","response_format","parallel_tool_calls","logit_bias","stream"],"supports_thinking":false,"thinking_forced":false,"pricing":{"prompt":"0.00000008","completion":"0.00000018"},"pricing_krw":{"prompt":"0.000108218400","completion":"0.000243491400"},"pricing_tiers":[{"input_tokens_lte":1048576,"input_price_usd_per_m":0.08,"output_price_usd_per_m":0.18,"cache_read_price_usd_per_m":0.016}],"pricing_variants":[],"providers":[{"provider":"deepinfra","input_price_usd":0.08,"output_price_usd":0.18,"markup_tier":"high","effective_markup_percent":0.0,"context_window":1048576,"max_output":32768,"cache_read_usd":0.016,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.00000008","completion":"0.00000018"},"pricing_krw":{"prompt":"0.000108218400","completion":"0.000243491400"},"peak_pricing":null,"pricing_policy":{"version":1,"kind":"token_tiers","tiers":[{"input_tokens_lte":1048576,"input_price_usd_per_m":0.08,"output_price_usd_per_m":0.18,"cache_read_price_usd_per_m":0.016}]},"pricing_tiers":[{"input_tokens_lte":1048576,"input_price_usd_per_m":0.08,"output_price_usd_per_m":0.18,"cache_read_price_usd_per_m":0.016}],"pricing_variants":[]},{"provider":"vultr","input_price_usd":0.1,"output_price_usd":0.25,"markup_tier":"high","effective_markup_percent":0.0,"context_window":1048576,"max_output":1048576,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.0000001","completion":"0.00000025"},"pricing_krw":{"prompt":"0.00013527300","completion":"0.000338182500"},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]},{"provider":"together","input_price_usd":0.14,"output_price_usd":0.28,"markup_tier":"high","effective_markup_percent":0.0,"context_window":1000000,"max_output":8192,"cache_read_usd":0.03,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.00000014","completion":"0.00000028"},"pricing_krw":{"prompt":"0.000189382200","completion":"0.000378764400"},"peak_pricing":null,"pricing_policy":{"version":1,"kind":"token_tiers","tiers":[{"input_tokens_lte":1000000,"input_price_usd_per_m":0.14,"output_price_usd_per_m":0.28,"cache_read_price_usd_per_m":0.03}]},"pricing_tiers":[{"input_tokens_lte":1000000,"input_price_usd_per_m":0.14,"output_price_usd_per_m":0.28,"cache_read_price_usd_per_m":0.03}],"pricing_variants":[]},{"provider":"qwen","input_price_usd":0.44,"output_price_usd":1.32,"markup_tier":"high","effective_markup_percent":0.0,"context_window":1000000,"max_output":393216,"cache_read_usd":0.043,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.00000044","completion":"0.00000132"},"pricing_krw":{"prompt":"0.000595201200","completion":"0.001785603600"},"peak_pricing":null,"pricing_policy":{"version":1,"kind":"token_tiers","tiers":[{"input_tokens_lte":1000000,"input_price_usd_per_m":0.44,"output_price_usd_per_m":1.32,"cache_read_price_usd_per_m":0.043}]},"pricing_tiers":[{"input_tokens_lte":1000000,"input_price_usd_per_m":0.44,"output_price_usd_per_m":1.32,"cache_read_price_usd_per_m":0.043}],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text"],"output_modalities":["text"],"description":"DeepSeek V4 Flash 0731 is a later checkpoint and remains a distinct logical model from the base DeepSeek V4 Flash. Each provider offering retains its own API identifier, pricing, and limits.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"nemotron-3.5-content-safety","object":"model","created":0,"owned_by":"pleum","provider":"vultr","display_name":"Nemotron 3.5 Content Safety (vultr)","modality":"text","price_unit":"token","input_price_usd":0.05,"output_price_usd":0.15,"markup_tier":"high","effective_markup_percent":0.0,"context_window":131072,"max_output":131072,"is_active":true,"operations":["chat.generate"],"maker":"NVIDIA","context_length":131072,"max_output_tokens":131072,"architecture":{"input_modalities":["text"],"output_modalities":["text"]},"supported_parameters":["temperature","max_tokens","top_p","stop","seed","frequency_penalty","presence_penalty","tools","tool_choice","response_format","parallel_tool_calls","logit_bias","stream"],"supports_thinking":false,"thinking_forced":false,"pricing":{"prompt":"0.00000005","completion":"0.00000015"},"pricing_krw":{"prompt":"0.000067636500","completion":"0.000202909500"},"pricing_tiers":[],"pricing_variants":[],"providers":[{"provider":"vultr","input_price_usd":0.05,"output_price_usd":0.15,"markup_tier":"high","effective_markup_percent":0.0,"context_window":131072,"max_output":131072,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.00000005","completion":"0.00000015"},"pricing_krw":{"prompt":"0.000067636500","completion":"0.000202909500"},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text"],"output_modalities":["text"],"description":"Nemotron 3.5 Content Safety is NVIDIA's content moderation classifier that scores prompts, images, and responses against a standard safety taxonomy or custom policy over a 131,072-token context.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"Qwen/Qwen2.5-7B-Instruct-Turbo","object":"model","created":0,"owned_by":"pleum","provider":"together","display_name":"Qwen2.5 7B Instruct Turbo (Together)","modality":"text","price_unit":"token","input_price_usd":0.3,"output_price_usd":0.3,"markup_tier":"high","effective_markup_percent":0.0,"context_window":32768,"max_output":8192,"is_active":true,"operations":["chat.generate"],"maker":"Qwen","context_length":32768,"max_output_tokens":8192,"architecture":{"input_modalities":["text"],"output_modalities":["text"]},"supported_parameters":["temperature","max_tokens","top_p","stop","seed","frequency_penalty","presence_penalty","tools","tool_choice","response_format","parallel_tool_calls","logit_bias","stream"],"supports_thinking":false,"thinking_forced":false,"pricing":{"prompt":"0.0000003","completion":"0.0000003"},"pricing_krw":{"prompt":"0.00040581900","completion":"0.00040581900"},"pricing_tiers":[],"pricing_variants":[],"providers":[{"provider":"together","input_price_usd":0.3,"output_price_usd":0.3,"markup_tier":"high","effective_markup_percent":0.0,"context_window":32768,"max_output":8192,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.0000003","completion":"0.0000003"},"pricing_krw":{"prompt":"0.00040581900","completion":"0.00040581900"},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text"],"output_modalities":["text"],"description":"Qwen2.5 7B Instruct Turbo (Together) is a current serverless text model from Together AI. PleumRouter catalogs its official API identifier and published pricing and context information.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"LiquidAI/LFM2.5-8B-A1B","object":"model","created":0,"owned_by":"pleum","provider":"together","display_name":"LFM2.5 8B A1B (Together)","modality":"text","price_unit":"token","input_price_usd":0.03,"output_price_usd":0.12,"markup_tier":"high","effective_markup_percent":0.0,"context_window":32768,"max_output":8192,"is_active":true,"operations":["chat.generate"],"maker":"Liquid AI","context_length":32768,"max_output_tokens":8192,"architecture":{"input_modalities":["text"],"output_modalities":["text"]},"supported_parameters":["temperature","max_tokens","top_p","stop","seed","frequency_penalty","presence_penalty","tools","tool_choice","response_format","parallel_tool_calls","logit_bias","stream"],"supports_thinking":false,"thinking_forced":false,"pricing":{"prompt":"0.00000003","completion":"0.00000012"},"pricing_krw":{"prompt":"0.000040581900","completion":"0.000162327600"},"pricing_tiers":[],"pricing_variants":[],"providers":[{"provider":"together","input_price_usd":0.03,"output_price_usd":0.12,"markup_tier":"high","effective_markup_percent":0.0,"context_window":32768,"max_output":8192,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.00000003","completion":"0.00000012"},"pricing_krw":{"prompt":"0.000040581900","completion":"0.000162327600"},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text"],"output_modalities":["text"],"description":"LFM2.5 8B A1B (Together) is a current serverless text model from Together AI. PleumRouter catalogs its official API identifier and published pricing and context information.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"Prism-ML/Ternary-Bonsai-27B","object":"model","created":0,"owned_by":"pleum","provider":"together","display_name":"Ternary Bonsai 27B (Together)","modality":"text","price_unit":"token","input_price_usd":0.0,"output_price_usd":0.0,"markup_tier":"high","effective_markup_percent":0.0,"context_window":262144,"max_output":8192,"is_active":true,"operations":["chat.generate"],"maker":"Prism ML","context_length":262144,"max_output_tokens":8192,"architecture":{"input_modalities":["text"],"output_modalities":["text"]},"supported_parameters":["temperature","max_tokens","top_p","stop","seed","frequency_penalty","presence_penalty","tools","tool_choice","response_format","parallel_tool_calls","logit_bias","stream"],"supports_thinking":false,"thinking_forced":false,"pricing":{"prompt":"0.00","completion":"0.00"},"pricing_krw":{"prompt":"0.000000","completion":"0.000000"},"pricing_tiers":[],"pricing_variants":[],"providers":[{"provider":"together","input_price_usd":0.0,"output_price_usd":0.0,"markup_tier":"high","effective_markup_percent":0.0,"context_window":262144,"max_output":8192,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.00","completion":"0.00"},"pricing_krw":{"prompt":"0.000000","completion":"0.000000"},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text"],"output_modalities":["text"],"description":"Ternary Bonsai 27B (Together) is a current serverless text model from Together AI. PleumRouter catalogs its official API identifier and published pricing and context information.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"meta-models/Muse-Glimmer-30B","object":"model","created":0,"owned_by":"pleum","provider":"together","display_name":"Muse Glimmer 30B (Together)","modality":"text","price_unit":"token","input_price_usd":0.35,"output_price_usd":1.5,"markup_tier":"medium","effective_markup_percent":0.0,"context_window":131072,"max_output":8192,"is_active":true,"operations":["chat.generate"],"maker":"Meta","context_length":131072,"max_output_tokens":8192,"architecture":{"input_modalities":["text"],"output_modalities":["text"]},"supported_parameters":["temperature","max_tokens","top_p","stop","seed","frequency_penalty","presence_penalty","tools","tool_choice","response_format","parallel_tool_calls","logit_bias","stream"],"supports_thinking":false,"thinking_forced":false,"pricing":{"prompt":"0.00000035","completion":"0.0000015"},"pricing_krw":{"prompt":"0.000473455500","completion":"0.00202909500"},"pricing_tiers":[{"input_tokens_lte":131072,"input_price_usd_per_m":0.35,"output_price_usd_per_m":1.5,"cache_read_price_usd_per_m":0.04}],"pricing_variants":[],"providers":[{"provider":"together","input_price_usd":0.35,"output_price_usd":1.5,"markup_tier":"medium","effective_markup_percent":0.0,"context_window":131072,"max_output":8192,"cache_read_usd":0.04,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.00000035","completion":"0.0000015"},"pricing_krw":{"prompt":"0.000473455500","completion":"0.00202909500"},"peak_pricing":null,"pricing_policy":{"version":1,"kind":"token_tiers","tiers":[{"input_tokens_lte":131072,"input_price_usd_per_m":0.35,"output_price_usd_per_m":1.5,"cache_read_price_usd_per_m":0.04}]},"pricing_tiers":[{"input_tokens_lte":131072,"input_price_usd_per_m":0.35,"output_price_usd_per_m":1.5,"cache_read_price_usd_per_m":0.04}],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text"],"output_modalities":["text"],"description":"Muse Glimmer 30B is a text model available through PleumRouter. Review its catalog metadata for supported capabilities and pricing.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"thinkingmachines/Inkling","object":"model","created":0,"owned_by":"pleum","provider":"together","display_name":"Inkling (DeepInfra)","modality":"text","price_unit":"token","input_price_usd":1.0,"output_price_usd":4.05,"markup_tier":"medium","effective_markup_percent":0.0,"context_window":524288,"max_output":8192,"is_active":true,"operations":["chat.generate"],"maker":"Thinking Machines Lab","context_length":524288,"max_output_tokens":8192,"architecture":{"input_modalities":["text"],"output_modalities":["text"]},"supported_parameters":["temperature","max_tokens","top_p","stop","seed","frequency_penalty","presence_penalty","tools","tool_choice","response_format","parallel_tool_calls","logit_bias","stream"],"supports_thinking":false,"thinking_forced":false,"pricing":{"prompt":"0.000001","completion":"0.00000405"},"pricing_krw":{"prompt":"0.0013527300","completion":"0.005478556500"},"pricing_tiers":[{"input_tokens_lte":524288,"input_price_usd_per_m":1,"output_price_usd_per_m":4.05,"cache_read_price_usd_per_m":0.17}],"pricing_variants":[],"providers":[{"provider":"together","input_price_usd":1.0,"output_price_usd":4.05,"markup_tier":"medium","effective_markup_percent":0.0,"context_window":524288,"max_output":8192,"cache_read_usd":0.17,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.000001","completion":"0.00000405"},"pricing_krw":{"prompt":"0.0013527300","completion":"0.005478556500"},"peak_pricing":null,"pricing_policy":{"version":1,"kind":"token_tiers","tiers":[{"input_tokens_lte":524288,"input_price_usd_per_m":1,"output_price_usd_per_m":4.05,"cache_read_price_usd_per_m":0.17}]},"pricing_tiers":[{"input_tokens_lte":524288,"input_price_usd_per_m":1,"output_price_usd_per_m":4.05,"cache_read_price_usd_per_m":0.17}],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text"],"output_modalities":["text"],"description":"Inkling (Together) is a current serverless text model from Together AI. PleumRouter catalogs its official API identifier and published pricing and context information.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"deepseek-v4-flash-ga-260731","object":"model","created":0,"owned_by":"pleum","provider":"modelark","display_name":"DeepSeek V4 Flash GA (ModelArk)","modality":"text","price_unit":"token","input_price_usd":0.44,"output_price_usd":1.32,"markup_tier":"high","effective_markup_percent":0.0,"context_window":1024000,"max_output":384000,"is_active":true,"operations":["chat.generate"],"maker":"DeepSeek","context_length":1024000,"max_output_tokens":384000,"architecture":{"input_modalities":["text"],"output_modalities":["text"]},"supported_parameters":["temperature","max_tokens","top_p","stop","seed","frequency_penalty","presence_penalty","tools","tool_choice","response_format","parallel_tool_calls","logit_bias","stream"],"supports_thinking":false,"thinking_forced":false,"pricing":{"prompt":"0.00000044","completion":"0.00000132"},"pricing_krw":{"prompt":"0.000595201200","completion":"0.001785603600"},"pricing_tiers":[{"input_tokens_lte":1024000,"input_price_usd_per_m":0.44,"output_price_usd_per_m":1.32,"cache_read_price_usd_per_m":0.014}],"pricing_variants":[],"providers":[{"provider":"modelark","input_price_usd":0.44,"output_price_usd":1.32,"markup_tier":"high","effective_markup_percent":0.0,"context_window":1024000,"max_output":384000,"cache_read_usd":0.014,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.00000044","completion":"0.00000132"},"pricing_krw":{"prompt":"0.000595201200","completion":"0.001785603600"},"peak_pricing":null,"pricing_policy":{"version":1,"kind":"token_tiers","tiers":[{"input_tokens_lte":1024000,"input_price_usd_per_m":0.44,"output_price_usd_per_m":1.32,"cache_read_price_usd_per_m":0.014}]},"pricing_tiers":[{"input_tokens_lte":1024000,"input_price_usd_per_m":0.44,"output_price_usd_per_m":1.32,"cache_read_price_usd_per_m":0.014}],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text"],"output_modalities":["text"],"description":"DeepSeek V4 Flash GA (260731) is the generally-available V4 Flash checkpoint served by BytePlus ModelArk with a 1M-token context. From 2026-08-21 it bills at $0.44/$1.32 per million tokens.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"deepseek-v4-pro-ga-260813","object":"model","created":0,"owned_by":"pleum","provider":"modelark","display_name":"DeepSeek V4 Pro GA (ModelArk)","modality":"text","price_unit":"token","input_price_usd":1.32,"output_price_usd":3.96,"markup_tier":"medium","effective_markup_percent":0.0,"context_window":1024000,"max_output":384000,"is_active":true,"operations":["chat.generate"],"maker":"DeepSeek","context_length":1024000,"max_output_tokens":384000,"architecture":{"input_modalities":["text"],"output_modalities":["text"]},"supported_parameters":["temperature","max_tokens","top_p","stop","seed","frequency_penalty","presence_penalty","tools","tool_choice","response_format","parallel_tool_calls","logit_bias","stream"],"supports_thinking":false,"thinking_forced":false,"pricing":{"prompt":"0.00000132","completion":"0.00000396"},"pricing_krw":{"prompt":"0.001785603600","completion":"0.005356810800"},"pricing_tiers":[{"input_tokens_lte":1024000,"input_price_usd_per_m":1.32,"output_price_usd_per_m":3.96,"cache_read_price_usd_per_m":0.044}],"pricing_variants":[],"providers":[{"provider":"modelark","input_price_usd":1.32,"output_price_usd":3.96,"markup_tier":"medium","effective_markup_percent":0.0,"context_window":1024000,"max_output":384000,"cache_read_usd":0.044,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.00000132","completion":"0.00000396"},"pricing_krw":{"prompt":"0.001785603600","completion":"0.005356810800"},"peak_pricing":null,"pricing_policy":{"version":1,"kind":"token_tiers","tiers":[{"input_tokens_lte":1024000,"input_price_usd_per_m":1.32,"output_price_usd_per_m":3.96,"cache_read_price_usd_per_m":0.044}]},"pricing_tiers":[{"input_tokens_lte":1024000,"input_price_usd_per_m":1.32,"output_price_usd_per_m":3.96,"cache_read_price_usd_per_m":0.044}],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text"],"output_modalities":["text"],"description":"DeepSeek V4 Pro GA (ModelArk) is the ByteDance ModelArk hosting of the DeepSeek flagship text model's August 13, 2026 GA snapshot with a 1,000,000-token context window.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"thinkingmachines/Inkling-Small","object":"model","created":0,"owned_by":"pleum","provider":"together","display_name":"Inkling Small","modality":"text","price_unit":"token","input_price_usd":0.5,"output_price_usd":1.2,"markup_tier":"high","effective_markup_percent":0.0,"context_window":524288,"max_output":8192,"is_active":true,"operations":["chat.generate"],"maker":"Thinking Machines Lab","context_length":524288,"max_output_tokens":8192,"architecture":{"input_modalities":["text"],"output_modalities":["text"]},"supported_parameters":["temperature","max_tokens","top_p","stop","seed","frequency_penalty","presence_penalty","tools","tool_choice","response_format","parallel_tool_calls","logit_bias","stream"],"supports_thinking":false,"thinking_forced":false,"pricing":{"prompt":"0.0000005","completion":"0.0000012"},"pricing_krw":{"prompt":"0.00067636500","completion":"0.00162327600"},"pricing_tiers":[],"pricing_variants":[],"providers":[{"provider":"together","input_price_usd":0.5,"output_price_usd":1.2,"markup_tier":"high","effective_markup_percent":0.0,"context_window":524288,"max_output":8192,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.0000005","completion":"0.0000012"},"pricing_krw":{"prompt":"0.00067636500","completion":"0.00162327600"},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text"],"output_modalities":["text"],"description":"Inkling Small (Together) is a current serverless text model from Together AI. PleumRouter catalogs its official API identifier and published pricing and context information.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"labs-leanstral-1-5","object":"model","created":0,"owned_by":"pleum","provider":"mistral","display_name":"Leanstral 1.5","modality":"text","price_unit":"token","input_price_usd":0.0,"output_price_usd":0.0,"markup_tier":"high","effective_markup_percent":0.0,"context_window":256000,"max_output":128000,"is_active":true,"operations":["chat.generate"],"maker":"Mistral","context_length":256000,"max_output_tokens":128000,"architecture":{"input_modalities":["text"],"output_modalities":["text"]},"supported_parameters":["temperature","max_tokens","top_p","stop","seed","frequency_penalty","presence_penalty","tools","tool_choice","response_format","parallel_tool_calls","logit_bias","stream"],"supports_thinking":false,"thinking_forced":false,"pricing":{"prompt":"0.00","completion":"0.00"},"pricing_krw":{"prompt":"0.000000","completion":"0.000000"},"pricing_tiers":[],"pricing_variants":[],"providers":[{"provider":"mistral","input_price_usd":0.0,"output_price_usd":0.0,"markup_tier":"high","effective_markup_percent":0.0,"context_window":256000,"max_output":128000,"cache_read_usd":null,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.00","completion":"0.00"},"pricing_krw":{"prompt":"0.000000","completion":"0.000000"},"peak_pricing":null,"pricing_policy":null,"pricing_tiers":[],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text"],"output_modalities":["text"],"description":"Leanstral 1.5 is Mistral's model for Lean 4 formal proof engineering and autoformalization. The official page lists 119B total parameters with 6.5B active, a 256K context window, 128K max output, free public preview access, and model ID labs-leanstral-1-5.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"ibm-granite/granite-4.2-30b","object":"model","created":0,"owned_by":"pleum","provider":"deepinfra","display_name":"Granite 4.2 30B (DeepInfra)","modality":"text","price_unit":"token","input_price_usd":0.16,"output_price_usd":0.65,"markup_tier":"high","effective_markup_percent":0.0,"context_window":131072,"max_output":32768,"is_active":true,"operations":["chat.generate"],"maker":"IBM","context_length":131072,"max_output_tokens":32768,"architecture":{"input_modalities":["text"],"output_modalities":["text"]},"supported_parameters":["temperature","max_tokens","top_p","stop","seed","frequency_penalty","presence_penalty","tools","tool_choice","response_format","parallel_tool_calls","logit_bias","stream"],"supports_thinking":false,"thinking_forced":false,"pricing":{"prompt":"0.00000016","completion":"0.00000065"},"pricing_krw":{"prompt":"0.000216436800","completion":"0.000879274500"},"pricing_tiers":[{"input_tokens_lte":131072,"input_price_usd_per_m":0.16,"output_price_usd_per_m":0.65,"cache_read_price_usd_per_m":0.04}],"pricing_variants":[],"providers":[{"provider":"deepinfra","input_price_usd":0.16,"output_price_usd":0.65,"markup_tier":"high","effective_markup_percent":0.0,"context_window":131072,"max_output":32768,"cache_read_usd":0.04,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.00000016","completion":"0.00000065"},"pricing_krw":{"prompt":"0.000216436800","completion":"0.000879274500"},"peak_pricing":null,"pricing_policy":{"version":1,"kind":"token_tiers","tiers":[{"input_tokens_lte":131072,"input_price_usd_per_m":0.16,"output_price_usd_per_m":0.65,"cache_read_price_usd_per_m":0.04}]},"pricing_tiers":[{"input_tokens_lte":131072,"input_price_usd_per_m":0.16,"output_price_usd_per_m":0.65,"cache_read_price_usd_per_m":0.04}],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text"],"output_modalities":["text"],"description":"Granite 4.2 30B is IBM's 30B-class text-generation model on DeepInfra, with a 131,072-token context and $0.16 input / $0.65 output per 1M tokens plus $0.04 cached reads.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"ibm-granite/granite-4.2-8b","object":"model","created":0,"owned_by":"pleum","provider":"deepinfra","display_name":"Granite 4.2 8B (DeepInfra)","modality":"text","price_unit":"token","input_price_usd":0.06,"output_price_usd":0.25,"markup_tier":"high","effective_markup_percent":0.0,"context_window":131072,"max_output":32768,"is_active":true,"operations":["chat.generate"],"maker":"IBM","context_length":131072,"max_output_tokens":32768,"architecture":{"input_modalities":["text"],"output_modalities":["text"]},"supported_parameters":["temperature","max_tokens","top_p","stop","seed","frequency_penalty","presence_penalty","tools","tool_choice","response_format","parallel_tool_calls","logit_bias","stream"],"supports_thinking":false,"thinking_forced":false,"pricing":{"prompt":"0.00000006","completion":"0.00000025"},"pricing_krw":{"prompt":"0.000081163800","completion":"0.000338182500"},"pricing_tiers":[{"input_tokens_lte":131072,"input_price_usd_per_m":0.06,"output_price_usd_per_m":0.25,"cache_read_price_usd_per_m":0.015}],"pricing_variants":[],"providers":[{"provider":"deepinfra","input_price_usd":0.06,"output_price_usd":0.25,"markup_tier":"high","effective_markup_percent":0.0,"context_window":131072,"max_output":32768,"cache_read_usd":0.015,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.00000006","completion":"0.00000025"},"pricing_krw":{"prompt":"0.000081163800","completion":"0.000338182500"},"peak_pricing":null,"pricing_policy":{"version":1,"kind":"token_tiers","tiers":[{"input_tokens_lte":131072,"input_price_usd_per_m":0.06,"output_price_usd_per_m":0.25,"cache_read_price_usd_per_m":0.015}]},"pricing_tiers":[{"input_tokens_lte":131072,"input_price_usd_per_m":0.06,"output_price_usd_per_m":0.25,"cache_read_price_usd_per_m":0.015}],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text"],"output_modalities":["text"],"description":"Granite 4.2 8B is IBM's lightweight text-generation model on DeepInfra, with a 131,072-token context and $0.06 input / $0.25 output per 1M tokens plus $0.015 cached reads.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"ibm-granite/granite-4.2-3b","object":"model","created":0,"owned_by":"pleum","provider":"deepinfra","display_name":"Granite 4.2 3B (DeepInfra)","modality":"text","price_unit":"token","input_price_usd":0.03,"output_price_usd":0.12,"markup_tier":"high","effective_markup_percent":0.0,"context_window":131072,"max_output":32768,"is_active":true,"operations":["chat.generate"],"maker":"IBM","context_length":131072,"max_output_tokens":32768,"architecture":{"input_modalities":["text"],"output_modalities":["text"]},"supported_parameters":["temperature","max_tokens","top_p","stop","seed","frequency_penalty","presence_penalty","tools","tool_choice","response_format","parallel_tool_calls","logit_bias","stream"],"supports_thinking":false,"thinking_forced":false,"pricing":{"prompt":"0.00000003","completion":"0.00000012"},"pricing_krw":{"prompt":"0.000040581900","completion":"0.000162327600"},"pricing_tiers":[{"input_tokens_lte":131072,"input_price_usd_per_m":0.03,"output_price_usd_per_m":0.12,"cache_read_price_usd_per_m":0.0075}],"pricing_variants":[],"providers":[{"provider":"deepinfra","input_price_usd":0.03,"output_price_usd":0.12,"markup_tier":"high","effective_markup_percent":0.0,"context_window":131072,"max_output":32768,"cache_read_usd":0.0075,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.00000003","completion":"0.00000012"},"pricing_krw":{"prompt":"0.000040581900","completion":"0.000162327600"},"peak_pricing":null,"pricing_policy":{"version":1,"kind":"token_tiers","tiers":[{"input_tokens_lte":131072,"input_price_usd_per_m":0.03,"output_price_usd_per_m":0.12,"cache_read_price_usd_per_m":0.0075}]},"pricing_tiers":[{"input_tokens_lte":131072,"input_price_usd_per_m":0.03,"output_price_usd_per_m":0.12,"cache_read_price_usd_per_m":0.0075}],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text"],"output_modalities":["text"],"description":"Granite 4.2 3B is IBM's compact text-generation model on DeepInfra, with a 131,072-token context and $0.03 input / $0.12 output per 1M tokens plus $0.0075 cached reads.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null},{"id":"qwen3.8-2.4t-a95b","object":"model","created":0,"owned_by":"pleum","provider":"qwen","display_name":"Qwen3.8 2.4T A95B","modality":"text","price_unit":"token","input_price_usd":2.0,"output_price_usd":6.0,"markup_tier":"medium","effective_markup_percent":0.0,"context_window":1000000,"max_output":131072,"is_active":true,"operations":["chat.generate"],"maker":"Qwen","context_length":1000000,"max_output_tokens":131072,"architecture":{"input_modalities":["text","image"],"output_modalities":["text"]},"supported_parameters":["temperature","max_tokens","top_p","stop","seed","frequency_penalty","presence_penalty","tools","tool_choice","response_format","parallel_tool_calls","logit_bias","stream"],"supports_thinking":false,"thinking_forced":false,"pricing":{"prompt":"0.000002","completion":"0.000006"},"pricing_krw":{"prompt":"0.0027054600","completion":"0.0081163800"},"pricing_tiers":[{"input_tokens_lte":1000000,"input_price_usd_per_m":2.0,"output_price_usd_per_m":6.0,"cache_read_price_usd_per_m":0.25}],"pricing_variants":[],"providers":[{"provider":"together","input_price_usd":2.0,"output_price_usd":6.0,"markup_tier":"medium","effective_markup_percent":0.0,"context_window":1000000,"max_output":131072,"cache_read_usd":0.25,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.000002","completion":"0.000006"},"pricing_krw":{"prompt":"0.0027054600","completion":"0.0081163800"},"peak_pricing":null,"pricing_policy":{"version":1,"kind":"token_tiers","tiers":[{"input_tokens_lte":1000000,"input_price_usd_per_m":2.0,"output_price_usd_per_m":6.0,"cache_read_price_usd_per_m":0.25}]},"pricing_tiers":[{"input_tokens_lte":1000000,"input_price_usd_per_m":2.0,"output_price_usd_per_m":6.0,"cache_read_price_usd_per_m":0.25}],"pricing_variants":[]},{"provider":"qwen","input_price_usd":2.0,"output_price_usd":6.0,"markup_tier":"medium","effective_markup_percent":0.0,"context_window":1000000,"max_output":131072,"cache_read_usd":0.25,"latency_ms":null,"throughput_tps":null,"uptime_percent":null,"pricing":{"prompt":"0.000002","completion":"0.000006"},"pricing_krw":{"prompt":"0.0027054600","completion":"0.0081163800"},"peak_pricing":null,"pricing_policy":{"version":1,"kind":"token_tiers","tiers":[{"input_tokens_lte":1000000,"input_price_usd_per_m":2.0,"output_price_usd_per_m":6.0,"cache_read_price_usd_per_m":0.25}]},"pricing_tiers":[{"input_tokens_lte":1000000,"input_price_usd_per_m":2.0,"output_price_usd_per_m":6.0,"cache_read_price_usd_per_m":0.25}],"pricing_variants":[]}],"parameters_b":null,"architecture_class":null,"license":null,"released_at":null,"input_modalities":["text","image"],"output_modalities":["text"],"description":"Qwen3.8 2.4T A95B is the open-source flagship of the Qwen3.8 line, a 2.4T-parameter (95B active) MoE with a 1M-token context. Released 2026-08-12 and served on Alibaba Cloud Model Studio.","billing_mode":"unit_price","cost_basis":null,"promo_discount_factor":null,"promo_ends_at":null}]}