{"object":"list","data":[{"id":"qwen3.8-flash-next","object":"model","created":1787909762,"owned_by":"Alibaba Cloud","description":"Qwen3.8 Flash Next is an efficient multimodal MoE model designed for low-cost inference and strong coding performance.","pricing":{"currency":"EUR","input_token":0.18,"output_token":0.449,"cache_read_cost":0.045},"providers":["tensorix"],"context_size":262144,"max_output_tokens":64000,"tags":["Instruct","Reasoning","Tools","Code","Image"],"input_modalities":["text","image"],"output_modalities":["text"],"supported_features":["json_mode","reasoning","tools"],"model_series":["qwen-3-flash"],"providers_details":{"tensorix":{"pricing":{"currency":"EUR","input_token":0.18,"output_token":0.449,"cache_read_cost":0.045},"quantization":"fp8","context_size":262144,"max_output_tokens":64000,"supported_features":["json_mode","reasoning","tools"],"metrics":{"throughput":null,"latency":null,"ttft":null,"cache_hit_rate":null,"uptime":null}}}},{"id":"glm-5.3-flash","object":"model","created":1787907482,"owned_by":"Z.ai","description":"GLM 5.3 Flash is a fast, cost-efficient multimodal model built for long-context reasoning and scalable workflows.","pricing":{"currency":"EUR","input_token":0.18,"output_token":0.449,"cache_read_cost":0.045},"providers":["tensorix"],"context_size":1048576,"max_output_tokens":64000,"tags":["Instruct","Code","Reasoning","Tools","Image"],"input_modalities":["text","image"],"output_modalities":["text"],"supported_features":["json_mode","reasoning","tools"],"model_series":["glm-5-flash"],"providers_details":{"tensorix":{"pricing":{"currency":"EUR","input_token":0.18,"output_token":0.449,"cache_read_cost":0.045},"quantization":"fp8","context_size":1048576,"max_output_tokens":64000,"supported_features":["json_mode","reasoning","tools"],"metrics":{"throughput":67.72,"latency":121.79,"ttft":54.61,"cache_hit_rate":0.66,"uptime":0.63}}}},{"id":"qwen3.8-27b","object":"model","created":1786966562,"owned_by":"Alibaba Cloud","description":"Qwen3.8 27B is a compact open-weight multimodal model optimized for efficient reasoning, coding, and agentic workflows on local hardware.","pricing":{"currency":"EUR","input_token":0.3,"output_token":2.2,"cache_read_cost":0.1},"providers":["tensorix","berget","aki"],"context_size":262144,"max_output_tokens":262144,"tags":["Instruct","Reasoning","Tools","Code","Image"],"input_modalities":["text","image"],"output_modalities":["text"],"supported_features":["json_mode","reasoning","tools"],"model_series":["qwen-3-27b"],"providers_details":{"tensorix":{"pricing":{"currency":"EUR","input_token":0.359,"output_token":2.154,"cache_read_cost":0.09},"quantization":"fp8","context_size":262144,"max_output_tokens":262144,"supported_features":["json_mode","reasoning","tools"],"metrics":{"throughput":44.24,"latency":26.97,"ttft":2.78,"cache_hit_rate":0.74,"uptime":0.99}},"berget":{"pricing":{"currency":"EUR","input_token":0.4,"output_token":3.0},"quantization":"fp8","context_size":262000,"max_output_tokens":262000,"supported_features":["json_mode","reasoning","tools"],"metrics":{"throughput":37.0,"latency":116.91,"ttft":21.67,"cache_hit_rate":null,"uptime":0.84}},"aki":{"pricing":{"currency":"EUR","input_token":0.3,"output_token":2.2,"cache_read_cost":0.1},"quantization":"fp16","context_size":262144,"max_output_tokens":262144,"supported_features":["json_mode","reasoning","tools"],"metrics":{"throughput":45.93,"latency":39.9,"ttft":2.74,"cache_hit_rate":0.89,"uptime":0.98}}}},{"id":"gemini-3.7-flash","object":"model","created":1786693082,"owned_by":"Google","description":"Gemini 3.7 Flash is a high-efficiency model delivering strong agentic capabilities, improved coding performance, and reliable multi-step execution.","pricing":{"currency":"EUR","input_token":0.673,"output_token":3.366,"audio_cost":1.683e-05,"cache_read_cost":0.067,"cache_write_cost":0.034},"providers":["google"],"context_size":1048576,"max_output_tokens":65535,"tags":["Instruct","Tools","Image","Reasoning","Audio","Document"],"input_modalities":["text","image","audio","file"],"output_modalities":["text"],"supported_features":["json_mode","reasoning","tools"],"model_series":["gemini-3-flash"],"providers_details":{"google":{"pricing":{"currency":"EUR","input_token":0.673,"output_token":3.366,"audio_cost":1.683e-05,"cache_read_cost":0.067,"cache_write_cost":0.034},"quantization":null,"context_size":1048576,"max_output_tokens":65535,"supported_features":["json_mode","reasoning","tools"],"metrics":{"throughput":165.04,"latency":6.85,"ttft":3.27,"cache_hit_rate":0.5,"uptime":1.0}}}},{"id":"gemini-3.6-flash","object":"model","created":1786689482,"owned_by":"Google","description":"Gemini 3.6 Flash is a high-efficiency model optimized for multi-step workflows, coding, and improved reasoning performance.","pricing":{"currency":"EUR","input_token":0.673,"output_token":3.366,"audio_cost":1.683e-05,"cache_read_cost":0.067,"cache_write_cost":0.034},"providers":["google"],"context_size":1048576,"max_output_tokens":65535,"tags":["Instruct","Tools","Image","Reasoning","Audio"],"input_modalities":["text","image","audio"],"output_modalities":["text"],"supported_features":["json_mode","reasoning","tools"],"model_series":["gemini-3-flash"],"providers_details":{"google":{"pricing":{"currency":"EUR","input_token":0.673,"output_token":3.366,"audio_cost":1.683e-05,"cache_read_cost":0.067,"cache_write_cost":0.034},"quantization":null,"context_size":1048576,"max_output_tokens":65535,"supported_features":["json_mode","reasoning","tools"],"metrics":{"throughput":857.84,"latency":6.34,"ttft":4.7,"cache_hit_rate":0.09,"uptime":1.0}}}},{"id":"qwen3.8-2.4t-a95b","object":"model","created":1786685762,"owned_by":"Alibaba Cloud","description":"Qwen3.8-2.4T-A95B is an open-weight flagship MoE model built for advanced reasoning, coding, and long-horizon agentic workflows.","pricing":{"currency":"EUR","input_token":2.244,"output_token":5.386,"cache_read_cost":0.561},"providers":["tensorix"],"context_size":262144,"max_output_tokens":262144,"tags":["Instruct","Reasoning","Tools","Code"],"input_modalities":["text"],"output_modalities":["text"],"supported_features":["json_mode","reasoning","tools"],"model_series":["qwen-3-2.4t"],"providers_details":{"tensorix":{"pricing":{"currency":"EUR","input_token":2.244,"output_token":5.386,"cache_read_cost":0.561},"quantization":"fp4","context_size":262144,"max_output_tokens":262144,"supported_features":["json_mode","reasoning","tools"],"metrics":{"throughput":249.66,"latency":7.28,"ttft":1.27,"cache_hit_rate":0.92,"uptime":0.99}}}},{"id":"gemini-3.5-flash-lite","object":"model","created":1786084682,"owned_by":"Google","description":"Gemini 3.5 Flash Lite is a fast, low-cost multimodal model optimized for high-volume, low-latency workloads.","pricing":{"currency":"EUR","input_token":0.296,"output_token":2.468,"audio_cost":6.73e-06,"cache_read_cost":0.03},"providers":["google"],"context_size":1048576,"max_output_tokens":65535,"tags":["Instruct","Tools","Image","Reasoning","Audio","Document"],"input_modalities":["text","image","audio","file"],"output_modalities":["text"],"supported_features":["json_mode","reasoning","tools"],"model_series":["gemini-3-flash-lite"],"providers_details":{"google":{"pricing":{"currency":"EUR","input_token":0.296,"output_token":2.468,"audio_cost":6.73e-06,"cache_read_cost":0.03},"quantization":null,"context_size":1048576,"max_output_tokens":65535,"supported_features":["json_mode","reasoning","tools"],"metrics":{"throughput":348.93,"latency":2.29,"ttft":1.2,"cache_hit_rate":0.0,"uptime":1.0}}}},{"id":"deepseek-v4-flash-0731","object":"model","created":1785566282,"owned_by":"Deepseek","description":"DeepSeek V4 Flash 0731 is an efficient MoE model optimized for fast reasoning, coding, and enhanced agentic workflows.","pricing":{"currency":"EUR","input_token":0.117,"output_token":0.251,"cache_read_cost":0.027},"providers":["tensorix","inceptron","scaleway","aki"],"context_size":1048576,"max_output_tokens":1048576,"tags":["Instruct","Tools","Reasoning"],"input_modalities":["text"],"output_modalities":["text"],"supported_features":["json_mode","reasoning","tools"],"model_series":["deepseek-v4-flash"],"providers_details":{"tensorix":{"pricing":{"currency":"EUR","input_token":0.224,"output_token":0.269,"cache_read_cost":0.056},"quantization":"fp4","context_size":1048576,"max_output_tokens":64000,"supported_features":["json_mode","reasoning","tools"],"metrics":{"throughput":95.98,"latency":8.99,"ttft":2.35,"cache_hit_rate":0.72,"uptime":0.74}},"inceptron":{"pricing":{"currency":"EUR","input_token":0.117,"output_token":0.251,"cache_read_cost":0.027},"quantization":"fp4","context_size":1048576,"max_output_tokens":1048576,"supported_features":["json_mode","reasoning","tools"],"metrics":{"throughput":110.86,"latency":6.38,"ttft":1.99,"cache_hit_rate":0.89,"uptime":0.98}},"scaleway":{"pricing":{"currency":"EUR","input_token":0.4,"output_token":0.8,"cache_read_cost":0.08},"quantization":null,"context_size":256000,"max_output_tokens":32768,"supported_features":["json_mode","reasoning","tools"],"metrics":{"throughput":313.15,"latency":13.54,"ttft":1.76,"cache_hit_rate":0.51,"uptime":0.99}},"aki":{"pricing":{"currency":"EUR","input_token":0.2,"output_token":0.5,"cache_read_cost":0.1},"quantization":"fp16","context_size":1048576,"max_output_tokens":81920,"supported_features":["json_mode","reasoning","tools"],"metrics":{"throughput":80.66,"latency":28.41,"ttft":8.39,"cache_hit_rate":0.35,"uptime":0.98}}}},{"id":"kimi-k3","object":"model","created":1785137882,"owned_by":"Moonshot AI","description":"Kimi K3 is a frontier open-weight multimodal model built for long-horizon reasoning, coding, and advanced agentic workflows.","pricing":{"currency":"EUR","input_token":2.693,"output_token":13.464},"providers":["nebius","tensorix","berget"],"context_size":1048576,"max_output_tokens":1048576,"tags":["Instruct","Code","Tools","Reasoning","Image"],"input_modalities":["text","image"],"output_modalities":["text"],"supported_features":["json_mode","reasoning","tools"],"model_series":["kimi-k3"],"providers_details":{"nebius":{"pricing":{"currency":"EUR","input_token":2.693,"output_token":13.464},"quantization":"fp4","context_size":1024000,"max_output_tokens":1024000,"supported_features":["json_mode","reasoning","tools"],"metrics":{"throughput":36.73,"latency":175.19,"ttft":108.11,"cache_hit_rate":0.27,"uptime":0.98}},"tensorix":{"pricing":{"currency":"EUR","input_token":2.693,"output_token":13.464,"cache_read_cost":0.673},"quantization":"fp4","context_size":1048576,"max_output_tokens":1048576,"supported_features":["json_mode","reasoning","tools"],"metrics":{"throughput":53.72,"latency":24.86,"ttft":2.05,"cache_hit_rate":0.8,"uptime":0.98}},"berget":{"pricing":{"currency":"EUR","input_token":2.693,"output_token":13.464},"quantization":"int4","context_size":1000000,"max_output_tokens":327000,"supported_features":["json_mode","reasoning","tools"],"metrics":{"throughput":57.06,"latency":28.82,"ttft":14.02,"cache_hit_rate":0.47,"uptime":0.99}}}},{"id":"claude-opus-5","object":"model","created":1785133800,"owned_by":"Anthropic","description":"Claude Opus 5 is Anthropic’s most advanced Opus model, built for long-running agents, complex coding, and high-level professional workflows.","pricing":{"currency":"EUR","input_token":4.937,"output_token":24.684,"cache_read_cost":0.494,"cache_write_cost":6.171},"providers":["amazon_ireland","amazon_paris","google"],"context_size":1000000,"max_output_tokens":128000,"tags":["Instruct","Tools","Image","Code","Reasoning","Document"],"input_modalities":["text","image","file"],"output_modalities":["text"],"supported_features":["json_mode","reasoning","tools"],"model_series":["claude-opus-5"],"providers_details":{"amazon_ireland":{"pricing":{"currency":"EUR","input_token":4.937,"output_token":24.684,"cache_read_cost":0.494,"cache_write_cost":6.171},"quantization":null,"context_size":1000000,"max_output_tokens":128000,"supported_features":["json_mode","reasoning","tools"],"metrics":{"throughput":164.78,"latency":31.14,"ttft":8.49,"cache_hit_rate":0.12,"uptime":1.0}},"amazon_paris":{"pricing":{"currency":"EUR","input_token":4.937,"output_token":24.684,"cache_read_cost":0.494,"cache_write_cost":6.171},"quantization":null,"context_size":1000000,"max_output_tokens":128000,"supported_features":["json_mode","reasoning","tools"],"metrics":{"throughput":201.05,"latency":12.87,"ttft":3.76,"cache_hit_rate":0.06,"uptime":0.98}},"google":{"pricing":{"currency":"EUR","input_token":4.937,"output_token":24.684,"cache_read_cost":0.494,"cache_write_cost":6.171},"quantization":null,"context_size":1000000,"max_output_tokens":128000,"supported_features":["json_mode","reasoning","tools"],"metrics":{"throughput":142.61,"latency":36.37,"ttft":12.0,"cache_hit_rate":0.12,"uptime":1.0}}}},{"id":"gpt-5.6-sol","object":"model","created":1783947600,"owned_by":"OpenAI","description":"GPT-5.6 Sol is the flagship model of the GPT-5.6 family, built for advanced reasoning, deep research, and complex multi-step execution.","pricing":{"currency":"EUR","input_token":4.937,"output_token":29.621,"cache_read_cost":0.494,"cache_write_cost":6.175},"providers":["azure_sc"],"context_size":1050000,"max_output_tokens":128000,"tags":["Instruct","Reasoning","Tools","Image","Document"],"input_modalities":["text","image","file"],"output_modalities":["text"],"supported_features":["json_mode","reasoning","tools"],"model_series":["gpt-5"],"providers_details":{"azure_sc":{"pricing":{"currency":"EUR","input_token":4.937,"output_token":29.621,"cache_read_cost":0.494,"cache_write_cost":6.175},"quantization":null,"context_size":1050000,"max_output_tokens":128000,"supported_features":["json_mode","reasoning","tools"],"metrics":{"throughput":1850.93,"latency":12.3,"ttft":11.51,"cache_hit_rate":0.87,"uptime":1.0}}}},{"id":"gpt-5.6-terra","object":"model","created":1783944000,"owned_by":"OpenAI","description":"GPT-5.6 Terra is a balanced mid-tier model optimized for professional work, combining strong reasoning, coding ability, and efficiency.","pricing":{"currency":"EUR","input_token":1.975,"output_token":11.848,"cache_read_cost":0.197,"cache_write_cost":2.468},"providers":["azure_sc"],"context_size":1050000,"max_output_tokens":128000,"tags":["Instruct","Reasoning","Tools","Image","Document"],"input_modalities":["text","image","file"],"output_modalities":["text"],"supported_features":["json_mode","reasoning","tools"],"model_series":["gpt-5"],"providers_details":{"azure_sc":{"pricing":{"currency":"EUR","input_token":1.975,"output_token":11.848,"cache_read_cost":0.197,"cache_write_cost":2.468},"quantization":null,"context_size":1050000,"max_output_tokens":128000,"supported_features":["json_mode","reasoning","tools"],"metrics":{"throughput":122.06,"latency":15.09,"ttft":4.82,"cache_hit_rate":0.6,"uptime":1.0}}}},{"id":"gpt-5.6-luna","object":"model","created":1783940400,"owned_by":"OpenAI","description":"GPT-5.6 Luna is a fast, cost-efficient model optimized for high-volume tasks, real-time interactions, and lightweight reasoning.","pricing":{"currency":"EUR","input_token":0.197,"output_token":1.185,"cache_read_cost":0.02,"cache_write_cost":0.247},"providers":["azure_sc"],"context_size":1050000,"max_output_tokens":128000,"tags":["Instruct","Reasoning","Tools","Image","Document"],"input_modalities":["text","image","file"],"output_modalities":["text"],"supported_features":["json_mode","reasoning","tools"],"model_series":["gpt-5"],"providers_details":{"azure_sc":{"pricing":{"currency":"EUR","input_token":0.197,"output_token":1.185,"cache_read_cost":0.02,"cache_write_cost":0.247},"quantization":null,"context_size":1050000,"max_output_tokens":128000,"supported_features":["json_mode","reasoning","tools"],"metrics":{"throughput":237.65,"latency":6.07,"ttft":4.69,"cache_hit_rate":0.87,"uptime":1.0}}}},{"id":"apertus-70b","object":"model","created":1783507082,"owned_by":"Swiss AI Initiative","description":"Apertus 70B is an open, multilingual language model designed for research, long-context reasoning, and sovereignty-focused AI systems.","pricing":{"currency":"EUR","input_token":1.25,"output_token":2.0},"providers":["aki"],"context_size":65536,"max_output_tokens":16384,"tags":["Instruct","Reasoning","Tools"],"input_modalities":["text"],"output_modalities":["text"],"supported_features":["reasoning","tools"],"model_series":["apertus-70b"],"providers_details":{"aki":{"pricing":{"currency":"EUR","input_token":1.25,"output_token":2.0},"quantization":"fp8","context_size":65536,"max_output_tokens":16384,"supported_features":["reasoning","tools"],"metrics":{"throughput":22.6,"latency":16.2,"ttft":0.46,"cache_hit_rate":0.08,"uptime":1.0}}}},{"id":"claude-sonnet-5","object":"model","created":1782981482,"owned_by":"Anthropic","description":"Claude Sonnet 5 is a high-performance model optimized for coding, agent workflows, and everyday professional tasks with strong efficiency and scalability.","pricing":{"currency":"EUR","input_token":1.975,"output_token":9.874,"cache_read_cost":0.197,"cache_write_cost":2.468},"providers":["google","amazon_ireland","amazon_paris"],"context_size":1000000,"max_output_tokens":128000,"tags":["Instruct","Tools","Image","Code","Reasoning","Document"],"input_modalities":["text","image","file"],"output_modalities":["text"],"supported_features":["json_mode","reasoning","tools"],"model_series":["claude-sonnet-5"],"providers_details":{"google":{"pricing":{"currency":"EUR","input_token":1.975,"output_token":9.874,"cache_read_cost":0.197,"cache_write_cost":2.468},"quantization":null,"context_size":1000000,"max_output_tokens":128000,"supported_features":["json_mode","reasoning","tools"],"metrics":{"throughput":167.76,"latency":8.74,"ttft":4.94,"cache_hit_rate":0.82,"uptime":1.0}},"amazon_ireland":{"pricing":{"currency":"EUR","input_token":1.975,"output_token":9.874,"cache_read_cost":0.197,"cache_write_cost":2.468},"quantization":null,"context_size":1000000,"max_output_tokens":128000,"supported_features":["json_mode","reasoning","tools"],"metrics":{"throughput":97.97,"latency":7.33,"ttft":2.05,"cache_hit_rate":0.85,"uptime":1.0}},"amazon_paris":{"pricing":{"currency":"EUR","input_token":1.975,"output_token":9.874,"cache_read_cost":0.197,"cache_write_cost":2.468},"quantization":null,"context_size":1000000,"max_output_tokens":128000,"supported_features":["json_mode","reasoning","tools"],"metrics":{"throughput":108.15,"latency":9.82,"ttft":3.86,"cache_hit_rate":0.31,"uptime":1.0}}}},{"id":"gemma-4-31b-it","object":"model","created":1781854682,"owned_by":"Google","description":"Gemma 4 31B IT is a multimodal instruction-tuned model from Google DeepMind designed for strong reasoning, coding, and vision-language tasks.","pricing":{"currency":"EUR","input_token":0.2,"output_token":0.35},"providers":["infercom","berget"],"context_size":262000,"max_output_tokens":262000,"tags":["Instruct","Image","Tools","Reasoning"],"input_modalities":["text","image"],"output_modalities":["text"],"supported_features":["json_mode","reasoning","tools"],"model_series":["gemma-4-31b"],"providers_details":{"infercom":{"pricing":{"currency":"EUR","input_token":0.2,"output_token":0.35},"quantization":null,"context_size":128000,"max_output_tokens":128000,"supported_features":["json_mode","reasoning","tools"],"metrics":{"throughput":128.64,"latency":7.16,"ttft":1.77,"cache_hit_rate":null,"uptime":0.95}},"berget":{"pricing":{"currency":"EUR","input_token":0.25,"output_token":0.5},"quantization":"fp16","context_size":262000,"max_output_tokens":262000,"supported_features":["json_mode","reasoning","tools"],"metrics":{"throughput":57.02,"latency":23.2,"ttft":1.62,"cache_hit_rate":0.36,"uptime":0.96}}}},{"id":"glm-5.2","object":"model","created":1781686682,"owned_by":"Z.ai","description":"GLM-5.2 is a flagship model built for long-horizon agentic tasks with stable 1M-token context and advanced coding capabilities.","pricing":{"currency":"EUR","input_token":1.077,"output_token":3.77,"cache_read_cost":0.233},"providers":["tensorix","scaleway","inceptron","berget","mistral"],"context_size":1048576,"max_output_tokens":1000000,"tags":["Instruct","Code","Reasoning","Tools"],"input_modalities":["text"],"output_modalities":["text"],"supported_features":["json_mode","reasoning","tools"],"model_series":["glm-5"],"providers_details":{"tensorix":{"pricing":{"currency":"EUR","input_token":1.331,"output_token":3.993,"cache_read_cost":0.337},"quantization":"fp8","context_size":1048576,"max_output_tokens":131072,"supported_features":["json_mode","reasoning","tools"],"metrics":{"throughput":232.74,"latency":4.66,"ttft":2.6,"cache_hit_rate":0.79,"uptime":0.98}},"scaleway":{"pricing":{"currency":"EUR","input_token":1.8,"output_token":5.5},"quantization":null,"context_size":256000,"max_output_tokens":16384,"supported_features":["json_mode","reasoning","tools"],"metrics":{"throughput":88.24,"latency":14.96,"ttft":2.61,"cache_hit_rate":null,"uptime":0.92}},"inceptron":{"pricing":{"currency":"EUR","input_token":1.077,"output_token":3.77,"cache_read_cost":0.233},"quantization":"fp4","context_size":1000000,"max_output_tokens":1000000,"supported_features":["json_mode","reasoning","tools"],"metrics":{"throughput":84.81,"latency":8.13,"ttft":2.01,"cache_hit_rate":0.92,"uptime":0.92}},"berget":{"pricing":{"currency":"EUR","input_token":1.4,"output_token":4.4},"quantization":"fp8","context_size":1048576,"max_output_tokens":327680,"supported_features":["json_mode","reasoning","tools"],"metrics":{"throughput":18.13,"latency":103.63,"ttft":7.2,"cache_hit_rate":0.32,"uptime":0.83}},"mistral":{"pricing":{"currency":"EUR","input_token":1.19,"output_token":3.74,"cache_read_cost":0.119},"quantization":null,"context_size":1000000,"max_output_tokens":128000,"supported_features":["json_mode","reasoning","tools"],"metrics":{"throughput":289.71,"latency":3.37,"ttft":1.99,"cache_hit_rate":0.83,"uptime":1.0}}}},{"id":"kimi-k2.7-code","object":"model","created":1781599082,"owned_by":"Moonshot AI","description":"Kimi K2.7 Code is an open-source agentic coding model optimized for long-horizon software engineering and efficient multi-step execution.","pricing":{"currency":"EUR","input_token":0.673,"output_token":3.142,"cache_read_cost":0.18},"providers":["tensorix","inceptron","aki"],"context_size":262144,"max_output_tokens":262144,"tags":["Instruct","Code","Tools","Reasoning","Image","Document"],"input_modalities":["text","image","file"],"output_modalities":["text"],"supported_features":["json_mode","reasoning","tools"],"model_series":["kimi-k2"],"providers_details":{"tensorix":{"pricing":{"currency":"EUR","input_token":1.109,"output_token":3.993,"cache_read_cost":0.277},"quantization":"int4","context_size":262144,"max_output_tokens":262144,"supported_features":["json_mode","reasoning","tools"],"metrics":{"throughput":241.34,"latency":5.29,"ttft":1.29,"cache_hit_rate":0.96,"uptime":0.99}},"inceptron":{"pricing":{"currency":"EUR","input_token":0.673,"output_token":3.142,"cache_read_cost":0.18},"quantization":"int4","context_size":256000,"max_output_tokens":256000,"supported_features":["json_mode","reasoning","tools"],"metrics":{"throughput":136.8,"latency":11.35,"ttft":2.08,"cache_hit_rate":0.75,"uptime":0.96}},"aki":{"pricing":{"currency":"EUR","input_token":0.86,"output_token":3.0,"cache_read_cost":0.18},"quantization":"fp4","context_size":262144,"max_output_tokens":81920,"supported_features":["json_mode","reasoning","tools"],"metrics":{"throughput":104.14,"latency":19.07,"ttft":16.34,"cache_hit_rate":0.35,"uptime":1.0}}}},{"id":"minimax-m3","object":"model","created":1781509082,"owned_by":"MiniMax AI","description":"MiniMax M3 is a multimodal frontier model built for coding and agentic workflows, featuring ultra-long context and advanced tool-driven reasoning.","pricing":{"currency":"EUR","input_token":0.355,"output_token":1.775,"cache_read_cost":0.089},"providers":["tensorix"],"context_size":1048576,"max_output_tokens":1048576,"tags":["Instruct","Code","Tools","Reasoning","Image"],"input_modalities":["text","image"],"output_modalities":["text"],"supported_features":["json_mode","reasoning","tools"],"model_series":["minimax-m3"],"providers_details":{"tensorix":{"pricing":{"currency":"EUR","input_token":0.355,"output_token":1.775,"cache_read_cost":0.089},"quantization":"fp8","context_size":1048576,"max_output_tokens":1048576,"supported_features":["json_mode","reasoning","tools"],"metrics":{"throughput":71.29,"latency":16.97,"ttft":2.39,"cache_hit_rate":0.91,"uptime":0.97}}}},{"id":"qwen3.6-27b","object":"model","created":1780392962,"owned_by":"Alibaba Cloud","description":"Qwen3.6 27B is a dense multimodal model offering strong agentic coding and reasoning performance with easy deployment at a practical scale.","pricing":{"currency":"EUR","input_token":0.4,"output_token":2.7},"providers":["ovh"],"context_size":262000,"max_output_tokens":262000,"tags":["Instruct","Reasoning","Tools","Code","Image"],"input_modalities":["text","image"],"output_modalities":["text"],"supported_features":["json_mode","reasoning","tools"],"model_series":["qwen-3-27b"],"providers_details":{"ovh":{"pricing":{"currency":"EUR","input_token":0.4,"output_token":2.7},"quantization":"fp8","context_size":262000,"max_output_tokens":262000,"supported_features":["json_mode","reasoning","tools"],"metrics":{"throughput":81.44,"latency":91.57,"ttft":0.13,"cache_hit_rate":null,"uptime":0.92}}}},{"id":"cosmos3-super-reasoner","object":"model","created":1780389482,"owned_by":"Nvidia","description":"Cosmos3 Super Reasoner is a high-capacity reasoning model designed for complex multi-agent tasks and advanced physical AI understanding.","pricing":{"currency":"EUR","input_token":0.089,"output_token":0.266},"providers":["nebius"],"context_size":256000,"max_output_tokens":256000,"tags":["Instruct","Tools","Reasoning"],"input_modalities":["text"],"output_modalities":["text"],"supported_features":["json_mode","reasoning","tools"],"model_series":["cosmos-3"],"providers_details":{"nebius":{"pricing":{"currency":"EUR","input_token":0.089,"output_token":0.266},"quantization":"fp16","context_size":256000,"max_output_tokens":256000,"supported_features":["json_mode","reasoning","tools"],"metrics":{"throughput":73.76,"latency":31.52,"ttft":0.3,"cache_hit_rate":0.01,"uptime":1.0}}}},{"id":"minicpm-v-4.5","object":"model","created":1780385882,"owned_by":"OpenBMB","description":"MiniCPM-V 4.5 is a compact, high-performance vision-language model excelling in video understanding, OCR, and multimodal reasoning with efficient deployment.","pricing":{"currency":"EUR","input_token":0.584,"output_token":0.985},"providers":["nebius"],"context_size":32000,"max_output_tokens":32000,"tags":["Instruct"],"input_modalities":["text"],"output_modalities":["text"],"supported_features":["json_mode","tools"],"model_series":["minicpm-v-4"],"providers_details":{"nebius":{"pricing":{"currency":"EUR","input_token":0.584,"output_token":0.985},"quantization":"fp16","context_size":32000,"max_output_tokens":32000,"supported_features":["json_mode","tools"],"metrics":{"throughput":71.37,"latency":1.38,"ttft":0.29,"cache_hit_rate":0.28,"uptime":1.0}}}},{"id":"claude-opus4-8","object":"model","created":1780036200,"owned_by":"Anthropic","description":"Claude Opus 4.8 is a top-tier model built for sustained autonomous work, excelling in coding, agents, and complex enterprise tasks.","pricing":{"currency":"EUR","input_token":4.881,"output_token":24.404,"cache_read_cost":0.488,"cache_write_cost":6.101},"providers":["amazon_ireland","amazon_paris","google"],"context_size":1000000,"max_output_tokens":128000,"tags":["Instruct","Tools","Image","Code","Reasoning","Document"],"input_modalities":["text","image","file"],"output_modalities":["text"],"supported_features":["json_mode","reasoning","tools"],"model_series":["claude-opus-4"],"providers_details":{"amazon_ireland":{"pricing":{"currency":"EUR","input_token":4.881,"output_token":24.404,"cache_read_cost":0.488,"cache_write_cost":6.101},"quantization":null,"context_size":1000000,"max_output_tokens":128000,"supported_features":["json_mode","reasoning","tools"],"metrics":{"throughput":98.78,"latency":9.03,"ttft":1.61,"cache_hit_rate":0.92,"uptime":1.0}},"amazon_paris":{"pricing":{"currency":"EUR","input_token":4.881,"output_token":24.404,"cache_read_cost":0.488,"cache_write_cost":6.101},"quantization":null,"context_size":1000000,"max_output_tokens":128000,"supported_features":["json_mode","reasoning","tools"],"metrics":{"throughput":99.19,"latency":7.74,"ttft":1.43,"cache_hit_rate":0.42,"uptime":1.0}},"google":{"pricing":{"currency":"EUR","input_token":4.881,"output_token":24.404,"cache_read_cost":0.488,"cache_write_cost":6.101},"quantization":null,"context_size":1000000,"max_output_tokens":128000,"supported_features":["json_mode","reasoning","tools"],"metrics":{"throughput":99.51,"latency":9.82,"ttft":2.19,"cache_hit_rate":0.73,"uptime":1.0}}}},{"id":"gemini-3.5-flash","object":"model","created":1779259082,"owned_by":"Google","description":"Gemini 3.5 Flash is a high-speed frontier model delivering near-Pro intelligence for agent workflows, coding, and large-scale tasks.","pricing":{"currency":"EUR","input_token":1.48,"output_token":8.886,"audio_cost":3.366e-05,"cache_read_cost":0.148,"cache_write_cost":0.898},"providers":["google"],"context_size":1048576,"max_output_tokens":65535,"tags":["Instruct","Tools","Image","Reasoning","Audio"],"input_modalities":["text","image","audio"],"output_modalities":["text"],"supported_features":["json_mode","reasoning","tools"],"model_series":["gemini-3-flash"],"providers_details":{"google":{"pricing":{"currency":"EUR","input_token":1.48,"output_token":8.886,"audio_cost":3.366e-05,"cache_read_cost":0.148,"cache_write_cost":0.898},"quantization":null,"context_size":1048576,"max_output_tokens":65535,"supported_features":["json_mode","reasoning","tools"],"metrics":{"throughput":181.17,"latency":7.22,"ttft":6.88,"cache_hit_rate":0.04,"uptime":1.0}}}},{"id":"gemini-3.1-flash-lite","object":"model","created":1779107882,"owned_by":"Google","description":"Gemini 3.1 Flash Lite is a highly efficient multimodal model optimized for ultra-low latency and cost-sensitive, high-volume workloads.","pricing":{"currency":"EUR","input_token":0.244,"output_token":1.464,"audio_cost":1.22e-05,"cache_read_cost":0.022,"cache_write_cost":0.074},"providers":["google"],"context_size":1048576,"max_output_tokens":65535,"tags":["Instruct","Tools","Image","Reasoning","Audio","Document"],"input_modalities":["text","image","audio","file"],"output_modalities":["text"],"supported_features":["json_mode","reasoning","tools"],"model_series":["gemini-3-flash-lite"],"providers_details":{"google":{"pricing":{"currency":"EUR","input_token":0.244,"output_token":1.464,"audio_cost":1.22e-05,"cache_read_cost":0.022,"cache_write_cost":0.074},"quantization":null,"context_size":1048576,"max_output_tokens":65535,"supported_features":["json_mode","reasoning","tools"],"metrics":{"throughput":149.29,"latency":1.63,"ttft":1.03,"cache_hit_rate":0.3,"uptime":1.0}}}},{"id":"qwen3.6-35b-a3b","object":"model","created":1778755082,"owned_by":"Alibaba Cloud","description":"Qwen3.6 35B A3B is a lightweight multimodal MoE model focused on efficient agentic coding, long-context reasoning, and visual understanding.","pricing":{"currency":"EUR","input_token":0.15,"output_token":0.5},"providers":["scaleway","aki"],"context_size":262000,"max_output_tokens":32768,"tags":["Instruct","Reasoning","Tools","Code","Image"],"input_modalities":["text","image"],"output_modalities":["text"],"supported_features":["json_mode","reasoning","tools"],"model_series":["qwen-3-35b"],"providers_details":{"scaleway":{"pricing":{"currency":"EUR","input_token":0.25,"output_token":1.5},"quantization":null,"context_size":262000,"max_output_tokens":32768,"supported_features":["json_mode","reasoning","tools"],"metrics":{"throughput":146.85,"latency":21.96,"ttft":1.61,"cache_hit_rate":null,"uptime":0.98}},"aki":{"pricing":{"currency":"EUR","input_token":0.15,"output_token":0.5},"quantization":"fp8","context_size":256000,"max_output_tokens":32768,"supported_features":["json_mode","reasoning","tools"],"metrics":{"throughput":185.23,"latency":10.3,"ttft":1.32,"cache_hit_rate":0.74,"uptime":0.96}}}},{"id":"glm-5v-turbo","object":"model","created":1778583482,"owned_by":"Z.ai","description":"GLM 5V Turbo is a flagship multimodal model optimized for vision-based coding, agent workflows, and long-horizon task execution.","pricing":{"currency":"EUR","input_token":1.065,"output_token":3.55,"cache_read_cost":0.266},"providers":["tensorix"],"context_size":202752,"max_output_tokens":202752,"tags":["Instruct","Code","Reasoning","Tools","Image"],"input_modalities":["text","image"],"output_modalities":["text"],"supported_features":["json_mode","reasoning","tools"],"model_series":["glm-5v-turbo"],"providers_details":{"tensorix":{"pricing":{"currency":"EUR","input_token":1.065,"output_token":3.55,"cache_read_cost":0.266},"quantization":"fp8","context_size":202752,"max_output_tokens":202752,"supported_features":["json_mode","reasoning","tools"],"metrics":{"throughput":150.24,"latency":7.52,"ttft":0.45,"cache_hit_rate":null,"uptime":0.97}}}},{"id":"glm-5-turbo","object":"model","created":1778579882,"owned_by":"Z.ai","description":"GLM 5 Turbo is a fast, cost-efficient variant of GLM-5 optimized for agent workflows, tool use, and long-chain execution.","pricing":{"currency":"EUR","input_token":1.065,"output_token":3.55,"cache_read_cost":0.266},"providers":["tensorix"],"context_size":202752,"max_output_tokens":202752,"tags":["Instruct","Code","Reasoning","Tools"],"input_modalities":["text"],"output_modalities":["text"],"supported_features":["json_mode","reasoning","tools"],"model_series":["glm-5-turbo"],"providers_details":{"tensorix":{"pricing":{"currency":"EUR","input_token":1.065,"output_token":3.55,"cache_read_cost":0.266},"quantization":"fp8","context_size":202752,"max_output_tokens":202752,"supported_features":["json_mode","reasoning","tools"],"metrics":{"throughput":173.67,"latency":3.26,"ttft":0.43,"cache_hit_rate":0.26,"uptime":1.0}}}},{"id":"gemma-4-26b-a4b-it","object":"model","created":1778153882,"owned_by":"Google","description":"Gemma 4 26B A4B is a multimodal Mixture-of-Experts model optimized for fast, efficient inference with strong reasoning, coding, and agentic capabilities.","pricing":{"currency":"EUR","input_token":0.1,"output_token":0.5},"providers":["scaleway","aki"],"context_size":262000,"max_output_tokens":81920,"tags":["Instruct","Image","Tools","Reasoning"],"input_modalities":["text","image"],"output_modalities":["text"],"supported_features":["json_mode","reasoning","tools"],"model_series":["gemma-4-26b"],"providers_details":{"scaleway":{"pricing":{"currency":"EUR","input_token":0.25,"output_token":0.5},"quantization":null,"context_size":262000,"max_output_tokens":32768,"supported_features":["json_mode","reasoning","tools"],"metrics":{"throughput":126.11,"latency":5.23,"ttft":0.48,"cache_hit_rate":null,"uptime":0.98}},"aki":{"pricing":{"currency":"EUR","input_token":0.1,"output_token":0.5},"quantization":"fp4","context_size":256000,"max_output_tokens":81920,"supported_features":["json_mode","reasoning","tools"],"metrics":{"throughput":206.11,"latency":25.7,"ttft":4.2,"cache_hit_rate":0.34,"uptime":0.94}}}},{"id":"deepseek-v4-pro","object":"model","created":1777621082,"owned_by":"Deepseek","description":"DeepSeek-V4 is a Mixture-of-Experts model series featuring advanced attention mechanisms and large-scale training for efficient long-context reasoning and strong performance.","pricing":{"currency":"EUR","input_token":1.553,"output_token":3.106,"cache_read_cost":0.388},"providers":["tensorix"],"context_size":1048576,"max_output_tokens":1048576,"tags":["Instruct","Tools","Reasoning"],"input_modalities":["text"],"output_modalities":["text"],"supported_features":["json_mode","reasoning","tools"],"model_series":["deepseek-v4-pro"],"providers_details":{"tensorix":{"pricing":{"currency":"EUR","input_token":1.553,"output_token":3.106,"cache_read_cost":0.388},"quantization":"fp8","context_size":1048576,"max_output_tokens":1048576,"supported_features":["json_mode","reasoning","tools"],"metrics":{"throughput":269.67,"latency":4.93,"ttft":1.92,"cache_hit_rate":0.73,"uptime":0.97}}}},{"id":"mistral-medium-3.5","object":"model","created":1777549993,"owned_by":"Mistral AI","description":"Mistral Medium 3.5 is a frontier multimodal 128B model combining reasoning, coding, and instruction-following with strong agentic performance and efficient deployment.","pricing":{"currency":"EUR","input_token":1.25,"output_token":6.4,"cache_read_cost":0.125},"providers":["mistral","scaleway"],"context_size":256000,"max_output_tokens":256000,"tags":["Instruct","Reasoning","Tools","Image"],"input_modalities":["text","image"],"output_modalities":["text"],"supported_features":["json_mode","reasoning","tools"],"model_series":["mistral-medium"],"providers_details":{"mistral":{"pricing":{"currency":"EUR","input_token":1.25,"output_token":6.4,"cache_read_cost":0.125},"quantization":null,"context_size":256000,"max_output_tokens":256000,"supported_features":["json_mode","reasoning","tools"],"metrics":{"throughput":165.49,"latency":8.09,"ttft":4.87,"cache_hit_rate":0.07,"uptime":1.0}},"scaleway":{"pricing":{"currency":"EUR","input_token":1.5,"output_token":7.5},"quantization":null,"context_size":256000,"max_output_tokens":16384,"supported_features":["json_mode","reasoning","tools"],"metrics":{"throughput":92.71,"latency":6.72,"ttft":0.26,"cache_hit_rate":null,"uptime":1.0}}}},{"id":"nvidia-nemotron-3-nano-omni","object":"model","created":1777477082,"owned_by":"Nvidia","description":"Nemotron-3-Nano-Omni is an open, efficient omni-modal reasoning model that unifies text, image, audio, and video for agentic AI workflows.","pricing":{"currency":"EUR","input_token":0.053,"output_token":0.213},"providers":["nebius"],"context_size":300000,"max_output_tokens":65536,"tags":["Instruct","Tools","Reasoning"],"input_modalities":["text"],"output_modalities":["text"],"supported_features":["json_mode","reasoning","tools"],"model_series":["nemotron-3-nano-omni"],"providers_details":{"nebius":{"pricing":{"currency":"EUR","input_token":0.053,"output_token":0.213},"quantization":"fp8","context_size":300000,"max_output_tokens":65536,"supported_features":["json_mode","reasoning","tools"],"metrics":{"throughput":338.74,"latency":2.48,"ttft":0.31,"cache_hit_rate":0.29,"uptime":1.0}}}},{"id":"gpt-5.4","object":"model","created":1777030682,"owned_by":"OpenAI","description":"GPT-5.4 is a frontier model designed for fast, reliable performance across professional workflows, coding, data analysis, and agentic tasks.","pricing":{"currency":"EUR","input_token":2.601,"output_token":13.872,"cache_read_cost":0.217},"providers":["azure_sc","azure_spc"],"context_size":1050000,"max_output_tokens":128000,"tags":["Instruct","Tools","Image","Reasoning","Document"],"input_modalities":["text","image","file"],"output_modalities":["text"],"supported_features":["json_mode","reasoning","tools"],"model_series":["gpt-5"],"providers_details":{"azure_sc":{"pricing":{"currency":"EUR","input_token":2.601,"output_token":13.872,"cache_read_cost":0.217},"quantization":null,"context_size":1050000,"max_output_tokens":128000,"supported_features":["json_mode","reasoning","tools"],"metrics":{"throughput":105.17,"latency":9.15,"ttft":3.72,"cache_hit_rate":0.74,"uptime":1.0}},"azure_spc":{"pricing":{"currency":"EUR","input_token":2.601,"output_token":13.872,"cache_read_cost":0.217},"quantization":null,"context_size":1050000,"max_output_tokens":128000,"supported_features":["json_mode","reasoning","tools"],"metrics":{"throughput":89.77,"latency":7.19,"ttft":0.93,"cache_hit_rate":0.79,"uptime":1.0}}}},{"id":"kimi-k2.6","object":"model","created":1776929882,"owned_by":"Moonshot AI","description":"Kimi K2.6 is an advanced multimodal agentic model with strong long-horizon coding, instruction following, and autonomous execution capabilities.","pricing":{"currency":"EUR","input_token":0.694,"output_token":3.034,"cache_read_cost":0.173},"providers":["tensorix","inceptron","berget"],"context_size":262144,"max_output_tokens":262144,"tags":["Instruct","Code","Tools","Reasoning","Image","Document"],"input_modalities":["text","image","file"],"output_modalities":["text"],"supported_features":["json_mode","reasoning","tools"],"model_series":["kimi-k2"],"providers_details":{"tensorix":{"pricing":{"currency":"EUR","input_token":0.867,"output_token":3.468,"cache_read_cost":0.222},"quantization":"int4","context_size":262144,"max_output_tokens":262144,"supported_features":["json_mode","reasoning","tools"],"metrics":{"throughput":135.56,"latency":31.99,"ttft":4.17,"cache_hit_rate":0.6,"uptime":0.95}},"inceptron":{"pricing":{"currency":"EUR","input_token":0.694,"output_token":3.034,"cache_read_cost":0.173},"quantization":"int4","context_size":256000,"max_output_tokens":256000,"supported_features":["json_mode","reasoning","tools"],"metrics":{"throughput":95.7,"latency":27.48,"ttft":1.89,"cache_hit_rate":0.81,"uptime":0.97}},"berget":{"pricing":{"currency":"EUR","input_token":0.75,"output_token":3.5},"quantization":"bf16","context_size":262144,"max_output_tokens":262144,"supported_features":["json_mode","reasoning","tools"],"metrics":{"throughput":97.25,"latency":19.52,"ttft":1.04,"cache_hit_rate":0.67,"uptime":1.0}}}},{"id":"claude-opus4-7","object":"model","created":1776407400,"owned_by":"Anthropic","description":"Claude Opus 4.7 is Anthropic’s most capable general model, optimized for coding, enterprise workflows, multimodal reasoning, and long-running agentic tasks.","pricing":{"currency":"EUR","input_token":4.881,"output_token":24.404,"cache_read_cost":0.488,"cache_write_cost":6.101},"providers":["amazon_ireland","amazon_paris","google"],"context_size":1000000,"max_output_tokens":128000,"tags":["Instruct","Tools","Image","Code","Reasoning","Document"],"input_modalities":["text","image","file"],"output_modalities":["text"],"supported_features":["json_mode","reasoning","tools"],"model_series":["claude-opus-4"],"providers_details":{"amazon_ireland":{"pricing":{"currency":"EUR","input_token":4.881,"output_token":24.404,"cache_read_cost":0.488,"cache_write_cost":6.101},"quantization":null,"context_size":1000000,"max_output_tokens":128000,"supported_features":["json_mode","reasoning","tools"],"metrics":{"throughput":99.88,"latency":11.48,"ttft":1.93,"cache_hit_rate":0.64,"uptime":1.0}},"amazon_paris":{"pricing":{"currency":"EUR","input_token":4.881,"output_token":24.404,"cache_read_cost":0.488,"cache_write_cost":6.101},"quantization":null,"context_size":1000000,"max_output_tokens":128000,"supported_features":["json_mode","reasoning","tools"],"metrics":{"throughput":101.72,"latency":12.27,"ttft":1.35,"cache_hit_rate":0.96,"uptime":1.0}},"google":{"pricing":{"currency":"EUR","input_token":4.881,"output_token":24.404,"cache_read_cost":0.488,"cache_write_cost":6.101},"quantization":null,"context_size":1000000,"max_output_tokens":128000,"supported_features":["json_mode","reasoning","tools"],"metrics":{"throughput":111.63,"latency":14.46,"ttft":2.3,"cache_hit_rate":0.78,"uptime":1.0}}}},{"id":"minimax-m2.7","object":"model","created":1776091082,"owned_by":"MiniMax AI","description":"MiniMax-M2.7 is a frontier autonomous agent model designed for iterative self-improvement, multi-agent coordination, and enterprise-scale execution.","pricing":{"currency":"EUR","input_token":0.6,"output_token":2.4},"providers":["infercom"],"context_size":196608,"max_output_tokens":196608,"tags":["Instruct","Code","Tools","Reasoning"],"input_modalities":["text"],"output_modalities":["text"],"supported_features":["json_mode","reasoning","tools"],"model_series":["minimax-m2"],"providers_details":{"infercom":{"pricing":{"currency":"EUR","input_token":0.6,"output_token":2.4},"quantization":null,"context_size":196608,"max_output_tokens":196608,"supported_features":["json_mode","reasoning","tools"],"metrics":{"throughput":331.94,"latency":2.87,"ttft":1.2,"cache_hit_rate":0.49,"uptime":0.95}}}},{"id":"glm-5.1","object":"model","created":1775735882,"owned_by":"Z.ai","description":"GLM-5.1 is a next-generation flagship model for agentic engineering, excelling in long-horizon reasoning and advanced coding tasks.","pricing":{"currency":"EUR","input_token":1.242,"output_token":3.903,"cache_read_cost":0.311},"providers":["tensorix","nebius"],"context_size":202752,"max_output_tokens":202752,"tags":["Instruct","Code","Reasoning","Tools"],"input_modalities":["text"],"output_modalities":["text"],"supported_features":["json_mode","reasoning","tools"],"model_series":["glm-5"],"providers_details":{"tensorix":{"pricing":{"currency":"EUR","input_token":1.242,"output_token":3.903,"cache_read_cost":0.311},"quantization":"fp8","context_size":202752,"max_output_tokens":202752,"supported_features":["json_mode","reasoning","tools"],"metrics":{"throughput":218.74,"latency":19.41,"ttft":2.47,"cache_hit_rate":0.46,"uptime":0.98}},"nebius":{"pricing":{"currency":"EUR","input_token":1.242,"output_token":3.903},"quantization":"fp8","context_size":202752,"max_output_tokens":202752,"supported_features":["json_mode","reasoning","tools"],"metrics":{"throughput":33.37,"latency":138.67,"ttft":3.33,"cache_hit_rate":0.03,"uptime":0.74}}}},{"id":"qwen3.5-122b-a10b","object":"model","created":1775727482,"owned_by":"Alibaba Cloud","description":"Qwen3.5-122B-A10B is a multimodal Mixture-of-Experts model designed for agentic applications across text, image, and video tasks.","pricing":{"currency":"EUR","input_token":0.444,"output_token":3.106,"cache_read_cost":0.111},"providers":["tensorix"],"context_size":262144,"max_output_tokens":262144,"tags":["Instruct","Reasoning","Tools","Code"],"input_modalities":["text"],"output_modalities":["text"],"supported_features":["json_mode","reasoning","tools"],"model_series":["qwen-3-122b"],"providers_details":{"tensorix":{"pricing":{"currency":"EUR","input_token":0.444,"output_token":3.106,"cache_read_cost":0.111},"quantization":"fp8","context_size":262144,"max_output_tokens":262144,"supported_features":["json_mode","reasoning","tools"],"metrics":{"throughput":80.28,"latency":21.25,"ttft":1.38,"cache_hit_rate":null,"uptime":1.0}}}},{"id":"qwen3.5-9b","object":"model","created":1775727362,"owned_by":"Alibaba Cloud","description":"Qwen3.5-9B is a dense multimodal model delivering strong reasoning, coding, and visual understanding with efficient performance and long context.","pricing":{"currency":"EUR","input_token":0.1,"output_token":0.15},"providers":["tensorix","ovh","ionos"],"context_size":262144,"max_output_tokens":262144,"tags":["Instruct","Reasoning","Tools","Code","Image"],"input_modalities":["text","image"],"output_modalities":["text"],"supported_features":["json_mode","reasoning","tools"],"model_series":["qwen-3-9b"],"providers_details":{"tensorix":{"pricing":{"currency":"EUR","input_token":0.133,"output_token":0.177,"cache_read_cost":0.033},"quantization":"fp8","context_size":262144,"max_output_tokens":262144,"supported_features":["json_mode","reasoning","tools"],"metrics":{"throughput":103.67,"latency":30.42,"ttft":2.39,"cache_hit_rate":0.1,"uptime":0.99}},"ovh":{"pricing":{"currency":"EUR","input_token":0.1,"output_token":0.15},"quantization":"bf16","context_size":262000,"max_output_tokens":262000,"supported_features":["json_mode","reasoning","tools"],"metrics":{"throughput":42.87,"latency":71.94,"ttft":0.13,"cache_hit_rate":null,"uptime":1.0}},"ionos":{"pricing":{"currency":"EUR","input_token":0.1,"output_token":0.15},"quantization":"fp8","context_size":262000,"max_output_tokens":262000,"supported_features":["json_mode","reasoning","tools"],"metrics":{"throughput":61.73,"latency":46.14,"ttft":0.28,"cache_hit_rate":null,"uptime":1.0}}}},{"id":"qwen3-coder-next","object":"model","created":1775140682,"owned_by":"Alibaba Cloud","description":"Qwen3 Coder Next 80B is a high-performance coding model optimized for complex software development, agentic workflows, and multi-language programming.","pricing":{"currency":"EUR","input_token":0.15,"output_token":0.8},"providers":["ionos"],"context_size":256000,"max_output_tokens":256000,"tags":["Instruct","Reasoning","Tools","Code"],"input_modalities":["text"],"output_modalities":["text"],"supported_features":["json_mode","reasoning","tools"],"model_series":["qwen-3-coder-next"],"providers_details":{"ionos":{"pricing":{"currency":"EUR","input_token":0.15,"output_token":0.8},"quantization":"int4","context_size":256000,"max_output_tokens":256000,"supported_features":["json_mode","reasoning","tools"],"metrics":{"throughput":106.87,"latency":4.8,"ttft":0.7,"cache_hit_rate":null,"uptime":1.0}}}},{"id":"glm-5","object":"model","created":1774522682,"owned_by":"Z.ai","description":"GLM-5 is Zhipu AI’s flagship multimodal model with strong bilingual reasoning, long-context understanding, and advanced agentic and tool-use capabilities.","pricing":{"currency":"EUR","input_token":0.887,"output_token":2.84,"cache_read_cost":0.222},"providers":["tensorix"],"context_size":202752,"max_output_tokens":202752,"tags":["Instruct","Code","Reasoning","Tools"],"input_modalities":["text"],"output_modalities":["text"],"supported_features":["json_mode","reasoning","tools"],"model_series":["glm-5"],"providers_details":{"tensorix":{"pricing":{"currency":"EUR","input_token":0.887,"output_token":2.84,"cache_read_cost":0.222},"quantization":"fp8","context_size":202752,"max_output_tokens":202752,"supported_features":["json_mode","reasoning","tools"],"metrics":{"throughput":78.54,"latency":12.89,"ttft":6.3,"cache_hit_rate":0.89,"uptime":0.95}}}},{"id":"qwen3.5-397b-a17b","object":"model","created":1773837482,"owned_by":"Alibaba Cloud","description":"Qwen3.5-397B-A17B is a large-scale multimodal model with a hybrid Mixture-of-Experts architecture, delivering state-of-the-art performance across chat, RAG, vision-language, video understanding, and agentic workflows.","pricing":{"currency":"EUR","input_token":0.6,"output_token":3.6},"providers":["scaleway","ovh","ionos"],"context_size":262000,"max_output_tokens":262000,"tags":["Instruct","Reasoning","Tools","Code"],"input_modalities":["text"],"output_modalities":["text"],"supported_features":["json_mode","reasoning","tools"],"model_series":["qwen-3-397b"],"providers_details":{"scaleway":{"pricing":{"currency":"EUR","input_token":0.6,"output_token":3.6},"quantization":null,"context_size":250000,"max_output_tokens":16384,"supported_features":["json_mode","reasoning","tools"],"metrics":{"throughput":75.78,"latency":119.04,"ttft":2.06,"cache_hit_rate":null,"uptime":1.0}},"ovh":{"pricing":{"currency":"EUR","input_token":0.6,"output_token":3.6},"quantization":"fp8","context_size":262000,"max_output_tokens":262000,"supported_features":["json_mode","reasoning","tools"],"metrics":{"throughput":139.94,"latency":15.61,"ttft":0.12,"cache_hit_rate":null,"uptime":1.0}},"ionos":{"pricing":{"currency":"EUR","input_token":0.6,"output_token":3.6},"quantization":"fp8","context_size":262000,"max_output_tokens":262000,"supported_features":["json_mode","reasoning","tools"],"metrics":{"throughput":66.58,"latency":37.12,"ttft":1.24,"cache_hit_rate":null,"uptime":1.0}}}},{"id":"deepseek-v3.2","object":"model","created":1773833882,"owned_by":"Deepseek","description":"DeepSeek V3.2 is a high-efficiency model designed for strong reasoning and agentic tool-use performance, optimized for long-context and scalable post-training.","pricing":{"currency":"EUR","input_token":0.266,"output_token":0.444,"cache_read_cost":0.067},"providers":["tensorix"],"context_size":163840,"max_output_tokens":163840,"tags":["Instruct","Tools","Reasoning"],"input_modalities":["text"],"output_modalities":["text"],"supported_features":["json_mode","reasoning","tools"],"model_series":["deepseek-v3"],"providers_details":{"tensorix":{"pricing":{"currency":"EUR","input_token":0.266,"output_token":0.444,"cache_read_cost":0.067},"quantization":"fp8","context_size":163840,"max_output_tokens":163840,"supported_features":["json_mode","reasoning","tools"],"metrics":{"throughput":34.4,"latency":18.45,"ttft":3.62,"cache_hit_rate":0.13,"uptime":0.82}}}},{"id":"mistral-small-2603","object":"model","created":1773741193,"owned_by":"Mistral AI","description":"Mistral Small 4 is a versatile Mixture-of-Experts model that unifies reasoning, multimodal understanding, and agentic coding in a single architecture, optimized for efficiency and long-context interactions.","pricing":{"currency":"EUR","input_token":0.128,"output_token":0.51,"cache_read_cost":0.013},"providers":["mistral","aki"],"context_size":262144,"max_output_tokens":256000,"tags":["Instruct","Code","Tools","Image","Reasoning"],"input_modalities":["text","image"],"output_modalities":["text"],"supported_features":["json_mode","reasoning","tools"],"model_series":["mistral-small"],"providers_details":{"mistral":{"pricing":{"currency":"EUR","input_token":0.128,"output_token":0.51,"cache_read_cost":0.013},"quantization":null,"context_size":256000,"max_output_tokens":256000,"supported_features":["json_mode","reasoning","tools"],"metrics":{"throughput":160.28,"latency":9.28,"ttft":3.55,"cache_hit_rate":0.61,"uptime":1.0}},"aki":{"pricing":{"currency":"EUR","input_token":0.2,"output_token":0.6},"quantization":"fp8","context_size":262144,"max_output_tokens":81920,"supported_features":["json_mode","reasoning","tools"],"metrics":{"throughput":142.18,"latency":3.1,"ttft":0.6,"cache_hit_rate":0.19,"uptime":1.0}}}},{"id":"minimax-m2.5","object":"model","created":1773675482,"owned_by":"MiniMax AI","description":"MiniMax-M2.5 is a state-of-the-art language model optimized for real-world productivity, autonomous agents, coding, and professional office workflows.","pricing":{"currency":"EUR","input_token":0.266,"output_token":1.065,"cache_read_cost":0.067},"providers":["tensorix","amazon_ireland","aki"],"context_size":196680,"max_output_tokens":196000,"tags":["Instruct","Code","Tools","Reasoning"],"input_modalities":["text"],"output_modalities":["text"],"supported_features":["json_mode","reasoning","tools"],"model_series":["minimax-m2"],"providers_details":{"tensorix":{"pricing":{"currency":"EUR","input_token":0.266,"output_token":1.065,"cache_read_cost":0.067},"quantization":"fp8","context_size":65536,"max_output_tokens":65536,"supported_features":["json_mode","reasoning","tools"],"metrics":{"throughput":68.07,"latency":14.04,"ttft":3.19,"cache_hit_rate":0.54,"uptime":0.99}},"amazon_ireland":{"pricing":{"currency":"EUR","input_token":0.312,"output_token":1.248},"quantization":null,"context_size":196000,"max_output_tokens":196000,"supported_features":["json_mode","reasoning","tools"],"metrics":{"throughput":117.38,"latency":12.26,"ttft":0.54,"cache_hit_rate":null,"uptime":1.0}},"aki":{"pricing":{"currency":"EUR","input_token":0.25,"output_token":1.2},"quantization":"fp4","context_size":196680,"max_output_tokens":81920,"supported_features":["json_mode","reasoning","tools"],"metrics":{"throughput":125.56,"latency":9.38,"ttft":0.38,"cache_hit_rate":0.88,"uptime":0.88}}}},{"id":"claude-4-6-sonnet","object":"model","created":1771490282,"owned_by":"Anthropic","description":"Claude Sonnet 4.6 delivers frontier-level intelligence at scale, optimized for coding, agents, and enterprise-grade workflows.","pricing":{"currency":"EUR","input_token":2.869,"output_token":14.309,"cache_read_cost":0.287,"cache_write_cost":3.59},"providers":["amazon_ireland","amazon_paris","google"],"context_size":1000000,"max_output_tokens":128000,"tags":["Instruct","Tools","Image","Code","Reasoning","Document"],"input_modalities":["text","image","file"],"output_modalities":["text"],"supported_features":["json_mode","reasoning","tools"],"model_series":["claude-sonnet-4"],"providers_details":{"amazon_ireland":{"pricing":{"currency":"EUR","input_token":2.951,"output_token":14.758,"cache_read_cost":0.293,"cache_write_cost":3.661},"quantization":null,"context_size":1000000,"max_output_tokens":128000,"supported_features":["json_mode","reasoning","tools"],"metrics":{"throughput":95.27,"latency":10.62,"ttft":1.63,"cache_hit_rate":0.2,"uptime":1.0}},"amazon_paris":{"pricing":{"currency":"EUR","input_token":2.951,"output_token":14.758,"cache_read_cost":0.293,"cache_write_cost":3.661},"quantization":null,"context_size":1000000,"max_output_tokens":128000,"supported_features":["json_mode","reasoning","tools"],"metrics":{"throughput":71.91,"latency":18.65,"ttft":2.37,"cache_hit_rate":0.01,"uptime":1.0}},"google":{"pricing":{"currency":"EUR","input_token":2.869,"output_token":14.309,"cache_read_cost":0.287,"cache_write_cost":3.59},"quantization":null,"context_size":1000000,"max_output_tokens":128000,"supported_features":["json_mode","reasoning","tools"],"metrics":{"throughput":95.02,"latency":13.12,"ttft":2.77,"cache_hit_rate":0.25,"uptime":1.0}}}},{"id":"glm-4.7-flash","object":"model","created":1771487882,"owned_by":"Z.ai","description":"GLM-4.7-Flash is a fast, resource-efficient variant of GLM-4.7 optimized for low-latency text and code generation.","pricing":{"currency":"EUR","input_token":0.072,"output_token":0.429},"providers":["amazon_ireland"],"context_size":203000,"max_output_tokens":203000,"tags":["Instruct","Code","Tools"],"input_modalities":["text"],"output_modalities":["text"],"supported_features":["json_mode","tools"],"model_series":["glm-4-flash"],"providers_details":{"amazon_ireland":{"pricing":{"currency":"EUR","input_token":0.072,"output_token":0.429},"quantization":null,"context_size":203000,"max_output_tokens":203000,"supported_features":["json_mode","tools"],"metrics":{"throughput":220.38,"latency":9.43,"ttft":6.7,"cache_hit_rate":null,"uptime":1.0}}}},{"id":"kimi-k2.5","object":"model","created":1771231082,"owned_by":"Moonshot AI","description":"Kimi K2.5 is an open-source native multimodal agentic model delivering state-of-the-art performance in agents, coding, visual understanding, and general reasoning tasks.","pricing":{"currency":"EUR","input_token":0.444,"output_token":2.485,"cache_read_cost":0.111},"providers":["tensorix"],"context_size":262144,"max_output_tokens":262144,"tags":["Instruct","Code","Tools","Reasoning","Image"],"input_modalities":["text","image"],"output_modalities":["text"],"supported_features":["json_mode","reasoning","tools"],"model_series":["kimi-k2"],"providers_details":{"tensorix":{"pricing":{"currency":"EUR","input_token":0.444,"output_token":2.485,"cache_read_cost":0.111},"quantization":"int4","context_size":262144,"max_output_tokens":262144,"supported_features":["json_mode","reasoning","tools"],"metrics":{"throughput":101.42,"latency":23.95,"ttft":2.96,"cache_hit_rate":0.78,"uptime":0.98}}}},{"id":"claude-opus4-6","object":"model","created":1770377400,"owned_by":"Anthropic","description":"Claude Opus 4.6 is the next generation of Anthropic’s most intelligent model, setting the global standard for coding, enterprise agents, and professional-grade workflows.","pricing":{"currency":"EUR","input_token":4.769,"output_token":23.843,"cache_read_cost":0.477,"cache_write_cost":5.965},"providers":["amazon_ireland","amazon_paris","google"],"context_size":1000000,"max_output_tokens":128000,"tags":["Instruct","Tools","Image","Code","Reasoning","Document"],"input_modalities":["text","image","file"],"output_modalities":["text"],"supported_features":["json_mode","reasoning","tools"],"model_series":["claude-opus-4"],"providers_details":{"amazon_ireland":{"pricing":{"currency":"EUR","input_token":4.919,"output_token":24.596,"cache_read_cost":0.488,"cache_write_cost":6.101},"quantization":null,"context_size":1000000,"max_output_tokens":128000,"supported_features":["json_mode","reasoning","tools"],"metrics":{"throughput":91.2,"latency":18.26,"ttft":1.61,"cache_hit_rate":0.7,"uptime":1.0}},"amazon_paris":{"pricing":{"currency":"EUR","input_token":4.919,"output_token":24.596,"cache_read_cost":0.488,"cache_write_cost":6.101},"quantization":null,"context_size":1000000,"max_output_tokens":128000,"supported_features":["json_mode","reasoning","tools"],"metrics":{"throughput":96.36,"latency":18.48,"ttft":1.36,"cache_hit_rate":0.66,"uptime":1.0}},"google":{"pricing":{"currency":"EUR","input_token":4.769,"output_token":23.843,"cache_read_cost":0.477,"cache_write_cost":5.965},"quantization":null,"context_size":1000000,"max_output_tokens":128000,"supported_features":["json_mode","reasoning","tools"],"metrics":{"throughput":61.25,"latency":29.2,"ttft":2.71,"cache_hit_rate":0.03,"uptime":1.0}}}},{"id":"minimax-m2","object":"model","created":1770374282,"owned_by":"MiniMax AI","description":"MiniMax-M2 is a large instruction-tuned MoE model optimized for multilingual dialogue, reasoning, and tool-calling, designed as a general-purpose assistant for consumer and enterprise use.","pricing":{"currency":"EUR","input_token":0.313,"output_token":1.261},"providers":["amazon_ireland"],"context_size":400000,"max_output_tokens":196000,"tags":["Instruct","Code","Tools","Reasoning"],"input_modalities":["text"],"output_modalities":["text"],"supported_features":["json_mode","reasoning","tools"],"model_series":["minimax-m2"],"providers_details":{"amazon_ireland":{"pricing":{"currency":"EUR","input_token":0.313,"output_token":1.261},"quantization":null,"context_size":400000,"max_output_tokens":196000,"supported_features":["json_mode","reasoning","tools"],"metrics":{"throughput":147.98,"latency":7.58,"ttft":0.7,"cache_hit_rate":null,"uptime":1.0}}}},{"id":"glm-4.7","object":"model","created":1770206282,"owned_by":"Z.ai","description":"GLM-4.7 is a flagship GLM model featuring strong multilingual reasoning, long-context understanding, and robust tool use, with major gains in agentic coding, UI generation, and complex reasoning tasks.","pricing":{"currency":"EUR","input_token":0.7,"output_token":2.5},"providers":["berget"],"context_size":202752,"max_output_tokens":202752,"tags":["Instruct","Code","Reasoning","Tools"],"input_modalities":["text"],"output_modalities":["text"],"supported_features":["json_mode","reasoning","tools"],"model_series":["glm-4"],"providers_details":{"berget":{"pricing":{"currency":"EUR","input_token":0.7,"output_token":2.5},"quantization":"fp8","context_size":202752,"max_output_tokens":202752,"supported_features":["json_mode","reasoning","tools"],"metrics":{"throughput":87.81,"latency":8.68,"ttft":0.36,"cache_hit_rate":null,"uptime":0.96}}}},{"id":"minimax-m2.1","object":"model","created":1770205082,"owned_by":"MiniMax AI","description":"MiniMax-M2.1 is an open-source agentic coding model designed for polyglot development, precision refactoring, and reliable execution of long, multi-step coding and office workflows.","pricing":{"currency":"EUR","input_token":0.322,"output_token":1.288},"providers":["amazon_ireland"],"context_size":196000,"max_output_tokens":196000,"tags":["Instruct","Code","Tools","Reasoning"],"input_modalities":["text"],"output_modalities":["text"],"supported_features":["json_mode","reasoning","tools"],"model_series":["minimax-m2"],"providers_details":{"amazon_ireland":{"pricing":{"currency":"EUR","input_token":0.322,"output_token":1.288},"quantization":null,"context_size":196000,"max_output_tokens":196000,"supported_features":["json_mode","reasoning","tools"],"metrics":{"throughput":198.44,"latency":2.85,"ttft":0.49,"cache_hit_rate":null,"uptime":1.0}}}},{"id":"qwen3guard-gen-8b","object":"model","created":1770204122,"owned_by":"Alibaba Cloud","description":"Qwen3Guard-Gen-8B is a large-scale multilingual safety moderation model designed for high-accuracy prompt and response classification.","pricing":{"currency":"EUR","input_token":0.0,"output_token":0.0},"providers":["ovh"],"context_size":32000,"max_output_tokens":32000,"tags":["Instruct","Safety-guard"],"input_modalities":["text"],"output_modalities":["text"],"supported_features":[],"model_series":["qwen-3-guard-8b"],"providers_details":{"ovh":{"pricing":{"currency":"EUR","input_token":0.0,"output_token":0.0},"quantization":"fp16","context_size":32000,"max_output_tokens":32000,"supported_features":[],"metrics":{"throughput":32.3,"latency":1.31,"ttft":0.19,"cache_hit_rate":null,"uptime":1.0}}}},{"id":"qwen3guard-gen-0.6b","object":"model","created":1770204002,"owned_by":"Alibaba Cloud","description":"Qwen3Guard-Gen-0.6B is a lightweight multilingual safety moderation model that classifies prompts and responses into safe, controversial, or unsafe categories.","pricing":{"currency":"EUR","input_token":0.0,"output_token":0.0},"providers":["ovh"],"context_size":32000,"max_output_tokens":32000,"tags":["Instruct","Safety-guard"],"input_modalities":["text"],"output_modalities":["text"],"supported_features":[],"model_series":["qwen-3-guard-0.6b"],"providers_details":{"ovh":{"pricing":{"currency":"EUR","input_token":0.0,"output_token":0.0},"quantization":"fp16","context_size":32000,"max_output_tokens":32000,"supported_features":[],"metrics":{"throughput":36.15,"latency":3.26,"ttft":0.09,"cache_hit_rate":null,"uptime":1.0}}}},{"id":"voxtral-small-2507","object":"model","created":1770025993,"owned_by":"Mistral AI","description":"Voxtral Small is a multimodal model with audio input, combining advanced speech capabilities with strong text performance for transcription, translation, and audio understanding.","pricing":{"currency":"EUR","input_token":0.1,"output_token":0.3,"audio_cost":6.7e-05,"cache_read_cost":0.01},"providers":["mistral"],"context_size":32000,"max_output_tokens":32000,"tags":["Instruct","Audio"],"input_modalities":["text","audio"],"output_modalities":["text"],"supported_features":["json_mode","tools"],"model_series":["voxtral-small"],"providers_details":{"mistral":{"pricing":{"currency":"EUR","input_token":0.1,"output_token":0.3,"audio_cost":6.7e-05,"cache_read_cost":0.01},"quantization":null,"context_size":32000,"max_output_tokens":32000,"supported_features":["json_mode","tools"],"metrics":{"throughput":100.39,"latency":1.65,"ttft":0.23,"cache_hit_rate":0.07,"uptime":1.0}}}},{"id":"qwen3-vl-235b-a22b","object":"model","created":1768304282,"owned_by":"Alibaba Cloud","description":"Qwen3 VL 235B A22B is a 235B-parameter MoE vision-language flagship model (≈22B active) designed for frontier-level multimodal understanding across text, images, documents, and long videos.","pricing":{"currency":"EUR","input_token":0.554,"output_token":2.8},"providers":["amazon_ireland"],"context_size":256000,"max_output_tokens":256000,"tags":["Instruct","Reasoning","Tools","Image"],"input_modalities":["text","image"],"output_modalities":["text"],"supported_features":["json_mode","reasoning","tools"],"model_series":["qwen-3-vl-235b"],"providers_details":{"amazon_ireland":{"pricing":{"currency":"EUR","input_token":0.554,"output_token":2.8},"quantization":null,"context_size":256000,"max_output_tokens":256000,"supported_features":["json_mode","reasoning","tools"],"metrics":{"throughput":28.49,"latency":3.99,"ttft":1.24,"cache_hit_rate":null,"uptime":1.0}}}},{"id":"nvidia-nemotron-3-nano-30b-a3b","object":"model","created":1768217882,"owned_by":"Nvidia","description":"Nemotron-Nano-3-30B-A3B is a compact Mixture-of-Experts model optimized for efficient reasoning, chat, and coding, with strong multilingual support and long-context RAG and agent workflows.","pricing":{"currency":"EUR","input_token":0.054,"output_token":0.215},"providers":["nebius","amazon_ireland"],"context_size":256000,"max_output_tokens":256000,"tags":["Instruct","Tools","Reasoning"],"input_modalities":["text"],"output_modalities":["text"],"supported_features":["json_mode","reasoning","tools"],"model_series":["nemotron-3-nano"],"providers_details":{"nebius":{"pricing":{"currency":"EUR","input_token":0.054,"output_token":0.215},"quantization":"fp8","context_size":128000,"max_output_tokens":128000,"supported_features":["json_mode","reasoning","tools"],"metrics":{"throughput":209.32,"latency":8.04,"ttft":0.37,"cache_hit_rate":0.52,"uptime":1.0}},"amazon_ireland":{"pricing":{"currency":"EUR","input_token":0.063,"output_token":0.25},"quantization":null,"context_size":256000,"max_output_tokens":256000,"supported_features":["json_mode","reasoning","tools"],"metrics":{"throughput":276.89,"latency":2.22,"ttft":0.44,"cache_hit_rate":null,"uptime":1.0}}}},{"id":"claude-opus4-5","object":"model","created":1767625200,"owned_by":"Anthropic","description":"Claude Opus 4.5 is Anthropic’s next-generation, most intelligent model, delivering industry-leading performance across coding, agents, computer use, and complex enterprise workflows.","pricing":{"currency":"EUR","input_token":4.769,"output_token":23.849,"cache_read_cost":0.477,"cache_write_cost":5.965},"providers":["amazon_ireland","amazon_paris","google"],"context_size":200000,"max_output_tokens":64000,"tags":["Instruct","Tools","Image","Code","Reasoning","Document"],"input_modalities":["text","image","file"],"output_modalities":["text"],"supported_features":["json_mode","reasoning","tools"],"model_series":["claude-opus-4"],"providers_details":{"amazon_ireland":{"pricing":{"currency":"EUR","input_token":4.919,"output_token":24.596,"cache_read_cost":0.488,"cache_write_cost":6.101},"quantization":null,"context_size":200000,"max_output_tokens":64000,"supported_features":["json_mode","reasoning","tools"],"metrics":{"throughput":103.17,"latency":12.97,"ttft":1.23,"cache_hit_rate":null,"uptime":1.0}},"amazon_paris":{"pricing":{"currency":"EUR","input_token":4.919,"output_token":24.596,"cache_read_cost":0.488,"cache_write_cost":6.101},"quantization":null,"context_size":200000,"max_output_tokens":64000,"supported_features":["json_mode","reasoning","tools"],"metrics":{"throughput":119.42,"latency":12.25,"ttft":1.31,"cache_hit_rate":null,"uptime":1.0}},"google":{"pricing":{"currency":"EUR","input_token":4.769,"output_token":23.849,"cache_read_cost":0.477,"cache_write_cost":5.965},"quantization":null,"context_size":200000,"max_output_tokens":64000,"supported_features":["json_mode","reasoning","tools"],"metrics":{"throughput":86.49,"latency":12.0,"ttft":1.6,"cache_hit_rate":null,"uptime":1.0}}}},{"id":"qwen3-next-80b-a3b-thinking","object":"model","created":1765370282,"owned_by":"Alibaba Cloud","description":"Qwen3-Next-80B-A3B-Thinking is an 80B-parameter thinking-oriented model combining Hybrid Attention, high-sparsity MoE, and multi-token prediction to deliver exceptional performance on complex reasoning tasks, surpassing both open-source and proprietary alternatives.","pricing":{"currency":"EUR","input_token":0.134,"output_token":1.073},"providers":["nebius"],"context_size":128000,"max_output_tokens":128000,"tags":["Instruct","Reasoning","Tools","Code"],"input_modalities":["text"],"output_modalities":["text"],"supported_features":["json_mode","reasoning","tools"],"model_series":["qwen-3-80b"],"providers_details":{"nebius":{"pricing":{"currency":"EUR","input_token":0.134,"output_token":1.073},"quantization":"fp8","context_size":128000,"max_output_tokens":128000,"supported_features":["json_mode","reasoning","tools"],"metrics":{"throughput":100.7,"latency":16.44,"ttft":0.45,"cache_hit_rate":0.78,"uptime":1.0}}}},{"id":"devstral-2512","object":"model","created":1765356793,"owned_by":"Mistral AI","description":"Devstral 2 2512 is an enterprise-grade text model designed for advanced coding agents and software engineering workflows.","pricing":{"currency":"EUR","input_token":0.4,"output_token":2.0,"cache_read_cost":0.04},"providers":["mistral","amazon_ireland"],"context_size":262000,"max_output_tokens":262000,"tags":["Instruct","Code","Tools"],"input_modalities":["text"],"output_modalities":["text"],"supported_features":["json_mode","tools"],"model_series":["devstral"],"providers_details":{"mistral":{"pricing":{"currency":"EUR","input_token":0.4,"output_token":2.0,"cache_read_cost":0.04},"quantization":null,"context_size":262000,"max_output_tokens":262000,"supported_features":["json_mode","tools"],"metrics":{"throughput":49.32,"latency":15.45,"ttft":6.26,"cache_hit_rate":0.25,"uptime":1.0}},"amazon_ireland":{"pricing":{"currency":"EUR","input_token":0.429,"output_token":2.147},"quantization":null,"context_size":256000,"max_output_tokens":256000,"supported_features":["json_mode","tools"],"metrics":{"throughput":92.41,"latency":7.55,"ttft":3.66,"cache_hit_rate":null,"uptime":1.0}}}},{"id":"nova-2-lite","object":"model","created":1764848282,"owned_by":"Amazon","description":"Nova 2 Lite is an advanced multimodal reasoning model that combines efficiency and performance, delivering reliable AI for agentic workflows and enterprise applications.","pricing":{"currency":"EUR","input_token":0.335,"output_token":2.822},"providers":["amazon_ireland","amazon_paris"],"context_size":1000000,"max_output_tokens":65535,"tags":["Instruct","Tools","Image","Reasoning","Document"],"input_modalities":["text","image","file"],"output_modalities":["text"],"supported_features":["json_mode","reasoning","tools"],"model_series":["nova-2-lite"],"providers_details":{"amazon_ireland":{"pricing":{"currency":"EUR","input_token":0.335,"output_token":2.822},"quantization":null,"context_size":1000000,"max_output_tokens":65535,"supported_features":["json_mode","reasoning","tools"],"metrics":{"throughput":159.75,"latency":3.04,"ttft":0.44,"cache_hit_rate":null,"uptime":1.0}},"amazon_paris":{"pricing":{"currency":"EUR","input_token":0.433,"output_token":3.63},"quantization":null,"context_size":1000000,"max_output_tokens":65535,"supported_features":["json_mode","reasoning","tools"],"metrics":{"throughput":201.79,"latency":3.84,"ttft":0.44,"cache_hit_rate":null,"uptime":1.0}}}},{"id":"gpt-oss-safeguard-120b","object":"model","created":1764848282,"owned_by":"OpenAI","description":"GPT OSS Safeguard 120B is a 120B-parameter open-weight safety reasoning model designed for high-accuracy enterprise moderation and policy enforcement.","pricing":{"currency":"EUR","input_token":0.161,"output_token":0.626},"providers":["amazon_ireland"],"context_size":128000,"max_output_tokens":128000,"tags":["Instruct","Reasoning","Tools","Safety-guard"],"input_modalities":["text"],"output_modalities":["text"],"supported_features":["json_mode","reasoning","tools"],"model_series":["gpt-oss-safeguard"],"providers_details":{"amazon_ireland":{"pricing":{"currency":"EUR","input_token":0.161,"output_token":0.626},"quantization":null,"context_size":128000,"max_output_tokens":128000,"supported_features":["json_mode","reasoning","tools"],"metrics":{"throughput":158.69,"latency":0.92,"ttft":0.4,"cache_hit_rate":null,"uptime":1.0}}}},{"id":"mistral-large-2512","object":"model","created":1764762602,"owned_by":"Mistral AI","description":"Mistral Large 3 is a state-of-the-art open-weight multimodal Mixture-of-Experts model with 41B active parameters, delivering frontier-level performance across text and vision tasks.","pricing":{"currency":"EUR","input_token":0.5,"output_token":1.5,"cache_read_cost":0.05},"providers":["mistral"],"context_size":256000,"max_output_tokens":256000,"tags":["Instruct","Code","Tools","Image"],"input_modalities":["text","image"],"output_modalities":["text"],"supported_features":["json_mode","tools"],"model_series":["mistral-large"],"providers_details":{"mistral":{"pricing":{"currency":"EUR","input_token":0.5,"output_token":1.5,"cache_read_cost":0.05},"quantization":null,"context_size":256000,"max_output_tokens":256000,"supported_features":["json_mode","tools"],"metrics":{"throughput":30.35,"latency":15.69,"ttft":5.69,"cache_hit_rate":0.05,"uptime":0.99}}}},{"id":"ministral-8b-2512","object":"model","created":1764762542,"owned_by":"Mistral AI","description":"Ministral 3 8B is a balanced, efficient multimodal model offering strong text and vision capabilities, optimized for edge and local deployment.","pricing":{"currency":"EUR","input_token":0.15,"output_token":0.15,"cache_read_cost":0.015},"providers":["mistral","amazon_ireland"],"context_size":256000,"max_output_tokens":256000,"tags":["Instruct","Code","Tools","Image"],"input_modalities":["text","image"],"output_modalities":["text"],"supported_features":["json_mode","tools"],"model_series":["ministral-8b"],"providers_details":{"mistral":{"pricing":{"currency":"EUR","input_token":0.15,"output_token":0.15,"cache_read_cost":0.015},"quantization":null,"context_size":256000,"max_output_tokens":256000,"supported_features":["json_mode","tools"],"metrics":{"throughput":110.93,"latency":1.11,"ttft":0.46,"cache_hit_rate":0.18,"uptime":1.0}},"amazon_ireland":{"pricing":{"currency":"EUR","input_token":0.161,"output_token":0.161},"quantization":null,"context_size":256000,"max_output_tokens":131072,"supported_features":["json_mode","tools"],"metrics":{"throughput":168.05,"latency":3.64,"ttft":0.38,"cache_hit_rate":null,"uptime":1.0}}}},{"id":"ministral-3b-2512","object":"model","created":1764762482,"owned_by":"Mistral AI","description":"Ministral 3 3B is a compact, efficient multimodal model with strong language, vision capabilities, and ideal for custom fine-tuning.","pricing":{"currency":"EUR","input_token":0.1,"output_token":0.1,"cache_read_cost":0.01},"providers":["mistral"],"context_size":256000,"max_output_tokens":256000,"tags":["Instruct","Code","Tools","Image"],"input_modalities":["text","image"],"output_modalities":["text"],"supported_features":["json_mode","tools"],"model_series":["ministral-3b"],"providers_details":{"mistral":{"pricing":{"currency":"EUR","input_token":0.1,"output_token":0.1,"cache_read_cost":0.01},"quantization":null,"context_size":256000,"max_output_tokens":256000,"supported_features":["json_mode","tools"],"metrics":{"throughput":210.28,"latency":1.73,"ttft":0.3,"cache_hit_rate":0.11,"uptime":1.0}}}},{"id":"ministral-14b-2512","object":"model","created":1764761882,"owned_by":"Mistral AI","description":"Ministral 3 14B is a frontier-level 14B multimodal model optimized for local deployment, delivering state-of-the-art text and vision reasoning with a 256K context window and strong agentic capabilities.","pricing":{"currency":"EUR","input_token":0.2,"output_token":0.2,"cache_read_cost":0.02},"providers":["mistral","amazon_ireland"],"context_size":256000,"max_output_tokens":256000,"tags":["Instruct","Code","Tools","Image"],"input_modalities":["text","image"],"output_modalities":["text"],"supported_features":["json_mode","tools"],"model_series":["ministral-14b"],"providers_details":{"mistral":{"pricing":{"currency":"EUR","input_token":0.2,"output_token":0.2,"cache_read_cost":0.02},"quantization":null,"context_size":256000,"max_output_tokens":256000,"supported_features":["json_mode","tools"],"metrics":{"throughput":92.15,"latency":6.6,"ttft":0.25,"cache_hit_rate":0.18,"uptime":1.0}},"amazon_ireland":{"pricing":{"currency":"EUR","input_token":0.215,"output_token":0.215},"quantization":null,"context_size":256000,"max_output_tokens":131072,"supported_features":["json_mode","tools"],"metrics":{"throughput":290.29,"latency":5.03,"ttft":0.45,"cache_hit_rate":null,"uptime":1.0}}}},{"id":"gpt-5.1","object":"model","created":1763168400,"owned_by":"OpenAI","description":"GPT-5.1 is an enhanced version of GPT-5, offering clearer responses, adaptive reasoning, improved consistency, expanded context capacity, and better customization for complex and interactive tasks.","pricing":{"currency":"EUR","input_token":1.234,"output_token":9.838,"cache_read_cost":0.14},"providers":["azure_sc"],"context_size":400000,"max_output_tokens":128000,"tags":["Instruct","Reasoning","Tools","Image","Document"],"input_modalities":["text","image","file"],"output_modalities":["text"],"supported_features":["reasoning","tools"],"model_series":["gpt-5"],"providers_details":{"azure_sc":{"pricing":{"currency":"EUR","input_token":1.234,"output_token":9.838,"cache_read_cost":0.14},"quantization":null,"context_size":400000,"max_output_tokens":128000,"supported_features":["reasoning","tools"],"metrics":{"throughput":99.66,"latency":5.57,"ttft":1.15,"cache_hit_rate":0.6,"uptime":1.0}}}},{"id":"nemotron-nano-v2-12b","object":"model","created":1761910682,"owned_by":"Nvidia","description":"NVIDIA Nemotron Nano v2 12B is a 12-billion-parameter multimodal reasoning model designed for advanced video understanding, document intelligence, and visual reasoning, built with a hybrid Transformer-Mamba architecture for high efficiency and low latency.","pricing":{"currency":"EUR","input_token":0.215,"output_token":0.635},"providers":["amazon_ireland"],"context_size":128000,"max_output_tokens":128000,"tags":["Instruct","Tools","Reasoning","Image"],"input_modalities":["text","image"],"output_modalities":["text"],"supported_features":["json_mode","reasoning","tools"],"model_series":["nemotron-2-nano"],"providers_details":{"amazon_ireland":{"pricing":{"currency":"EUR","input_token":0.215,"output_token":0.635},"quantization":"bf16","context_size":128000,"max_output_tokens":128000,"supported_features":["json_mode","reasoning","tools"],"metrics":{"throughput":222.55,"latency":2.67,"ttft":0.42,"cache_hit_rate":null,"uptime":1.0}}}},{"id":"claude-haiku-4-5","object":"model","created":1760547600,"owned_by":"Anthropic","description":"Claude Haiku 4.5 delivers near-frontier performance for coding and agent tasks, optimized for speed and cost to support high-volume and free-tier applications.","pricing":{"currency":"EUR","input_token":0.894,"output_token":4.472,"cache_read_cost":0.089,"cache_write_cost":1.065},"providers":["amazon_ireland","amazon_paris","google"],"context_size":200000,"max_output_tokens":64000,"tags":["Instruct","Tools","Image","Code","Reasoning","Document"],"input_modalities":["text","image","file"],"output_modalities":["text"],"supported_features":["json_mode","reasoning","tools"],"model_series":["claude-haiku-4"],"providers_details":{"amazon_ireland":{"pricing":{"currency":"EUR","input_token":0.894,"output_token":4.472,"cache_read_cost":0.089,"cache_write_cost":1.065},"quantization":null,"context_size":200000,"max_output_tokens":64000,"supported_features":["json_mode","reasoning","tools"],"metrics":{"throughput":142.65,"latency":2.5,"ttft":1.02,"cache_hit_rate":0.94,"uptime":1.0}},"amazon_paris":{"pricing":{"currency":"EUR","input_token":0.894,"output_token":4.472,"cache_read_cost":0.089,"cache_write_cost":1.065},"quantization":null,"context_size":200000,"max_output_tokens":64000,"supported_features":["json_mode","reasoning","tools"],"metrics":{"throughput":87.13,"latency":3.47,"ttft":1.12,"cache_hit_rate":0.55,"uptime":1.0}},"google":{"pricing":{"currency":"EUR","input_token":0.954,"output_token":4.769,"cache_read_cost":0.095,"cache_write_cost":1.196},"quantization":null,"context_size":200000,"max_output_tokens":64000,"supported_features":["json_mode","reasoning","tools"],"metrics":{"throughput":86.08,"latency":5.26,"ttft":1.07,"cache_hit_rate":null,"uptime":1.0}}}},{"id":"claude-4-5-sonnet","object":"model","created":1759145882,"owned_by":"Anthropic","description":"Claude Sonnet 4.5 is Anthropic’s most capable model for real-world agents, excelling in coding, computer use, and long-horizon tasks.","pricing":{"currency":"EUR","input_token":2.683,"output_token":13.416,"cache_read_cost":0.293,"cache_write_cost":3.661},"providers":["amazon_ireland","amazon_paris","google"],"context_size":200000,"max_output_tokens":64000,"tags":["Instruct","Tools","Image","Code","Reasoning","Document"],"input_modalities":["text","image","file"],"output_modalities":["text"],"supported_features":["json_mode","reasoning","tools"],"model_series":["claude-sonnet-4"],"providers_details":{"amazon_ireland":{"pricing":{"currency":"EUR","input_token":2.683,"output_token":13.416,"cache_read_cost":0.293,"cache_write_cost":3.661},"quantization":null,"context_size":200000,"max_output_tokens":64000,"supported_features":["json_mode","reasoning","tools"],"metrics":{"throughput":64.97,"latency":9.48,"ttft":2.32,"cache_hit_rate":0.03,"uptime":1.0}},"amazon_paris":{"pricing":{"currency":"EUR","input_token":2.683,"output_token":13.416,"cache_read_cost":0.293,"cache_write_cost":3.661},"quantization":null,"context_size":200000,"max_output_tokens":64000,"supported_features":["json_mode","reasoning","tools"],"metrics":{"throughput":89.31,"latency":13.29,"ttft":1.62,"cache_hit_rate":null,"uptime":1.0}},"google":{"pricing":{"currency":"EUR","input_token":2.863,"output_token":14.309,"cache_read_cost":0.286,"cache_write_cost":3.583},"quantization":null,"context_size":200000,"max_output_tokens":64000,"supported_features":["json_mode","reasoning","tools"],"metrics":{"throughput":98.82,"latency":15.9,"ttft":1.23,"cache_hit_rate":null,"uptime":1.0}}}},{"id":"hermes-4-70b","object":"model","created":1755085082,"owned_by":"NousResearch","description":"Hermes 4 70B is a hybrid-mode reasoning model built on Llama 3.1, designed for advanced logic, coding, math, and structured outputs with improved steerability.","pricing":{"currency":"EUR","input_token":0.116,"output_token":0.358},"providers":["nebius"],"context_size":128000,"max_output_tokens":128000,"tags":["Instruct","Tools"],"input_modalities":["text"],"output_modalities":["text"],"supported_features":["json_mode","tools"],"model_series":["hermes-4-70b"],"providers_details":{"nebius":{"pricing":{"currency":"EUR","input_token":0.116,"output_token":0.358},"quantization":"fp8","context_size":128000,"max_output_tokens":128000,"supported_features":["json_mode","tools"],"metrics":{"throughput":89.84,"latency":3.56,"ttft":0.37,"cache_hit_rate":0.02,"uptime":1.0}}}},{"id":"gpt-5","object":"model","created":1754528400,"owned_by":"OpenAI","description":"GPT-5 is OpenAI’s most advanced model, built for deep reasoning, high-quality code generation, and complex multi-step tasks.","pricing":{"currency":"EUR","input_token":1.234,"output_token":9.838,"cache_read_cost":0.14},"providers":["azure_sc"],"context_size":400000,"max_output_tokens":128000,"tags":["Instruct","Reasoning","Tools","Image"],"input_modalities":["text","image"],"output_modalities":["text"],"supported_features":["reasoning","tools"],"model_series":["gpt-5"],"providers_details":{"azure_sc":{"pricing":{"currency":"EUR","input_token":1.234,"output_token":9.838,"cache_read_cost":0.14},"quantization":null,"context_size":400000,"max_output_tokens":128000,"supported_features":["reasoning","tools"],"metrics":{"throughput":560.43,"latency":17.47,"ttft":13.27,"cache_hit_rate":null,"uptime":1.0}}}},{"id":"gpt-oss-120b","object":"model","created":1754393882,"owned_by":"OpenAI","description":"GPT Oss 120b is a 120B parameter Mixture-of-Experts model by OpenAI, built for advanced reasoning, agentic tasks, and flexible developer use under Apache 2.0.","pricing":{"currency":"EUR","input_token":0.08,"output_token":0.4},"providers":["scaleway","nebius","ionos","ovh","amazon_ireland","infercom","aki","berget"],"context_size":131000,"max_output_tokens":131000,"tags":["Instruct","Reasoning","Tools"],"input_modalities":["text"],"output_modalities":["text"],"supported_features":["json_mode","reasoning","tools"],"model_series":["gpt-oss-120b"],"providers_details":{"scaleway":{"pricing":{"currency":"EUR","input_token":0.15,"output_token":0.6},"quantization":null,"context_size":128000,"max_output_tokens":8192,"supported_features":["json_mode","reasoning","tools"],"metrics":{"throughput":186.65,"latency":1.88,"ttft":0.59,"cache_hit_rate":null,"uptime":1.0}},"nebius":{"pricing":{"currency":"EUR","input_token":0.134,"output_token":0.537},"quantization":"fp4","context_size":131000,"max_output_tokens":131000,"supported_features":["json_mode","reasoning","tools"],"metrics":{"throughput":276.8,"latency":5.45,"ttft":0.77,"cache_hit_rate":0.37,"uptime":0.97}},"ionos":{"pricing":{"currency":"EUR","input_token":0.15,"output_token":0.65},"quantization":"fp8","context_size":128000,"max_output_tokens":128000,"supported_features":["json_mode","reasoning","tools"],"metrics":{"throughput":227.4,"latency":3.01,"ttft":0.59,"cache_hit_rate":null,"uptime":1.0}},"ovh":{"pricing":{"currency":"EUR","input_token":0.08,"output_token":0.4},"quantization":"fp4","context_size":131000,"max_output_tokens":131000,"supported_features":["json_mode","reasoning","tools"],"metrics":{"throughput":105.12,"latency":28.57,"ttft":1.42,"cache_hit_rate":null,"uptime":1.0}},"amazon_ireland":{"pricing":{"currency":"EUR","input_token":0.161,"output_token":0.626},"quantization":null,"context_size":128000,"max_output_tokens":128000,"supported_features":["json_mode","reasoning","tools"],"metrics":{"throughput":271.16,"latency":4.35,"ttft":0.7,"cache_hit_rate":null,"uptime":1.0}},"infercom":{"pricing":{"currency":"EUR","input_token":0.22,"output_token":0.59},"quantization":null,"context_size":128000,"max_output_tokens":128000,"supported_features":["json_mode","reasoning","tools"],"metrics":{"throughput":559.05,"latency":1.21,"ttft":1.14,"cache_hit_rate":null,"uptime":1.0}},"aki":{"pricing":{"currency":"EUR","input_token":0.15,"output_token":0.55},"quantization":"fp4","context_size":128000,"max_output_tokens":32768,"supported_features":["json_mode","reasoning","tools"],"metrics":{"throughput":211.0,"latency":2.09,"ttft":0.44,"cache_hit_rate":0.36,"uptime":0.93}},"berget":{"pricing":{"currency":"EUR","input_token":0.2,"output_token":0.75},"quantization":"int4","context_size":128000,"max_output_tokens":128000,"supported_features":["json_mode","reasoning","tools"],"metrics":{"throughput":142.78,"latency":4.94,"ttft":0.48,"cache_hit_rate":null,"uptime":0.86}}}},{"id":"qwen3-30b-a3b-instruct-2507","object":"model","created":1753702682,"owned_by":"Alibaba Cloud","description":"Qwen3-30B-A3B-Instruct-2507 is an advanced Mixture-of-Experts model optimized for reasoning, coding, and multilingual instruction following.","pricing":{"currency":"EUR","input_token":0.089,"output_token":0.268},"providers":["nebius"],"context_size":262000,"max_output_tokens":262000,"tags":["Instruct","Tools","Reasoning"],"input_modalities":["text"],"output_modalities":["text"],"supported_features":["json_mode","reasoning","tools"],"model_series":["qwen-3-30b"],"providers_details":{"nebius":{"pricing":{"currency":"EUR","input_token":0.089,"output_token":0.268},"quantization":"fp8","context_size":262000,"max_output_tokens":262000,"supported_features":["json_mode","reasoning","tools"],"metrics":{"throughput":57.57,"latency":7.57,"ttft":10.21,"cache_hit_rate":0.66,"uptime":1.0}}}},{"id":"gpt-oss-20b","object":"model","created":1752838682,"owned_by":"OpenAI","description":"GPT Oss 20B is an open-weight Mixture-of-Experts model from OpenAI, optimized for low-latency inference and local deployment.","pricing":{"currency":"EUR","input_token":0.04,"output_token":0.15},"providers":["ovh","amazon_ireland"],"context_size":131000,"max_output_tokens":131000,"tags":["Instruct","Reasoning","Tools"],"input_modalities":["text"],"output_modalities":["text"],"supported_features":["json_mode","reasoning","tools"],"model_series":["gpt-oss-20b"],"providers_details":{"ovh":{"pricing":{"currency":"EUR","input_token":0.04,"output_token":0.15},"quantization":"fp4","context_size":131000,"max_output_tokens":131000,"supported_features":["json_mode","reasoning","tools"],"metrics":{"throughput":90.52,"latency":11.91,"ttft":0.17,"cache_hit_rate":null,"uptime":1.0}},"amazon_ireland":{"pricing":{"currency":"EUR","input_token":0.072,"output_token":0.313},"quantization":null,"context_size":128000,"max_output_tokens":128000,"supported_features":["json_mode","reasoning","tools"],"metrics":{"throughput":227.0,"latency":6.09,"ttft":0.44,"cache_hit_rate":null,"uptime":1.0}}}},{"id":"mistral-7b-instruct-v0.3","object":"model","created":1748252162,"owned_by":"Mistral AI","description":"Mistral-7B-Instruct-v0.3 model is a fine-tuned version of the Mistral 7B base model, optimized for instruction-following tasks. Released in 2023, it is intended for demonstration purposes and does not include built-in guardrails or moderation features.","pricing":{"currency":"EUR","input_token":0.1,"output_token":0.1},"providers":["ovh"],"context_size":127000,"max_output_tokens":127000,"tags":["Instruct","Tools"],"input_modalities":["text"],"output_modalities":["text"],"supported_features":["json_mode","tools"],"model_series":["mistral-7b"],"providers_details":{"ovh":{"pricing":{"currency":"EUR","input_token":0.1,"output_token":0.1},"quantization":null,"context_size":127000,"max_output_tokens":127000,"supported_features":["json_mode","tools"],"metrics":{"throughput":42.49,"latency":7.8,"ttft":0.26,"cache_hit_rate":null,"uptime":1.0}}}},{"id":"mistral-7b-instruct-v0.2","object":"model","created":1748252162,"owned_by":"Mistral AI","description":"Mistral 7B Instruct is a compact, 7B parameter model optimized for fast and efficient text and code generation with a 32K token context window.","pricing":{"currency":"EUR","input_token":0.143,"output_token":0.197},"providers":["amazon_ireland","amazon_paris"],"context_size":32000,"max_output_tokens":8192,"tags":["Instruct","Document"],"input_modalities":["text","file"],"output_modalities":["text"],"supported_features":[],"model_series":["mistral-7b"],"providers_details":{"amazon_ireland":{"pricing":{"currency":"EUR","input_token":0.143,"output_token":0.197},"quantization":null,"context_size":32000,"max_output_tokens":8192,"supported_features":[],"metrics":{"throughput":130.59,"latency":2.23,"ttft":0.15,"cache_hit_rate":null,"uptime":1.0}},"amazon_paris":{"pricing":{"currency":"EUR","input_token":0.179,"output_token":0.233},"quantization":null,"context_size":32000,"max_output_tokens":8192,"supported_features":[],"metrics":{"throughput":133.79,"latency":2.41,"ttft":0.16,"cache_hit_rate":null,"uptime":1.0}}}},{"id":"mistral-small-3.2-24b-instruct-2506","object":"model","created":1748252162,"owned_by":"Mistral AI","description":"Mistral-Small-3.2-24B-Instruct-2506 is a 24B parameter instruction-tuned model with enhanced long-context support (128k) and state-of-the-art vision understanding.","pricing":{"currency":"EUR","input_token":0.09,"output_token":0.28},"providers":["ovh","scaleway","berget"],"context_size":131000,"max_output_tokens":131000,"tags":["Instruct","Tools","Image"],"input_modalities":["text","image"],"output_modalities":["text"],"supported_features":["json_mode","tools"],"model_series":["mistral-small"],"providers_details":{"ovh":{"pricing":{"currency":"EUR","input_token":0.09,"output_token":0.28},"quantization":"fp8","context_size":128000,"max_output_tokens":128000,"supported_features":["json_mode","tools"],"metrics":{"throughput":48.41,"latency":3.04,"ttft":0.28,"cache_hit_rate":null,"uptime":1.0}},"scaleway":{"pricing":{"currency":"EUR","input_token":0.15,"output_token":0.35},"quantization":null,"context_size":128000,"max_output_tokens":8192,"supported_features":["json_mode","tools"],"metrics":{"throughput":189.11,"latency":1.49,"ttft":0.2,"cache_hit_rate":null,"uptime":1.0}},"berget":{"pricing":{"currency":"EUR","input_token":0.3,"output_token":0.3},"quantization":"bf16","context_size":131000,"max_output_tokens":131000,"supported_features":["json_mode","tools"],"metrics":{"throughput":79.2,"latency":4.48,"ttft":0.23,"cache_hit_rate":null,"uptime":1.0}}}},{"id":"mistral-large-2402","object":"model","created":1748252162,"owned_by":"Mistral AI","description":"Mistral Large (24.02) is Mistral AI’s most advanced language model, built for complex multilingual reasoning, code generation, and deep text understanding.","pricing":{"currency":"EUR","input_token":3.846,"output_token":11.627},"providers":["amazon_ireland","amazon_paris"],"context_size":32000,"max_output_tokens":8192,"tags":["Instruct","Tools","Reasoning","Document"],"input_modalities":["text","file"],"output_modalities":["text"],"supported_features":["json_mode","reasoning","tools"],"model_series":["mistral-large"],"providers_details":{"amazon_ireland":{"pricing":{"currency":"EUR","input_token":3.846,"output_token":11.627},"quantization":null,"context_size":32000,"max_output_tokens":8192,"supported_features":["json_mode","reasoning","tools"],"metrics":{"throughput":48.81,"latency":3.68,"ttft":0.25,"cache_hit_rate":null,"uptime":1.0}},"amazon_paris":{"pricing":{"currency":"EUR","input_token":4.648,"output_token":13.951},"quantization":null,"context_size":32000,"max_output_tokens":8192,"supported_features":["json_mode","reasoning","tools"],"metrics":{"throughput":49.21,"latency":7.89,"ttft":0.21,"cache_hit_rate":null,"uptime":1.0}}}},{"id":"pixtral-large-2502","object":"model","created":1748252162,"owned_by":"Mistral AI","description":"Pixtral Large (25.02) is a 124B open-weight multimodal model built on Mistral Large 2, offering advanced image understanding and strong performance across text and code tasks.","pricing":{"currency":"EUR","input_token":1.789,"output_token":5.366},"providers":["amazon_ireland","amazon_paris"],"context_size":128000,"max_output_tokens":128000,"tags":["Instruct","Image","Tools","Reasoning","Document"],"input_modalities":["text","image","file"],"output_modalities":["text"],"supported_features":["json_mode","reasoning","tools"],"model_series":["pixtral-large"],"providers_details":{"amazon_ireland":{"pricing":{"currency":"EUR","input_token":1.789,"output_token":5.366},"quantization":null,"context_size":128000,"max_output_tokens":128000,"supported_features":["json_mode","reasoning","tools"],"metrics":{"throughput":88.3,"latency":7.15,"ttft":0.32,"cache_hit_rate":null,"uptime":1.0}},"amazon_paris":{"pricing":{"currency":"EUR","input_token":1.789,"output_token":5.366},"quantization":null,"context_size":128000,"max_output_tokens":128000,"supported_features":["json_mode","reasoning","tools"],"metrics":{"throughput":91.14,"latency":5.98,"ttft":0.36,"cache_hit_rate":null,"uptime":1.0}}}},{"id":"qwen3-235b-a22b-instruct-2507","object":"model","created":1745840282,"owned_by":"Alibaba Cloud","description":"Qwen3-235B-A22B-Instruct-2507 is a large non-thinking mode model with major improvements in reasoning, instruction following, knowledge coverage, and long-context understanding up to 256K tokens.","pricing":{"currency":"EUR","input_token":0.062,"output_token":0.408,"cache_read_cost":0.016},"providers":["scaleway","nebius","tensorix"],"context_size":262000,"max_output_tokens":262000,"tags":["Instruct","Tools","Reasoning"],"input_modalities":["text"],"output_modalities":["text"],"supported_features":["json_mode","reasoning","tools"],"model_series":["qwen-3-235b"],"providers_details":{"scaleway":{"pricing":{"currency":"EUR","input_token":0.75,"output_token":2.25},"quantization":null,"context_size":250000,"max_output_tokens":8192,"supported_features":["json_mode","reasoning","tools"],"metrics":{"throughput":124.1,"latency":3.91,"ttft":0.28,"cache_hit_rate":null,"uptime":1.0}},"nebius":{"pricing":{"currency":"EUR","input_token":0.179,"output_token":0.537},"quantization":"fp4","context_size":262000,"max_output_tokens":262000,"supported_features":["json_mode","reasoning","tools"],"metrics":{"throughput":75.34,"latency":3.99,"ttft":19.79,"cache_hit_rate":0.39,"uptime":1.0}},"tensorix":{"pricing":{"currency":"EUR","input_token":0.062,"output_token":0.408,"cache_read_cost":0.016},"quantization":"fp8","context_size":131000,"max_output_tokens":131000,"supported_features":["json_mode","reasoning","tools"],"metrics":{"throughput":23.61,"latency":5.83,"ttft":1.69,"cache_hit_rate":0.13,"uptime":1.0}}}},{"id":"qwen3-coder-30b-a3b-instruct","object":"model","created":1745840282,"owned_by":"Alibaba Cloud","description":"Qwen3 Coder 30b a3b Instruct is a 30.5B parameter open-source Mixture-of-Experts model specialized for coding, tool use, and complex multi-step programming workflows.","pricing":{"currency":"EUR","input_token":0.06,"output_token":0.22},"providers":["scaleway","amazon_ireland","ovh"],"context_size":262144,"max_output_tokens":262144,"tags":["Instruct","Code","Tools","Reasoning"],"input_modalities":["text"],"output_modalities":["text"],"supported_features":["json_mode","reasoning","tools"],"model_series":["qwen-3-coder-30b"],"providers_details":{"scaleway":{"pricing":{"currency":"EUR","input_token":0.2,"output_token":0.8},"quantization":null,"context_size":128000,"max_output_tokens":32000,"supported_features":["json_mode","reasoning","tools"],"metrics":{"throughput":186.26,"latency":2.07,"ttft":0.82,"cache_hit_rate":null,"uptime":1.0}},"amazon_ireland":{"pricing":{"currency":"EUR","input_token":0.161,"output_token":0.626},"quantization":null,"context_size":262144,"max_output_tokens":262144,"supported_features":["json_mode","reasoning","tools"],"metrics":{"throughput":170.55,"latency":21.3,"ttft":17.53,"cache_hit_rate":null,"uptime":1.0}},"ovh":{"pricing":{"currency":"EUR","input_token":0.06,"output_token":0.22},"quantization":"fp8","context_size":32000,"max_output_tokens":32000,"supported_features":["json_mode","reasoning","tools"],"metrics":{"throughput":112.78,"latency":4.25,"ttft":0.4,"cache_hit_rate":null,"uptime":1.0}}}},{"id":"qwen3-32b","object":"model","created":1745840282,"owned_by":"Alibaba Cloud","description":"Qwen3 delivers cutting-edge advancements in reasoning, agent capabilities, and multilingual support, with seamless mode switching for optimized performance across tasks.","pricing":{"currency":"EUR","input_token":0.089,"output_token":0.268},"providers":["nebius","ovh","amazon_ireland"],"context_size":40000,"max_output_tokens":40000,"tags":["Instruct","Reasoning","Tools"],"input_modalities":["text"],"output_modalities":["text"],"supported_features":["json_mode","reasoning","tools"],"model_series":["qwen-3-32b"],"providers_details":{"nebius":{"pricing":{"currency":"EUR","input_token":0.089,"output_token":0.268},"quantization":"fp8","context_size":40000,"max_output_tokens":40000,"supported_features":["json_mode","reasoning","tools"],"metrics":{"throughput":47.72,"latency":19.36,"ttft":0.29,"cache_hit_rate":0.07,"uptime":1.0}},"ovh":{"pricing":{"currency":"EUR","input_token":0.08,"output_token":0.28},"quantization":"fp8","context_size":32000,"max_output_tokens":32000,"supported_features":["json_mode","reasoning","tools"],"metrics":{"throughput":42.01,"latency":17.14,"ttft":0.4,"cache_hit_rate":null,"uptime":1.0}},"amazon_ireland":{"pricing":{"currency":"EUR","input_token":0.161,"output_token":0.626},"quantization":null,"context_size":16384,"max_output_tokens":16384,"supported_features":["json_mode","reasoning","tools"],"metrics":{"throughput":271.34,"latency":1.73,"ttft":0.41,"cache_hit_rate":null,"uptime":1.0}}}},{"id":"nova-lite-v1","object":"model","created":1744630682,"owned_by":"Amazon","description":"Nova Lite is a fast, low-cost multimodal foundation model capable of reasoning over text, images, and video in 200+ languages.","pricing":{"currency":"EUR","input_token":0.062,"output_token":0.247},"providers":["amazon_ireland","amazon_paris"],"context_size":300000,"max_output_tokens":10000,"tags":["Instruct","Tools","Image","Reasoning","Document"],"input_modalities":["text","image","file"],"output_modalities":["text"],"supported_features":["json_mode","reasoning","tools"],"model_series":["nova-1-lite"],"providers_details":{"amazon_ireland":{"pricing":{"currency":"EUR","input_token":0.062,"output_token":0.247},"quantization":null,"context_size":300000,"max_output_tokens":10000,"supported_features":["json_mode","reasoning","tools"],"metrics":{"throughput":281.22,"latency":2.09,"ttft":0.35,"cache_hit_rate":null,"uptime":1.0}},"amazon_paris":{"pricing":{"currency":"EUR","input_token":0.079,"output_token":0.315},"quantization":null,"context_size":300000,"max_output_tokens":10000,"supported_features":["json_mode","reasoning","tools"],"metrics":{"throughput":246.61,"latency":1.89,"ttft":0.33,"cache_hit_rate":null,"uptime":1.0}}}},{"id":"claude-sonnet-4","object":"model","created":1744630682,"owned_by":"Anthropic","description":"Claude Sonnet 4 is a versatile, mid-sized model optimized for coding, real-time AI assistants, and large-scale content tasks with strong cost-performance balance.","pricing":{"currency":"EUR","input_token":2.601,"output_token":13.01,"cache_read_cost":0.26,"cache_write_cost":3.253},"providers":["amazon_ireland","amazon_paris","google"],"context_size":200000,"max_output_tokens":65000,"tags":["Instruct","Tools","Image","Code","Reasoning","Document"],"input_modalities":["text","image","file"],"output_modalities":["text"],"supported_features":["json_mode","reasoning","tools"],"model_series":["claude-sonnet-4"],"providers_details":{"amazon_ireland":{"pricing":{"currency":"EUR","input_token":2.683,"output_token":13.416,"cache_read_cost":0.266,"cache_write_cost":3.328},"quantization":null,"context_size":200000,"max_output_tokens":65000,"supported_features":["json_mode","reasoning","tools"],"metrics":{"throughput":105.81,"latency":9.79,"ttft":1.51,"cache_hit_rate":null,"uptime":1.0}},"amazon_paris":{"pricing":{"currency":"EUR","input_token":2.683,"output_token":13.416,"cache_read_cost":0.266,"cache_write_cost":3.328},"quantization":null,"context_size":200000,"max_output_tokens":65000,"supported_features":["json_mode","reasoning","tools"],"metrics":{"throughput":114.7,"latency":10.66,"ttft":2.17,"cache_hit_rate":null,"uptime":1.0}},"google":{"pricing":{"currency":"EUR","input_token":2.601,"output_token":13.01,"cache_read_cost":0.26,"cache_write_cost":3.253},"quantization":null,"context_size":200000,"max_output_tokens":64000,"supported_features":["json_mode","reasoning","tools"],"metrics":{"throughput":98.43,"latency":10.45,"ttft":0.94,"cache_hit_rate":null,"uptime":1.0}}}},{"id":"gpt-4.1-mini","object":"model","created":1744630682,"owned_by":"OpenAI","description":"gpt-4.1-mini is a cost-effective, low-latency model in the GPT-4.1 series, optimized for coding, instruction following, and multimodal tasks with large-context support.","pricing":{"currency":"EUR","input_token":0.39,"output_token":1.53,"cache_read_cost":0.12},"providers":["azure_sc","azure_spc"],"context_size":1047576,"max_output_tokens":32768,"tags":["Instruct","Tools","Image","Reasoning","Document"],"input_modalities":["text","image","file"],"output_modalities":["text"],"supported_features":["reasoning","tools"],"model_series":["gpt-4-mini"],"providers_details":{"azure_sc":{"pricing":{"currency":"EUR","input_token":0.39,"output_token":1.53,"cache_read_cost":0.12},"quantization":null,"context_size":1047576,"max_output_tokens":32768,"supported_features":["reasoning","tools"],"metrics":{"throughput":53.09,"latency":3.91,"ttft":0.69,"cache_hit_rate":0.3,"uptime":1.0}},"azure_spc":{"pricing":{"currency":"EUR","input_token":0.39,"output_token":1.53,"cache_read_cost":0.12},"quantization":null,"context_size":1047576,"max_output_tokens":32768,"supported_features":["reasoning","tools"],"metrics":{"throughput":90.08,"latency":4.03,"ttft":0.81,"cache_hit_rate":0.46,"uptime":1.0}}}},{"id":"gpt-4.1-nano","object":"model","created":1744630682,"owned_by":"OpenAI","description":"gpt-4.1-nano is an ultra-efficient model in the GPT-4.1 series, offering powerful coding and instruction capabilities with support for text and vision at the lowest cost and latency.","pricing":{"currency":"EUR","input_token":0.1,"output_token":0.39,"cache_read_cost":0.05},"providers":["azure_sc","azure_spc"],"context_size":1047576,"max_output_tokens":32768,"tags":["Instruct","Tools","Image","Reasoning","Document"],"input_modalities":["text","image","file"],"output_modalities":["text"],"supported_features":["reasoning","tools"],"model_series":["gpt-4-nano"],"providers_details":{"azure_sc":{"pricing":{"currency":"EUR","input_token":0.1,"output_token":0.39,"cache_read_cost":0.05},"quantization":null,"context_size":1047576,"max_output_tokens":32768,"supported_features":["reasoning","tools"],"metrics":{"throughput":218.91,"latency":1.38,"ttft":0.43,"cache_hit_rate":0.12,"uptime":1.0}},"azure_spc":{"pricing":{"currency":"EUR","input_token":0.1,"output_token":0.39,"cache_read_cost":0.05},"quantization":null,"context_size":1047576,"max_output_tokens":32768,"supported_features":["reasoning","tools"],"metrics":{"throughput":233.16,"latency":1.61,"ttft":0.52,"cache_hit_rate":0.41,"uptime":1.0}}}},{"id":"nova-micro-v1","object":"model","created":1744630682,"owned_by":"Amazon","description":"Nova Micro is a multilingual text-to-text foundation model with strong reasoning capabilities and broad language coverage across 200+ languages.","pricing":{"currency":"EUR","input_token":0.036,"output_token":0.143},"providers":["amazon_ireland","amazon_paris"],"context_size":128000,"max_output_tokens":10000,"tags":["Instruct","Tools","Image","Reasoning"],"input_modalities":["text","image"],"output_modalities":["text"],"supported_features":["json_mode","reasoning","tools"],"model_series":["nova-1-micro"],"providers_details":{"amazon_ireland":{"pricing":{"currency":"EUR","input_token":0.036,"output_token":0.143},"quantization":null,"context_size":128000,"max_output_tokens":10000,"supported_features":["json_mode","reasoning","tools"],"metrics":{"throughput":206.5,"latency":0.71,"ttft":0.35,"cache_hit_rate":null,"uptime":1.0}},"amazon_paris":{"pricing":{"currency":"EUR","input_token":0.047,"output_token":0.185},"quantization":null,"context_size":128000,"max_output_tokens":10000,"supported_features":["json_mode","reasoning","tools"],"metrics":{"throughput":332.33,"latency":1.31,"ttft":0.42,"cache_hit_rate":null,"uptime":1.0}}}},{"id":"gpt-4.1","object":"model","created":1744630682,"owned_by":"OpenAI","description":"GPT-4.1 is the latest evolution of the GPT-4o model family, offering superior coding, instruction following, and support for up to 1 million input tokens with enhanced multimodal capabilities.","pricing":{"currency":"EUR","input_token":1.968,"output_token":7.872,"cache_read_cost":0.49},"providers":["azure_sc","azure_spc"],"context_size":1047576,"max_output_tokens":32768,"tags":["Instruct","Tools","Image","Reasoning","Document"],"input_modalities":["text","image","file"],"output_modalities":["text"],"supported_features":["reasoning","tools"],"model_series":["gpt-4"],"providers_details":{"azure_sc":{"pricing":{"currency":"EUR","input_token":1.968,"output_token":7.872,"cache_read_cost":0.49},"quantization":null,"context_size":1047576,"max_output_tokens":32768,"supported_features":["reasoning","tools"],"metrics":{"throughput":110.6,"latency":2.68,"ttft":0.44,"cache_hit_rate":0.15,"uptime":1.0}},"azure_spc":{"pricing":{"currency":"EUR","input_token":1.968,"output_token":7.872,"cache_read_cost":0.49},"quantization":null,"context_size":1047576,"max_output_tokens":32768,"supported_features":["reasoning","tools"],"metrics":{"throughput":118.35,"latency":3.3,"ttft":0.49,"cache_hit_rate":null,"uptime":1.0}}}},{"id":"nova-pro-v1","object":"model","created":1744630682,"owned_by":"Amazon","description":"Nova Pro is a powerful, multilingual multimodal foundation model that excels at reasoning over text, images, and video across 200+ languages.","pricing":{"currency":"EUR","input_token":0.824,"output_token":3.295},"providers":["amazon_ireland","amazon_paris"],"context_size":300000,"max_output_tokens":10000,"tags":["Instruct","Tools","Image","Reasoning","Document"],"input_modalities":["text","image","file"],"output_modalities":["text"],"supported_features":["json_mode","reasoning","tools"],"model_series":["nova-1-pro"],"providers_details":{"amazon_ireland":{"pricing":{"currency":"EUR","input_token":0.824,"output_token":3.295},"quantization":null,"context_size":300000,"max_output_tokens":10000,"supported_features":["json_mode","reasoning","tools"],"metrics":{"throughput":170.82,"latency":2.39,"ttft":0.38,"cache_hit_rate":null,"uptime":1.0}},"amazon_paris":{"pricing":{"currency":"EUR","input_token":1.055,"output_token":4.221},"quantization":null,"context_size":300000,"max_output_tokens":10000,"supported_features":["json_mode","reasoning","tools"],"metrics":{"throughput":174.4,"latency":2.54,"ttft":0.37,"cache_hit_rate":null,"uptime":1.0}}}},{"id":"llama-3.1-nemotron-ultra-253b-v1","object":"model","created":1744025882,"owned_by":"Nvidia","description":"A reasoning-optimized LLM based on Llama 3.1, Nemotron Ultra 253B delivers strong performance in tasks like RAG and tool use, with high efficiency and reduced latency.","pricing":{"currency":"EUR","input_token":0.537,"output_token":1.61},"providers":["nebius"],"context_size":128000,"max_output_tokens":128000,"tags":["Instruct","Tools","Reasoning"],"input_modalities":["text"],"output_modalities":["text"],"supported_features":["json_mode","reasoning","tools"],"model_series":["llama-3-nemotron-ultra"],"providers_details":{"nebius":{"pricing":{"currency":"EUR","input_token":0.537,"output_token":1.61},"quantization":"fp8","context_size":128000,"max_output_tokens":128000,"supported_features":["json_mode","reasoning","tools"],"metrics":{"throughput":63.53,"latency":7.95,"ttft":0.8,"cache_hit_rate":0.97,"uptime":1.0}}}},{"id":"mistral-small-2503","object":"model","created":1742482730,"owned_by":"Mistral AI","description":"Combines advanced text and vision capabilities with 24 billion parameters, supporting multilingual tasks and long contexts up to 131k tokens, making it versatile for various applications without sacrificing performance.","pricing":{"currency":"EUR","input_token":0.1,"output_token":0.3},"providers":["ionos"],"context_size":128000,"max_output_tokens":128000,"tags":["Instruct","Image","Tools"],"input_modalities":["text","image"],"output_modalities":["text"],"supported_features":["json_mode","tools"],"model_series":["mistral-small"],"providers_details":{"ionos":{"pricing":{"currency":"EUR","input_token":0.1,"output_token":0.3},"quantization":"fp8","context_size":128000,"max_output_tokens":128000,"supported_features":["json_mode","tools"],"metrics":{"throughput":43.73,"latency":7.02,"ttft":0.42,"cache_hit_rate":null,"uptime":1.0}}}},{"id":"gemini-2.5-flash","object":"model","created":1742125082,"owned_by":"Google","description":"Gemini 2.5 models are advanced thinking models that reason before responding, delivering improved accuracy and performance.","pricing":{"currency":"EUR","input_token":0.268,"output_token":2.236,"audio_cost":2.236e-05,"cache_read_cost":0.026,"cache_write_cost":0.087},"providers":["google"],"context_size":1048576,"max_output_tokens":65535,"tags":["Instruct","Tools","Image","Reasoning","Audio","Document"],"input_modalities":["text","image","audio","file"],"output_modalities":["text"],"supported_features":["json_mode","reasoning","tools"],"model_series":["gemini-2-flash"],"providers_details":{"google":{"pricing":{"currency":"EUR","input_token":0.268,"output_token":2.236,"audio_cost":2.236e-05,"cache_read_cost":0.026,"cache_write_cost":0.087},"quantization":null,"context_size":1048576,"max_output_tokens":65535,"supported_features":["json_mode","reasoning","tools"],"metrics":{"throughput":450.73,"latency":4.07,"ttft":3.44,"cache_hit_rate":0.81,"uptime":1.0}}}},{"id":"gemini-2.5-pro","object":"model","created":1742125082,"owned_by":"Google","description":"Gemini 2.5 Pro is the most advanced reasoning model in the Gemini series, excelling at complex problem-solving across multiple data types.","pricing":{"currency":"EUR","input_token":1.342,"output_token":8.944,"audio_cost":3.4e-05,"cache_read_cost":0.217,"cache_write_cost":0.39},"providers":["google"],"context_size":1048576,"max_output_tokens":65535,"tags":["Instruct","Tools","Image","Reasoning","Audio"],"input_modalities":["text","image","audio"],"output_modalities":["text"],"supported_features":["json_mode","reasoning","tools"],"model_series":["gemini-2-pro"],"providers_details":{"google":{"pricing":{"currency":"EUR","input_token":1.342,"output_token":8.944,"audio_cost":3.4e-05,"cache_read_cost":0.217,"cache_write_cost":0.39},"quantization":null,"context_size":1048576,"max_output_tokens":65535,"supported_features":["json_mode","reasoning","tools"],"metrics":{"throughput":109.1,"latency":30.86,"ttft":18.68,"cache_hit_rate":0.03,"uptime":1.0}}}},{"id":"gemma-3-27b-it","object":"model","created":1741779482,"owned_by":"Google","description":"Gemma 3 is a family of lightweight, multimodal models from Google, supporting text and image inputs, multilingual capabilities, and a 131K context window.","pricing":{"currency":"EUR","input_token":0.089,"output_token":0.268},"providers":["nebius"],"context_size":131000,"max_output_tokens":110000,"tags":["Instruct","Image","Tools","Reasoning"],"input_modalities":["text","image"],"output_modalities":["text"],"supported_features":["json_mode","reasoning"],"model_series":["gemma-3-27b"],"providers_details":{"nebius":{"pricing":{"currency":"EUR","input_token":0.089,"output_token":0.268},"quantization":"fp8","context_size":131000,"max_output_tokens":110000,"supported_features":["json_mode","reasoning"],"metrics":{"throughput":79.31,"latency":18.34,"ttft":2.01,"cache_hit_rate":null,"uptime":0.91}}}},{"id":"qwen2.5-vl-72b-instruct","object":"model","created":1737977882,"owned_by":"Alibaba Cloud","description":"Qwen2.5-VL is a powerful vision-language model with advanced capabilities in visual understanding, long video reasoning, and structured output generation.","pricing":{"currency":"EUR","input_token":0.224,"output_token":0.671},"providers":["nebius","ovh"],"context_size":32000,"max_output_tokens":32000,"tags":["Instruct","Image","Reasoning"],"input_modalities":["text","image"],"output_modalities":["text"],"supported_features":["json_mode","reasoning"],"model_series":["qwen-2-vl-72b"],"providers_details":{"nebius":{"pricing":{"currency":"EUR","input_token":0.224,"output_token":0.671},"quantization":"fp8","context_size":32000,"max_output_tokens":32000,"supported_features":["json_mode","reasoning"],"metrics":{"throughput":18.35,"latency":6.61,"ttft":0.93,"cache_hit_rate":0.41,"uptime":1.0}},"ovh":{"pricing":{"currency":"EUR","input_token":0.91,"output_token":0.91},"quantization":"fp8","context_size":32000,"max_output_tokens":32000,"supported_features":["json_mode","reasoning"],"metrics":{"throughput":33.95,"latency":10.69,"ttft":0.2,"cache_hit_rate":null,"uptime":1.0}}}},{"id":"deepseek-r1-0528","object":"model","created":1737373082,"owned_by":"Deepseek","description":"DeepSeek R1 0528 is an upgraded reasoning model with enhanced depth, reduced hallucinations, and stronger performance in math, coding, and logic.","pricing":{"currency":"EUR","input_token":0.585,"output_token":2.307,"cache_read_cost":0.146},"providers":["tensorix"],"context_size":164000,"max_output_tokens":164000,"tags":["Instruct","Tools","Reasoning"],"input_modalities":["text"],"output_modalities":["text"],"supported_features":["json_mode","reasoning","tools"],"model_series":["deepseek-r1"],"providers_details":{"tensorix":{"pricing":{"currency":"EUR","input_token":0.585,"output_token":2.307,"cache_read_cost":0.146},"quantization":"fp8","context_size":164000,"max_output_tokens":164000,"supported_features":["json_mode","reasoning","tools"],"metrics":{"throughput":20.21,"latency":45.55,"ttft":2.68,"cache_hit_rate":0.02,"uptime":1.0}}}},{"id":"codestral-2508","object":"model","created":1736768282,"owned_by":"Mistral AI","description":"Codestral-2508 is a cutting-edge coding model optimized for low-latency, high-frequency tasks like FIM, code correction, and test generation.","pricing":{"currency":"EUR","input_token":0.3,"output_token":0.9,"cache_read_cost":0.03},"providers":["mistral"],"context_size":256000,"max_output_tokens":256000,"tags":["Instruct","Code","Tools"],"input_modalities":["text"],"output_modalities":["text"],"supported_features":["json_mode","tools"],"model_series":["codestral"],"providers_details":{"mistral":{"pricing":{"currency":"EUR","input_token":0.3,"output_token":0.9,"cache_read_cost":0.03},"quantization":null,"context_size":256000,"max_output_tokens":256000,"supported_features":["json_mode","tools"],"metrics":{"throughput":199.26,"latency":2.05,"ttft":0.25,"cache_hit_rate":0.75,"uptime":1.0}}}},{"id":"llama-3.3-70b-instruct","object":"model","created":1733830682,"owned_by":"Meta","description":"With 70 billion parameters, this cutting-edge multilingual model excels in generating high-quality, safe, and helpful text across eight languages, making it stand out from other chat models.","pricing":{"currency":"EUR","input_token":0.116,"output_token":0.358},"providers":["scaleway","nebius","ovh","ionos","aki","berget"],"context_size":131000,"max_output_tokens":131000,"tags":["Instruct","Tools","Reasoning"],"input_modalities":["text"],"output_modalities":["text"],"supported_features":["json_mode","reasoning","tools"],"model_series":["llama-3-70b"],"providers_details":{"scaleway":{"pricing":{"currency":"EUR","input_token":0.9,"output_token":0.9},"quantization":null,"context_size":131000,"max_output_tokens":16384,"supported_features":["json_mode","reasoning","tools"],"metrics":{"throughput":107.86,"latency":3.89,"ttft":0.82,"cache_hit_rate":null,"uptime":1.0}},"nebius":{"pricing":{"currency":"EUR","input_token":0.116,"output_token":0.358},"quantization":"fp8","context_size":128000,"max_output_tokens":128000,"supported_features":["json_mode","reasoning","tools"],"metrics":{"throughput":5.85,"latency":63.84,"ttft":18.3,"cache_hit_rate":0.08,"uptime":1.0}},"ovh":{"pricing":{"currency":"EUR","input_token":0.67,"output_token":0.67},"quantization":"fp8","context_size":131000,"max_output_tokens":131000,"supported_features":["json_mode","reasoning","tools"],"metrics":{"throughput":19.43,"latency":17.07,"ttft":1.12,"cache_hit_rate":null,"uptime":1.0}},"ionos":{"pricing":{"currency":"EUR","input_token":0.65,"output_token":0.65},"quantization":"fp8","context_size":128000,"max_output_tokens":128000,"supported_features":["json_mode","reasoning","tools"],"metrics":{"throughput":127.31,"latency":7.98,"ttft":0.93,"cache_hit_rate":null,"uptime":1.0}},"aki":{"pricing":{"currency":"EUR","input_token":0.65,"output_token":0.65},"quantization":"fp8","context_size":128000,"max_output_tokens":32000,"supported_features":["json_mode","reasoning","tools"],"metrics":{"throughput":50.87,"latency":5.48,"ttft":0.33,"cache_hit_rate":0.94,"uptime":1.0}},"berget":{"pricing":{"currency":"EUR","input_token":0.9,"output_token":0.9},"quantization":"fp16","context_size":131000,"max_output_tokens":131000,"supported_features":["json_mode","reasoning","tools"],"metrics":{"throughput":69.4,"latency":7.75,"ttft":1.2,"cache_hit_rate":null,"uptime":1.0}}}},{"id":"gpt-4o","object":"model","created":1732102682,"owned_by":"OpenAI","description":"GPT-4o is a transformative multimodal AI model that seamlessly fuses text, images, and audio to deliver exceptional speed, efficiency, and performance—at twice the speed and half the cost of GPT-4 Turbo.","pricing":{"currency":"EUR","input_token":2.387,"output_token":9.547,"cache_read_cost":1.194},"providers":["azure_sc","azure_spc"],"context_size":128000,"max_output_tokens":16000,"tags":["Instruct","Tools","Image","Reasoning","Document"],"input_modalities":["text","image","file"],"output_modalities":["text"],"supported_features":["reasoning","tools"],"model_series":["gpt-4o"],"providers_details":{"azure_sc":{"pricing":{"currency":"EUR","input_token":2.387,"output_token":9.547,"cache_read_cost":1.194},"quantization":null,"context_size":128000,"max_output_tokens":16000,"supported_features":["reasoning","tools"],"metrics":{"throughput":121.07,"latency":3.2,"ttft":0.83,"cache_hit_rate":0.35,"uptime":1.0}},"azure_spc":{"pricing":{"currency":"EUR","input_token":2.387,"output_token":9.547,"cache_read_cost":1.194},"quantization":null,"context_size":128000,"max_output_tokens":16000,"supported_features":["reasoning","tools"],"metrics":{"throughput":144.97,"latency":2.91,"ttft":0.66,"cache_hit_rate":null,"uptime":1.0}}}},{"id":"gpt-5-mini","object":"model","created":1732102682,"owned_by":"OpenAI","description":"GPT 5 mini is a compact, low-cost, and fast version of GPT-5, ideal for real-time agents and lightweight reasoning tasks.","pricing":{"currency":"EUR","input_token":0.25,"output_token":1.968,"cache_read_cost":0.05},"providers":["azure_sc"],"context_size":400000,"max_output_tokens":128000,"tags":["Instruct","Tools","Image","Reasoning"],"input_modalities":["text","image"],"output_modalities":["text"],"supported_features":["reasoning","tools"],"model_series":["gpt-5-mini"],"providers_details":{"azure_sc":{"pricing":{"currency":"EUR","input_token":0.25,"output_token":1.968,"cache_read_cost":0.05},"quantization":null,"context_size":400000,"max_output_tokens":128000,"supported_features":["reasoning","tools"],"metrics":{"throughput":879.93,"latency":5.66,"ttft":5.33,"cache_hit_rate":0.66,"uptime":1.0}}}},{"id":"gpt-5-nano","object":"model","created":1732102682,"owned_by":"OpenAI","description":"GPT 5 nano is the fastest, cheapest GPT-5 model, optimized for summarization, classification, and ultra-low latency tasks.","pricing":{"currency":"EUR","input_token":0.054,"output_token":0.394,"cache_read_cost":0.017},"providers":["azure_sc"],"context_size":400000,"max_output_tokens":128000,"tags":["Instruct","Tools","Image","Reasoning"],"input_modalities":["text","image"],"output_modalities":["text"],"supported_features":["reasoning","tools"],"model_series":["gpt-5-nano"],"providers_details":{"azure_sc":{"pricing":{"currency":"EUR","input_token":0.054,"output_token":0.394,"cache_read_cost":0.017},"quantization":null,"context_size":400000,"max_output_tokens":128000,"supported_features":["reasoning","tools"],"metrics":{"throughput":1738.35,"latency":13.44,"ttft":14.47,"cache_hit_rate":0.14,"uptime":1.0}}}},{"id":"pixtral-12b-2409","object":"model","created":1731176378,"owned_by":"Mistral AI","description":"Pixtral 2409 12B is a state-of-the-art multimodal model with 12B parameters and a 400M vision encoder, natively trained on interleaved text and image data. It excels in tasks spanning vision-language reasoning, instruction following, and pure text understanding, making it highly effective for real-world multimodal applications.","pricing":{"currency":"EUR","input_token":0.2,"output_token":0.2},"providers":["scaleway"],"context_size":128000,"max_output_tokens":4096,"tags":["Instruct","Image","Reasoning"],"input_modalities":["text","image"],"output_modalities":["text"],"supported_features":["json_mode","reasoning","tools"],"model_series":["pixtral-12b"],"providers_details":{"scaleway":{"pricing":{"currency":"EUR","input_token":0.2,"output_token":0.2},"quantization":null,"context_size":128000,"max_output_tokens":4096,"supported_features":["json_mode","reasoning","tools"],"metrics":{"throughput":106.91,"latency":7.22,"ttft":0.2,"cache_hit_rate":null,"uptime":1.0}}}},{"id":"hermes-4-405b","object":"model","created":1723549082,"owned_by":"NousResearch","description":"Hermes 4 405B is a frontier hybrid-mode reasoning model built on Llama 3.1, optimized for advanced logic, math, coding, and structured output generation.","pricing":{"currency":"EUR","input_token":0.894,"output_token":2.683},"providers":["nebius"],"context_size":128000,"max_output_tokens":128000,"tags":["Instruct","Tools"],"input_modalities":["text"],"output_modalities":["text"],"supported_features":["json_mode","tools"],"model_series":["hermes-4-405b"],"providers_details":{"nebius":{"pricing":{"currency":"EUR","input_token":0.894,"output_token":2.683},"quantization":"fp8","context_size":128000,"max_output_tokens":128000,"supported_features":["json_mode","tools"],"metrics":{"throughput":39.96,"latency":7.97,"ttft":0.73,"cache_hit_rate":0.3,"uptime":1.0}}}},{"id":"mistral-medium-2508","object":"model","created":1723020793,"owned_by":"Mistral AI","description":"Mistral Medium 2508 is a frontier-class multimodal LLM with a 128,000 token context window, optimized for reasoning, coding, and multimodal tasks.","pricing":{"currency":"EUR","input_token":0.4,"output_token":2.0,"cache_read_cost":0.04},"providers":["mistral"],"context_size":128000,"max_output_tokens":128000,"tags":["Instruct","Reasoning","Tools","Image"],"input_modalities":["text","image"],"output_modalities":["text"],"supported_features":["json_mode","reasoning","tools"],"model_series":["mistral-medium"],"providers_details":{"mistral":{"pricing":{"currency":"EUR","input_token":0.4,"output_token":2.0,"cache_read_cost":0.04},"quantization":null,"context_size":128000,"max_output_tokens":128000,"supported_features":["json_mode","reasoning","tools"],"metrics":{"throughput":70.01,"latency":0.93,"ttft":0.37,"cache_hit_rate":0.08,"uptime":1.0}}}},{"id":"mistral-nemo-instruct-2407","object":"model","created":1723020793,"owned_by":"Mistral AI","description":"A 12B parameter, instruct-tuned language model by Mistral AI and NVIDIA, designed for advanced instruction following, multi-turn conversations, and generating text and code across multiple languages.","pricing":{"currency":"EUR","input_token":0.13,"output_token":0.13},"providers":["ovh","ionos"],"context_size":128000,"max_output_tokens":128000,"tags":["Instruct","Tools"],"input_modalities":["text"],"output_modalities":["text"],"supported_features":["json_mode","tools"],"model_series":["mistral-nemo"],"providers_details":{"ovh":{"pricing":{"currency":"EUR","input_token":0.13,"output_token":0.13},"quantization":null,"context_size":118000,"max_output_tokens":118000,"supported_features":["json_mode","tools"],"metrics":{"throughput":48.09,"latency":5.81,"ttft":0.24,"cache_hit_rate":null,"uptime":0.95}},"ionos":{"pricing":{"currency":"EUR","input_token":0.15,"output_token":0.15},"quantization":"fp8","context_size":128000,"max_output_tokens":128000,"supported_features":["json_mode","tools"],"metrics":{"throughput":48.46,"latency":6.36,"ttft":0.25,"cache_hit_rate":null,"uptime":1.0}}}},{"id":"llama-3.1-405b-instruct","object":"model","created":1721734682,"owned_by":"Meta","description":"Meta Llama 3.1 is a multilingual LLM series optimized for dialogue, combining SFT and RLHF for improved helpfulness, safety, and performance.","pricing":{"currency":"EUR","input_token":1.75,"output_token":1.75},"providers":["ionos"],"context_size":128000,"max_output_tokens":128000,"tags":["Instruct","Tools","Reasoning"],"input_modalities":["text"],"output_modalities":["text"],"supported_features":["json_mode","reasoning","tools"],"model_series":["llama-3-405b"],"providers_details":{"ionos":{"pricing":{"currency":"EUR","input_token":1.75,"output_token":1.75},"quantization":"int4","context_size":128000,"max_output_tokens":128000,"supported_features":["json_mode","reasoning","tools"],"metrics":{"throughput":18.32,"latency":601.9,"ttft":1.7,"cache_hit_rate":null,"uptime":1.0}}}},{"id":"gpt-4o-mini","object":"model","created":1721302682,"owned_by":"OpenAI","description":"GPT-4o mini is a lightweight, cost-efficient multimodal model optimized for real-time tasks and large-context applications, with support for text and vision.","pricing":{"currency":"EUR","input_token":0.143,"output_token":0.573,"cache_read_cost":0.073},"providers":["azure_sc","azure_spc"],"context_size":128000,"max_output_tokens":16000,"tags":["Instruct","Tools","Image","Reasoning","Document"],"input_modalities":["text","image","file"],"output_modalities":["text"],"supported_features":["reasoning","tools"],"model_series":["gpt-4o-mini"],"providers_details":{"azure_sc":{"pricing":{"currency":"EUR","input_token":0.143,"output_token":0.573,"cache_read_cost":0.073},"quantization":null,"context_size":128000,"max_output_tokens":16000,"supported_features":["reasoning","tools"],"metrics":{"throughput":42.52,"latency":1.37,"ttft":0.58,"cache_hit_rate":0.34,"uptime":1.0}},"azure_spc":{"pricing":{"currency":"EUR","input_token":0.143,"output_token":0.573,"cache_read_cost":0.073},"quantization":null,"context_size":128000,"max_output_tokens":16000,"supported_features":["reasoning","tools"],"metrics":{"throughput":104.81,"latency":3.51,"ttft":1.33,"cache_hit_rate":0.47,"uptime":1.0}}}},{"id":"llama-3.1-8b-instruct","object":"model","created":1712652299,"owned_by":"Meta","description":"Optimized for dialogue, this LLM by Meta outperforms other open-source chat models in benchmarks while prioritizing helpfulness and safety.","pricing":{"currency":"EUR","input_token":0.15,"output_token":0.15},"providers":["ionos","aki"],"context_size":128000,"max_output_tokens":128000,"tags":["Instruct","Tools","Reasoning"],"input_modalities":["text"],"output_modalities":["text"],"supported_features":["json_mode","reasoning","tools"],"model_series":["llama-3-8b"],"providers_details":{"ionos":{"pricing":{"currency":"EUR","input_token":0.15,"output_token":0.15},"quantization":"fp8","context_size":128000,"max_output_tokens":128000,"supported_features":["json_mode","reasoning","tools"],"metrics":{"throughput":58.95,"latency":1.98,"ttft":0.67,"cache_hit_rate":null,"uptime":1.0}},"aki":{"pricing":{"currency":"EUR","input_token":0.15,"output_token":0.15},"quantization":"fp8","context_size":65536,"max_output_tokens":16384,"supported_features":["json_mode","reasoning","tools"],"metrics":{"throughput":98.75,"latency":4.52,"ttft":0.32,"cache_hit_rate":0.99,"uptime":1.0}}}},{"id":"mixtral-8x7B-instruct-v0.1","object":"model","created":1702294682,"owned_by":"Mistral AI","description":"Mixtral-8x7B is a sparse mixture-of-experts model with open weights, delivering fast, high-performance inference that outperforms Llama 2 70B and rivals GPT-3.5.","pricing":{"currency":"EUR","input_token":0.438,"output_token":0.68},"providers":["amazon_ireland","amazon_paris"],"context_size":32000,"max_output_tokens":4096,"tags":["Instruct","Reasoning","Document"],"input_modalities":["text","file"],"output_modalities":["text"],"supported_features":["json_mode","reasoning"],"model_series":["mixtral-8x7b"],"providers_details":{"amazon_ireland":{"pricing":{"currency":"EUR","input_token":0.438,"output_token":0.68},"quantization":null,"context_size":32000,"max_output_tokens":4096,"supported_features":["json_mode","reasoning"],"metrics":{"throughput":111.53,"latency":4.01,"ttft":0.23,"cache_hit_rate":null,"uptime":1.0}},"amazon_paris":{"pricing":{"currency":"EUR","input_token":0.528,"output_token":0.814},"quantization":null,"context_size":32000,"max_output_tokens":4096,"supported_features":["json_mode","reasoning"],"metrics":{"throughput":114.91,"latency":3.57,"ttft":0.21,"cache_hit_rate":null,"uptime":1.0}}}}]}