फ़ाइल के रूप में नीतियाँ
रूटिंग नियम एक बार लिखें और उन्हें पूरे संगठन, किसी प्रोजेक्ट या एक कुंजी से जोड़ें। सहेजने से पहले उनकी टाइप-जाँच होती है।
ai.ml एक LLM गेटवे है। जो OpenAI, Anthropic या Gemini SDK आप पहले से उपयोग करते हैं उसे ही रखें, बेस URL बदलें, और हर अनुरोध अनुवादित होता है, सबसे अच्छे होस्ट तक पहुँचता है, स्ट्रीम होकर लौटता है और एक-एक टोकन तक मीटर होता है।
from openai import OpenAI client = OpenAI(- base_url="https://api.openai.com/v1",+ base_url="https://api.ai.ml/v1", api_key=KEY,)client.chat.completions.create( model="openai/gpt-5-mini", ...)
फ़ेलओवर का एक उदाहरण: पहले होस्ट का समय समाप्त हो जाता है, इसलिए अनुरोध अगले होस्ट पर चला जाता है। आपको एक उत्तर मिलता है और आप एक का ही भुगतान करते हैं।
पाँच वायर फ़ॉर्मेट अंदर आते हैं, और हर एक उसी फ़ॉर्मेट में लौटता है, चाहे किसी भी प्रदाता ने उसे सर्व किया हो। कोई फ़ॉर्मेट चुनकर देखें कि वह कहाँ मिलता है और उसमें क्या-क्या आता है।
client = OpenAI(base_url="https://api.ai.ml/v1", api_key=KEY)
आपके SDK और मॉडल के बीच छह चरण हैं। किसी चरण पर क्लिक करें, या पूरा रास्ता चलाएँ, और देखें कि हर चरण क्या जाँचता है और क्या दर्ज करता है।
जो होस्ट अनुरोध पूरा नहीं कर सकते, वे सुविधा, देश और डेटा नियमों के आधार पर छाँट दिए जाते हैं। बाक़ी को आपकी नीति के अनुसार क्रम दिया जाता है: कीमत, गति या अपटाइम।
# trace
5 hosts, 3 eligible ranked by priceहर मॉडल उन होस्ट की सूची देता है जो उसे चलाते हैं, कीमत, मापी गई गति और 30 दिन के अपटाइम के साथ। उन्हें क्रम में लगाएँ, ट्रैफ़िक को एक देश में रखें, या किसी एक होस्ट को पिन करने के लिए पंक्ति पर क्लिक करें। ये openai/gpt-5-mini के होस्ट हैं।
| होस्ट | देश | इनपुट / आउटपुट प्रति 1M | पहला टोकन | 30 दिन का अपटाइम |
|---|---|---|---|---|
| Azure OpenAI (Global Standard) | ग्लोबल | $0.25 / $2.00 | n/a | n/a |
| OpenAI | संयुक्त राज्य | $0.25 / $2.00 | n/a | n/a |
| OpenRouter | ग्लोबल | $0.26 / $2.10 | 0.68 s | 100.00% |
अगर वह होस्ट विफल या धीमा हो जाए, तो सूची का अगला होस्ट अनुरोध ले लेता है। आपसे शुल्क एक ही बार लिया जाता है।
# रिक्वेस्ट बॉडी में जोड़ें "route": { "sort": "price" }
कैटलॉग से लाइव आँकड़े, पिछले 30 दिनों में मापे गए।
रूटिंग नियम एक बार लिखें और उन्हें पूरे संगठन, किसी प्रोजेक्ट या एक कुंजी से जोड़ें। सहेजने से पहले उनकी टाइप-जाँच होती है।
ट्रैफ़िक का छोटा हिस्सा नए होस्ट को भेजें। उसकी त्रुटि दर बढ़ने या उत्तर की गुणवत्ता गिरने पर यह हिस्सा अपने आप घटा दिया जाता है।
लाइव अनुरोधों को बैकग्राउंड में दूसरे मॉडल पर दोबारा चलाएँ और लागत, गति और रुकने के कारण की तुलना करें। आपके उपयोगकर्ताओं को यह कभी नहीं दिखता।
किसी पुराने या बताए गए अनुरोध पर असली राउटर चलाएँ और पढ़ें कि वह कौन-सा होस्ट चुनता, और बाक़ी क्यों नहीं चुने गए।
होस्ट इस बात में अलग होते हैं कि वे क्या समर्थन करते हैं। गेटवे हर एक को जानता है, जहाँ सुरक्षित रूप से हो सके कमी पूरी करता है, और जहाँ न हो सके वहाँ साफ़ त्रुटि के साथ मना कर देता है। किसी सेल पर होवर या टैप करें।
| मॉडल | टूल्स | स्ट्रक्चर्ड आउटपुट | विज़न | रीज़निंग | प्रॉम्प्ट कैश |
|---|---|---|---|---|---|
| anthropic/claude-haiku-4.5 | समर्थित | समर्थित | समर्थित | समर्थित | समर्थित |
| google/gemini-3.1-flash-lite | समर्थित | समर्थित | समर्थित | समर्थित | समर्थित |
| openai/gpt-5-mini | समर्थित | समर्थित | समर्थित | समर्थित | समर्थित |
| deepseek/deepseek-v4.1-flash | समर्थित | समर्थित | समर्थित | समर्थित | समर्थित |
| meta/llama-3.3-70b-instruct | समर्थित | समर्थित | उपलब्ध नहीं | उपलब्ध नहीं | उपलब्ध नहीं |
| aion-labs/aion-2.0 | समर्थित | समर्थित | उपलब्ध नहीं | समर्थित | समर्थित |
लाइव कैटलॉग से। हर मॉडल के पेज पर हर होस्ट और उसकी समर्थित सुविधाएँ दी गई हैं।
आपको कभी अंदाज़ा नहीं लगाना पड़ता कि किस प्रदाता ने जवाब दिया, कितने प्रयास लगे या लागत क्या रही। जवाब रिस्पॉन्स पर ही है, और वही रिकॉर्ड अनुरोध लॉग में तब तक रहता है जब तक आप लॉग रखते हैं।
हर वह होस्ट जिस पर विचार हुआ और हर एक पर क्या हुआ।
HTTP/1.1 200 OK x-aiml-request-id: 01K7QW3M9T2ZB4 x-aiml-provider: bedrock x-aiml-region: us x-aiml-attempts: 2 x-aiml-cost-micro: 2676 x-aiml-route-trace: anthropic:timeout,bedrock:ok
हर कुंजी की अपनी दर सीमाएँ, मॉडल अनुमति-सूची, अनुमत ब्राउज़र ओरिजिन, समाप्ति और ख़र्च बजट होता है। बजट ख़त्म होने पर अगला अनुरोध साफ़ त्रुटि के साथ अस्वीकार हो जाता है और एक वेबहुक आपकी टीम को बताता है। आज़माकर देखें: लूप में फँसा एक एजेंट शुरू करें।
पहले अनुरोध की प्रतीक्षा है।डेटा नियम हर कुंजी पर तय होते हैं और नीचे के स्तर पर केवल और सख़्त हो सकते हैं। स्विच बदलकर देखें कि उन नियमों वाली कुंजी क्या करती है।
हस्ताक्षरित डेटा प्रोसेसिंग समझौता, उप-प्रोसेसर की सूची और अनुरोध पर डेटा मिटाना हर खाते का हिस्सा हैं।
सेटअप कमांड पहले आपकी कुंजी और मॉडल जाँचता है, केवल अपनी सेटिंग्स बदलता है, और बैकअप रखता है ताकि एक और कमांड सब कुछ पहले जैसा कर दे।
$ npx @aiml/cli setup claude-code ok key accepted ok model available ok backup saved ok wrote ~/.claude/settings.json npx @aiml/cli restore
पहले इंटीग्रेशन के बाद टीम जो चीज़ें माँगती है, वे पहले से मौजूद हैं।
किसी कुंजी के लिए इसे चालू करें और हूबहू वही अनुरोध बिना किसी लागत के कैश से जवाब पाता है, स्ट्रीमिंग सहित।
OpenAI, Cohere, Voyage और Jina शैली के एम्बेडिंग मॉडलों के लिए एक ही रूट, जहाँ बड़े बैच आपके लिए अपने आप बाँट दिए जाते हैं।
जो कुंजियाँ आपके पास पहले से हैं, उन्हें ले आएँ। अनुरोध उन्हीं से जाते हैं और लॉग, सीमाएँ और रूटिंग आपके पास रहती हैं।
इमेज, PDF या ऑडियो फ़ाइल एक बार अपलोड करें और किसी भी प्रदाता पर, किसी भी अनुरोध से उसका संदर्भ दें।
TypeScript, Python और Go लाइब्रेरी, साथ ही एक टूल-कॉलिंग लूप जो आपकी तय की हुई ख़र्च सीमा पर रुक जाता है।
अपने एडिटर या एजेंट को मानक टूल्स के ज़रिए मॉडल, उपयोग और अनुरोध पढ़ने और कुंजियाँ बनाने दें।
अपने टेस्ट सेट पर मॉडलों और होस्ट को स्कोर करें और नतीजे से रूटिंग तय होने दें।
पुनःप्रयास वाले हस्ताक्षरित इवेंट, SAML या OIDC साइन-इन, और आपकी डायरेक्टरी से उपयोगकर्ता प्रोविज़निंग।
प्रीपेड, प्रति टोकन भुगतान। UPI, कार्ड या नेट बैंकिंग से रुपये में, या कार्ड से डॉलर में टॉप-अप करें। कोई सब्सक्रिप्शन नहीं। भारतीय कंपनियों को हर टॉप-अप पर GST इनवॉइस मिलता है।
मूल्य देखेंऔर कुछ पूछना हो तो अपने एक्सेस अनुरोध में पूछें, कोई व्यक्ति आपको जवाब देगा।
बीटा केवल आमंत्रण पर है। एक्सेस का अनुरोध करें, और अनुरोध स्वीकृत होने पर आपको पासवर्ड सेट करने और खाता खोलने का लिंक मिलता है।
हाँ। इवेंट उसी फ़ॉर्मेट में लौटते हैं जिसमें आपके SDK ने भेजा था, उसी क्रम में जिसकी वह अपेक्षा करता है, चाहे उन्हें किसी भी प्रदाता ने बनाया हो। टूल कॉल और रीज़निंग भी स्ट्रीम होते हैं।
आप प्रति टोकन भुगतान करते हैं, उस कीमत पर जो मॉडल के पेज पर हर होस्ट के लिए दिखाई गई है। कोई सब्सक्रिप्शन नहीं है।
नहीं। जो OpenAI, Anthropic या Gemini SDK आप आज उपयोग करते हैं उसे ही रखें और बेस URL और कुंजी बदलें। स्ट्रीमिंग, टूल्स और स्ट्रक्चर्ड आउटपुट पहले की तरह काम करते हैं।
अनुरोध उसी मॉडल को चलाने वाले अगले होस्ट पर चला जाता है। आपसे उसी उत्तर का शुल्क लिया जाता है जो आपको मिला, और विफल प्रयास का कुछ नहीं।
यह हर अनुरोध पर थोड़ा-सा निश्चित ओवरहेड जोड़ता है और उसे हर रिस्पॉन्स पर प्रदाता के अपने समय से अलग बताता है, ताकि आप ख़ुद देख सकें।
आप चुनते हैं। किसी कुंजी को एक क्षेत्र के होस्ट तक सीमित किया जा सकता है, और जो अनुरोध वहाँ पूरे नहीं हो सकते वे अस्वीकार कर दिए जाते हैं।
हम एक बार में कुछ ही टीमों को शामिल कर रहे हैं ताकि हर खाते को पहले इंटीग्रेशन में असली मदद मिले।