हर मॉडल के लिए एक एंडपॉइंट, जिसमें रूटिंग और फ़ेलओवर पहले से शामिल हैं।

ai.ml एक LLM गेटवे है। जो OpenAI, Anthropic या Gemini SDK आप पहले से उपयोग करते हैं उसे ही रखें, बेस URL बदलें, और हर अनुरोध अनुवादित होता है, सबसे अच्छे होस्ट तक पहुँचता है, स्ट्रीम होकर लौटता है और एक-एक टोकन तक मीटर होता है।

  • पाँच वायर फ़ॉर्मेट, एक कुंजी
  • स्ट्रीमिंग, टूल्स और स्ट्रक्चर्ड आउटपुट
  • होस्ट और क्लाउड के बीच फ़ेलओवर
from openai import OpenAI client = OpenAI(-   base_url="https://api.openai.com/v1",+   base_url="https://api.ai.ml/v1",    api_key=KEY,)client.chat.completions.create(    model="openai/gpt-5-mini", ...)
openai/gpt-5-mini
  • होस्टदेशइनपुट / 1Mपहला टोकनस्थिति
  • Azure OpenAI (Global Standard)GLOBAL$0.25n/aसमय समाप्त
  • OpenAIUS$0.25n/aसर्व किया
  • OpenRouterGLOBAL$0.260.68 sस्टैंडबाय

रिस्पॉन्स आपको क्या बताता है

किसने सर्व किया
OpenAI, US
प्रयास
2
पहला टोकन
n/a

फ़ेलओवर का एक उदाहरण: पहले होस्ट का समय समाप्त हो जाता है, इसलिए अनुरोध अगले होस्ट पर चला जाता है। आपको एक उत्तर मिलता है और आप एक का ही भुगतान करते हैं।

इनके मॉडलAnthropicGoogleOpenAIDeepSeekMeta LlamaAion-labsAmazonAnthracite-orgArcee-aiBytedanceCognitivecomputationsCohere

यह वही API बोलता है जो आपका कोड पहले से बोलता है

पाँच वायर फ़ॉर्मेट अंदर आते हैं, और हर एक उसी फ़ॉर्मेट में लौटता है, चाहे किसी भी प्रदाता ने उसे सर्व किया हो। कोई फ़ॉर्मेट चुनकर देखें कि वह कहाँ मिलता है और उसमें क्या-क्या आता है।

OpenAI SDK और उस पर बनी हर चीज़ के लिए ड्रॉप-इन

client = OpenAI(base_url="https://api.ai.ml/v1", api_key=KEY)
  • स्ट्रीमिंग, आख़िरी चंक में उपयोग के आँकड़ों के साथ
  • फ़ंक्शन टूल्स और समानांतर टूल कॉल
  • JSON मोड और JSON Schema आउटपुट
  • इनपुट के रूप में इमेज, ऑडियो और फ़ाइलें

एक अनुरोध के साथ क्या होता है, क्रम से

आपके SDK और मॉडल के बीच छह चरण हैं। किसी चरण पर क्लिक करें, या पूरा रास्ता चलाएँ, और देखें कि हर चरण क्या जाँचता है और क्या दर्ज करता है।

4. रूटिंग

जो होस्ट अनुरोध पूरा नहीं कर सकते, वे सुविधा, देश और डेटा नियमों के आधार पर छाँट दिए जाते हैं। बाक़ी को आपकी नीति के अनुसार क्रम दिया जाता है: कीमत, गति या अपटाइम।

# trace
5 hosts, 3 eligible   ranked by price

अनुरोध भेजने से पहले हर होस्ट देखें

हर मॉडल उन होस्ट की सूची देता है जो उसे चलाते हैं, कीमत, मापी गई गति और 30 दिन के अपटाइम के साथ। उन्हें क्रम में लगाएँ, ट्रैफ़िक को एक देश में रखें, या किसी एक होस्ट को पिन करने के लिए पंक्ति पर क्लिक करें। ये openai/gpt-5-mini के होस्ट हैं।

होस्टदेशइनपुट / आउटपुट प्रति 1Mपहला टोकन30 दिन का अपटाइम
Azure OpenAI (Global Standard)ग्लोबल$0.25 / $2.00n/an/a
OpenAIसंयुक्त राज्य$0.25 / $2.00n/an/a
OpenRouterग्लोबल$0.26 / $2.100.68 s100.00%

आपका अनुरोध सबसे सस्ते होस्ट पर जाता है

अगर वह होस्ट विफल या धीमा हो जाए, तो सूची का अगला होस्ट अनुरोध ले लेता है। आपसे शुल्क एक ही बार लिया जाता है।

# रिक्वेस्ट बॉडी में जोड़ें
"route": {
  "sort": "price"
}

कैटलॉग से लाइव आँकड़े, पिछले 30 दिनों में मापे गए।

मॉडल देखें

फ़ाइल के रूप में नीतियाँ

रूटिंग नियम एक बार लिखें और उन्हें पूरे संगठन, किसी प्रोजेक्ट या एक कुंजी से जोड़ें। सहेजने से पहले उनकी टाइप-जाँच होती है।

नए होस्ट को कैनरी करें

ट्रैफ़िक का छोटा हिस्सा नए होस्ट को भेजें। उसकी त्रुटि दर बढ़ने या उत्तर की गुणवत्ता गिरने पर यह हिस्सा अपने आप घटा दिया जाता है।

दूसरे मॉडल को शैडो करें

लाइव अनुरोधों को बैकग्राउंड में दूसरे मॉडल पर दोबारा चलाएँ और लागत, गति और रुकने के कारण की तुलना करें। आपके उपयोगकर्ताओं को यह कभी नहीं दिखता।

शिप करने से पहले ड्राई रन

किसी पुराने या बताए गए अनुरोध पर असली राउटर चलाएँ और पढ़ें कि वह कौन-सा होस्ट चुनता, और बाक़ी क्यों नहीं चुने गए।

कोई सुविधा हर होस्ट पर एक जैसी काम करती है, वरना आपको बता दिया जाता है

होस्ट इस बात में अलग होते हैं कि वे क्या समर्थन करते हैं। गेटवे हर एक को जानता है, जहाँ सुरक्षित रूप से हो सके कमी पूरी करता है, और जहाँ न हो सके वहाँ साफ़ त्रुटि के साथ मना कर देता है। किसी सेल पर होवर या टैप करें।

मॉडलटूल्सस्ट्रक्चर्ड आउटपुटविज़नरीज़निंगप्रॉम्प्ट कैश
anthropic/claude-haiku-4.5समर्थितसमर्थितसमर्थितसमर्थितसमर्थित
google/gemini-3.1-flash-liteसमर्थितसमर्थितसमर्थितसमर्थितसमर्थित
openai/gpt-5-miniसमर्थितसमर्थितसमर्थितसमर्थितसमर्थित
deepseek/deepseek-v4.1-flashसमर्थितसमर्थितसमर्थितसमर्थितसमर्थित
meta/llama-3.3-70b-instructसमर्थितसमर्थितउपलब्ध नहींउपलब्ध नहींउपलब्ध नहीं
aion-labs/aion-2.0समर्थितसमर्थितउपलब्ध नहींसमर्थितसमर्थित

लाइव कैटलॉग से। हर मॉडल के पेज पर हर होस्ट और उसकी समर्थित सुविधाएँ दी गई हैं।

हर रिस्पॉन्स अपनी पूरी बात ख़ुद बताता है

आपको कभी अंदाज़ा नहीं लगाना पड़ता कि किस प्रदाता ने जवाब दिया, कितने प्रयास लगे या लागत क्या रही। जवाब रिस्पॉन्स पर ही है, और वही रिकॉर्ड अनुरोध लॉग में तब तक रहता है जब तक आप लॉग रखते हैं।

हर वह होस्ट जिस पर विचार हुआ और हर एक पर क्या हुआ।

HTTP/1.1 200 OK
x-aiml-request-id: 01K7QW3M9T2ZB4
x-aiml-provider: bedrock
x-aiml-region: us
x-aiml-attempts: 2
x-aiml-cost-micro: 2676
x-aiml-route-trace: anthropic:timeout,bedrock:ok

सीमाएँ जो टिकती हैं, हर कुंजी और हर प्रोजेक्ट पर

हर कुंजी की अपनी दर सीमाएँ, मॉडल अनुमति-सूची, अनुमत ब्राउज़र ओरिजिन, समाप्ति और ख़र्च बजट होता है। बजट ख़त्म होने पर अगला अनुरोध साफ़ त्रुटि के साथ अस्वीकार हो जाता है और एक वेबहुक आपकी टीम को बताता है। आज़माकर देखें: लूप में फँसा एक एजेंट शुरू करें।

$0.00आज ख़र्च
0अनुरोध पूरे हुए
0अनुरोध अस्वीकार हुए
पहले अनुरोध की प्रतीक्षा है।

क्या रखा जाए और कहाँ चले, यह आप तय करते हैं

डेटा नियम हर कुंजी पर तय होते हैं और नीचे के स्तर पर केवल और सख़्त हो सकते हैं। स्विच बदलकर देखें कि उन नियमों वाली कुंजी क्या करती है।

अनुरोध लॉग रखें7 से 365 दिन तक एन्क्रिप्टेड रूप में संग्रहीत, अवधि आप चुनते हैं।
लॉग में व्यक्तिगत जानकारी छिपाएँईमेल, फ़ोन नंबर और कार्ड नंबर संग्रहीत होने से पहले मास्क कर दिए जाते हैं।
ज़ीरो डेटा रिटेंशनकेवल वे होस्ट अनुरोध पूरा कर सकते हैं जो कुछ भी नहीं रखते।
आपके डेटा पर कोई ट्रेनिंग नहींऐसे हर होस्ट को छोड़ दें जिसकी शर्तें API ट्रैफ़िक पर ट्रेनिंग की अनुमति देती हैं।
केवल भारतअनुरोध भारत के होस्ट से पूरे होते हैं या अस्वीकार कर दिए जाते हैं।

इन नियमों के साथ यह कुंजी

  • व्यक्तिगत जानकारी मास्क करके एन्क्रिप्टेड अनुरोध लॉग रखेगी।
  • कभी ऐसे होस्ट को अनुरोध नहीं भेजेगी जो उस पर ट्रेनिंग कर सकता है।
  • किसी भी क्षेत्र के सबसे अच्छे होस्ट पर चलेगी।

हस्ताक्षरित डेटा प्रोसेसिंग समझौता, उप-प्रोसेसर की सूची और अनुरोध पर डेटा मिटाना हर खाते का हिस्सा हैं।

आपके कोडिंग टूल्स, एक कमांड से यहाँ जुड़े

सेटअप कमांड पहले आपकी कुंजी और मॉडल जाँचता है, केवल अपनी सेटिंग्स बदलता है, और बैकअप रखता है ताकि एक और कमांड सब कुछ पहले जैसा कर दे।

$ npx @aiml/cli setup claude-code
ok  key accepted
ok  model available
ok  backup saved
ok  wrote ~/.claude/settings.json

npx @aiml/cli restore

साथ में यह भी

पहले इंटीग्रेशन के बाद टीम जो चीज़ें माँगती है, वे पहले से मौजूद हैं।

रिस्पॉन्स कैश

किसी कुंजी के लिए इसे चालू करें और हूबहू वही अनुरोध बिना किसी लागत के कैश से जवाब पाता है, स्ट्रीमिंग सहित।

एम्बेडिंग और रीरैंक

OpenAI, Cohere, Voyage और Jina शैली के एम्बेडिंग मॉडलों के लिए एक ही रूट, जहाँ बड़े बैच आपके लिए अपने आप बाँट दिए जाते हैं।

आपकी अपनी प्रदाता कुंजियाँ

जो कुंजियाँ आपके पास पहले से हैं, उन्हें ले आएँ। अनुरोध उन्हीं से जाते हैं और लॉग, सीमाएँ और रूटिंग आपके पास रहती हैं।

फ़ाइल अपलोड

इमेज, PDF या ऑडियो फ़ाइल एक बार अपलोड करें और किसी भी प्रदाता पर, किसी भी अनुरोध से उसका संदर्भ दें।

SDK और एजेंट लूप

TypeScript, Python और Go लाइब्रेरी, साथ ही एक टूल-कॉलिंग लूप जो आपकी तय की हुई ख़र्च सीमा पर रुक जाता है।

MCP सर्वर

अपने एडिटर या एजेंट को मानक टूल्स के ज़रिए मॉडल, उपयोग और अनुरोध पढ़ने और कुंजियाँ बनाने दें।

आपके प्रॉम्प्ट पर इवैल

अपने टेस्ट सेट पर मॉडलों और होस्ट को स्कोर करें और नतीजे से रूटिंग तय होने दें।

वेबहुक और सिंगल साइन-ऑन

पुनःप्रयास वाले हस्ताक्षरित इवेंट, SAML या OIDC साइन-इन, और आपकी डायरेक्टरी से उपयोगकर्ता प्रोविज़निंग।

प्रीपेड, प्रति टोकन भुगतान। UPI, कार्ड या नेट बैंकिंग से रुपये में, या कार्ड से डॉलर में टॉप-अप करें। कोई सब्सक्रिप्शन नहीं। भारतीय कंपनियों को हर टॉप-अप पर GST इनवॉइस मिलता है।

मूल्य देखें

वे सवाल जो लोग सबसे पहले पूछते हैं

और कुछ पूछना हो तो अपने एक्सेस अनुरोध में पूछें, कोई व्यक्ति आपको जवाब देगा।

मुझे एक्सेस कैसे मिलेगी?

बीटा केवल आमंत्रण पर है। एक्सेस का अनुरोध करें, और अनुरोध स्वीकृत होने पर आपको पासवर्ड सेट करने और खाता खोलने का लिंक मिलता है।

क्या स्ट्रीमिंग वैसे ही काम करती है जैसी मेरा SDK अपेक्षा करता है?

हाँ। इवेंट उसी फ़ॉर्मेट में लौटते हैं जिसमें आपके SDK ने भेजा था, उसी क्रम में जिसकी वह अपेक्षा करता है, चाहे उन्हें किसी भी प्रदाता ने बनाया हो। टूल कॉल और रीज़निंग भी स्ट्रीम होते हैं।

इसकी लागत कितनी है?

आप प्रति टोकन भुगतान करते हैं, उस कीमत पर जो मॉडल के पेज पर हर होस्ट के लिए दिखाई गई है। कोई सब्सक्रिप्शन नहीं है।

क्या मुझे अपना कोड दोबारा लिखना होगा?

नहीं। जो OpenAI, Anthropic या Gemini SDK आप आज उपयोग करते हैं उसे ही रखें और बेस URL और कुंजी बदलें। स्ट्रीमिंग, टूल्स और स्ट्रक्चर्ड आउटपुट पहले की तरह काम करते हैं।

जब कोई प्रदाता डाउन हो जाए तो क्या होता है?

अनुरोध उसी मॉडल को चलाने वाले अगले होस्ट पर चला जाता है। आपसे उसी उत्तर का शुल्क लिया जाता है जो आपको मिला, और विफल प्रयास का कुछ नहीं।

गेटवे कितनी लेटेंसी जोड़ता है?

यह हर अनुरोध पर थोड़ा-सा निश्चित ओवरहेड जोड़ता है और उसे हर रिस्पॉन्स पर प्रदाता के अपने समय से अलग बताता है, ताकि आप ख़ुद देख सकें।

मेरा डेटा कहाँ प्रोसेस होता है?

आप चुनते हैं। किसी कुंजी को एक क्षेत्र के होस्ट तक सीमित किया जा सकता है, और जो अनुरोध वहाँ पूरे नहीं हो सकते वे अस्वीकार कर दिए जाते हैं।

क्लोज़्ड बीटा से जुड़ें

हम एक बार में कुछ ही टीमों को शामिल कर रहे हैं ताकि हर खाते को पहले इंटीग्रेशन में असली मदद मिले।

यह कैसे काम करता हैहमें बताएँ कि आप क्या बना रहे हैं। अनुरोध स्वीकृत होने पर आपको पासवर्ड सेट करने और खाता खोलने का लिंक मिलता है।