रेफ़रेंस
सोर्स
YouTube, TikTok, आपकी फ़ाइलें और सीधे लिंक: कौन से URL चलते हैं, हर मोड क्या करता है, और सीमाएं।
अपडेट किया गया
सोर्स कोई भी हो, आपको वही ट्रांसक्रिप्ट ऑब्जेक्ट मिलता है: टेक्स्ट, समय वाले सेगमेंट, और जब AI ट्रांसक्रिप्शन ने उसे बनाया हो तो शब्दों के समय भी। हर सोर्स की सीमा: 2 घंटे और 250 MB।
सोर्स#
| सोर्स | स्वीकार किए जाने वाले लिंक | captions_only | auto / transcribe |
|---|---|---|---|
| YouTube | youtube.com/watch?v=…, youtu.be/…, /shorts/…, /live/… | क्रिएटर या ऑटोमैटिक कैप्शन, 1 क्रेडिट | पेड प्लान |
| TikTok | tiktok.com/@user/video/…, vm.tiktok.com/… शेयर लिंक | क्रिएटर कैप्शन, 1 क्रेडिट | पेड प्लान |
| आपकी फ़ाइल | mp3, wav, m4a, ogg, aac, mp4, webm, POST /v1/uploads के ज़रिए | उपलब्ध नहीं | पेड प्लान |
| सीधा लिंक | कोई भी सार्वजनिक https URL जो ऑडियो या वीडियो फ़ाइल देता हो | उपलब्ध नहीं | पेड प्लान |
अपनी कुंजी के साथ GET /v1/capabilities आपके प्लान के लिए यही तालिका लौटाता है, ताकि क्लाइंट सिर्फ़ वही दिखा सके जो काम करेगा।
कैप्शन#
- सिर्फ़ सार्वजनिक वीडियो। निजी, सिर्फ़ सदस्यों वाले और उम्र सीमा वाले वीडियो
SOURCE_*कोड के साथ फेल होते हैं। - YouTube पर दो तरह के कैप्शन होते हैं: क्रिएटर के अपलोड किए हुए और YouTube के अपने ऑटोमैटिक।
caption_preferenceइनमें से चुनता है; डिफ़ॉल्ट में क्रिएटर वाले मौजूद हों तो वही लिए जाते हैं। caption_languagesसे ख़ास ट्रैक मांगे जाते हैं, जैसे["es", "en"]। किसी YouTube वीडियो में कौन से ट्रैक हैं, यहPOST /v1/language-discoveriesबताता है।- समय हर कैप्शन क्यू के हिसाब से मिलता है (
timing_granularity: "segment")।
AI ट्रांसक्रिप्शन#
- ऑडियो सुनकर बनता है; कैप्शन हों या न हों, काम करता है। भाषा अपने आप पहचानता है, या
languageमें दिया संकेत लेता है। - शब्दों के समय और कॉन्फ़िडेंस लौटाता है (
timing_granularity: "word")। - मीडिया की लंबाई का करीब चौथाई समय लगता है। लगातार पोलिंग की जगह
?wait=25या वेबहुक इस्तेमाल करें। - शुरू हुए हर मिनट पर 2 क्रेडिट, कम से कम 1 मिनट;
max_creditsसे जॉब की सीमा तय करें।