Transcrições de vídeo no LangChain
Carregue transcrições do YouTube e do TikTok como Documents do LangChain, com marcações de tempo, ou dê ao agente do LangChain as ferramentas MCP do Transcript Dock.
Atualizado em
Resposta curta: há dois caminhos. Para indexação, um loader pequeno transforma uma transcrição em objetos Document do LangChain, um por segmento de legenda, com o horário de início. Para agentes, o servidor MCP do Transcript Dock se conecta ao LangChain pelo langchain-mcp-adapters, e o próprio agente busca as transcrições.
Um loader de documentos#
Vinte linhas, sem pacote extra. Cada Document guarda a URL do vídeo e o tempo, então os resultados de busca podem citar o momento de onde vieram. Agrupe os segmentos em blocos maiores antes de gerar os embeddings, como mostrado em transcrições para RAG.
# pip install langchain-core requestsimport requestsfrom langchain_core.documents import DocumentAPI = "https://www.transcriptdock.com"H = {"Authorization": "Bearer td_live_YOUR_KEY"}def load_video(url: str, mode: str = "captions_only") -> list[Document]:"""One Document per caption segment, with the video URL and start time as metadata."""job = requests.post(f"{API}/v1/jobs", headers={**H, "Idempotency-Key": f"lc-{url}"[:128]},json={"source": {"url": url}, "mode": mode}).json()while job["status"] not in ("succeeded", "failed", "cancelled"):job = requests.get(f"{API}/v1/jobs/{job['id']}", params={"wait": 25}, headers=H).json()if job["status"] != "succeeded":raise RuntimeError(job["error"]["code"])t = requests.get(f"{API}/v1/transcripts/{job['result_id']}", headers=H).json()meta = {"source": t["source"]["canonical_url"], "title": t["source"]["title"], "language": t["language"]}return [Document(page_content=s["text"], metadata={**meta, "start": s["start"], "end": s["end"]})for s in t["segments"]]docs = load_video("https://www.youtube.com/watch?v=dQw4w9WgXcQ")
Ferramentas para agentes via MCP#
O MultiServerMCPClient se conecta ao servidor remoto e transforma as ferramentas dele em ferramentas do LangChain: get_video_transcript, busca no YouTube, listagem de canais e playlists e listagem de perfis do TikTok.
# pip install langchain-mcp-adapters langgraph langchain-anthropicimport asynciofrom langchain_mcp_adapters.client import MultiServerMCPClientfrom langgraph.prebuilt import create_react_agentasync def main():client = MultiServerMCPClient({"transcriptdock": {"url": "https://www.transcriptdock.com/mcp","transport": "streamable_http","headers": {"Authorization": "Bearer td_live_YOUR_KEY"},}})tools = await client.get_tools()agent = create_react_agent("anthropic:claude-sonnet-5-5", tools)out = await agent.ainvoke({"messages": "Summarize https://www.youtube.com/watch?v=dQw4w9WgXcQ"})print(out["messages"][-1].content)asyncio.run(main())
Os nomes das ferramentas, os argumentos e os custos em créditos estão na página MCP. O LlamaIndex e outros frameworks que falam MCP se conectam do mesmo jeito.