API-Übersicht
Rufen Sie Speechdash aus Ihrer eigenen Anwendung auf und erstellen Sie die API-Schlüssel, die sie autorisieren.
Die Speechdash API ermöglicht es Ihrer eigenen Anwendung, Dokumente zu erstellen und Sprache mit denselben Stimmen wie die App zu generieren. Alles, was Sie über die API erstellen, erscheint auch in Ihrer Bibliothek. Fertige Audio- und Videotranskriptionen, die in der App erstellt wurden, erscheinen ebenfalls als Bibliotheksdokumente (source ist transcription, mit einem transcript_id). Es gibt keine REST-Ressource /transcripts: Verwenden Sie stattdessen die Dokument-Endpunkte. Die API startet keine Transkriptionsjobs.
Basierend URL:
https://api.speechdash.com/v1Gesundheitsprüfung (ohne API-Schlüssel): GET https://api.speechdash.com/health
Der maschinell lesbare Vertrag wird unter https://api.speechdash.com/v1/openapi.json veröffentlicht, sodass Sie einen Client für Ihre Programmiersprache generieren können.
Endpunkte
| Methode | Pfad | Zweck |
|---|---|---|
GET | /health | Dienstgesundheit (nicht unter /v1) |
GET | /v1/openapi.json | OpenAPI 3.1-Dokument |
GET | /v1/me | Konto, Plan und Wallet |
GET | /v1/documents | Auflisten von Bibliotheksdokumenten, einschließlich fertiger Transkriptionen |
POST | /v1/documents | Erstellen eines Textdokuments (source=api) |
GET | /v1/documents/{document_id} | Lesen eines Dokuments und seines Textes |
PUT | /v1/documents/{document_id} | Aktualisieren von Titel, Text, Sprache, is_archived oder visibility |
DELETE | /v1/documents/{document_id} | Löschen eines Dokuments |
POST | /v1/documents/{document_id}/translate | Neue übersetzte Version (gleiche Guthaben wie MP3-Export) |
GET | /v1/documents/{document_id}/export | Herunterladen von pdf, docx, txt, csv, srt oder vtt |
POST | /v1/audio/speech | Synthese von bis zu 5.000 Zeichen (JSON + Audio) |
POST | /v1/audio/stream | Streamen von WAV, bis zu 20.000 Zeichen |
POST | /v1/audio/stream/with-timestamps | SSE mit Audio pro Satz und Markierungen |
GET | /v1/voices | Stimmenkatalog |
GET | /v1/voices/{voice_id} | Eine Stimme vorgeben |
Interaktive OpenAPI-Seiten: Konto, Dokumente, Audio, Stimmen.
MCP-Server (für KI-Assistenten)
Wenn Sie Cursor, Claude Desktop oder einen anderen MCP-Client verwenden, können Sie stattdessen den offiziellen Speechdash MCP-Server hinzufügen, anstatt selbst HTTP-Aufrufe zu tätigen. Er bietet dieselbe Bibliothek (inklusive fertiger Transkriptionen), Übersetzung, Export, Stimmen, Kontosnapshot und nicht-streamende Sprachsynthese als Tools, die von denselben API-Schlüsseln und Abrechnung wie in dieser Anleitung unterstützt werden. Streaming-Sprache bleibt auf REST.
Sehen Sie sich MCP-Server für die vollständige Tool-Liste und Einrichtung (stdio oder Streamable HTTP) an. Sie können auch die Agents-Hub auf der Marketing-Website für maschinell lesbare Dokumente lesen, die an KI-Systeme gerichtet sind. Endnutzer können mit API-Schlüsseln und MCP in diesem Hilfe-Center beginnen.
Einen API-Schlüssel erstellen
Öffnen Sie Einstellungen → API.
Klicken Sie auf Neuer Schlüssel und geben Sie ihm einen Namen, der angibt, wo er verwendet wird, z. B. Produktionsserver.
Kopieren Sie den Schlüssel sofort. Nur sein Präfix wird gespeichert, daher wird er einmal angezeigt und nie wieder.
Ein Schlüssel wirkt auf Ihr Konto. Bewahren Sie ihn auf Ihrem Server auf, nie in einem Browser, einer mobilen App oder einem öffentlichen Repository. Falls ein Schlüssel geleakt wird, widerrufen Sie ihn unter Einstellungen → API und erstellen Sie einen neuen.
Sie können bis zu 10 aktive Schlüssel behalten, diese jederzeit umbenennen und sehen, wann jeder zuletzt verwendet wurde. Das Widerrufen eines Schlüssels stoppt seine Anfragen sofort.
Authentifizieren einer Anfrage
Senden Sie den Schlüssel als Bearer-Token:
curl https://api.speechdash.com/v1/me \
-H "Authorization: Bearer sh_live_dein_schlüssel"Anfragen ohne gültigen Schlüssel antworten mit 401 und dem Code unauthorized.
GET /me gibt Ihre Kontonummer, E-Mail, den Plan und das Wallet-Guthaben (wallet_cents und display_credits) zurück, sowie Metadaten zum verwendeten API-Schlüssel. Verwenden Sie es, um einen Schlüssel nach der Einrichtung zu überprüfen (z. B. in Zapier).
POST /documents und POST /audio/speech akzeptieren einen optionalen Idempotency-Key-Header. Das Wiederholen desselben Schlüssels mit demselben Körper spielt die erste erfolgreiche Antwort für 24 Stunden zurück, sodass ein Netzwerkfehler kein zweites Dokument erstellt oder Sprachsynthese doppelt abrechnet. Falls eine Sprachantwort zu groß zum Speichern ist, antwortet ein erneuter Versuch mit demselben Schlüssel mit 409 statt die Antwort neu zu generieren (die ursprüngliche Anfrage wurde bereits abgerechnet). Ein Client-Abschluss bei /audio/speech antwortet mit 204, regelt jeden bereits erzeugten Audioinhalt ab und setzt den Schlüssel frei, sodass ein erneuter Versuch die Antwort neu generieren kann. Streaming-Audio-Endpunkte lehnen den Header ab.
Guthaben
Sprachsynthese verbraucht Guthaben aus demselben Wallet wie die App: 0,5 Guthaben (1 Wallet-Cent) pro gestarteten 30 Sekunden erzeugter Audioinhalte. Jede Anfrage hält eine Schätzung (plus eine kleine Marge) bevor die Generierung beginnt, und rechnet dann auf das tatsächlich erzeugte Audio ab. Nicht genutztes Guthaben wird zurückerstattet; jede abgerechnete Anfrage erscheint in Einstellungen → Guthabenverbrauch als API Sprachsynthese. Das Feld billed_credits in den API-Antworten ist in Wallet-Cents (2 Cents = 1 angezeigtes Guthaben). Falls ein Stream in der Mitte unterbrochen wird, werden die bereits gelieferten Sätze trotzdem abgerechnet.
Falls Ihr Guthaben den Halt nicht decken kann, antwortet die API mit 402 und dem Code payment_required, bevor etwas generiert wird.
Das Erstellen von Dokumenten verbraucht kein Guthaben, zählt aber auf die tägliche Dokumentenobergrenze Ihres Plans (Kostenlos: 3 pro Tag; Unlimited: keine tägliche Obergrenze) und die Upload-Dauerbegrenzungen. Der Datei-Export verbraucht kein Guthaben.
Abrechnung vs. Cloud-Wiedergabe in der App
Die in der App verfügbare Cloud-Wiederholung nutzt den pro-Dokument-Satz-Cache: Das Abspielen eines Satzes, der bereits auf dem Server generiert wurde, kann 0 angezeigte Guthaben kosten. REST- und MCP-Sprachendpunkte generieren immer frisches Audio und abrechnen pro gestarteten 30 Sekunden zum gleichen Satz, wenn die Generierung stattfindet. Es gibt keinen Wiedergabe-Cache bei API- oder MCP-Synthese.
Grenzen
| Grenze | Wert |
|---|---|
Anfragen an /documents | 120 pro Minute, pro Konto |
Anfragen an /audio/* | 60 pro Minute, pro Konto |
| Parallel laufende Sprachanfragen | 3 pro Konto |
POST /audio/speech input | 5.000 Zeichen |
POST /audio/stream input | 20.000 Zeichen |
| Dokumenttext | 500.000 Zeichen |
| Aktive API-Schlüssel | 10 |
Die Rate Limits werden pro Konto und nicht pro Schlüssel gezählt, daher erhöhen zusätzliche Schlüssel nicht Ihre Quote. Jede Antwort enthält X-Request-ID, und /documents sowie /audio/* geben zusätzlich X-RateLimit-Limit, X-RateLimit-Remaining und X-RateLimit-Reset zurück. Zitieren Sie X-Request-ID, wenn Sie den Support kontaktieren.
Sprachanfragen haben auch eine Parallelitätsgrenze: Eine vierte gleichzeitige Anfrage antwortet mit 429, während drei noch laufen, sodass eine Integration die Synthese nicht monopolisieren kann. Versuchen Sie 429 und 503 erneut nach dem Retry-After-Header.
Für Inhalte, die länger als die Sprachgrenzen sind, erstellen Sie ein Dokument mit POST /v1/documents und exportieren Sie dessen Audio aus der App.
Dokumente: teilen, übersetzen, exportieren
Serialisierte Dokumente enthalten visibility und share_url (null, wenn privat). PUT /v1/documents/{id} akzeptiert visibility, um eine unveröffentlichte, nur-lesbare Seite unter /share/document/{id} zu veröffentlichen, und is_archived, um ein Dokument zu archivieren oder wiederherzustellen. Geteilte Seiten sind textbasiert. Sie spielen keine abgerechneten Audioinhalte ab.
POST /v1/documents/{id}/translate erstellt eine neue übersetzte Version. Sie belastet dasselbe Guthaben-Wallet wie der MP3-Export (0,5 Guthaben pro gestarteten 30 Sekunden geschätzter Sprache) und antwortet mit 402, wenn das Wallet nicht ausreicht. Sie antwortet mit 503, wenn die Übersetzung nicht konfiguriert oder nicht verfügbar ist.
GET /v1/documents/{id}/export?format=pdf|docx|txt|csv|srt|vtt lädt die aktuelle Version als Anhang herunter. Fügen Sie timestamps=1 hinzu, um Abschnittszeiten in PDF, DOCX, TXT und CSV einzuschließen. SRT und VTT benötigen eine Transkription oder vollständige Satz-Timings. Gespeichertes text bei GET /v1/documents/{id} behält Transkriptions-Timestamp-Header. Diese werden nur durch eine App-Leseoption ausgeblendet.