diff --git a/containers/chatterbox/server.py b/containers/chatterbox/server.py index 5d1967c..e62e9b2 100644 --- a/containers/chatterbox/server.py +++ b/containers/chatterbox/server.py @@ -3,8 +3,8 @@ import io import os import tempfile +import soundfile as sf import torch -import torchaudio as ta from fastapi import FastAPI, File, Form, HTTPException, UploadFile from fastapi.responses import StreamingResponse from pydantic import BaseModel @@ -79,7 +79,7 @@ def speech(req: SpeechRequest): ) buf = io.BytesIO() - ta.save(buf, wav, model.sr, format="wav") + sf.write(buf, wav.squeeze(0).cpu().numpy(), model.sr, format="WAV") buf.seek(0) return StreamingResponse(buf, media_type="audio/wav") @@ -114,6 +114,6 @@ def speech_clone( os.remove(tmp_path) buf = io.BytesIO() - ta.save(buf, wav, model.sr, format="wav") + sf.write(buf, wav.squeeze(0).cpu().numpy(), model.sr, format="WAV") buf.seek(0) return StreamingResponse(buf, media_type="audio/wav")