جعبهابزار متن به گفتار، کاملاً آفلاین
تبدیل PDF به کتاب صوتی، با ریتم طبیعی و کاملاً آفلاین
pdf2speech فایل PDF شما، یا پوشهای از فایلهای مارکداون فصلبهفصل را، با گفتار مصنوعی عصبی میخواند، مکثهایی شبیه به روایت یک انسان اضافه میکند، و در پایان یک فایل MP3 و یک ویدیوی آماده برای یوتیوب تحویل میدهد. هیچ دادهای از دستگاه شما بیرون نمیرود.
این ابزار چه میکند
پنج نکته که وقتی میخواهید یک دستنوشته را به چیزی قابل شنیدن تبدیل کنید، اهمیت دارند.
آفلاین و خصوصی
همهچیز روی دستگاه خودتان اجرا میشود. نه کلید API، نه آپلود فایل، نه هزینهای که با حجم کتاب بالا برود.
صداهای طبیعی
Kokoro-82M برای روایت انگلیسی با لحنی گیرا، یا Piper وقتی سرعت مهمتر است یا زبان موردنظرتان را Kokoro پشتیبانی نمیکند.
ریتمی شبیه خواندن انسانی
اعلام عنوان فصل، مکث بعد از نقلقولهای آغازین، نفسی کوتاه بین پاراگرافها، و سکوتی بلندتر در پایان هر فصل.
آماده برای یوتیوب
ویدیوی H.264 با کیفیت 1080p و جلدی برگرفته از صفحه اول کتاب، یا یک کارت عنوان ساختهشده، بههمراه فهرست فصلها با زمانبندی واقعی برای چسباندن در توضیحات ویدیو.
چندزبانه و امتحانشده در عمل
انگلیسی، فارسی، و دانمارکی، با صداهایی که با گوش انتخاب شدهاند، نه فقط از روی یک فهرست.
روند کار
-
۱
متن خود را مشخص کنید
یک فایل PDF برای پیشنویس سریع، یا پوشهای از فایلهای مارکداون فصلبهفصل برای روایت کامل یک کتاب.
-
۲
موتور و صدا را انتخاب کنید
Kokoro برای طبیعیترین راوی انگلیسی، یا Piper برای سرعت بیشتر یا زبانی مثل فارسی و دانمارکی که Kokoro ندارد.
-
۳
فایلهای آماده انتشار را بردارید
یک MP3، یک MP4، و فایل زمانبندی فصلها کنار فایل اصلی شما قرار میگیرند، آماده برای فید کتاب صوتی یا آپلود در یوتیوب.
نصب
پنج دستور، فقط یکبار. نسخه CPU از torch باید پیش از requirements.txt نصب شود، وگرنه pip نسخه حجیم CUDA را دانلود میکند.
git clone https://github.com/cocodedk/pdf2speech
cd pdf2speech
python3 -m venv .venv
.venv/bin/pip install torch --index-url https://download.pytorch.org/whl/cpu
.venv/bin/pip install -r requirements.txt
.venv/bin/python -m piper.download_voices en_US-lessac-medium --data-dir voices
مدل Kokoro در اولین استفاده بهطور خودکار از Hugging Face دانلود میشود (حدود ۳۳۰ مگابایت). صداهای دیگر Piper، از جمله صداهای فارسی و دانمارکی، با همان دستور download_voices و نام مدل متفاوت در دسترساند.
نحوه استفاده
سه ابزار، به ترتیب حجم کتابی که به آنها میدهید.
pdf2speech: یک WAV سریع
ابزاری برای پیشنویس سریع. یک PDF ورودی، یک WAV خروجی، خواندهشده با Piper در سرعتی آرام.
./pdf2speech mybook.pdf
./pdf2speech mybook.pdf -o out.wav
make_audiobook: MP3 و MP4 از یک فایل
یک PDF یا فایل مارکداون را روایت میکند و هم MP3 و هم یک MP4 آماده برای یوتیوب، با جلدی ثابت، تولید میکند.
./make_audiobook mybook.pdf
./make_audiobook notes.md -o ~/out/ --engine kokoro --voice am_michael
narrate_book: پرچمدار فصلمحور
فایلهای مارکداون هر فصل را به ترتیب میخواند و یک MP3 و MP4 با اعلام عنوان فصل، مکث بعد از نقلقول، نفس بین پاراگراف، و سکوت پایان فصل میسازد. با هر زبانی که Piper صدا برایش داشته باشد کار میکند.
./narrate_book mybook/chapters --voice am_michael --cover-pdf book.pdf
./narrate_book mybook/persian --engine piper --voice fa_IR-ganji_adabi-medium \
--chapter-label فصل --cover-pdf mybook-fa.pdf --name mybook-fa