pdf2speech

جعبه‌ابزار متن به گفتار، کاملاً آفلاین

تبدیل PDF به کتاب صوتی، با ریتم طبیعی و کاملاً آفلاین

pdf2speech فایل PDF شما، یا پوشه‌ای از فایل‌های مارک‌داون فصل‌به‌فصل را، با گفتار مصنوعی عصبی می‌خواند، مکث‌هایی شبیه به روایت یک انسان اضافه می‌کند، و در پایان یک فایل MP3 و یک ویدیوی آماده برای یوتیوب تحویل می‌دهد. هیچ داده‌ای از دستگاه شما بیرون نمی‌رود.

این ابزار چه می‌کند

پنج نکته که وقتی می‌خواهید یک دست‌نوشته را به چیزی قابل شنیدن تبدیل کنید، اهمیت دارند.

آفلاین و خصوصی

همه‌چیز روی دستگاه خودتان اجرا می‌شود. نه کلید API، نه آپلود فایل، نه هزینه‌ای که با حجم کتاب بالا برود.

صداهای طبیعی

Kokoro-82M برای روایت انگلیسی با لحنی گیرا، یا Piper وقتی سرعت مهم‌تر است یا زبان موردنظرتان را Kokoro پشتیبانی نمی‌کند.

ریتمی شبیه خواندن انسانی

اعلام عنوان فصل، مکث بعد از نقل‌قول‌های آغازین، نفسی کوتاه بین پاراگراف‌ها، و سکوتی بلندتر در پایان هر فصل.

آماده برای یوتیوب

ویدیوی H.264 با کیفیت 1080p و جلدی برگرفته از صفحه اول کتاب، یا یک کارت عنوان ساخته‌شده، به‌همراه فهرست فصل‌ها با زمان‌بندی واقعی برای چسباندن در توضیحات ویدیو.

چندزبانه و امتحان‌شده در عمل

انگلیسی، فارسی، و دانمارکی، با صداهایی که با گوش انتخاب شده‌اند، نه فقط از روی یک فهرست.

روند کار

  1. ۱

    متن خود را مشخص کنید

    یک فایل PDF برای پیش‌نویس سریع، یا پوشه‌ای از فایل‌های مارک‌داون فصل‌به‌فصل برای روایت کامل یک کتاب.

  2. ۲

    موتور و صدا را انتخاب کنید

    Kokoro برای طبیعی‌ترین راوی انگلیسی، یا Piper برای سرعت بیشتر یا زبانی مثل فارسی و دانمارکی که Kokoro ندارد.

  3. ۳

    فایل‌های آماده انتشار را بردارید

    یک MP3، یک MP4، و فایل زمان‌بندی فصل‌ها کنار فایل اصلی شما قرار می‌گیرند، آماده برای فید کتاب صوتی یا آپلود در یوتیوب.

نصب

پنج دستور، فقط یک‌بار. نسخه CPU از torch باید پیش از requirements.txt نصب شود، وگرنه pip نسخه حجیم CUDA را دانلود می‌کند.

git clone https://github.com/cocodedk/pdf2speech
cd pdf2speech
python3 -m venv .venv
.venv/bin/pip install torch --index-url https://download.pytorch.org/whl/cpu
.venv/bin/pip install -r requirements.txt
.venv/bin/python -m piper.download_voices en_US-lessac-medium --data-dir voices

مدل Kokoro در اولین استفاده به‌طور خودکار از Hugging Face دانلود می‌شود (حدود ۳۳۰ مگابایت). صداهای دیگر Piper، از جمله صداهای فارسی و دانمارکی، با همان دستور download_voices و نام مدل متفاوت در دسترس‌اند.

نحوه استفاده

سه ابزار، به ترتیب حجم کتابی که به آن‌ها می‌دهید.

pdf2speech: یک WAV سریع

ابزاری برای پیش‌نویس سریع. یک PDF ورودی، یک WAV خروجی، خوانده‌شده با Piper در سرعتی آرام.

./pdf2speech mybook.pdf
./pdf2speech mybook.pdf -o out.wav

make_audiobook: MP3 و MP4 از یک فایل

یک PDF یا فایل مارک‌داون را روایت می‌کند و هم MP3 و هم یک MP4 آماده برای یوتیوب، با جلدی ثابت، تولید می‌کند.

./make_audiobook mybook.pdf
./make_audiobook notes.md -o ~/out/ --engine kokoro --voice am_michael

narrate_book: پرچمدار فصل‌محور

فایل‌های مارک‌داون هر فصل را به ترتیب می‌خواند و یک MP3 و MP4 با اعلام عنوان فصل، مکث بعد از نقل‌قول، نفس بین پاراگراف، و سکوت پایان فصل می‌سازد. با هر زبانی که Piper صدا برایش داشته باشد کار می‌کند.

./narrate_book mybook/chapters --voice am_michael --cover-pdf book.pdf

./narrate_book mybook/persian --engine piper --voice fa_IR-ganji_adabi-medium \
    --chapter-label فصل --cover-pdf mybook-fa.pdf --name mybook-fa