100% cục bộ — tệp của bạn không bao giờ rời khỏi trình duyệt
Chuyển Âm Thanh Thành Văn Bản
Công cụ chuyển âm thanh thành văn bản miễn phí, chạy hoàn toàn trong trình duyệt — tệp không rời khỏi thiết bị của bạn.
- Miễn phí
- Không cần đăng ký
- Không watermark
Cách hoạt động
- 01
Chọn bản ghi âm
Chọn một tệp âm thanh — MP3, WAV, M4A, AAC, OGG hay FLAC — hoặc một tệp video, phần âm thanh sẽ được tách sẵn cho bạn. Không có gì được tải lên ở bất kỳ bước nào.
- 02
Chọn ngôn ngữ được nói
Hãy tự chọn ngôn ngữ thay vì để máy đoán. Đoán sai không báo lỗi rõ ràng: nó tạo ra văn bản trôi chảy nhưng bịa đặt, rất khó nhận ra là sai.
- 03
Sao chép hoặc xuất
Bản ghi hiện ra bên dưới, sẵn sàng để sao chép. Xuất TXT cho văn bản thuần, hoặc SRT và VTT nếu bạn cần mốc thời gian để làm phụ đề.
Vì sao chọn TranscriptSnap
Dành cho những bản ghi không thể tải lên
Ghi chú bệnh nhân, lời khai, phỏng vấn nguồn tin, âm thanh chiến dịch chưa ra mắt. Xử lý cục bộ không làm giảm rủi ro tiết lộ — nó loại bỏ việc tiết lộ, vì không có bên thứ ba nào tham gia ở bất kỳ khâu nào.
Không giới hạn độ dài lẫn số lượng
Không có máy chủ nào để đặt ra giới hạn. Bản ghi dài được cắt thành các cửa sổ chồng lấn rồi ghép lại tự động; trần thật sự duy nhất là bộ nhớ máy bạn.
Vẫn chạy khi không có mạng
Sau lượt đầu tiên, mô hình nằm trong bộ nhớ đệm, nên bạn có thể xử lý trên máy bay hoặc trong văn phòng bị chặn mạng. Đây cũng là cách đơn giản nhất để chứng minh công cụ chạy cục bộ — ngắt mạng rồi thử lại.
Mọi định dạng âm thanh thông dụng, và cả video
MP3, WAV, M4A, AAC, OGG và FLAC đều chạy được, MP4, MOV và WebM cũng vậy — phần âm thanh sẽ được tách sẵn cho bạn. Không cần chuyển đổi gì trước.
Điều nên biết
Công cụ chuyển âm thanh thành văn bản với quyền riêng tư thực sự
Hầu hết công cụ khác đều tải bản ghi âm của bạn lên máy chủ. Công cụ này thì không: mô hình giọng nói chạy ngay trong trình duyệt bằng WebAssembly, nên âm thanh ở lại trên máy bạn. Nhờ vậy nó an toàn cho phỏng vấn, ghi chú y tế, ghi âm pháp lý và mọi thứ bạn không muốn giao cho bên thứ ba.
Dùng được ngoại tuyến sau lần tải đầu
Mô hình được lưu vào bộ nhớ đệm sau lần chạy đầu tiên, nên lần sau bạn có thể chuyển âm thanh thành văn bản mà không cần kết nối mạng. Không tính phí theo phút, không giới hạn dung lượng.
Định dạng hỗ trợ và nên đưa vào tệp thế nào
MP3, WAV, M4A, AAC, OGG và FLAC đều chạy được, các định dạng video phổ biến như MP4, MOV và WebM cũng vậy — phần âm thanh sẽ được tách ra giúp bạn. Chất lượng thu quan trọng hơn định dạng rất nhiều: bản ghi 128 kbps của một người nói rõ ràng ngay sát micro vẫn hơn hẳn tệp lossless thu từ đầu bên kia căn phòng. Nếu được chọn, hãy thu mono ở 16 kHz trở lên và giữ người nói ở gần micro.
Tệp dài được xử lý ra sao
Mô hình giọng nói làm việc trên các đoạn ngắn, nên bản ghi dài sẽ được cắt thành nhiều khối có phần chồng lấn rồi ghép lại. Chính phần chồng lấn đó giữ cho câu không bị cắt đôi ở chỗ nối — nếu bạn từng thấy bản ghi mà chữ biến mất đều đặn một cách đáng ngờ, đó là công cụ đã bỏ qua bước này. Tệp rất dài bị giới hạn bởi bộ nhớ máy bạn chứ không phải bởi giới hạn tải lên nào, nên một tiếng âm thanh chạy thoải mái trên laptop và có thể nặng với điện thoại.
Công cụ này dành cho ai
Chuyện quyền riêng tư ở đây không hề trừu tượng. Tải âm thanh có thể nhận dạng bệnh nhân lên một dịch vụ khi chưa có thỏa thuận là vi phạm quy định trong ngành y. Bản ghi của thân chủ được bảo mật nghề nghiệp trong ngành luật. Với báo chí, bản ghi nguồn tin chính là toàn bộ công việc, và một bên xử lý trung gian là lỗ hổng tấn công có thật. Tài liệu chiến dịch chưa công bố và đang trong thỏa thuận bảo mật thì thường không được phép gửi cho nhà cung cấp chưa được duyệt. Trong tất cả những trường hợp đó, xử lý ngay trên máy không chỉ giảm rủi ro — nó xóa bỏ hoàn toàn việc tiết lộ dữ liệu, vì chẳng có bên thứ ba nào tham gia.
Cách sửa kết quả cho nhanh
Hãy đọc lướt bản ghi một lượt trong lúc nghe lại, thay vì sửa từng chữ một. Lỗi thường dồn vào tên người, tên sản phẩm và thuật ngữ chuyên ngành, nên chỉ cần tìm và thay thế vài tên riêng xuất hiện trong bản ghi là đã xử lý được phần lớn. Dấu câu là do mô hình suy ra chứ không phải nghe thấy, nên chỗ ngắt câu trong đoạn nói nhanh đáng để xem lại lần nữa. Phần còn lại thường đã đủ tốt để giữ nguyên.
Câu hỏi thường gặp
Công cụ này thực sự miễn phí chứ?
Đúng vậy, và không giới hạn. Vì việc xử lý diễn ra trên thiết bị của bạn nên không có chi phí máy chủ để tính vào.
Âm thanh của tôi có bị tải lên đâu đó không?
Không. Tệp được đọc cục bộ và xử lý trong trình duyệt. Không có gì được gửi lên máy chủ.
Hỗ trợ những định dạng nào?
MP3, WAV, M4A, AAC, OGG, FLAC và các tệp video phổ biến như MP4 và MOV.
Độ chính xác thế nào?
Công cụ dùng OpenAI Whisper, cùng dòng mô hình mà hầu hết dịch vụ trả phí đang dùng. Với giọng nói rõ ràng, kết quả thường rất sát nguyên văn.
Vì sao lần chạy đầu chậm hơn?
Mô hình được tải về một lần rồi lưu đệm. Những lần sau sẽ bắt đầu ngay lập tức.
Tôi kiểm chứng được là không có gì bị tải lên không?
Được, và bạn nên kiểm chứng. Hãy mở bảng Network của trình duyệt trước khi chuyển đổi: bạn sẽ thấy các tệp mô hình tải về ở lần chạy đầu tiên và không có gì khác nữa. Hoặc ngắt mạng sau khi mô hình đã được lưu đệm rồi vẫn chuyển đổi bình thường — đó là điều không công cụ nào giả vờ được.
Có dùng được trên điện thoại không?
Có, tuy điện thoại chậm hơn laptop khá nhiều và bản ghi dài có thể làm cạn bộ nhớ máy. Với đoạn ngắn thì hoàn toàn ổn.
Điểm yếu của công cụ là gì?
Những chỗ yếu nhất là nhiều người nói chồng tiếng, tên riêng, và giọng vùng miền nặng trên nền ồn. Công cụ cũng không ghi rõ ai đang nói.
Chuyển âm thanh thành văn bản miễn phí mà không giao tệp cho ai
Phần lớn công cụ chuyển âm thanh thành văn bản là công cụ chạy trên máy chủ: bạn tải lên, máy của họ nghe, bạn nhận lại chữ và số phút được tính. Mô hình đó ổn với một podcast đằng nào cũng sẽ công khai, và không ổn với phần lớn những gì người ta thật sự ghi âm. Công cụ này biên dịch mô hình giọng nói vào trình duyệt bằng WebAssembly, nên bản ghi được đọc từ ổ đĩa và xử lý ngay tại chỗ nó vốn nằm. Kết quả vẫn là đầu ra Whisper mà các dịch vụ trả phí dùng, nhưng không cần tài khoản, không tính tiền theo phút.