← Tất cả bài viết
29.07.2026

OpenAI ra mắt gpt-transcribe và gpt-live-transcribe

OpenAI ra mắt gpt-transcribe và gpt-live-transcribe
Lê Nam Khánh 4 phút đọc
Lưu ý: đây là hai mô hình dành cho nhà phát triển dùng qua API để xây dựng ứng dụng, không phải một tính năng có sẵn trong giao diện ChatGPT thông thường.

Ngày 28/7/2026, OpenAI công bố hai mô hình chuyển giọng nói thành văn bản (speech-to-text) mới qua tài khoản chính thức OpenAI Developers trên X và tài liệu API [1][2][3]. Trên bộ benchmark Common Voice với 22 ngôn ngữ, mô hình mới giảm tỷ lệ lỗi transcript từ 40,37% xuống còn 19,27% so với whisper-1, tức giảm khoảng 52% [1][5]. Cùng ngày, OpenAI đăng một video demo ngắn trên YouTube trình diễn khả năng xử lý các tình huống khó như từ vựng riêng, tiếng ồn nền và giọng đa ngôn ngữ.

Hai mô hình cho hai tình huống: xử lý file và nghe trực tiếp

OpenAI ra mắt cùng lúc hai mô hình, mỗi mô hình phục vụ một nhu cầu khác nhau:

  • gpt-transcribe: dùng cho file âm thanh đã ghi sẵn, transcript theo luồng của file, và các lượt đã chốt trong phiên Realtime qua WebSocket. Đây là lựa chọn có độ chính xác cao nhất trong dòng sản phẩm, giá 0,0045 USD mỗi phút âm thanh [2].
  • gpt-live-transcribe: dùng cho âm thanh phát trực tiếp (mic, cuộc gọi, sự kiện đang diễn ra), tối ưu cho độ trễ thấp để trả về từng đoạn văn bản gần như ngay khi người nói vừa dứt câu, giá 0,017 USD mỗi phút [3].

Cả hai được OpenAI khuyến nghị là điểm khởi đầu mặc định cho mọi tích hợp transcription mới, thay cho whisper-1 và gpt-realtime-whisper trước đây [4].

Điểm khác biệt: mô hình "nghe có ngữ cảnh" thay vì nghe từng đoạn rời rạc

Các mô hình ASR (nhận diện giọng nói tự động) trước đây thường xử lý từng đoạn âm thanh độc lập, nên rất dễ đoán sai tên riêng, thuật ngữ chuyên ngành hay số liệu. gpt-transcribe và gpt-live-transcribe được thiết kế để nhận thêm ba loại ngữ cảnh trước khi transcribe [4]:

  • Một đoạn mô tả tự do về bối cảnh bản ghi (ví dụ: "cuộc họp tiến độ dự án thanh toán QR").
  • Danh sách từ khóa: tên riêng, tên sản phẩm, thuật ngữ chuyên ngành có khả năng xuất hiện.
  • Ngôn ngữ dự kiến sẽ xuất hiện trong bản ghi.

Riêng gpt-transcribe còn có thể dùng các lượt hội thoại trước đó làm ngữ cảnh bổ sung [1]. Đây cũng chính là các tình huống được trình diễn trong video demo: gõ từ vựng tùy chỉnh vào prompt, nhận diện giữa tiếng ồn nền, xử lý audio đa ngôn ngữ, câu trả lời ngắn và số liệu, đúng với những use case OpenAI liệt kê trong thông báo chính thức [1].

Độ chính xác tăng rõ rệt nhờ có ngữ cảnh

Ngoài mức giảm lỗi trên Common Voice, OpenAI công bố thêm một benchmark mới gọi là Context Aware ASR: khi được cung cấp ngữ cảnh tự do, độ chính xác ngữ nghĩa (semantic accuracy) của gpt-transcribe tăng từ 41,6% lên 45,2% [1]. Nói cách khác, việc mô tả trước "bản ghi này về chủ đề gì, có tên riêng nào" thực sự giúp mô hình transcribe đúng hơn, không chỉ là tính năng cho có.

Vẫn còn giới hạn, và ai nên quan tâm

AlphaSignal, trang tin phân tích các mô hình AI, lưu ý một số khoảng trống của hai mô hình mới: chưa hỗ trợ timestamp theo từng từ, xuất phụ đề SRT/VTT, phân biệt người nói (speaker diarization) hay dịch sang tiếng Anh. Những nhu cầu này vẫn phải dùng whisper-1 hoặc gpt-4o-transcribe-diarize [5].

Vì đây là sản phẩm API dành cho nhà phát triển, phần lớn nhân viên sẽ không dùng trực tiếp, nhưng đây là công nghệ nền cho các công cụ ghi biên bản họp, transcript cuộc gọi khách hàng hay phụ đề video mà nhiều bên thứ ba đang tích hợp. Nếu phòng ban có nhu cầu xây dựng công cụ tương tự, đây là điểm khởi đầu kỹ thuật đáng cân nhắc thay vì các mô hình Whisper cũ.

Lưu ý an toàn: khi thử nghiệm bất kỳ công cụ transcription bên thứ ba nào (kể cả các ứng dụng dùng mô hình này), không đưa file ghi âm cuộc họp có thông tin dự án, khách hàng hay dữ liệu nội bộ nhạy cảm của VNPAY vào khi chưa được xác nhận công cụ đó an toàn.

Tài liệu tham khảo

[1] OpenAI Developers (@OpenAIDevs) trên X — thông báo ra mắt gpt-transcribe và gpt-live-transcribe (28/7/2026). https://x.com/OpenAIDevs/status/2082201169443905798

[2] OpenAI API Docs — GPT Transcribe Model. https://developers.openai.com/api/docs/models/gpt-transcribe

[3] OpenAI API Docs — GPT Live Transcribe Model. https://developers.openai.com/api/docs/models/gpt-live-transcribe

[4] OpenAI API Docs — Transcription Guide. https://developers.openai.com/api/docs/guides/transcription

[5] AlphaSignal — OpenAI Replaces Whisper With gpt-transcribe, Slashing Errors by 52% (28-29/7/2026). https://alphasignal.ai/news/openai-replaces-whisper-with-gpt-transcribe-slashing-errors-by-52