Trình tạo video

Đánh giá Synthesia: Avatar AI Thật Đến Nỗi Tôi Sợ Hãi

mm
Thêm Unite.AI vào các nguồn ưu tiên của bạn trên Google
Công bố:

Unite.AI có thể nhận thù lao khi bạn dùng liên kết đến sản phẩm chúng tôi đánh giá. Điều này không ảnh hưởng đến đánh giá biên tập của chúng tôi. Đọc công bố liên kết của chúng tôi.

A woman generating an AI avatar clone that looks just like her.

Nếu bạn từng phải làm một video đào tạo, bạn sẽ biết phần phiền phức không phải là viết kịch bản. Đó là việc tìm người thuyết trình, lắp đặt máy quay, quay nhiều lần, và sau đó phải làm lại tất cả khi có thay đổi.

Đó là vấn đề mà trình tạo video AI như Synthesia được thiết kế để giải quyết. Nó cho phép bạn biến một kịch bản thành video có người thuyết trình mà không cần máy quay hay người thuyết trình thực, sau đó cập nhật bằng cách thay đổi văn bản thay vì quay lại. Synthesia cho biết hơn 90% các công ty trong Fortune 100 sử dụng nền tảng này, điều này cho bạn một ý tưởng rõ ràng về đối tượng mục tiêu: các doanh nghiệp cần tạo nhiều video đào tạo và nội bộ.

Nhưng những người thuyết trình AI này thực sự thực tế như thế nào khi bạn sử dụng chúng? Tôi đã đưa Synthesia qua năm bài kiểm tra, bao gồm tạo video đào tạo từ PDF, tạo một avatar của bản thân, lồng tiếng video sang tiếng Tây Ban Nha, và để một avatar trình diễn một mẹo an toàn trong kho. Kết quả thực sự ấn tượng ở một số khía cạnh, nhưng tôi cũng phát hiện một vài điểm muốn sửa trước khi xuất bản.

Trong bài đánh giá Synthesia này, tôi sẽ cho bạn thấy nó hoạt động như thế nào, nơi nào đã gây ấn tượng và nơi nào tôi cho rằng vẫn còn thiếu sót. Tôi sẽ kết thúc bài viết bằng cách so sánh nó với ba lựa chọn thay thế hàng đầu của tôi: HeyGen, AI Studios, và Colossyan. Khi đọc xong, bạn sẽ biết công cụ nào phù hợp với mình!

Kết luận

Synthesia là một nền tảng video AI được xây dựng chủ yếu cho đào tạo và truyền thông nội bộ. Điểm mạnh lớn nhất của nó là tạo video nhanh chóng, avatar thực tế, khả năng lồng tiếng và bản địa hoá mạnh mẽ, và cập nhật dễ dàng. Các bài kiểm tra của tôi cũng cho thấy công nghệ sao chép giọng nói và avatar tùy chỉnh của nó có thể rất thuyết phục. Tuy nhiên, gói miễn phí có giới hạn, và các video vẫn cần được con người kiểm duyệt đối với các yếu tố như cảnh phụ (b-roll), bố cục văn bản và đoạn hành động. Ngoài ra, avatar cá nhân cũng không thể hoàn toàn tái hiện chính xác người thật.

Ưu và Nhược điểm

  • Nhanh chóng chuyển kịch bản hoặc đề xuất thành video hoàn chỉnh, chuyên nghiệp, chất lượng cao mà không cần diễn viên, bộ phim trường, hay máy quay.
  • Chọn trong hơn 240 avatar và hơn 1.000 giọng nói ở hơn 160 ngôn ngữ.
  • Avatar Express-2 sử dụng cử chỉ tay và cơ thể thay vì chỉ nói vào máy quay.
  • Tạo các trang phục, bối cảnh và đoạn hành động khác nhau cho cùng một avatar.
  • Lồng tiếng video sang hơn 140 ngôn ngữ với đồng bộ môi và sao chép giọng nói.
  • Thay đổi kịch bản thay vì quay lại toàn bộ video khi cập nhật.
  • Thêm các câu đố tương tác, nút nhấn có thể click và các lộ trình khác nhau trong video.
  • Xuất video dưới dạng tệp SCORM cho các nền tảng học tập, giúp đào tạo dễ dàng.
  • Tạo avatar cá nhân yêu cầu ghi âm đồng ý trực tiếp để ngăn người khác tạo avatar của bạn mà không có sự cho phép.
  • Đáp ứng các tiêu chuẩn bảo mật và quyền riêng tư quan trọng, bao gồm SOC 2 Type II, ISO 42001 và GDPR.
  • Gói miễn phí để dùng thử Synthesia mà không cần thẻ tín dụng trước khi thanh toán.
  • Trong các thử nghiệm của tôi, bản sao giọng nói nghe khá giống với giọng thật của tôi.
  • Avatar tùy chỉnh trong bài kiểm tra đào tạo an toàn của tôi trông nhất quán và thực tế, ngay cả khi thực hiện hành động.
  • Gói Starter bao gồm 10 phút video mỗi tháng, trong khi Creator bao gồm 30 phút.
  • Creator đắt hơn nhiều so với Starter, và đây là gói mà tính năng phân nhánh và truy cập API bắt đầu.
  • Bạn chỉ được truy cập vào chín avatar trong gói miễn phí, vì vậy không thể thử toàn bộ thư viện avatar miễn phí.
  • Bạn phải nâng cấp để có thể tải video về.
  • Các bài kiểm tra của tôi phát hiện các vấn đề với b-roll do AI tạo, bố cục văn bản, độ dài video và đoạn hành động, vì vậy một số video vẫn cần được chỉnh sửa.
  • Avatar cá nhân của tôi trông thực tế, nhưng nó không nắm bắt đủ khuôn mặt hay cử chỉ của tôi để có thể được xem là tôi.

Synthesia là gì?

 

Synthesia là một nền tảng video AI chuyển văn bản thành video được trình bày bởi các avatar AI thực tế.

Nó được thành lập tại London vào năm 2017 bởi Victor Riparbelli, Steffen Tjerrild và các nhà nghiên cứu AI Lourdes Agapito và Matthias Niessner. Vào tháng 1 năm 2026, nó đã huy động 200 triệu đô la trong vòng Series E với định giá 4 tỷ đô la, do GV (Google Ventures) dẫn đầu. Synthesia cho biết nó được hơn 90% các công ty trong Fortune 100 sử dụng và có hơn một triệu người dùng.

Những con số đó cho bạn biết Synthesia thực sự được xây dựng cho ai. Nó không phải là công cụ sáng tạo để làm các đoạn phim điện ảnh. Đó là công cụ sản xuất cho các công ty cần nhiều video giải thích có thương hiệu, đặc biệt là cho đào tạo.

Cách Synthesia Hoạt Động

Trong thực tế, một video Synthesia bắt đầu bằng một kịch bản. Bạn có thể tự viết, hoặc mô tả những gì bạn muốn và để AI Assistant soạn thảo kịch bản và bố trí các cảnh dựa trên bộ nhận diện thương hiệu của bạn. Mỗi cảnh sẽ có một avatar, một bố cục, văn bản trên màn hình và phương tiện, và avatar sẽ đọc phần kịch bản của mình.

Khi bạn render, Synthesia tạo ra giọng nói, chuyển động môi và cử chỉ của avatar. Sau đó bạn có thể xuất kết quả dưới dạng MP4, embed, hoặc gói SCORM cho nền tảng học tập của mình. Khi có chi tiết nào thay đổi sau này, bạn chỉnh sửa văn bản và render lại thay vì phải đặt lại người thuyết trình.

Các Avatar Đã Vượt Ra Ngoài Việc Chỉ Nói Đầu

Thay đổi lớn nhất là các avatar tự chúng. Với Synthesia 3.0 phiên bản vào tháng 10 năm 2025, Synthesia đã giới thiệu Express-2, một mô hình cho avatar có các cử chỉ toàn thân thay vì chỉ một khuôn mặt di chuyển.

Vào một tháng sau, họ thêm avatar có thể tùy chỉnh nơi bạn mô tả trang phục (“áo khoác phản quang,” “đồng phục bệnh viện”) và bối cảnh, sau đó yêu cầu một đoạn clip hành động ngắn phát ngay sau khi một câu được nói. Vào tháng 7 năm 2026, Synthesia đã công bố Express-3, mà họ gọi là mô hình sống động nhất đến nay, cùng với Dubbing 2.0.

Bạn cũng có thể tạo một avatar của chính mình. Tải lên một ảnh chất lượng cao hoặc video ngắn, tùy chọn sao chép giọng nói của bạn, và ghi lại một tuyên bố đồng ý trực tiếp trên camera. Bước đồng ý này không thể bỏ qua hoặc tải lên từ nguồn khác, đây là một biện pháp an toàn quan trọng cho công cụ có khả năng đặt lời nói vào miệng người khác.

Từ Video Đến Cuộc Trò Chuyện

Synthesia cũng đang chuyển từ các video một chiều sang các video tương tác. Các video có thể bao gồm CTA có thể nhấp, các nhánh đường đi và câu đố. Roleplay Sessions (ra mắt tháng 7 năm 2026) cho phép nhân viên thực hành các cuộc trò chuyện thực tế với một avatar, và Interactive Avatar API cho phép các công ty nhúng avatar đồng bộ môi thực thời gian thực vào sản phẩm của họ.

Điều khiến tôi ngạc nhiên nhất là chất lượng của các video avatar cốt lõi đã rất tốt. Các avatar, bản sao giọng nói và đồng bộ môi đủ thuyết phục để sử dụng trong các video đào tạo thực tế, nhưng các chi tiết phụ vẫn cần sự kiểm tra của con người.

Các đoạn b-roll, bố cục văn bản, thời lượng và clip hành động ngắn do AI tạo ra đều gặp vấn đề trong các thử nghiệm của tôi, vì vậy Synthesia có thể đưa bạn gần tới mục tiêu. Tuy nhiên, tôi sẽ không công bố một video nếu chưa xem qua toàn bộ trước.

Synthesia Phù Hợp Nhất Cho Ai?

Đây là những đối tượng Synthesia phù hợp nhất:

  • Các đội ngũ đào tạo có thể chuyển các chính sách và quy trình tiêu chuẩn thành các bài học video ngắn, thêm câu đố, chia sẻ chúng qua hệ thống học tập của họ, và cập nhật bài học bằng cách thay đổi kịch bản thay vì quay lại.
  • Các đội nhân sự và onboarding có thể tạo video chào mừng và hướng dẫn về lợi ích, sau đó cập nhật chúng mỗi năm mà không cần đặt người thuyết trình và quay lại.
  • Các công ty có đội ngũ quốc tế có thể tạo một video một lần và lồng tiếng sang hơn 140 ngôn ngữ thay vì thuê diễn viên lồng tiếng cho mỗi thị trường. Đây là một công cụ dịch video AI thực tiễn cho các đội đã tạo video trong Synthesia.
  • Các đội sản phẩm có thể tạo các bản demo tính năng và cập nhật sản phẩm với cùng một người thuyết trình, sử dụng avatar có thể tùy chỉnh để trình diễn sản phẩm trong hoạt động.
  • Các đội hỗ trợ khách hàng có thể tạo các video hướng dẫn ngắn trả lời các câu hỏi thường gặp, điều này hoạt động tốt cùng với công cụ hỗ trợ khách hàng AI.
  • Các đội bán hàng có thể luyện tập xử lý phản đối bằng Roleplay Sessions.
  • Người tạo khóa học không muốn xuất hiện trên camera có thể trình bày bài học bằng một avatar có sẵn hoặc avatar cá nhân của mình.
  • Các ngành được quản lý (tài chính, y tế, dược phẩm) có thể tận dụng SOC 2 Type II, ISO 42001 và tuân thủ GDPR của Synthesia cùng với việc tạo avatar dựa trên sự đồng ý, giúp dễ dàng vượt qua đánh giá bảo mật hơn hầu hết các đối thủ.
  • Các ngành được quản lý như tài chính, y tế và dược phẩm có thể sử dụng chứng nhận bảo mật và riêng tư của Synthesia, cùng với avatar dựa trên sự đồng ý, để làm cho các đánh giá bảo mật trở nên dễ dàng hơn.

Các Tính Năng Chính của Synthesia

Đây là những tính năng chính mà tôi nhận thấy nổi bật:

  • Trợ lý AI: Chuyển một lời nhắc, tài liệu hoặc ý tưởng thành bản thảo video kịch bản, cảnh từng cảnh, tuân theo bộ nhận diện thương hiệu của bạn.
  • Avatar có sẵn: hơn 240 người thuyết trình trên gói Enterprise (hơn 180 trên Creator, hơn 125 trên Starter), với các cử chỉ và biểu cảm thực tế.
  • Avatar Express-2 và Express-3: các mô hình avatar mới nhất của Synthesia. Express-2 bổ sung chuyển động toàn thân và cử chỉ tay, trong khi Express-3 mang lại hình ảnh sắc nét hơn và đồng bộ môi chính xác hơn.
  • Avatar có thể tùy chỉnh: Yêu cầu trang phục, bối cảnh và clip hành động (B-roll) của avatar trong cùng trình chỉnh sửa với các đoạn nói (A-roll). Sau đó, lưu chúng vào thư viện của bạn cho đội ngũ.
  • Trình tạo Avatar: Tạo một avatar thực tế hoặc phong cách từ lời nhắc.
  • Avatar cá nhân: Phiên bản kỹ thuật số của bạn, được tạo từ ảnh hoặc video ngắn, với tùy chọn sao chép giọng nói và yêu cầu đồng ý trực tiếp bắt buộc.
  • Giọng nói & Nhân bản giọng nói: hơn 1.000 giọng AI trên hơn 160 ngôn ngữ. Express-Voice sao chép giọng của bạn trong khi giữ nguyên giọng địa phương và phong cách nói.
  • AI Dubbing: Tải lên tệp MP4, MOV hoặc WebM (hoặc dán liên kết YouTube) và nhận lại video bằng hơn 140 ngôn ngữ với đồng bộ môi. Nó phát hiện nhiều người nói và sao chép mỗi giọng riêng biệt.
  • 1-Click Translation: Dịch các video được tạo bằng Synthesia sang hơn 160 ngôn ngữ.
  • Tính năng tương tác: CTA có thể nhấp và các nhánh đường đi có sẵn trên gói Creator trở lên, câu đố chỉ có trên gói Enterprise.
  • Roleplay Sessions: Luyện tập hội thoại với avatar và nhận phản hồi. Các gói tự phục vụ bao gồm 10 buổi mỗi tháng, với 25 buổi mỗi tháng trên Enterprise.
  • Bộ công cụ thương hiệu & Mẫu: hơn 60 mẫu cùng khả năng thêm phông chữ, màu sắc và logo riêng của bạn để duy trì tính nhất quán cho video.
  • Live Collaboration & Kiểm soát phiên bản: Chỉnh sửa đồng thời thời gian thực (chỉ trên Enterprise) và cập nhật một cú nhấp cho các video đã xuất bản.
  • Export & Analytics: MP4 Full HD, nhúng và xuất SCORM, cùng phân tích lượt xem, tỷ lệ rời bỏ và tỷ lệ hoàn thành.
  • API & API Avatar tương tác: Tạo video bằng lập trình từ gói Creator trở lên, và avatar nhúng thời gian thực cho doanh nghiệp.
  • API & Avatar tương tác: Tạo video bằng API trên gói Creator và thêm avatar trực tiếp vào ứng dụng.

Kiểm Tra Thực Tế: Synthesia Thực Sự Tạo Ra Gì

Đây là các thử nghiệm tôi đã thực hiện với Synthesia. Đối với mỗi thử nghiệm, tôi tập trung vào video cuối cùng: mức độ tự nhiên về hình ảnh và âm thanh, độ chính xác, và mức độ cần chỉnh sửa trước khi công bố.

Kiểm Tra 1: Video Chào Mừng Nhân Viên Mới

Trong thử nghiệm đầu tiên, tôi đã sử dụng Trợ lý AI để tạo video giới thiệu nhân viên mới chỉ từ một lời nhắc:

“Tạo một video chào mừng dài 90 giây cho nhân viên mới tại công ty phần mềm vừa phải. Bao gồm ba giá trị cốt lõi của chúng tôi, nơi tìm sổ tay nhân viên, và người liên hệ trong tuần đầu tiên. Giọng điệu thân thiện nhưng chuyên nghiệp.”

Tôi chọn tùy chọn độ dài “Short” và để Trợ lý tạo video.

Video mất 9 phút để tạo và độ dài chỉ 56 giây thay vì 90 giây tôi yêu cầu trong lời nhắc. Tôi nghi ngờ cài đặt độ dài “Short” đã ưu tiên hơn độ dài trong lời nhắc, vì vậy nếu bạn cần thời lượng cụ thể, hãy chọn tùy chọn độ dài phù hợp.

Nhận Xét Của Tôi

Kịch bản là phần tốt nhất. Nó nghe thuyết phục, bao phủ những gì tôi yêu cầu và nắm bắt đúng giọng điệu thân thiện, chuyên nghiệp từ lời nhắc của tôi.

Cử chỉ và biểu cảm khuôn mặt của avatar trông thật tự nhiên, và video tự nó có chất lượng cao. Avatar trông rất thực tế, mặc dù tôi vẫn nghĩ hầu hết mọi người sẽ nhận ra nó được tạo bằng AI. Cô ấy trông hơi “hoàn hảo” quá, nếu có thể diễn đạt được.

Synthesia cũng thêm đoạn b-roll do AI tạo phù hợp với kịch bản, nhưng ở đây video thực sự gặp vấn đề. Trong một cảnh, avatar mở một cuốn sổ tay và cuốn sổ biến mất. Trong một cảnh khác, avatar mở một chiếc laptop và nó cũng biến mất. Tốc độ khung hình của b-roll cũng trông giật hơn so với cảnh avatar, khiến các chuyển cảnh giữa chúng trở nên rõ rệt.

Nhìn chung, tôi sẵn sàng sử dụng kịch bản và các đoạn avatar như hiện tại. Tuy nhiên, tôi sẽ thay thế hoặc cắt bỏ các đoạn b-roll trước khi chia sẻ với nhân viên mới, vì những lỗi này chính là những gì khiến người xem nhận ra họ đang xem nội dung do AI tạo.

Kiểm Tra 2: Chuyển Đổi Tài Liệu Hiện Có Thành Video Đào Tạo

Trong thử nghiệm tiếp theo, tôi tải lên file PDF của Chính sách biên tập của Unite.ai lên Trợ lý AI và đưa cho nó lời nhắc sau:

“Chuyển đổi chính sách biên tập này thành video đào tạo dài 2 phút cho các nhà văn mới của Unite.ai. Bao gồm các quy tắc quan trọng nhất họ cần tuân thủ, và kết thúc bằng bản tóm tắt ngắn các điểm chính.”

Tôi không chỉnh sửa dàn ý trước khi tạo. Trợ lý tự chọn phong cách “Dusk” và kiểu trình bày “Presentation”. Trên gói Starter, tôi không thể thêm bộ công cụ thương hiệu hay câu đố, vì chúng yêu cầu gói Enterprise và Creator.

Video mất 11 phút để tạo, lâu hơn video chào mừng trong Kiểm Tra 1 khoảng 2 phút. Nó cũng có độ dài 3 phút, mặc dù tôi yêu cầu 2 phút.

Vì vậy trong Kiểm Tra 1 video quá ngắn, còn ở đây lại quá dài. Bạn không thể tin rằng Synthesia sẽ đạt đúng thời lượng bạn yêu cầu trong lời nhắc.

Nhận Xét Của Tôi

Kịch bản lại là điểm nổi bật. Nó phù hợp tốt với chính sách biên tập, và văn bản cùng đồ họa trên màn hình chính xác với tài liệu gốc. Tôi không thấy nó tự tạo ra bất kỳ quy tắc nào, điều mà tôi lo lắng nhất khi đưa cho nó một chính sách thực tế.

Avatar trông rất chất lượng cao, với biểu cảm khuôn mặt và cử chỉ tay tuyệt vời. Nhưng nó trông hơi quá hoàn hảo, và tôi nghĩ đó chính là điều sẽ khiến người xem nhận ra nó là AI. Các chuyển động môi chính xác, nhưng chúng có vẻ hơi quá nhấn mạnh, như thể avatar đang phát âm quá rõ ràng từng từ.

Khuyết điểm hình ảnh lớn nhất là bố cục văn bản. Trong một cảnh, chữ “g” ở cuối từ “Advertising” bị ngắt xuống dòng riêng, trông lộn xộn. Đây là một lỗi nhanh chóng sửa được trong trình chỉnh sửa, nhưng là loại sai sót bạn cần phát hiện trước khi chia sẻ video.

Nhìn chung, video này cho kết quả sử dụng tốt hơn Test 1. Tôi tin nội dung, nhưng vẫn sẽ xem video từ đầu đến cuối để phát hiện các lỗi bố cục, và sẽ cắt bớt để đạt độ dài tôi thực sự muốn.

Test 3: Tạo Avatar Cá Nhân Của Chính Mình

Tiếp theo, tôi tạo một avatar cá nhân của mình từ một bức ảnh, với bản sao giọng nói và bản ghi đồng ý trực tiếp bắt buộc của Synthesia. Synthesia cũng yêu cầu tôi mô tả trang phục và môi trường xung quanh, vì vậy tôi mô tả chính xác những gì tôi đang mặc và căn phòng tôi đang ở để giữ so sánh công bằng.

Sau đó tôi để avatar của mình đọc một đoạn văn ngắn mà tôi chưa từng ghi âm, và quay lại mình đọc cùng đoạn văn để có thể so sánh hai bên cạnh nhau.

Đây là tôi thật:

Và đây là avatar Synthesia của tôi đọc cùng đoạn văn:

Nhận xét của tôi

Nhìn riêng, avatar trông xác thực và chất lượng cao. Nhưng khi đặt cạnh tôi thật, nó không thực sự giống tôi.

Tôi cảm thấy sự khác biệt vật lý lớn nhất là miệng của tôi. Nó không di chuyển hay trông giống miệng thực của tôi, và tôi cảm thấy cách biểu cảm của avatar không nắm bắt được tính cách của tôi. Avatar có vẻ hào hứng hơn tôi trong đời thực.

Điều này phù hợp với những gì tôi nhận thấy ở Test 2, khi các chuyển động môi của avatar mặc định trông quá nhấn mạnh. Các avatar của Synthesia dường như mặc định theo phong cách biểu cảm phóng đại, năng động.

Tuy nhiên, bản sao giọng nói là phần tôi cảm thấy hiệu quả nhất. Nó thực sự nghe giống tôi.

Nhưng thành thật mà nói, tôi thấy toàn bộ quá trình khá rùng rợn. Dù sao, tôi sẽ không dùng avatar này thay mình trên camera. Bản sao giọng nói đủ thuyết phục, nhưng khuôn mặt và biểu cảm không đủ gần gũi để có thể lừa được người biết tôi.

Test 4: Lồng Tiếng Video Thực Thành Tiếng Tây Ban Nha

Đối với test 4, tôi đã sử dụng AI Dubbing của Synthesia để dịch một video nói chuyện trực tiếp bằng tiếng Anh của mình sang tiếng Tây Ban Nha. Đó là cùng một video tôi đã lồng tiếng trong đánh giá ElevenLabs, vì vậy tôi có thể so sánh hai công cụ một cách trực tiếp.

Đây là video gốc bằng tiếng Anh:

 

Đây là bản lồng tiếng Tây Ban Nha của Synthesia:

 

Và đây là phiên bản ElevenLabs để so sánh:

 

Việc lồng tiếng mất 14 phút trên Synthesia, lâu hơn tôi dự đoán cho một video ngắn như vậy. Nó đã sử dụng 287 trong số 800 credit hàng tháng của tôi, vì vậy một bản lồng tiếng ngắn đã tốn hơn một phần ba hạn mức của tôi.

Nhận xét của tôi

Đồng bộ môi thực sự ấn tượng với tôi. Các chuyển động miệng của tôi khớp chặt chẽ với âm thanh tiếng Tây Ban Nha, thậm chí cả răng cũng trông đúng. Có một chút lỗi giật, nhưng nhìn chung nó trông thật.

Đây là nơi Synthesia rõ ràng vượt trội hơn ElevenLabs. ElevenLabs đã lồng tiếng video của tôi thành công, nhưng chỉ thay thế âm thanh, không đồng bộ môi, vì vậy miệng tôi vẫn tạo hình tiếng Anh dưới các từ tiếng Tây Ban Nha. Synthesia thực sự thay đổi cách miệng tôi di chuyển để phù hợp với ngôn ngữ mới, điều này tạo ra sự khác biệt lớn về độ tin cậy của kết quả.

Tuy nhiên, nói vậy, nó vẫn khiến tôi cảm thấy hơi rùng rợn. Miệng tôi di chuyển theo cách mà tôi không làm khi nói trong đời thực, giống như vấn đề tôi gặp với avatar cá nhân trong Test 3.

Thêm nữa, giọng nói yếu hơn. Nó nghe hơi cao, dù không tệ. Đối với tôi, giọng tiếng Tây Ban Nha của ElevenLabs nghe giống giọng thực của tôi hơn.

Vì vậy, nếu tôi đang lồng tiếng một video cho khán giả sẽ thực sự nhìn thấy khuôn mặt tôi, tôi sẽ chọn Synthesia cho đồng bộ môi. Nếu là nội dung dựa trên âm thanh (như đoạn podcast hoặc lồng tiếng), tôi sẽ chọn ElevenLabs.

Test 5: Avatar Tùy Chỉnh Thực Hiện Mẹo An Toàn

Đối với bài kiểm tra cuối cùng, tôi muốn xem liệu các avatar tùy chỉnh của Synthesia có thể xử lý nội dung gần giống video đào tạo thực tế không. Tôi đã viết một mẹo an toàn ngắn về cách nâng hộp đúng cách trong kho và nhập nó như kịch bản của mình.

Từ đó, tôi đã tùy chỉnh một avatar mặc sẵn bằng cách yêu cầu cô ấy mặc áo phản quang và mũ bảo hiểm, và đặt cô ấy trong một lối đi của kho. Tôi cũng tạo một đoạn clip hành động cô ấy nâng một chiếc hộp với tư thế đúng, để phát trong khi phần thuyết minh giải thích kỹ thuật. Các clip hành động dựa trên lời nhắc của Synthesia được tạo bằng mô hình Veo 3 của Google.

 

Video mất 7 phút để tạo.

Nhận xét của tôi

Đây là kết quả yêu thích nhất trong tất cả các thử nghiệm của tôi. Bộ trang phục và bối cảnh nhà kho xuất hiện chính xác như tôi tưởng tượng, và avatar trông vô cùng thực tế và chất lượng cao. Cô ấy cũng trông giống hệt trong các cảnh nói và đoạn clip hành động.

Cú nâng hộp cũng trông đáng tin cậy. Không có tay biến dạng, hộp không biến mất (không giống như notebook và laptop trong Thử nghiệm 1), và tư thế nâng của cô ấy đúng, điều này rất quan trọng trong video an toàn.

Những bực bội của tôi là về phần chỉnh sửa, không phải kết quả.

Đoạn clip hành động chỉ dài bốn giây, ngắn hơn dòng thuyết minh. Vì vậy Synthesia đã lặp lại nó một lần, và phần video đó trông hơi giật. Tôi không thể tránh được điều này bằng cách để clip tự phát, vì mỗi cảnh trong Synthesia đều cần một kịch bản. Không có cảnh trống nào cả, vì vậy tôi phải thêm một cảnh mẫu và xóa mọi thứ trên đó để cấp cho clip một slide riêng.

Nhưng ngay cả với vòng lặp đó, tôi hoàn toàn có thể thấy nó được sử dụng cho đào tạo an toàn thực tế. Nếu bạn đang tạo một video, hãy cố gắng khớp độ dài thuyết minh với đoạn clip hành động để nó chỉ phát một lần.

Kết quả & Chất lượng đầu ra

Đây là những gì tôi nhận thấy trong các thử nghiệm của mình:

  • Tính hiện thực: Các avatar trông rất thực tế, với cử chỉ và biểu cảm chân thực. Tuy nhiên, chúng hơi quá hoàn hảo và việc nhấn mạnh quá mức chuyển động môi vẫn lộ ra là AI.
  • Chất lượng giọng nói: Các kịch bản nghe thuyết phục và bản sao giọng của tôi thực sự giống tôi. Tuy nhiên, phần lồng tiếng tiếng Tây Ban Nha của tôi nghe cao hơn giọng thực tế.
  • Độ chính xác: Trợ lý AI đã nắm bắt đúng tông mà tôi yêu cầu và trung thành với chính sách biên tập tôi tải lên, không có quy tắc tự tạo nào mà tôi phát hiện.
  • Tính nhất quán: Avatar tùy chỉnh của tôi trông giống hệt trong các cảnh nói và đoạn clip hành động. Tuy nhiên, thời gian chạy của tôi không nhất quán chút nào (56 giây khi tôi yêu cầu 90, rồi 3 phút khi tôi yêu cầu 2).
  • Tốc độ: Mỗi lần render mất từ 7 đến 14 phút, ngay cả với video dưới một phút.
  • Cần chỉnh sửa: Video an toàn của tôi (Thử nghiệm 5) có thể sử dụng ngay mặc dù có một clip lặp. Tuy nhiên, tôi phải cắt đoạn b-roll lỗi từ Thử nghiệm 1, sửa lỗi ngắt dòng văn bản và rút ngắn độ dài trong Thử nghiệm 2.
  • Số tín dụng đã dùng so với đầu ra: Lồng tiếng một video ngắn đã sử dụng 287 trong số 800 tín dụng hàng tháng của tôi trên gói Starter, vì vậy hạn mức nhanh hết khi bạn thêm lồng tiếng.
  • Những điểm còn thiếu: Tôi cảm thấy avatar tùy chỉnh của mình không phản ánh đúng khuôn mặt hay tính cách thực tế. Ngoài ra, b-roll tự động và các đoạn clip hành động ngắn, lặp lại khiến một số phần video trông giật.

Cách đạt kết quả tốt trong Synthesia

Đây là quy trình tôi thấy tạo ra những video có thể sử dụng nhất:

  1. Bắt đầu từ một kịch bản chặt chẽ, không phải một đề bài mơ hồ. Trợ lý AI có thể soạn thảo video từ một ý tưởng, nhưng cung cấp cho nó tài liệu nguồn thực tế của bạn (chính sách, SOP, hoặc trang sản phẩm) sẽ ngăn nó lấp đầy khoảng trống bằng nội dung chung chung.
  2. Thiết lập bộ nhận diện thương hiệu của bạn trước. Các phông chữ, màu sắc và logo được áp dụng ngay từ đầu sẽ giúp bạn tránh việc phải tái thiết kế từng cảnh một cách thủ công sau này.
  3. Viết cho tai nghe. Các câu ngắn và dấu câu rõ ràng giúp avatar có nhịp điệu tốt hơn. Viết ra đầy đủ các từ viết tắt và viết tên thương hiệu theo cách phát âm nếu giọng nói phát âm sai. Thậm chí hơn, đặt cách phát âm bằng cách đánh dấu từ trong trình chỉnh sửa kịch bản. Chọn Phát âm để điều chỉnh cách nó nghe, và gõ cách viết phiên âm thủ công hoặc ghi âm giọng của bạn nói từ đó, hệ thống sẽ chuyển thành phiên âm.
  4. Giữ các cảnh ngắn. Một ý tưởng cho mỗi cảnh giúp dễ dàng khớp cử chỉ và văn bản trên màn hình, đồng thời làm cho việc chỉnh sửa sau này dễ dàng hơn.
  5. Xem trước trước khi render. Mỗi lần render đầy đủ sẽ tiêu tốn phút trong hạn mức hàng tháng của bạn, vì vậy hãy kiểm tra kịch bản và thời gian trước.

Top 3 lựa chọn thay thế Synthesia

Đây là những lựa chọn thay thế Synthesia tốt nhất mà tôi đã thử và đề xuất.

HeyGen

HeyGen là đối thủ gần nhất của Synthesia, và lựa chọn chủ yếu phụ thuộc vào đối tượng người xem video.

Một mặt, HeyGen hướng tới các nhà sáng tạo và nhà tiếp thị. Gói miễn phí cung cấp cho bạn hơn 500 avatar có sẵn và một avatar tùy chỉnh (so với 9 avatar miễn phí của Synthesia). Xuất video 4K bắt đầu từ gói Pro, và nó hỗ trợ hơn 175 ngôn ngữ từ gói Creator.

Trong khi đó, Synthesia được xây dựng cho đào tạo doanh nghiệp. Nó bao gồm tính năng nhánh và truy cập API trong gói Creator, trong khi HeyGen duy trì video tương tác và SCORM cho gói Business.

Chọn HeyGen nếu bạn đang làm video marketing hoặc video xã hội. Nếu không, hãy chọn Synthesia nếu bạn đang xây dựng nội dung đào tạo cho một LMS.

Đọc đánh giá HeyGen của tôi hoặc truy cập HeyGen!

AI Studios

 

AI Studios (từ DeepBrain AI) là lựa chọn thay thế mà tôi sẽ giới thiệu cho các đội ngũ có ngân sách hạn hẹp, vì nó không hạn chế phút như Synthesia.

Một mặt, gói Cá nhân của AI Studios bao gồm video không giới hạn lên đến 30 phút mỗi video, 3 avatar tùy chỉnh, xuất 1080p và 120 phút lồng tiếng AI mỗi tháng. Gói Starter của Synthesia giới hạn bạn ở 10 phút video. Gói Team của AI Studios bổ sung xuất video 4K.

Trong khi đó, Synthesia cung cấp gói đào tạo toàn diện hơn: các câu đố tương tác và nhánh, các buổi Roleplay Sessions, thư viện avatar lớn hơn, và hơn 140 ngôn ngữ lồng tiếng, so với 73 ngôn ngữ và phương ngữ của AI Studios. AI Studios bán avatar tương tác như một gói riêng.

Chọn AI Studios nếu bạn sản xuất nhiều video và muốn có nhiều phút hơn cho số tiền bỏ ra. Nếu không, chọn Synthesia nếu tính tương tác và bản địa hoá quan trọng hơn so với khối lượng.

Đọc đánh giá DeepBrain AI của tôi hoặc truy cập AI Studios!

Colossyan

 

Colossyan nhắm tới cùng đối tượng mua hàng như Synthesia (các đội ngũ đào tạo), vì vậy so sánh này tập trung vào tính năng và giá cả hơn là khán giả.

Một mặt, Colossyan đưa nhiều tính năng đào tạo hơn vào các gói thấp hơn. Gói miễn phí của nó bao gồm 20 phút mỗi tháng và 10 video tương tác.

Gói Professional bổ sung xuất SCORM (5 lần mỗi tháng), 15 video tương tác và tối đa 3 biên tập viên. Để có tính năng nhánh, bạn cần gói Creator trong khi các câu đố có trên gói Enterprise của Synthesia.

Trong khi đó, Synthesia có nhiều giọng nói và ngôn ngữ hơn (hơn 160 so với hơn 100). Nó cũng là lựa chọn đã được thiết lập hơn cho các đánh giá bảo mật doanh nghiệp.

Chọn Colossyan nếu bạn là một đội ngũ đào tạo nhỏ cần các khóa học tương tác với ngân sách eo hẹp. Nếu không, chọn Synthesia nếu độ thực tế của avatar, bản địa hoá và quy mô là ưu tiên.

Đọc đánh giá Colossyan của tôi hoặc truy cập Colossyan!

Đánh giá Synthesia: Công cụ phù hợp cho bạn?

Điều tôi thích nhất về Synthesia là khả năng dễ dàng biến kịch bản thành video chuyên nghiệp mà không cần máy quay hay người thuyết trình thực tế. Trong các thử nghiệm của tôi, các kịch bản mạnh mẽ, các avatar có sẵn trông thực tế, và avatar có thể tùy chỉnh đã tạo ra video ưa thích của tôi.

Điều tôi không thích là việc dọn dẹp. Đoạn b-roll do AI tạo ra trông rời rạc hơn so với người nói, văn bản cần sửa, và độ dài video không phải lúc nào cũng khớp với yêu cầu của tôi. Avatar cá nhân của tôi cũng trông thực tế nhưng không đủ giống tôi để thay tôi trên máy quay.

Tôi sẽ đề xuất Synthesia cho các đội ngũ đào tạo và nhân sự cần thường xuyên tạo video chuyên nghiệp, đặc biệt trong nhiều ngôn ngữ. Tuy nhiên, đối với việc tạo video thỉnh thoảng, các giới hạn hàng tháng có thể khó biện minh và bạn có thể muốn xem xét các lựa chọn thay thế sau:

  • HeyGen là lựa chọn tốt nhất cho các nhà tiếp thị và người sáng tạo muốn đầu ra 4K và nhiều avatar có sẵn.
  • AI Studios là lựa chọn tốt nhất cho sản xuất quy mô lớn với video không giới hạn trong gói Cá nhân.
  • Colossyan là lựa chọn tốt nhất cho các đội ngũ đào tạo nhỏ muốn đào tạo SCORM tương tác với chi phí thấp hơn.

Cảm ơn bạn đã đọc đánh giá Synthesia của tôi! Hy vọng bạn thấy nó hữu ích. Nếu bạn muốn tự mình thử Synthesia, bạn có thể đăng ký miễn phí và xem nó có thể tạo gì cho bạn.

Câu hỏi thường gặp

Synthesia có miễn phí không?

Có, Synthesia có gói Basic miễn phí không yêu cầu thẻ tín dụng. Gói này bao gồm 10 phút video và 10 phút lồng tiếng mỗi tháng, và 9 avatar.

Avatar của Synthesia thực sự giống thật đến mức nào?

Avatar của Synthesia trông rất thực tế. Tuy nhiên trong các thử nghiệm của tôi, các chuyển động miệng và biểu cảm khuôn mặt hơi phóng đại vẫn khiến chúng trông như được tạo bởi AI, và avatar cá nhân của tôi không nắm bắt đủ khuôn mặt hay cử chỉ thực tế của tôi để có thể thay tôi.

Tôi có thể tạo avatar AI của mình với Synthesia không?

Có, bạn có thể tạo avatar cá nhân từ ảnh hoặc video ngắn, kèm theo tùy chọn sao chép giọng nói. Bạn sẽ cần ghi lại một tuyên bố đồng ý trên camera, không thể bỏ qua hoặc ghi trước. Gói Starter bao gồm 3 avatar cá nhân, Creator bao gồm 5, và Enterprise không giới hạn.

Synthesia hỗ trợ bao nhiêu ngôn ngữ?

Synthesia hỗ trợ hơn 160 ngôn ngữ và giọng nói để tạo video và hơn 140 ngôn ngữ cho lồng tiếng AI.

Synthesia có thể lồng tiếng cho video hiện có không?

Có, Synthesia có thể lồng tiếng cho video hiện có. Bạn tải lên tệp MP4, MOV hoặc WebM (tối đa 4K) hoặc dán liên kết YouTube, và nó sẽ trả về phiên bản đồng bộ môi trường nói bằng ngôn ngữ khác với giọng nói sao chép của người nói. Bạn có thể chỉnh sửa bất kỳ câu dịch nào trong trình chỉnh sửa.

Tôi có thể sử dụng video Synthesia cho mục đích thương mại không?

Có, bạn có thể sử dụng video Synthesia cho mục đích thương mại. Nó được thiết kế cho doanh nghiệp, bao gồm video đào tạo, marketing và bán hàng.

Synthesia có hoạt động với LMS của tôi không?

Có, Synthesia xuất video dưới dạng gói SCORM, vì vậy chúng có thể được tải lên hầu hết các hệ thống quản lý học tập. Chỉ cần lưu ý rằng việc xuất SCORM chỉ có sẵn trên gói Synthesia Enterprise.

Synthesia có an toàn khi sử dụng không?

Có, Synthesia tuân thủ SOC 2 Type II, ISO 42001 và GDPR. Ngoài ra, nó yêu cầu sự đồng ý trực tiếp trước khi tạo avatar cá nhân.

Synthesia có đáng giá không?

Synthesia đáng giá nếu đội ngũ của bạn thường xuyên sản xuất video đào tạo (đặc biệt bằng nhiều ngôn ngữ) và cần bảo mật đáng tin cậy. Nếu bạn chỉ cần một vài video ngắn, giới hạn phút hàng tháng có thể khiến HeyGen hoặc AI Studios mang lại giá trị tốt hơn.

Janine Heinrichs là một chuyên gia đánh giá phần mềm AI, người đã thử nghiệm và đánh giá hơn 250 công cụ AI trong ba năm qua.