Một công cụ tạo hình ảnh của OpenAI, Sora mang đến một thế giới ảo mới mẻ
AI video credit: OpenAI
Một khung hình từ một video được tạo ra bởi trí tuệ nhân tạo của OpenAI bằng cách nhập vào một đoạn văn bản mô tả: "Một người phụ nữ phong cách đi bộ trên một con phố ở Tokyo được chiếu sáng bởi ánh sáng neon ấm áp và các biển quảng cáo của thành phố. Cô ấy mặc một chiếc áo khoác da màu đen, một chiếc váy đỏ dài và đôi ủng đen, cầm một chiếc túi đen. Cô ấy đeo kính râm và son môi đỏ. Cô ấy đi tự tin và thoải mái. Con phố ẩm ướt và phản chiếu tạo ra hiệu ứng gương của ánh sáng màu sắc. Nhiều người đi bộ trên đường."
Trong cuộc đua vàng tạo hình ảnh của trí tuệ nhân tạo, OpenAI đã gửi một đòn tấn công quyết định vào các công cụ tạo video hiện tại như Google's Imagen, Runway Gen-2 hoặc Meta's Make-A-Video.
Những nỗ lực cạnh tranh này là mờ nhạt, độ phân giải thấp, nhựa như vẻ bề ngoài và tổng thể là khởi đầu bước vào một tương lai của hình ảnh tổng hợp hơn là sản phẩm có thể sử dụng. Sora của OpenAI là một con quái vật hoàn toàn khác, sử dụng văn bản để tạo ra những hình ảnh người, động vật và cảnh quan giống như thật. Nó sử dụng các xử lý mô phỏng hạt phim hoặc video điện thoại di động và sử dụng các chuyển động theo dõi chuyên nghiệp, dolly và jib.
Nó không hoàn hảo, nhưng nó gần như không thể phân biệt được với thực tế.
Kết quả là khá ấn tượng. Chiếc khuyên tai của một phụ nữ nhẹ nhàng lắc theo bước chân của cô ấy khi ánh sáng phản chiếu một cách thực tế trên kính của cô và các con phố ẩm ướt ở Tokyo. Trong một video khác, một số loài voi lớn tới, đi qua một đồng cỏ tuyết, bóng của chúng vây quanh và môi trường như mong đợi. Các video không có dấu hiệu lạ khiến các video được dựng bởi AI trước đó kêu gào rằng đó là không phải nhân tạo.
Những kết quả ấn tượng này cũng gây lo ngại.
Nỗi sợ hãi về những điều này đồng nghĩa với các công việc sáng tạo (như đã được nhấn mạnh trong cuộc đình công của biên kịch và diễn viên Hollywood năm 2023) hoặc ý nghĩa của chúng ta về ảnh và video, chuông báo động lớn nhất là điều đó có ý nghĩa gì cho tương lai của sự thật khách quan, thông tin sai lệch và quyền lực.
Nếu bạn không thể biết điều gì là thật (các video được tạo ra bởi trí tuệ nhân tạo trông giống như thật cũng như video thực sự mà người khác cho là giả mạo), không có gì là thực tế trừ những gì bạn chọn tin. Thập kỷ qua đã cho chúng ta thấy rõ nguy hiểm của các hội thoại hỗ trợ bởi mạng xã hội.
Điều gì là thật?
AI video credit: OpenAI
Khi nhìn vào ví dụ trên với những loài voi ma-mút, dễ dàng nói rằng đó không phải là thật. Là người xem, bạn có thể nhớ rằng loài voi lông xù đã tuyệt chủng khoảng 4000 năm trước, vì vậy bạn lý giải rằng đây phải là một loại minh họa nào đó, có được tạo ra bởi trí tuệ nhân tạo hoặc không.
Nhưng hãy xem xét một chút rằng một video như vậy được xem như vậy bởi những người không biết rằng chúng đã tuyệt chủng. Điều này không phải là điều quá mức kỳ quặc như bạn có thể nghĩ. Như BCC đã báo cáo năm ngoái, các video YouTube về khoa học được tạo ra bởi trí tuệ nhân tạo và nhắm vào trẻ em đã thuyết phục những đứa trẻ 5 tuổi rằng các kim tự tháp của Ai Cập là máy phát điện, người ngoài hành tinh là thật sự và NASA đang giấu đi sự thật rằng hoạt động của con người không ảnh hưởng đến biến đổi khí hậu. Tất cả những điều này đều là sai, nhưng điều đó làm cho trẻ em 5 tuổi tin và xem các video là bằng chứng cho những tuyên bố này.
Một công cụ như Sora, hứa hẹn cung cấp con người có hình dáng giống như thật và các môi trường thế giới thực cho bất kỳ ai, với ít hoặc không có sai khác nào cả, đặt ra một thách thức đối với những kẻ có ý định để lừa dối trẻ em (và người lớn), và điều đó chắc chắn sẽ khiến bạn suy nghĩ lại.
Các tác phẩm Deepfakes trước đây đòi hỏi một mức độ kỹ năng và chiếc máy tính mạnh mẽ để tạo ra một cách chân thực nhất (ít nhất là hai tuần và 15 triệu vào năm 2019 cho một tác phẩm thô sơ), nhưng với các công cụ như Sora, ngưỡng đã được hạ xuống cho bất kỳ ai có một bàn phím và một ít thời gian và ý tưởng.
OpenAI không tiết lộ mỗi video mẫu mà nó tạo ra mất bao lâu để làm. Tôi đã thấy một số tuyên bố rằng chúng có thể được tạo ra trong vài phút, nhưng dựa trên kinh nghiệm của tôi với việc tạo hình ảnh trí tuệ nhân tạo tĩnh, tôi nghi ngờ rằng sẽ phải mất hàng giờ hoặc hàng ngày để tinh chỉnh và chỉnh sửa để có được kết quả lý tưởng. Trong các bài viết trên X sau thông báo về Sora, Giám đốc điều hành của OpenAI, Sam Altman, đã yêu cầu độc giả gửi yêu cầu và đã gửi hai yêu cầu (một bà nội nấu ăn và một ảo tưởng về những sinh vật biển trong một cuộc diễu hành xe đạp) trong khoảng 90 phút.
OpenAI cũng không chia sẻ nguồn video và hình ảnh nào đã được sử dụng để đào tạo Sora hay nói rõ hơn là liệu các tác phẩm có bản quyền có được sử dụng hay không. Công ty cũng sản xuất chatbot ChatGPT và nhà tạo hình ảnh tĩnh DALL-E, đã bị kiện với cáo buộc sử dụng các tác phẩm có bản quyền để đào tạo các sản phẩm trước đó.
Dù sao, Sora đã được thông báo. Sớm thôi, mọi người sẽ có thể tạo ra video giả mạo thuyết phục. OpenAI dường như đã nhận ra nguy hiểm của các công cụ trí tuệ nhân tạo ở một mức độ nào đó.
Phần lớn thông báo được dành cho phần an toàn với tiêu đề menu nổi bật để thừa nhận rủi ro về thông tin sai lệch và tác hại cho xã hội. Nền tảng này chưa có ngày phát hành công khai; hiện tại nó chỉ có thể truy cập được đối với một nhóm người thử nghiệm được chọn, những người cũng được giao nhiệm vụ giúp xác định và đánh giá rủi ro cũng như tác hại tiềm ẩn. Tôi hy vọng mức độ chăm sóc này là chân thành chứ không phải lời nói suông.
Lời dẫn: "Đoạn giới thiệu phim kể về cuộc phiêu lưu của người đàn ông vũ trụ 30 tuổi đội mũ bảo hiểm xe máy dệt kim len màu đỏ, bầu trời xanh, sa mạc muối, phong cách điện ảnh, quay trên phim 35mm, màu sắc sống động."
Kiểm soát AI?
Hiện tại, không có quy định nào về các công cụ tạo AI. Đạo luật AI của EU có thể trở thành đạo luật đầu tiên, nếu được thông qua, và sẽ quy định ngành công nghiệp bằng cách giới hạn việc sử dụng AI của các công ty và cơ quan chức năng cũng như một phương tiện cho công chúng để gửi khiếu nại. Cũng có một số nỗ lực ở Mỹ và Trung Quốc để quy định việc sử dụng trí tuệ nhân tạo, nhưng hiện tại, chúng chỉ mang tính chắp vá.
Các biện pháp bảo vệ duy nhất được áp dụng khi tôi viết bài này là do các công ty nghiên cứu về AI tự áp đặt.
OpenAI sử dụng bộ lọc ngôn ngữ để kiểm tra và từ chối các yêu cầu văn bản bao gồm các mục mà nó coi là bạo lực, tình dục, căm hận hoặc cố gắng sử dụng tác phẩm có bản quyền hoặc hình ảnh của các ngôi sao. Có kế hoạch triển khai siêu dữ liệu C2PA vào bất kỳ phiên bản công cộng nào của công cụ này.
C2PA (Liên minh về Xuất xứ và Tính xác thực Nội dung) là một nỗ lực chuẩn hóa xác thực được Adobe, Sony, BBC và các tổ chắc khác ủng hộ. Nó kết hợp những nỗ lực của CAI (Sáng kiến về Tính xác thực Nội dung) và Dự án Gốc để giải quyết vấn đề về nguồn gốc và tính xác thực bằng cách thiết lập tiêu chuẩn tác giả và siêu dữ liệu cùng các công cụ mã nguồn mở để giáo dục công chúng về tính xác thực của nội dung.
"Công nghệ mới thật tuyệt vời, và thừa nhận rủi ro là rất lớn, nhưng việc chịu trách nhiệm về thần đèn trước khi bạn thả nó ra ngoài là điều đúng đắn."
Bằng cách tham gia vào nhóm này và áp dụng tiêu chuẩn, OpenAI dường như nhận ra nhu cầu về một dấu vết để xác định cái gì là chính xác và cái gì là tổng hợp. Cho đến khi Sora trở nên công cộng, chúng ta sẽ không biết cách nó sẽ được triển khai, cách công chúng sẽ được đào tạo để sử dụng các công cụ xác thực, hoặc, quan trọng hơn, giá trị của việc sử dụng các công cụ như thế nào.
Tuy nhiên, có một điều quan trọng còn thiếu trong sự thừa nhận này. Những nỗ lực của C2PA chủ yếu nhắm vào các nhà báo, những người có thể quan tâm nhất đến việc xác thực phương tiện truyền thông. Nguồn gốc và tính xác thực của hình ảnh có ý nghĩa gì đối với người dùng Sora thông thường?
Trường hợp điển hình: mồi dư luận. Một thước đo thành công quan trọng trên mạng xã hội là mức độ tương tác – số lượng người tương tác với nội dung của bạn: phiếu tự đánh giá về lượt thích, nhận xét, thời gian sử dụng, chia sẻ, lưu và theo dõi. Trong mô hình này, tất cả những gì quan trọng là những số liệu này xác định mức độ tương tác, vì vậy việc mọi thứ có đúng hay không cũng không thành vấn đề. Mục đích biện minh cho phương tiện.
Công nghệ mới thật tuyệt vời và thừa nhận rủi ro là rất lớn, nhưng chịu trách nhiệm về thần đèn khi bạn thả nó ra là điều nên làm. Chúng ta đã trải qua một cuộc tranh luận kéo dài nhiều năm về hình ảnh AI và liệu chúng là ảnh, tác phẩm nghệ thuật, có bản quyền hay hữu ích. Nhưng nếu Sora nhắc nhở chúng ta một điều, thì đó là công nghệ tiến bộ nhanh hơn con người chúng ta và chúng ta có một cơ hội chủ động hạn chế trước khi có bất kỳ tác hại nào.
Đây hiện là video do AI tạo ra tệ nhất từng xem. Một năm trước, chúng ta đã cười khúc khích khi thấy các công cụ AI phải vật lộn với cơ thể con người và không thể tạo ra cảnh Will Smith ăn spaghetti thực tế và 11 tháng sau, chúng ta có những video giống như video dưới đây về một người đàn ông đang đọc sách.
Trong lần hé lộ này của mình, OpenAI đã chia sẻ các ví dụ về công cụ này vẫn đang gặp khó khăn với bàn tay, vật lý và các hoạt động chồng chéo. Nếu chúng ta xem xét kỹ các chi tiết, chúng ta có thể biết rằng điều gì đó không có thật, nhưng bạn phải xem kỹ chứ không phải là chỉ nhìn thoáng qua. Hoặc, trong trường hợp phương tiện truyền thông xã hội và mọi người chia sẻ lại ảnh chụp màn hình trong đó việc nén hình ảnh làm giảm chất lượng hình ảnh, điều đó đòi hỏi chúng ta phải hoài nghi và tìm kiếm nguồn để tự xác minh. Các công cụ C2PA có thể hữu ích nếu được triển khai đúng cách từ khía cạnh kỹ thuật, nhưng chúng cũng sẽ cần nỗ lực giáo dục kiến thức truyền thông mạnh mẽ.
Nhìn vào chặng đường phát triển của video do AI tạo ra trong 11 tháng, có thể thấy rằng những điểm kỳ quặc của hình ảnh và video do AI tạo ra sẽ tự giải quyết trong thời gian thích hợp. Đây hiện là video do AI tạo ra tệ nhất từng xem.
Mô tả: “Một thanh niên khoảng 20 tuổi đang ngồi trên một đám mây trên bầu trời đọc sách.”
Thông tin ảo được vũ khí hóa
Một thế giới trong đó sự thật có thể bị chôn vùi dưới sự hư cấu một cách dễ dàng đến mức khiến tôi cảm thấy như đang bị tổn thương một cách nguy hiểm gần với chủ nghĩa đen tối.
Lịch sử có rất nhiều ví dụ về việc thao túng hình ảnh và cố gắng coi những hình ảnh giả là xác thực; Sau cái chết của Abraham Lincoln, một bức ảnh nổi tiếng của cựu tổng thống Mỹ đã bị làm giả. Tuy nhiên, không giống như trước đây, sự phổ biến của các công cụ chế tạo và xử lý hình ảnh rẻ hơn và dễ sử dụng hơn, chẳng hạn như AI, đã khiến bất kỳ ai cũng có thể tạo ra hình ảnh và video giả mạo cũng như nhanh chóng lan truyền thông tin ảo như sự thật. Vì mục đích vui vẻ hoặc bất chính hơn.
"Không biết điều gì là chính xác và đúng sự thật, mọi thứ đều trở nên đáng ngờ và sự thật trở nên chủ quan."
Gần đây, mạng xã hội tràn ngập thông tin sai lệch về hình ảnh về cuộc xung đột Hamas-Israel . Hình ảnh từ các nơi khác trên thế giới đã được ghép nối với các tiêu đề mới gây hiểu lầm, hình ảnh AI được sử dụng làm bằng chứng về tội ác chiến tranh, video giả mạo kiểu BBC chia sẻ các tài khoản hư cấu từ thực địa và video về các nhà lãnh đạo thế giới với chú thích tiếng Anh không chính xác gieo rắc bất đồng quan điểm và sự nhầm lẫn . Vấn đề nghiêm trọng trên X đến mức nền tảng này đã nhắc nhở người dùng về chính sách thông tin ảo của nó và cách nó tăng cường sử dụng Ghi chú cộng đồng, tính năng xác minh tính xác thực của nó, mà một số người trong cuộc cho rằng đó là một chiếc băng đô không hoạt động .
Sự tràn ngập thông tin ảo về hình ảnh ngày nay đang thách thức xã hội và những người tạo ra những hình ảnh chân thực. Không biết điều gì là chính xác và đúng sự thật, mọi thứ trở nên đáng nghi ngờ và sự thật trở nên chủ quan. Đột nhiên, những kẻ xấu có thể tràn ngập mạng xã hội và làm xáo trộn dòng nước, gây khó khăn cho việc phân biệt sự thật với hư cấu.
Khi tôi nhìn Sora và các mẫu được chia sẻ, nỗi sợ hãi này len lỏi vào bối cảnh truyền thông trong đó người ta không thể tự tin biết đâu là thật và đâu là ai đó đang cố che mắt chúng ta.
Trong số các video do AI tạo ra, Sora làm các sinh vật hoạt hình và máy bay giấy bay qua khu rừng rậm, có một số video đáng lo ngại. Những con người thực tế như ảnh trong môi trường thế giới thực gợi lên những kịch bản về thông tin sai lệch được vũ khí hóa. Một video được tạo từ lời nhắc "cảnh quay lịch sử của California trong cơn sốt vàng" không phải là tài liệu lịch sử. Video từ người dân địa phương trên toàn cầu mở ra cơ hội tiếp cận lịch sử thay thế của một địa điểm.
Trong số tất cả các video được OpenAI chia sẻ, có một video khiến tôi lo lắng nhất. Đoạn clip ăn mừng Tết Nguyên đán dài 10 giây của Trung Quốc cho thấy một đám đông lớn tụ tập để diễu hành, hai bên đường khi hai con rối rồng tham gia múa rồng ở trung tâm.
Lời nhắc: "Video ăn mừng Tết Nguyên đán của Trung Quốc với Rồng Trung Quốc."
Video này khá vô hại; không cần suy nghĩ quá nhiều về góc độ, bạn có thể cho rằng đó là video trên điện thoại thông minh. Với ánh sáng chân thực, chất lượng hình ảnh thấp hơn, thiếu độ sâu trường ảnh, những người hơi mất nét che đi sự thiếu chi tiết và chuyển động mờ, không có lý do gì để nghĩ rằng ai đó sẽ gặp rắc rối khi tạo một video AI về một cảnh tượng như vậy. Khi xem video này trên mạng xã hội, bạn có thể nghĩ nó là thật và tiếp tục bị thuyết phục.
Đây là mối nguy hiểm. Nó bình thường đến mức người ta có thể thắc mắc, "Tại sao lại có người giả mạo điều này?"
Bây giờ, hãy xem xét một tình huống trong đó một kẻ xấu muốn đặt ai đó vào cảnh này và yêu cầu họ làm điều gì đó bất chính ở phía sau; có lẽ mục tiêu được cho là đang khiêu vũ với một người mà lẽ ra họ không nên trở thành. Vào một ngày sau đó, những cáo buộc chống lại người được nhắm mục tiêu sẽ được đưa ra và ngay sau đó, đoạn video giả mạo này được coi là khẩu súng châm ngòi. Bây giờ, hãy coi người bị nhắm đến này là chủ tịch nước và gieo mầm mống cho rằng họ không đáng tin cậy và có hại cho quốc gia là phù hợp với đảng đối lập. Kịch bản đó có vẻ không quá xa vời. Trong năm ngoái, chúng ta đã thấy điều này xảy ra với những hình ảnh tĩnh do AI tạo ra trong cuộc đua tổng thống Mỹ.
Tôi sẽ không đặt ra những câu sáo rỗng có thể/nên, nhưng tôi sẽ nói rằng cần phải cân nhắc về đạo đức, tác hại đối với xã hội, hiểu biết về truyền thông và trách nhiệm của doanh nghiệp. Giờ đây khi thần đèn đã xuất hiện, nhân loại có trách nhiệm lớn hơn trong việc đặt các rào chắn tại chỗ với các phương tiện để điều chỉnh hướng đi trong thời gian thực, chứ không phải nhặt từng mảnh sau khi bị tổn hại.
Lời nhắc: "Hình ảnh phản chiếu qua cửa sổ một chuyến tàu đi qua vùng ngoại ô Tokyo."
Một đề xuất giá trị
Mỗi lần tôi xem lại công nghệ tạo ra AI, tôi cũng có những suy nghĩ tương tự. Nó chắc chắn rất ấn tượng, nhưng chính xác thì nó giải quyết được vấn đề gì? Mượn câu thần chú yêu thích của Thung lũng Silicon, liệu điều này có làm thế giới trở thành một nơi tốt đẹp hơn không?
Tôi hiểu rằng có một cơn sốt vàng. Tôi thấy giá cổ phiếu của Nvidia và Microsoft tăng vọt và hiểu tiền thúc đẩy sự phát triển AI như thế nào. Tôi cũng thấy mọi người tạo ra những thứ sáng tạo để truyền cảm hứng sáng tạo. Tôi đã sử dụng hình ảnh do AI tạo ra cho bảng phân cảnh và bảng tâm trạng. Nhưng tôi cũng thấy được sự nguy hiểm.
“Mượn câu thần chú yêu thích của Thung lũng Silicon, liệu điều này có khiến thế giới trở thành một nơi tốt đẹp hơn không?”
Trong các video ví dụ được OpenAI chia sẻ, không có video nào thực sự gây ấn tượng với tôi là có trường hợp tôi sẽ sử dụng đến công cụ này. Về cốt lõi, Sora đang cố gắng tạo ra một video chân thực có thể giống như thật và tôi phải tự hỏi, mục đích là gì? Video giả có thể được coi là video thật chỉ bằng một cái nhìn thoáng qua. Bất cứ ai cũng có thể cáo buộc video thật là giả mạo. "Sự thật" trở nên rạn nứt và thay vào đó là hàng triệu buồng vang vọng trỗi dậy và tự do cất giữ phiên bản riêng của họ về những gì là thực đối với họ và những người theo dõi họ.
Tôi cho rằng hướng đi rõ ràng sẽ là quyết định của chúng ta. Có lẽ một ngày nào đó, thời điểm thần đèn AI đã hoàn toàn ra khỏi chai, để cuối cùng làm rõ ý nghĩa của nó và những gì chúng ta đã học được.