Trong bối cảnh trí tuệ nhân tạo vẫn phụ thuộc vào hạ tầng đám mây, việc một mô hình có thể hoạt động trực tiếp trên thiết bị cá nhân đang trở thành bước ngoặt lớn. Google vừa công bố Gemma 4, dòng AI gọn nhẹ nhưng hiệu năng cao, hướng đến khả năng triển khai trực tiếp trên laptop, điện thoại và các thiết bị nhúng.
Gemma 4 là thế hệ mới trong dòng mô hình AI “open weight” của Google, được phát triển dựa trên nền tảng công nghệ từ hệ sinh thái Gemini. Theo tài liệu kỹ thuật do Google công bố, mô hình này được thiết kế với mục tiêu tối ưu hiệu năng trên mỗi tham số, giúp duy trì khả năng xử lý cao trong khi giảm đáng kể yêu cầu phần cứng.
Một điểm đáng chú ý là Gemma 4 có nhiều cấu hình khác nhau, từ các phiên bản nhỏ dành cho thiết bị di động đến các bản lớn hơn phục vụ máy trạm. Cách tiếp cận này cho phép cùng một nền tảng AI có thể hoạt động trên nhiều môi trường, từ smartphone đến hệ thống chuyên dụng.
Khác với các mô hình như GPT-4 vốn phụ thuộc vào máy chủ mạnh, Gemma 4 có thể được tải về và chạy trực tiếp trên CPU hoặc GPU của thiết bị. Điều này giúp giảm rào cản triển khai, đặc biệt với cá nhân và doanh nghiệp nhỏ.
Bên cạnh đó, việc phát hành theo hướng mở cho phép cộng đồng phát triển dễ dàng tùy chỉnh, tích hợp và xây dựng ứng dụng riêng, từ chatbot, trợ lý lập trình đến các hệ thống xử lý dữ liệu nội bộ.
Khả năng hoạt động offline là điểm khác biệt quan trọng của Gemma 4. Thay vì gửi dữ liệu lên máy chủ để xử lý, toàn bộ quá trình có thể diễn ra trực tiếp trên thiết bị người dùng.
Điều này mang lại lợi ích lớn về quyền riêng tư. Các dữ liệu nhạy cảm như tài liệu công việc hay thông tin cá nhân không cần rời khỏi thiết bị, giúp giảm nguy cơ rò rỉ. Đây là yếu tố ngày càng được quan tâm khi AI được sử dụng rộng rãi trong đời sống và công việc.
Ngoài ra, AI offline giúp cải thiện đáng kể tốc độ phản hồi. Khi không phụ thuộc vào kết nối mạng, các tác vụ như soạn thảo văn bản, dịch thuật hoặc hỗ trợ lập trình có thể được xử lý gần như tức thì.
Một lợi ích khác là chi phí. Khi không phụ thuộc vào dịch vụ đám mây hay API, người dùng có thể giảm đáng kể chi phí vận hành AI trong dài hạn.
Gemma 4 là một ví dụ rõ nét cho xu hướng lớn của ngành công nghệ, khi nhiều tập đoàn như Apple, Qualcomm hay Google đang chuyển hướng sang AI on device: Apple đã tích hợp các tính năng AI trực tiếp trên thiết bị trong hệ sinh thái của mình, trong khi Qualcomm phát triển các dòng chip với bộ xử lý AI chuyên dụng.
Sự kết hợp giữa phần cứng ngày càng mạnh và mô hình AI tối ưu hóa đang giúp việc triển khai AI trở nên linh hoạt hơn, có thể hoạt động trực tiếp trên nhiều loại thiết bị khác nhau. Tuy vậy, cách tiếp cận này vẫn tồn tại những hạn chế, đặc biệt về giới hạn tài nguyên và khả năng cập nhật dữ liệu theo thời gian.
Dù còn thách thức, khoảng cách giữa AI đám mây và AI trên thiết bị đang dần được thu hẹp. Nhiều chuyên gia cho rằng trong tương lai gần, hai mô hình này sẽ cùng tồn tại và bổ trợ lẫn nhau.
Sự xuất hiện của Gemma 4 cho thấy một hướng đi rõ ràng của ngành AI, khi trọng tâm dần chuyển từ hạ tầng đám mây sang thiết bị cá nhân. Nếu xu hướng này tiếp tục phát triển, AI sẽ không chỉ nhanh hơn và riêng tư hơn mà còn hiện diện trực tiếp trên từng thiết bị, thay vì chỉ nằm trong các trung tâm dữ liệu như trước đây.
Theo trang công nghệ The Verge, nhiều tài khoản mạng xã hội những ngày qua đăng tải nhiều hình ảnh "check-in" tại đại nhạc hội Coachella (Coachella Valley Music and Arts Festival, Mỹ, diễn ra từ 10 đến 19-4), tạo dáng cùng những người nổi tiếng như thành viên gia đình Kardashian, Jenner hay James Charles,...
Tuy nhiên, không ít trong số đó thực chất là các nhân vật ảo, chưa từng đặt chân đến sự kiện.
Phần lớn người xem vẫn tương tác với các tài khoản này như thể họ là người thật. Việc dán nhãn nội dung trí tuệ nhân tạo (AI) trên các nền tảng như Instagram, Tiktok còn hạn chế, khiến ranh giới giữa thật và giả trở nên mơ hồ.
Sự bùng nổ của influencer AI không chỉ đến từ yếu tố công nghệ mà còn nằm ở bài toán chi phí. Để đưa một influencer thật tham dự Coachella, các thương hiệu có thể phải chi hàng trăm nghìn USD cho di chuyển, lưu trú và sản xuất nội dung. Trong khi đó, sử dụng influencer AI thì hoàn toàn không phát sinh các chi phí này.
Ngoài ra, các "gương mặt ảo" còn giúp nhãn hàng kiểm soát tuyệt đối hình ảnh, không lo bê bối cá nhân và luôn đáp ứng đúng yêu cầu chiến dịch quảng bá.
Video một influencer được cho là sản phẩm AI "Check-in tại đại nhạc hội Coachella - Video: Tiktok/Lilyleafdigitals
Các công cụ tạo hình ảnh hiện nay cũng đã phát triển đến mức người xem khó phân biệt đâu là ảnh thật, đâu là sản phẩm do AI tạo ra, dù vẫn tồn tại những dấu hiệu sai lệch nhỏ về thị giác.
Nhiều influencer AI còn tận dụng lượng người theo dõi để kiếm tiền trực tiếp, chẳng hạn dẫn người dùng sang các nền tảng trả phí như OnlyFans (dịch vụ cho phép người sáng tạo nội dung thu phí trực tiếp từ người theo dõi của Mỹ),...
Một số tài khoản từng gây chú ý khi đăng ảnh "check-in ảo" tại Coachella nhưng vẫn nhận được lời mời gặp mặt từ người hâm mộ. Đến nay, mô hình này tiếp tục lan rộng, thậm chí được biến thành các khóa học hướng dẫn tạo influencer AI như một phương thức kiếm tiền mới.
Đại nhạc hội Coachella, vốn được xem là "sàn đấu" để các nhà sáng tạo nội dung tranh dành từng khung hình, săn những bản hợp đồng tài trợ quảng cáo béo bở giờ đây có nguy cơ trở thành nơi phô diễn những hình ảnh được dàn dựng bằng công nghệ.
19h ngày 6/4 (6h ngày 7/4 theo giờ Hà Nội), tàu Orion đưa phi hành đoàn Artemis II tới gần Mặt Trăng nhất khi chỉ cách 6.545 km. Tại thời điểm này, tàu di chuyển với tốc độ khoảng 97.950 km/h so với Trái Đất, nhưng chỉ 5.052 km/h so với Mặt Trăng.
Hai phút sau, tàu tiếp tục bay xa Trái Đất nhất, cách 406.771 km, lập kỷ lục mới cho chuyến bay vũ trụ có người lái. Cột mốc đưa phi hành đoàn đến vị trí cách hành tinh xanh xa hơn 6.616 km so với nhiệm vụ Apollo 13 năm 1970.
Ở khoảng cách này, Mặt Trăng xuất hiện trước mắt phi hành đoàn Artemis II với kích thước tương đương quả bóng rổ đặt cách một cánh tay. Họ cũng là những người đầu tiên nhìn thấy một số khu vực ở phía xa Mặt Trăng (phía luôn bị khuất khi nhìn từ Trái Đất) bằng mắt thường.
Trước đó, 13h56 ngày 6/4 (0h56 ngày 7/4 giờ Hà Nội), Artemis II cũng phá kỷ lục về quãng đường xa nhất mà con người từng bay khỏi Trái Đất, với 400.171 km, do Apollo 13 thiết lập năm 1970. "Khi vượt qua khoảng cách xa nhất mà con người từng rời khỏi Trái Đất, chúng tôi muốn tôn vinh kỳ tích và nỗ lực phi thường của người tiền nhiệm trong lĩnh vực thám hiểm không gian", Jeremy Hansen từ Cơ quan Vũ trụ Canada (CSA), thành viên phi hành đoàn Artemis II, chia sẻ.
"Chúng tôi sẽ tiếp tục hành trình tiến xa hơn nữa vào không gian trước khi được Mẹ Trái Đất kéo trở lại với tất cả những gì thân yêu. Nhưng điều quan trọng nhất là chúng tôi chọn khoảnh khắc này để thách thức thế hệ hiện tại và thế hệ tiếp theo, đảm bảo kỷ lục mới sẽ không tồn tại lâu", ông nói thêm.
Tàu Orion rời bệ phóng tối 1/4 (5h35 ngày 2/4 giờ Hà Nội) đưa bốn phi hành gia bay tới Mặt Trăng, trở thành sứ mệnh có người lái đầu tiên của NASA vượt ra ngoài quỹ đạo Trái Đất tầm thấp sau 54 năm. Phi hành đoàn gồm chỉ huy nhiệm vụ Reid Wiseman (NASA), phi công Victor Glover (NASA), chuyên gia nhiệm vụ Christina Koch (NASA) và chuyên gia nhiệm vụ Jeremy Hansen (Cơ quan Vũ trụ Canada CSA).
Nhiệm vụ Artemis II đánh dấu hàng loạt cột mốc trong ngành hàng không vũ trụ. Ví dụ, phi hành gia da màu, người phụ nữ, người không phải công dân Mỹ đầu tiên, phi hành gia lớn tuổi nhất đến Mặt Trăng. Bên cạnh đó, đây là chuyến bay có người lái đầu tiên của tên lửa Hệ thống Phóng Không gian (SLS) và tàu Orion. Rất nhiều công nghệ trên tàu cũng lần đầu được thử nghiệm ngoài không gian như Hệ thống Liên lạc Quang học Orion Artemis II, sử dụng tia laser để gửi và nhận dữ liệu từ Trái Đất. Ngoài ra, tàu cũng trang bị nhà vệ sinh hoạt động đầy đủ đầu tiên trong chuyến bay tới Mặt Trăng.
"Images 2.0 mang đến chi tiết và độ chính xác chưa từng có trong việc tạo hình ảnh", OpenAI cho biết trên blog ngày 21/4. "Không chỉ hình dung bối cảnh ảnh phức tạp, nó còn hiện thực hóa tầm nhìn của người dùng hiệu quả nhưng vẫn tuân theo hướng dẫn, bảo toàn các chi tiết được yêu cầu".
Theo công ty, ChatGPT với Images 2.0 có thể hiển thị chi tiết nhỏ vốn "làm khó" mô hình AI tạo ảnh, như văn bản nhỏ, biểu tượng, yếu tố giao diện người dùng, bố cục dày đặc cũng như các ràng buộc về phong cách. Tất cả ảnh tạo ra đều ở độ phân giải đến 2K.
Lần đầu tiên, OpenAI cũng tích hợp khả năng suy luận vào mô hình tạo ảnh khi Images 2.0 có "khả năng tư duy", cho phép tìm kiếm trên web, tạo ra nhiều hình ảnh từ một yêu cầu duy nhất, tự động kiểm tra trước khi hiển thị. Nhờ đó, công cụ có thể tạo banner, menu cho quán ăn... với nhiều kích thước khác nhau, cũng như truyện tranh nhiều khung hình. Chế độ này mất nhiều thời gian xử lý hơn so với thông thường, nhưng cho độ chính xác cao hơn.
AI mới cũng có khả năng hiển thị văn bản không phải chữ La-tinh với các ngôn ngữ như tiếng Nhật, tiếng Hàn, tiếng Hindi và tiếng Bengali. Kiến thức của mô hình được cập nhật đến tháng 12/2025. Công ty của Sam Altman không nêu chi tiết mô hình AI đứng sau Images 2.0.
ChatGPT Images 2.0 hỗ trợ dải tỷ lệ khung hình rộng từ 3:1 đến 1:3, có thể thiết lập trực tiếp qua câu lệnh. Tuy nhiên, công cụ cũng gặp một số khó khăn khi mô phỏng chi tiết ẩn, góc nghiêng lạ hoặc cấu trúc vật lý phức tạp. Các biểu đồ chứa thông tin dày đặc cũng dễ sai sót. OpenAI cho biết đã áp dụng biện pháp an toàn để ngăn người dùng tạo nội dung độc hại.
Thử nghiệm thực tế với tiếng Việt cho thấy, so với bản cũ Image 1.5 cuối năm ngoái, ChatGPT với Images 2.0 cho khả năng tạo ảnh nhanh và chính xác. Chữ tiếng Việt hiển thị gần như không gặp các lỗi liên quan đến chính tả hay hiển thị sai, kể cả với văn bản dài.
Theo TechCrunch, thuật toán tạo ảnh bằng AI thường gặp khó khăn trong nhận diện ngôn ngữ, bởi chúng sử dụng mô hình khuếch tán. "Các mô hình khuếch tán chủ yếu tái tạo lại đầu vào nội dung. Chúng có thể giả định rằng chữ viết trên hình ảnh chỉ là một phần rất nhỏ, vì thế bộ tạo hình ảnh sẽ học các mẫu bao phủ nhiều pixel hơn thay vì hiển thị chính xác", Asmelash Teka Hadgu, người sáng lập kiêm CEO của Lesan AI, giải thích.
Cuối năm ngoái, Google cũng ra mắt công cụ Nano Banana Pro nâng cấp khả năng tạo chữ chính xác, hỗ trợ làm đồ họa, sơ đồ, điều mà các mô hình AI khác chưa làm được khi đó. Công cụ có thể được ứng dụng cho những đồ họa như infographic, biển quảng cáo, sơ đồ minh họa, bản ghi chú, công thức nấu ăn...