AI RACE— Cuộc đua AI
AI League

Kog khai thác sâu GPU để tăng tốc suy luận AI lên tới 30 lần

Startup Pháp Kog hứa tăng tốc suy luận mô hình ngôn ngữ lớn trên GPU tiêu chuẩn bằng phần mềm, thu hút hơn 200 khách hàng tiềm năng.

21:50 14/08/2026
AI League

Tin nóng: Kog hứa “bóp” hiệu năng suy luận AI từ GPU hiện có

Vào tháng 5 năm 2026, công ty khởi nghiệp Pháp Kog đã gây chú ý trên Hacker News với bản preview công nghệ cho phép “giải mã nhanh chóng một yêu cầu duy nhất” trên các GPU trung tâm dữ liệu phổ biến như AMD MI300X và NVIDIA H200 – những thiết bị mà các doanh nghiệp đã sở hữu sẵn. CEO Gaël Delalleau cho biết công nghệ Kog Inference Engine (KIE) có thể làm tăng tốc độ suy luận lên tới 30‑x so với hiện trạng, đồng thời đã thu hút hơn 200 “lead” kinh doanh thực tế ngay sau buổi giới thiệu.

Chi tiết công nghệ và phản hồi thị trường

Kog tập trung vào việc tối ưu phần mềm để khai thác toàn bộ băng thông bộ nhớ và khả năng tính toán của GPU, thay vì thiết kế chip chuyên dụng như Cerebras. Trong buổi demo, Kog đã chạy mô hình Laneformer 2B – một mô hình mở nguồn với khoảng 2 tỷ tham số – đạt tốc độ 3 000 token mỗi giây (TPS) cho một yêu cầu. Mặc dù mô hình này còn nhỏ, Delalleau khẳng định cùng phương pháp sẽ áp dụng được cho các LLM lớn hơn, nơi “bộ nhớ và băng thông GPU ngày càng mạnh mẽ, chỉ chờ được khai thác tối đa”.

Đối tượng khách hàng mục tiêu của Kog là những người dùng phải chờ hàng giờ để nhận kết quả từ các mô hình như Claude của Anthropic. Anthropic hiện đã bán chế độ Fast Mode với mức giá cao hơn, chứng tỏ tốc độ là yếu tố quyết định chi phí. Kog hy vọng giải pháp phần mềm sẽ giúp các doanh nghiệp, đặc biệt là các nhà phát triển game và ứng dụng, rút ngắn thời gian phản hồi, từ đó tăng doanh thu. Đối tác thiết kế của Kog đã xác nhận rằng việc giảm thời gian suy luận sẽ mang lại lợi thế cạnh tranh đáng kể.

Theo Delalleau, Kog đã nhận được “200 lead kinh doanh thực tế” ngay sau buổi trình diễn. Công ty đang tập trung vào việc tăng tốc phát triển các mô hình lớn hơn, vì khách hàng chưa sẵn sàng tinh chỉnh các mô hình nhỏ. Đội ngũ 11 người của Kog sẽ dành vài tuần, thậm chí vài tháng, để “đào sâu” vào kiến trúc từng loại GPU mới, thực hiện nghiên cứu kỹ thuật GPU ở mức độ rất chi tiết. Đây là lý do tại sao Kog chỉ có thể hỗ trợ một số lượng giới hạn các chip trong thời gian tới, nhưng kế hoạch dài hạn là xây dựng các pipeline dựa trên agent để mở rộng sang nhiều chip và mô hình hơn.

Kog không hoạt động độc lập; họ đã nhận được hỗ trợ từ Scaleway và các quỹ đầu tư của Pháp như Bpifrance và chương trình French Tech 2030. Vòng seed của Kog được dẫn dắt bởi Varsity VC, do Kamel Zeroual – đồng sáng lập cũ của Stribe (công ty được TechCrunch nhắc đến năm 2009) – là đối tác chính. Delalleau, người có nền tảng vật lý bán dẫn tại École Polytechnique và kinh nghiệm trong lĩnh vực an ninh mạng tấn công (white‑hat hacking), đã áp dụng tư duy “đảo ngược mã” để hiểu sâu về luật vật lý và kiến trúc GPU, từ đó tối ưu hoá phần mềm ở mức lắp ráp và mã nhị phân.

Trong khi một số người dùng lo ngại công nghệ này không áp dụng được cho GPU laptop, Delalleau nhấn mạnh rằng các GPU máy chủ hiện nay đã có băng thông bộ nhớ “khá khủng” và chỉ cần “mở khóa” chúng. Các đối thủ như ZML (cũng đến từ Pháp) đã phát triển phần mềm không phụ thuộc vào CUDA để tăng tốc suy luận trên nhiều loại chip, và Stanford Hazy Research cũng đang nghiên cứu tăng tốc GPU sâu hơn. Tuy nhiên, Delalleau cho rằng Kog “đi sâu hơn” cả Hazy, tập trung vào việc tối ưu từng lớp phần cứng.

Kế hoạch tiếp theo của Kog là triển khai mô hình lớn hơn với tốc độ gấp 10 lần vào tháng 9 năm 2026. Khi đạt được thành công này, công ty dự định sẽ chứng minh sức hút của mình với khách hàng thực tế và tiến tới vòng Series A để mở rộng quy mô.

Bối cảnh ngành và triển vọng

Cuộc đua tăng tốc suy luận AI đang diễn ra mạnh mẽ sau khi Cerebras – nhà sản xuất chip chuyên dụng – đã thu hút sự chú ý của thị trường trong đợt IPO tháng 5. Tuy nhiên, chi phí đầu tư cho phần cứng chuyên dụng vẫn cao, khiến nhiều doanh nghiệp tìm đến giải pháp tối ưu phần mềm trên GPU hiện có. Kog, cùng với ZML và các nhóm nghiên cứu của Stanford, đang khẳng định rằng “GPU vẫn còn tiềm năng chưa được khai thác hết”. Nếu Kog thực hiện thành công cam kết 30 x tăng tốc trên LLM, họ sẽ không chỉ mở ra một kênh giảm chi phí đáng kể cho các doanh nghiệp mà còn củng cố vị thế của châu Âu trong lĩnh vực AI độc lập, nhờ sự hỗ trợ của các quỹ quốc gia và chương trình French Tech 2030. Thành công của Kog sẽ là bằng chứng cho việc “phần mềm có thể làm cho phần cứng hiện có mạnh hơn”, đồng thời tạo đà cho các nhà khởi nghiệp châu Âu tiếp tục đầu tư vào nghiên cứu sâu GPU và các giải pháp AI tối ưu.

◗ Nguồn

TechCrunch14-08

Tin liên quan