66B là một mô hình ngôn ngữ có khoảng 66 tỷ tham số, được thiết kế để xử lý ngôn ngữ tự nhiên và tạo văn bản chất lượng cao cho nhiều tác vụ như trả lời câu hỏi, tóm tắt, và sáng tác nội dung.
Kiến trúc của 66B dựa trên các biến thể của transformer, với nhiều lớp tự Attention và feed-forward. Việc huấn luyện được thực hiện trên tập dữ liệu đa dạng, bao gồm văn bản web, sách, và tài liệu bằng nhiều ngôn ngữ, với mục tiêu tối ưu hóa perplexity và khả năng hiểu-nghe ngôn ngữ.
So với các mô hình có tham số nhỏ hơn như 7B hay 13B, 66B thể hiện khả năng hiểu và sinh văn bản mượt mà hơn, đặc biệt ở các tác vụ phức tạp. Tuy nhiên, quy mô lớn đi kèm với yêu cầu tính toán và bộ nhớ cao hơn, và có thể tăng rủi ro nội dung không mong muốn nếu dữ liệu huấn luyện không cân nhắc.
Lợi ích của 66B bao gồm chất lượng văn bản tốt, khả năng điều chỉnh phong cách và ngôn ngữ, cùng với khả năng đáp ứng nhanh các câu hỏi đa dạng. Hạn chế gồm yêu cầu phần cứng mạnh, chi phí vận hành cao và thách thức về kiểm soát khuôn mẫu và loại bỏ thiên lệch trong dữ liệu huấn luyện.