66B là một mô hình ngôn ngữ lớn với 66 tỷ tham số
66B là một mô hình ngôn ngữ lớn (LLM) có khoảng 66 tỷ tham số, được thiết kế để xử lý ngôn ngữ tự nhiên, sinh văn bản, trả lời câu hỏi và thực hiện tác vụ ngôn ngữ phức tạp với hiệu suất cao.
Kiến trúc của 66B
Kiến trúc của 66B phần lớn dựa trên Transformer, gồm nhiều lớp self-attention và feed-forward. Mã hóa chuỗi văn bản đầu vào và giải mã đầu ra thông qua cơ chế attention đa đầu. Các kỹ thuật tối ưu hóa như pretraining, fine-tuning và học đa tác vụ giúp tăng cường khả năng hiểu ngữ cảnh và sinh văn bản tự nhiên.
Đào tạo và dữ liệu
66B được huấn luyện trên tập dữ liệu khổng lồ gồm sách, trang web và các nguồn văn bản khác, với biện pháp lọc để giảm nội dung độc hại và sai lệch. Quá trình huấn luyện bao gồm pretraining trên mục tiêu dự đoán từ tiếp theo và đánh giá trên các bộ kiểm tra chuẩn.
