Từ điển AI #3: Few-shot Prompting là gì?

Few-shot Prompting là kỹ thuật cung cấp cho mô hình ngôn ngữ lớn một vài ví dụ cụ thể (thường 2-5 cặp dữ liệu Đầu vào – Đầu ra) ngay trong câu lệnh, giúp AI “học” theo mẫu tức thời thay vì chỉ dựa vào mô tả bằng lời.

Ở bài viết trước, dữ liệu từ chính nghiên cứu gốc về GPT-3 đã cho thấy: hiệu suất few-shot vượt zero-shot rõ rệt trên hầu hết bộ dữ liệu chuẩn, và khoảng cách này còn nới rộng khi mô hình càng lớn. Đây chính là lúc chúng ta tìm hiểu tận gốc kỹ thuật đứng sau con số đó.

Few-shot Prompting

Few-shot Prompting là gì, và vì sao nó hoạt động hiệu quả đến vậy?

Thay vì chỉ đưa ra mệnh lệnh suông, Few-shot Prompting nghĩa là bạn trực tiếp trình diễn cho AI thấy kết quả cuối cùng nên trông như thế nào, thông qua một vài cặp ví dụ Đầu vào – Đầu ra. Cơ chế đứng sau gọi là “học trong ngữ cảnh” (in-context learning): AI không thực sự cập nhật lại các tham số nội tại của nó (như đã tìm hiểu ở bài Model Parameters), mà đang thực hiện một quá trình khớp mẫu (pattern matching) dựa trên các mối quan hệ nó quan sát được giữa những ví dụ bạn vừa đưa ra, ngay trong phạm vi context window của cuộc hội thoại đó.

Nghiên cứu gốc đã đo lường mức cải thiện chính xác ra sao – và có phải lúc nào few-shot cũng thắng?

Cũng trong nghiên cứu GPT-3 gốc, dữ liệu thực nghiệm cho thấy một bức tranh có sắc thái hơn nhiều người nghĩ. Trên phần lớn benchmark, xu hướng cải thiện rất rõ: TriviaQA tăng từ 64,3% (zero-shot) lên 71,2% (few-shot); CoQA tăng từ 81,5 lên 85,0 điểm F1; StoryCloze tăng từ 83,2% lên 87,7%. Nhưng thú vị là không phải benchmark nào cũng tuân theo quy luật tuyến tính: trên bộ dữ liệu PIQA đo lường lẽ thường vật lý, hiệu suất one-shot (80,5%) thậm chí còn thấp hơn zero-shot (81,0%), trước khi few-shot vượt lên 82,8%. Bài học thực tế rút ra: few-shot không phải “cây đũa thần” luôn cải thiện kết quả một cách tuyến tính — chất lượng và số lượng ví dụ mẫu bạn chọn quan trọng không kém việc có ví dụ hay không.

Khi nào nên chọn Few-shot Prompting thay vì đầu tư vào fine-tuning?

Đây là một câu hỏi thực dụng mà nhiều nhà quản lý sản phẩm và bộ phận công nghệ trong doanh nghiệp phải cân nhắc. Fine-tuning – huấn luyện lại một phần mô hình bằng dữ liệu riêng của tổ chức – thường cho kết quả ổn định và chuyên sâu hơn về lâu dài, nhưng đòi hỏi chi phí, thời gian, và đội ngũ kỹ thuật chuyên trách. Few-shot Prompting, ngược lại, gần như miễn phí về mặt triển khai: chỉ cần vài ví dụ tốt đặt ngay trong câu lệnh là có thể thấy kết quả tức thì, không cần huấn luyện lại gì cả. Nguyên tắc thực dụng: nếu tác vụ của bạn thay đổi thường xuyên hoặc số lượng người dùng còn nhỏ, few-shot là lựa chọn hợp lý hơn; chỉ khi tác vụ đã ổn định, khối lượng sử dụng đủ lớn, và đòi hỏi độ chính xác rất cao mới nên cân nhắc đầu tư vào fine-tuning.

Ứng dụng thực tế: cá nhân hóa văn phong và định dạng dữ liệu

Một trong những lý do khiến Few-shot Prompting quan trọng chính là khả năng xử lý các nhiệm vụ mang tính cá nhân hóa cao. Nếu bạn muốn AI viết theo giọng văn hài hước, châm biếm đặc trưng của mình, mô tả “hãy viết hài hước” thường cho kết quả ngô nghê; nhưng nếu đưa vào hai đoạn văn mẫu bạn từng viết, AI sẽ phân tích cấu trúc câu, cách dùng từ lóng, nhịp điệu để mô phỏng lại. Few-shot cũng là cứu cánh cho việc trích xuất dữ liệu theo định dạng JSON, Markdown, hay các bảng biểu phức tạp – chỉ cần vài ví dụ mẫu, AI hiểu ngay quy luật logic, kể cả những quy tắc rất riêng mà không có cách nào diễn đạt gọn gàng bằng lời.

Điều gì xảy ra nếu bạn chọn ví dụ mẫu không nhất quán?

Một cạm bẫy ít người để ý: nếu các ví dụ mẫu trong prompt mâu thuẫn nhau về định dạng hoặc logic, AI sẽ không “chọn” ví dụ đúng mà thường trộn lẫn các mẫu hình một cách khó lường, tạo ra kết quả lộn xộn hơn cả khi không có ví dụ nào. Nguyên tắc an toàn: mọi ví dụ trong cùng một prompt cần tuân theo đúng một cấu trúc, một văn phong nhất quán – vì AI đang cố gắng suy luận ra “quy luật ẩn” đằng sau các ví dụ đó, và một quy luật mâu thuẫn sẽ khiến quá trình suy luận này thất bại.

Vì sao Few-shot giúp giảm thiểu ảo giác?

Với Zero-shot, AI đôi khi tự tiện thêm thắt thông tin ngoài lề hoặc thay đổi cấu trúc câu trả lời mỗi lần một khác. Khi có sự hiện diện của ví dụ mẫu, AI được đặt vào một chiếc khung kỷ luật – nó hiểu định dạng và phong cách trả lời phải nhất quán với những gì đã được trình diễn. “The Prompt Report” nhấn mạnh rằng việc cung cấp ví dụ mẫu chất lượng cao có thể làm giảm đáng kể hiện tượng ảo giác đã tìm hiểu ở bài #11, vì AI có một hệ tham chiếu thực tế để bám sát thay vì tự suy diễn hoàn toàn.

Số lượng ví dụ lý tưởng là bao nhiêu — càng nhiều càng tốt?

Trực giác thông thường cho rằng cung cấp càng nhiều ví dụ, AI càng hiểu rõ yêu cầu. Nhưng dữ liệu thực nghiệm từ nghiên cứu GPT-3 gốc cho thấy đường cong cải thiện có xu hướng bão hòa khá nhanh: phần lớn lợi ích đến từ việc đi từ 0 ví dụ lên 2-4 ví dụ, trong khi tăng từ 4 lên vài chục ví dụ mang lại cải thiện biên tế nhỏ hơn nhiều, đồng thời làm prompt dài hơn, tốn nhiều token hơn (khái niệm sẽ tìm hiểu ở bài #8), và có nguy cơ vượt quá context window đã tìm hiểu ở bài #9. Nguyên tắc thực dụng cho công việc văn phòng: 2-3 ví dụ chất lượng cao, đa dạng về tình huống, thường đã đủ để AI nắm được quy luật – quan trọng hơn số lượng là việc các ví dụ đó có bao phủ được những trường hợp biên (edge case) mà bạn thực sự gặp phải hay không.

Việc làm chủ Few-shot là bước đệm quan trọng để bạn bước từ vị thế người dùng phổ thông lên hàng ngũ những chuyên gia điều khiển AI thực thụ. Nhưng khi các nhiệm vụ trở nên lắt léo, đòi hỏi khả năng suy luận logic đa tầng, liệu chỉ vài ví dụ mẫu có đủ? Đó chính là lúc chúng ta cần đến sức mạnh của Chain-of-Thought – chủ đề bài viết tiếp theo.

Tham khảo khóa học AI Mastery for Work level 1 và 2 tại đây.