IOAI 2025 — Xác thực tranh cổ

Xem PDF



Tác giả:
Dạng bài
Ngôn ngữ cho phép
Output
Điểm: 1200 (p) Thời gian: 1.0s Bộ nhớ: 256M Input: bàn phím Output: màn hình

Mô tả bài toán

Bạn được mời giúp một nhà khảo cổ học và phê bình nghệ thuật xây dựng một thuật toán phân biệt các bức tranh cổ là nguyên bản hay bản sao. Vì việc xác thực thủ công tốn kém, đội nghiên cứu chỉ kịp gắn nhãn cho một phần nhỏ trong số các bức tranh đã thu thập; phần lớn còn lại chưa có nhãn. Tuy nhiên, các đặc trưng số (digital features) trích xuất từ tranh được biết là có cấu trúc rõ ràng, nên ta vẫn có thể tận dụng cả những mẫu chưa gắn nhãn để huấn luyện mô hình.

Đây là bài toán phân loại nhị phân bán giám sát (semi-supervised binary classification): nhãn nhận một trong ba giá trị -1 (bản sao), +1 (nguyên bản) và 0 (chưa biết). Bạn cần xây dựng một mô hình dự đoán nhãn -1 hoặc +1 cho các mẫu trong tập kiểm tra.

Dữ liệu

Bộ dữ liệu gồm các tệp sau (đính kèm cùng đề bài):

  • training_set.csvtập huấn luyện (training set), gồm 500 dòng. Năm cột đầu là đặc trưng số của mỗi bức tranh, cột thứ sáu là nhãn nhận giá trị -1, 1 hoặc 0 (0 nghĩa là chưa biết nhãn).
  • test_input.csvtập kiểm tra (test set), gồm 500 dòng, chỉ có 5 cột đặc trưng (không kèm nhãn). Đây là dữ liệu mà bài nộp của bạn cần dự đoán.
  • sample_submission.csv — ví dụ minh hoạ định dạng tệp đáp án.

Ngoài ra, bạn có thể tham khảo:

  • ioai25antique_baseline.ipynb — notebook giải pháp cơ sở (baseline), minh hoạ cách đọc dữ liệu, huấn luyện một mô hình SVM đơn giản và xuất tệp nộp bài.
  • figures.zip — các hình minh hoạ kèm theo đề bài gốc.

Bài nộp

Nộp một tệp zip chứa duy nhất tệp test_answer.csv, trong đó:

  • Mỗi dòng chứa đúng một dự đoán, là -1 hoặc 1.
  • Số dòng bằng số dòng của test_input.csv (500 dòng) và theo đúng thứ tự các mẫu trong tệp đó.
  • Không có dòng tiêu đề (header), không có cột chỉ số.

Hệ thống chấm sẽ giải nén tệp nộp, đọc test_answer.csv và so khớp với nhãn thật, vì vậy bạn cần tuân thủ nghiêm ngặt định dạng trên.

Tiêu chí chấm

Tiêu chí đánh giá là độ chính xác phân loại (classification accuracy) — tỉ lệ mẫu được dự đoán đúng trên tổng số mẫu trong tập kiểm tra.

Để tham chiếu, theo công bố của Ban Khoa học IOAI 2025 trên Leaderboard B:

  • Điểm baseline (giải pháp cơ sở): 0.46.
  • Điểm cao nhất đạt được: 0.98.

Bài toán gốc thuộc kỳ thi cá nhân IOAI 2025 (Bắc Kinh, Trung Quốc). Mã nguồn và mô tả gốc có tại kho lưu trữ chính thức của IOAI.

Tệp

Bình luận

Mới nhất
Tải bình luận...

Không có bình luận nào.

Kỳ thi: