Phân Loại Hoa Iris
Xem PDF
Điểm:
500
Thời gian:
1.0s
Bộ nhớ:
256M
Input:
bàn phím
Output:
màn hình
Tập dữ liệu Iris là một trong những tập dữ liệu kinh điển nhất trong lĩnh vực học máy, bao gồm 150 mẫu hoa thuộc 3 loài khác nhau: Iris-setosa, Iris-versicolor và Iris-virginica. Mỗi mẫu được mô tả bởi 4 đặc trưng đo lường từ thực tế.
Mô Tả Dữ Liệu
Tập dữ liệu gốc bao gồm các cột sau:
- Id: Mã định danh duy nhất cho mỗi mẫu hoa.
- SepalLengthCm: Chiều dài đài hoa (cm).
- SepalWidthCm: Chiều rộng đài hoa (cm).
- PetalLengthCm: Chiều dài cánh hoa (cm).
- PetalWidthCm: Chiều rộng cánh hoa (cm).
- Species: Nhãn loài hoa — đây là biến mục tiêu cần dự đoán.
Yêu Cầu Bài Toán
Cho trước tập huấn luyện train.csv có đầy đủ các đặc trưng và nhãn loài, và tập kiểm tra test.csv không có cột nhãn, bạn cần:
- Xây dựng mô hình phân loại dựa trên tập huấn luyện.
- Dự đoán loài hoa (
Species) cho từng mẫu trong tập kiểm tra. - Lưu kết quả dự đoán vào file theo định dạng của sample_output.csv, bao gồm cột
Idvà cộtSpecies.
Tiêu Chí Đánh Giá
Kết quả nộp bài sẽ được so sánh với file output ẩn chứa nhãn thực tế của tập kiểm tra. Độ chính xác (Accuracy) sẽ là thước đo chính:
\[\text{Accuracy} = \frac{\text{Số mẫu dự đoán đúng}}{\text{Tổng số mẫu kiểm tra}} \times 100\%\]
Định Dạng Nộp Bài
File kết quả phải đặt tên là output.csv có đúng 30 dòng (không tính dòng tiêu đề), với hai cột Id và Species, khớp với định dạng của sample_output.csv.
File dữ liệu
- File iris.zip gồm 3 files train.csv, test.csv, sample_output.csv
Bình luận