Quay lại

Christian Ordoñez

Số áo #32

Midfielder

Quốc tịch Flag Argentina
Tuổi 22
Chiều cao 5' 10"
Cân nặng 141 lbs

Câu lạc bộ hiện tại

Logo

Parma

Clubhouse

Thông tin chi tiết (Wikipedia)

Danh sách các bộ dữ liệu dùng trong nghiên cứu học máy bao gồm các tập dữ liệu được sử dụng trong nghiên cứu học máy và được mô tả hoặc sử dụng trong các công trình học thuật đã qua bình duyệt. Các bộ dữ liệu đóng vai trò quan trọng trong việc phát triển và đánh giá các thuật toán và mô hình học máy.

Các bộ dữ liệu trong danh sách được phân loại chủ yếu theo dạng dữ liệu mà mô hình xử lý, chẳng hạn như hình ảnh, video, văn bản, âm thanh, chuỗi thời gian, dữ liệu dạng bảng, đồ thị, dữ liệu ba chiều và dữ liệu đa phương thức kết hợp nhiều dạng khác nhau. Trong mỗi nhóm, chúng có thể được chia nhỏ theo nội dung hoặc lĩnh vực ứng dụng. Một bộ dữ liệu có thể hỗ trợ nhiều tác vụ học máy khác nhau, chẳng hạn như phân loại, hồi quy, phân vùng ảnh, phát hiện vật thể, xử lý ngôn ngữ tự nhiên, hệ thống gợi ý hoặc tổng quát hóa miền.

Trong các bộ dữ liệu dùng cho học có giám sát, mỗi mẫu dữ liệu thường đi kèm một hoặc nhiều nhãn (label) biểu thị thông tin mà mô hình cần dự đoán. Trong bài toán phân loại, mỗi giá trị phân loại có thể được gọi là một lớp (class); chẳng hạn, một bộ dữ liệu ảnh chó và mèo có hai lớp, còn nhãn của một ảnh cụ thể cho biết ảnh đó thuộc lớp nào. Một mẫu cũng có thể có nhiều nhãn cùng lúc, như một ảnh được gán đồng thời các nhãn "người", "ô tô" và "đường phố". Với các tác vụ khác, nhãn có thể mang dạng khác, chẳng hạn một giá trị số trong hồi quy, hộp giới hạn trong phát hiện vật thể, nhãn cho từng pixel trong phân vùng ảnh, hoặc một chuỗi văn bản trong các bài toán ngôn ngữ. Một số bộ dữ liệu không có nhãn có thể được sử dụng cho học không giám sát hoặc học tự giám sát.

Dữ liệu hình ảnh

Chữ viết tay và ký tự

Bộ dữ liệu Mô tả Quy mô Tác vụ Năm Nguồn
MNIST Ảnh đen trắng 28 × 28 pixel của các chữ số viết tay từ 0 đến 9. 70.000 ảnh Phân loại ảnh; nhận dạng chữ viết tay 1998
USPS Ảnh đen trắng của các chữ số viết tay được trích từ mã ZIP trên thư của Bưu điện Hoa Kỳ. Khoảng 12.000 ảnh Phân loại ảnh; nhận dạng chữ viết tay 1992
CASIA-HWDB Ảnh đen trắng của các ký tự và văn bản chữ Hán viết tay do hơn một nghìn người viết tạo ra. Hơn 1 triệu ảnh ký tự Phân loại ảnh; nhận dạng chữ viết tay; nhận dạng chữ Hán 2013
Chars74K Ảnh các ký tự tiếng Anhchữ Kannada được thu thập từ cảnh tự nhiên, chữ viết tay và các phông chữ tổng hợp. 74.107 ảnh Nhận dạng ký tự; nhận dạng ký tự quang học; phân loại ảnh 2009
EMNIST Ảnh đen trắng 28 × 28 pixel của các chữ số và chữ cái viết tay, được tạo từ NIST Special Database 19 theo cùng định dạng với MNIST. 814.255 ảnh trong tập ByClass Phân loại ảnh; nhận dạng chữ viết tay; nhận dạng ký tự 2017
Street View House Numbers (SVHN) Ảnh màu của các chữ số trong số nhà được thu thập từ Google Street View, kèm nhãn và hộp giới hạn cho từng chữ số. 630.420 chữ số Nhận dạng chữ số; phân loại ảnh; phát hiện ký tự 2011
Semeion Handwritten Digit Ảnh nhị phân đã chuẩn hóa của các chữ số viết tay từ 0 đến 9 do 80 người viết tạo ra. 1.593 ảnh Phân loại ảnh; nhận dạng chữ viết tay 2008

Vật thể

Bộ dữ liệu Mô tả Quy mô Tác vụ Năm Nguồn
Caltech 101 Ảnh các vật thể thuộc 101 lớp, với phần lớn vật thể xuất hiện trên nền tương đối đồng nhất. 9.146 ảnh; 101 lớp Phân loại ảnh; nhận dạng vật thể 2004
Caltech-256 Ảnh các vật thể thuộc 256 lớp, với số lượng ảnh và mức độ đa dạng lớn hơn Caltech 101. 30.607 ảnh; 256 lớp Phân loại ảnh; nhận dạng vật thể 2007
CIFAR-10 Ảnh màu 32 × 32 pixel thuộc 10 lớp vật thể, được lấy từ bộ 80 Million Tiny Images. 60.000 ảnh; 10 lớp Phân loại ảnh 2009
CIFAR-100 Ảnh màu 32 × 32 pixel thuộc 100 lớp vật thể, được nhóm thành 20 siêu lớp. 60.000 ảnh; 100 lớp Phân loại ảnh; phân loại theo nhãn lớn và nhãn con 2009
Fashion-MNIST Ảnh đen trắng 28 × 28 pixel của các sản phẩm thời trang thuộc 10 lớp, theo cùng định dạng dữ liệu với MNIST. 70.000 ảnh; 10 lớp Phân loại ảnh 2017
ImageNet Ảnh thuộc hàng nghìn lớp vật thể được tổ chức theo hệ thống khái niệm phân cấp của WordNet. 14.197.122 ảnh; 21.841 lớp, trong đó một tập hợp con gồm 1.000 lớp thường được sử dụng cho cuộc thi ILSVRC Phân loại ảnh; phân loại theo nhãn lớn và nhãn con; phát hiện vật thể 2009
SUN Ảnh các cảnh trong nhà và ngoài trời thuộc nhiều lớp cảnh, kèm chú thích cho các vật thể xuất hiện trong ảnh. 131.067 ảnh; 899 lớp Nhận dạng cảnh; nhận dạng vật thể 2010
LSUN Ảnh thuộc 10 lớp cảnh và 20 lớp vật thể, được gán nhãn bằng quy trình kết hợp mô hình học sâu với chú thích của con người. Khoảng 1 triệu ảnh có nhãn cho mỗi một trong 10 lớp cảnh; ngoài ra có 20 lớp vật thể Phân loại ảnh; nhận dạng cảnh; nhận dạng vật thể 2015
LabelMe Ảnh các cảnh tự nhiên, trong đó các vật thể được người dùng chú thích bằng đa giác và nhãn văn bản. 187.240 ảnh, trong đó 62.197 ảnh được chú thích. Tổng cộng 658.992 vật thể được chú thích Nhận dạng vật thể; phát hiện vật thể; phân vùng ảnh; tổng quát hóa miền 2008
Places Ảnh các cảnh trong nhà và ngoài trời thuộc hơn 400 lớp địa điểm và cảnh. Khoảng 10 triệu ảnh; hơn 400 lớp cảnh Phân loại ảnh; nhận dạng cảnh 2018
PASCAL VOC Ảnh các cảnh tự nhiên chứa vật thể thuộc 20 lớp, kèm nhãn lớp, hộp giới hạn và mặt nạ phân vùng. Hàng chục nghìn ảnh qua các phiên bản (2007: 9.963, 2012: 22.263, bản tổng hợp 21.503 ảnh lấy năm 2007 và một phần từ 2012); 20 lớp Phân loại ảnh; phát hiện vật thể; phân vùng ảnh 2010
Microsoft COCO Ảnh các cảnh đời thường chứa nhiều vật thể trong bối cảnh tự nhiên, kèm chú thích lớp, hộp giới hạn và mặt nạ phân vùng cho từng vật thể. Hơn 200.000 ảnh; hơn 1,5 triệu đối tượng Phát hiện vật thể; phân vùng ảnh; ước lượng điểm mốc; tạo chú thích ảnh 2014
Open Images Ảnh thuộc hàng nghìn lớp vật thể, kèm nhãn cấp ảnh, hộp giới hạn, mặt nạ phân vùng và chú thích quan hệ giữa các vật thể. Khoảng 9 triệu ảnh; 20.000 lớp và 600 vật thể có hộp giới hạn Phân loại ảnh; phát hiện vật thể; phân vùng ảnh; phát hiện quan hệ trực quan 2017
LVIS Ảnh các cảnh tự nhiên chứa vật thể thuộc hơn một nghìn lớp, kèm mặt nạ phân vùng cho từng thực thể và có phân bố lớp đuôi dài. 164.000 ảnh; khoảng 2,2 triệu mặt nạ; hơn 1.000 lớp Phát hiện vật thể; phân vùng thực thể 2019
VLCS Ảnh thuộc năm lớp vật thể trong bốn miền dữ liệu: VOC2007, LabelMe, Caltech và SUN09. Khoảng 10.700 ảnh; 4 miền; 5 lớp Phân loại ảnh; tổng quát hóa miền 2015
PACS Ảnh thuộc bảy lớp vật thể trong bốn miền hình ảnh: ảnh chụp, tranh vẽ, hoạt hình và phác thảo. 9.991 ảnh; 4 miền; 7 lớp Phân loại ảnh; tổng quát hóa miền 2017
Office-Home Ảnh thuộc 65 lớp vật thể trong bốn miền hình ảnh: tranh vẽ, clipart, ảnh không nền và ảnh chụp. Khoảng 15.500 ảnh; 4 miền; 65 lớp Phân loại ảnh; thích nghi miền; tổng quát hóa miền 2017
DomainNet Ảnh thuộc 345 lớp vật thể trong sáu miền hình ảnh: clipart, đồ họa thông tin, tranh vẽ, hình vẽ từ "Quick, Draw!" của Google, ảnh chụp và phác thảo. Khoảng 0,6 triệu ảnh; 6 miền; 345 lớp Phân loại ảnh; thích nghi miền; tổng quát hóa miền 2019

Khuôn mặt người

Bộ dữ liệu Mô tả Quy mô Tác vụ Năm Nguồn
FERET Ảnh khuôn mặt của nhiều người được chụp ở các thời điểm, tư thế và điều kiện khác nhau để đánh giá các thuật toán nhận dạng khuôn mặt. 14.126 ảnh của 1.199 người Nhận dạng khuôn mặt; xác minh danh tính 1998
Yale Face Database Ảnh khuôn mặt của 15 người dưới nhiều biểu cảm và điều kiện chiếu sáng khác nhau. 165 ảnh; 15 người Nhận dạng khuôn mặt; nhận dạng biểu cảm 1997
Cohn–Kanade Chuỗi ảnh khuôn mặt có gán nhãn các đơn vị hành động và biểu cảm, được thu thập để nghiên cứu phân tích biểu cảm khuôn mặt. Hơn 500 chuỗi ảnh của 100 người Nhận dạng biểu cảm; phát hiện đơn vị hành động 2000
JAFFE Ảnh khuôn mặt của 10 phụ nữ Nhật Bản thể hiện sáu biểu cảm cơ bản và trạng thái trung tính. 213 ảnh Nhận dạng biểu cảm khuôn mặt 1998
BioID Face Database Ảnh khuôn mặt chụp trong điều kiện thực tế, kèm tọa độ vị trí mắt được gán nhãn thủ công. 1.521 ảnh của 23 người Phát hiện khuôn mặt; định vị đặc trưng khuôn mặt 2001
Labeled Faces in the Wild (LFW) Ảnh khuôn mặt của người nổi tiếngnhân vật công chúng được thu thập từ Internet trong các điều kiện không kiểm soát. 13.233 ảnh của 5.749 người Nhận dạng khuôn mặt; xác minh khuôn mặt 2007
SCFace Ảnh khuôn mặt được chụp đồng thời bằng máy ảnh chất lượng cao và nhiều camera giám sát ở các khoảng cách khác nhau. 4.160 ảnh của 130 người Nhận dạng khuôn mặt; nhận dạng khuôn mặt từ camera giám sát 2011
FaceScrub Ảnh khuôn mặt của các nhân vật công chúng được thu thập tự động từ kết quả tìm kiếm ảnh trên Internet. 106.863 ảnh của 530 người Nhận dạng khuôn mặt 2014
Leeds Sports Pose Ảnh người trong các hoạt động thể thao, với vị trí 14 khớp cơ thể được gán nhãn cho chủ thể chính trong ảnh. 2.000 ảnh Ước lượng tư thế người 2010
Leeds Sports Pose Extended Ảnh người trong các hoạt động thể thao được thu thập từ Flickr, với vị trí 14 khớp cơ thể được gán nhãn; đây là phần mở rộng của Leeds Sports Pose. 10.000 ảnh Ước lượng tư thế người 2011

Y khoa

Bộ dữ liệu Mô tả Quy mô Tác vụ Năm Nguồn
Messidor Ảnh màu đáy mắt với nhãn mức độ bệnh võng mạc tiểu đường và nguy cơ phù hoàng điểm. 1.200 ảnh Phân loại ảnh; phân vùng ảnh; phát hiện bệnh võng mạc tiểu đường 2008
Synthetic Fundus Dataset Ảnh đáy mắt tổng hợp có tính quang thực cùng mặt nạ phân vùng mạch máu võng mạc. 2.500 ảnh Phân vùng mạch máu; phân loại ảnh 2020
ChestX-ray14 Ảnh X-quang ngực nhìn từ phía trước của bệnh nhân tại NIH Clinical Center, với 14 nhãn phát hiện bệnh lý được suy ra từ báo cáo X-quang. 112.120 ảnh của 30.805 bệnh nhân Phân loại ảnh đa nhãn; định vị bất thường 2017
HAM10000 Ảnh soi da cho các tổn thương sắc tố da, gồm bảy nhóm chẩn đoán khác nhau. 10.015 ảnh Phân loại tổn thương da; phát hiện u hắc tố 2018
CheXpert Ảnh X-quang ngực với 14 nhãn quan sát lâm sàng, gồm cả nhãn không chắc chắn được suy ra từ báo cáo X-quang. 224.316 ảnh của 65.240 bệnh nhân Phân loại ảnh đa nhãn; phát hiện bất thường 2019
CAMELYON17 Ảnh toàn bộ tiêu bản mô học của các hạch bạch huyết nhuộm H&E từ bệnh nhân ung thư vú tại năm trung tâm y tế, kèm chú thích di căn. 1.000 ảnh toàn bộ tiêu bản Phát hiện di căn; phân loại ảnh; tổng quát hóa miền 2017
VinDr-CXR Ảnh X-quang ngực từ các bệnh viện ở Việt Nam, được bác sĩ X-quang gán nhãn cho các phát hiện và chẩn đoán bất thường. 18.000 ảnh Phân loại ảnh; phát hiện và định vị bất thường 2022
AlphaDent Ảnh chụp răng với độ phân giải cao bằng máy ảnh DSLR, được gán nhãn các bệnh lý và phục hình nha khoa bằng mặt nạ thực thể để phân vùng. 1.320 ảnh; 9 lớp Phân vùng thực thể; phát hiện bệnh lý răng 2025

Động vật và thực vật

Bộ dữ liệu Mô tả Quy mô Tác vụ Năm Nguồn
Oxford 17 Flowers Ảnh của 17 loài hoa phổ biến ở Vương quốc Anh, với mỗi lớp gồm 80 ảnh. 1.360 ảnh; 17 lớp Phân loại loài 2006
Oxford 102 Flowers Ảnh của 102 loài hoa, với sự biến thiên lớn về kích thước, tư thế và điều kiện chiếu sáng. 8.189 ảnh; 102 lớp Phân loại loài 2008
CUB-200-2011 Ảnh của 200 loài chim tại Bắc Mỹ với chú thích lớp, hộp giới hạn, vị trí các bộ phận và các thuộc tính hình thái của loài. 11.788 ảnh; 200 loài Phân loại loài; định vị bộ phận 2011
Stanford Dogs Ảnh của 120 giống chó trên thế giới, được xây dựng từ ảnh và chú thích của ImageNet. 20.580 ảnh; 120 giống Phân loại giống 2011
Oxford-IIIT Pet Ảnh của 37 giống chómèo với chú thích giống, vùng đầu và mặt nạ phân vùng cho mỗi pixel. 7.349 ảnh; 37 giống Phân loại giống; phân vùng ảnh 2012
Folio Ảnh cây của 32 loài thực vật được chụp dưới nhiều điều kiện khác nhau. 637 ảnh; 32 loài Phân loại loài 2015
Snapshot Serengeti Ảnh lấy từ các bẫy ảnh được thu thập liên tục tại Vườn quốc gia Serengeti để khảo sát các loài động vật có vú trong môi trường tự nhiên. Khoảng 1,2 triệu tập ảnh từ 225 bẫy ảnh Phát hiện động vật; phân loại loài; giám sát đa dạng sinh học 2015
Plant Seedlings Dataset Ảnh cây con của 12 loài cây trồngcỏ dại ở nhiều giai đoạn sinh trưởng. Khoảng 5.500 ảnh; 12 loài Phân loại loài 2017
iNaturalist 2017 Ảnh thực địa về thực vật và động vật có phân bố lớp mất cân bằng tự nhiên, được thu thập từ cộng đồng iNaturalist. 859.000 ảnh; hơn 5.000 loài Phân loại loài; nhận dạng loài 2018
Terra Incognita Ảnh động vật được thu thập từ 20 bẫy ảnh cố định tại các địa điểm khác nhau, được thiết kế để đánh giá khả năng nhận dạng động vật ở các môi trường mà mô hình chưa từng học. Hơn 24.000 ảnh trong benchmark thường dùng Phân loại loài; phát hiện động vật; tổng quát hóa miền 2018

Ảnh viễn thám

Bộ dữ liệu Mô tả Quy mô Tác vụ Năm Nguồn
UC Merced Land Use Ảnh hàng không với độ phân giải cao cho các khu vực tại Hoa Kỳ, được chia thành 21 lớp cho các mục đích sử dụng đất như khu dân cư, rừng, đường cao tốcsân bay. 2.100 ảnh; 21 lớp Phân loại sử dụng đất 2010
SAT-4 Ảnh hàng không từ chương trình National Agriculture Imagery Program của Hoa Kỳ, được chia thành bốn lớp phủ bề mặt. 500.000 ảnh; 4 lớp Phân loại lớp phủ bề mặt 2015
SAT-6 Ảnh hàng không từ cùng nguồn với SAT-4, được chia thành sáu lớp phủ bề mặt. 405.000 ảnh; 6 lớp Phân loại lớp phủ bề mặt 2015
AID Ảnh viễn thám thu thập từ nhiều quốc gia và điều kiện chụp khác nhau, bao gồm 30 loại cảnh như sân bay, khu dân cư, rừng và cảng biển. 10.000 ảnh; 30 lớp Phân loại cảnh viễn thám 2017
NWPU-RESISC45 Ảnh viễn thám thuộc 45 loại cảnh, với sự biến thiên về độ phân giải, góc nhìn, ánh sáng và điều kiện nền. 31.500 ảnh; 45 lớp Phân loại cảnh viễn thám 2017
INRIA Aerial Image Labeling Ảnh hàng không độ phân giải 0,3 m từ nhiều thành phố tại Hoa Kỳ và châu Âu, kèm mặt nạ nhị phân thể hiện có công trình nhân tạo ở đó không. 360 ảnh 5.000 × 5.000 pixel Phân vùng công trình 2017
SpaceNet 2: Building Detection v2 Ảnh vệ tinh WorldView-3 độ phân giải cao tại các thành phố Las Vegas, Paris, Thượng HảiKhartoum, kèm các đa giác vị trí các công trình nhân tạo. 24.586 cảnh ảnh; 4 khu vực Phát hiện công trình; phân vùng công trình; trích xuất dấu chân công trình 2017
DOTA Ảnh hàng không độ phân giải cao từ nhiều cảm biến và nền tảng, với các vật thể xuất hiện ở nhiều kích thước và hướng khác nhau. 2.806 ảnh; 15 lớp trong phiên bản đầu Phát hiện vật thể 2018
MASATI Ảnh quang học trên không của các vùng biểnven biển trong nhiều điều kiện thời tiết và chiếu sáng, bao gồm cả ảnh có và không có tàu. 7.389 ảnh Phân loại cảnh hàng hải; phát hiện tàu 2018
AICrowd Mapping Challenge Ảnh vệ tinh RGB WorldView-3 độ phân giải 0,3 m được chia thành các mảnh 300 × 300 pixel, kèm chú thích đa giác dấu chân công trình theo định dạng MS COCO. Bộ dữ liệu được tạo từ dữ liệu SpaceNet 2.

Một nghiên cứu tại CVPR 2026 phát hiện mức độ trùng lặp và rò rỉ dữ liệu nghiêm trọng: sau khi loại các bản sao chính xác và biến đổi, chỉ còn 29.338 ảnh huấn luyện duy nhất trong số 280.741 ảnh ban đầu, đồng thời 93,45% ảnh kiểm định xuất hiện trong tập huấn luyện.

280.741 ảnh huấn luyện; 60.317 ảnh kiểm định; 60.697 ảnh kiểm tra Phân vùng công trình; trích xuất dấu chân công trình 2018
DeepGlobe Ảnh vệ tinh độ phân giải cao từ nhiều khu vực trên thế giới, được gán nhãn cho ba bài toán gồm trích xuất đường giao thông, phát hiện tòa nhà và phân vùng các lớp phủ đất như khu đô thị, đất nông nghiệp, rừng, mặt nước và đất cằn. 3 bộ dữ liệu; riêng bộ trích xuất đường gồm 8.570 ảnh phủ khoảng 2.220 km² Trích xuất đường; phát hiện tòa nhà; phân vùng lớp phủ đất 2018
Functional Map of the World Ảnh vệ tinh đa phổ của các địa điểm tại hơn 200 quốc gia và vùng lãnh thổ, kèm thông tin về vị trí, thời gian chụp và điều kiện quan sát. Các địa điểm được chia thành 63 lớp theo chức năng, như sân bay, bệnh viện, nhà máy điện, cảng, nhà tù và cơ sở quân sự. 1.047.691 ảnh; 63 lớp; 207 quốc gia hoặc vùng lãnh thổ Phân loại chức năng địa điểm; nhận dạng địa điểm từ ảnh viễn thám 2018
xView Ảnh vệ tinh WorldView-3 với độ phân giải khoảng 0,3 m, bao phủ nhiều khu vực trên thế giới và được gán hộp giới hạn cho 60 loại vật thể như máy bay, tàu thủy, ô tô, xe tải, tòa nhà và các cơ sở hạ tầng khác. Hơn 1 triệu vật thể; 60 lớp; hơn 1.400 km² ảnh Phát hiện vật thể 2018
EuroSAT Ảnh vệ tinh Sentinel-2 được chia thành 10 lớp sử dụng đất và lớp phủ bề mặt; phiên bản đa phổ sử dụng 13 dải phổ. 27.000 ảnh; 10 lớp Phân loại sử dụng đất; phân loại lớp phủ bề mặt 2019
iSAID Bộ dữ liệu được xây dựng từ ảnh DOTA và bổ sung mặt nạ cho từng vật thể trong ảnh. 2.806 ảnh; 655.451 đối tượng; 15 lớp Phân vùng thực thể 2019
BigEarthNet Ảnh vệ tinh đa phổ từ Sentinel-2 được thu thập tại mười quốc gia châu Âu, bao phủ nhiều điều kiện theo mùa và địa lý. Mỗi ảnh được gán nhiều nhãn lớp phủ đất dựa trên hệ thống CORINE Land Cover, như đất canh tác, rừng, đồng cỏ, vùng đô thị và mặt nước. 590.326 ảnh; 19 lớp trong hệ nhãn được sửa đổi Phân loại đa nhãn lớp phủ đất 2019
xBD Các cặp ảnh vệ tinh độ phân giải cao chụp cùng khu vực trước và sau thiên tai, kèm vị trí tòa nhà và mức độ thiệt hại. Dữ liệu bao gồm nhiều loại sự kiện như động đất, lũ lụt, cháy rừng, bão nhiệt đớisóng thần tại nhiều quốc gia. 850.736 chú thích tòa nhà; 45.362 km² ảnh Phát hiện thay đổi; đánh giá thiệt hại tòa nhà 2019
LoveDA Ảnh viễn thám độ phân giải cao từ Nam Kinh, Thường ChâuVũ Hán tại Trung Quốc, bao gồm cả khu vực đô thị và nông thôn. Mỗi pixel được gán một trong bảy lớp như tòa nhà, đường, mặt nước, rừng, đất nông nghiệp và đất trống. 5.987 ảnh; 7 lớp Phân vùng lớp phủ đất; thích nghi miền 2021
Million-AID Ảnh viễn thám độ phân giải cao thu thập trên phạm vi toàn cầu, bao gồm các cảnh tự nhiên và nhân tạo như đất nông nghiệp, rừng, khu dân cư, sân bay, cảng, cầu và các cơ sở công nghiệp. Các ảnh được tổ chức theo một hệ phân cấp gồm 51 loại cảnh. Hơn 1 triệu ảnh; 51 lớp Phân loại cảnh viễn thám 2021
Harmonized Landsat Sentinel-2 Ảnh vệ tinh phản xạ bề mặt từ Landsat 8, Landsat 9 và Sentinel-2 được hiệu chỉnh và chuẩn hóa để có thể sử dụng chung. Dữ liệu phủ gần toàn bộ đất liền trên thế giới ở độ phân giải 30 m và cung cấp các quan sát lặp lại theo thời gian cho những ứng dụng như theo dõi thảm thực vật, nông nghiệp và thay đổi lớp phủ đất. Phủ gần toàn bộ đất liền toàn cầu trừ Nam Cực; độ phân giải 30 m; dữ liệu từ năm 2013 Phân loại lớp phủ đất; phát hiện thay đổi; giám sát nông nghiệp và thảm thực vật; phân tích chuỗi ảnh viễn thám 2025


Giao thông

Bộ dữ liệu Mô tả Quy mô Tác vụ Năm Nguồn
German Traffic Sign Recognition Benchmark (GTSRB) Ảnh biển báo giao thông tại Đức thuộc 43 lớp, được thu thập từ các chuỗi video thực tế và cắt thành từng ảnh biển báo riêng lẻ. 51.840 ảnh; 43 lớp Phân loại biển báo giao thông 2011
German Traffic Sign Detection Benchmark (GTSDB) Ảnh cảnh đường phố tại Đức với các biển báo giao thông được đánh dấu bằng hộp giới hạn. 900 ảnh Phát hiện biển báo giao thông 2013
Daimler Monocular Pedestrian Detection Ảnh chụp từ camera đơn trên xe chạy trong môi trường đô thị, với vị trí người đi bộ được đánh dấu bằng hộp giới hạn. Hàng chục nghìn mẫu huấn luyện; hơn 21.000 ảnh kiểm tra Phát hiện người đi bộ 2009
CamVid Các frame từ video quay khi lái xe ở Cambridge, với từng pixel được gán một trong 32 lớp ngữ nghĩa như đường xá, xe cộ, người đi bộ và công trình. Hơn 700 frame được gán nhãn Phân vùng ngữ nghĩa cảnh đường phố 2009
Cityscapes Ảnh đường phố được trích từ các chuỗi video stereo được ghi lại tại 50 thành phố, với nhãn ngữ nghĩa và nhãn thực thể cho từng pixel. 5.000 ảnh gán nhãn chi tiết; 20.000 ảnh gán nhãn thô Phân vùng ngữ nghĩa; phân vùng thực thể 2016
Bosch Small Traffic Lights Dataset Ảnh đường phố thu từ camera trên xe, với hộp giới hạn và trạng thái hoạt động của từng đèn tín hiệu giao thông. 13.427 ảnh; khoảng 24.000 đèn tín hiệu được gán nhãn Phát hiện đèn tín hiệu; phân loại trạng thái đèn 2017
RailSem19 Các frame nhìn từ buồng lái tàu hỏa và tàu điện, được gán nhãn cho mỗi pixel cho cảnh đường sắt và các đối tượng liên quan. 8.500 frame được chú thích Phân vùng ngữ nghĩa cảnh đường sắt 2019
RAWPED Ảnh đường sắt ghi từ phương tiện chạy trên đường ray, với người đi bộ được đánh dấu bằng hộp giới hạn. 26.000 ảnh Phát hiện người đi bộ trên đường sắt 2020
FRSign Ảnh chụp từ tàu đang vận hành tại Pháp, với hộp giới hạn và trạng thái của các đèn tín hiệu đường sắt. Hơn 100.000 ảnh trong phần dữ liệu được công bố Phát hiện tín hiệu đường sắt; phân loại trạng thái tín hiệu 2020
GERALD Ảnh cảnh đường sắt tại Đức với các tín hiệu đường sắt chính tuyến và các biển báo liên quan được gán hộp giới hạn. 5.000 ảnh; 33.554 đối tượng được gán nhãn Phát hiện tín hiệu đường sắt 2023
RailFOD23 Ảnh các vật thể lạ xuất hiện trên hệ thống truyền tải điện đường sắt, gồm túi nhựa, các vật thể trong không trung, tổ chimbóng bay. 14.615 ảnh; 40.541 đối tượng được gán nhãn Phát hiện vật thể lạ 2024

Robot và thao tác vật thể

Bộ dữ liệu Mô tả Quy mô Tác vụ Năm Nguồn
Cornell Grasping Dataset Ảnh RGB-D (D cho độ sâu) của các vật thể, trong đó mỗi vật thể được chú thích bằng nhiều cách gắp khả thi và không khả thi. Một tư thế gắp được biểu diễn bằng hình chữ nhật có hướng trên ảnh, tương ứng với vị trí và hướng của kẹp robot. 885 ảnh RGB-D; 240 vật thể; 8.019 tư thế gắp được chú thích Phát hiện tư thế gắp 2011
Jacquard Bộ dữ liệu tổng hợp được tạo từ các mô hình vật thể 3D, cung cấp ảnh RGB, ảnh độ sâu và mặt nạ phân vùng của từng cảnh. Các tư thế gắp khả thi được xác định bằng mô phỏng và biểu diễn trên mặt phẳng ảnh. 54.485 cảnh; 11.619 vật thể; 4.967.454 chú thích tư thế gắp Phát hiện tư thế gắp 2018

Khác

Bộ dữ liệu Mô tả Quy mô Tác vụ Năm Nguồn
FAMOS Ảnh hiển vi của 5.000 vi cấu trúc vật lý riêng biệt; mỗi mẫu được chụp nhiều lần bằng hai camera khác nhau để nghiên cứu khả năng xác thực dựa trên các đặc trưng vật lý khó sao chép. 30.000 ảnh; 5.000 mẫu Xác thực; nhận dạng mẫu 2012
PharmaPack Ảnh bao bì dược phẩm thuộc 1.000 sản phẩm khác nhau, được chụp trong nhiều điều kiện và góc nhìn để phân biệt các bao bì có hình thức tương tự nhau. 54.000 ảnh; 1.000 lớp Phân loại sản phẩm; nhận dạng bao bì dược phẩm 2017
MCQ Dataset Ảnh phiếu trả lời của sáu bài kiểm tra trắc nghiệm thực tế, kèm vị trí và nhãn của các ô trả lời để đánh giá các hệ thống chấm bài tự động bằng thị giác máy tính. 735 phiếu trả lời; 33.540 ô trả lời Nhận dạng đáp án; chấm bài trắc nghiệm tự động 2017

Dữ liệu video

Hành động và hoạt động của con người

Bộ dữ liệu Mô tả Quy mô Tác vụ Năm Nguồn
HMDB51 Các đoạn video ngắn về chuyển động và hành động của con người, được thu thập từ phim, video trên Internet và nhiều nguồn khác. 6.766 đoạn video; 51 lớp hành động Nhận dạng hành động 2011
UCF101 Các đoạn video thực tế được thu thập từ YouTube, bao gồm nhiều loại hành động của con người như thể thao, tương tác với đồ vật và tương tác giữa người với người. 13.320 đoạn video; 101 lớp hành động; khoảng 27 giờ video Nhận dạng hành động 2012
MPII Cooking Activities Video quay các hoạt động nấu ăn trong nhà bếp. Các thao tác được chú thích theo từng khoảng thời gian, cho phép xác định những hành động cụ thể. 44 video; 65 lớp hoạt động; 881.755 frame Nhận dạng hành động; xác định hành động theo thời gian 2012
ActivityNet Video chưa được cắt thành các đoạn hành động riêng, bao gồm nhiều hoạt động phức tạp trong đời sống thường ngày. Các khoảng thời gian chứa hoạt động được chú thích trong từng video. Khoảng 20.000 video; 200 lớp hoạt động; hơn 600 giờ video Phân loại hoạt động; xác định hoạt động theo thời gian 2015
Charades Video do người tham gia tự quay tại nhà khi thực hiện các hoạt động thường ngày. Mỗi video có thể chứa nhiều hành động đồng thời hoặc nối tiếp nhau, kèm mô tả bằng ngôn ngữ tự nhiên và khoảng thời gian của từng hành động. 9.848 video; 157 lớp hành động; 66.500 khoảng hành động được chú thích Nhận dạng nhiều hành động; xác định hành động theo thời gian 2016
Kinetics-400 Các đoạn video khoảng 10 giây từ YouTube, tập trung vào hành động của con người và bao gồm cả tương tác với đồ vật lẫn tương tác giữa người với người. Khoảng 300.000 đoạn video; 400 lớp hành động Nhận dạng hành động 2017
Something-Something Video ngắn quay người thực hiện các tương tác đơn giản với đồ vật. Nhãn được xây dựng để phân biệt các hành động có hình ảnh tĩnh tương tự nhau nhưng khác về chuyển động hoặc quan hệ theo thời gian, chẳng hạn đặt vật lên trên hoặc lấy vật ra khỏi vật khác. Hơn 100.000 video; 174 lớp trong phiên bản đầu Nhận dạng hành động; hiểu tương tác người–vật 2017
AVA Các đoạn phim dài được chú thích cho nhiều hành động cơ bản của từng người. Tại các thời điểm được lấy mẫu, mỗi người được đánh dấu bằng hộp giới hạn và có thể mang đồng thời nhiều nhãn hành động. 430 đoạn video dài 15 phút; 80 lớp hành động; khoảng 1,58 triệu nhãn hành động Phát hiện hành động trong không gian và thời gian; nhận dạng nhiều hành động 2018
HAA500 Các đoạn video được chọn và chú thích thủ công để biểu diễn 500 hành động tương đối cụ thể của con người, bao gồm thể thao, sinh hoạt thường ngày và tương tác với đồ vật. 10.000 video; 500 lớp hành động; hơn 591.000 frame được gán nhãn Nhận dạng hành động 2021

Khuôn mặt và biểu cảm

Bộ dữ liệu Mô tả Quy mô Tác vụ Năm Nguồn
CASIA NIR Các đoạn video khuôn mặt được ghi lại trong phổ ánh sáng khả kiến và cận hồng ngoại, với sáu biểu cảm gồm tức giận, ghê tởm, sợ hãi, vui vẻ, buồn bãngạc nhiên. 480 chuỗi video Nhận dạng biểu cảm khuôn mặt 2011
Aff-Wild Video khuôn mặt thu thập trong các điều kiện tự nhiên, với sự thay đổi về tư thế đầu, ánh sáng, sự che khuất và biểu cảm. Mỗi frame được chú thích bằng hai giá trị liên tục biểu diễn mức độ tích cực–tiêu cực của cảm xúc và cường độ cảm xúc. 298 video; 200 người; hơn 30 giờ video Ước lượng cảm xúc theo hai chiều valence–arousal 2017
Aff-Wild2 Bản mở rộng của Aff-Wild, gồm video khuôn mặt trong điều kiện tự nhiên và nhiều loại chú thích cảm xúc. Dữ liệu được chú thích theo biểu cảm rời rạc, hai chiều tích cực tiêu cực và cường độ, và các đơn vị hành động trên khuôn mặt. Hơn 500 video; khoảng 2,8 triệu frame được chú thích Nhận dạng biểu cảm; ước lượng valence–arousal; phát hiện đơn vị hành động khuôn mặt 2019
FERV39k Các đoạn video khuôn mặt thu thập từ nhiều cảnh thực tế như phim ảnh, chương trình truyền hình và video trên Internet. Mỗi đoạn được gán một trong bảy biểu cảm cơ bản. 38.935 đoạn video; 7 lớp biểu cảm Nhận dạng biểu cảm khuôn mặt trong video 2022

Giao thông

Bộ dữ liệu Mô tả Quy mô Tác vụ Năm Nguồn
UA-DETRAC Các video giao thông quay bằng camera cố định tại nhiều địa điểm, trong các điều kiện thời tiết và mật độ giao thông khác nhau. Phương tiện trong mỗi frame được đánh dấu bằng hộp giới hạn và mã định danh để có thể theo dõi chúng qua thời gian. 100 video; hơn 140.000 frame Phát hiện phương tiện; theo dõi nhiều phương tiện 2020
CityFlow Video với độ phân giải cao được đồng bộ từ nhiều camera giao thông tại các nút giao thông trong cùng một thành phố. Các phương tiện được theo dõi giữa nhiều camera, cho phép xác định cùng một phương tiện khi nó xuất hiện tại các vị trí khác nhau. Hơn 3 giờ video; 40 camera tại 10 nút giao; hơn 200.000 hộp giới hạn Theo dõi phương tiện qua nhiều camera; tái nhận dạng phương tiện 2019
BDD100K Video quay từ camera phía trước của xe khi lưu thông trong nhiều thành phố, thời tiết và thời điểm trong ngày khác nhau. Bộ dữ liệu hỗ trợ nhiều loại chú thích, gồm phương tiện và người đi bộ, làn đường, vùng có thể lái xe và thông tin theo dõi đối tượng. 100.000 video, mỗi video dài khoảng 40 giây; hơn 100 triệu frame Phát hiện và theo dõi đối tượng; phân vùng cảnh đường phố; phát hiện làn đường 2020

Video góc nhìn thứ nhất

Bộ dữ liệu Mô tả Quy mô Tác vụ Năm Nguồn
EGTEA Gaze+ Video góc nhìn thứ nhất (egocentric) ghi lại các hoạt động nấu ăn của người tham gia. Ngoài video, bộ dữ liệu còn cung cấp vị trí ánh nhìn, nhãn hành động và mặt nạ bàn tay cho một số frame. 86 video; khoảng 28 giờ; 10.321 đoạn hành động; 106 lớp hành động Nhận dạng và dự đoán hành động; dự đoán hướng nhìn 2018
EPIC-KITCHENS-100 Video góc nhìn thứ nhất ghi bằng camera đeo trên đầu khi người tham gia thực hiện các hoạt động thường ngày trong nhà bếp. Các đoạn hành động được chú thích bằng động từ và danh từ biểu thị thao tác và vật thể liên quan. 700 video; 100 giờ; khoảng 20 triệu frame; 89.977 đoạn hành động Nhận dạng hành động; phát hiện hành động theo thời gian; dự đoán hành động sắp xảy ra 2020
Charades-Ego Các cặp video quay cùng loại hoạt động trong nhà từ góc nhìn của người hành động và góc nhìn của người quan sát. Thiết kế này cho phép nghiên cứu mối liên hệ giữa cách một hành động xuất hiện đối với người thực hiện và đối với người quan sát bên ngoài. 4.000 cặp video; 112 người; 157 lớp hành động Nhận dạng hành động; chuyển giao giữa góc nhìn thứ nhất và góc nhìn người quan sát 2018
Ego4D Video góc nhìn thứ nhất về các hoạt động thường ngày trong gia đình, nơi làm việc, hoạt động ngoài trời và giải trí, được thu thập tại nhiều quốc gia. Bộ dữ liệu cung cấp nhiều benchmark cho việc hiểu hoạt động, tương tác với vật thể và diễn biến của các sự kiện dài. 3.670 giờ video; 931 người đeo camera; 74 địa điểm tại 9 quốc gia Nhận dạng và dự đoán hoạt động; tìm kiếm sự kiện trong video; hiểu tương tác người–vật 2022

Khác

Bộ dữ liệu Mô tả Quy mô Tác vụ Năm Nguồn
DAVIS Các chuỗi video Full HD về nhiều vật thể và cảnh khác nhau, bao gồm các trường hợp bị che khuất, nhòe do chuyển động và thay đổi hình dạng. Mỗi frame có mặt nạ phân vùng thủ công cho vật thể cần theo dõi. 50 video trong phiên bản đầu Phân vùng vật thể trong video 2016
YouTube-8M Video YouTube thuộc nhiều chủ đề khác nhau, được gán đồng thời nhiều nhãn mô tả nội dung như vật thể, hoạt động và địa điểm. Bộ dữ liệu cũng cung cấp các đặc trưng hình ảnh và âm thanh được trích sẵn từ video. Khoảng 8 triệu video; khoảng 500.000 giờ video; hơn 4.800 nhãn trong phiên bản đầu Phân loại video đa nhãn 2016
LIRIS-ACCEDE Các đoạn phim được chú thích theo mức độ tích cực–tiêu cực của cảm xúc và cường độ cảm xúc mà nội dung video gây ra cho người xem. Khác với các bộ nhận dạng biểu cảm khuôn mặt, nhãn ở đây mô tả cảm xúc do toàn bộ nội dung video gợi ra. 9.800 đoạn video trong bộ rời rạc; khoảng 27 giờ video Phân tích cảm xúc do nội dung video gợi ra 2015
YouTube-VOS Video YouTube chứa nhiều loại vật thể và hoạt động, trong đó các vật thể được chú thích bằng mặt nạ phân vùng qua nhiều frame liên tiếp. Tập kiểm tra còn chứa các loại vật thể không xuất hiện trong tập huấn luyện để đánh giá khả năng khái quát sang lớp mới. 3.252 video trong phiên bản công bố ban đầu; 78 loại vật thể; 133.886 chú thích vật thể Phân vùng vật thể trong video 2018

Dữ liệu 3D và đám mây điểm (point cloud)

Vật thể 3D

Bộ dữ liệu Mô tả Quy mô Tác vụ Năm Nguồn
ModelNet Các mô hình CAD 3D của những vật thể thông dụng trong nhà, được tổ chức theo lớp vật thể. Hai tập con ModelNet10 và ModelNet40 thường được dùng làm benchmark. 12.311 mô hình trong ModelNet40; 40 lớp Phân loại vật thể 3D; truy hồi mô hình 3D 2015
ShapeNet Các mô hình CAD 3D thuộc nhiều loại vật thể, được tổ chức theo hệ thống phân loại của WordNet. Nhiều mô hình còn có các chú thích về bộ phận, kích thước, hướng chuẩn và các thuộc tính hình học khác. Hơn 3 triệu mô hình được lập chỉ mục; khoảng 220.000 mô hình được phân loại vào 3.135 lớp tại thời điểm công bố Phân loại vật thể 3D; phân vùng bộ phận; truy hồi và tái tạo hình dạng 3D 2015
ShapeNetPart Tập con của ShapeNet trong đó các mô hình vật thể được chú thích theo từng bộ phận cấu thành, chẳng hạn cánh máy bay, chân ghế hoặc tay cầm. 16.881 mô hình; 16 lớp vật thể; 50 loại bộ phận Phân vùng bộ phận của vật thể 3D 2016
ABC Các mô hình CAD của các vật thể cơ khí được thu thập từ các tệp thiết kế tham số, kèm các bề mặt và đường cong hình học chính xác thay vì chỉ lưới tam giác xấp xỉ. Hơn 1 triệu mô hình CAD Tái tạo bề mặt; phân vùng hình học; học biểu diễn hình dạng 3D 2019
OmniObject3D Các vật thể đời thường thực được quét ở độ phân giải cao. Mỗi vật thể có mô hình lưới có kết cấu, đám mây điểm và nhiều góc quan sát, thay vì chỉ sử dụng các mô hình CAD tổng hợp. 6.000 vật thể; 190 lớp Phân loại vật thể 3D; tái tạo vật thể; sinh mô hình 3D 2023

Khuôn mặt 3D

Bộ dữ liệu Mô tả Quy mô Tác vụ Năm Nguồn
Face Recognition Grand Challenge (FRGC) v2.0 Ảnh khuôn mặt độ phân giải cao và các bản quét khuôn mặt 3D được thu thập trong nhiều phiên chụp. Phần dữ liệu 3D gồm bề mặt khuôn mặt và ảnh màu tương ứng. 4.950 bản quét 3D; 466 người Nhận dạng và xác minh khuôn mặt 3D 2005
BU-3DFE Các mô hình khuôn mặt 3D có kết cấu của 100 người, gồm biểu cảm trung tính và sáu biểu cảm cơ bản ở nhiều mức cường độ khác nhau. 2.500 mô hình khuôn mặt; 100 người; 6 biểu cảm cơ bản Nhận dạng biểu cảm khuôn mặt 3D 2006
Bosphorus Các bản quét khuôn mặt 3D có kết cấu, được thu thập với nhiều biểu cảm, góc quay đầu và dạng che khuất như kính mắt, tóc hoặc bàn tay. 4.666 bản quét; 105 người Nhận dạng khuôn mặt 3D; nhận dạng biểu cảm; đánh giá khả năng chống che khuất và thay đổi tư thế 2008
FaceScape Các mô hình khuôn mặt 3D có kết cấu và độ chi tiết cao, trong đó mỗi người được quét với nhiều biểu cảm. Các mô hình được xử lý để có cấu trúc lưới thống nhất, phục vụ việc tái tạo và mô hình hóa khuôn mặt 3D. 18.760 mô hình khuôn mặt; 938 người; 20 biểu cảm Tái tạo khuôn mặt 3D; mô hình hóa hình dạng và biểu cảm khuôn mặt 2020

Giao thông

Bộ dữ liệu Mô tả Quy mô Tác vụ Năm Nguồn
SemanticKITTI Các chuỗi đám mây điểm LiDAR 360° từ KITTI Vision Odometry Benchmark, trong đó mỗi điểm được gán nhãn ngữ nghĩa cho các thành phần của cảnh giao thông như đường, xe, người và thảm thực vật. 22 chuỗi; hơn 43.000 lần quét LiDAR Phân vùng ngữ nghĩa đám mây điểm; phân vùng theo chuỗi thời gian 2019
Rail3D Đám mây điểm LiDAR của các tuyến đường sắt tại Hungary, Pháp và Bỉ, được gán nhãn cho các vật thể như đường ray, cột điện, dây điện, hàng rào và công trình. Khoảng 288 triệu điểm; khoảng 5,8 km đường sắt; 9 lớp Phân vùng ngữ nghĩa đám mây điểm đường sắt 2024
WHU-Railway3D Đám mây điểm LiDAR đường sắt tại Trung Quốc, bao gồm môi trường đô thị, nông thôncao nguyên, với nhãn cho từng điểm cùng các thuộc tính như cường độ phản xạ và góc quét. Khoảng 4,6 tỷ điểm; khoảng 30 km; 11 lớp Phân vùng ngữ nghĩa đám mây điểm đường sắt 2024

Nhận dạng tư thế 6D và tư thế gắp của vật cho robot

LINEMOD Ảnh RGB-D của các vật thể trong cảnh có nhiều vật cản, kèm mô hình 3D và tư thế thực của từng vật thể. Bộ dữ liệu được dùng rộng rãi để đánh giá khả năng xác định vị trí và hướng của vật thể trong không gian. 13 vật thể; 13 chuỗi Nhận dạng tư thế 6D của vật thể 2012
T-LESS Ảnh RGB-D của các vật thể công nghiệp hầu như không có hoa văn bề mặt, nhiều vật thể có hình dạng tương tự hoặc đối xứng. Bộ dữ liệu còn cung cấp mô hình CAD và mô hình 3D tái tạo cho từng vật thể. 30 vật thể; khoảng 39.000 ảnh huấn luyện và 10.000 ảnh kiểm tra cho mỗi cảm biến Phát hiện vật thể; nhận dạng tư thế 6D của vật thể 2017
YCB-Video Các chuỗi video RGB-D chứa những vật thể gia dụng thuộc bộ YCB trong các cảnh có nhiều vật thể và che khuất. Mỗi frame được chú thích tư thế 6D của các vật thể xuất hiện trong ảnh. 92 video; 133.827 frame; 21 vật thể Nhận dạng và theo dõi tư thế 6D của vật thể 2018
HOPE Ảnh RGB-D của các vật thể mô phỏng sản phẩm tạp hóa trong môi trường gia đình và văn phòng, kèm mô hình 3D có kết cấu và tư thế 6D. Các cảnh được thiết kế với nhiều mức che khuất, ánh sáng và số lượng vật thể khác nhau. 28 vật thể; 50 cảnh trong 10 môi trường Nhận dạng tư thế 6D của vật thể 2022
GraspNet-1Billion Các cảnh RGB-D chứa nhiều vật thể gia dụng, kèm mô hình lưới 3D và hơn một tỷ tư thế gắp khả thi trong không gian 3D. Bộ dữ liệu được thiết kế để đánh giá trực tiếp việc chọn vị trí gắp và hướng tiếp cận vật thể của bàn tay robot trong khung cảnh lộn xộn. 97.280 ảnh RGB-D; 88 vật thể; hơn 1 tỷ tư thế gắp Phát hiện tư thế gắp 6D 2020

Cảnh vật

Bộ dữ liệu Mô tả Quy mô Tác vụ Năm Nguồn
S3DIS Đám mây điểm màu của các không gian trong nhà tại sáu khu vực thuộc ba tòa nhà, gồm văn phòng, hành lang, phòng hội nghị và nhiều loại phòng khác. Mỗi điểm trong không gian được gán một nhãn ngữ nghĩa như tường, sàn, bàn, ghế hoặc cửa. 6 khu vực; 272 phòng Phân vùng ngữ nghĩa đám mây điểm trong nhà 2016
ScanNet Các chuỗi RGB-D quay trong nhiều không gian trong nhà, được tái dựng thành mô hình bề mặt 3D. Dữ liệu kèm tư thế và vị trí của camera, thông tin hình học 3D và nhãn ngữ nghĩa cho các vật thể trong cảnh. 1.513 cảnh; khoảng 2,5 triệu frame RGB-D Tái dựng cảnh 3D; phân vùng ngữ nghĩa và phân vùng thực thể 2017
Matterport3D Các không gian trong nhà quy mô toàn tòa nhà được ghi bằng camera RGB-D toàn cảnh. Bộ dữ liệu cung cấp ảnh RGB-D, mô hình bề mặt 3D, tư thế camera và nhãn ngữ nghĩa cho cả biểu diễn 2D lẫn 3D. 90 tòa nhà; 10.800 góc nhìn toàn cảnh; 194.400 ảnh RGB-D Tái dựng và hiểu cảnh 3D; phân vùng ngữ nghĩa 2017
Semantic3D Các đám mây điểm dày đặc được thu bằng máy quét laser mặt đất tại nhiều cảnh ngoài trời như đường phố, quảng trường, làng, đường sắt, sân thể thao và khu vực quanh các công trình. Mỗi điểm trong khung cảnh cũng được gán một trong tám lớp ngữ nghĩa. Hơn 4 tỷ điểm; 8 lớp Phân vùng ngữ nghĩa đám mây điểm ngoài trời 2017

Dữ liệu văn bản

Phân tích cảm xúc từ các bài đánh giá

Bộ dữ liệu Mô tả Quy mô Tác vụ Năm Nguồn
Large Movie Review Dataset (IMDb) Các bài đánh giá phim trên IMDb, được gán nhãn tích cực hoặc tiêu cực dựa trên điểm đánh giá. Dữ liệu còn gồm các bài đánh giá chưa gán nhãn. 50.000 bài đánh giá có nhãn; 50.000 bài chưa gán nhãn Phân tích cảm xúc 2011
Stanford Sentiment Treebank Các câu trích từ bài đánh giá phim, trong đó cả câu hoàn chỉnh và các cụm từ cấu thành câu đều được gán nhãn cảm xúc. Nhãn cho phép phân biệt nhiều mức cảm xúc của người dùng từ rất tiêu cực đến rất tích cực. 11.855 câu; 215.154 cụm từ được gán nhãn Phân tích cảm xúc; phân tích cảm xúc theo thành phần câu 2013
Sentiment Labeled Sentences Các câu ngắn từ bài đánh giá trên IMDb, AmazonYelp, được gán nhãn tích cực hoặc tiêu cực bằng tay. 3.000 câu; 1.000 câu từ mỗi nguồn Phân tích cảm xúc 2015
Yelp Review Polarity Các bài đánh giá doanh nghiệp trên Yelp, trong đó đánh giá 1–2 sao được gán nhãn tiêu cực và 4–5 sao được gán nhãn tích cực. 560.000 mẫu huấn luyện; 38.000 mẫu kiểm tra; 2 lớp Phân tích cảm xúc 2015
Yelp Review Full Các bài đánh giá doanh nghiệp trên Yelp, được gán một trong năm nhãn tương ứng với mức đánh giá từ 1 đến 5 sao. 650.000 mẫu huấn luyện; 50.000 mẫu kiểm tra; 5 lớp Phân loại mức đánh giá; phân tích cảm xúc 2015
Amazon Review Polarity Các bài đánh giá sản phẩm trên Amazon, trong đó đánh giá 1–2 sao được gán nhãn tiêu cực và 4–5 sao được gán nhãn tích cực. 3,6 triệu mẫu huấn luyện; 400.000 mẫu kiểm tra; 2 lớp Phân tích cảm xúc 2015
Amazon Review Full Các bài đánh giá sản phẩm trên Amazon, được gán một trong năm nhãn tương ứng với mức đánh giá từ 1 đến 5 sao. 3 triệu mẫu huấn luyện; 650.000 mẫu kiểm tra; 5 lớp Phân loại mức đánh giá; phân tích cảm xúc 2015

Tin tức

Bộ dữ liệu Mô tả Quy mô Tác vụ Năm Nguồn
Reuters-21578 Các bản tin tiếng Anh của Reuters được gán nhãn một hoặc nhiều chủ đề như kinh tế, hàng hóadoanh nghiệp. Bộ dữ liệu có nhiều cách chia tập; trong đó chia theo mốc thời gian xuất bản bài báo ModApte thường được sử dụng trong nghiên cứu phân loại văn bản. 21.578 văn bản Phân loại chủ đề; phân loại đa nhãn 1997
Reuters Corpus Volume I (RCV1) Kho bản tin Reuters bằng tiếng Anh trong khoảng một năm, được các biên tập viên Reuters gán thủ công nhiều loại nhãn về chủ đề, ngành kinh tế và khu vực địa lý. 806.791 bản tin Phân loại chủ đề; phân loại đa nhãn 2004
AG News Tiêu đề và phần mô tả ngắn của các bài báo được thu thập từ hơn 2.000 nguồn tin. Phiên bản benchmark sử dụng bốn chủ đề lớn: tin tức thế giới, thể thao, kinh doanh và khoa họccông nghệ. 120.000 mẫu huấn luyện; 7.600 mẫu kiểm tra; 4 lớp Phân loại chủ đề 2015
Sogou News Các bài báo tiếng Trung từ các kho tin tức SogouCA và SogouCS. Phiên bản benchmark sử dụng tiêu đề và nội dung bài báo thuộc năm chủ đề. 450.000 mẫu huấn luyện; 60.000 mẫu kiểm tra; 5 lớp Phân loại chủ đề 2015
CNN/Daily Mail Các bài báo từ CNNDaily Mail cùng phần điểm tin chính do tòa soạn cung cấp. Các điểm tin được sử dụng làm bản tóm tắt tham chiếu cho bài báo. Khoảng 312.000 cặp bài báo–tóm tắt Tóm tắt văn bản 2015
XSum Các bài báo trực tuyến của BBC đi kèm một câu tóm tắt ngắn do người viết bài cung cấp. Bộ dữ liệu được thiết kế để tóm tắt toàn bộ nội dung bài báo thành một câu súc tích thay vì chỉ trích lại các câu có sẵn trong bài. 226.711 bài báo Tóm tắt văn bản 2018
Multi-News Các cụm bài báo từ nhiều nguồn cùng đề cập đến một sự kiện hoặc chủ đề, đi kèm một bản tóm tắt chung do con người viết. 56.216 cặp cụm tài liệu–tóm tắt Tóm tắt nhiều văn bản 2019

Thư điện tử và tin nhắn

Bộ dữ liệu Mô tả Quy mô Tác vụ Năm Nguồn
Enron Corpus Kho thư điện tử của các nhân viên từ công ty Enron được công khai trong quá trình điều tra pháp lý đối với công ty. Dữ liệu gồm nội dung thư, người gửi, người nhận và cấu trúc thư mục thư điện tử. Bộ dữ liệu này đã được sử dụng cho nhiều bài toán như phân loại, truy hồi thông tin và phân tích giao tiếp. 619.446 thư điện tử trong kho dữ liệu gốc; 158 người dùng Phân loại và truy hồi thư điện tử; phân tích giao tiếp 2004
Ling-Spam Thư hợp lệ từ một danh sách thư điện tử về ngôn ngữ học được kết hợp với thư rác nhận được bởi những người tạo bộ dữ liệu. Bộ dữ liệu được cung cấp dưới nhiều phiên bản khác nhau tùy theo việc có áp dụng danh sách từ dừng và chuẩn hóa thành từ gốc (như bỏ phụ tố -ing, -ed, -zation, etc.) hay không. 2.893 thư; 2.412 thư hợp lệ và 481 thư rác Phát hiện thư rác 2000
SMS Spam Collection Các tin nhắn SMS thực được tổng hợp từ nhiều nguồn và gán nhãn thành tin nhắn hợp lệ hoặc thư rác. Nội dung được giữ ở dạng văn bản thô thay vì chỉ cung cấp các đặc trưng đã trích xuất. 5.574 tin nhắn; 4.827 hợp lệ và 747 thư rác Phát hiện tin nhắn rác 2011
NUS SMS Corpus Kho tin nhắn SMS được thu thập từ người dùng điện thoại di động, chủ yếu tại Singapore. Không giống SMS Spam Collection, dữ liệu không được xây dựng riêng cho bài toán phát hiện tin nhắn rác mà phản ánh giao tiếp SMS thông thường. 67.093 tin nhắn trong phiên bản năm 2015 Mô hình hóa ngôn ngữ; phân tích ngôn ngữ trong tin nhắn 2013

Mạng xã hội và diễn đàn trực tuyến

Bộ dữ liệu Mô tả Quy mô Tác vụ Năm Nguồn
Twenty Newsgroups Các bài đăng trên 20 nhóm thảo luận Usenet về những chủ đề như máy tính, khoa học, thể thao, chính trịtôn giáo. Các nhóm có số lượng bài tương đối cân bằng và thường được dùng làm benchmark phân loại văn bản. Khoảng 20.000 bài đăng; 20 nhóm Phân loại chủ đề 1995
Sentiment140 Các bài đăng Twitter bằng tiếng Anh được gán nhãn cảm xúc tự động dựa trên biểu tượng cảm xúc có trong bài đăng. Biểu tượng dùng để tạo nhãn sau đó được loại khỏi nội dung để mô hình không thể dự đoán trực tiếp từ chúng. Khoảng 1,6 triệu bài đăng Phân tích cảm xúc 2009
OLID Các bài đăng Twitter tiếng Anh được chú thích theo ba tầng: có hay không có ngôn ngữ xúc phạm; nếu có, loại nội dung xúc phạm và đối tượng mà nội dung đó hướng tới. 14.200 bài đăng Phát hiện và phân loại ngôn ngữ xúc phạm; xác định đối tượng bị nhắm tới 2019
UIT-VSMEC Các bình luận tiếng Việt trên mạng xã hội được gán một trong bảy nhãn cảm xúc gồm vui vẻ, buồn bã, tức giận, ngạc nhiên, sợ hãi, ghê tởm và khác. 6.927 bình luận; 7 lớp cảm xúc Nhận dạng cảm xúc 2020
TweetEval Bộ benchmark tổng hợp các tập dữ liệu Twitter đã có trước đó và chuẩn hóa chúng thành bảy tác vụ phân loại với cùng cách đánh giá, gồm phân tích cảm xúc, nhận dạng cảm xúc, phát hiện ngôn ngữ thù ghét, ngôn ngữ xúc phạm, mỉa mai, dự đoán emoji và xác định lập trường của người đăng. 7 tác vụ Phân tích cảm xúc; nhận dạng cảm xúc; phát hiện ngôn ngữ thù ghét và xúc phạm; phát hiện mỉa mai; xác định lập trường 2020
Pushshift Reddit Kho lưu trữ quy mô lớn các bài đăng và bình luận công khai trên Reddit, bao phủ dữ liệu lịch sử từ khi nền tảng được thành lập. Dữ liệu giữ cả nội dung văn bản cùng thông tin về subreddit, người dùng, thời gian và cấu trúc thảo luận. Hàng tỷ bài đăng và bình luận Phân tích mạng xã hội; xử lý ngôn ngữ tự nhiên; nghiên cứu cộng đồng trực tuyến 2020
HateXplain Các bài đăng từ Twitter và Reddit được chú thích theo ba lớp bao gồm ngôn ngữ thù ghét, nội dung xúc phạm và bình thường. Mỗi mẫu còn có nhãn về nhóm bị nhắm tới và những từ hoặc cụm từ mà người chú thích sử dụng để giải thích quyết định của mình. Hơn 20.000 bài đăng Phát hiện ngôn ngữ thù ghét và xúc phạm; giải thích dự đoán 2021

Hỏi đáp và đọc hiểu

Bộ dữ liệu Mô tả Quy mô Tác vụ Năm Nguồn
TREC Question Classification Các câu hỏi tiếng Anh được gán nhãn theo loại câu trả lời cần tìm, chẳng hạn người, địa điểm, số lượng hoặc thực thể. Bộ dữ liệu thường được dùng để đánh giá khả năng phân loại câu hỏi trước bước tìm câu trả lời. 5.500 câu huấn luyện; 500 câu kiểm tra; 6 lớp lớn và 50 lớp con Phân loại câu hỏi theo cả nhãn lớn và nhãn con 2002
SQuAD Các đoạn văn lấy từ Wikipedia kèm các câu hỏi do người tham gia đặt dựa trên nội dung đoạn văn. Trong phiên bản đầu, câu trả lời cho mỗi câu hỏi là một đoạn văn bản tiếp theo sau đoạn văn đó. 107.785 cặp câu hỏi–câu trả lời từ 536 bài viết Wikipedia Đọc hiểu; trích xuất câu trả lời 2016
RACE Các đoạn văn và câu hỏi trắc nghiệm lấy từ các kỳ thi tiếng Anh dành cho học sinh trung học cơ sởtrung học phổ thông tại Trung Quốc. Nhiều câu hỏi yêu cầu suy luận từ nội dung thay vì chỉ tìm một cụm từ xuất hiện trực tiếp trong đoạn văn. 27.933 đoạn văn; 97.687 câu hỏi Đọc hiểu trắc nghiệm 2017
HotpotQA Các câu hỏi dựa trên Wikipedia được thiết kế để cần kết hợp thông tin từ nhiều tài liệu hoặc nhiều câu khác nhau. Ngoài câu trả lời, bộ dữ liệu còn cung cấp các câu làm bằng chứng để hỗ trợ cho quá trình suy luận của mô hình. Khoảng 113.000 cặp câu hỏi–câu trả lời Hỏi đáp nhiều bước; đọc hiểu; xác định bằng chứng 2018
Natural Questions Các truy vấn tìm kiếm thực của người dùng Google đã được ẩn danh hóa, mỗi câu hỏi đi kèm một trang Wikipedia từ các kết quả tìm kiếm hàng đầu. Mỗi trang được gán nhãn để xác định câu trả lời dài, câu trả lời ngắn hoặc cho biết trang không chứa câu trả lời. 307.373 mẫu huấn luyện; 7.830 mẫu phát triển Hỏi đáp; đọc hiểu; xác định câu trả lời ngắn và dài 2019

Suy luận ngôn ngữ

Bộ dữ liệu Mô tả Quy mô Tác vụ Năm Nguồn
SNLI Các cặp câu tiếng Anh gồm một câu tiền đề và một câu giả thuyết, được gán một trong ba nhãn: suy ra, mâu thuẫn hoặc trung lập. Các câu tiền đề bắt nguồn từ chú thích ảnh. Khoảng 570.000 cặp câu Suy luận ngôn ngữ tự nhiên 2015
MultiNLI Các cặp câu tiếng Anh gồm một câu tiền đề và một câu giả thuyết, được gán một trong ba nhãn: suy ra, mâu thuẫn hoặc trung lập. Văn bản được lấy từ nhiều thể loại nói và viết như hội thoại, thư từ, báo chí, tiểu thuyết và văn bản chính phủ. Khoảng 433.000 cặp câu; 10 thể loại Suy luận ngôn ngữ tự nhiên; đánh giá khả năng khái quát giữa các thể loại văn bản 2018
XNLI Các cặp câu tiền đề–giả thuyết từ MultiNLI được dịch sang 15 ngôn ngữ và giữ cùng ba nhãn: suy ra, mâu thuẫn hoặc trung lập. 7.500 cặp câu được gán nhãn bằng 15 ngôn ngữ trong tập đánh giá Suy luận ngôn ngữ tự nhiên đa ngôn ngữ; chuyển giao giữa các ngôn ngữ 2018
ANLI Các cặp câu tiền đề–giả thuyết được gán một trong ba nhãn: suy ra, mâu thuẫn hoặc trung lập. Dữ liệu được xây dựng qua nhiều vòng đối kháng, trong đó người tham gia tạo các ví dụ khiến mô hình hiện tại phân loại sai. Hơn 160.000 cặp câu qua 3 vòng Suy luận ngôn ngữ tự nhiên; đánh giá độ bền của mô hình 2020

Hội thoại

Bộ dữ liệu Mô tả Quy mô Tác vụ Năm Nguồn
DailyDialog Các đoạn hội thoại qua lại giữa hai người bằng tiếng Anh về những tình huống thường ngày như công việc, trường học, mua sắm và các mối quan hệ. Mỗi lượt lời được gán nhãn về mục đích giao tiếp và cảm xúc. 13.118 đoạn hội thoại Sinh phản hồi hội thoại; nhận dạng mục đích giao tiếp và cảm xúc 2017
Persona-Chat Các đoạn hội thoại giữa hai người, trong đó mỗi người được cung cấp một hồ sơ gồm một số câu mô tả đặc điểm và sở thích của nhân vật mà họ đóng vai. Nội dung hội thoại được xây dựng sao cho phù hợp với những thông tin trong hồ sơ này. 10.907 đoạn hội thoại Sinh hội thoại; duy trì tính nhất quán của nhân vật 2018
MultiWOZ Các đoạn hội thoại viết giữa người dùng và người đóng vai trợ lý, trong đó người dùng cần hoàn thành các tác vụ thuộc nhiều lĩnh vực như đặt khách sạn, tìm nhà hàng, đi tàu và đặt taxi. Một đoạn hội thoại có thể liên quan đến nhiều lĩnh vực khác nhau và đi kèm nhãn trạng thái hội thoại. 10.438 đoạn hội thoại; 7 lĩnh vực Hội thoại hướng tác vụ; theo dõi trạng thái hội thoại; sinh phản hồi 2018
Taskmaster-1 Các đoạn hội thoại hướng tác vụ trong sáu lĩnh vực như đặt vé xem phim, nhà hàng, cà phê, đặt xe và sửa chữa ô tô. Bộ dữ liệu gồm cả hội thoại giữa hai người và hội thoại do một người tự viết theo cả hai vai để tạo ra các luồng hội thoại đa dạng hơn. 13.215 đoạn hội thoại; 6 lĩnh vực Hội thoại hướng tác vụ; sinh phản hồi; hiểu yêu cầu người dùng 2019

Hội thoại và tinh chỉnh theo chỉ dẫn

Bộ dữ liệu Mô tả Quy mô Tác vụ Năm Nguồn
Flan Collection Tập hợp các bộ dữ liệu và mẫu hướng dẫn cho nhiều tác vụ xử lý ngôn ngữ tự nhiên, được chuyển về dạng đầu vào–đầu ra theo chỉ dẫn với các thiết lập không ví dụ, có ví dụ và chuỗi suy luận. 1.836 tác vụ trong Flan 2022 Tinh chỉnh theo chỉ dẫn; học đa tác vụ 2023
OpenAssistant Conversations (OASST1) Các cây hội thoại nhiều lượt giữa người dùng và trợ lý do con người viết bằng nhiều ngôn ngữ, kèm các đánh giá chất lượng cho từng tin nhắn và phản hồi. 161.443 tin nhắn; 35 ngôn ngữ; hơn 10.000 cây hội thoại hoàn chỉnh Tinh chỉnh theo chỉ dẫn; tinh chỉnh có giám sát; căn chỉnh mô hình ngôn ngữ 2023
UltraChat Các đoạn hội thoại nhiều lượt giữa người dùng mô phỏng và trợ lý, được tạo tự động bằng các mô hình ngôn ngữ theo nhiều chủ đề và loại yêu cầu khác nhau mà không sử dụng truy vấn trực tiếp từ người dùng thật. 1,5 triệu đoạn hội thoại nhiều lượt Tinh chỉnh theo chỉ dẫn; sinh hội thoại; tinh chỉnh chatbot 2023
LMSYS-Chat-1M Các đoạn hội thoại thực tế giữa người dùng và 25 mô hình ngôn ngữ lớn được thu thập từ Vicuna demo và Chatbot Arena, kèm thông tin về mô hình, ngôn ngữ và nhãn kiểm duyệt nội dung. 1 triệu đoạn hội thoại; 25 mô hình ngôn ngữ lớn Phân tích tương tác người–mô hình; tinh chỉnh theo chỉ dẫn; nghiên cứu an toàn mô hình 2024
WildChat Các đoạn hội thoại thực tế giữa người dùng và ChatGPT được thu thập từ một dịch vụ chatbot công khai, bao phủ nhiều ngôn ngữ, chủ đề và dạng yêu cầu trong sử dụng thực tế. Khoảng 1 triệu đoạn hội thoại; hơn 2,5 triệu lượt tương tác Phân tích tương tác người–mô hình; tinh chỉnh và đánh giá chatbot; nghiên cứu an toàn mô hình 2024


Kiến thức, suy luận và đánh giá mô hình ngôn ngữ

Bộ dữ liệu Mô tả Quy mô Tác vụ Năm Nguồn
MMLU Các câu hỏi trắc nghiệm thuộc 57 môn và lĩnh vực kiến thức, bao gồm toán học, khoa học, lịch sử, khoa học máy tính, luật và nhiều lĩnh vực khác. 57 tác vụ; khoảng 16.000 câu hỏi Đánh giá kiến thức đa lĩnh vực; giải câu hỏi trắc nghiệm 2021
GSM8K Các bài toán có lời văn ở trình độ tiểu học, mỗi bài đi kèm lời giải bằng ngôn ngữ tự nhiên gồm nhiều bước suy luận và phép tính cơ bản. 8.500 bài toán Suy luận toán học; giải bài toán có lời văn 2021
AI2 Reasoning Challenge (ARC) Các câu hỏi khoa học trắc nghiệm lấy từ các kỳ thi ở bậc phổ thông, được chia thành tập Easy và Challenge; tập Challenge gồm các câu mà những phương pháp truy hồi và đồng xuất hiện từ đơn giản đều trả lời sai. 7.787 câu hỏi Hỏi đáp khoa học; đánh giá kiến thức và suy luận 2018
HellaSwag Các tình huống bằng ngôn ngữ tự nhiên kèm nhiều phương án tiếp diễn, trong đó mô hình phải chọn phương án hợp lý nhất. Các phương án sai được tạo và lọc theo quy trình đối kháng để khó phân biệt bằng các đặc trưng bề mặt. Khoảng 70.000 mẫu Suy luận thường thức; chọn phần tiếp diễn hợp lý 2019
TruthfulQA Các câu hỏi thuộc 38 chủ đề được thiết kế xoay quanh những quan niệm sai hoặc niềm tin phổ biến có thể khiến người hoặc mô hình đưa ra câu trả lời không đúng sự thật. 817 câu hỏi; 38 chủ đề Đánh giá tính đúng sự thật của câu trả lời; hỏi đáp 2022

Dịch máy

Bộ dữ liệu Mô tả Quy mô Tác vụ Năm Nguồn
Hansard French-English Các câu song song tiếng Pháp–Anh được trích từ biên bản tranh luận của Quốc hội Canada. 2.869.040 cặp câu trong phần IBM Dịch máy Pháp–Anh 1995
Europarl Các văn bản song song được trích từ biên bản của Nghị viện châu Âu, gồm các bản dịch chính thức giữa nhiều ngôn ngữ châu Âu. Khoảng 30 triệu từ cho mỗi ngôn ngữ trong phiên bản ban đầu; 11 ngôn ngữ Dịch máy song ngữ và đa ngữ 2005
IWSLT Các văn bản song song được xây dựng chủ yếu từ bản ghi và bản dịch của các bài nói TED, với các cặp ngôn ngữ thay đổi theo từng chiến dịch đánh giá. Thay đổi theo năm và cặp ngôn ngữ Dịch máy; dịch lời nói 2004–
OPUS Các văn bản song song được thu thập từ nhiều nguồn đã được dịch trên Internet, gồm phụ đề, tài liệu phần mềm và văn bản hành chính, rồi được căn chỉnh giữa nhiều ngôn ngữ. Nhiều tập dữ liệu song song và hàng trăm ngôn ngữ; quy mô thay đổi theo phiên bản Dịch máy song ngữ và đa ngữ 2004
WMT 2014 Dữ liệu song song và đơn ngữ dùng cho nhiệm vụ dịch máy của Workshop on Statistical Machine Translation năm 2014, với các cặp ngôn ngữ gồm tiếng Anh với tiếng Séc, Đức, Pháp, Hindi và Nga. Quy mô thay đổi theo cặp ngôn ngữ; các thiết lập Anh–Đức và Anh–Pháp có hàng triệu cặp câu huấn luyện Dịch máy; đánh giá hệ thống dịch máy 2014
OpenSubtitles2016 Các câu song song được trích và căn chỉnh từ phụ đề phim và chương trình truyền hình, nên chứa nhiều ngôn ngữ hội thoại và cách diễn đạt đời thường. Khoảng 2,6 tỷ câu; 1.689 cặp văn bản song song; 60 ngôn ngữ Dịch máy song ngữ và đa ngữ 2016
United Nations Parallel Corpus Các tài liệu chính thức của Liên Hợp Quốc được căn chỉnh giữa sáu ngôn ngữ chính thức của tổ chức: Ả Rập, Trung Quốc, Anh, Pháp, NgaTây Ban Nha. Khoảng 800.000 tài liệu; 6 ngôn ngữ Dịch máy đa ngữ; căn chỉnh văn bản song song 2016
ParaCrawl Các câu song song được khai thác tự động từ các trang web đa ngôn ngữ, bao phủ nhiều lĩnh vực và cặp ngôn ngữ. Quy mô hàng tỷ cặp câu; thay đổi theo phiên bản và cặp ngôn ngữ Huấn luyện dịch máy; khai thác và lọc câu song song 2020
OPUS-100 Các cặp câu song song lấy từ OPUS, được tổ chức thành tập dữ liệu đa ngôn ngữ lấy tiếng Anh làm trung tâm và giới hạn lượng dữ liệu tối đa cho mỗi cặp ngôn ngữ. Khoảng 55 triệu cặp câu; 100 ngôn ngữ Dịch máy đa ngữ; dịch giữa các cặp ngôn ngữ chưa xuất hiện trực tiếp trong dữ liệu huấn luyện 2020
FLORES-101 Các đoạn văn tham chiếu được dịch thủ công sang 101 ngôn ngữ, với cùng nội dung được căn chỉnh giữa các ngôn ngữ. 3.001 câu cho mỗi ngôn ngữ; 101 ngôn ngữ Đánh giá dịch máy đa ngữ và ngôn ngữ ít tài nguyên 2021
FLORES-200 Các đoạn văn tham chiếu được dịch giữa hơn 200 ngôn ngữ, mở rộng FLORES-101 để hỗ trợ đánh giá nhất quán trên nhiều chiều dịch hơn. Hơn 200 ngôn ngữ; hơn 40.000 chiều dịch có thể đánh giá Đánh giá dịch máy đa ngữ và ngôn ngữ ít tài nguyên 2022
WikiMatrix Các cặp câu song song được khai thác tự động từ các bài viết Wikipedia bằng biểu diễn câu đa ngôn ngữ, không giới hạn việc ghép các ngôn ngữ với tiếng Anh. 135 triệu cặp câu; 1.620 cặp ngôn ngữ; 96 ngôn ngữ Huấn luyện dịch máy; khai thác câu song song 2021

Pháp lý

Bộ dữ liệu Mô tả Quy mô Tác vụ Năm Nguồn
EURLEX57K Các văn bản pháp luật của Liên minh châu Âu bằng tiếng Anh từ cơ sở dữ liệu EUR-Lex, được gán nhiều nhãn theo hệ thống chủ đề EUROVOC. 57.000 văn bản; khoảng 4.300 nhãn Phân loại văn bản pháp lý đa nhãn 2019
LEDGAR Các điều khoản được trích từ hợp đồng công khai trong hồ sơ của Ủy ban Giao dịch và Chứng khoán Hoa Kỳ, và được gán nhãn theo loại điều khoản. 846.274 điều khoản; 12.608 loại nhãn trong tập dữ liệu đầy đủ Phân loại điều khoản hợp đồng đa nhãn 2020
MultiEURLEX Các văn bản pháp luật của Liên minh châu Âu được dịch chính thức sang nhiều ngôn ngữ và gán nhiều nhãn chủ đề theo EUROVOC. Bộ dữ liệu còn được chia theo thời gian để đánh giá ảnh hưởng của sự thay đổi nội dung pháp luật theo thời gian. 65.000 văn bản; 23 ngôn ngữ Phân loại văn bản pháp lý đa ngôn ngữ và đa nhãn 2021
CUAD Các hợp đồng thương mại tiếng Anh được các chuyên gia pháp lý đánh dấu những đoạn chứa các điều khoản quan trọng đối với quá trình rà soát hợp đồng, như quyền chấm dứt, miễn trừ trách nhiệm và điều khoản không cạnh tranh. 510 hợp đồng; hơn 13.000 chú thích; 41 loại điều khoản Trích xuất và nhận dạng điều khoản hợp đồng 2021
ContractNLI Các hợp đồng bảo mật được ghép với những phát biểu về nội dung hợp đồng. Mỗi phát biểu được xác định là được hợp đồng xác nhận, mâu thuẫn với hợp đồng hoặc không được đề cập; dữ liệu còn chỉ ra đoạn văn làm bằng chứng. 607 hợp đồng Suy luận ngôn ngữ tự nhiên trên hợp đồng; xác định bằng chứng 2021
CaseHOLD Các câu hỏi trắc nghiệm được xây dựng từ án lệ Hoa Kỳ. Mỗi mẫu gồm ngữ cảnh trích dẫn từ một phán quyết và năm phát biểu về kết luận pháp lý của vụ án được dẫn, trong đó một lựa chọn là phù hợp. Hơn 53.000 câu hỏi Đọc hiểu và suy luận trên án lệ 2021
LexGLUE Bộ benchmark tập hợp nhiều bộ dữ liệu tiếng Anh thuộc các nguồn pháp lý khác nhau, gồm luật của Liên minh châu Âu, phán quyết của Tòa án Nhân quyền châu Âu, hợp đồng và án lệ Hoa Kỳ. Các tác vụ được chuẩn hóa để so sánh mô hình trên nhiều dạng hiểu văn bản pháp lý. 7 bộ dữ liệu Phân loại văn bản; dự đoán phán quyết; phân loại điều khoản; suy luận và đọc hiểu pháp lý 2022
LegalBench Bộ benchmark gồm nhiều tác vụ do các nhà nghiên cứu luật và máy học xây dựng hoặc chuẩn hóa để đánh giá nhiều dạng suy luận pháp lý, từ áp dụng quy tắc pháp luật đến giải thích hợp đồng và án lệ. 162 tác vụ từ 36 nguồn dữ liệu Đánh giá suy luận pháp lý 2023

Tiền huấn luyện mô hình ngôn ngữ

Bộ dữ liệu Mô tả Quy mô Tác vụ Năm Nguồn
BookCorpus Văn bản tiếng Anh từ các sách hư cấu được xuất bản miễn phí trên Internet, gồm các đoạn văn liên tục từ nhiều thể loại. 11.038 cuốn sách; khoảng 74 triệu câu Mô hình hóa ngôn ngữ; tiền huấn luyện mô hình ngôn ngữ 2015
WikiText-103 Văn bản tiếng Anh từ các bài viết chất lượng cao trên Wikipedia, giữ lại phần lớn cấu trúc văn bản, dấu câu, chữ hoa và số. Hơn 103 triệu từ Mô hình hóa ngôn ngữ; dự đoán văn bản 2017
C4 Văn bản tiếng Anh được trích từ Common Crawl, sau đó được lọc và làm sạch để loại nội dung không phù hợp hoặc có chất lượng thấp. Khoảng 750 GB văn bản tiếng Anh trong phiên bản ban đầu Tiền huấn luyện mô hình ngôn ngữ; mô hình hóa ngôn ngữ 2020
The Pile Văn bản tiếng Anh được tổng hợp từ 22 nguồn, gồm nội dung web, sách, bài báo khoa học, mã nguồn, văn bản pháp lý và Wikipedia. 825 GiB; 22 nguồn dữ liệu Tiền huấn luyện và đánh giá mô hình ngôn ngữ 2021
OSCAR Văn bản web đa ngôn ngữ được trích từ Common Crawl, sau đó được nhận dạng ngôn ngữ và lọc theo từng ngôn ngữ. Hơn 150 ngôn ngữ; quy mô thay đổi theo phiên bản Tiền huấn luyện mô hình ngôn ngữ đa ngữ; mô hình hóa ngôn ngữ 2019
RefinedWeb Văn bản tiếng Anh được trích từ Common Crawl, sau đó được lọc và loại trùng để giữ lại dữ liệu web có chất lượng cao hơn. Khoảng 5 nghìn tỷ token sau xử lý; 600 tỷ token được công bố Tiền huấn luyện mô hình ngôn ngữ 2023
Dolma Văn bản tiếng Anh được tổng hợp từ sáu nhóm nguồn, gồm nội dung web, bài báo khoa học, mã nguồn, sách thuộc phạm vi công cộng, mạng xã hội và tài liệu bách khoa. 3 nghìn tỷ token; hơn 4 tỷ tài liệu Tiền huấn luyện mô hình ngôn ngữ 2024
FineWeb Văn bản tiếng Anh được trích từ 96 bản lưu Common Crawl, sau đó được lọc, làm sạch và loại trùng; FineWeb-Edu là tập con được lọc để ưu tiên nội dung mang tính giáo dục. 15 nghìn tỷ token; FineWeb-Edu khoảng 1,3 nghìn tỷ token Tiền huấn luyện mô hình ngôn ngữ 2024
RedPajama-V2 Văn bản web được trích từ 84 bản lưu Common Crawl bằng quy trình CCNet, kèm các tín hiệu về chất lượng và mức độ trùng lặp của từng tài liệu. Hơn 100 tỷ tài liệu; 30 tỷ tài liệu có tín hiệu chất lượng; 20 tỷ tài liệu sau loại trùng Tiền huấn luyện mô hình ngôn ngữ; nghiên cứu lọc và lựa chọn dữ liệu 2024

Khác

Bộ dữ liệu Mô tả Quy mô Tác vụ Năm Nguồn
DBpedia Ontology Văn bản được trích từ các bài viết Wikipedia thông qua DBpedia và chia thành các lớp theo hệ thống phân loại của DBpedia. 560.000 mẫu huấn luyện; 70.000 mẫu kiểm tra; 14 lớp Phân loại văn bản 2015
GLUE Bộ benchmark tập hợp nhiều bộ dữ liệu tiếng Anh để đánh giá khả năng hiểu ngôn ngữ trên các tác vụ như suy luận ngôn ngữ, mức độ tương đồng giữa câu và phân loại quan hệ giữa các câu. 9 tác vụ được tính vào điểm benchmark Đánh giá khả năng hiểu ngôn ngữ tổng quát 2019
SuperGLUE Bộ benchmark kế tiếp GLUE, tập hợp các tác vụ khó hơn về suy luận, đọc hiểu, phân giải đồng tham chiếu và hiểu nghĩa của từ trong ngữ cảnh. 8 tác vụ chính Đánh giá khả năng hiểu và suy luận ngôn ngữ tổng quát 2019

Dữ liệu âm thanh

Tiếng nói

Bộ dữ liệu Mô tả Quy mô Tác vụ Năm Nguồn
TIMIT Các câu tiếng Anh được thu âm trong điều kiện kiểm soát từ người nói thuộc nhiều phương ngữ tại Hoa Kỳ. Dữ liệu kèm bản chép lời và nhãn ngữ âm được căn chỉnh với tín hiệu. 6.300 câu; 630 người nói Nhận dạng tiếng nói; nhận dạng âm vị 1993
Switchboard Các cuộc hội thoại điện thoại tự nhiên bằng tiếng Anh giữa những người tham gia được ghép cặp để thảo luận về các chủ đề được cho trước. Khoảng 2.400 cuộc hội thoại; khoảng 260 giờ Nhận dạng tiếng nói; mô hình hóa hội thoại nói 1992
LibriSpeech Các bản đọc từ sách nói tiếng Anh được trích từ LibriVox và căn chỉnh với văn bản từ Dự án Gutenberg. Dữ liệu được chia thành các tập có mức độ nhiễu và độ khó khác nhau. Khoảng 1.000 giờ tiếng nói; 2.484 người nói Nhận dạng tiếng nói; tiền huấn luyện mô hình tiếng nói 2015
VoxCeleb Các đoạn tiếng nói của người nổi tiếng được thu thập tự động từ video phỏng vấn và nội dung trực tuyến, với sự thay đổi lớn về tiếng ồn nền, thiết bị thu và môi trường. Hơn 100.000 đoạn phát biểu từ 1.251 người trong VoxCeleb1; VoxCeleb2 mở rộng lên hơn 6.000 người Nhận dạng và xác minh người nói 2017
Common Voice Các đoạn tiếng nói do cộng đồng đóng góp và xác minh, trong đó người tham gia đọc các câu văn cho trước. Bộ dữ liệu bao phủ nhiều ngôn ngữ và được cập nhật qua nhiều phiên bản. Hàng nghìn giờ tiếng nói; hơn 100 ngôn ngữ tùy phiên bản Nhận dạng tiếng nói đa ngôn ngữ 2020
Libri-Light Các bản sách nói tiếng Anh không gán nhãn được xây dựng từ LibriVox ở quy mô lớn hơn LibriSpeech, nhằm hỗ trợ học tự giám sáthọc nửa giám sát cho tiếng nói. Khoảng 60.000 giờ âm thanh chưa gán nhãn Học tự giám sát; học nửa giám sát; nhận dạng tiếng nói 2020

Âm nhạc

Bộ dữ liệu Mô tả Quy mô Tác vụ Năm Nguồn
GTZAN Genre Collection Các đoạn nhạc dài 30 giây thuộc mười thể loại: blues, cổ điển, country, disco, hip hop, jazz, metal, pop, reggaerock. 1.000 đoạn âm thanh; 10 thể loại Phân loại thể loại âm nhạc 2002
MagnaTagATune Các đoạn nhạc ngắn được gắn nhiều nhãn mô tả những đặc điểm như thể loại, loại nhạc cụ, tâm trạng và đặc tính âm thanh. Chúng được thu thập thông qua một trò chơi trực tuyến. 25.863 đoạn âm thanh; 188 thẻ Gắn đa nhãn âm nhạc 2009
MedleyDB Các bản nhạc hoàn chỉnh được cung cấp cùng các track âm thanh riêng của từng nhạc cụ hoặc giọng hát. Bộ dữ liệu còn có chú thích cao độ giai điệu và khoảng thời gian xuất hiện của từng nhạc cụ. 122 bài hát trong phiên bản đầu Trích xuất giai điệu; nhận dạng nhạc cụ; tách nguồn âm thanh 2014
NSynth Các bản ghi từng nốt nhạc riêng lẻ được tạo bởi nhiều nhạc cụ. Mỗi mẫu có thông tin về nhạc cụ, cao độ, vận tốc phím đàn và các đặc điểm âm sắc. 305.979 mẫu âm thanh; 1.006 nhạc cụ Nhận dạng nhạc cụ; học biểu diễn và sinh âm thanh âm nhạc 2017
Free Music Archive Các bản nhạc được phát hành theo giấy phép Creative Commons, kèm thông tin về nghệ sĩ, album, nhãn phân loại và hệ thống phân cấp thể loại. Bộ dữ liệu cung cấp cả bản ghi âm đầy đủ và các đặc trưng âm thanh đã trích sẵn. 106.574 bài hát; 16.341 nghệ sĩ; 161 thể loại trong hệ thống phân cấp Phân loại thể loại; gắn nhãn và truy hồi âm nhạc 2017
MUSDB18 Các bản thu âm nhạc được tách thành bốn nguồn gồm giọng hát, trống, bass và phần nhạc còn lại; đồng thời cung cấp bản phối hoàn chỉnh của từng bài. 150 bài hát Tách nguồn âm thanh âm nhạc 2017

Âm thanh môi trường

Bộ dữ liệu Mô tả Quy mô Tác vụ Năm Nguồn
ESC-50 Các đoạn âm thanh ngắn về những âm thanh thường gặp trong môi trường, gồm tiếng động vật, hiện tượng tự nhiên, âm thanh của con người, âm thanh trong nhà và tiếng ồn đô thị. 2.000 đoạn âm thanh; 50 lớp Phân loại âm thanh môi trường 2015
UrbanSound8K Các đoạn âm thanh đô thị thực tế như tiếng còi xe, tiếng khoan, còi báo động, tiếng chó sủa và tiếng nhạc đường phố, được trích từ các bản ghi trên Freesound. 8.732 đoạn âm thanh; 10 lớp Phân loại âm thanh đô thị 2014
TUT Acoustic Scenes 2017 Các bản ghi âm từ nhiều môi trường thực tế như nhà ở, văn phòng, công viên, trung tâm thành phố, cửa hàng, phương tiện công cộng và ga tàu điện. Các bản ghi dài được chia thành những đoạn 10 giây để phân loại môi trường nơi âm thanh được thu. Khoảng 52 giờ âm thanh; 15 loại cảnh Nhận dạng cảnh âm thanh 2017
AudioSet Các đoạn âm thanh dài 10 giây được lấy từ video trên YouTube và gán một hoặc nhiều nhãn mô tả những sự kiện âm thanh xuất hiện, từ tiếng nói, âm nhạc và động vật đến máy móc và âm thanh môi trường. Hơn 2 triệu đoạn âm thanh; 527 lớp Phát hiện và phân loại sự kiện âm thanh đa nhãn 2017
FSD50K Các đoạn âm thanh từ Freesound được gán thủ công một hoặc nhiều nhãn sự kiện âm thanh theo hệ thống lớp của AudioSet. Không giống AudioSet, các tệp âm thanh của FSD50K được phát hành trực tiếp theo giấy phép Creative Commons. 51.197 đoạn âm thanh; hơn 100 giờ; 200 lớp Phân loại và phát hiện sự kiện âm thanh đa nhãn 2021

Tín hiệu và chuỗi thời gian

Y sinh

Bộ dữ liệu Mô tả Quy mô Tác vụ Năm Nguồn
MIT-BIH Arrhythmia Database Các bản ghi điện tâm đồ Holter hai kênh dài khoảng 30 phút, kèm chú thích vị trí và loại của từng nhịp tim. 48 bản ghi từ 47 người; khoảng 110.000 nhịp tim được chú thích Phát hiện và phân loại rối loạn nhịp tim 1980
MIT-BIH Atrial Fibrillation Database Các bản ghi điện tâm đồ Holter dài khoảng 10 giờ từ người có bệnh rung nhĩ kịch phát, với các khoảng rung nhĩ và nhịp tim được đánh dấu theo thời gian. 25 bản ghi dài; khoảng 250 giờ điện tâm đồ Phát hiện rung nhĩ 1983
PTB-XL Các bản ghi điện tâm đồ 12 chuyển đạo dài 10 giây từ bệnh nhân trong thực hành lâm sàng. Mỗi bản ghi có thể mang nhiều nhãn chẩn đoán và các nhãn này được tổ chức thành nhiều nhóm bệnh. 21.837 bản ghi; 18.885 bệnh nhân Phân loại và chẩn đoán từ ECG đa nhãn 2020
EEG Motor Movement/Imagery Dataset Các bản ghi điện não đồ 64 kênh từ người tham gia khi thực hiện hoặc tưởng tượng các chuyển động của taychân. Dữ liệu gồm nhiều lần lặp của các tác vụ vận động và tưởng tượng vận động. Hơn 1.500 bản ghi dài 1–2 phút; 109 người Phân loại vận động và tưởng tượng vận động; giao diện não–máy tính 2009
BCI Competition III Dataset II Các tín hiệu điện não đồ 64 kênh được ghi khi người tham gia sử dụng hệ thống đánh vần dựa trên điện thế P300 (phản ánh hoạt động xử lý thông tin, sự chú ý và chức năng trí tuệ của não bộ). Những kích thích mục tiêu và không phải mục tiêu được đánh dấu để huấn luyện mô hình phát hiện phản ứng P300. 2 người; 64 kênh điện não đồ; 85 lượt huấn luyện và 100 lượt kiểm tra cho mỗi người Phát hiện P300; giao diện não–máy tính 2006

Hoạt động con người

Bộ dữ liệu Mô tả Quy mô Tác vụ Năm Nguồn
UCI Human Activity Recognition Using Smartphones Tín hiệu gia tốcvận tốc góc ba trục X Y Z được ghi bằng cảm biến của điện thoại thông minh đeo ở thắt lưng khi người tham gia thực hiện sáu hoạt động gồm đi bộ, đi lên cầu thang, đi xuống cầu thang, ngồi, đứng và nằm. 30 người; 6 hoạt động; tín hiệu được lấy mẫu ở 50 Hz Nhận dạng hoạt động con người 2013
PAMAP2 Tín hiệu từ ba bộ đo quán tính đeo ở tay, ngực và mắt cá chân cùng dữ liệu nhịp tim. Được ghi khi người tham gia thực hiện nhiều hoạt động thể chất như đi bộ, chạy, đạp xe và chơi bóng đá. 9 người; 18 hoạt động; khoảng 3,85 triệu mẫu Nhận dạng hoạt động; ước lượng cường độ hoạt động 2012
OPPORTUNITY Tín hiệu đồng bộ từ các cảm biến đeo trên cơ thể, cảm biến gắn trên đồ vật và cảm biến trong môi trường khi người tham gia thực hiện các hoạt động sinh hoạt thường ngày. Dữ liệu cho phép nhận dạng cả chuyển động của cơ thể và các thao tác với đồ vật. 4 người trong benchmark; 23 cảm biến đeo người, 12 cảm biến trên đồ vật và 21 cảm biến môi trường Nhận dạng hoạt động; nhận dạng thao tác; phân đoạn chuỗi tín hiệu 2013
Daily and Sports Activities Tín hiệu từ năm bộ cảm biến quán tính và từ trường gắn ở thân, hai tay và hai chân khi người tham gia thực hiện các hoạt động sinh hoạt và thể thao. 8 người; 19 hoạt động; 9.120 đoạn tín hiệu Nhận dạng hoạt động con người 2010
REALDISP Tín hiệu từ nhiều cảm biến quán tính đeo trên cơ thể khi người tham gia thực hiện các hoạt động thể chất. Dữ liệu được thu trong ba điều kiện bố trí cảm biến khác nhau để đánh giá ảnh hưởng của việc cảm biến bị đặt lệch vị trí. 17 người; 33 hoạt động; khoảng 9 giờ dữ liệu Nhận dạng hoạt động; đánh giá độ bền trước thay đổi vị trí cảm biến 2014
Heterogeneity Activity Recognition Tín hiệu gia tốc kế và con quay hồi chuyển được thu đồng thời từ nhiều mẫu điện thoại thông minh và đồng hồ thông minh khác nhau, nhằm phản ánh sự khác biệt giữa thiết bị và vị trí đeo trong điều kiện sử dụng thực tế. Hơn 43 triệu mẫu; nhiều điện thoại và đồng hồ thông minh Nhận dạng hoạt động; đánh giá khả năng khái quát giữa các thiết bị 2015

Công nghiệp

Bộ dữ liệu Mô tả Quy mô Tác vụ Năm Nguồn
Tennessee Eastman Process Dữ liệu mô phỏng một quy trình sản xuất hóa chất công nghiệp gồm lò phản ứng, thiết bị ngưng tụ, máy nén và các dòng tuần hoàn. Các biến đo lường và biến điều khiển được ghi theo thời gian trong điều kiện vận hành bình thường và khi xuất hiện nhiều loại lỗi quy trình. 52 biến quy trình trong mô hình chuẩn; nhiều chế độ vận hành và tình huống lỗi tùy phiên bản Phát hiện và chẩn đoán lỗi; giám sát quy trình 1993
NASA C-MAPSS Turbofan Engine Degradation Các chuỗi dữ liệu mô phỏng quá trình suy giảm của động cơ tuabin phản lực từ trạng thái hoạt động bình thường đến khi hỏng. Mỗi chu kỳ gồm điều kiện vận hành và nhiều phép đo cảm biến của động cơ. 4 tập con; từ 100 đến 260 động cơ huấn luyện và 100 đến 259 động cơ kiểm tra tùy tập con Ước lượng tuổi thọ hữu ích còn lại; dự đoán hỏng hóc 2008
Paderborn University Bearing Dataset Tín hiệu rung và dòng điện động cơ được đo đồng thời trên một hệ truyền động thử nghiệm với vòng bi khỏe mạnh và vòng bi bị hỏng. Các hư hỏng bao gồm cả lỗi nhân tạo và hư hỏng thực phát sinh trong quá trình thử nghiệm. 32 trạng thái vòng bi; nhiều điều kiện tốc độ, tải và lực hướng kính Phát hiện và phân loại hư hỏng vòng bi; giám sát tình trạng máy 2016
Condition Monitoring of Hydraulic Systems Các chuỗi tín hiệu từ một hệ thống thủy lực thử nghiệm, gồm áp suất, lưu lượng, nhiệt độ, độ rung và nhiều phép đo khác trong các chu kỳ tải 60 giây. Tình trạng của bộ làm mát, van, bơm và bình tích áp được thay đổi có kiểm soát. 2.205 chu kỳ; 17 cảm biến Giám sát tình trạng; phát hiện và phân loại lỗi hệ thống thủy lực 2018
MetroPT Chuỗi dữ liệu cảm biến liên tục từ bộ tạo khí nén trên một đoàn tàu điện đang vận hành tại Porto, gồm áp suất, nhiệt độ, dòng điện và các tín hiệu điều khiển. Các sự cố thực tế được xác định từ hồ sơ bảo trì của đơn vị vận hành. Khoảng 1,5 triệu bản ghi trong MetroPT-3 Phát hiện bất thường; dự đoán hỏng hóc; bảo trì dự đoán 2022

Môi trường và khoa học Trái Đất

Bộ dữ liệu Mô tả Quy mô Tác vụ Năm Nguồn
CAMELS-US Chuỗi thời gian thủy vănkhí tượng của các lưu vực sông tại Hoa Kỳ, gồm lưu lượng dòng chảy, lượng mưa, nhiệt độ, độ ẩm, bức xạ, tốc độ bay hơi nước và các biến khí tượng khác, kèm các thuộc tính tương đối ổn định của từng lưu vực như địa hình, đất, địa chấtthảm thực vật. 671 lưu vực Dự báo lưu lượng; mô hình hóa thủy văn 2017
CAMELS-CL Chuỗi thời gian khí tượng và thủy văn cùng các thuộc tính lưu vực tại Chile, trải dài qua nhiều điều kiện khí hậu từ sa mạc Atacama đến các vùng ôn đớiPatagonia. 516 lưu vực Dự báo lưu lượng; mô hình hóa thủy văn; nghiên cứu ảnh hưởng của khí hậu 2018
CAMELS-BR Chuỗi thời gian khí tượng và thủy văn cùng các thuộc tính lưu vực tại Brazil. 897 lưu vực trong tập dữ liệu chuẩn hóa Dự báo lưu lượng; mô hình hóa thủy văn 2020
CAMELS-GB Chuỗi thời gian khí tượng và thủy văn cùng các thuộc tính lưu vực tại Anh, ScotlandXứ Wales. 671 lưu vực Dự báo lưu lượng; mô hình hóa thủy văn 2020
CAMELS-AUS Chuỗi thời gian khí tượng và thủy văn cùng các thuộc tính lưu vực tại Australia. 222 lưu vực trong phiên bản đầu Dự báo lưu lượng; mô hình hóa thủy văn 2021
LamaH-CE Chuỗi thời gian khí tượng và thủy văn cùng các thuộc tính lưu vực tại Trung Âu. Dữ liệu còn biểu diễn mối liên hệ giữa các lưu vực trong mạng lưới sông. 859 lưu vực có trạm đo Dự báo lưu lượng; mô hình hóa thủy văn; mô hình hóa mạng lưới sông 2021
ERA5-Land Dữ liệu tái phân tích toàn cầu mô tả diễn biến theo thời gian của các biến trên bề mặt đất như nhiệt độ, lượng mưa, độ ẩm đất, tuyết, bức xạ và các thành phần của chu trình nước và năng lượng. Dữ liệu toàn cầu theo giờ, độ phân giải khoảng 9 km Dự báo và mô hình hóa khí tượng; nghiên cứu khí hậu và thủy văn 2021

Giao thông

Bộ dữ liệu Mô tả Quy mô Tác vụ Năm Nguồn
METR-LA Chuỗi các giá trị đo tốc độ của các phương tiện tham gia giao thông được ghi từ các cảm biến trên mạng lưới đường cao tốc tại Los Angeles. Các phép đo được lấy theo khoảng thời gian đều đặn và có thể kết hợp với cấu trúc mạng lưới đường xá. 207 cảm biến; dữ liệu từ tháng 3 đến tháng 6 năm 2012; khoảng lấy mẫu 5 phút Dự báo tốc độ giao thông 2018
PEMS-BAY Chuỗi các giá trị đo tốc độ của các phương tiện tham gia giao thông được thu từ các cảm biến thuộc hệ thống Performance Measurement System (PeMS) của Caltrans tại vùng vịnh San Francisco. Dữ liệu được ghi theo từng khoảng 5 phút. 325 cảm biến; dữ liệu trong khoảng 6 tháng; khoảng lấy mẫu 5 phút Dự báo tốc độ giao thông 2018
PeMSD4 Chuỗi lưu lượng giao thông từ các cảm biến thuộc hệ thống PeMS tại khu vực vịnh San Francisco. Phiên bản benchmark thường dùng gồm dữ liệu của các cảm biến được chọn trên nhiều tuyến đường trong hai tháng đầu năm 2018. 307 cảm biến trong phiên bản benchmark; 16.992 bước thời gian Dự báo lưu lượng giao thông 2019
PeMSD8 Chuỗi lưu lượng giao thông từ hệ thống PeMS tại khu vực San Bernardino, California, được ghi từ các cảm biến đặt trên nhiều tuyến đường trong tháng 7 và tháng 8 năm 2016. 170 cảm biến trong phiên bản benchmark; 17.856 bước thời gian Dự báo lưu lượng giao thông 2019
Traffic4cast Dữ liệu giao thông đô thị được tổng hợp theo không gian và thời gian từ lượng lớn vị trí GPS của phương tiện. Mỗi bước thời gian mô tả lưu lượng, tốc độ trung bình và hướng di chuyển tại các vùng của thành phố; các phiên bản của cuộc thi bao phủ nhiều thành phố và khoảng thời gian khác nhau. Phiên bản 2020 gồm Berlin, Istanbul và Moskva với dữ liệu theo khoảng 5 phút trong khoảng một năm; các phiên bản sau mở rộng sang nhiều thành phố Dự báo trạng thái giao thông theo không gian và thời gian; đánh giá khả năng khái quát giữa các thành phố 2020

Tài chính

Bộ dữ liệu Mô tả Quy mô Tác vụ Năm Nguồn
Dow Jones Index Dữ liệu theo tuần của 30 cổ phiếu thuộc Dow Jones Industrial Average trong hai quý đầu năm 2011, gồm giá mở cửa, đóng cửa, cao nhất, thấp nhất, khối lượng giao dịch và các đại lượng thay đổi theo thời gian. 750 mẫu; 30 cổ phiếu; 25 tuần Dự báo biến động giá; phân loại và hồi quy chuỗi tài chính 2013
FI-2010 Dữ liệu sổ lệnh giới hạn tần suất cao của năm cổ phiếu trên thị trường NASDAQ Nordic trong mười ngày giao dịch liên tiếp. Dữ liệu chứa giá và khối lượng ở nhiều mức mua–bán, cùng các biểu diễn chuẩn hóa dùng để dự đoán biến động giá. Khoảng 4 triệu mẫu chuỗi thời gian; 5 cổ phiếu; 10 ngày giao dịch Dự báo biến động giá giữa; phân tích sổ lệnh giới hạn 2018
CNNpred Chuỗi dữ liệu theo ngày của năm chỉ số chứng khoán lớn tại Hoa Kỳ, kết hợp giá thị trường với nhiều biến tài chính khác như chỉ báo kỹ thuật, hợp đồng tương lai, giá hàng hóa, các chỉ số thị trường quốc tế và lãi suất tín phiếu kho bạc. 1.985 ngày từ năm 2010 đến 2017; 5 chỉ số; 84 biến trong phiên bản UCI Dự đoán hướng biến động thị trường chứng khoán 2019

Tiêu thụ điện

Bộ dữ liệu Mô tả Quy mô Tác vụ Năm Nguồn
Individual Household Electric Power Consumption Các phép đo mức tiêu thụ điện của một hộ gia đình tại Pháp trong gần bốn năm, gồm công suất sử dụng, công suất điện trở, điện áp, cường độ dòng điện và mức tiêu thụ của một số nhóm thiết bị. Các phép đo được ghi mỗi phút. 2.075.259 phép đo; 47 tháng; 9 biến Dự báo mức tiêu thụ điện; phân tích chuỗi thời gian 2006
ElectricityLoadDiagrams20112014 Chuỗi mức tiêu thụ điện của hàng trăm khách hàng tại Bồ Đào Nha, được ghi theo từng khoảng 15 phút trong giai đoạn 2011–2014. 370 khách hàng; khoảng lấy mẫu 15 phút Dự báo phụ tải điện; phân cụm chuỗi tiêu thụ điện 2015
Appliances Energy Prediction Chuỗi dữ liệu từ một ngôi nhà tiết kiệm năng lượng, gồm mức tiêu thụ điện của thiết bị, nhiệt độ và độ ẩm tại nhiều phòng, cùng các biến thời tiết bên ngoài. 19.735 phép đo; khoảng lấy mẫu 10 phút; 29 biến Dự báo mức tiêu thụ điện của thiết bị 2017

Khác

Bộ dữ liệu Mô tả Quy mô Tác vụ Năm Nguồn
Numenta Anomaly Benchmark Bộ benchmark gồm nhiều chuỗi thời gian một biến có dấu thời gian từ các nguồn thực tế và dữ liệu tổng hợp, chẳng hạn mức sử dụng tài nguyên máy chủ, số liệu quảng cáo, cảm biến và lưu lượng mạng. Các khoảng xảy ra bất thường được đánh dấu để đánh giá thuật toán phát hiện bất thường theo thời gian thực. Hơn 50 chuỗi thời gian trong phiên bản ban đầu Phát hiện bất thường trong chuỗi thời gian 2015

Dữ liệu dạng bảng

Hệ thống gợi ý

Bộ dữ liệu Mô tả Quy mô Tác vụ Năm Nguồn
MovieLens Các điểm đánh giá phim do người dùng của hệ thống MovieLens cung cấp, kèm mã người dùng, tên phim, thời gian đánh giá và trong một số phiên bản có thêm nhãn mô tả do người dùng nhập. Bộ dữ liệu được phát hành thành nhiều phiên bản với quy mô khác nhau. Nhiều phiên bản; MovieLens 25M có khoảng 25 triệu lượt đánh giá của 162.000 người dùng cho 62.000 phim Hệ thống gợi ý; dự đoán điểm đánh giá 1997
Netflix Prize Các điểm đánh giá phim 1–5 sao của khách hàng Netflix đã được ẩn danh, kèm mã phim và thời điểm đánh giá. Bộ dữ liệu được phát hành cho cuộc thi Netflix Prize và sau đó cũng được dùng trong KDD Cup 2007. 100.480.507 lượt đánh giá; 480.189 người dùng; 17.770 phim Hệ thống gợi ý; dự đoán điểm đánh giá 2006
Jester Collaborative Filtering Dataset Các điểm đánh giá ẩn danh của người dùng cho 100 câu chuyện cười, theo thang điểm liên tục từ −10 đến 10. Khoảng 4,1 triệu lượt đánh giá; 73.421 người dùng; 100 câu chuyện cười Lọc cộng tác; dự đoán mức độ ưa thích 2001
Yahoo! Music KDD Cup 2011 Các điểm đánh giá của người dùng Yahoo! Music đối với bài hát, album, nghệ sĩ và thể loại âm nhạc. Các mục được tổ chức theo cấu trúc phân cấp và dữ liệu còn chứa thời gian đánh giá. Hàng trăm triệu lượt đánh giá trong hai tập dữ liệu của KDD Cup 2011 Hệ thống gợi ý âm nhạc; dự đoán điểm đánh giá và xếp hạng 2011

Y sinh và sức khỏe

Bộ dữ liệu Mô tả Quy mô Tác vụ Năm Nguồn
Heart Disease Dữ liệu lâm sàng của bệnh nhân được thu tại bốn cơ sở ở Hoa Kỳ và châu Âu. Các thuộc tính gồm tuổi tác, giới tính, triệu chứng đau ngực, huyết áp, cholesterol, kết quả điện tâm đồ và các phép đo liên quan đến nghiệm pháp gắng sức. 303 mẫu trong tập Cleveland thường dùng; 13 đặc trưng Phân loại bệnh động mạch vành 1988
Breast Cancer Wisconsin (Original) Các đặc trưng mô tả hình thái tế bào lấy từ mẫu chọc hút kim nhỏ của khối u , như độ dày cụm tế bào, độ đồng nhất về kích thước và hình dạng tế bào. 699 mẫu; 9 đặc trưng Phân loại khối u lành tính hoặc ác tính 1992
Breast Cancer Wisconsin (Diagnostic) Các đặc trưng hình học được tính từ ảnh số hóa của mẫu chọc hút kim nhỏ của khối u vú. Mười đại lượng cơ bản như bán kính, kết cấu, chu vidiện tích được biểu diễn bằng giá trị trung bình, sai số chuẩngiá trị cực đại. 569 mẫu; 30 đặc trưng Phân loại khối u lành tính hoặc ác tính 1995
Diabetic Retinopathy Debrecen Các đặc trưng được trích từ ảnh đáy mắt trong bộ Messidor, gồm thông tin về tổn thương được phát hiện, các cấu trúc giải phẫu của mắt và các đặc trưng mô tả toàn ảnh. 1.151 mẫu; 19 đặc trưng Phát hiện dấu hiệu bệnh võng mạc tiểu đường 2014
Parkinson's Các phép đo âm học được trích từ bản ghi giọng nói của người mắc bệnh Parkinson và người khỏe mạnh. Mỗi hàng tương ứng với một bản ghi giọng nói và gồm các đại lượng về cao độ, độ biến động về cường độ (jitter), độ biến động về biên độ (shimmer) và các đặc trưng phi tuyến. 195 bản ghi; 31 người Phân loại bệnh Parkinson 2008
Parkinson Speech Dataset Các đặc trưng tuyến tính và thời gian–tần số được trích từ nhiều loại bản ghi giọng nói như nguyên âm kéo dài, số, từ và câu ngắn của người mắc Parkinson và người khỏe mạnh. 1.040 mẫu; 40 người trong tập huấn luyện Phân loại bệnh Parkinson; hồi quy mức độ bệnh 2013
Mice Protein Expression Mức biểu hiện của 77 protein hoặc dạng biến đổi protein trong vỏ não của chuột đối chứng và chuột với ba nhiễm sắc thể trong mỗi tế bào để mô phỏng hội chứng Down. Các nhóm chuột khác nhau về kiểu gen, điều kiện học và việc điều trị bằng memantine. 1.080 mẫu; 72 con chuột; 77 protein Phân loại nhóm chuột; phân tích các protein liên quan đến khả năng học 2015

Khoa học tự nhiên

Bộ dữ liệu Mô tả Quy mô Tác vụ Năm Nguồn
Abalone Các phép đo vật lý của bào ngư như chiều dài, đường kính, chiều cao và khối lượng. Tuổi của bào ngư được xác định từ số vòng trên vỏ và được dùng làm giá trị cần dự đoán. 4.177 mẫu; 8 đặc trưng Ước lượng tuổi 1995
Covertype Các ô đất rừng 30 × 30 m tại Rừng Quốc gia Roosevelt ở Colorado, được mô tả bằng những thuộc tính địa hình và đất như độ cao, độ dốc, khoảng cách đến nguồn nước, mức che bóng, vùng hoang dã và loại đất. Dữ liệu không sử dụng ảnh viễn thám. 581.012 mẫu; 54 đặc trưng; 7 loại rừng Phân loại loại rừng 1998
Wine Quality Các mẫu rượu vang đỏtrắng Vinho Verde của Bồ Đào Nha, được mô tả bằng các phép đo lý hóa như độ axid, đường dư, chloride, sulfur dioxide, khối lượng riêng, pH, sulfatenồng độ cồn. Mỗi mẫu có điểm chất lượng do người thử rượu đánh giá. 6.497 mẫu; 11 đặc trưng đầu vào Dự đoán chất lượng rượu vang 2009
Forest Type Mapping Các đặc trưng phổ được trích từ ảnh vệ tinh ASTER của một khu vực rừng tại Nhật Bản vào ba thời điểm khác nhau. Mỗi mẫu gồm các giá trị phổ khả kiến và cận hồng ngoại cùng các đại lượng biểu diễn sai khác không gian. 326 mẫu; 27 đặc trưng; 4 lớp Phân loại loại rừng 2012
HIGGS Các sự kiện va chạm hạt được mô phỏng bằng phương pháp Monte Carlo để phân biệt tín hiệu của một quá trình tạo boson Higgs với các quá trình nền. Mỗi sự kiện được biểu diễn bằng các đại lượng động học của các hạt cùng một số đặc trưng vật lý tổng hợp. 11 triệu mẫu; 28 đặc trưng Phân loại sự kiện vật lý hạt 2014
HEPMASS Các sự kiện va chạm hạt được mô phỏng bằng Monte Carlo, với mục tiêu phân biệt các quá trình tạo hạt giả định mới khỏi nền vật lý chuẩn. Mỗi sự kiện được biểu diễn bằng các đặc trưng động học dạng số. 10,5 triệu mẫu; 28 đặc trưng Phân loại sự kiện vật lý hạt 2016
Iris Các mẫu hoa diên vĩ thuộc ba loài, được mô tả bằng chiều dài và chiều rộng của đài hoacánh hoa. 150 mẫu; 4 đặc trưng; 3 lớp Phân loại loài hoa 1936
Wine Kết quả phân tích hóa học của các mẫu rượu vang được sản xuất từ ba giống nho khác nhau trồng trong cùng một khu vực tại Ý. Các đặc trưng gồm nồng độ cồn, axid malic, magnesium, phenol, flavonoid, cường độ màu và proline. 178 mẫu; 13 đặc trưng; 3 lớp Phân loại giống nho dựa trên thành phần hóa học của rượu vang 1991

Kỹ thuật và công nghiệp

Bộ dữ liệu Mô tả Quy mô Tác vụ Năm Nguồn
Steel Plates Faults Các khiếm khuyết trên bề mặt thép không gỉ được biểu diễn bằng các đặc trưng hình học và hình dạng đã trích, rồi chia thành bảy loại lỗi như vết xước, vết bẩn và chỗ lồi. 1.941 mẫu; 27 đặc trưng; 7 lớp Phân loại khuyết tật trên tấm thép 2010
Airfoil Self-Noise Các phép đo từ thí nghiệm khí động họcâm học trên cánh NACA 0012 trong đường hầm gió. Mỗi mẫu gồm tần số, góc tấn, chiều dài cung, vận tốc dòng khí và độ dày lớp biên, cùng mức áp suất âm thanh đo được. 1.503 mẫu; 5 đặc trưng đầu vào Dự đoán tiếng ồn khí động học 2014
Energy Efficiency Các cấu hình mô phỏng của công trình dân dụng với những thuộc tính thiết kế như độ nhỏ gọn tương đối, diện tích bề mặt, diện tích tường và mái, chiều cao, hướng và diện tích kính. Hai giá trị cần dự đoán là tải sưởi và tải làm mát. 768 mẫu; 8 đặc trưng đầu vào Dự đoán tải sưởi và tải làm mát của công trình 2012
Gas Turbine CO and NOx Emission Các phép đo vận hành của một tuabin khí tại Thổ Nhĩ Kỳ được tổng hợp theo giờ, gồm điều kiện môi trường và các biến của quá trình như áp suất, nhiệt độ và công suất. Hai biến đầu ra là nồng độ carbon monoxidenitrogen oxide trong khí thải. 36.733 mẫu; 11 biến đo Dự đoán phát thải CO và NOx 2019

Ô tô

Bộ dữ liệu Mô tả Quy mô Tác vụ Năm Nguồn
Automobile Thông số kỹ thuật và đặc điểm của các mẫu ô tô, gồm hãng sản xuất, loại nhiên liệu, kiểu thân xe, kích thước, khối lượng, đặc điểm động cơ và mức tiêu thụ nhiên liệu. Dữ liệu còn chứa mức rủi ro bảo hiểm và giá xe. 205 mẫu; 25 đặc trưng Dự đoán giá xe; phân tích rủi ro bảo hiểm 1985
Auto MPG Các đặc điểm kỹ thuật của ô tô như số xi-lanh, dung tích động cơ, công suất, khối lượng, khả năng tăng tốc và năm sản xuất, kèm mức tiêu thụ nhiên liệu tính theo dặm trên gallon. 398 mẫu; 7 đặc trưng đầu vào Dự đoán mức tiêu thụ nhiên liệu 1983
Car Evaluation Các cấu hình ô tô được mô tả bằng sáu thuộc tính phân loại gồm giá mua, chi phí bảo dưỡng, số cửa, sức chứa hành khách, kích thước khoang hành lý và mức an toàn. Nhãn biểu thị mức độ chấp nhận của xe. 1.728 mẫu; 6 đặc trưng; 4 lớp Phân loại mức độ chấp nhận của ô tô 1988

Kinh tế và tài chính

Bộ dữ liệu Mô tả Quy mô Tác vụ Năm Nguồn
Statlog (Australian Credit Approval) Các hồ sơ xin cấp tín dụng với cả thuộc tính số và thuộc tính phân loại. Tên và giá trị của các thuộc tính đã được ẩn hoặc mã hóa để bảo vệ thông tin cá nhân. 690 mẫu; 14 đặc trưng Phân loại hồ sơ tín dụng 1987
Statlog (German Credit Data) Hồ sơ người vay được mô tả bằng các thuộc tính như tình trạng tài khoản, thời hạn và mục đích khoản vay, lịch sử tín dụng, hạn mức tín dụng, việc làm và tình trạng nhà ở. Mỗi hồ sơ được phân thành rủi ro tín dụng tốt hoặc xấu. 1.000 mẫu; 20 đặc trưng Đánh giá rủi ro tín dụng 1994
Default of Credit Card Clients Hồ sơ khách hàng thẻ tín dụng tại Đài Loan, gồm hạn mức tín dụng, thông tin nhân khẩu học, lịch sử trả nợ, số tiền trên hóa đơn và các khoản thanh toán trong sáu tháng trước đó. 30.000 khách hàng; 23 đặc trưng Dự đoán khả năng vỡ nợ thẻ tín dụng 2009
Bank Marketing Dữ liệu từ các chiến dịch tiếp thị trực tiếp qua điện thoại của một ngân hàng Bồ Đào Nha. Mỗi mẫu mô tả một khách hàng và lần liên hệ, với mục tiêu xác định người đó có đăng ký tiền gửi có kỳ hạn hay không. 45.211 mẫu; 16 đặc trưng trong phiên bản đầy đủ Dự đoán phản hồi chiến dịch tiếp thị ngân hàng 2012

Xã hội

Bộ dữ liệu Mô tả Quy mô Tác vụ Năm Nguồn
Adult Các hồ sơ được trích từ dữ liệu điều tra dân số Hoa Kỳ, gồm những thuộc tính như tuổi, trình độ học vấn, nghề nghiệp, tình trạng hôn nhân, số giờ làm việc và thu nhập. 48.842 mẫu; 14 đặc trưng Dự đoán thu nhập hằng năm trên hoặc không quá 50.000 USD 1996
Census-Income (KDD) Các hồ sơ được trích từ Current Population Surveys của Cục Điều tra Dân số Hoa Kỳ năm 1994 và 1995, gồm các biến về nhân khẩu học, việc làm, giáo dục và hộ gia đình. Mỗi mẫu còn có trọng số biểu thị số người trong dân số mà hồ sơ đại diện. 299.285 mẫu; 41 đặc trưng Dự đoán mức thu nhập 2000
Student Performance Dữ liệu học sinh tại hai trường trung học ở Bồ Đào Nha, gồm điểm số, thông tin nhân khẩu học, hoàn cảnh xã hội, gia đình và các yếu tố liên quan đến trường học. Hai tập con tương ứng với môn Toántiếng Bồ Đào Nha. 395 học sinh môn Toán; 649 học sinh môn tiếng Bồ Đào Nha Dự đoán kết quả học tập 2008
Teaching Assistant Evaluation Các đánh giá chất lượng giảng dạy của các trợ giảng tại Khoa Thống kê, Đại học Wisconsin–Madison trong ba học kỳ chính và hai học kỳ hè. Mỗi mẫu mô tả một lần phân công trợ giảng bằng các thuộc tính như giảng viên, khóa học, học kỳ và quy mô lớp. 151 mẫu; 5 đặc trưng Phân loại mức đánh giá giảng dạy 1997
Balance Scale Dữ liệu tổng hợp được tạo để mô hình hóa kết quả của một thí nghiệm về cân thăng bằng. Mỗi mẫu xác định khối lượng và khoảng cách ở hai phía của cân, với nhãn cho biết cân nghiêng sang trái, sang phải hoặc giữ cân bằng. 625 mẫu; 4 đặc trưng; 3 lớp Phân loại trạng thái cân 1994

Khác

Bộ dữ liệu Mô tả Quy mô Tác vụ Năm Nguồn
Letter Recognition Các chữ cái in hoa trong bảng chữ cái Latinh được biểu diễn bằng các đặc trưng số trích từ ảnh ký tự, như vị trí, kích thước và các thống kê về phân bố pixel. 20.000 mẫu; 16 đặc trưng; 26 lớp Nhận dạng chữ cái 1991
Spambase Các thư điện tử được biểu diễn bằng những đặc trưng đã trích như tần suất xuất hiện của từ và ký tự, cùng các thống kê về chuỗi chữ in hoa. 4.601 mẫu; 57 đặc trưng Phân loại thư rác 1999

Dữ liệu đồ thị

Mạng xã hội

Bộ dữ liệu Mô tả Quy mô Tác vụ Năm Nguồn
Facebook Social Circles Các mạng lân cận của người dùng Facebook, trong đó mỗi nút biểu thị người dùng và các cạnh biểu thị quan hệ bạn bè giữa họ. Dữ liệu còn gồm các thuộc tính hồ sơ đã ẩn danh và các nhóm bạn bè do người dùng xác định. 4.039 nút; 88.234 cạnh Phát hiện cộng đồng; dự đoán liên kết; học biểu diễn nút 2012
Epinions Social Network Mạng có hướng giữa người dùng của trang đánh giá Epinions, trong đó một cạnh biểu thị việc một người dùng tuyên bố tin cậy một người dùng khác. 75.879 nút; 508.837 cạnh Dự đoán liên kết; phân tích độ tin cậy; phân tích mạng xã hội 2003
Slashdot Social Network Mạng người dùng của trang tin công nghệ Slashdot, trong đó các quan hệ được tạo thông qua chức năng Slashdot Zoo cho phép người dùng đánh dấu người khác là bạn hoặc đối thủ. Phiên bản tháng 2 năm 2009 chứa mạng quan hệ giữa hơn 82 nghìn người dùng. 82.168 nút; 948.464 cạnh Phân tích cấu trúc cộng đồng; dự đoán liên kết 2009
Pokec Social Network Mạng xã hội Pokec tại Slovakia, gồm các quan hệ bạn bè có hướng và thông tin hồ sơ đã được ẩn danh như tuổi, giới tính, khu vực, học vấn và sở thích. 1.632.803 nút; 30.622.564 cạnh Phân tích mạng xã hội; dự đoán liên kết; dự đoán thuộc tính nút 2012
LiveJournal Social Network Mạng quan hệ giữa người dùng LiveJournal, một nền tảng blog và cộng đồng trực tuyến. Các nút biểu thị tài khoản người dùng và cạnh có hướng biểu thị quan hệ bạn bè được khai báo giữa các thành viên. 4.847.571 nút; 68.993.773 cạnh Phát hiện cộng đồng; phân tích cấu trúc mạng; dự đoán liên kết 2006
Gowalla Mạng xã hội dựa trên vị trí của Gowalla, gồm quan hệ bạn bè giữa người dùng và các lần check-in có dấu thời gian và tọa độ địa lý. 196.591 nút; 950.327 cạnh; 6.442.890 lượt check-in Dự đoán liên kết; dự đoán vị trí; phân tích quan hệ giữa tình bạn và di chuyển 2011

Hóa học

Bộ dữ liệu Mô tả Quy mô Tác vụ Năm Nguồn
MUTAG Tập hợp các hợp chất hóa học có cấu trúc được biểu diễn dưới dạng đồ thị, trong đó nút là nguyên tử và cạnh là liên kết hóa học. Mỗi phân tử được gán nhãn theo khả năng gây đột biến. 188 đồ thị; trung bình 17,9 nút và 19,8 cạnh mỗi đồ thị; 2 lớp Phân loại đồ thị; dự đoán khả năng gây đột biến 2020
NCI1 Các hợp chất hóa học được biểu diễn thành đồ thị phân tử và gán nhãn theo kết quả sàng lọc khả năng ức chế sự phát triển của tế bào ung thư trong chương trình của Viện Ung thư Quốc gia Hoa Kỳ. 4.110 đồ thị; trung bình 29,9 nút và 32,3 cạnh; 2 lớp Phân loại đồ thị; dự đoán hoạt tính sinh học của hợp chất 2020
ZINC Các phân tử hữu cơ giống thuốc từ cơ sở dữ liệu ZINC được biểu diễn dưới dạng đồ thị với nguyên tử là nút và liên kết hóa học là cạnh. Phiên bản benchmark thường dùng gồm 12.000 phân tử và yêu cầu dự đoán một tính chất hóa học liên tục. 12.000 đồ thị trong phiên bản benchmark; 10.000 huấn luyện, 1.000 xác thực, 1.000 kiểm thử Hồi quy đồ thị; dự đoán tính chất phân tử 2020

Sinh học

Bộ dữ liệu Mô tả Quy mô Tác vụ Năm Nguồn
PP-Pathways Mạng tương tác protein–protein ở người, trong đó các nút biểu thị protein và các cạnh biểu thị những tương tác vật lý đã được xác nhận bằng thực nghiệm. Mạng được sử dụng để nghiên cứu cấu trúc của các con đường liên quan đến bệnh. 21.557 nút; 342.353 cạnh Dự đoán liên kết; phát hiện con đường bệnh; phân tích cấu trúc mạng protein 2018
PPT-OhmNet Tập hợp các mạng tương tác protein–protein đặc hiệu theo mô ở người. Mỗi lớp mạng tương ứng với một mô, với các nút là protein và các cạnh là tương tác vật lý được xác định là hoạt động trong mô đó. 4.510 protein; 70.338 cạnh trong mạng đa lớp; 107 mô Dự đoán chức năng protein theo mô; học biểu diễn nút trên mạng đa lớp 2017
PP-Decagon Mạng liên kết protein–protein ở người, gồm cả tương tác vật lý trực tiếp và các liên hệ chức năng gián tiếp. Bộ dữ liệu là thành phần protein của mạng đa phương thức Decagon dùng để mô hình hóa tác dụng phụ của việc kết hợp nhiều loại thuốc. 19.081 nút; 715.612 cạnh Dự đoán liên kết; học biểu diễn protein; dự đoán tác dụng phụ của phối hợp thuốc 2018
ChG-TargetDecagon Mạng hai phía giữa thuốc và protein đích, trong đó mỗi cạnh biểu thị một tương tác thuốc–protein đã được xác nhận bằng thực nghiệm hoặc nghiên cứu dược lý. 3.932 nút, gồm 284 thuốc và 3.648 gene/protein; 18.690 cạnh Dự đoán đích tác dụng của thuốc; dự đoán liên kết thuốc–protein 2018
PP-Miner Tập hợp các mạng liên kết protein–protein của nhiều loài, gồm tương tác vật lý trực tiếp và các liên hệ chức năng như đồng biểu hiện, cùng con đường sinh học và phức hợp protein. Dữ liệu được trích từ STRING phiên bản 10.5. Khoảng 8,25 triệu protein; 1,85 tỷ cạnh; 2.031 loài Dự đoán tương tác protein; học biểu diễn protein; phân tích mạng sinh học giữa nhiều loài 2017
ENZYMES Các protein được biểu diễn dưới dạng đồ thị dựa trên cấu trúc bậc ba; các nút tương ứng với cấu trúc thứ cấp của protein và các cạnh mô tả quan hệ không gian giữa chúng. Mỗi đồ thị được gán vào một trong sáu lớp enzyme. 600 đồ thị; trung bình 32,6 nút và 62,1 cạnh; 6 lớp Phân loại đồ thị; phân loại enzyme 2020
ogbg-molhiv Các phân tử được biểu diễn thành đồ thị nguyên tử–liên kết và gán nhãn theo khả năng ức chế sự nhân lên của HIV. Bộ dữ liệu được OGB chuẩn hóa từ một tác vụ trong MoleculeNet. 41.127 đồ thị Phân loại đồ thị; dự đoán hoạt tính chống HIV 2020
ogbg-molpcba Các hợp chất từ PubChem BioAssay được biểu diễn thành đồ thị phân tử và gán nhãn cho nhiều phép thử sinh học khác nhau. 437.929 đồ thị; 128 tác vụ phân loại nhị phân Phân loại đồ thị đa tác vụ; dự đoán hoạt tính sinh học 2020
ogbg-ppa Tập hợp các mạng liên kết protein của nhiều loài, trong đó mỗi đồ thị biểu diễn mạng liên kết protein của một loài và các cạnh có đặc trưng mô tả nhiều loại liên hệ giữa protein. Mục tiêu là xác định nhóm phân loại sinh học của loài tạo ra mạng. 1.581 đồ thị; 37 lớp Phân loại đồ thị; phân loại nhóm sinh vật 2020

Đồ thị tri thức

Bộ dữ liệu Mô tả Quy mô Tác vụ Năm Nguồn
FB15k-237 Một tập con của Freebase được tạo từ FB15k sau khi loại bỏ các quan hệ dư thừa và nhiều cặp quan hệ nghịch đảo có thể gây rò rỉ giữa tập huấn luyện và kiểm thử. Các bộ ba biểu diễn quan hệ giữa các thực thể thuộc nhiều lĩnh vực như người, địa điểm, phim và thể thao. 14.541 thực thể; 237 loại quan hệ; 310.116 bộ ba Hoàn thiện đồ thị tri thức; dự đoán liên kết 2015
WN18RR Một tập con của WordNet được tạo từ benchmark WN18 bằng cách loại bỏ các quan hệ nghịch đảo gây rò rỉ giữa dữ liệu huấn luyện và kiểm thử. Các nút tương ứng với các tập hợp từ đồng nghĩa (synset) của WordNet và các cạnh biểu thị những quan hệ từ vựng giữa chúng. 40.943 thực thể; 11 loại quan hệ; 93.003 bộ ba Hoàn thiện đồ thị tri thức; dự đoán liên kết 2018
YAGO3-10 Một tập con của đồ thị tri thức YAGO3 chỉ giữ các thực thể tham gia ít nhất mười quan hệ. Phần lớn các bộ ba mô tả thuộc tính của con người, chẳng hạn quốc tịch, giới tính và nghề nghiệp. 123.182 thực thể; 37 loại quan hệ; 1.089.040 bộ ba Hoàn thiện đồ thị tri thức; dự đoán liên kết 2018
Wikidata5M Đồ thị tri thức quy mô lớn được xây dựng từ bản kết xuất WikidataWikipedia tiếng Anh tháng 7 năm 2019. Mỗi thực thể được liên kết với phần mô tả lấy từ bài Wikipedia tương ứng, cho phép đánh giá cả trên các thực thể đã xuất hiện và chưa xuất hiện trong quá trình huấn luyện. 4.594.485 thực thể; 822 loại quan hệ; 20.624.575 bộ ba Hoàn thiện đồ thị tri thức; dự đoán liên kết quy nạp; học biểu diễn thực thể 2021

Mạng trích dẫn nghiên cứu

Bộ dữ liệu Mô tả Quy mô Tác vụ Năm Nguồn
Cora Mạng trích dẫn các bài báo về học máy, trong đó mỗi nút là một bài báo và mỗi cạnh biểu thị quan hệ trích dẫn. Mỗi bài được biểu diễn bằng vector nhị phân cho biết sự xuất hiện của các từ và được gán vào một trong bảy chủ đề. 2.708 nút; 5.429 cạnh; 1.433 đặc trưng; 7 lớp Phân loại nút; học nửa giám sát trên đồ thị 2000
CiteSeer Mạng trích dẫn các bài báo khoa học, trong đó các nút là tài liệu và các cạnh biểu thị quan hệ trích dẫn. Nội dung mỗi bài được biểu diễn bằng vector từ và các bài báo được chia thành sáu chủ đề. 3.327 nút; 4.732 cạnh; 3.703 đặc trưng; 6 lớp Phân loại nút; học nửa giám sát trên đồ thị 2008
PubMed Mạng trích dẫn các bài báo y sinh về bệnh tiểu đường trong cơ sở dữ liệu PubMed. Mỗi bài báo là một nút, các cạnh biểu thị trích dẫn và mỗi nút có vector đặc trưng dựa trên tần suất từ, cùng nhãn chỉ một trong ba nhóm chủ đề. 19.717 nút; 44.338 cạnh; 500 đặc trưng; 3 lớp Phân loại nút; học nửa giám sát trên đồ thị 2008
ogbn-arxiv Mạng trích dẫn có hướng của các bài báo khoa học máy tính trên arXiv được lập chỉ mục trong Microsoft Academic Graph. Mỗi nút là một bài báo, mỗi cạnh biểu thị một trích dẫn và mỗi nút có vector 128 chiều được tạo từ tiêu đề và tóm tắt. 169.343 nút; 1.166.243 cạnh; 40 lớp Phân loại chủ đề bài báo; phân loại nút 2020
ogbn-papers100M Mạng trích dẫn quy mô lớn của các bài báo khoa học máy tính được lập chỉ mục trong Microsoft Academic Graph. Mỗi nút là một bài báo, mỗi cạnh có hướng biểu thị một quan hệ trích dẫn và mỗi bài có vector đặc trưng 128 chiều được tạo từ tiêu đề và tóm tắt. 111.059.956 nút; 1.615.685.872 cạnh; 172 lớp Phân loại chủ đề bài báo; phân loại nút; đánh giá khả năng mở rộng của mô hình đồ thị 2020

Mã nguồn và nhật ký phần mềm

Bộ dữ liệu Mô tả Quy mô Tác vụ Năm Nguồn
CodeSearchNet Corpus Mã nguồn từ các kho phần mềm nguồn mở trên GitHub, gồm các hàm và tài liệu đi kèm thuộc sáu ngôn ngữ lập trình: Go, Java, JavaScript, PHP, PythonRuby. Khoảng 6 triệu hàm; 6 ngôn ngữ lập trình Tìm kiếm mã nguồn; sinh mô tả mã; học biểu diễn mã nguồn 2019
CodeXGLUE Bộ benchmark tổng hợp nhiều tập dữ liệu về mã nguồn cho các bài toán hiểu và tạo sinh chương trình, bao gồm phát hiện clone và lỗi, tìm kiếm mã, tạo sinh và hoàn thiện mã, dịch giữa các ngôn ngữ lập trình, sửa mã và tạo sinh mô tả bằng ngôn ngữ tự nhiên. 14 tập dữ liệu; 10 tác vụ Hiểu mã nguồn; sinh mã; phát hiện lỗi; tìm kiếm mã; dịch và sửa mã 2021
The Stack Mã nguồn quy mô lớn được thu thập từ các kho phần mềm công khai và lọc theo giấy phép cho phép phân phối. Khoảng 3,1 TB mã nguồn; 30 ngôn ngữ lập trình trong phiên bản được công bố ban đầu Mô hình hóa mã nguồn; hoàn thiện mã; sinh chương trình; tiền huấn luyện mô hình ngôn ngữ 2022
HumanEval Bộ bài toán lập trình Python, mỗi bài gồm chữ ký hàm, tài liệu mô tả yêu cầu và các kiểm thử dùng để đánh giá tính đúng đắn của chương trình được sinh ra. 164 bài toán lập trình Sinh mã từ mô tả ngôn ngữ tự nhiên; đánh giá tính đúng đắn chức năng 2021
Defects4J Tập hợp các lỗi thực tế có thể tái tạo trong các dự án Java nguồn mở. Mỗi lỗi đi kèm phiên bản chương trình bị lỗi và phiên bản đã sửa, cùng bộ kiểm thử giúp tái tạo hành vi lỗi. 357 lỗi thuộc 5 dự án trong phiên bản được công bố ban đầu Kiểm thử phần mềm; định vị lỗi; sửa lỗi tự động; dự đoán lỗi 2014
Loghub Bộ sưu tập nhật ký thực tế từ nhiều loại hệ thống phần mềm, gồm hệ thống phân tán, siêu máy tính, hệ điều hành, thiết bị di động, ứng dụng máy chủ và phần mềm độc lập. Một số tập con có nhãn để xác định sự bất thường. 19 tập dữ liệu; tổng dung lượng hơn 77 GB Phân tích nhật ký; phân tích cú pháp log; phát hiện bất thường; chẩn đoán lỗi 2020
Loghub-2.0 Bộ benchmark nhật ký hệ thống được xây dựng để khắc phục hạn chế về quy mô và tính đại diện của Loghub khi đánh giá các thuật toán phân tích cú pháp log. Các log được lấy từ nhiều hệ thống phần mềm thực tế và được gán nhãn mẫu log. 14 tập dữ liệu; trung bình khoảng 3,6 triệu dòng log mỗi tập Phân tích cú pháp nhật ký; đánh giá thuật toán phân tích log 2023

Đa phương thức

Hình ảnh–văn bản

Bộ dữ liệu Mô tả Quy mô Tác vụ Năm Nguồn
Flickr30k Các ảnh chụp từ Flickr, mỗi ảnh đi kèm năm câu mô tả bằng tiếng Anh do con người viết. Dữ liệu chủ yếu mô tả người, vật thể, hoạt động và sự kiện trong các cảnh đời thường. 31.783 ảnh; 158.915 câu mô tả Sinh mô tả ảnh; truy hồi ảnh–văn bản; học biểu diễn đa phương thức 2014
Visual Genome Các ảnh cảnh thực tế được gán chú thích dày đặc về vật thể, thuộc tính, quan hệ giữa các vật thể, vùng ảnh và mô tả bằng ngôn ngữ tự nhiên. Các chú thích có thể được biểu diễn dưới dạng đồ thị cảnh liên kết nội dung hình ảnh với ngôn ngữ. 108.077 ảnh; hàng triệu mô tả vùng, vật thể, thuộc tính và quan hệ Sinh mô tả ảnh; sinh đồ thị cảnh; hiểu quan hệ thị giác–ngôn ngữ; hỏi đáp trực quan 2017
VQA v2 Các câu hỏi bằng ngôn ngữ tự nhiên về ảnh cùng câu trả lời do con người cung cấp. Phiên bản thứ hai được xây dựng để giảm khả năng mô hình đoán câu trả lời chỉ từ thiên lệch ngôn ngữ bằng cách ghép các câu hỏi tương tự với những ảnh có câu trả lời khác nhau. Khoảng 204.000 ảnh; 1,1 triệu câu hỏi; hơn 11 triệu câu trả lời Hỏi đáp trực quan 2017
CLEVR Các ảnh tổng hợp chứa những vật thể 3D đơn giản, đi kèm câu hỏi được sinh tự động về thuộc tính, vị trí, số lượng và quan hệ giữa các vật thể. Mỗi câu hỏi còn có biểu diễn chương trình chức năng mô tả chuỗi suy luận cần thực hiện. 100.000 ảnh; khoảng 1 triệu câu hỏi Hỏi đáp trực quan; suy luận kết hợp; đánh giá khả năng suy luận thị giác 2017
GQA Các câu hỏi và câu trả lời về ảnh thực tế được tạo từ các đồ thị cảnh của Visual Genome. Mỗi câu hỏi đi kèm biểu diễn ngữ nghĩa có cấu trúc, cho phép đánh giá nhiều bước suy luận về vật thể, thuộc tính và quan hệ. 113.018 ảnh; khoảng 22 triệu câu hỏi Hỏi đáp trực quan; suy luận kết hợp; đánh giá tính nhất quán 2019
Conceptual Captions Các cặp ảnh và văn bản thay thế được thu thập tự động từ các trang web; văn bản được xử lý và khái quát hóa một số thực thể, tạo dữ liệu quy mô lớn nhưng nhiễu hơn các bộ mô tả ảnh được gán nhãn thủ công. Khoảng 3,3 triệu cặp ảnh–văn bản huấn luyện Sinh mô tả ảnh; tiền huấn luyện thị giác–ngôn ngữ 2018
Wikipedia-based Image Text Dataset Các cặp ảnh–văn bản được trích từ Wikipedia đa ngôn ngữ, kết hợp ảnh với văn bản liên quan trong bài viết và thông tin về thực thể. Bộ dữ liệu được thiết kế cho học đa phương thức và đa ngôn ngữ. 37,6 triệu mẫu ảnh–văn bản; 11,5 triệu ảnh duy nhất; 108 ngôn ngữ Tiền huấn luyện đa phương thức; truy hồi ảnh–văn bản; học đa ngôn ngữ 2021
LAION-5B Bộ dữ liệu quy mô lớn gồm các cặp ảnh và văn bản thay thế thu thập từ web, sau đó được lọc theo mức tương đồng giữa ảnh và văn bản bằng mô hình CLIP (contrastive language-image pre-training). Bộ dữ liệu gồm nhiều tập con theo ngôn ngữ và mức độ an toàn của nội dung. 5,85 tỷ cặp ảnh–văn bản Tiền huấn luyện mô hình thị giác–ngôn ngữ; sinh ảnh từ văn bản; truy hồi ảnh–văn bản 2022

Video–âm thanh–văn bản

Bộ dữ liệu Mô tả Quy mô Tác vụ Năm Nguồn
CMU-MOSI Các đoạn video độc thoại lấy từ video đánh giá phim trên YouTube, gồm hình ảnh người nói, tín hiệu âm thanh và bản chép lời. Mỗi đoạn được gán điểm cường độ cảm xúc từ −3 đến 3. 2.199 đoạn; 93 video Phân tích cảm xúc đa phương thức; hồi quy cường độ cảm xúc 2016
CMU-MOSEI Các đoạn phát biểu lấy từ video trực tuyến của hơn một nghìn người nói về nhiều chủ đề khác nhau. Mỗi mẫu kết hợp bản chép lời, âm thanh và biểu hiện hình ảnh, đồng thời có nhãn cảm xúc và cường độ cảm xúc. 23.453 đoạn; hơn 1.000 người nói; 250 chủ đề Phân tích cảm xúc đa phương thức; nhận dạng cảm xúc 2018
MELD Các đoạn hội thoại nhiều người từ loạt phim Friends, trong đó mỗi phát ngôn có video, âm thanh và bản chép lời, cùng nhãn cảm xúc và sắc thái tích cực, tiêu cực hoặc trung tính. Khoảng 13.000 phát ngôn; 1.433 đoạn hội thoại Nhận dạng cảm xúc trong hội thoại; phân tích cảm xúc đa phương thức 2019
HowTo100M Các video hướng dẫn có lời thuyết minh được thu thập từ web, chia thành các đoạn ngắn và ghép với văn bản lấy từ phụ đề tự động của lời nói. 1,22 triệu video; 136 triệu đoạn video; khoảng 134.000 giờ Tiền huấn luyện video–ngôn ngữ; truy hồi video–văn bản; học biểu diễn đa phương thức 2019
CH-SIMS Các đoạn video tiếng Trung lấy từ phim điện ảnh, phim truyền hình và chương trình giải trí, kết hợp hình ảnh, âm thanh và lời thoại. Ngoài nhãn cảm xúc chung cho cả mẫu đã phương thức, mỗi phương thức còn được gán nhãn cảm xúc riêng. 2.281 đoạn video; 60 video nguồn Phân tích cảm xúc đơn phương thức và đa phương thức 2020

Văn bản–đồ thị/cấu trúc

Bộ dữ liệu Mô tả Quy mô Tác vụ Năm Nguồn
WebNLG Các tập bộ ba RDF lấy từ DBpedia được ghép với những câu hoặc đoạn văn diễn đạt cùng nội dung bằng ngôn ngữ tự nhiên. Bộ dữ liệu được xây dựng để đánh giá khả năng chuyển dữ liệu có cấu trúc thành văn bản. Hàng nghìn tập bộ ba RDF và nhiều cách diễn đạt bằng văn bản Sinh văn bản từ đồ thị; diễn đạt dữ liệu RDF bằng ngôn ngữ tự nhiên 2017
T-REx Các câu trong phần mở đầu của bài Wikipedia được căn chỉnh với các bộ ba trong Wikidata biểu diễn những thực thể và quan hệ được đề cập trong văn bản. 11 triệu bộ ba; 3,09 triệu phần mở đầu Wikipedia; 6,2 triệu câu Trích xuất quan hệ; liên kết thực thể; căn chỉnh văn bản–đồ thị tri thức; hoàn thiện cơ sở tri thức 2018
WikiTableQuestions Các câu hỏi bằng ngôn ngữ tự nhiên được ghép với bảng bán cấu trúc lấy từ Wikipedia và câu trả lời có thể được suy ra từ nội dung bảng. Nhiều câu hỏi yêu cầu kết hợp nhiều phép toán hoặc so sánh giữa các ô. 22.033 câu hỏi; 2.108 bảng Hỏi đáp trên bảng; phân tích ngữ nghĩa 2015
WikiSQL Các câu hỏi bằng ngôn ngữ tự nhiên về những bảng lấy từ Wikipedia, đi kèm truy vấn SQL tương ứng. Mỗi ví dụ gắn một câu hỏi với cấu trúc của bảng và một truy vấn dùng để lấy câu trả lời. 80.654 cặp câu hỏi–SQL; 24.241 bảng Chuyển văn bản thành SQL; phân tích ngữ nghĩa; giao diện ngôn ngữ tự nhiên cho cơ sở dữ liệu 2017
Spider Các câu hỏi ngôn ngữ tự nhiên được ghép với truy vấn SQL trên nhiều cơ sở dữ liệu quan hệ có nhiều bảng và lược đồ khác nhau. Tập huấn luyện và kiểm thử sử dụng các cơ sở dữ liệu khác nhau để đánh giá khả năng khái quát hóa sang lược đồ chưa gặp. 10.181 câu hỏi; 5.693 truy vấn SQL riêng biệt; 200 cơ sở dữ liệu; 138 lĩnh vực Chuyển văn bản thành SQL; phân tích ngữ nghĩa trên nhiều miền 2018
ToTTo Các bảng Wikipedia với một số ô được đánh dấu, đi kèm một câu tiếng Anh diễn đạt thông tin chứa trong các ô đó. Các câu đích được biên tập để vừa tự nhiên vừa bám sát dữ liệu trong bảng. Hơn 120.000 mẫu huấn luyện Sinh văn bản từ bảng; sinh văn bản có điều kiện từ dữ liệu có cấu trúc 2020

Khác

Bộ dữ liệu Mô tả Quy mô Tác vụ Năm Nguồn
RAVDESS Các bản ghi lời nói và bài hát thể hiện cảm xúc của 24 diễn viên chuyên nghiệp, được cung cấp dưới dạng nghe nhìn, chỉ âm thanh và chỉ video. Các biểu cảm được gán nhãn theo loại cảm xúc và cường độ. 7.356 tệp; 24 diễn viên Nhận dạng cảm xúc từ giọng nói và khuôn mặt; học đa phương thức âm thanh–video 2018
FUNSD Các biểu mẫu giấy đã quét với chú thích cho từ, thực thể ngữ nghĩa và quan hệ giữa các thực thể. Mỗi mẫu kết hợp hình ảnh tài liệu, nội dung văn bản và vị trí không gian của văn bản trên trang. 199 biểu mẫu; 31.485 từ; 9.707 thực thể; 5.304 quan hệ Hiểu biểu mẫu; nhận dạng thực thể; liên kết thực thể; phân tích bố cục tài liệu 2019
DocVQA Các ảnh tài liệu được ghép với câu hỏi bằng ngôn ngữ tự nhiên và câu trả lời do con người gán nhãn. Việc trả lời thường yêu cầu kết hợp nhận dạng văn bản với hiểu bố cục và cấu trúc của tài liệu. Hơn 12.000 ảnh tài liệu; 50.000 câu hỏi Hỏi đáp trên tài liệu; hiểu tài liệu đa phương thức 2021
Ego-Exo4D Các hoạt động có kỹ năng được ghi đồng thời từ camera góc nhìn thứ nhất và nhiều camera bên ngoài. Dữ liệu góc nhìn thứ nhất còn có âm thanh nhiều kênh, cảm biến quán tính, theo dõi ánh mắt, tư thế đầu và thông tin hình học 3D của môi trường; một phần dữ liệu đi kèm chú thích ngôn ngữ. Hơn 1.400 giờ video; 839 người tham gia; 13 thành phố Hiểu hoạt động; chuyển đổi giữa góc nhìn thứ nhất và thứ ba; học đa phương thức và đa góc nhìn 2024

Tham khảo

Thống kê chỉ số

Số trận 3 (1)
Bàn thắng 0
Kiến tạo 0
Cú sút 4
Thẻ vàng 0
Thẻ đỏ 0
NL
✦ Đối Tác Công Nghệ Số
Ngọc Lợi Digital
Kỹ Sư Giải Pháp Số & Marketing Toàn Diện
🏆
500+
Dự án
<1.5s
Tốc độ web
🏛
100%
BCT duyệt
🔧
24/7
Hỗ trợ KT
🎁 Tư vấn miễn phí còn
05 GIỜ : 18 PHÚT : 00 GIÂY
Tư Vấn Ngay → 0388 810 316
QUẢNG CÁO

0388 810 316 Tư vấn miễn phí
NL