Danh sách các bộ dữ liệu dùng trong nghiên cứu học máy bao gồm các tập dữ liệu được sử dụng trong nghiên cứu học máy và được mô tả hoặc sử dụng trong các công trình học thuật đã qua bình duyệt. Các bộ dữ liệu đóng vai trò quan trọng trong việc phát triển và đánh giá các thuật toán và mô hình học máy.
Trong các bộ dữ liệu dùng cho học có giám sát, mỗi mẫu dữ liệu thường đi kèm một hoặc nhiều nhãn (label) biểu thị thông tin mà mô hình cần dự đoán. Trong bài toán phân loại, mỗi giá trị phân loại có thể được gọi là một lớp (class); chẳng hạn, một bộ dữ liệu ảnh chó và mèo có hai lớp, còn nhãn của một ảnh cụ thể cho biết ảnh đó thuộc lớp nào. Một mẫu cũng có thể có nhiều nhãn cùng lúc, như một ảnh được gán đồng thời các nhãn "người", "ô tô" và "đường phố". Với các tác vụ khác, nhãn có thể mang dạng khác, chẳng hạn một giá trị số trong hồi quy, hộp giới hạn trong phát hiện vật thể, nhãn cho từng pixel trong phân vùng ảnh, hoặc một chuỗi văn bản trong các bài toán ngôn ngữ. Một số bộ dữ liệu không có nhãn có thể được sử dụng cho học không giám sát hoặc học tự giám sát.
Phát hiện động vật; phân loại loài; giám sát đa dạng sinh học
2015
Plant Seedlings Dataset
Ảnh cây con của 12 loài cây trồng và cỏ dại ở nhiều giai đoạn sinh trưởng.
Khoảng 5.500 ảnh; 12 loài
Phân loại loài
2017
iNaturalist 2017
Ảnh thực địa về thực vật và động vật có phân bố lớp mất cân bằng tự nhiên, được thu thập từ cộng đồng iNaturalist.
859.000 ảnh; hơn 5.000 loài
Phân loại loài; nhận dạng loài
2018
Terra Incognita
Ảnh động vật được thu thập từ 20 bẫy ảnh cố định tại các địa điểm khác nhau, được thiết kế để đánh giá khả năng nhận dạng động vật ở các môi trường mà mô hình chưa từng học.
Hơn 24.000 ảnh trong benchmark thường dùng
Phân loại loài; phát hiện động vật; tổng quát hóa miền
2018
Ảnh viễn thám
Bộ dữ liệu
Mô tả
Quy mô
Tác vụ
Năm
Nguồn
UC Merced Land Use
Ảnh hàng không với độ phân giải cao cho các khu vực tại Hoa Kỳ, được chia thành 21 lớp cho các mục đích sử dụng đất như khu dân cư, rừng, đường cao tốc và sân bay.
2.100 ảnh; 21 lớp
Phân loại sử dụng đất
2010
SAT-4
Ảnh hàng không từ chương trình National Agriculture Imagery Program của Hoa Kỳ, được chia thành bốn lớp phủ bề mặt.
500.000 ảnh; 4 lớp
Phân loại lớp phủ bề mặt
2015
SAT-6
Ảnh hàng không từ cùng nguồn với SAT-4, được chia thành sáu lớp phủ bề mặt.
405.000 ảnh; 6 lớp
Phân loại lớp phủ bề mặt
2015
AID
Ảnh viễn thám thu thập từ nhiều quốc gia và điều kiện chụp khác nhau, bao gồm 30 loại cảnh như sân bay, khu dân cư, rừng và cảng biển.
10.000 ảnh; 30 lớp
Phân loại cảnh viễn thám
2017
NWPU-RESISC45
Ảnh viễn thám thuộc 45 loại cảnh, với sự biến thiên về độ phân giải, góc nhìn, ánh sáng và điều kiện nền.
31.500 ảnh; 45 lớp
Phân loại cảnh viễn thám
2017
INRIA Aerial Image Labeling
Ảnh hàng không độ phân giải 0,3 m từ nhiều thành phố tại Hoa Kỳ và châu Âu, kèm mặt nạ nhị phân thể hiện có công trình nhân tạo ở đó không.
Phát hiện công trình; phân vùng công trình; trích xuất dấu chân công trình
2017
DOTA
Ảnh hàng không độ phân giải cao từ nhiều cảm biến và nền tảng, với các vật thể xuất hiện ở nhiều kích thước và hướng khác nhau.
2.806 ảnh; 15 lớp trong phiên bản đầu
Phát hiện vật thể
2018
MASATI
Ảnh quang học trên không của các vùng biển và ven biển trong nhiều điều kiện thời tiết và chiếu sáng, bao gồm cả ảnh có và không có tàu.
7.389 ảnh
Phân loại cảnh hàng hải; phát hiện tàu
2018
AICrowd Mapping Challenge
Ảnh vệ tinh RGB WorldView-3 độ phân giải 0,3 m được chia thành các mảnh 300 × 300 pixel, kèm chú thích đa giác dấu chân công trình theo định dạng MS COCO. Bộ dữ liệu được tạo từ dữ liệu SpaceNet 2.
Một nghiên cứu tại CVPR 2026 phát hiện mức độ trùng lặp và rò rỉ dữ liệu nghiêm trọng: sau khi loại các bản sao chính xác và biến đổi, chỉ còn 29.338 ảnh huấn luyện duy nhất trong số 280.741 ảnh ban đầu, đồng thời 93,45% ảnh kiểm định xuất hiện trong tập huấn luyện.
Phân vùng công trình; trích xuất dấu chân công trình
2018
DeepGlobe
Ảnh vệ tinh độ phân giải cao từ nhiều khu vực trên thế giới, được gán nhãn cho ba bài toán gồm trích xuất đường giao thông, phát hiện tòa nhà và phân vùng các lớp phủ đất như khu đô thị, đất nông nghiệp, rừng, mặt nước và đất cằn.
3 bộ dữ liệu; riêng bộ trích xuất đường gồm 8.570 ảnh phủ khoảng 2.220 km²
Trích xuất đường; phát hiện tòa nhà; phân vùng lớp phủ đất
2018
Functional Map of the World
Ảnh vệ tinh đa phổ của các địa điểm tại hơn 200 quốc gia và vùng lãnh thổ, kèm thông tin về vị trí, thời gian chụp và điều kiện quan sát. Các địa điểm được chia thành 63 lớp theo chức năng, như sân bay, bệnh viện, nhà máy điện, cảng, nhà tù và cơ sở quân sự.
1.047.691 ảnh; 63 lớp; 207 quốc gia hoặc vùng lãnh thổ
Phân loại chức năng địa điểm; nhận dạng địa điểm từ ảnh viễn thám
2018
xView
Ảnh vệ tinh WorldView-3 với độ phân giải khoảng 0,3 m, bao phủ nhiều khu vực trên thế giới và được gán hộp giới hạn cho 60 loại vật thể như máy bay, tàu thủy, ô tô, xe tải, tòa nhà và các cơ sở hạ tầng khác.
Hơn 1 triệu vật thể; 60 lớp; hơn 1.400 km² ảnh
Phát hiện vật thể
2018
EuroSAT
Ảnh vệ tinh Sentinel-2 được chia thành 10 lớp sử dụng đất và lớp phủ bề mặt; phiên bản đa phổ sử dụng 13 dải phổ.
27.000 ảnh; 10 lớp
Phân loại sử dụng đất; phân loại lớp phủ bề mặt
2019
iSAID
Bộ dữ liệu được xây dựng từ ảnh DOTA và bổ sung mặt nạ cho từng vật thể trong ảnh.
2.806 ảnh; 655.451 đối tượng; 15 lớp
Phân vùng thực thể
2019
BigEarthNet
Ảnh vệ tinh đa phổ từ Sentinel-2 được thu thập tại mười quốc gia châu Âu, bao phủ nhiều điều kiện theo mùa và địa lý. Mỗi ảnh được gán nhiều nhãn lớp phủ đất dựa trên hệ thống CORINE Land Cover, như đất canh tác, rừng, đồng cỏ, vùng đô thị và mặt nước.
590.326 ảnh; 19 lớp trong hệ nhãn được sửa đổi
Phân loại đa nhãn lớp phủ đất
2019
xBD
Các cặp ảnh vệ tinh độ phân giải cao chụp cùng khu vực trước và sau thiên tai, kèm vị trí tòa nhà và mức độ thiệt hại. Dữ liệu bao gồm nhiều loại sự kiện như động đất, lũ lụt, cháy rừng, bão nhiệt đới và sóng thần tại nhiều quốc gia.
850.736 chú thích tòa nhà; 45.362 km² ảnh
Phát hiện thay đổi; đánh giá thiệt hại tòa nhà
2019
LoveDA
Ảnh viễn thám độ phân giải cao từ Nam Kinh, Thường Châu và Vũ Hán tại Trung Quốc, bao gồm cả khu vực đô thị và nông thôn. Mỗi pixel được gán một trong bảy lớp như tòa nhà, đường, mặt nước, rừng, đất nông nghiệp và đất trống.
5.987 ảnh; 7 lớp
Phân vùng lớp phủ đất; thích nghi miền
2021
Million-AID
Ảnh viễn thám độ phân giải cao thu thập trên phạm vi toàn cầu, bao gồm các cảnh tự nhiên và nhân tạo như đất nông nghiệp, rừng, khu dân cư, sân bay, cảng, cầu và các cơ sở công nghiệp. Các ảnh được tổ chức theo một hệ phân cấp gồm 51 loại cảnh.
Hơn 1 triệu ảnh; 51 lớp
Phân loại cảnh viễn thám
2021
Harmonized Landsat Sentinel-2
Ảnh vệ tinh phản xạ bề mặt từ Landsat 8, Landsat 9 và Sentinel-2 được hiệu chỉnh và chuẩn hóa để có thể sử dụng chung. Dữ liệu phủ gần toàn bộ đất liền trên thế giới ở độ phân giải 30 m và cung cấp các quan sát lặp lại theo thời gian cho những ứng dụng như theo dõi thảm thực vật, nông nghiệp và thay đổi lớp phủ đất.
Phủ gần toàn bộ đất liền toàn cầu trừ Nam Cực; độ phân giải 30 m; dữ liệu từ năm 2013
Phân loại lớp phủ đất; phát hiện thay đổi; giám sát nông nghiệp và thảm thực vật; phân tích chuỗi ảnh viễn thám
2025
Giao thông
Bộ dữ liệu
Mô tả
Quy mô
Tác vụ
Năm
Nguồn
German Traffic Sign Recognition Benchmark (GTSRB)
Ảnh biển báo giao thông tại Đức thuộc 43 lớp, được thu thập từ các chuỗi video thực tế và cắt thành từng ảnh biển báo riêng lẻ.
51.840 ảnh; 43 lớp
Phân loại biển báo giao thông
2011
German Traffic Sign Detection Benchmark (GTSDB)
Ảnh cảnh đường phố tại Đức với các biển báo giao thông được đánh dấu bằng hộp giới hạn.
900 ảnh
Phát hiện biển báo giao thông
2013
Daimler Monocular Pedestrian Detection
Ảnh chụp từ camera đơn trên xe chạy trong môi trường đô thị, với vị trí người đi bộ được đánh dấu bằng hộp giới hạn.
Hàng chục nghìn mẫu huấn luyện; hơn 21.000 ảnh kiểm tra
Phát hiện người đi bộ
2009
CamVid
Các frame từ video quay khi lái xe ở Cambridge, với từng pixel được gán một trong 32 lớp ngữ nghĩa như đường xá, xe cộ, người đi bộ và công trình.
Hơn 700 frame được gán nhãn
Phân vùng ngữ nghĩa cảnh đường phố
2009
Cityscapes
Ảnh đường phố được trích từ các chuỗi video stereo được ghi lại tại 50 thành phố, với nhãn ngữ nghĩa và nhãn thực thể cho từng pixel.
Ảnh đường phố thu từ camera trên xe, với hộp giới hạn và trạng thái hoạt động của từng đèn tín hiệu giao thông.
13.427 ảnh; khoảng 24.000 đèn tín hiệu được gán nhãn
Phát hiện đèn tín hiệu; phân loại trạng thái đèn
2017
RailSem19
Các frame nhìn từ buồng lái tàu hỏa và tàu điện, được gán nhãn cho mỗi pixel cho cảnh đường sắt và các đối tượng liên quan.
8.500 frame được chú thích
Phân vùng ngữ nghĩa cảnh đường sắt
2019
RAWPED
Ảnh đường sắt ghi từ phương tiện chạy trên đường ray, với người đi bộ được đánh dấu bằng hộp giới hạn.
26.000 ảnh
Phát hiện người đi bộ trên đường sắt
2020
FRSign
Ảnh chụp từ tàu đang vận hành tại Pháp, với hộp giới hạn và trạng thái của các đèn tín hiệu đường sắt.
Hơn 100.000 ảnh trong phần dữ liệu được công bố
Phát hiện tín hiệu đường sắt; phân loại trạng thái tín hiệu
2020
GERALD
Ảnh cảnh đường sắt tại Đức với các tín hiệu đường sắt chính tuyến và các biển báo liên quan được gán hộp giới hạn.
5.000 ảnh; 33.554 đối tượng được gán nhãn
Phát hiện tín hiệu đường sắt
2023
RailFOD23
Ảnh các vật thể lạ xuất hiện trên hệ thống truyền tải điện đường sắt, gồm túi nhựa, các vật thể trong không trung, tổ chim và bóng bay.
14.615 ảnh; 40.541 đối tượng được gán nhãn
Phát hiện vật thể lạ
2024
Robot và thao tác vật thể
Bộ dữ liệu
Mô tả
Quy mô
Tác vụ
Năm
Nguồn
Cornell Grasping Dataset
Ảnh RGB-D (D cho độ sâu) của các vật thể, trong đó mỗi vật thể được chú thích bằng nhiều cách gắp khả thi và không khả thi. Một tư thế gắp được biểu diễn bằng hình chữ nhật có hướng trên ảnh, tương ứng với vị trí và hướng của kẹp robot.
885 ảnh RGB-D; 240 vật thể; 8.019 tư thế gắp được chú thích
Phát hiện tư thế gắp
2011
Jacquard
Bộ dữ liệu tổng hợp được tạo từ các mô hình vật thể 3D, cung cấp ảnh RGB, ảnh độ sâu và mặt nạ phân vùng của từng cảnh. Các tư thế gắp khả thi được xác định bằng mô phỏng và biểu diễn trên mặt phẳng ảnh.
54.485 cảnh; 11.619 vật thể; 4.967.454 chú thích tư thế gắp
Phát hiện tư thế gắp
2018
Khác
Bộ dữ liệu
Mô tả
Quy mô
Tác vụ
Năm
Nguồn
FAMOS
Ảnh hiển vi của 5.000 vi cấu trúc vật lý riêng biệt; mỗi mẫu được chụp nhiều lần bằng hai camera khác nhau để nghiên cứu khả năng xác thực dựa trên các đặc trưng vật lý khó sao chép.
30.000 ảnh; 5.000 mẫu
Xác thực; nhận dạng mẫu
2012
PharmaPack
Ảnh bao bì dược phẩm thuộc 1.000 sản phẩm khác nhau, được chụp trong nhiều điều kiện và góc nhìn để phân biệt các bao bì có hình thức tương tự nhau.
54.000 ảnh; 1.000 lớp
Phân loại sản phẩm; nhận dạng bao bì dược phẩm
2017
MCQ Dataset
Ảnh phiếu trả lời của sáu bài kiểm tra trắc nghiệm thực tế, kèm vị trí và nhãn của các ô trả lời để đánh giá các hệ thống chấm bài tự động bằng thị giác máy tính.
735 phiếu trả lời; 33.540 ô trả lời
Nhận dạng đáp án; chấm bài trắc nghiệm tự động
2017
Dữ liệu video
Hành động và hoạt động của con người
Bộ dữ liệu
Mô tả
Quy mô
Tác vụ
Năm
Nguồn
HMDB51
Các đoạn video ngắn về chuyển động và hành động của con người, được thu thập từ phim, video trên Internet và nhiều nguồn khác.
6.766 đoạn video; 51 lớp hành động
Nhận dạng hành động
2011
UCF101
Các đoạn video thực tế được thu thập từ YouTube, bao gồm nhiều loại hành động của con người như thể thao, tương tác với đồ vật và tương tác giữa người với người.
13.320 đoạn video; 101 lớp hành động; khoảng 27 giờ video
Nhận dạng hành động
2012
MPII Cooking Activities
Video quay các hoạt động nấu ăn trong nhà bếp. Các thao tác được chú thích theo từng khoảng thời gian, cho phép xác định những hành động cụ thể.
44 video; 65 lớp hoạt động; 881.755 frame
Nhận dạng hành động; xác định hành động theo thời gian
2012
ActivityNet
Video chưa được cắt thành các đoạn hành động riêng, bao gồm nhiều hoạt động phức tạp trong đời sống thường ngày. Các khoảng thời gian chứa hoạt động được chú thích trong từng video.
Khoảng 20.000 video; 200 lớp hoạt động; hơn 600 giờ video
Phân loại hoạt động; xác định hoạt động theo thời gian
2015
Charades
Video do người tham gia tự quay tại nhà khi thực hiện các hoạt động thường ngày. Mỗi video có thể chứa nhiều hành động đồng thời hoặc nối tiếp nhau, kèm mô tả bằng ngôn ngữ tự nhiên và khoảng thời gian của từng hành động.
9.848 video; 157 lớp hành động; 66.500 khoảng hành động được chú thích
Nhận dạng nhiều hành động; xác định hành động theo thời gian
2016
Kinetics-400
Các đoạn video khoảng 10 giây từ YouTube, tập trung vào hành động của con người và bao gồm cả tương tác với đồ vật lẫn tương tác giữa người với người.
Khoảng 300.000 đoạn video; 400 lớp hành động
Nhận dạng hành động
2017
Something-Something
Video ngắn quay người thực hiện các tương tác đơn giản với đồ vật. Nhãn được xây dựng để phân biệt các hành động có hình ảnh tĩnh tương tự nhau nhưng khác về chuyển động hoặc quan hệ theo thời gian, chẳng hạn đặt vật lên trên hoặc lấy vật ra khỏi vật khác.
Hơn 100.000 video; 174 lớp trong phiên bản đầu
Nhận dạng hành động; hiểu tương tác người–vật
2017
AVA
Các đoạn phim dài được chú thích cho nhiều hành động cơ bản của từng người. Tại các thời điểm được lấy mẫu, mỗi người được đánh dấu bằng hộp giới hạn và có thể mang đồng thời nhiều nhãn hành động.
430 đoạn video dài 15 phút; 80 lớp hành động; khoảng 1,58 triệu nhãn hành động
Phát hiện hành động trong không gian và thời gian; nhận dạng nhiều hành động
2018
HAA500
Các đoạn video được chọn và chú thích thủ công để biểu diễn 500 hành động tương đối cụ thể của con người, bao gồm thể thao, sinh hoạt thường ngày và tương tác với đồ vật.
10.000 video; 500 lớp hành động; hơn 591.000 frame được gán nhãn
Video khuôn mặt thu thập trong các điều kiện tự nhiên, với sự thay đổi về tư thế đầu, ánh sáng, sự che khuất và biểu cảm. Mỗi frame được chú thích bằng hai giá trị liên tục biểu diễn mức độ tích cực–tiêu cực của cảm xúc và cường độ cảm xúc.
298 video; 200 người; hơn 30 giờ video
Ước lượng cảm xúc theo hai chiều valence–arousal
2017
Aff-Wild2
Bản mở rộng của Aff-Wild, gồm video khuôn mặt trong điều kiện tự nhiên và nhiều loại chú thích cảm xúc. Dữ liệu được chú thích theo biểu cảm rời rạc, hai chiều tích cực tiêu cực và cường độ, và các đơn vị hành động trên khuôn mặt.
Hơn 500 video; khoảng 2,8 triệu frame được chú thích
Nhận dạng biểu cảm; ước lượng valence–arousal; phát hiện đơn vị hành động khuôn mặt
2019
FERV39k
Các đoạn video khuôn mặt thu thập từ nhiều cảnh thực tế như phim ảnh, chương trình truyền hình và video trên Internet. Mỗi đoạn được gán một trong bảy biểu cảm cơ bản.
38.935 đoạn video; 7 lớp biểu cảm
Nhận dạng biểu cảm khuôn mặt trong video
2022
Giao thông
Bộ dữ liệu
Mô tả
Quy mô
Tác vụ
Năm
Nguồn
UA-DETRAC
Các video giao thông quay bằng camera cố định tại nhiều địa điểm, trong các điều kiện thời tiết và mật độ giao thông khác nhau. Phương tiện trong mỗi frame được đánh dấu bằng hộp giới hạn và mã định danh để có thể theo dõi chúng qua thời gian.
100 video; hơn 140.000 frame
Phát hiện phương tiện; theo dõi nhiều phương tiện
2020
CityFlow
Video với độ phân giải cao được đồng bộ từ nhiều camera giao thông tại các nút giao thông trong cùng một thành phố. Các phương tiện được theo dõi giữa nhiều camera, cho phép xác định cùng một phương tiện khi nó xuất hiện tại các vị trí khác nhau.
Hơn 3 giờ video; 40 camera tại 10 nút giao; hơn 200.000 hộp giới hạn
Theo dõi phương tiện qua nhiều camera; tái nhận dạng phương tiện
2019
BDD100K
Video quay từ camera phía trước của xe khi lưu thông trong nhiều thành phố, thời tiết và thời điểm trong ngày khác nhau. Bộ dữ liệu hỗ trợ nhiều loại chú thích, gồm phương tiện và người đi bộ, làn đường, vùng có thể lái xe và thông tin theo dõi đối tượng.
100.000 video, mỗi video dài khoảng 40 giây; hơn 100 triệu frame
Phát hiện và theo dõi đối tượng; phân vùng cảnh đường phố; phát hiện làn đường
2020
Video góc nhìn thứ nhất
Bộ dữ liệu
Mô tả
Quy mô
Tác vụ
Năm
Nguồn
EGTEA Gaze+
Video góc nhìn thứ nhất (egocentric) ghi lại các hoạt động nấu ăn của người tham gia. Ngoài video, bộ dữ liệu còn cung cấp vị trí ánh nhìn, nhãn hành động và mặt nạ bàn tay cho một số frame.
86 video; khoảng 28 giờ; 10.321 đoạn hành động; 106 lớp hành động
Nhận dạng và dự đoán hành động; dự đoán hướng nhìn
2018
EPIC-KITCHENS-100
Video góc nhìn thứ nhất ghi bằng camera đeo trên đầu khi người tham gia thực hiện các hoạt động thường ngày trong nhà bếp. Các đoạn hành động được chú thích bằng động từ và danh từ biểu thị thao tác và vật thể liên quan.
700 video; 100 giờ; khoảng 20 triệu frame; 89.977 đoạn hành động
Nhận dạng hành động; phát hiện hành động theo thời gian; dự đoán hành động sắp xảy ra
2020
Charades-Ego
Các cặp video quay cùng loại hoạt động trong nhà từ góc nhìn của người hành động và góc nhìn của người quan sát. Thiết kế này cho phép nghiên cứu mối liên hệ giữa cách một hành động xuất hiện đối với người thực hiện và đối với người quan sát bên ngoài.
4.000 cặp video; 112 người; 157 lớp hành động
Nhận dạng hành động; chuyển giao giữa góc nhìn thứ nhất và góc nhìn người quan sát
2018
Ego4D
Video góc nhìn thứ nhất về các hoạt động thường ngày trong gia đình, nơi làm việc, hoạt động ngoài trời và giải trí, được thu thập tại nhiều quốc gia. Bộ dữ liệu cung cấp nhiều benchmark cho việc hiểu hoạt động, tương tác với vật thể và diễn biến của các sự kiện dài.
3.670 giờ video; 931 người đeo camera; 74 địa điểm tại 9 quốc gia
Nhận dạng và dự đoán hoạt động; tìm kiếm sự kiện trong video; hiểu tương tác người–vật
2022
Khác
Bộ dữ liệu
Mô tả
Quy mô
Tác vụ
Năm
Nguồn
DAVIS
Các chuỗi video Full HD về nhiều vật thể và cảnh khác nhau, bao gồm các trường hợp bị che khuất, nhòe do chuyển động và thay đổi hình dạng. Mỗi frame có mặt nạ phân vùng thủ công cho vật thể cần theo dõi.
50 video trong phiên bản đầu
Phân vùng vật thể trong video
2016
YouTube-8M
Video YouTube thuộc nhiều chủ đề khác nhau, được gán đồng thời nhiều nhãn mô tả nội dung như vật thể, hoạt động và địa điểm. Bộ dữ liệu cũng cung cấp các đặc trưng hình ảnh và âm thanh được trích sẵn từ video.
Khoảng 8 triệu video; khoảng 500.000 giờ video; hơn 4.800 nhãn trong phiên bản đầu
Phân loại video đa nhãn
2016
LIRIS-ACCEDE
Các đoạn phim được chú thích theo mức độ tích cực–tiêu cực của cảm xúc và cường độ cảm xúc mà nội dung video gây ra cho người xem. Khác với các bộ nhận dạng biểu cảm khuôn mặt, nhãn ở đây mô tả cảm xúc do toàn bộ nội dung video gợi ra.
9.800 đoạn video trong bộ rời rạc; khoảng 27 giờ video
Phân tích cảm xúc do nội dung video gợi ra
2015
YouTube-VOS
Video YouTube chứa nhiều loại vật thể và hoạt động, trong đó các vật thể được chú thích bằng mặt nạ phân vùng qua nhiều frame liên tiếp. Tập kiểm tra còn chứa các loại vật thể không xuất hiện trong tập huấn luyện để đánh giá khả năng khái quát sang lớp mới.
3.252 video trong phiên bản công bố ban đầu; 78 loại vật thể; 133.886 chú thích vật thể
Phân vùng vật thể trong video
2018
Dữ liệu 3D và đám mây điểm (point cloud)
Vật thể 3D
Bộ dữ liệu
Mô tả
Quy mô
Tác vụ
Năm
Nguồn
ModelNet
Các mô hình CAD 3D của những vật thể thông dụng trong nhà, được tổ chức theo lớp vật thể. Hai tập con ModelNet10 và ModelNet40 thường được dùng làm benchmark.
12.311 mô hình trong ModelNet40; 40 lớp
Phân loại vật thể 3D; truy hồi mô hình 3D
2015
ShapeNet
Các mô hình CAD 3D thuộc nhiều loại vật thể, được tổ chức theo hệ thống phân loại của WordNet. Nhiều mô hình còn có các chú thích về bộ phận, kích thước, hướng chuẩn và các thuộc tính hình học khác.
Hơn 3 triệu mô hình được lập chỉ mục; khoảng 220.000 mô hình được phân loại vào 3.135 lớp tại thời điểm công bố
Phân loại vật thể 3D; phân vùng bộ phận; truy hồi và tái tạo hình dạng 3D
2015
ShapeNetPart
Tập con của ShapeNet trong đó các mô hình vật thể được chú thích theo từng bộ phận cấu thành, chẳng hạn cánh máy bay, chân ghế hoặc tay cầm.
16.881 mô hình; 16 lớp vật thể; 50 loại bộ phận
Phân vùng bộ phận của vật thể 3D
2016
ABC
Các mô hình CAD của các vật thể cơ khí được thu thập từ các tệp thiết kế tham số, kèm các bề mặt và đường cong hình học chính xác thay vì chỉ lưới tam giác xấp xỉ.
Hơn 1 triệu mô hình CAD
Tái tạo bề mặt; phân vùng hình học; học biểu diễn hình dạng 3D
2019
OmniObject3D
Các vật thể đời thường thực được quét ở độ phân giải cao. Mỗi vật thể có mô hình lưới có kết cấu, đám mây điểm và nhiều góc quan sát, thay vì chỉ sử dụng các mô hình CAD tổng hợp.
6.000 vật thể; 190 lớp
Phân loại vật thể 3D; tái tạo vật thể; sinh mô hình 3D
2023
Khuôn mặt 3D
Bộ dữ liệu
Mô tả
Quy mô
Tác vụ
Năm
Nguồn
Face Recognition Grand Challenge (FRGC) v2.0
Ảnh khuôn mặt độ phân giải cao và các bản quét khuôn mặt 3D được thu thập trong nhiều phiên chụp. Phần dữ liệu 3D gồm bề mặt khuôn mặt và ảnh màu tương ứng.
4.950 bản quét 3D; 466 người
Nhận dạng và xác minh khuôn mặt 3D
2005
BU-3DFE
Các mô hình khuôn mặt 3D có kết cấu của 100 người, gồm biểu cảm trung tính và sáu biểu cảm cơ bản ở nhiều mức cường độ khác nhau.
2.500 mô hình khuôn mặt; 100 người; 6 biểu cảm cơ bản
Nhận dạng biểu cảm khuôn mặt 3D
2006
Bosphorus
Các bản quét khuôn mặt 3D có kết cấu, được thu thập với nhiều biểu cảm, góc quay đầu và dạng che khuất như kính mắt, tóc hoặc bàn tay.
4.666 bản quét; 105 người
Nhận dạng khuôn mặt 3D; nhận dạng biểu cảm; đánh giá khả năng chống che khuất và thay đổi tư thế
2008
FaceScape
Các mô hình khuôn mặt 3D có kết cấu và độ chi tiết cao, trong đó mỗi người được quét với nhiều biểu cảm. Các mô hình được xử lý để có cấu trúc lưới thống nhất, phục vụ việc tái tạo và mô hình hóa khuôn mặt 3D.
18.760 mô hình khuôn mặt; 938 người; 20 biểu cảm
Tái tạo khuôn mặt 3D; mô hình hóa hình dạng và biểu cảm khuôn mặt
2020
Giao thông
Bộ dữ liệu
Mô tả
Quy mô
Tác vụ
Năm
Nguồn
SemanticKITTI
Các chuỗi đám mây điểm LiDAR 360° từ KITTI Vision Odometry Benchmark, trong đó mỗi điểm được gán nhãn ngữ nghĩa cho các thành phần của cảnh giao thông như đường, xe, người và thảm thực vật.
22 chuỗi; hơn 43.000 lần quét LiDAR
Phân vùng ngữ nghĩa đám mây điểm; phân vùng theo chuỗi thời gian
2019
Rail3D
Đám mây điểm LiDAR của các tuyến đường sắt tại Hungary, Pháp và Bỉ, được gán nhãn cho các vật thể như đường ray, cột điện, dây điện, hàng rào và công trình.
Khoảng 288 triệu điểm; khoảng 5,8 km đường sắt; 9 lớp
Phân vùng ngữ nghĩa đám mây điểm đường sắt
2024
WHU-Railway3D
Đám mây điểm LiDAR đường sắt tại Trung Quốc, bao gồm môi trường đô thị, nông thôn và cao nguyên, với nhãn cho từng điểm cùng các thuộc tính như cường độ phản xạ và góc quét.
Khoảng 4,6 tỷ điểm; khoảng 30 km; 11 lớp
Phân vùng ngữ nghĩa đám mây điểm đường sắt
2024
Nhận dạng tư thế 6D và tư thế gắp của vật cho robot
LINEMOD
Ảnh RGB-D của các vật thể trong cảnh có nhiều vật cản, kèm mô hình 3D và tư thế thực của từng vật thể. Bộ dữ liệu được dùng rộng rãi để đánh giá khả năng xác định vị trí và hướng của vật thể trong không gian.
13 vật thể; 13 chuỗi
Nhận dạng tư thế 6D của vật thể
2012
T-LESS
Ảnh RGB-D của các vật thể công nghiệp hầu như không có hoa văn bề mặt, nhiều vật thể có hình dạng tương tự hoặc đối xứng. Bộ dữ liệu còn cung cấp mô hình CAD và mô hình 3D tái tạo cho từng vật thể.
30 vật thể; khoảng 39.000 ảnh huấn luyện và 10.000 ảnh kiểm tra cho mỗi cảm biến
Phát hiện vật thể; nhận dạng tư thế 6D của vật thể
2017
YCB-Video
Các chuỗi video RGB-D chứa những vật thể gia dụng thuộc bộ YCB trong các cảnh có nhiều vật thể và che khuất. Mỗi frame được chú thích tư thế 6D của các vật thể xuất hiện trong ảnh.
92 video; 133.827 frame; 21 vật thể
Nhận dạng và theo dõi tư thế 6D của vật thể
2018
HOPE
Ảnh RGB-D của các vật thể mô phỏng sản phẩm tạp hóa trong môi trường gia đình và văn phòng, kèm mô hình 3D có kết cấu và tư thế 6D. Các cảnh được thiết kế với nhiều mức che khuất, ánh sáng và số lượng vật thể khác nhau.
28 vật thể; 50 cảnh trong 10 môi trường
Nhận dạng tư thế 6D của vật thể
2022
GraspNet-1Billion
Các cảnh RGB-D chứa nhiều vật thể gia dụng, kèm mô hình lưới 3D và hơn một tỷ tư thế gắp khả thi trong không gian 3D. Bộ dữ liệu được thiết kế để đánh giá trực tiếp việc chọn vị trí gắp và hướng tiếp cận vật thể của bàn tay robot trong khung cảnh lộn xộn.
97.280 ảnh RGB-D; 88 vật thể; hơn 1 tỷ tư thế gắp
Phát hiện tư thế gắp 6D
2020
Cảnh vật
Bộ dữ liệu
Mô tả
Quy mô
Tác vụ
Năm
Nguồn
S3DIS
Đám mây điểm màu của các không gian trong nhà tại sáu khu vực thuộc ba tòa nhà, gồm văn phòng, hành lang, phòng hội nghị và nhiều loại phòng khác. Mỗi điểm trong không gian được gán một nhãn ngữ nghĩa như tường, sàn, bàn, ghế hoặc cửa.
6 khu vực; 272 phòng
Phân vùng ngữ nghĩa đám mây điểm trong nhà
2016
ScanNet
Các chuỗi RGB-D quay trong nhiều không gian trong nhà, được tái dựng thành mô hình bề mặt 3D. Dữ liệu kèm tư thế và vị trí của camera, thông tin hình học 3D và nhãn ngữ nghĩa cho các vật thể trong cảnh.
1.513 cảnh; khoảng 2,5 triệu frame RGB-D
Tái dựng cảnh 3D; phân vùng ngữ nghĩa và phân vùng thực thể
2017
Matterport3D
Các không gian trong nhà quy mô toàn tòa nhà được ghi bằng camera RGB-D toàn cảnh. Bộ dữ liệu cung cấp ảnh RGB-D, mô hình bề mặt 3D, tư thế camera và nhãn ngữ nghĩa cho cả biểu diễn 2D lẫn 3D.
Các đám mây điểm dày đặc được thu bằng máy quét laser mặt đất tại nhiều cảnh ngoài trời như đường phố, quảng trường, làng, đường sắt, sân thể thao và khu vực quanh các công trình. Mỗi điểm trong khung cảnh cũng được gán một trong tám lớp ngữ nghĩa.
Hơn 4 tỷ điểm; 8 lớp
Phân vùng ngữ nghĩa đám mây điểm ngoài trời
2017
Dữ liệu văn bản
Phân tích cảm xúc từ các bài đánh giá
Bộ dữ liệu
Mô tả
Quy mô
Tác vụ
Năm
Nguồn
Large Movie Review Dataset (IMDb)
Các bài đánh giá phim trên IMDb, được gán nhãn tích cực hoặc tiêu cực dựa trên điểm đánh giá. Dữ liệu còn gồm các bài đánh giá chưa gán nhãn.
50.000 bài đánh giá có nhãn; 50.000 bài chưa gán nhãn
Phân tích cảm xúc
2011
Stanford Sentiment Treebank
Các câu trích từ bài đánh giá phim, trong đó cả câu hoàn chỉnh và các cụm từ cấu thành câu đều được gán nhãn cảm xúc. Nhãn cho phép phân biệt nhiều mức cảm xúc của người dùng từ rất tiêu cực đến rất tích cực.
11.855 câu; 215.154 cụm từ được gán nhãn
Phân tích cảm xúc; phân tích cảm xúc theo thành phần câu
2013
Sentiment Labeled Sentences
Các câu ngắn từ bài đánh giá trên IMDb, Amazon và Yelp, được gán nhãn tích cực hoặc tiêu cực bằng tay.
3.000 câu; 1.000 câu từ mỗi nguồn
Phân tích cảm xúc
2015
Yelp Review Polarity
Các bài đánh giá doanh nghiệp trên Yelp, trong đó đánh giá 1–2 sao được gán nhãn tiêu cực và 4–5 sao được gán nhãn tích cực.
Các bản tin tiếng Anh của Reuters được gán nhãn một hoặc nhiều chủ đề như kinh tế, hàng hóa và doanh nghiệp. Bộ dữ liệu có nhiều cách chia tập; trong đó chia theo mốc thời gian xuất bản bài báo ModApte thường được sử dụng trong nghiên cứu phân loại văn bản.
21.578 văn bản
Phân loại chủ đề; phân loại đa nhãn
1997
Reuters Corpus Volume I (RCV1)
Kho bản tin Reuters bằng tiếng Anh trong khoảng một năm, được các biên tập viên Reuters gán thủ công nhiều loại nhãn về chủ đề, ngành kinh tế và khu vực địa lý.
806.791 bản tin
Phân loại chủ đề; phân loại đa nhãn
2004
AG News
Tiêu đề và phần mô tả ngắn của các bài báo được thu thập từ hơn 2.000 nguồn tin. Phiên bản benchmark sử dụng bốn chủ đề lớn: tin tức thế giới, thể thao, kinh doanh và khoa học–công nghệ.
120.000 mẫu huấn luyện; 7.600 mẫu kiểm tra; 4 lớp
Phân loại chủ đề
2015
Sogou News
Các bài báo tiếng Trung từ các kho tin tức SogouCA và SogouCS. Phiên bản benchmark sử dụng tiêu đề và nội dung bài báo thuộc năm chủ đề.
Các bài báo từ CNN và Daily Mail cùng phần điểm tin chính do tòa soạn cung cấp. Các điểm tin được sử dụng làm bản tóm tắt tham chiếu cho bài báo.
Khoảng 312.000 cặp bài báo–tóm tắt
Tóm tắt văn bản
2015
XSum
Các bài báo trực tuyến của BBC đi kèm một câu tóm tắt ngắn do người viết bài cung cấp. Bộ dữ liệu được thiết kế để tóm tắt toàn bộ nội dung bài báo thành một câu súc tích thay vì chỉ trích lại các câu có sẵn trong bài.
226.711 bài báo
Tóm tắt văn bản
2018
Multi-News
Các cụm bài báo từ nhiều nguồn cùng đề cập đến một sự kiện hoặc chủ đề, đi kèm một bản tóm tắt chung do con người viết.
56.216 cặp cụm tài liệu–tóm tắt
Tóm tắt nhiều văn bản
2019
Thư điện tử và tin nhắn
Bộ dữ liệu
Mô tả
Quy mô
Tác vụ
Năm
Nguồn
Enron Corpus
Kho thư điện tử của các nhân viên từ công ty Enron được công khai trong quá trình điều tra pháp lý đối với công ty. Dữ liệu gồm nội dung thư, người gửi, người nhận và cấu trúc thư mục thư điện tử. Bộ dữ liệu này đã được sử dụng cho nhiều bài toán như phân loại, truy hồi thông tin và phân tích giao tiếp.
619.446 thư điện tử trong kho dữ liệu gốc; 158 người dùng
Phân loại và truy hồi thư điện tử; phân tích giao tiếp
2004
Ling-Spam
Thư hợp lệ từ một danh sách thư điện tử về ngôn ngữ học được kết hợp với thư rác nhận được bởi những người tạo bộ dữ liệu. Bộ dữ liệu được cung cấp dưới nhiều phiên bản khác nhau tùy theo việc có áp dụng danh sách từ dừng và chuẩn hóa thành từ gốc (như bỏ phụ tố -ing, -ed, -zation, etc.) hay không.
2.893 thư; 2.412 thư hợp lệ và 481 thư rác
Phát hiện thư rác
2000
SMS Spam Collection
Các tin nhắn SMS thực được tổng hợp từ nhiều nguồn và gán nhãn thành tin nhắn hợp lệ hoặc thư rác. Nội dung được giữ ở dạng văn bản thô thay vì chỉ cung cấp các đặc trưng đã trích xuất.
5.574 tin nhắn; 4.827 hợp lệ và 747 thư rác
Phát hiện tin nhắn rác
2011
NUS SMS Corpus
Kho tin nhắn SMS được thu thập từ người dùng điện thoại di động, chủ yếu tại Singapore. Không giống SMS Spam Collection, dữ liệu không được xây dựng riêng cho bài toán phát hiện tin nhắn rác mà phản ánh giao tiếp SMS thông thường.
67.093 tin nhắn trong phiên bản năm 2015
Mô hình hóa ngôn ngữ; phân tích ngôn ngữ trong tin nhắn
2013
Mạng xã hội và diễn đàn trực tuyến
Bộ dữ liệu
Mô tả
Quy mô
Tác vụ
Năm
Nguồn
Twenty Newsgroups
Các bài đăng trên 20 nhóm thảo luận Usenet về những chủ đề như máy tính, khoa học, thể thao, chính trị và tôn giáo. Các nhóm có số lượng bài tương đối cân bằng và thường được dùng làm benchmark phân loại văn bản.
Khoảng 20.000 bài đăng; 20 nhóm
Phân loại chủ đề
1995
Sentiment140
Các bài đăng Twitter bằng tiếng Anh được gán nhãn cảm xúc tự động dựa trên biểu tượng cảm xúc có trong bài đăng. Biểu tượng dùng để tạo nhãn sau đó được loại khỏi nội dung để mô hình không thể dự đoán trực tiếp từ chúng.
Khoảng 1,6 triệu bài đăng
Phân tích cảm xúc
2009
OLID
Các bài đăng Twitter tiếng Anh được chú thích theo ba tầng: có hay không có ngôn ngữ xúc phạm; nếu có, loại nội dung xúc phạm và đối tượng mà nội dung đó hướng tới.
14.200 bài đăng
Phát hiện và phân loại ngôn ngữ xúc phạm; xác định đối tượng bị nhắm tới
2019
UIT-VSMEC
Các bình luận tiếng Việt trên mạng xã hội được gán một trong bảy nhãn cảm xúc gồm vui vẻ, buồn bã, tức giận, ngạc nhiên, sợ hãi, ghê tởm và khác.
6.927 bình luận; 7 lớp cảm xúc
Nhận dạng cảm xúc
2020
TweetEval
Bộ benchmark tổng hợp các tập dữ liệu Twitter đã có trước đó và chuẩn hóa chúng thành bảy tác vụ phân loại với cùng cách đánh giá, gồm phân tích cảm xúc, nhận dạng cảm xúc, phát hiện ngôn ngữ thù ghét, ngôn ngữ xúc phạm, mỉa mai, dự đoán emoji và xác định lập trường của người đăng.
7 tác vụ
Phân tích cảm xúc; nhận dạng cảm xúc; phát hiện ngôn ngữ thù ghét và xúc phạm; phát hiện mỉa mai; xác định lập trường
2020
Pushshift Reddit
Kho lưu trữ quy mô lớn các bài đăng và bình luận công khai trên Reddit, bao phủ dữ liệu lịch sử từ khi nền tảng được thành lập. Dữ liệu giữ cả nội dung văn bản cùng thông tin về subreddit, người dùng, thời gian và cấu trúc thảo luận.
Hàng tỷ bài đăng và bình luận
Phân tích mạng xã hội; xử lý ngôn ngữ tự nhiên; nghiên cứu cộng đồng trực tuyến
2020
HateXplain
Các bài đăng từ Twitter và Reddit được chú thích theo ba lớp bao gồm ngôn ngữ thù ghét, nội dung xúc phạm và bình thường. Mỗi mẫu còn có nhãn về nhóm bị nhắm tới và những từ hoặc cụm từ mà người chú thích sử dụng để giải thích quyết định của mình.
Hơn 20.000 bài đăng
Phát hiện ngôn ngữ thù ghét và xúc phạm; giải thích dự đoán
2021
Hỏi đáp và đọc hiểu
Bộ dữ liệu
Mô tả
Quy mô
Tác vụ
Năm
Nguồn
TREC Question Classification
Các câu hỏi tiếng Anh được gán nhãn theo loại câu trả lời cần tìm, chẳng hạn người, địa điểm, số lượng hoặc thực thể. Bộ dữ liệu thường được dùng để đánh giá khả năng phân loại câu hỏi trước bước tìm câu trả lời.
5.500 câu huấn luyện; 500 câu kiểm tra; 6 lớp lớn và 50 lớp con
Phân loại câu hỏi theo cả nhãn lớn và nhãn con
2002
SQuAD
Các đoạn văn lấy từ Wikipedia kèm các câu hỏi do người tham gia đặt dựa trên nội dung đoạn văn. Trong phiên bản đầu, câu trả lời cho mỗi câu hỏi là một đoạn văn bản tiếp theo sau đoạn văn đó.
107.785 cặp câu hỏi–câu trả lời từ 536 bài viết Wikipedia
Đọc hiểu; trích xuất câu trả lời
2016
RACE
Các đoạn văn và câu hỏi trắc nghiệm lấy từ các kỳ thi tiếng Anh dành cho học sinhtrung học cơ sở và trung học phổ thông tại Trung Quốc. Nhiều câu hỏi yêu cầu suy luận từ nội dung thay vì chỉ tìm một cụm từ xuất hiện trực tiếp trong đoạn văn.
27.933 đoạn văn; 97.687 câu hỏi
Đọc hiểu trắc nghiệm
2017
HotpotQA
Các câu hỏi dựa trên Wikipedia được thiết kế để cần kết hợp thông tin từ nhiều tài liệu hoặc nhiều câu khác nhau. Ngoài câu trả lời, bộ dữ liệu còn cung cấp các câu làm bằng chứng để hỗ trợ cho quá trình suy luận của mô hình.
Khoảng 113.000 cặp câu hỏi–câu trả lời
Hỏi đáp nhiều bước; đọc hiểu; xác định bằng chứng
2018
Natural Questions
Các truy vấn tìm kiếm thực của người dùng Google đã được ẩn danh hóa, mỗi câu hỏi đi kèm một trang Wikipedia từ các kết quả tìm kiếm hàng đầu. Mỗi trang được gán nhãn để xác định câu trả lời dài, câu trả lời ngắn hoặc cho biết trang không chứa câu trả lời.
307.373 mẫu huấn luyện; 7.830 mẫu phát triển
Hỏi đáp; đọc hiểu; xác định câu trả lời ngắn và dài
2019
Suy luận ngôn ngữ
Bộ dữ liệu
Mô tả
Quy mô
Tác vụ
Năm
Nguồn
SNLI
Các cặp câu tiếng Anh gồm một câu tiền đề và một câu giả thuyết, được gán một trong ba nhãn: suy ra, mâu thuẫn hoặc trung lập. Các câu tiền đề bắt nguồn từ chú thích ảnh.
Khoảng 570.000 cặp câu
Suy luận ngôn ngữ tự nhiên
2015
MultiNLI
Các cặp câu tiếng Anh gồm một câu tiền đề và một câu giả thuyết, được gán một trong ba nhãn: suy ra, mâu thuẫn hoặc trung lập. Văn bản được lấy từ nhiều thể loại nói và viết như hội thoại, thư từ, báo chí, tiểu thuyết và văn bản chính phủ.
Khoảng 433.000 cặp câu; 10 thể loại
Suy luận ngôn ngữ tự nhiên; đánh giá khả năng khái quát giữa các thể loại văn bản
2018
XNLI
Các cặp câu tiền đề–giả thuyết từ MultiNLI được dịch sang 15 ngôn ngữ và giữ cùng ba nhãn: suy ra, mâu thuẫn hoặc trung lập.
7.500 cặp câu được gán nhãn bằng 15 ngôn ngữ trong tập đánh giá
Suy luận ngôn ngữ tự nhiên đa ngôn ngữ; chuyển giao giữa các ngôn ngữ
2018
ANLI
Các cặp câu tiền đề–giả thuyết được gán một trong ba nhãn: suy ra, mâu thuẫn hoặc trung lập. Dữ liệu được xây dựng qua nhiều vòng đối kháng, trong đó người tham gia tạo các ví dụ khiến mô hình hiện tại phân loại sai.
Hơn 160.000 cặp câu qua 3 vòng
Suy luận ngôn ngữ tự nhiên; đánh giá độ bền của mô hình
2020
Hội thoại
Bộ dữ liệu
Mô tả
Quy mô
Tác vụ
Năm
Nguồn
DailyDialog
Các đoạn hội thoại qua lại giữa hai người bằng tiếng Anh về những tình huống thường ngày như công việc, trường học, mua sắm và các mối quan hệ. Mỗi lượt lời được gán nhãn về mục đích giao tiếp và cảm xúc.
13.118 đoạn hội thoại
Sinh phản hồi hội thoại; nhận dạng mục đích giao tiếp và cảm xúc
2017
Persona-Chat
Các đoạn hội thoại giữa hai người, trong đó mỗi người được cung cấp một hồ sơ gồm một số câu mô tả đặc điểm và sở thích của nhân vật mà họ đóng vai. Nội dung hội thoại được xây dựng sao cho phù hợp với những thông tin trong hồ sơ này.
10.907 đoạn hội thoại
Sinh hội thoại; duy trì tính nhất quán của nhân vật
2018
MultiWOZ
Các đoạn hội thoại viết giữa người dùng và người đóng vai trợ lý, trong đó người dùng cần hoàn thành các tác vụ thuộc nhiều lĩnh vực như đặt khách sạn, tìm nhà hàng, đi tàu và đặt taxi. Một đoạn hội thoại có thể liên quan đến nhiều lĩnh vực khác nhau và đi kèm nhãn trạng thái hội thoại.
10.438 đoạn hội thoại; 7 lĩnh vực
Hội thoại hướng tác vụ; theo dõi trạng thái hội thoại; sinh phản hồi
2018
Taskmaster-1
Các đoạn hội thoại hướng tác vụ trong sáu lĩnh vực như đặt vé xem phim, nhà hàng, cà phê, đặt xe và sửa chữa ô tô. Bộ dữ liệu gồm cả hội thoại giữa hai người và hội thoại do một người tự viết theo cả hai vai để tạo ra các luồng hội thoại đa dạng hơn.
13.215 đoạn hội thoại; 6 lĩnh vực
Hội thoại hướng tác vụ; sinh phản hồi; hiểu yêu cầu người dùng
2019
Hội thoại và tinh chỉnh theo chỉ dẫn
Bộ dữ liệu
Mô tả
Quy mô
Tác vụ
Năm
Nguồn
Flan Collection
Tập hợp các bộ dữ liệu và mẫu hướng dẫn cho nhiều tác vụ xử lý ngôn ngữ tự nhiên, được chuyển về dạng đầu vào–đầu ra theo chỉ dẫn với các thiết lập không ví dụ, có ví dụ và chuỗi suy luận.
1.836 tác vụ trong Flan 2022
Tinh chỉnh theo chỉ dẫn; học đa tác vụ
2023
OpenAssistant Conversations (OASST1)
Các cây hội thoại nhiều lượt giữa người dùng và trợ lý do con người viết bằng nhiều ngôn ngữ, kèm các đánh giá chất lượng cho từng tin nhắn và phản hồi.
161.443 tin nhắn; 35 ngôn ngữ; hơn 10.000 cây hội thoại hoàn chỉnh
Tinh chỉnh theo chỉ dẫn; tinh chỉnh có giám sát; căn chỉnh mô hình ngôn ngữ
2023
UltraChat
Các đoạn hội thoại nhiều lượt giữa người dùng mô phỏng và trợ lý, được tạo tự động bằng các mô hình ngôn ngữ theo nhiều chủ đề và loại yêu cầu khác nhau mà không sử dụng truy vấn trực tiếp từ người dùng thật.
1,5 triệu đoạn hội thoại nhiều lượt
Tinh chỉnh theo chỉ dẫn; sinh hội thoại; tinh chỉnh chatbot
2023
LMSYS-Chat-1M
Các đoạn hội thoại thực tế giữa người dùng và 25 mô hình ngôn ngữ lớn được thu thập từ Vicuna demo và Chatbot Arena, kèm thông tin về mô hình, ngôn ngữ và nhãn kiểm duyệt nội dung.
1 triệu đoạn hội thoại; 25 mô hình ngôn ngữ lớn
Phân tích tương tác người–mô hình; tinh chỉnh theo chỉ dẫn; nghiên cứu an toàn mô hình
2024
WildChat
Các đoạn hội thoại thực tế giữa người dùng và ChatGPT được thu thập từ một dịch vụ chatbot công khai, bao phủ nhiều ngôn ngữ, chủ đề và dạng yêu cầu trong sử dụng thực tế.
Khoảng 1 triệu đoạn hội thoại; hơn 2,5 triệu lượt tương tác
Phân tích tương tác người–mô hình; tinh chỉnh và đánh giá chatbot; nghiên cứu an toàn mô hình
2024
Kiến thức, suy luận và đánh giá mô hình ngôn ngữ
Bộ dữ liệu
Mô tả
Quy mô
Tác vụ
Năm
Nguồn
MMLU
Các câu hỏi trắc nghiệm thuộc 57 môn và lĩnh vực kiến thức, bao gồm toán học, khoa học, lịch sử, khoa học máy tính, luật và nhiều lĩnh vực khác.
57 tác vụ; khoảng 16.000 câu hỏi
Đánh giá kiến thức đa lĩnh vực; giải câu hỏi trắc nghiệm
2021
GSM8K
Các bài toán có lời văn ở trình độ tiểu học, mỗi bài đi kèm lời giải bằng ngôn ngữ tự nhiên gồm nhiều bước suy luận và phép tính cơ bản.
8.500 bài toán
Suy luận toán học; giải bài toán có lời văn
2021
AI2 Reasoning Challenge (ARC)
Các câu hỏi khoa học trắc nghiệm lấy từ các kỳ thi ở bậc phổ thông, được chia thành tập Easy và Challenge; tập Challenge gồm các câu mà những phương pháp truy hồi và đồng xuất hiện từ đơn giản đều trả lời sai.
7.787 câu hỏi
Hỏi đáp khoa học; đánh giá kiến thức và suy luận
2018
HellaSwag
Các tình huống bằng ngôn ngữ tự nhiên kèm nhiều phương án tiếp diễn, trong đó mô hình phải chọn phương án hợp lý nhất. Các phương án sai được tạo và lọc theo quy trình đối kháng để khó phân biệt bằng các đặc trưng bề mặt.
Khoảng 70.000 mẫu
Suy luận thường thức; chọn phần tiếp diễn hợp lý
2019
TruthfulQA
Các câu hỏi thuộc 38 chủ đề được thiết kế xoay quanh những quan niệm sai hoặc niềm tin phổ biến có thể khiến người hoặc mô hình đưa ra câu trả lời không đúng sự thật.
817 câu hỏi; 38 chủ đề
Đánh giá tính đúng sự thật của câu trả lời; hỏi đáp
Các văn bản song song được trích từ biên bản của Nghị viện châu Âu, gồm các bản dịch chính thức giữa nhiều ngôn ngữ châu Âu.
Khoảng 30 triệu từ cho mỗi ngôn ngữ trong phiên bản ban đầu; 11 ngôn ngữ
Dịch máy song ngữ và đa ngữ
2005
IWSLT
Các văn bản song song được xây dựng chủ yếu từ bản ghi và bản dịch của các bài nói TED, với các cặp ngôn ngữ thay đổi theo từng chiến dịch đánh giá.
Thay đổi theo năm và cặp ngôn ngữ
Dịch máy; dịch lời nói
2004–
OPUS
Các văn bản song song được thu thập từ nhiều nguồn đã được dịch trên Internet, gồm phụ đề, tài liệu phần mềm và văn bản hành chính, rồi được căn chỉnh giữa nhiều ngôn ngữ.
Nhiều tập dữ liệu song song và hàng trăm ngôn ngữ; quy mô thay đổi theo phiên bản
Dịch máy song ngữ và đa ngữ
2004
WMT 2014
Dữ liệu song song và đơn ngữ dùng cho nhiệm vụ dịch máy của Workshop on Statistical Machine Translation năm 2014, với các cặp ngôn ngữ gồm tiếng Anh với tiếng Séc, Đức, Pháp, Hindi và Nga.
Quy mô thay đổi theo cặp ngôn ngữ; các thiết lập Anh–Đức và Anh–Pháp có hàng triệu cặp câu huấn luyện
Dịch máy; đánh giá hệ thống dịch máy
2014
OpenSubtitles2016
Các câu song song được trích và căn chỉnh từ phụ đề phim và chương trình truyền hình, nên chứa nhiều ngôn ngữ hội thoại và cách diễn đạt đời thường.
Khoảng 2,6 tỷ câu; 1.689 cặp văn bản song song; 60 ngôn ngữ
Các câu song song được khai thác tự động từ các trang webđa ngôn ngữ, bao phủ nhiều lĩnh vực và cặp ngôn ngữ.
Quy mô hàng tỷ cặp câu; thay đổi theo phiên bản và cặp ngôn ngữ
Huấn luyện dịch máy; khai thác và lọc câu song song
2020
OPUS-100
Các cặp câu song song lấy từ OPUS, được tổ chức thành tập dữ liệu đa ngôn ngữ lấy tiếng Anh làm trung tâm và giới hạn lượng dữ liệu tối đa cho mỗi cặp ngôn ngữ.
Khoảng 55 triệu cặp câu; 100 ngôn ngữ
Dịch máy đa ngữ; dịch giữa các cặp ngôn ngữ chưa xuất hiện trực tiếp trong dữ liệu huấn luyện
2020
FLORES-101
Các đoạn văn tham chiếu được dịch thủ công sang 101 ngôn ngữ, với cùng nội dung được căn chỉnh giữa các ngôn ngữ.
3.001 câu cho mỗi ngôn ngữ; 101 ngôn ngữ
Đánh giá dịch máy đa ngữ và ngôn ngữ ít tài nguyên
2021
FLORES-200
Các đoạn văn tham chiếu được dịch giữa hơn 200 ngôn ngữ, mở rộng FLORES-101 để hỗ trợ đánh giá nhất quán trên nhiều chiều dịch hơn.
Hơn 200 ngôn ngữ; hơn 40.000 chiều dịch có thể đánh giá
Đánh giá dịch máy đa ngữ và ngôn ngữ ít tài nguyên
2022
WikiMatrix
Các cặp câu song song được khai thác tự động từ các bài viết Wikipedia bằng biểu diễn câu đa ngôn ngữ, không giới hạn việc ghép các ngôn ngữ với tiếng Anh.
846.274 điều khoản; 12.608 loại nhãn trong tập dữ liệu đầy đủ
Phân loại điều khoản hợp đồng đa nhãn
2020
MultiEURLEX
Các văn bản pháp luật của Liên minh châu Âu được dịch chính thức sang nhiều ngôn ngữ và gán nhiều nhãn chủ đề theo EUROVOC. Bộ dữ liệu còn được chia theo thời gian để đánh giá ảnh hưởng của sự thay đổi nội dung pháp luật theo thời gian.
65.000 văn bản; 23 ngôn ngữ
Phân loại văn bản pháp lý đa ngôn ngữ và đa nhãn
2021
CUAD
Các hợp đồng thương mại tiếng Anh được các chuyên gia pháp lý đánh dấu những đoạn chứa các điều khoản quan trọng đối với quá trình rà soát hợp đồng, như quyền chấm dứt, miễn trừ trách nhiệm và điều khoản không cạnh tranh.
510 hợp đồng; hơn 13.000 chú thích; 41 loại điều khoản
Trích xuất và nhận dạng điều khoản hợp đồng
2021
ContractNLI
Các hợp đồng bảo mật được ghép với những phát biểu về nội dung hợp đồng. Mỗi phát biểu được xác định là được hợp đồng xác nhận, mâu thuẫn với hợp đồng hoặc không được đề cập; dữ liệu còn chỉ ra đoạn văn làm bằng chứng.
607 hợp đồng
Suy luận ngôn ngữ tự nhiên trên hợp đồng; xác định bằng chứng
2021
CaseHOLD
Các câu hỏi trắc nghiệm được xây dựng từ án lệ Hoa Kỳ. Mỗi mẫu gồm ngữ cảnh trích dẫn từ một phán quyết và năm phát biểu về kết luận pháp lý của vụ án được dẫn, trong đó một lựa chọn là phù hợp.
Hơn 53.000 câu hỏi
Đọc hiểu và suy luận trên án lệ
2021
LexGLUE
Bộ benchmark tập hợp nhiều bộ dữ liệu tiếng Anh thuộc các nguồn pháp lý khác nhau, gồm luật của Liên minh châu Âu, phán quyết của Tòa án Nhân quyền châu Âu, hợp đồng và án lệ Hoa Kỳ. Các tác vụ được chuẩn hóa để so sánh mô hình trên nhiều dạng hiểu văn bản pháp lý.
7 bộ dữ liệu
Phân loại văn bản; dự đoán phán quyết; phân loại điều khoản; suy luận và đọc hiểu pháp lý
2022
LegalBench
Bộ benchmark gồm nhiều tác vụ do các nhà nghiên cứu luật và máy học xây dựng hoặc chuẩn hóa để đánh giá nhiều dạng suy luận pháp lý, từ áp dụng quy tắc pháp luật đến giải thích hợp đồng và án lệ.
162 tác vụ từ 36 nguồn dữ liệu
Đánh giá suy luận pháp lý
2023
Tiền huấn luyện mô hình ngôn ngữ
Bộ dữ liệu
Mô tả
Quy mô
Tác vụ
Năm
Nguồn
BookCorpus
Văn bản tiếng Anh từ các sách hư cấu được xuất bản miễn phí trên Internet, gồm các đoạn văn liên tục từ nhiều thể loại.
Văn bản tiếng Anh từ các bài viết chất lượng cao trên Wikipedia, giữ lại phần lớn cấu trúc văn bản, dấu câu, chữ hoa và số.
Hơn 103 triệu từ
Mô hình hóa ngôn ngữ; dự đoán văn bản
2017
C4
Văn bản tiếng Anh được trích từ Common Crawl, sau đó được lọc và làm sạch để loại nội dung không phù hợp hoặc có chất lượng thấp.
Khoảng 750 GB văn bản tiếng Anh trong phiên bản ban đầu
Tiền huấn luyện mô hình ngôn ngữ; mô hình hóa ngôn ngữ
2020
The Pile
Văn bản tiếng Anh được tổng hợp từ 22 nguồn, gồm nội dung web, sách, bài báo khoa học, mã nguồn, văn bản pháp lý và Wikipedia.
825 GiB; 22 nguồn dữ liệu
Tiền huấn luyện và đánh giá mô hình ngôn ngữ
2021
OSCAR
Văn bản web đa ngôn ngữ được trích từ Common Crawl, sau đó được nhận dạng ngôn ngữ và lọc theo từng ngôn ngữ.
Hơn 150 ngôn ngữ; quy mô thay đổi theo phiên bản
Tiền huấn luyện mô hình ngôn ngữ đa ngữ; mô hình hóa ngôn ngữ
2019
RefinedWeb
Văn bản tiếng Anh được trích từ Common Crawl, sau đó được lọc và loại trùng để giữ lại dữ liệu web có chất lượng cao hơn.
Khoảng 5 nghìn tỷ token sau xử lý; 600 tỷ token được công bố
Tiền huấn luyện mô hình ngôn ngữ
2023
Dolma
Văn bản tiếng Anh được tổng hợp từ sáu nhóm nguồn, gồm nội dung web, bài báo khoa học, mã nguồn, sách thuộc phạm vi công cộng, mạng xã hội và tài liệu bách khoa.
3 nghìn tỷ token; hơn 4 tỷ tài liệu
Tiền huấn luyện mô hình ngôn ngữ
2024
FineWeb
Văn bản tiếng Anh được trích từ 96 bản lưu Common Crawl, sau đó được lọc, làm sạch và loại trùng; FineWeb-Edu là tập con được lọc để ưu tiên nội dung mang tính giáo dục.
15 nghìn tỷ token; FineWeb-Edu khoảng 1,3 nghìn tỷ token
Tiền huấn luyện mô hình ngôn ngữ
2024
RedPajama-V2
Văn bản web được trích từ 84 bản lưu Common Crawl bằng quy trình CCNet, kèm các tín hiệu về chất lượng và mức độ trùng lặp của từng tài liệu.
Hơn 100 tỷ tài liệu; 30 tỷ tài liệu có tín hiệu chất lượng; 20 tỷ tài liệu sau loại trùng
Tiền huấn luyện mô hình ngôn ngữ; nghiên cứu lọc và lựa chọn dữ liệu
2024
Khác
Bộ dữ liệu
Mô tả
Quy mô
Tác vụ
Năm
Nguồn
DBpedia Ontology
Văn bản được trích từ các bài viết Wikipedia thông qua DBpedia và chia thành các lớp theo hệ thống phân loại của DBpedia.
Bộ benchmark tập hợp nhiều bộ dữ liệu tiếng Anh để đánh giá khả năng hiểu ngôn ngữ trên các tác vụ như suy luận ngôn ngữ, mức độ tương đồng giữa câu và phân loại quan hệ giữa các câu.
9 tác vụ được tính vào điểm benchmark
Đánh giá khả năng hiểu ngôn ngữ tổng quát
2019
SuperGLUE
Bộ benchmark kế tiếp GLUE, tập hợp các tác vụ khó hơn về suy luận, đọc hiểu, phân giải đồng tham chiếu và hiểu nghĩa của từ trong ngữ cảnh.
8 tác vụ chính
Đánh giá khả năng hiểu và suy luận ngôn ngữ tổng quát
2019
Dữ liệu âm thanh
Tiếng nói
Bộ dữ liệu
Mô tả
Quy mô
Tác vụ
Năm
Nguồn
TIMIT
Các câu tiếng Anh được thu âm trong điều kiện kiểm soát từ người nói thuộc nhiều phương ngữ tại Hoa Kỳ. Dữ liệu kèm bản chép lời và nhãn ngữ âm được căn chỉnh với tín hiệu.
6.300 câu; 630 người nói
Nhận dạng tiếng nói; nhận dạng âm vị
1993
Switchboard
Các cuộc hội thoại điện thoại tự nhiên bằng tiếng Anh giữa những người tham gia được ghép cặp để thảo luận về các chủ đề được cho trước.
Khoảng 2.400 cuộc hội thoại; khoảng 260 giờ
Nhận dạng tiếng nói; mô hình hóa hội thoại nói
1992
LibriSpeech
Các bản đọc từ sách nói tiếng Anh được trích từ LibriVox và căn chỉnh với văn bản từ Dự án Gutenberg. Dữ liệu được chia thành các tập có mức độ nhiễu và độ khó khác nhau.
Khoảng 1.000 giờ tiếng nói; 2.484 người nói
Nhận dạng tiếng nói; tiền huấn luyện mô hình tiếng nói
2015
VoxCeleb
Các đoạn tiếng nói của người nổi tiếng được thu thập tự động từ video phỏng vấn và nội dung trực tuyến, với sự thay đổi lớn về tiếng ồn nền, thiết bị thu và môi trường.
Hơn 100.000 đoạn phát biểu từ 1.251 người trong VoxCeleb1; VoxCeleb2 mở rộng lên hơn 6.000 người
Nhận dạng và xác minh người nói
2017
Common Voice
Các đoạn tiếng nói do cộng đồng đóng góp và xác minh, trong đó người tham gia đọc các câu văn cho trước. Bộ dữ liệu bao phủ nhiều ngôn ngữ và được cập nhật qua nhiều phiên bản.
Hàng nghìn giờ tiếng nói; hơn 100 ngôn ngữ tùy phiên bản
Nhận dạng tiếng nói đa ngôn ngữ
2020
Libri-Light
Các bản sách nói tiếng Anh không gán nhãn được xây dựng từ LibriVox ở quy mô lớn hơn LibriSpeech, nhằm hỗ trợ học tự giám sát và học nửa giám sát cho tiếng nói.
Khoảng 60.000 giờ âm thanh chưa gán nhãn
Học tự giám sát; học nửa giám sát; nhận dạng tiếng nói
Các đoạn nhạc ngắn được gắn nhiều nhãn mô tả những đặc điểm như thể loại, loại nhạc cụ, tâm trạng và đặc tính âm thanh. Chúng được thu thập thông qua một trò chơi trực tuyến.
25.863 đoạn âm thanh; 188 thẻ
Gắn đa nhãn âm nhạc
2009
MedleyDB
Các bản nhạc hoàn chỉnh được cung cấp cùng các track âm thanh riêng của từng nhạc cụ hoặc giọng hát. Bộ dữ liệu còn có chú thích cao độ giai điệu và khoảng thời gian xuất hiện của từng nhạc cụ.
122 bài hát trong phiên bản đầu
Trích xuất giai điệu; nhận dạng nhạc cụ; tách nguồn âm thanh
2014
NSynth
Các bản ghi từng nốt nhạc riêng lẻ được tạo bởi nhiều nhạc cụ. Mỗi mẫu có thông tin về nhạc cụ, cao độ, vận tốc phím đàn và các đặc điểm âm sắc.
305.979 mẫu âm thanh; 1.006 nhạc cụ
Nhận dạng nhạc cụ; học biểu diễn và sinh âm thanh âm nhạc
2017
Free Music Archive
Các bản nhạc được phát hành theo giấy phép Creative Commons, kèm thông tin về nghệ sĩ, album, nhãn phân loại và hệ thống phân cấp thể loại. Bộ dữ liệu cung cấp cả bản ghi âm đầy đủ và các đặc trưng âm thanh đã trích sẵn.
106.574 bài hát; 16.341 nghệ sĩ; 161 thể loại trong hệ thống phân cấp
Phân loại thể loại; gắn nhãn và truy hồi âm nhạc
2017
MUSDB18
Các bản thu âm nhạc được tách thành bốn nguồn gồm giọng hát, trống, bass và phần nhạc còn lại; đồng thời cung cấp bản phối hoàn chỉnh của từng bài.
150 bài hát
Tách nguồn âm thanh âm nhạc
2017
Âm thanh môi trường
Bộ dữ liệu
Mô tả
Quy mô
Tác vụ
Năm
Nguồn
ESC-50
Các đoạn âm thanh ngắn về những âm thanh thường gặp trong môi trường, gồm tiếng động vật, hiện tượng tự nhiên, âm thanh của con người, âm thanh trong nhà và tiếng ồn đô thị.
2.000 đoạn âm thanh; 50 lớp
Phân loại âm thanh môi trường
2015
UrbanSound8K
Các đoạn âm thanh đô thị thực tế như tiếng còi xe, tiếng khoan, còi báo động, tiếng chó sủa và tiếng nhạc đường phố, được trích từ các bản ghi trên Freesound.
8.732 đoạn âm thanh; 10 lớp
Phân loại âm thanh đô thị
2014
TUT Acoustic Scenes 2017
Các bản ghi âm từ nhiều môi trường thực tế như nhà ở, văn phòng, công viên, trung tâm thành phố, cửa hàng, phương tiện công cộng và ga tàu điện. Các bản ghi dài được chia thành những đoạn 10 giây để phân loại môi trường nơi âm thanh được thu.
Khoảng 52 giờ âm thanh; 15 loại cảnh
Nhận dạng cảnh âm thanh
2017
AudioSet
Các đoạn âm thanh dài 10 giây được lấy từ video trên YouTube và gán một hoặc nhiều nhãn mô tả những sự kiện âm thanh xuất hiện, từ tiếng nói, âm nhạc và động vật đến máy móc và âm thanh môi trường.
Hơn 2 triệu đoạn âm thanh; 527 lớp
Phát hiện và phân loại sự kiện âm thanh đa nhãn
2017
FSD50K
Các đoạn âm thanh từ Freesound được gán thủ công một hoặc nhiều nhãn sự kiện âm thanh theo hệ thống lớp của AudioSet. Không giống AudioSet, các tệp âm thanh của FSD50K được phát hành trực tiếp theo giấy phép Creative Commons.
51.197 đoạn âm thanh; hơn 100 giờ; 200 lớp
Phân loại và phát hiện sự kiện âm thanh đa nhãn
2021
Tín hiệu và chuỗi thời gian
Y sinh
Bộ dữ liệu
Mô tả
Quy mô
Tác vụ
Năm
Nguồn
MIT-BIH Arrhythmia Database
Các bản ghi điện tâm đồ Holter hai kênh dài khoảng 30 phút, kèm chú thích vị trí và loại của từng nhịp tim.
48 bản ghi từ 47 người; khoảng 110.000 nhịp tim được chú thích
Phát hiện và phân loại rối loạn nhịp tim
1980
MIT-BIH Atrial Fibrillation Database
Các bản ghi điện tâm đồ Holter dài khoảng 10 giờ từ người có bệnh rung nhĩ kịch phát, với các khoảng rung nhĩ và nhịp tim được đánh dấu theo thời gian.
25 bản ghi dài; khoảng 250 giờ điện tâm đồ
Phát hiện rung nhĩ
1983
PTB-XL
Các bản ghi điện tâm đồ 12 chuyển đạo dài 10 giây từ bệnh nhân trong thực hành lâm sàng. Mỗi bản ghi có thể mang nhiều nhãn chẩn đoán và các nhãn này được tổ chức thành nhiều nhóm bệnh.
21.837 bản ghi; 18.885 bệnh nhân
Phân loại và chẩn đoán từ ECG đa nhãn
2020
EEG Motor Movement/Imagery Dataset
Các bản ghi điện não đồ 64 kênh từ người tham gia khi thực hiện hoặc tưởng tượng các chuyển động của tay và chân. Dữ liệu gồm nhiều lần lặp của các tác vụ vận động và tưởng tượng vận động.
Hơn 1.500 bản ghi dài 1–2 phút; 109 người
Phân loại vận động và tưởng tượng vận động; giao diện não–máy tính
2009
BCI Competition III Dataset II
Các tín hiệu điện não đồ 64 kênh được ghi khi người tham gia sử dụng hệ thống đánh vần dựa trên điện thế P300 (phản ánh hoạt động xử lý thông tin, sự chú ý và chức năng trí tuệ của não bộ). Những kích thích mục tiêu và không phải mục tiêu được đánh dấu để huấn luyện mô hình phát hiện phản ứng P300.
2 người; 64 kênh điện não đồ; 85 lượt huấn luyện và 100 lượt kiểm tra cho mỗi người
30 người; 6 hoạt động; tín hiệu được lấy mẫu ở 50 Hz
Nhận dạng hoạt động con người
2013
PAMAP2
Tín hiệu từ ba bộ đo quán tính đeo ở tay, ngực và mắt cá chân cùng dữ liệu nhịp tim. Được ghi khi người tham gia thực hiện nhiều hoạt động thể chất như đi bộ, chạy, đạp xe và chơi bóng đá.
9 người; 18 hoạt động; khoảng 3,85 triệu mẫu
Nhận dạng hoạt động; ước lượng cường độ hoạt động
2012
OPPORTUNITY
Tín hiệu đồng bộ từ các cảm biến đeo trên cơ thể, cảm biến gắn trên đồ vật và cảm biến trong môi trường khi người tham gia thực hiện các hoạt động sinh hoạt thường ngày. Dữ liệu cho phép nhận dạng cả chuyển động của cơ thể và các thao tác với đồ vật.
4 người trong benchmark; 23 cảm biến đeo người, 12 cảm biến trên đồ vật và 21 cảm biến môi trường
Nhận dạng hoạt động; nhận dạng thao tác; phân đoạn chuỗi tín hiệu
2013
Daily and Sports Activities
Tín hiệu từ năm bộ cảm biến quán tính và từ trường gắn ở thân, hai tay và hai chân khi người tham gia thực hiện các hoạt động sinh hoạt và thể thao.
8 người; 19 hoạt động; 9.120 đoạn tín hiệu
Nhận dạng hoạt động con người
2010
REALDISP
Tín hiệu từ nhiều cảm biến quán tính đeo trên cơ thể khi người tham gia thực hiện các hoạt động thể chất. Dữ liệu được thu trong ba điều kiện bố trí cảm biến khác nhau để đánh giá ảnh hưởng của việc cảm biến bị đặt lệch vị trí.
17 người; 33 hoạt động; khoảng 9 giờ dữ liệu
Nhận dạng hoạt động; đánh giá độ bền trước thay đổi vị trí cảm biến
2014
Heterogeneity Activity Recognition
Tín hiệu gia tốc kế và con quay hồi chuyển được thu đồng thời từ nhiều mẫu điện thoại thông minh và đồng hồ thông minh khác nhau, nhằm phản ánh sự khác biệt giữa thiết bị và vị trí đeo trong điều kiện sử dụng thực tế.
Hơn 43 triệu mẫu; nhiều điện thoại và đồng hồ thông minh
Nhận dạng hoạt động; đánh giá khả năng khái quát giữa các thiết bị
2015
Công nghiệp
Bộ dữ liệu
Mô tả
Quy mô
Tác vụ
Năm
Nguồn
Tennessee Eastman Process
Dữ liệu mô phỏng một quy trình sản xuất hóa chấtcông nghiệp gồm lò phản ứng, thiết bị ngưng tụ, máy nén và các dòng tuần hoàn. Các biến đo lường và biến điều khiển được ghi theo thời gian trong điều kiện vận hành bình thường và khi xuất hiện nhiều loại lỗi quy trình.
52 biến quy trình trong mô hình chuẩn; nhiều chế độ vận hành và tình huống lỗi tùy phiên bản
Phát hiện và chẩn đoán lỗi; giám sát quy trình
1993
NASA C-MAPSS Turbofan Engine Degradation
Các chuỗi dữ liệu mô phỏng quá trình suy giảm của động cơ tuabin phản lực từ trạng thái hoạt động bình thường đến khi hỏng. Mỗi chu kỳ gồm điều kiện vận hành và nhiều phép đo cảm biến của động cơ.
4 tập con; từ 100 đến 260 động cơ huấn luyện và 100 đến 259 động cơ kiểm tra tùy tập con
Ước lượng tuổi thọ hữu ích còn lại; dự đoán hỏng hóc
2008
Paderborn University Bearing Dataset
Tín hiệu rung và dòng điện động cơ được đo đồng thời trên một hệ truyền động thử nghiệm với vòng bi khỏe mạnh và vòng bi bị hỏng. Các hư hỏng bao gồm cả lỗi nhân tạo và hư hỏng thực phát sinh trong quá trình thử nghiệm.
32 trạng thái vòng bi; nhiều điều kiện tốc độ, tải và lực hướng kính
Phát hiện và phân loại hư hỏng vòng bi; giám sát tình trạng máy
2016
Condition Monitoring of Hydraulic Systems
Các chuỗi tín hiệu từ một hệ thống thủy lực thử nghiệm, gồm áp suất, lưu lượng, nhiệt độ, độ rung và nhiều phép đo khác trong các chu kỳ tải 60 giây. Tình trạng của bộ làm mát, van, bơm và bình tích áp được thay đổi có kiểm soát.
2.205 chu kỳ; 17 cảm biến
Giám sát tình trạng; phát hiện và phân loại lỗi hệ thống thủy lực
2018
MetroPT
Chuỗi dữ liệu cảm biến liên tục từ bộ tạo khí nén trên một đoàn tàu điện đang vận hành tại Porto, gồm áp suất, nhiệt độ, dòng điện và các tín hiệu điều khiển. Các sự cố thực tế được xác định từ hồ sơ bảo trì của đơn vị vận hành.
Khoảng 1,5 triệu bản ghi trong MetroPT-3
Phát hiện bất thường; dự đoán hỏng hóc; bảo trì dự đoán
Chuỗi thời gian khí tượng và thủy văn cùng các thuộc tính lưu vực tại Chile, trải dài qua nhiều điều kiện khí hậu từ sa mạc Atacama đến các vùng ôn đới và Patagonia.
516 lưu vực
Dự báo lưu lượng; mô hình hóa thủy văn; nghiên cứu ảnh hưởng của khí hậu
2018
CAMELS-BR
Chuỗi thời gian khí tượng và thủy văn cùng các thuộc tính lưu vực tại Brazil.
897 lưu vực trong tập dữ liệu chuẩn hóa
Dự báo lưu lượng; mô hình hóa thủy văn
2020
CAMELS-GB
Chuỗi thời gian khí tượng và thủy văn cùng các thuộc tính lưu vực tại Anh, Scotland và Xứ Wales.
671 lưu vực
Dự báo lưu lượng; mô hình hóa thủy văn
2020
CAMELS-AUS
Chuỗi thời gian khí tượng và thủy văn cùng các thuộc tính lưu vực tại Australia.
222 lưu vực trong phiên bản đầu
Dự báo lưu lượng; mô hình hóa thủy văn
2021
LamaH-CE
Chuỗi thời gian khí tượng và thủy văn cùng các thuộc tính lưu vực tại Trung Âu. Dữ liệu còn biểu diễn mối liên hệ giữa các lưu vực trong mạng lưới sông.
859 lưu vực có trạm đo
Dự báo lưu lượng; mô hình hóa thủy văn; mô hình hóa mạng lưới sông
2021
ERA5-Land
Dữ liệu tái phân tích toàn cầu mô tả diễn biến theo thời gian của các biến trên bề mặt đất như nhiệt độ, lượng mưa, độ ẩm đất, tuyết, bức xạ và các thành phần của chu trình nước và năng lượng.
Dữ liệu toàn cầu theo giờ, độ phân giải khoảng 9 km
Dự báo và mô hình hóa khí tượng; nghiên cứu khí hậu và thủy văn
2021
Giao thông
Bộ dữ liệu
Mô tả
Quy mô
Tác vụ
Năm
Nguồn
METR-LA
Chuỗi các giá trị đo tốc độ của các phương tiện tham gia giao thông được ghi từ các cảm biến trên mạng lưới đường cao tốc tại Los Angeles. Các phép đo được lấy theo khoảng thời gian đều đặn và có thể kết hợp với cấu trúc mạng lưới đường xá.
207 cảm biến; dữ liệu từ tháng 3 đến tháng 6 năm 2012; khoảng lấy mẫu 5 phút
Dự báo tốc độ giao thông
2018
PEMS-BAY
Chuỗi các giá trị đo tốc độ của các phương tiện tham gia giao thông được thu từ các cảm biến thuộc hệ thống Performance Measurement System (PeMS) của Caltrans tại vùng vịnh San Francisco. Dữ liệu được ghi theo từng khoảng 5 phút.
325 cảm biến; dữ liệu trong khoảng 6 tháng; khoảng lấy mẫu 5 phút
Dự báo tốc độ giao thông
2018
PeMSD4
Chuỗi lưu lượng giao thông từ các cảm biến thuộc hệ thống PeMS tại khu vực vịnh San Francisco. Phiên bản benchmark thường dùng gồm dữ liệu của các cảm biến được chọn trên nhiều tuyến đường trong hai tháng đầu năm 2018.
307 cảm biến trong phiên bản benchmark; 16.992 bước thời gian
Dự báo lưu lượng giao thông
2019
PeMSD8
Chuỗi lưu lượng giao thông từ hệ thống PeMS tại khu vực San Bernardino, California, được ghi từ các cảm biến đặt trên nhiều tuyến đường trong tháng 7 và tháng 8 năm 2016.
170 cảm biến trong phiên bản benchmark; 17.856 bước thời gian
Dự báo lưu lượng giao thông
2019
Traffic4cast
Dữ liệu giao thông đô thị được tổng hợp theo không gian và thời gian từ lượng lớn vị trí GPS của phương tiện. Mỗi bước thời gian mô tả lưu lượng, tốc độ trung bình và hướng di chuyển tại các vùng của thành phố; các phiên bản của cuộc thi bao phủ nhiều thành phố và khoảng thời gian khác nhau.
Phiên bản 2020 gồm Berlin, Istanbul và Moskva với dữ liệu theo khoảng 5 phút trong khoảng một năm; các phiên bản sau mở rộng sang nhiều thành phố
Dự báo trạng thái giao thông theo không gian và thời gian; đánh giá khả năng khái quát giữa các thành phố
Dự báo biến động giá; phân loại và hồi quy chuỗi tài chính
2013
FI-2010
Dữ liệu sổ lệnh giới hạn tần suất cao của năm cổ phiếu trên thị trường NASDAQ Nordic trong mười ngày giao dịch liên tiếp. Dữ liệu chứa giá và khối lượng ở nhiều mức mua–bán, cùng các biểu diễn chuẩn hóa dùng để dự đoán biến động giá.
Khoảng 4 triệu mẫu chuỗi thời gian; 5 cổ phiếu; 10 ngày giao dịch
Dự báo biến động giá giữa; phân tích sổ lệnh giới hạn
2018
CNNpred
Chuỗi dữ liệu theo ngày của năm chỉ số chứng khoán lớn tại Hoa Kỳ, kết hợp giá thị trường với nhiều biến tài chính khác như chỉ báo kỹ thuật, hợp đồng tương lai, giá hàng hóa, các chỉ số thị trường quốc tế và lãi suất tín phiếu kho bạc.
1.985 ngày từ năm 2010 đến 2017; 5 chỉ số; 84 biến trong phiên bản UCI
Dự đoán hướng biến động thị trường chứng khoán
2019
Tiêu thụ điện
Bộ dữ liệu
Mô tả
Quy mô
Tác vụ
Năm
Nguồn
Individual Household Electric Power Consumption
Các phép đo mức tiêu thụ điện của một hộ gia đình tại Pháp trong gần bốn năm, gồm công suất sử dụng, công suất điện trở, điện áp, cường độ dòng điện và mức tiêu thụ của một số nhóm thiết bị. Các phép đo được ghi mỗi phút.
2.075.259 phép đo; 47 tháng; 9 biến
Dự báo mức tiêu thụ điện; phân tích chuỗi thời gian
2006
ElectricityLoadDiagrams20112014
Chuỗi mức tiêu thụ điện của hàng trăm khách hàng tại Bồ Đào Nha, được ghi theo từng khoảng 15 phút trong giai đoạn 2011–2014.
370 khách hàng; khoảng lấy mẫu 15 phút
Dự báo phụ tải điện; phân cụm chuỗi tiêu thụ điện
2015
Appliances Energy Prediction
Chuỗi dữ liệu từ một ngôi nhà tiết kiệm năng lượng, gồm mức tiêu thụ điện của thiết bị, nhiệt độ và độ ẩm tại nhiều phòng, cùng các biến thời tiết bên ngoài.
19.735 phép đo; khoảng lấy mẫu 10 phút; 29 biến
Dự báo mức tiêu thụ điện của thiết bị
2017
Khác
Bộ dữ liệu
Mô tả
Quy mô
Tác vụ
Năm
Nguồn
Numenta Anomaly Benchmark
Bộ benchmark gồm nhiều chuỗi thời gian một biến có dấu thời gian từ các nguồn thực tế và dữ liệu tổng hợp, chẳng hạn mức sử dụng tài nguyên máy chủ, số liệu quảng cáo, cảm biến và lưu lượng mạng. Các khoảng xảy ra bất thường được đánh dấu để đánh giá thuật toán phát hiện bất thường theo thời gian thực.
Hơn 50 chuỗi thời gian trong phiên bản ban đầu
Phát hiện bất thường trong chuỗi thời gian
2015
Dữ liệu dạng bảng
Hệ thống gợi ý
Bộ dữ liệu
Mô tả
Quy mô
Tác vụ
Năm
Nguồn
MovieLens
Các điểm đánh giá phim do người dùng của hệ thống MovieLens cung cấp, kèm mã người dùng, tên phim, thời gian đánh giá và trong một số phiên bản có thêm nhãn mô tả do người dùng nhập. Bộ dữ liệu được phát hành thành nhiều phiên bản với quy mô khác nhau.
Nhiều phiên bản; MovieLens 25M có khoảng 25 triệu lượt đánh giá của 162.000 người dùng cho 62.000 phim
Hệ thống gợi ý; dự đoán điểm đánh giá
1997
Netflix Prize
Các điểm đánh giá phim 1–5 sao của khách hàng Netflix đã được ẩn danh, kèm mã phim và thời điểm đánh giá. Bộ dữ liệu được phát hành cho cuộc thi Netflix Prize và sau đó cũng được dùng trong KDD Cup 2007.
100.480.507 lượt đánh giá; 480.189 người dùng; 17.770 phim
Hệ thống gợi ý; dự đoán điểm đánh giá
2006
Jester Collaborative Filtering Dataset
Các điểm đánh giá ẩn danh của người dùng cho 100 câu chuyện cười, theo thang điểm liên tục từ −10 đến 10.
Khoảng 4,1 triệu lượt đánh giá; 73.421 người dùng; 100 câu chuyện cười
Lọc cộng tác; dự đoán mức độ ưa thích
2001
Yahoo! Music KDD Cup 2011
Các điểm đánh giá của người dùng Yahoo! Music đối với bài hát, album, nghệ sĩ và thể loại âm nhạc. Các mục được tổ chức theo cấu trúc phân cấp và dữ liệu còn chứa thời gian đánh giá.
Hàng trăm triệu lượt đánh giá trong hai tập dữ liệu của KDD Cup 2011
Hệ thống gợi ý âm nhạc; dự đoán điểm đánh giá và xếp hạng
2011
Y sinh và sức khỏe
Bộ dữ liệu
Mô tả
Quy mô
Tác vụ
Năm
Nguồn
Heart Disease
Dữ liệu lâm sàng của bệnh nhân được thu tại bốn cơ sở ở Hoa Kỳ và châu Âu. Các thuộc tính gồm tuổi tác, giới tính, triệu chứng đau ngực, huyết áp, cholesterol, kết quả điện tâm đồ và các phép đo liên quan đến nghiệm pháp gắng sức.
303 mẫu trong tập Cleveland thường dùng; 13 đặc trưng
Phân loại bệnh động mạch vành
1988
Breast Cancer Wisconsin (Original)
Các đặc trưng mô tả hình thái tế bào lấy từ mẫu chọc hút kim nhỏ của khối uvú, như độ dày cụm tế bào, độ đồng nhất về kích thước và hình dạng tế bào.
Các đặc trưng được trích từ ảnh đáy mắt trong bộ Messidor, gồm thông tin về tổn thương được phát hiện, các cấu trúc giải phẫu của mắt và các đặc trưng mô tả toàn ảnh.
1.151 mẫu; 19 đặc trưng
Phát hiện dấu hiệu bệnh võng mạc tiểu đường
2014
Parkinson's
Các phép đo âm học được trích từ bản ghi giọng nói của người mắc bệnh Parkinson và người khỏe mạnh. Mỗi hàng tương ứng với một bản ghi giọng nói và gồm các đại lượng về cao độ, độ biến động về cường độ (jitter), độ biến động về biên độ (shimmer) và các đặc trưng phi tuyến.
195 bản ghi; 31 người
Phân loại bệnh Parkinson
2008
Parkinson Speech Dataset
Các đặc trưng tuyến tính và thời gian–tần số được trích từ nhiều loại bản ghi giọng nói như nguyên âm kéo dài, số, từ và câu ngắn của người mắc Parkinson và người khỏe mạnh.
1.040 mẫu; 40 người trong tập huấn luyện
Phân loại bệnh Parkinson; hồi quy mức độ bệnh
2013
Mice Protein Expression
Mức biểu hiện của 77 protein hoặc dạng biến đổi protein trong vỏ não của chuột đối chứng và chuột với ba nhiễm sắc thể trong mỗi tế bào để mô phỏng hội chứng Down. Các nhóm chuột khác nhau về kiểu gen, điều kiện học và việc điều trị bằng memantine.
1.080 mẫu; 72 con chuột; 77 protein
Phân loại nhóm chuột; phân tích các protein liên quan đến khả năng học
2015
Khoa học tự nhiên
Bộ dữ liệu
Mô tả
Quy mô
Tác vụ
Năm
Nguồn
Abalone
Các phép đo vật lý của bào ngư như chiều dài, đường kính, chiều cao và khối lượng. Tuổi của bào ngư được xác định từ số vòng trên vỏ và được dùng làm giá trị cần dự đoán.
4.177 mẫu; 8 đặc trưng
Ước lượng tuổi
1995
Covertype
Các ô đất rừng 30 × 30 m tại Rừng Quốc gia Roosevelt ở Colorado, được mô tả bằng những thuộc tính địa hình và đất như độ cao, độ dốc, khoảng cách đến nguồn nước, mức che bóng, vùng hoang dã và loại đất. Dữ liệu không sử dụng ảnh viễn thám.
Các đặc trưng phổ được trích từ ảnh vệ tinh ASTER của một khu vực rừng tại Nhật Bản vào ba thời điểm khác nhau. Mỗi mẫu gồm các giá trị phổ khả kiến và cận hồng ngoại cùng các đại lượng biểu diễn sai khác không gian.
326 mẫu; 27 đặc trưng; 4 lớp
Phân loại loại rừng
2012
HIGGS
Các sự kiện va chạm hạt được mô phỏng bằng phương pháp Monte Carlo để phân biệt tín hiệu của một quá trình tạo bosonHiggs với các quá trình nền. Mỗi sự kiện được biểu diễn bằng các đại lượng động học của các hạt cùng một số đặc trưng vật lý tổng hợp.
11 triệu mẫu; 28 đặc trưng
Phân loại sự kiện vật lý hạt
2014
HEPMASS
Các sự kiện va chạm hạt được mô phỏng bằng Monte Carlo, với mục tiêu phân biệt các quá trình tạo hạt giả định mới khỏi nền vật lý chuẩn. Mỗi sự kiện được biểu diễn bằng các đặc trưng động học dạng số.
Kết quả phân tích hóa học của các mẫu rượu vang được sản xuất từ ba giống nho khác nhau trồng trong cùng một khu vực tại Ý. Các đặc trưng gồm nồng độ cồn, axid malic, magnesium, phenol, flavonoid, cường độ màu và proline.
178 mẫu; 13 đặc trưng; 3 lớp
Phân loại giống nho dựa trên thành phần hóa học của rượu vang
1991
Kỹ thuật và công nghiệp
Bộ dữ liệu
Mô tả
Quy mô
Tác vụ
Năm
Nguồn
Steel Plates Faults
Các khiếm khuyết trên bề mặt thép không gỉ được biểu diễn bằng các đặc trưng hình học và hình dạng đã trích, rồi chia thành bảy loại lỗi như vết xước, vết bẩn và chỗ lồi.
Các cấu hình mô phỏng của công trình dân dụng với những thuộc tính thiết kế như độ nhỏ gọn tương đối, diện tích bề mặt, diện tích tường và mái, chiều cao, hướng và diện tích kính. Hai giá trị cần dự đoán là tải sưởi và tải làm mát.
768 mẫu; 8 đặc trưng đầu vào
Dự đoán tải sưởi và tải làm mát của công trình
2012
Gas Turbine CO and NOx Emission
Các phép đo vận hành của một tuabin khí tại Thổ Nhĩ Kỳ được tổng hợp theo giờ, gồm điều kiện môi trường và các biến của quá trình như áp suất, nhiệt độ và công suất. Hai biến đầu ra là nồng độ carbon monoxide và nitrogen oxide trong khí thải.
36.733 mẫu; 11 biến đo
Dự đoán phát thải CO và NOx
2019
Ô tô
Bộ dữ liệu
Mô tả
Quy mô
Tác vụ
Năm
Nguồn
Automobile
Thông số kỹ thuật và đặc điểm của các mẫu ô tô, gồm hãng sản xuất, loại nhiên liệu, kiểu thân xe, kích thước, khối lượng, đặc điểm động cơ và mức tiêu thụ nhiên liệu. Dữ liệu còn chứa mức rủi ro bảo hiểm và giá xe.
205 mẫu; 25 đặc trưng
Dự đoán giá xe; phân tích rủi ro bảo hiểm
1985
Auto MPG
Các đặc điểm kỹ thuật của ô tô như số xi-lanh, dung tích động cơ, công suất, khối lượng, khả năng tăng tốc và năm sản xuất, kèm mức tiêu thụ nhiên liệu tính theo dặm trên gallon.
398 mẫu; 7 đặc trưng đầu vào
Dự đoán mức tiêu thụ nhiên liệu
1983
Car Evaluation
Các cấu hình ô tô được mô tả bằng sáu thuộc tính phân loại gồm giá mua, chi phí bảo dưỡng, số cửa, sức chứa hành khách, kích thước khoang hành lý và mức an toàn. Nhãn biểu thị mức độ chấp nhận của xe.
1.728 mẫu; 6 đặc trưng; 4 lớp
Phân loại mức độ chấp nhận của ô tô
1988
Kinh tế và tài chính
Bộ dữ liệu
Mô tả
Quy mô
Tác vụ
Năm
Nguồn
Statlog (Australian Credit Approval)
Các hồ sơ xin cấp tín dụng với cả thuộc tính số và thuộc tính phân loại. Tên và giá trị của các thuộc tính đã được ẩn hoặc mã hóa để bảo vệ thông tin cá nhân.
690 mẫu; 14 đặc trưng
Phân loại hồ sơ tín dụng
1987
Statlog (German Credit Data)
Hồ sơ người vay được mô tả bằng các thuộc tính như tình trạng tài khoản, thời hạn và mục đích khoản vay, lịch sử tín dụng, hạn mức tín dụng, việc làm và tình trạng nhà ở. Mỗi hồ sơ được phân thành rủi ro tín dụng tốt hoặc xấu.
1.000 mẫu; 20 đặc trưng
Đánh giá rủi ro tín dụng
1994
Default of Credit Card Clients
Hồ sơ khách hàng thẻ tín dụng tại Đài Loan, gồm hạn mức tín dụng, thông tin nhân khẩu học, lịch sử trả nợ, số tiền trên hóa đơn và các khoản thanh toán trong sáu tháng trước đó.
30.000 khách hàng; 23 đặc trưng
Dự đoán khả năng vỡ nợ thẻ tín dụng
2009
Bank Marketing
Dữ liệu từ các chiến dịch tiếp thị trực tiếp qua điện thoại của một ngân hàng Bồ Đào Nha. Mỗi mẫu mô tả một khách hàng và lần liên hệ, với mục tiêu xác định người đó có đăng ký tiền gửi có kỳ hạn hay không.
45.211 mẫu; 16 đặc trưng trong phiên bản đầy đủ
Dự đoán phản hồi chiến dịch tiếp thị ngân hàng
2012
Xã hội
Bộ dữ liệu
Mô tả
Quy mô
Tác vụ
Năm
Nguồn
Adult
Các hồ sơ được trích từ dữ liệu điều tra dân số Hoa Kỳ, gồm những thuộc tính như tuổi, trình độ học vấn, nghề nghiệp, tình trạng hôn nhân, số giờ làm việc và thu nhập.
48.842 mẫu; 14 đặc trưng
Dự đoán thu nhập hằng năm trên hoặc không quá 50.000 USD
1996
Census-Income (KDD)
Các hồ sơ được trích từ Current Population Surveys của Cục Điều tra Dân số Hoa Kỳ năm 1994 và 1995, gồm các biến về nhân khẩu học, việc làm, giáo dục và hộ gia đình. Mỗi mẫu còn có trọng số biểu thị số người trong dân số mà hồ sơ đại diện.
299.285 mẫu; 41 đặc trưng
Dự đoán mức thu nhập
2000
Student Performance
Dữ liệu học sinh tại hai trường trung học ở Bồ Đào Nha, gồm điểm số, thông tin nhân khẩu học, hoàn cảnh xã hội, gia đình và các yếu tố liên quan đến trường học. Hai tập con tương ứng với môn Toán và tiếng Bồ Đào Nha.
395 học sinh môn Toán; 649 học sinh môn tiếng Bồ Đào Nha
Dự đoán kết quả học tập
2008
Teaching Assistant Evaluation
Các đánh giá chất lượng giảng dạy của các trợ giảng tại Khoa Thống kê, Đại học Wisconsin–Madison trong ba học kỳ chính và hai học kỳ hè. Mỗi mẫu mô tả một lần phân công trợ giảng bằng các thuộc tính như giảng viên, khóa học, học kỳ và quy mô lớp.
151 mẫu; 5 đặc trưng
Phân loại mức đánh giá giảng dạy
1997
Balance Scale
Dữ liệu tổng hợp được tạo để mô hình hóa kết quả của một thí nghiệm về cân thăng bằng. Mỗi mẫu xác định khối lượng và khoảng cách ở hai phía của cân, với nhãn cho biết cân nghiêng sang trái, sang phải hoặc giữ cân bằng.
625 mẫu; 4 đặc trưng; 3 lớp
Phân loại trạng thái cân
1994
Khác
Bộ dữ liệu
Mô tả
Quy mô
Tác vụ
Năm
Nguồn
Letter Recognition
Các chữ cái in hoa trong bảng chữ cái Latinh được biểu diễn bằng các đặc trưng số trích từ ảnh ký tự, như vị trí, kích thước và các thống kê về phân bố pixel.
20.000 mẫu; 16 đặc trưng; 26 lớp
Nhận dạng chữ cái
1991
Spambase
Các thư điện tử được biểu diễn bằng những đặc trưng đã trích như tần suất xuất hiện của từ và ký tự, cùng các thống kê về chuỗi chữ in hoa.
4.601 mẫu; 57 đặc trưng
Phân loại thư rác
1999
Dữ liệu đồ thị
Mạng xã hội
Bộ dữ liệu
Mô tả
Quy mô
Tác vụ
Năm
Nguồn
Facebook Social Circles
Các mạng lân cận của người dùng Facebook, trong đó mỗi nút biểu thị người dùng và các cạnh biểu thị quan hệ bạn bè giữa họ. Dữ liệu còn gồm các thuộc tính hồ sơ đã ẩn danh và các nhóm bạn bè do người dùng xác định.
4.039 nút; 88.234 cạnh
Phát hiện cộng đồng; dự đoán liên kết; học biểu diễn nút
2012
Epinions Social Network
Mạng có hướng giữa người dùng của trang đánh giá Epinions, trong đó một cạnh biểu thị việc một người dùng tuyên bố tin cậy một người dùng khác.
75.879 nút; 508.837 cạnh
Dự đoán liên kết; phân tích độ tin cậy; phân tích mạng xã hội
2003
Slashdot Social Network
Mạng người dùng của trang tin công nghệ Slashdot, trong đó các quan hệ được tạo thông qua chức năng Slashdot Zoo cho phép người dùng đánh dấu người khác là bạn hoặc đối thủ. Phiên bản tháng 2 năm 2009 chứa mạng quan hệ giữa hơn 82 nghìn người dùng.
82.168 nút; 948.464 cạnh
Phân tích cấu trúc cộng đồng; dự đoán liên kết
2009
Pokec Social Network
Mạng xã hội Pokec tại Slovakia, gồm các quan hệ bạn bè có hướng và thông tin hồ sơ đã được ẩn danh như tuổi, giới tính, khu vực, học vấn và sở thích.
1.632.803 nút; 30.622.564 cạnh
Phân tích mạng xã hội; dự đoán liên kết; dự đoán thuộc tính nút
2012
LiveJournal Social Network
Mạng quan hệ giữa người dùng LiveJournal, một nền tảng blog và cộng đồng trực tuyến. Các nút biểu thị tài khoản người dùng và cạnh có hướng biểu thị quan hệ bạn bè được khai báo giữa các thành viên.
4.847.571 nút; 68.993.773 cạnh
Phát hiện cộng đồng; phân tích cấu trúc mạng; dự đoán liên kết
2006
Gowalla
Mạng xã hội dựa trên vị trí của Gowalla, gồm quan hệ bạn bè giữa người dùng và các lần check-in có dấu thời gian và tọa độ địa lý.
Dự đoán liên kết; dự đoán vị trí; phân tích quan hệ giữa tình bạn và di chuyển
2011
Hóa học
Bộ dữ liệu
Mô tả
Quy mô
Tác vụ
Năm
Nguồn
MUTAG
Tập hợp các hợp chất hóa học có cấu trúc được biểu diễn dưới dạng đồ thị, trong đó nút là nguyên tử và cạnh là liên kết hóa học. Mỗi phân tử được gán nhãn theo khả năng gây đột biến.
188 đồ thị; trung bình 17,9 nút và 19,8 cạnh mỗi đồ thị; 2 lớp
Phân loại đồ thị; dự đoán khả năng gây đột biến
2020
NCI1
Các hợp chất hóa học được biểu diễn thành đồ thị phân tử và gán nhãn theo kết quả sàng lọc khả năng ức chế sự phát triển của tế bào ung thư trong chương trình của Viện Ung thư Quốc gia Hoa Kỳ.
4.110 đồ thị; trung bình 29,9 nút và 32,3 cạnh; 2 lớp
Phân loại đồ thị; dự đoán hoạt tính sinh học của hợp chất
2020
ZINC
Các phân tử hữu cơ giống thuốc từ cơ sở dữ liệu ZINC được biểu diễn dưới dạng đồ thị với nguyên tử là nút và liên kết hóa học là cạnh. Phiên bản benchmark thường dùng gồm 12.000 phân tử và yêu cầu dự đoán một tính chất hóa học liên tục.
12.000 đồ thị trong phiên bản benchmark; 10.000 huấn luyện, 1.000 xác thực, 1.000 kiểm thử
Hồi quy đồ thị; dự đoán tính chất phân tử
2020
Sinh học
Bộ dữ liệu
Mô tả
Quy mô
Tác vụ
Năm
Nguồn
PP-Pathways
Mạng tương tác protein–protein ở người, trong đó các nút biểu thị protein và các cạnh biểu thị những tương tác vật lý đã được xác nhận bằng thực nghiệm. Mạng được sử dụng để nghiên cứu cấu trúc của các con đường liên quan đến bệnh.
21.557 nút; 342.353 cạnh
Dự đoán liên kết; phát hiện con đường bệnh; phân tích cấu trúc mạng protein
2018
PPT-OhmNet
Tập hợp các mạng tương tác protein–protein đặc hiệu theo mô ở người. Mỗi lớp mạng tương ứng với một mô, với các nút là protein và các cạnh là tương tác vật lý được xác định là hoạt động trong mô đó.
4.510 protein; 70.338 cạnh trong mạng đa lớp; 107 mô
Dự đoán chức năng protein theo mô; học biểu diễn nút trên mạng đa lớp
2017
PP-Decagon
Mạng liên kết protein–protein ở người, gồm cả tương tác vật lý trực tiếp và các liên hệ chức năng gián tiếp. Bộ dữ liệu là thành phần protein của mạng đa phương thức Decagon dùng để mô hình hóa tác dụng phụ của việc kết hợp nhiều loại thuốc.
19.081 nút; 715.612 cạnh
Dự đoán liên kết; học biểu diễn protein; dự đoán tác dụng phụ của phối hợp thuốc
2018
ChG-TargetDecagon
Mạng hai phía giữa thuốc và protein đích, trong đó mỗi cạnh biểu thị một tương tác thuốc–protein đã được xác nhận bằng thực nghiệm hoặc nghiên cứu dược lý.
3.932 nút, gồm 284 thuốc và 3.648 gene/protein; 18.690 cạnh
Dự đoán đích tác dụng của thuốc; dự đoán liên kết thuốc–protein
2018
PP-Miner
Tập hợp các mạng liên kết protein–protein của nhiều loài, gồm tương tác vật lý trực tiếp và các liên hệ chức năng như đồng biểu hiện, cùng con đường sinh học và phức hợp protein. Dữ liệu được trích từ STRING phiên bản 10.5.
Khoảng 8,25 triệu protein; 1,85 tỷ cạnh; 2.031 loài
Dự đoán tương tác protein; học biểu diễn protein; phân tích mạng sinh học giữa nhiều loài
2017
ENZYMES
Các protein được biểu diễn dưới dạng đồ thị dựa trên cấu trúc bậc ba; các nút tương ứng với cấu trúc thứ cấp của protein và các cạnh mô tả quan hệ không gian giữa chúng. Mỗi đồ thị được gán vào một trong sáu lớp enzyme.
600 đồ thị; trung bình 32,6 nút và 62,1 cạnh; 6 lớp
Phân loại đồ thị; phân loại enzyme
2020
ogbg-molhiv
Các phân tử được biểu diễn thành đồ thị nguyên tử–liên kết và gán nhãn theo khả năng ức chế sự nhân lên của HIV. Bộ dữ liệu được OGB chuẩn hóa từ một tác vụ trong MoleculeNet.
41.127 đồ thị
Phân loại đồ thị; dự đoán hoạt tính chống HIV
2020
ogbg-molpcba
Các hợp chất từ PubChem BioAssay được biểu diễn thành đồ thị phân tử và gán nhãn cho nhiều phép thử sinh học khác nhau.
437.929 đồ thị; 128 tác vụ phân loại nhị phân
Phân loại đồ thị đa tác vụ; dự đoán hoạt tính sinh học
2020
ogbg-ppa
Tập hợp các mạng liên kết protein của nhiều loài, trong đó mỗi đồ thị biểu diễn mạng liên kết protein của một loài và các cạnh có đặc trưng mô tả nhiều loại liên hệ giữa protein. Mục tiêu là xác định nhóm phân loại sinh học của loài tạo ra mạng.
1.581 đồ thị; 37 lớp
Phân loại đồ thị; phân loại nhóm sinh vật
2020
Đồ thị tri thức
Bộ dữ liệu
Mô tả
Quy mô
Tác vụ
Năm
Nguồn
FB15k-237
Một tập con của Freebase được tạo từ FB15k sau khi loại bỏ các quan hệ dư thừa và nhiều cặp quan hệ nghịch đảo có thể gây rò rỉ giữa tập huấn luyện và kiểm thử. Các bộ ba biểu diễn quan hệ giữa các thực thể thuộc nhiều lĩnh vực như người, địa điểm, phim và thể thao.
14.541 thực thể; 237 loại quan hệ; 310.116 bộ ba
Hoàn thiện đồ thị tri thức; dự đoán liên kết
2015
WN18RR
Một tập con của WordNet được tạo từ benchmark WN18 bằng cách loại bỏ các quan hệ nghịch đảo gây rò rỉ giữa dữ liệu huấn luyện và kiểm thử. Các nút tương ứng với các tập hợp từ đồng nghĩa (synset) của WordNet và các cạnh biểu thị những quan hệ từ vựng giữa chúng.
40.943 thực thể; 11 loại quan hệ; 93.003 bộ ba
Hoàn thiện đồ thị tri thức; dự đoán liên kết
2018
YAGO3-10
Một tập con của đồ thị tri thức YAGO3 chỉ giữ các thực thể tham gia ít nhất mười quan hệ. Phần lớn các bộ ba mô tả thuộc tính của con người, chẳng hạn quốc tịch, giới tính và nghề nghiệp.
123.182 thực thể; 37 loại quan hệ; 1.089.040 bộ ba
Hoàn thiện đồ thị tri thức; dự đoán liên kết
2018
Wikidata5M
Đồ thị tri thức quy mô lớn được xây dựng từ bản kết xuất Wikidata và Wikipedia tiếng Anh tháng 7 năm 2019. Mỗi thực thể được liên kết với phần mô tả lấy từ bài Wikipedia tương ứng, cho phép đánh giá cả trên các thực thể đã xuất hiện và chưa xuất hiện trong quá trình huấn luyện.
4.594.485 thực thể; 822 loại quan hệ; 20.624.575 bộ ba
Hoàn thiện đồ thị tri thức; dự đoán liên kết quy nạp; học biểu diễn thực thể
2021
Mạng trích dẫn nghiên cứu
Bộ dữ liệu
Mô tả
Quy mô
Tác vụ
Năm
Nguồn
Cora
Mạng trích dẫn các bài báo về học máy, trong đó mỗi nút là một bài báo và mỗi cạnh biểu thị quan hệ trích dẫn. Mỗi bài được biểu diễn bằng vector nhị phân cho biết sự xuất hiện của các từ và được gán vào một trong bảy chủ đề.
2.708 nút; 5.429 cạnh; 1.433 đặc trưng; 7 lớp
Phân loại nút; học nửa giám sát trên đồ thị
2000
CiteSeer
Mạng trích dẫn các bài báo khoa học, trong đó các nút là tài liệu và các cạnh biểu thị quan hệ trích dẫn. Nội dung mỗi bài được biểu diễn bằng vector từ và các bài báo được chia thành sáu chủ đề.
3.327 nút; 4.732 cạnh; 3.703 đặc trưng; 6 lớp
Phân loại nút; học nửa giám sát trên đồ thị
2008
PubMed
Mạng trích dẫn các bài báo y sinh về bệnh tiểu đường trong cơ sở dữ liệu PubMed. Mỗi bài báo là một nút, các cạnh biểu thị trích dẫn và mỗi nút có vector đặc trưng dựa trên tần suất từ, cùng nhãn chỉ một trong ba nhóm chủ đề.
19.717 nút; 44.338 cạnh; 500 đặc trưng; 3 lớp
Phân loại nút; học nửa giám sát trên đồ thị
2008
ogbn-arxiv
Mạng trích dẫn có hướng của các bài báo khoa học máy tính trên arXiv được lập chỉ mục trong Microsoft Academic Graph. Mỗi nút là một bài báo, mỗi cạnh biểu thị một trích dẫn và mỗi nút có vector 128 chiều được tạo từ tiêu đề và tóm tắt.
169.343 nút; 1.166.243 cạnh; 40 lớp
Phân loại chủ đề bài báo; phân loại nút
2020
ogbn-papers100M
Mạng trích dẫn quy mô lớn của các bài báo khoa học máy tính được lập chỉ mục trong Microsoft Academic Graph. Mỗi nút là một bài báo, mỗi cạnh có hướng biểu thị một quan hệ trích dẫn và mỗi bài có vector đặc trưng 128 chiều được tạo từ tiêu đề và tóm tắt.
111.059.956 nút; 1.615.685.872 cạnh; 172 lớp
Phân loại chủ đề bài báo; phân loại nút; đánh giá khả năng mở rộng của mô hình đồ thị
2020
Mã nguồn và nhật ký phần mềm
Bộ dữ liệu
Mô tả
Quy mô
Tác vụ
Năm
Nguồn
CodeSearchNet Corpus
Mã nguồn từ các kho phần mềm nguồn mở trên GitHub, gồm các hàm và tài liệu đi kèm thuộc sáu ngôn ngữ lập trình: Go, Java, JavaScript, PHP, Python và Ruby.
Khoảng 6 triệu hàm; 6 ngôn ngữ lập trình
Tìm kiếm mã nguồn; sinh mô tả mã; học biểu diễn mã nguồn
2019
CodeXGLUE
Bộ benchmark tổng hợp nhiều tập dữ liệu về mã nguồn cho các bài toán hiểu và tạo sinh chương trình, bao gồm phát hiện clone và lỗi, tìm kiếm mã, tạo sinh và hoàn thiện mã, dịch giữa các ngôn ngữ lập trình, sửa mã và tạo sinh mô tả bằng ngôn ngữ tự nhiên.
14 tập dữ liệu; 10 tác vụ
Hiểu mã nguồn; sinh mã; phát hiện lỗi; tìm kiếm mã; dịch và sửa mã
2021
The Stack
Mã nguồn quy mô lớn được thu thập từ các kho phần mềm công khai và lọc theo giấy phép cho phép phân phối.
Khoảng 3,1 TB mã nguồn; 30 ngôn ngữ lập trình trong phiên bản được công bố ban đầu
Mô hình hóa mã nguồn; hoàn thiện mã; sinh chương trình; tiền huấn luyện mô hình ngôn ngữ
2022
HumanEval
Bộ bài toán lập trình Python, mỗi bài gồm chữ ký hàm, tài liệu mô tả yêu cầu và các kiểm thử dùng để đánh giá tính đúng đắn của chương trình được sinh ra.
164 bài toán lập trình
Sinh mã từ mô tả ngôn ngữ tự nhiên; đánh giá tính đúng đắn chức năng
2021
Defects4J
Tập hợp các lỗi thực tế có thể tái tạo trong các dự án Java nguồn mở. Mỗi lỗi đi kèm phiên bản chương trình bị lỗi và phiên bản đã sửa, cùng bộ kiểm thử giúp tái tạo hành vi lỗi.
357 lỗi thuộc 5 dự án trong phiên bản được công bố ban đầu
Kiểm thử phần mềm; định vị lỗi; sửa lỗi tự động; dự đoán lỗi
Phân tích nhật ký; phân tích cú pháp log; phát hiện bất thường; chẩn đoán lỗi
2020
Loghub-2.0
Bộ benchmark nhật ký hệ thống được xây dựng để khắc phục hạn chế về quy mô và tính đại diện của Loghub khi đánh giá các thuật toán phân tích cú pháp log. Các log được lấy từ nhiều hệ thống phần mềm thực tế và được gán nhãn mẫu log.
14 tập dữ liệu; trung bình khoảng 3,6 triệu dòng log mỗi tập
Phân tích cú pháp nhật ký; đánh giá thuật toán phân tích log
2023
Đa phương thức
Hình ảnh–văn bản
Bộ dữ liệu
Mô tả
Quy mô
Tác vụ
Năm
Nguồn
Flickr30k
Các ảnh chụp từ Flickr, mỗi ảnh đi kèm năm câu mô tả bằng tiếng Anh do con người viết. Dữ liệu chủ yếu mô tả người, vật thể, hoạt động và sự kiện trong các cảnh đời thường.
31.783 ảnh; 158.915 câu mô tả
Sinh mô tả ảnh; truy hồi ảnh–văn bản; học biểu diễn đa phương thức
2014
Visual Genome
Các ảnh cảnh thực tế được gán chú thích dày đặc về vật thể, thuộc tính, quan hệ giữa các vật thể, vùng ảnh và mô tả bằng ngôn ngữ tự nhiên. Các chú thích có thể được biểu diễn dưới dạng đồ thị cảnh liên kết nội dung hình ảnh với ngôn ngữ.
108.077 ảnh; hàng triệu mô tả vùng, vật thể, thuộc tính và quan hệ
Sinh mô tả ảnh; sinh đồ thị cảnh; hiểu quan hệ thị giác–ngôn ngữ; hỏi đáp trực quan
2017
VQA v2
Các câu hỏi bằng ngôn ngữ tự nhiên về ảnh cùng câu trả lời do con người cung cấp. Phiên bản thứ hai được xây dựng để giảm khả năng mô hình đoán câu trả lời chỉ từ thiên lệch ngôn ngữ bằng cách ghép các câu hỏi tương tự với những ảnh có câu trả lời khác nhau.
Khoảng 204.000 ảnh; 1,1 triệu câu hỏi; hơn 11 triệu câu trả lời
Hỏi đáp trực quan
2017
CLEVR
Các ảnh tổng hợp chứa những vật thể 3D đơn giản, đi kèm câu hỏi được sinh tự động về thuộc tính, vị trí, số lượng và quan hệ giữa các vật thể. Mỗi câu hỏi còn có biểu diễn chương trình chức năng mô tả chuỗi suy luận cần thực hiện.
100.000 ảnh; khoảng 1 triệu câu hỏi
Hỏi đáp trực quan; suy luận kết hợp; đánh giá khả năng suy luận thị giác
2017
GQA
Các câu hỏi và câu trả lời về ảnh thực tế được tạo từ các đồ thị cảnh của Visual Genome. Mỗi câu hỏi đi kèm biểu diễn ngữ nghĩa có cấu trúc, cho phép đánh giá nhiều bước suy luận về vật thể, thuộc tính và quan hệ.
113.018 ảnh; khoảng 22 triệu câu hỏi
Hỏi đáp trực quan; suy luận kết hợp; đánh giá tính nhất quán
2019
Conceptual Captions
Các cặp ảnh và văn bản thay thế được thu thập tự động từ các trang web; văn bản được xử lý và khái quát hóa một số thực thể, tạo dữ liệu quy mô lớn nhưng nhiễu hơn các bộ mô tả ảnh được gán nhãn thủ công.
Khoảng 3,3 triệu cặp ảnh–văn bản huấn luyện
Sinh mô tả ảnh; tiền huấn luyện thị giác–ngôn ngữ
2018
Wikipedia-based Image Text Dataset
Các cặp ảnh–văn bản được trích từ Wikipedia đa ngôn ngữ, kết hợp ảnh với văn bản liên quan trong bài viết và thông tin về thực thể. Bộ dữ liệu được thiết kế cho học đa phương thức và đa ngôn ngữ.
Tiền huấn luyện đa phương thức; truy hồi ảnh–văn bản; học đa ngôn ngữ
2021
LAION-5B
Bộ dữ liệu quy mô lớn gồm các cặp ảnh và văn bản thay thế thu thập từ web, sau đó được lọc theo mức tương đồng giữa ảnh và văn bản bằng mô hình CLIP (contrastive language-image pre-training). Bộ dữ liệu gồm nhiều tập con theo ngôn ngữ và mức độ an toàn của nội dung.
5,85 tỷ cặp ảnh–văn bản
Tiền huấn luyện mô hình thị giác–ngôn ngữ; sinh ảnh từ văn bản; truy hồi ảnh–văn bản
2022
Video–âm thanh–văn bản
Bộ dữ liệu
Mô tả
Quy mô
Tác vụ
Năm
Nguồn
CMU-MOSI
Các đoạn video độc thoại lấy từ video đánh giá phim trên YouTube, gồm hình ảnh người nói, tín hiệu âm thanh và bản chép lời. Mỗi đoạn được gán điểm cường độ cảm xúc từ −3 đến 3.
2.199 đoạn; 93 video
Phân tích cảm xúc đa phương thức; hồi quy cường độ cảm xúc
2016
CMU-MOSEI
Các đoạn phát biểu lấy từ video trực tuyến của hơn một nghìn người nói về nhiều chủ đề khác nhau. Mỗi mẫu kết hợp bản chép lời, âm thanh và biểu hiện hình ảnh, đồng thời có nhãn cảm xúc và cường độ cảm xúc.
23.453 đoạn; hơn 1.000 người nói; 250 chủ đề
Phân tích cảm xúc đa phương thức; nhận dạng cảm xúc
2018
MELD
Các đoạn hội thoại nhiều người từ loạt phim Friends, trong đó mỗi phát ngôn có video, âm thanh và bản chép lời, cùng nhãn cảm xúc và sắc thái tích cực, tiêu cực hoặc trung tính.
Khoảng 13.000 phát ngôn; 1.433 đoạn hội thoại
Nhận dạng cảm xúc trong hội thoại; phân tích cảm xúc đa phương thức
2019
HowTo100M
Các video hướng dẫn có lời thuyết minh được thu thập từ web, chia thành các đoạn ngắn và ghép với văn bản lấy từ phụ đề tự động của lời nói.
1,22 triệu video; 136 triệu đoạn video; khoảng 134.000 giờ
Tiền huấn luyện video–ngôn ngữ; truy hồi video–văn bản; học biểu diễn đa phương thức
2019
CH-SIMS
Các đoạn video tiếng Trung lấy từ phim điện ảnh, phim truyền hình và chương trình giải trí, kết hợp hình ảnh, âm thanh và lời thoại. Ngoài nhãn cảm xúc chung cho cả mẫu đã phương thức, mỗi phương thức còn được gán nhãn cảm xúc riêng.
2.281 đoạn video; 60 video nguồn
Phân tích cảm xúc đơn phương thức và đa phương thức
2020
Văn bản–đồ thị/cấu trúc
Bộ dữ liệu
Mô tả
Quy mô
Tác vụ
Năm
Nguồn
WebNLG
Các tập bộ ba RDF lấy từ DBpedia được ghép với những câu hoặc đoạn văn diễn đạt cùng nội dung bằng ngôn ngữ tự nhiên. Bộ dữ liệu được xây dựng để đánh giá khả năng chuyển dữ liệu có cấu trúc thành văn bản.
Hàng nghìn tập bộ ba RDF và nhiều cách diễn đạt bằng văn bản
Sinh văn bản từ đồ thị; diễn đạt dữ liệu RDF bằng ngôn ngữ tự nhiên
2017
T-REx
Các câu trong phần mở đầu của bài Wikipedia được căn chỉnh với các bộ ba trong Wikidata biểu diễn những thực thể và quan hệ được đề cập trong văn bản.
11 triệu bộ ba; 3,09 triệu phần mở đầu Wikipedia; 6,2 triệu câu
Trích xuất quan hệ; liên kết thực thể; căn chỉnh văn bản–đồ thị tri thức; hoàn thiện cơ sở tri thức
2018
WikiTableQuestions
Các câu hỏi bằng ngôn ngữ tự nhiên được ghép với bảng bán cấu trúc lấy từ Wikipedia và câu trả lời có thể được suy ra từ nội dung bảng. Nhiều câu hỏi yêu cầu kết hợp nhiều phép toán hoặc so sánh giữa các ô.
22.033 câu hỏi; 2.108 bảng
Hỏi đáp trên bảng; phân tích ngữ nghĩa
2015
WikiSQL
Các câu hỏi bằng ngôn ngữ tự nhiên về những bảng lấy từ Wikipedia, đi kèm truy vấn SQL tương ứng. Mỗi ví dụ gắn một câu hỏi với cấu trúc của bảng và một truy vấn dùng để lấy câu trả lời.
80.654 cặp câu hỏi–SQL; 24.241 bảng
Chuyển văn bản thành SQL; phân tích ngữ nghĩa; giao diện ngôn ngữ tự nhiên cho cơ sở dữ liệu
2017
Spider
Các câu hỏi ngôn ngữ tự nhiên được ghép với truy vấn SQL trên nhiều cơ sở dữ liệu quan hệ có nhiều bảng và lược đồ khác nhau. Tập huấn luyện và kiểm thử sử dụng các cơ sở dữ liệu khác nhau để đánh giá khả năng khái quát hóa sang lược đồ chưa gặp.
10.181 câu hỏi; 5.693 truy vấn SQL riêng biệt; 200 cơ sở dữ liệu; 138 lĩnh vực
Chuyển văn bản thành SQL; phân tích ngữ nghĩa trên nhiều miền
2018
ToTTo
Các bảng Wikipedia với một số ô được đánh dấu, đi kèm một câu tiếng Anh diễn đạt thông tin chứa trong các ô đó. Các câu đích được biên tập để vừa tự nhiên vừa bám sát dữ liệu trong bảng.
Hơn 120.000 mẫu huấn luyện
Sinh văn bản từ bảng; sinh văn bản có điều kiện từ dữ liệu có cấu trúc
2020
Khác
Bộ dữ liệu
Mô tả
Quy mô
Tác vụ
Năm
Nguồn
RAVDESS
Các bản ghi lời nói và bài hát thể hiện cảm xúc của 24 diễn viên chuyên nghiệp, được cung cấp dưới dạng nghe nhìn, chỉ âm thanh và chỉ video. Các biểu cảm được gán nhãn theo loại cảm xúc và cường độ.
7.356 tệp; 24 diễn viên
Nhận dạng cảm xúc từ giọng nói và khuôn mặt; học đa phương thức âm thanh–video
2018
FUNSD
Các biểu mẫu giấy đã quét với chú thích cho từ, thực thể ngữ nghĩa và quan hệ giữa các thực thể. Mỗi mẫu kết hợp hình ảnh tài liệu, nội dung văn bản và vị trí không gian của văn bản trên trang.
199 biểu mẫu; 31.485 từ; 9.707 thực thể; 5.304 quan hệ
Hiểu biểu mẫu; nhận dạng thực thể; liên kết thực thể; phân tích bố cục tài liệu
2019
DocVQA
Các ảnh tài liệu được ghép với câu hỏi bằng ngôn ngữ tự nhiên và câu trả lời do con người gán nhãn. Việc trả lời thường yêu cầu kết hợp nhận dạng văn bản với hiểu bố cục và cấu trúc của tài liệu.
Hơn 12.000 ảnh tài liệu; 50.000 câu hỏi
Hỏi đáp trên tài liệu; hiểu tài liệu đa phương thức
2021
Ego-Exo4D
Các hoạt động có kỹ năng được ghi đồng thời từ camera góc nhìn thứ nhất và nhiều camera bên ngoài. Dữ liệu góc nhìn thứ nhất còn có âm thanh nhiều kênh, cảm biến quán tính, theo dõi ánh mắt, tư thế đầu và thông tin hình học 3D của môi trường; một phần dữ liệu đi kèm chú thích ngôn ngữ.
Hơn 1.400 giờ video; 839 người tham gia; 13 thành phố
Hiểu hoạt động; chuyển đổi giữa góc nhìn thứ nhất và thứ ba; học đa phương thức và đa góc nhìn