در پست قبل 11 دیتاست عمومی و رایگان برای اجرای الگوریتم های مختلف علم داده، داده کاوی و هوش مصنوعی معرفی کردیم. در ادامه در این پست 11 مجموعه داده دیگر را باهم بررسی می کنیم.
- متون گوگل
اگر به داده های واقعاً گسترده علاقه مند هستید، مجموعه داده های گوگل فراوانی کلمات و عبارات را بر اساس تعداد زیادی از منابع متنی به صورت سالانه می شمارد. حجم این مجموعه داده حدود 2.2 ترابایت است. اگرچه استفاده از این مورد برای یک پروژه تجسم داده ممکن است دشوار باشد ، اما یک مجموعه داده عالی برای تمیز کردن داده هاست.
- داده های یونیسف
یونیسف معتبرترین منبع برای اطلاعات مربوط به زندگی کودکان در سراسر جهان است. مجموعه داده های عمومی این سازمان تغذیه ، ایمن سازی و آموزش و... را شامل می شود که یک منبع عالی برای پروژه های تجسم داده است.
- کامنت های سایت ردیت
سایت Reddit یک مجموعه داده بسیار جالب از هر نظری که در این سایت ارائه شده را منتشر کرده است. حجم این مجموعه داده بیش از یک ترابایت است. بنابراین اگر می خواهید یک مجموعه داده کوچکتر برای کار کردن داشته باشید سایت Kaggle نظرات مه 2015 را در سایت خود جمع آوری کرده است.
- ویکی پدیا
ویکی پدیا علاوه بر پروژه های دیگر بنیاد ویکی مدیا ، دستورالعمل هایی را برای بارگیری متن مقالات انگلیسی زبان ارائه می دهد. بارگیری پایگاه داده ویکی پدیا برای بازتاب و استفاده شخصی در دسترس است و حتی برنامه متن باز مخصوص به خود را دارد که می توانید برای بارگیری کامل ویکی پدیا در سیستم خود از گزینه های متنوع پردازش و تمیز کردن پروژه ها استفاده کنید.
- داده های Yelp
Yelp یک مجموعه داده رایگان برای استفاده در اهداف شخصی، آموزشی و دانشگاهی نگهداری می کند. این دیتاست شامل 6 میلیون بررسی است که شامل 189000 کسب و کار در 10 منطقه شهری است. دانشجویان از مشارکت در چالش مجموعه داده های Yelp استقبال می کنند و به شما گزینه های مختلفی برای انواع مختلف پروژه های داده می دهند.
- داده های ترند گوگل
گوگل یکی از بهترین مجموعه های داده برای تجزیه و تحلیل را داراست. شما می توانید مجموعه داده دلخواه خود را در قالب فایل CSV دانلود و با استفاده از نرم افزارها یا زبان های برنامه نویسی مختلف تجزیه و تحلیل کنید. همچنین امکان اینکه این داده ها را بر اساس موضوع، مکان و... دسته بندی و مرتب کنید وجود دارد.
- سازمان تجارت جهانی
سازمان تجارت جهانی مجموعه داده زیادی برای تجزیه و تحلیل در اختیار علاقه مندان قرار می دهد. کسانی که قصد کسب و کار در حوزه تجارت و پیش بینی های مربوط به آن را دارند از این مجموعه داده استقبال زیادی می کنند زیرا هم فرصت های زیادی برای ورود به علم داده فراهم می کند هم درک افراد را از صنعت تجارت زیادتر خواهد کرد.
- صندوق بین المللی پول
این سایت چندین مجموعه داده اکسل رایگان در حوزه شاخص های مختلف اقتصادی کلیدی از تولید ناخالص داخلی تا تورم دارد. گرفتن داده ها از چندین فایل مختلف و تجمیع آن ها، یک روش عالی برای تمیز کردن داده ها است.
- اداره اطلاعات انرژیِ ایالات متحده
این سایت داده های رایگان و در دسترسی در قالب فایل اکسل و google sheet از طریق افزونه و همچنین از طریق ویجت هایی که تجسم داده های تعاملی را فراهم می کنند، در اختیار افراد قرار می دهد. این مجموعه داده برای پروژه های یادگیری ماشین بسیار خوب عمل می کند.
- مجموعه داده تصاویر Tensorflow (CelebA)
برای تمرین در حوزه یادگیری ماشین، به یک مجموعه داده تخصصی مانند TensorFlow نیاز دارید. کتابخانه TensorFlow شامل انواع ابزارها، مدل ها و راهنماهای یادگیری ماشین به همراه مجموعه داده های خود است. CelebA بسیار گسترده و به صورت آنلاین در دسترس عموم است و شامل بیش از دویست هزار تصویر مشهور است.
- مجموعه داده متنی Tensorflow
یک مجموعه داده دیگر از کتابخانه Tensorflow به نام Common Crawl’s Web Crawl Corpus
در بیش از 40 زبان وجود دارد. این دیتاست داده های هفت سال را در بر می گیرد و مبنعی عالی برای ارزیابی عملکرد مجموعه داده های یادگیری ماشین است.