שלום אדווה,
ראשית, אם מה שהצעתי עבד, זה אומר שהנתונים מופרדים בטאבים ולא בפסיקים (פשוט יותר פעמים נתקלתי בסיפור הזה עם טאבים, לכן הצעתי את שהצעתי).
רק כדי לוודא שאת אכן מצליחה לקרוא את הנתונים נכון, הייתי מציע להתחיל בלהריץ:
data_source<-read.table("C:\\NB_Dataset.txt", sep = "\t", nrows = 10)
ולראות שמה שקיבלת הוא הגיוני (אם לא, אז צריך לעבור לבא בתור).
עם זאת, באופן עקרוני יותר, R יודע לעבוד עם אובייקטים ששמורים בזכרון. כלומר, אם יש לך זיכרון של יותר מ- 17GB על המחשב (ומערכת הפעלה חדשה מספיק, אני מניח שאת על חלונות 7), ו- R חדש מספיק (דהיינו 3.0.0), אז יש אולי סיכוי שהוא יצליח לקרוא את הנתונים הללו לתוך R (אני האמת קצת מסופק, אבל אולי, מעולם לא ניסיתי).
עם זאת, תהליך העבודה הזה נשמע לי ממש לא ריאלי (לקרוא כל פעם את הנתונים לתוך הזכרון, גם אילו זה היה אפשרי - ואני מסופק שזה אפשרי).
מה שיותר הגיוני לעשות הוא לעבוד עם חבילה כמו ff, עם פונקציה כמו read.csv.ffdf
ולעבוד עם הפונקציות שהחבילה הזו מעניקה.
קישור להתחיל לקרוא ממנו (אשר נותן הרבה קישורים אחרים) הוא זה:
כמובן שגם אפשר להעביר את הנתונים הללו לדטא-בייס, ומשם לקרוא לחתיכות מהנתונים באמצעות הדטאבייס, או חבילות שמחברות אותו ל- R.
אשמח לשמוע איזה דברים עבדו עבורך (היות ועד כה לא עבדתי עם נתונים בכאלה גדלים)
בברכה,
טל