מדד לאיכות דגימה

16 views
Skip to first unread message

Shlomo Yona

unread,
Apr 8, 2013, 11:22:49 AM4/8/13
to israel-r-...@googlegroups.com
שלום,
יש לי נתונים שנדגמים, לכאורה בהתפלגות אחידה, אחד ל-k.
בהינתן כמה אוספי דגימות שכאלה, אם למשל k=10 אז לקחתי דגימות מודולו 1, מודולו 2 ומודולו 7, אני רוצה לבדוק שאכן מה שאני רואה באוסף הדגימות מודולו 1 כשאני משווה עם אוסף הדגימות מודולו 2 ועם אוסף הדגימות מודולו 7 הוא "דומה מאוד".
אילו כלים "out of the box" יש לי ב-R כדי לייצר מדדי דמיון בעלי משמעות לעניין זה?
בפרט:
בכל דגימה יש לי עמודת מפתח ועמודת נתונים.
רוב (אם לא כל המפתחות) צפויים להופיע בכל אוסף דגימות, אבל זה אינו מובטח לי (מאפיינים של "תנועת הנתונים").

אז אילו מדדים מוצלחים יש לי כדי לקבל ציון כמותי וגם ציון איכותי על "טיב" המערכת הדוגמת לפי אוספי הדגימות שמתקבלים?

תודה רבה!!
שלמה

Tal Galili

unread,
Apr 8, 2013, 2:36:02 PM4/8/13
to israel-r-...@googlegroups.com
שלום שלמה,
אני לא מבין את ההגדרה שלך:
"אם למשל k=10 אז לקחתי דגימות מודולו 1, מודולו 2 וכו'."
מה זה אומר?
ראשית - ההתפלגות שלך היא רציפה או בדידה?
אחרי שדגמת נתונים (פעם אחת, או יותר?) אתה מבצע עליהם מניפולציה (אחת או כמה?)?
לאחר שביצעת זאת (מה שזה לא יהיה), מהו ה"דמיון" שאתה מחפש? דמיון להתפלגות אחידה? או לנתונים אחרי המניפולציה? 
משהו פה לא ברור לי.

נ.ב: לתת קוד R שמדגים זה תמיד נחמד. אבל לא חובה.


טל














----------------Contact Details:-------------------------------------------------------
Contact me: Tal.G...@gmail.com
Read me: www.talgalili.com (Hebrew) | www.biostatistics.co.il (Hebrew) | www.r-statistics.com (English)
----------------------------------------------------------------------------------------------



2013/4/8 Shlomo Yona <shlom...@gmail.com>

--
You received this message because you are subscribed to the Google Groups "Israel R User Group" group.
To unsubscribe from this group and stop receiving emails from it, send an email to israel-r-user-g...@googlegroups.com.
For more options, visit https://groups.google.com/groups/opt_out.
 
 

Shlomo Yona

unread,
Apr 8, 2013, 3:11:08 PM4/8/13
to israel-r-...@googlegroups.com

הנתונים נדגמים ע״פ שדה שלכאורה מתפלג אחיד.
אפשר לומר שאם אני רוצה לגדום אחד לעשר, די לי להסתכל על שארית החלוקה בעשר של אותו השדה.

בהינתן שיש לי כמה אוספי דגימות שכאלה, ארצה לבדוק האם באמת הדגימות מייצגות נאמנה את ה״אוכלוסייה״. משום שחישובית קשה ולא מעשי להתעסק באוכלוסייה כולה, חשוב לי להבין שהדגימות שלי מייצגות ותקפות.
שלמה

Tal Galili

unread,
Apr 8, 2013, 3:18:29 PM4/8/13
to israel-r-...@googlegroups.com
שלמה, אני אנסה לתאר את מה שהבנתי, אנא תקן אותי אם פיספסתי משהו:
אתה דוגם סידרת נתונים, ואז עושה מודולו 10 למספרים שקיבלת, ואתה רוצה לדעת האם יש עדות לכך שהמספרים שקיבלת הם כן/לא מתפלגים אחיד?
לדוגמא, כזה דבר:
hist(runif(100, 0,100) %% 10)

?



Shlomo Yona

unread,
Apr 8, 2013, 3:21:23 PM4/8/13
to israel-r-...@googlegroups.com

הדגימות אינן נעשות ב-R
הדגימות נעשות ע״פ מאפיין אחד והמטרה שלי לבדוק ששאר המאפיינים כשמשווים עם דגימה אחרת ״דומים״.
שלמה

david golan

unread,
Apr 8, 2013, 3:38:59 PM4/8/13
to israel-r-...@googlegroups.com
היי,

אני לא ממש מצליח להבין על מה מדובר, אבל בכל זאת:

חשוב לציין שאם יש לך מספר שמתפלג אחיד בין 1 לm, ואתה לוקח את התוצאות ומסתכל עליהן מודולו k, לא תקבל בהכרח התפלגות אחידה (רק אם k מחלק את m). בדוגמה של טל זה יוצא יפה כי 10 מחלק את 100, אבל תריץ:
hist(runif(10000, 0,3) %% 2)
ותראה שזה לא נכון באופן כללי.  

כמובן שאם כל מה שאתה רוצה להשוות זה האם דגימות משתי התפלגויות מתנהגות אותו הדבר מודולו k זה כבר משהו אחר לגמרי. אם k מספיק קטן ויש לך מספיק דגימות אתה יכול לעשות את זה עם מבחן חי בריבוע לאי תלות. יש וריאנט של מבחן חי בריבוע שנקרא two samples chi square test, שאמור להיות בעל עוצמה יותר גבוהה במקרה שלך, אבל בזמנו חיפשתי ולא מצאתי מימוש שלו בR. 

אם k גדול בעקרון אתה יכול להשתמש במבחן קולמוגורב סמירנוב (ks.test). 

דוד.


2013/4/8 Shlomo Yona <shlom...@gmail.com>

Shlomo Yona

unread,
Apr 8, 2013, 3:43:37 PM4/8/13
to israel-r-...@googlegroups.com

דוד, מה הקריטריון כדי להכריע ש-k גדול?
שלמה

david golan

unread,
Apr 8, 2013, 3:54:43 PM4/8/13
to israel-r-...@googlegroups.com
בגדול, מבחן חי בריבוע מקרב את ההתפלגות הבינומית בכל תא על ידי התפלגות נורמלית.  אתה רוצה הרבה דגימות בכל תא כדי שהקירוב יהיה טוב.
כלל האצבע שאני מכיר (ואומר לסטודנטים) הוא לפחות 5 כדורים בכל תא, כלומר: 
min(table(samples %% k)) >=4 
מצד שני, לא ברור לי שזו אמת חקוקה באבן, אבל למיטב ידיעתי זה מקובל. 

דוד. 




Jonathan Rosenblatt

unread,
Apr 9, 2013, 2:09:22 AM4/9/13
to israel-r-...@googlegroups.com
שלמה-
האם תוכל לתת קצת רקע לבעייה? (שנשמעת מאוד לא שגרתית עבורי)


2013/4/8 david golan <golan...@gmail.com>



--
Jonathan Rosenblatt
www.john-ros.com

amit gal

unread,
Apr 9, 2013, 2:29:07 AM4/9/13
to israel-r-...@googlegroups.com
אם אני מבין נכון את הסיטואציה, יש מאגר מידע מאד מאד גדול. ולצורך העניין יש בו שני משתנים: משתנה אחד משמש לסלקציה של תת קבוצות, ומשתנה שני שבתכונותיו מתעניינים. רוצים לדעת האם ביצוע סלקציה על פי משתנה הסלקציה יוצר איזושהי הטיה משמעותית בהתפלגות של המשתנה המעניין (ביחס לכלל האוכלוסיה), או במלים פשוטות רוצים לדעת אם מדגם שנבחר על פי משתנה הסלקציה הוא מייצג.
לכאורה, כל מה שצריך לברר זה שאין מתאם בין משתנה הסלקציה למשתנה המעניין באוכלוסיה כולה. הבעיה: אי אפשר לבצע חישובים על האוכלוסיה כולה מפאת גודל הדאטה או סיבות טכניות אחרות.
הגישה לפתרון (כפי שאני מבין אותה), לבחור כמה מדגמים שונים שנבחרו על פי משתנה הסלקציה, ולבדוק האם יש שינויים משמעותיים  בהתפלגות של המשתנה המעניין בהשוואה בין המדגמים, אשר עשויה לרמז על מתאם משמעותי בין משתנה הסלקציה לבין המשתנה המעניין, אשר גורם למדגם להיות מוטה ביחס לאוכלוסיה כולה.
נדמה לי שחלק מההצעות שעלו כאן עוזרות. אני רק אוסיף את qqplot כאמצעי ויזואלי שמאפשר להשוות מדגם מול מדגם ולראות אם ההתפלגויות מתיישרות זו מול זו.

האם אני בכלל בכיוון הנכון בהבנת הבעיה?



2013/4/9 Jonathan Rosenblatt <john...@gmail.com>

Shlomo Yona

unread,
Apr 9, 2013, 3:21:28 AM4/9/13
to israel-r-...@googlegroups.com
בטח.
יש המון מכונות שמייצרות המון נתונים. המכונות הללו נמצאות ב-data centers שונים ובמקרים רבים יש להם מאפיינים שונים אלה מאלה. 
יש תהליך שדוגם נתונים מכלל המכונות. הדגימה נעשית בהתפלגות אחידה (על כל וקטור מידע מגרילים בהסתברות אחידה האם להתייחס לוקטור המידע, נניח אם הגרלתי אחיד מספר בין 0 ל-1 אז אבחר בוקטורי מידע כשתוצאת ההגרלה תיפול לי בין 1/10, כולל לבין 2/10, לא כולל).

עכשיו אני קיבלתי 4 קבצים עם תוצרי הגרלה שכאלה [באותו הזמן העמיסו את המכונות ככה שדגמו 4 פעמים ולא פעם אחת: ז"א הריצו 4 הגרלות...]

אני מחפש לקבל מדד איכותי וכמותי האם אני יכול לסמוך על המידע שמתקבל לי בכל "שורת מידע" בכל קובץ דגימות שכזה ועד כמה.
בעיני רוחי חשבתי לקבל זאת מתוך התבוננות בתוצרים מ-4 קבצי הדגימה (זה בשוטף לא יהיה לי... כי בשוטף ידגמו עם הגרלה אחת, כל התעסקות עם הגרלה היא "יקרה") ולקוות שאוכל לקבל מסקנה שאפשר להכליל אותה ולהשתמש בה בעתיד כשיתעסקו בנתונים שנדגמו.

האם זה מסביר היטב?

תודה.
שלמה


2013/4/9 Jonathan Rosenblatt <john...@gmail.com>

Shlomo Yona

unread,
Apr 9, 2013, 3:23:46 AM4/9/13
to israel-r-...@googlegroups.com
עמית, אתה מאוד בכיוון.
אני לומד הרבה מהדיון שמתקיים פה.
תודה גם על ההסבר שלך למה שאני מנסה להבין וגם על ההצעה.
שלמה


2013/4/9 amit gal <amit...@gmail.com>

Jonathan Rosenblatt

unread,
Apr 9, 2013, 3:51:39 AM4/9/13
to israel-r-...@googlegroups.com
לאור התשובות עד כה, אני מבין שזו בעייה של בדיקת שיווין התפלגויות בין מספר מדגמים. בפרט- אני לא רואה מה החשיבות של התהליך הספציפי של הדגימה הואיל וההשערה הנבדקת היא "כל המדגמים מאותה ההתפלגות".
אם כך, אז מבחן חי בריבוע לאי תלות שהציע דוד הוא כיוון מתבקש (אם הנתונים בדידים). 
אם הנתונים רציפים, אתה יכול להיעזר בדיון שכאן על מבחני קלמגורוב סמירנוב למספר מדגמים. החדשות הטובות הן שקל מאוד לבנות מבחן פרמוטציות שכזה.

יונתן


2013/4/9 Shlomo Yona <shlom...@gmail.com>



--
Jonathan Rosenblatt
www.john-ros.com

Shlomo Yona

unread,
Apr 9, 2013, 5:32:59 AM4/9/13
to israel-r-...@googlegroups.com
תודה רבה!!
שלמה


2013/4/9 Jonathan Rosenblatt <john...@gmail.com>
לאור התשובות עד כה, אני מבין שזו בעייה של בדיקת שיווין התפלגויות בין מספר מדגמים. בפרט- אני לא רואה מה החשיבות של התהליך הספציפי של הדגימה הואיל וההשערה הנבדקת היא "כל המדגמים מאותה ההתפלגות".
Reply all
Reply to author
Forward
0 new messages