ברדין / Bardeen
ברדין הוא כלי אוטומציה שלא רץ בענן אלא בדפדפן שלכם, ומשם נובעים גם כל היתרונות שלו וגם כל הבעיות. מנוע אוטומציה רגיל מדבר עם מערכות דרך ממשק מוגדר, ולכן הוא מוגבל לשירותים שהסכימו לפתוח ממשק כזה. הכלי הזה יושב כתוסף בדפדפן, רואה את המסך בדיוק כמו שאתם רואים אותו ופועל מתוך החשבון שכבר מחוברים אליו, ולכן הוא מגיע גם למקומות שאין להם ממשק בכלל. זו יכולת אמיתית שחוסכת שעות, והיא מגיעה עם שאלה משפטית שאי אפשר לדלג עליה ועם שבירות שכדאי להכיר מראש. סקירה של מה שהכלי באמת עושה, של התמחור, של הגבולות ושל התרחישים שבהם הוא באמת הבחירה הנכונה.
מה זה ברדין ואיך הוא פועל אחרת מכל השאר?
ברדין הוא כלי אוטומציה אמריקאי שהושק בשנת 2020, ומתקינים אותו כתוסף לדפדפן ולא כשירות שמתחברים אליו. ההבדל הזה נשמע טכני והוא בעצם ההבדל המרכזי בכל הסקירה: הכלי פועל מתוך ההרשאות שלכם באתר שאתם כבר מחוברים אליו, ולכן הוא רואה בדיוק את מה שאתם רואים.
בפועל עובדים בשלושה דפוסים. הראשון הוא תסריט שמפעילים בלחיצה: עומדים על עמוד, לוחצים, והכלי אוסף ממנו את מה שהגדרתם ומעביר אותו ליעד. השני הוא תסריט שמופעל לבד לפי לוח זמנים או לפי אירוע. השלישי הוא בונה איסוף, שבו מסמנים על המסך שדות בעמוד אחד והכלי לומד לזהות אותם בכל שאר העמודים מאותו סוג.
מעל שלושת אלה יושבת שכבה שמנסחת אוטומציה מתוך תיאור בשפה חופשית. מתארים מה רוצים, והכלי מרכיב הצעה לרצף פעולות שאפשר לערוך. זה עובד יפה בתרחישים שכיחים ופחות טוב כשהתהליך ייחודי, וזה בערך המצב בכל הקטגוריה כרגע. שווה לראות בזה נקודת פתיחה לעריכה ולא תוצר סופי.
הנקודה שקובעת אם הכלי יתאים לכם היא מה קורה כשהמחשב סגור. אוטומציה שרצה בדפדפן דורשת דפדפן פתוח, ולכן היא מצוינת לעבודה שאדם עושה ממילא מול המסך ובעייתית לתהליך שחייב לרוץ בשלוש לפנות בוקר. יש דרכים לעקוף את זה בחבילות הגבוהות, וזו עדיין נקודת המוצא שכדאי להתחיל ממנה.
הפיצ'רים המרכזיים של ברדין
שש יכולות מרכיבות את הכלי. השלישית היא זו שאין לאף מנוע ענן, והשישית היא זו שקובעת אם התסריט ישרוד חודש.
מסמנים שדות בעמוד אחד, והכלי חוזר על אותה קריאה בכל עמוד מאותו סוג.
כל אתר שאתם מחוברים אליו נגיש, גם כשאין לו ממשק חיצוני כלל.
התסריט זמין מתוך העמוד שעליו אתם עומדים, בלי לעבור למערכת אחרת.
אותו תסריט רץ לבד לפי שעה קבועה או כשמשהו מוגדר משתנה.
מתארים את התהליך במילים ומקבלים רצף פעולות ראשוני לעריכה.
טבלאות, מסדי ידע ומערכות לקוחות מקבלים את התוצאה בלי שלב ביניים.
ארבע הערות שלא תמצאו בעמוד המוצר. הראשונה: ההגעה לאתרים בלי ממשק היא הסיבה היחידה האמיתית לבחור בכלי הזה. אם כל מה שצריך הוא להעביר נתון בין שתי מערכות שיש להן ממשק, מנוע ענן יעשה את זה טוב יותר, יציב יותר וזול יותר. הערך כאן מתחיל בדיוק במקום שבו הדרך הרגילה נחסמת.
השנייה: תסריטי איסוף נשברים כשעמוד משתנה. הכלי מזהה שדות לפי המבנה של העמוד, וכל שינוי עיצוב אצל הצד השני מפיל את הזיהוי. זה אינו כשל של הכלי אלא תכונה של השיטה, והמסקנה המעשית היא שצריך אדם שיבדוק ויתקן, ולתכנן את זה מראש כעבודה חוזרת ולא כתקלה חד פעמית.
השלישית: העברית עוברת נכון והממשק אינו מתורגם. טקסט עברי נאסף ונכתב ליעד בלי שיבושים, כולל בטבלאות ובמסדי ידע, וזה החלק הפשוט. הממשק, התיעוד וניסוח האוטומציה מטקסט עובדים באנגלית, ולכן צוות שאינו קורא אנגלית טכנית יאבד כאן חלק ניכר מהערך.
הרביעית, והיא החשובה מכולן: יש כאן שאלה משפטית שלא נעלמת. איסוף אוטומטי של פרטים מרשתות מקצועיות מנוגד לתנאי השימוש של רובן, ועלול לגרור הגבלת חשבון. בנוסף, פרטים אישיים שנאספו ונשמרו כפופים לדיני הגנת הפרטיות בישראל, שהוחמרו מאוד בתיקון האחרון לחוק. זה לא אומר שאסור להשתמש בכלי, זה אומר שצריך להחליט מראש מה נאסף ולמה.
כמה זה עולה?
התמחור בנוי על נקודות שנצרכות לפי פעולות, ועל מספר המשתמשים. השילוב הזה עושה את הכלי זול מאוד לאדם אחד ויקר מהצפוי לצוות.
מכסת נקודות קטנה ותסריטים בסיסיים. מספיקה כדי להבין אם השיטה מתאימה.
מכסה אמיתית, הפעלה מתוזמנת ובונה איסוף. הבחירה של משתמש יחיד.
שיתוף תסריטים, הרשאות והרצה בענן. כאן החשבון מתחיל להיות מורגש.
בקרת גישה, ביקורת ותמיכה. רלוונטית כשהאיסוף נוגע בפרטים אישיים.
הפער בין החבילה האישית לצוותית הוא הדבר הראשון שכדאי לבדוק, כי הוא פי חמישה בערך. משתמש בודד שאוסף נתונים לעצמו נמצא בעסקה מצוינת, וצוות של ארבעה מגיע לחשבון שנמצא כבר בטריטוריה של מערכות רציניות אחרות. לפני שמרחיבים לצוות שווה לשאול אם באמת כולם צריכים לערוך, או שמספיק שאדם אחד מפעיל וכולם מקבלים את התוצאה.
הצריכה בפועל מפתיעה לשני הכיוונים. תסריט שאוסף חמישים שורות מעמוד אחד צורך מעט, ותסריט שעובר על מאתיים פרופילים ואוסף מכל אחד חמישה שדות צורך פי כמה. מי שמתכנן איסוף בנפח גדול צריך למדוד את הצריכה על מדגם קטן לפני שמריץ על הכול, אחרת המכסה נגמרת באמצע והתוצאה חלקית בלי שיודעים אילו שורות חסרות.
ההשוואה הכלכלית הנכונה כאן אינה מול מנוע אוטומציה אלא מול שעות אדם. איסוף ידני של מאה רשומות מאתר ללא ממשק לוקח בין שעתיים לארבע, וכלי כזה מוריד את זה לעשרים דקות כולל בדיקה. שתי הרצות בחודש כבר מחזירות את המנוי האישי. הכיוון ההפוך נכון גם הוא: מי שעושה את זה פעם ברבעון ישלם מנוי שנתי על עבודה של יומיים, וזה כמעט תמיד לא משתלם.
בפרויקט מחקר שוק לחברת שירותים, איסוף של מאה ושמונים רשומות מאתר ללא ממשק ירד משלושה ימי עבודה לכשעה וחצי, כולל בדיקה ידנית של מדגם. מה שלקח יותר זמן מהאיסוף היה ההחלטה אילו שדות מותר בכלל לשמור.
מתוך מחקר שוק לחברת שירותיםהסעיף היקר באמת אינו במחירון והוא זמן התחזוקה. תסריט איסוף שנבנה היום יישבר בממוצע תוך חודשיים עד ארבעה, כי הצד השני שינה עיצוב או הוסיף שלב אימות. התיקון עצמו לוקח עשר דקות למי שבנה, והבעיה היא שאף אחד לא שם לב שהוא נשבר עד שמישהו מגלה שהטבלה ריקה שבועיים. מי שמתכנן להישען על איסוף אוטומטי חייב להגדיר בדיקה שבועית קצרה, אחרת הוא מקבל נתונים חלקיים ומחליט לפיהם בלי לדעת.
ברדין מול מנועי אוטומציה ומול איסוף ידני
שלוש דרכים עומדות מול מי שצריך להעביר מידע מאתר למערכת: מנוע אוטומציה בענן, כלי שרץ בדפדפן כמו זה, או אדם שמעתיק ומדביק. ההבדל ביניהן אינו במהירות אלא בשאלה אם לצד השני יש בכלל ממשק שמוכן לדבר אתכם.
מול מנועי הענן, אין כאן תחרות אמיתית אלא חלוקת עבודה. מנוע ענן יציב יותר, רץ בלי מחשב פתוח ומתחבר למאות שירותים דרך ממשק מסודר, ולכן הוא הבחירה הנכונה לכל תהליך שאפשר לבצע בדרך הזאת. הכלי הזה נכנס רק כשהדרך הזאת חסומה. הדפוס שעובד הוא שהאיסוף נעשה בדפדפן, והתוצאה נשלחת החוצה למנוע שממשיך את התהליך ומעדכן את שאר המערכות.
מול איסוף ידני, השאלה היחידה היא נפח ותדירות. מאה רשומות פעם בשנה עדיף לאסוף ידנית ולסיים עם זה, ומאה רשומות כל שבועיים מצדיקות תסריט בלי היסוס. הגבול נמצא בערך בשלוש הרצות: מהשלישית והלאה הכלי כבר החזיר את עצמו, כולל זמן הבנייה והתיקונים.
שאלה שחוזרת אצל לקוחות היא מה עושים עם מה שנאסף, ושם רוב הפרויקטים נופלים. רשימה של מאתיים שורות אינה שווה כלום עד שהיא נכנסת למקום שבו מישהו עובד. כשהיעד הוא מערכת הלקוחות HubSpot צריך לוודא שהשדות תואמים ושאין כפילות מול מה שכבר קיים, וכשהיעד הוא לוח עבודה כמו מערכת הניהול Monday צריך להחליט מי מקבל את המשימה. כשהיעד הוא מסד ידע כמו מערכת הידע Notion השאלה משתנה שוב, כי שם המידע נצבר בלי שאיש אחראי לנקות אותו, וטבלה שגדלה בלי בקרה הופכת תוך חצי שנה למקום שאיש כבר לא סומך עליו. את המבנה הזה אני בונה כחלק מאוטומציה לניהול לידים בכל פרויקט שכולל איסוף חיצוני.
שימוש שני שמתאים לכלי הזה הוא מחקר ולא לידים, וכאן הוא נקי מבעיות. איסוף מחירים מעמודי מוצר, מעקב אחרי שינויים בעמודי שירות של מתחרים, או ריכוז תוכן שפורסם בתחום, כל אלה הם מידע פומבי שאין בו פרטים אישיים. מי שעובד בקידום אתרים כבר מקבל את רוב התמונה ממערכת המחקר SEMrush, והחורים שנשארים הם בדיוק המקומות שדורשים איסוף ידני. שם תסריט אחד חוסך יום עבודה בכל חודש.
הרובד השלישי הוא מה שהכלי הזה לא יעשה בשבילכם, וזו נקודה שאני מדגיש מול לקוחות: הוא אוסף, הוא לא מחליט. רשימת מתחרים שנאספה אינה ניתוח תחרותי, ורשימת מילות חיפוש אינה אסטרטגיה. הפער בין הנתון להחלטה נשאר אנושי לגמרי, וזה בדיוק הפער שבו נמצאת העבודה. בשירות קידום אתרים אורגני אני משתמש באיסוף אוטומטי כדי לקצר את שלב הליקוט, ואת השעות שהתפנו מפנה לשלב שבו באמת מחליטים מה לעשות.
המסקנה מהשטח: זה כלי משלים ולא תשתית. מי שמנסה לבנות עליו את מערך האוטומציה של העסק יגלה שהוא שביר ותלוי במחשב פתוח, ומי שמשתמש בו בדיוק במקום שבו אין ממשק יקבל ערך שאף כלי אחר לא נותן.
הפיצ'ר שעושה את ההבדל: השער שבודק מה מותר לשמור
היכולת לאסוף נתונים מכל מסך היא החלק הקל, ומה שמפריד בין פרויקט שמחזיק לבין פרויקט שמייצר חשיפה הוא שער אחד שבודק כל שורה לפני שהיא נשמרת. ההבחנה המעשית פשוטה: מידע על חברה, על מוצר או על מחיר הוא מידע עסקי, ופרטים שמזהים אדם מסוים הם קטגוריה אחרת לגמרי עם חובות משלה. הקוד למטה מדגים מקלט שמקבל את מה שהתסריט אסף, מפריד בין השניים, מסמן שורות שדורשות בסיס חוקי לשמירה, מנקה כפילויות, ומייצר קובץ לבדיקה אנושית לפני שמשהו נכנס למערכת.
# מקלט לתוצאות איסוף: הפרדה בין מידע עסקי לפרטים אישיים לפני שמירה
import csv
import hashlib
import json
import re
from datetime import datetime, timezone
# שדות שמזהים אדם מסוים. שמירתם דורשת בסיס חוקי ומדיניות מחיקה
PERSONAL_FIELDS = {"full_name", "email", "phone", "profile_url", "job_title"}
# שדות עסקיים. אלה מידע פומבי על ארגון ולא על אדם
BUSINESS_FIELDS = {"company", "domain", "industry", "size", "city", "price"}
EMAIL_RE = re.compile(r"^[^@\s]+@[^@\s]+\.[a-z]{2,}$", re.I)
REVIEW_PATH = "collected-for-review.csv"
def normalize_domain(value):
# דומיין הוא המפתח היציב ביותר לזיהוי ארגון, ולכן מנרמלים אותו קודם
value = (value or "").strip().lower()
value = re.sub(r"^https?://", "", value)
value = re.sub(r"^www\.", "", value)
return value.split("/")[0]
def row_fingerprint(row):
domain = normalize_domain(row.get("domain"))
email = (row.get("email") or "").strip().lower()
return hashlib.sha1((domain + "|" + email).encode("utf-8")).hexdigest()
def classify(row):
present_personal = {k for k in row if k in PERSONAL_FIELDS and row.get(k)}
if not present_personal:
return "business", present_personal
return "personal", present_personal
def validate(row):
problems = []
if not normalize_domain(row.get("domain")):
problems.append("missing_domain")
email = (row.get("email") or "").strip()
if email:
if not EMAIL_RE.match(email):
problems.append("bad_email")
return problems
def run(payload_path, legal_basis=None):
rows = json.load(open(payload_path, encoding="utf-8"))
seen, clean, blocked = set(), [], []
for row in rows:
fp = row_fingerprint(row)
if fp in seen:
continue
seen.add(fp)
problems = validate(row)
kind, personal_fields = classify(row)
# שורה עם פרטים אישיים נשמרת רק כשהוגדר בסיס חוקי מפורש
if kind == "personal":
if not legal_basis:
blocked.append({"fingerprint": fp, "reason": "no_legal_basis",
"fields": sorted(personal_fields)})
continue
row["legal_basis"] = legal_basis
row["retention_review"] = "90d"
if problems:
blocked.append({"fingerprint": fp, "reason": ",".join(problems)})
continue
row["fingerprint"] = fp
row["collected_at"] = datetime.now(timezone.utc).isoformat()
row["kind"] = kind
clean.append(row)
# הקובץ הזה נועד לעין אנושית. שום שורה לא נכנסת למערכת לפני שמישהו עבר עליו
if clean:
with open(REVIEW_PATH, "w", encoding="utf-8-sig", newline="") as f:
writer = csv.DictWriter(f, fieldnames=sorted(clean[0].keys()))
writer.writeheader()
writer.writerows(clean)
return {"received": len(rows), "ready": len(clean), "blocked": len(blocked),
"reasons": blocked[:20]}
# שלושה כללים שהופכים איסוף אוטומטי למשהו שאפשר להגן עליו
# כלל 1: מידע על ארגון ומידע על אדם אינם אותה קטגוריה, וההפרדה נעשית בקוד
# כלל 2: שום שורה לא נכנסת ישירות למערכת. קובץ ביניים לבדיקה עולה דקה ומציל
# כלל 3: לכל שורה אישית נשמר תאריך איסוף ומועד בדיקה מחדש, אחרת אין מחיקה לעולם
מה שהשער הזה נותן אינו הגנה משפטית אלא סדר. ברוב הפרויקטים שראיתי, השאלה מה מותר לשמור עלתה רק אחרי שכבר נאספו אלפי שורות, וההתמודדות עם זה בדיעבד קשה בהרבה מלהחליט מראש. חמש שורות קוד שמפרידות בין מידע על חברה למידע על אדם חוסכות דיון שלם בהמשך, וגם מייצרות תיעוד שאפשר להראות.
הכלל השני הוא זה שאני מתעקש עליו: קובץ ביניים לבדיקה לפני שמשהו נכנס למערכת. איסוף אוטומטי מייצר בערך חמישה עד עשרה אחוזים שורות משובשות, שדות שהתערבבו, ערכים ריקים ורשומות מעמוד שנטען חלקית. שורה משובשת שנכנסה למערכת הלקוחות נשארת שם שנים ומזהמת כל דוח שמסתמך עליה. שתי דקות של מבט אנושי על קובץ אחד מונעות את זה לגמרי.
חסרונות שאתם צריכים לדעת
עכשיו לצד השני של המשוואה. שישה חסרונות, והראשון שבהם הוא סיבה מספקת בפני עצמה לוותר על הכלי בחלק מהעסקים.
איסוף פרטים אישיים כפוף לדיני פרטיות ולתנאי השימוש של האתר הנאסף.
רוב התסריטים דורשים מחשב פועל. תהליך לילי אינו התרחיש שלו.
שינוי עיצוב אצל הצד השני מפיל את הזיהוי, ולרוב בלי הודעת שגיאה.
המעבר מחבילה אישית לצוותית מכפיל את החשבון פי כמה לאותה עבודה.
אין תרגום לעברית, וניסוח האוטומציה מטקסט עובד באנגלית בלבד.
פעולה אוטומטית מהחשבון שלכם עלולה להיתפס כחריגה ולגרור חסימה.
החיסרון הראשון דורש התייחסות רצינית ולא הערת שוליים. איסוף מידע פומבי על חברות, מחירים ומוצרים הוא פעולה לגיטימית שנעשית כל יום. איסוף שמות, כתובות דואר וטלפונים של אנשים מסוימים כדי לפנות אליהם הוא משהו אחר לגמרי: הוא מתנגש בדרך כלל בתנאי השימוש של האתר שממנו נאסף, והוא כפוף לחובות שנקבעו בדיני הגנת הפרטיות בישראל, שהוחמרו מאוד בשנים האחרונות. ההמלצה המעשית שלי פשוטה: להשתמש בכלי למחקר ולמידע עסקי בלב שלם, ולפני כל איסוף שנוגע באנשים לשאול מה הבסיס לשמירה ומתי מוחקים.
היתרונות שעושים את ברדין שווה
ומולם, שש סיבות שבגללן הכלי הזה יושב אצלי בדפדפן גם אחרי שהמערך העיקרי בנוי במקום אחר.
היכולת היחידה שלא קיימת בשום מנוע ענן, וזו הסיבה האמיתית לבחור.
מסמנים שדות על המסך ומקבלים תסריט. אין תלות באיש פיתוח.
לא צריך לעבור למערכת אחרת. לוחצים במקום שבו כבר עובדים.
שלוש הרצות מכסות את המנוי ואת זמן הבנייה, בהשוואה לעבודה ידנית.
התוצאה נשלחת החוצה למנוע אוטומציה שממשיך את התהליך כרגיל.
מחירים, שירותים ותוכן של מתחרים, בלי לגעת בפרטים אישיים בכלל.
היתרון שמורגש מיד הוא היעלמות המשימה שאף אחד לא רוצה לעשות. בכל עסק יש עבודה של העתקה והדבקה שנדחית שוב ושוב כי היא משעממת, ולכן היא נעשית באיחור ובחלקיות. תסריט שרץ בעשרים דקות במקום ביום עבודה משנה לא רק את הזמן אלא את התדירות, ופתאום הנתון מתעדכן כל שבוע במקום כל רבעון. זה נכון במיוחד לנתונים שמערכות המחקר המסחריות אינן מכסות: מערכת המחקר Ahrefs תראה לכם את פרופיל הקישורים של מתחרה ואת מבנה התוכן שלו, והיא לא תדע לספר מה כתוב בעמוד החבילות שהוא עדכן אתמול.
יתרון שני שקל לפספס הוא שאין כאן שלב פיתוח בכלל. בונים תסריט על ידי סימון על המסך, ולכן איש תוכן או איש שיווק יכול לבנות ולתקן בעצמו. זה הופך את הכלי לזמין באותם מקומות שבהם מנוע רציני היה נשאר על הנייר בהמתנה לאיש פיתוח פנוי. בפרויקטים שריכזתי בעמוד הפרויקטים אני רואה שוב ושוב שהכלי שנכנס לשימוש הוא לא הטוב ביותר אלא זה שמישהו בצוות מרגיש בנוח לתקן.
מתי לבחור ברדין ומתי לבחור מנוע ענן?
כאן ההכרעה קלה יחסית, כי היא נופלת על שאלה אחת מכריעה ועוד שתיים שמסייגות אותה: האם לצד השני יש בכלל ממשק, ומה נאסף, ומי יתקן כשזה יישבר.
המקור אינו מציע ממשק חיצוני, והמידע שנאסף הוא עסקי ולא אישי.
לשני הצדדים יש ממשק, והתהליך חייב לרוץ גם כשאף מחשב אינו פתוח.
מדובר בפחות משלוש הרצות בשנה, ואין מי שיתחזק תסריט שנשבר.
# עץ החלטה לאיסוף מידע ממקור חיצוני
שאלה 1: האם למקור יש ממשק חיצוני?
כן, מתועד וזמין --> מנוע ענן, יציב וזול יותר
יש אך מוגבל מאוד --> לבדוק אם המגבלה חוסמת בפועל
אין בכלל --> ברדין או כלי דפדפן אחר
שאלה 2: מה בדיוק נאסף?
מחירים ומוצרים --> מידע עסקי, אין מניעה
שמות חברות ותחומים --> מידע עסקי, לתעד מקור
פרטים של אנשים --> לעצור, להגדיר בסיס חוקי ומועד מחיקה
שאלה 3: באיזו תדירות?
פעם ברבעון או פחות --> ידנית, זול יותר מלתחזק תסריט
כל שבועיים --> תסריט מחזיר את עצמו מהר
יומי --> תסריט, ולוודא שמישהו בודק שהוא רץ
שאלה 4: מי מתקן כשזה נשבר?
מי שבנה, זמין --> אפשר להישען על זה
ספק חיצוני --> לוודא בדיקה שבועית בהסכם
אף אחד --> לא לבנות תלות, נתון חלקי גרוע מאין נתון
הטעות הראשונה שאני פוגש היא להישען על נתון שנאסף בלי לבדוק שהאיסוף עדיין רץ. תסריט שנשבר אינו שולח הודעה, הוא פשוט מפסיק להוסיף שורות, והטבלה נראית בדיוק כמו קודם רק בלי המידע החדש. שתי דקות בשבוע שבהן מסתכלים על תאריך השורה האחרונה פותרות את זה, וזו הבדיקה שנשמטת אצל כמעט כולם.
הטעות השנייה היא לאסוף הכול כי אפשר. ברגע שהאיסוף קל, הפיתוי לשמור כל שדה שמופיע על המסך גדול, והתוצאה היא מאגר שמלא בפרטים שאין להם שימוש ויש להם חובות. הכלל שאני עובד לפיו הוא לאסוף רק שדות שיש להם שימוש מוגדר כבר עכשיו, ולא שדות שאולי יהיו שימושיים מתישהו. זה חוסך גם עבודה וגם חשיפה.
השורה התחתונה: האם ברדין שווה?
נסכם בכנות: זה כלי צר ומצוין, ולא תשתית. הוא עושה דבר אחד שאין לאף מנוע ענן, והדבר האחד הזה שווה הרבה כשנתקלים בו. ברגע שמנסים להרחיב אותו לכל מערך האוטומציה של העסק מגלים את המגבלות מהר: תלות במחשב פתוח, תסריטים ששבירים לשינוי עיצוב, וקפיצת מחיר משמעותית ברגע שהצוות גדל.
הפרופילים שעבורם זה מתאים: אנשי מחקר שוק ואנשי תוכן שאוספים מידע פומבי, צוותי מכירות שעובדים ממילא מול המסך ומעבירים משם נתונים למערכת, סוכנויות שמרכזות מידע על מתחרים עבור לקוחות, וכל מי שנתקל שוב ושוב במקור שאין לו ממשק. ומנגד, זה לא מתאים לתהליכים שחייבים לרוץ ברקע, ולא לכל עסק שהאיסוף שלו נוגע בפרטים אישיים בלי שהוגדרה מדיניות ברורה.
ארבעה צעדים למי שמתחיל. ראשית, לבחור מקור אחד בלבד ולבנות עליו תסריט שלם, כי רק כך מתגלה כמה תחזוקה זה דורש. שנית, להחליט לפני האיסוף אילו שדות נשמרים ולמה, ולא אחריו. שלישית, להוסיף בדיקה שבועית קצרה שמוודאת שהתסריט עדיין רץ. רביעית, לחבר את התוצאה למקום שבו מישהו באמת עובד, כי טבלה שאיש לא פותח היא בזבוז מלא. לתיאום שיחת ייעוץ על מערך איסוף ואוטומציה שמתאים לעסק, כולל השאלה מה נכון לאסוף מלכתחילה.
ומחשבה אחת שמסכמת את הקטגוריה כולה. הפיתוי בכלים כאלה הוא לחשוב שהם מייצרים ידע, והם מייצרים חומר גלם בלבד. רשימה של מאתיים מתחרים היא לא ניתוח, וטבלה של מחירים היא לא אסטרטגיית תמחור. מה שהכלי חוסך זה בדיוק את החלק שאדם עושה גרוע ובשעמום, ומה שהוא לא נוגע בו הוא החלק שבו מסתכלים על הנתונים ומחליטים. מי שמצפה שהכלי יעשה גם את החלק השני יישאר עם קבצים ובלי החלטות. שאר הסקירות בקטגוריה, וגם הדרך שבה אני מחבר ביניהן לתהליך אחד, מרוכזות באתר של דביר נעמן.
שיתוף הפוסט
שאלות ותשובות
האם ברדין עובד בעברית?
טקסט עברי נאסף ונכתב ליעד בלי שיבושים, כולל בטבלאות, במסדי ידע ובמערכות לקוחות, וזה החלק שעובד. הממשק והתיעוד באנגלית בלבד ואין תרגום, וגם היכולת לנסח אוטומציה מתיאור חופשי עובדת באנגלית. צוות שאינו קורא אנגלית טכנית יאבד כאן חלק ניכר מהערך, ולכן כדאי שאדם אחד לפחות יהיה נוח בשפה.
האם מותר לאסוף פרטים מאתרים?
צריך להפריד בין שני מקרים. איסוף מידע עסקי פומבי, כמו מחירים, מוצרים ושמות חברות, הוא פעולה לגיטימית ורווחת. איסוף פרטים שמזהים אדם מסוים מתנגש בדרך כלל בתנאי השימוש של האתר וכפוף לדיני הגנת הפרטיות בישראל, שהוחמרו מאוד. לפני איסוף כזה צריך להגדיר מה הבסיס לשמירה ומתי מוחקים, ולא לדחות את השאלה.
צריך מחשב פתוח כדי שזה ירוץ?
ברוב התסריטים כן, וזו המגבלה המעשית העיקרית של השיטה. הכלי פועל מתוך הדפדפן ומתוך החשבון שאתם מחוברים אליו, ולכן דפדפן סגור פירושו אוטומציה שלא רצה. בחבילות הגבוהות יש אפשרויות הרצה בענן לחלק מהתרחישים, ובכל מקרה תהליך שחייב לרוץ בלילה בלי התערבות מתאים יותר למנוע ענן רגיל.
מה קורה כשהאתר משנה עיצוב?
התסריט מפסיק לזהות את השדות ובדרך כלל שותק במקום להתריע. זו התכונה המסוכנת ביותר בכל השיטה, כי הטבלה נראית תקינה ופשוט מפסיקה להתמלא. התיקון עצמו לוקח דקות למי שבנה את התסריט, והבעיה היא הזמן שעובר עד שמישהו מבחין. בדיקה שבועית של תאריך השורה האחרונה מספיקה כדי לסגור את הפער.
מה ההבדל בין זה למנוע אוטומציה?
מנוע אוטומציה מדבר עם מערכות דרך ממשק מוגדר, ולכן הוא יציב, רץ ברקע ומתחבר למאות שירותים. הכלי הזה פועל דרך המסך ודרך ההרשאות שלכם, ולכן הוא מגיע גם לאתרים שאין להם ממשק כלל. השניים אינם מתחרים אלא משלימים: האיסוף נעשה בדפדפן, והתוצאה נשלחת למנוע שממשיך את התהליך ומעדכן את המערכות.
כמה זה עולה בפועל?
יש חבילה חינמית עם מכסת נקודות קטנה שמספיקה לבדיקה רצינית, חבילה אישית בסביבות עשרים דולר בחודש שמתאימה למשתמש יחיד, וחבילה צוותית שקופצת לסביבות מאה דולר למשתמש. הפער בין השתיים הוא הדבר הראשון שכדאי לבדוק, ולעיתים עדיף שאדם אחד יפעיל את התסריטים והתוצאה תשותף לשאר במקום להרחיב לכולם.
אפשר להשתמש בזה למחקר מתחרים?
כן, וזה השימוש הנקי והמומלץ ביותר. מעקב אחרי מחירים בעמודי מוצר, שינויים בעמודי שירות, תוכן חדש שפורסם בתחום או השוואת חבילות, כל אלה הם מידע פומבי על ארגונים ואין בהם פרטים אישיים. מערכות מחקר מסחריות נותנות את רוב התמונה, והכלי הזה סוגר בדיוק את החורים שדורשים היום עבודה ידנית.
האם החשבון שלי בסיכון?
יש סיכון אמיתי ולא תיאורטי. פעולה אוטומטית בקצב גבוה מתוך החשבון שלכם עלולה להיתפס אצל האתר הנאסף כחריגה מתנאי השימוש ולגרור הגבלה או חסימה, במיוחד ברשתות מקצועיות. הדרך להקטין את הסיכון היא להריץ בקצב אנושי, לא לאסוף בנפחים גדולים ברצף, ולהימנע לגמרי משימוש בחשבון שאתם לא יכולים להרשות לעצמכם לאבד.