چگونه با Custom Extraction در Screaming Frog داده استخراج کنیم؟
برای استخراج داده با Custom Extraction در Screaming Frog، ابتدا نوع استخراج (XPath، CSSPath یا Regex) را انتخاب کنید. سپس الگوی مورد نظر را وارد کرده و خزش را آغاز کنید. این ابزار داده های سفارشی را از صفحات وب استخراج می کند.
برای استخراج داده با Custom Extraction در Screaming Frog، ابتدا نوع استخراج (XPath، CSSPath یا Regex) را انتخاب کنید. سپس الگوی مورد نظر را وارد کرده و خزش را آغاز کنید. این ابزار داده های سفارشی را از صفحات وب استخراج می کند.
Custom Extraction (استخراج سفارشی) در ابزار Screaming Frog یک قابلیت قدرتمند برای جمع آوری داده های خاص از وب سایت ها است که به صورت پیش فرض توسط خزشگر (Crawler) جمع آوری نمی شوند. این ویژگی به متخصصان سئو تکنیکال اجازه می دهد تا اطلاعاتی مانند کدهای اسکیما (Schema Markup)، متاتگ های Open Graph، کدهای رهگیری (Tracking Codes) یا هر محتوای دیگری را که در کد منبع صفحه وجود دارد، استخراج و تحلیل کنند. با این روش، می توان به بینش های عمیق تری درباره ساختار و محتوای سایت دست یافت و مشکلات پنهان را شناسایی کرد.
Custom Extraction در Screaming Frog چیست و چرا برای سئو تکنیکال حیاتی است؟
- P1: "اسکریمینگ فراگ (Screaming Frog) یکی از شناخته شده ترین ابزارهای سئو آنلاین است، اما توانایی آن به خزش و نمایش اطلاعات استاندارد ختم نمی شود. Custom Extraction در Screaming Frog قابلیتی پیشرفته است که به شما امکان می دهد فراتر از گزارش های معمول ابزار عمل کنید و داده های سفارشی را از کدهای HTML صفحات وب سایت استخراج کنید. این ویژگی برای تحلیل عمیق سئو تکنیکال و کشف جزئیاتی که به صورت پیش فرض در دسترس نیستند، بسیار ضروری است.
دقت در انتخاب روش استخراج داده
انتخاب درست بین XPath، CSSPath و Regex برای استخراج داده های سفارشی، کلید موفقیت است. هر روش مزایا و محدودیت های خود را دارد و باید بر اساس ساختار HTML صفحه و پیچیدگی داده مورد نظر انتخاب شود تا از استخراج داده های اشتباه جلوگیری شود.
Custom Extraction چگونه به تحلیل عمیق سئو تکنیکال کمک می کند؟
قابلیت Custom Extraction در Screaming Frog ابزاری قدرتمند برای تحلیل عمیق سئو تکنیکال است. این ویژگی به متخصصان سئو کمک می کند تا داده های خاصی را از کدهای HTML صفحات استخراج کنند که در گزارش های پیش فرض خزش در دسترس نیستند. با این روش، مشکلات پنهان مانند خطاهای نشانه گذاری، تنظیمات نادرست تگ ها و عوامل مؤثر بر سرعت سایت کشف می شوند.
شناسایی مشکلات Schema Markup و Open Graph
وب سایت ها برای ارائه اطلاعات ساختاریافته به موتورهای جستجو و بهبود نمایش در نتایج، از نشانه گذاری اسکیما (Schema Markup) و تگ های Open Graph (اوپن گراف) استفاده می کنند. با Custom Extraction در Screaming Frog می توانید نبود این تگ ها را بررسی کنید یا محتوای آن ها را استخراج کنید. این کار به کشف خطاهای نگارشی، مقادیر نادرست یا حتی عدم وجود کامل این نشانه گذاری ها کمک می کند. به عنوان مثال، ممکن است متوجه شوید که تاریخ انتشار مقالات یا قیمت محصولات در اسکیما به درستی درج نشده است.
بررسی وضعیت تگ های Canonical و Hreflang
تگ های Canonical Tag و Hreflang برای جلوگیری از محتوای تکراری و مدیریت نسخه های چندزبانه سایت ضروری هستند. با استفاده از Custom Extraction، می توان به سرعت تمام URLهای دارای تگ کنونیکال را استخراج و مقادیر آن ها را بررسی کرد. این کار به شناسایی صفحاتی که به خودشان کنونیکال نشده اند یا به یک URL اشتباه اشاره می کنند، کمک می کند. بررسی وضعیت Hreflang هم با این روش امکان پذیر است تا از درستی آدرس دهی نسخه های زبانی مختلف اطمینان حاصل شود.
استخراج اطلاعات مربوط به سرعت و تجربه کاربری
عوامل موثر بر سرعت سایت و تجربه کاربری، مانند اندازه تصاویر، وجود کدهای CSS یا JavaScript مسدودکننده رندر، از طریق Custom Extraction قابل بررسی هستند. شما می توانید با تنظیم صحیح استخراج کننده، آدرس فایل های CSS و JS را جمع آوری کنید. حتی امکان استخراج ویژگی های خاصی از HTML که نشان دهنده تاخیر در بارگذاری یا مشکلات چیدمان هستند، وجود دارد. این داده ها تحلیل عمیق تری از وضعیت فنی سایت ارائه می دهد.
گام به گام: چگونه Custom Extraction را در Screaming Frog تنظیم کنیم؟
انتخاب حالت استخراج: XPath، CSSPath یا Regex
برای شروع کار با Custom Extraction در Screaming Frog، ابتدا باید به بخش «Configuration» و سپس «Custom» و در نهایت «Extraction» بروید. در این قسمت می توانید تا ۱۰ استخراج کننده (Extractor) مختلف را تعریف کنید. اولین قدم، انتخاب نوع استخراج کننده است: XPath (XML Path Language)، CSSPath (CSS Selector Path) یا Regex (Regular Expression). هر کدام از این روش ها برای سناریوهای متفاوتی کاربرد دارند. XPath برای پیمایش در ساختار سند HTML و انتخاب گره ها عالی است، در حالی که CSSPath بیشتر برای انتخاب عناصر بر اساس ویژگی های CSS مناسب است. Regex هم به شما اجازه می دهد الگوهای متنی پیچیده را در کدهای HTML پیدا کنید. انتخاب روش بستگی به نوع داده ای دارد که می خواهید استخراج کنید و میزان پیچیدگی آن.
وارد کردن عبارت استخراج (Extractor) و تست آن
پس از انتخاب نوع استخراج کننده، باید عبارت یا الگوی مورد نظر خود را در فیلد مربوطه وارد کنید. برای مثال، اگر می خواهید آدرس های Canonical (کنونیکال) را استخراج کنید، یک XPath مانند //link[@rel='canonical']/@href می تواند کاربردی باشد. یا برای استخراج متن از یک تگ H1، یک CSSPath مثل h1::text کار می کند. مهم ترین مرحله پس از وارد کردن الگو، تست کردن آن است. Screaming Frog به شما امکان می دهد الگوی وارد شده را روی یک URL خاص تست کنید تا مطمئن شوید داده های صحیح استخراج می شوند. این تست به سرعت نشان می دهد که آیا الگوی شما دقیق است یا نیاز به اصلاح دارد. یک اشتباه رایج، فراموش کردن پیش نمایش (Preview) نتیجه است که می تواند زمان زیادی را تلف کند.
تنظیمات پیشرفته و ذخیره سازی الگوها
علاوه بر انتخاب نوع و وارد کردن الگو، Screaming Frog چند گزینه پیشرفته برای Custom Extraction ارائه می دهد. می توانید انتخاب کنید که استخراج از عنصر HTML (Extract HTML Element)، متن (Extract Text) یا مقدار ویژگی (Extract Attribute Value) انجام شود. برای مثال، برای استخراج hreflang، باید مقدار ویژگی href یا hreflang را هدف قرار دهید. پس از تنظیم دقیق، می توانید الگوهای استخراج را برای استفاده های بعدی ذخیره کنید. این کار به خصوص برای پروژه های بزرگ یا سایت های مشابه بسیار مفید است و در وقت شما صرفه جویی می کند.
مقایسه روش های استخراج داده در Screaming Frog
هر یک از روش های استخراج داده در Screaming Frog برای سناریوهای متفاوتی مناسب هستند و انتخاب صحیح به نیاز شما بستگی دارد.
| شاخص مقایسه | XPath | CSSPath | Regex |
|---|---|---|---|
| پیچیدگی (Complexity) |
متوسط تا بالا | پایین تا متوسط | متوسط تا بالا |
| انعطاف پذیری (Flexibility) |
بالا (دسترسی به هر گره) | متوسط (بر اساس سلکتورها) | بالا (الگوهای متنی) |
| سرعت اجرا (Execution Speed) |
متوسط | بالا | پایین تا متوسط |
| مورد استفاده اصلی (Primary Use Case) |
ساختارهای پیچیده HTML | عناصر با کلاس/آیدی مشخص | استخراج متن از محتوا |
| دانش فنی لازم (Required Technical Knowledge) |
متوسط | پایین | بالا |
یکی از اشتباهات رایج در Custom Extraction، تعریف نادرست الگوهای استخراج است. این کار به جمع آوری داده های بی ربط یا ناقص منجر می شود و تحلیل های بعدی را گمراه می کند. همیشه پیش از اجرای خزش کامل، الگوهای خود را روی چند صفحه نمونه تست کنید تا از دقت آن ها مطمئن شوید.
چه داده های خاصی را می توان با Custom Extraction استخراج کرد؟
قابلیت Custom Extraction Screaming Frog به شما اجازه می دهد از مرز آنالیزهای پایه ای متاداده ها عبور کنید و هر داده ای را که در کد منبع وب سایت وجود دارد استخراج کنید. با نوشتن عبارت های CSSPath یا XPath می توانید بخش های پنهان یا ساختاریافته کد را به جدول داده های خروجی اضافه کنید.
استخراج داده های Schema Markup (JSON-LD, Microdata)
داده های ساختاریافته (Structured Data) معمولا در تگ های اسکریپت با نوع JSON-LD قرار دارند. با تنظیم یک استخراج کننده XPath مانند //script[@type='application/ld+json'] تمام کدهای اسکیما روی صفحات جمع آوری می شوند. بررسی وضعیت اسکیماهای قیمت محصول یا موجودی انبار در سایت های فروشگاهی بزرگ بدون این روش ساعات زیادی زمان می برد. گاهی خطاهای موجود در کدهای سمت کلاینت باعث رندر نشدن این اسکیماها می شود که در فرآیند سئو جاوا اسکریپت باید به دقت ردیابی و اصلاح گردند.
بررسی تگ های Open Graph و Twitter Card
نمایش صحیح لینک ها در شبکه های اجتماعی نیازمند وجود تگ های متا مانند og:title و og:image است. استفاده از CSSPath هایی نظیر meta[property^="og:"] امکان گردآوری تمام متاتگ های شبکه های اجتماعی را فراهم می کند. نبود تصویر شاخص یا درج کدهای اشتباه در این تگ ها ظاهر اشتراک گذاری را خراب می کند. اگر عنوان های یکسانی در صفحات مختلف استخراج شود، احتمال وجود محتوای تکراری در ساختار متاداده ها پررنگ می شود.
یافتن کدهای رهگیری (Tracking Codes) یا اسکریپت های خاص
بررسی وجود شناسه گوگل انالیتیکس (Google Analytics ID) یا گوگل تگ منجر روی تمام صفحات با روش دستی بسیار زمان بر است. شما می توانید با یک عبارت منظم (Regex) یا CSSPath ساده، شناسه دقیق مانند G-XXXXX را از دل اسکریپت ها بیرون بکشید. این تکنیک عدم نصب کد رهگیری روی صفحات جدید یا اجرای چندباره یک اسکریپت را سریعا مشخص می کند.
نکات پیشرفته و راه حل خطاهای رایج در Custom Extraction چیست؟
بهینه سازی عملکرد برای سایت های بزرگ
استخراج داده در پروژه های سنگین می تواند حافظه سیستم را شدیدا درگیر کند. اگر پروژه شما بیش از ۵۰ هزار آدرس دارد، تنظیم حافظه تخصیص یافته به نرم افزار در بخش Memory Configuration اهمیت بالایی دارد. نرخ درخواست ها در ثانیه را کنترل کنید؛ چرا که درخواست های هم زمان بالا فشار زیادی به سرور مقصد وارد می کند و حتی روند افزایش سرعت سایت را تحت تاثیر قرار می دهد.
عیب یابی خطاهای استخراج و نتایج خالی
دلیل اصلی خالی بودن جدول خروجی، تفاوت کدهای HTML خام با کدهای رندر شده توسط مرورگر است. اگر محتوای صفحه با جاوا اسکریپت بارگذاری می شود، حالت پردازش نرم افزار را روی رندرینگ جاوا اسکریپت (JavaScript Rendering) بگذارید. گاهی تغییر ساختار DOM یا بروز خطای Crawl Anomaly هنگام دسترسی به صفحات باعث می شود کدهای XPath یا Regex با هیچ کدی تطابق پیدا نکنند. حتما فرمول استخراج خود را پیش از اجرای کامل، روی چند آدرس نمونه تست کنید.
ترکیب Custom Extraction با سایر قابلیت های Screaming Frog
قدرت واقعی قابلیت Custom Extraction Screaming Frog زمانی مشخص می شود که آن را با APIهای گوگل متصل کنید. برای نمونه، می توانید داده های اسکیما یا متاتگ های خاص را استخراج کرده و هم زمان آمار کلیک سرچ کنسول را کنار آن ها قرار دهید. این روش، تحلیل صفحات کم ارزش یا فاقد داده ساختاریافته را هوشمندتر و سریع تر می کند.
چک لیست تعاملی تنظیم Custom Extraction
برای اطمینان از تنظیم صحیح Custom Extraction و دریافت داده های دقیق، موارد زیر را بررسی کنید.
بررسی تنظیمات استخراج سفارشی:
- هدف استخراج داده را به وضوح مشخص کرده اید؟
- مناسب ترین روش استخراج (XPath، CSSPath، Regex) را انتخاب کرده اید؟
- الگوی استخراج را روی چند URL نمونه تست کرده اید؟
- تنظیمات مربوط به خزش (مانند JavaScript rendering) را بررسی کرده اید؟
- داده های استخراج شده را از نظر صحت و کامل بودن بازبینی می کنید؟
- الگوهای استخراج را برای استفاده های بعدی ذخیره کرده اید؟
پرسش های متداول درباره Custom Extraction Screaming Frog (FAQ)
آیا Custom Extraction سرعت خزش را کاهش می دهد؟
بله، به دلیل پردازش اضافی برای هر صفحه، ممکن است سرعت خزش کمی کاهش یابد، به خصوص با الگوهای پیچیده یا تعداد زیاد استخراج کننده ها.
چگونه می توانم XPath یا CSSPath یک عنصر را پیدا کنم؟
می توانید با استفاده از ابزار Inspect (بررسی عنصر) مرورگر خود، روی عنصر مورد نظر راست کلیک کرده و گزینه "Copy" سپس "Copy XPath" یا "Copy selector" را انتخاب کنید.
آیا Custom Extraction برای سایت های بزرگ هم مناسب است؟
بله، اما نیاز به بهینه سازی تنظیمات و گاهی استفاده از سرورهای قوی تر دارد. همچنین می توان خزش را به بخش های کوچکتر تقسیم کرد.
آیا می توانم چندین Custom Extractor را همزمان استفاده کنم؟
بله، Screaming Frog به شما اجازه می دهد تا چندین Extractor را به طور همزمان برای استخراج داده های مختلف از یک صفحه تنظیم کنید.
نظرات (0)
اولین نفری باشید که نظر میدهید.
ثبت نظر