نحوه عملکرد موتورهای جستجو
نحوه عملکرد موتورهای جستجو
دراین نوشتهیعلمی قصد داریم مقدمهای راجعبه نحوه شغل موتورهای جستجو به شما ارائه دهیم. این فرایندها مشتمل بر کرال، ایندکس و درجهبندی کردن صفحه ها و همچنین مفاهیم دیگری دراین مورد می باشد. پس با ما همراه باشید تا ببینیم موتورهای جستجو چطور کار میکنند؟ موتورهای جستجو با کرال کردن صدها میلیارد شیت با استعمال از خزندههای وبشان، شغل میکنند. این خزندههای وب معمولا به عنوان رباتهای موتور جستجو یا عنکبوت (spider) شناخته می شوند. یک موتور جستجو با لود کردن صفحات وب و دنبال کردن لینکها در این صفحات، آنانرا پیمایش خواهد کرد تا صفحات جدیدی که در دسترس هست را پیدا کند. در واقع، موتورهای جستجو، دستگاه پاسخگویی هستند. آن ها برای کشف، فهم و شعور و سازماندهی محتوای جانور در اینترنت به وجود آمدهاند تا بتوانند مرتبطترین نتایج را به سوالاتی که جستجوگران از آنها میپرسند، ارائه دهند. برای اینکه تارنما شما در نتایج جستجو علامت داده خواهد شد، شروع باید محتوایتان برای موتورهای جستجو قابل مشاهده باشد. حتما اصلیترین قسمت معمای seo این می باشد: در حالتیکه سایت شما پیدا نشود، هیچ راهی برای نمایش آن در SERP (صفحه نتایج موتور جستجو) وجود ندارد. برای این که ببینیم موتورهای جستجو چطور عمل میکنند، باید تلاش اساسی آن را استیناف کنیم. موتورهای جستجو از طریق سه همت اصلی کار میکنند: کرال کردن: تمام صفحه های وب را جستجو میکند. (کد یا محتوای هر URL را که پیدا کند، آن را جستجو خواهد کرد.) سئو در مشهد را با ما تجربه کنیدایندکس کردن: محتوای پیدا شده طی فرآیند کرالینگ را ذخیره و سازماندهی میکند. زمانی که یک شیت در ایندکس قرار گرفت، در حال اجرا می باشد تا برای سوالات مربوطه، نمایش داده خواهد شد. رنکینگ یا مرتبهبندی: برای هر کوئری، قسمتهایی از محتوا را ارائه میکند که به بهترین وجه به سوال کاربر پاسخ بدهد، این بدان معناست که حاصل به ترتیب از نزدیکترین به دورترین پاسخ، سکو میگیرند.
درین نوشتهعلمی با مطالب ذیل آشنا میشوید:
کرالینگ موتور جستجو چیست؟
اولین قدم برای اینکه بفهمیم موتورهای جستجو چطور کار میکنند، مبحث کرالینگ میباشد. کرالینگ (Crawling)، فرآیندی هست که بوسیله خزندههای وب موتور جستجو (رباتها یا عنکبوتها) برای بازدید و دانلود یک برگه و استخراج لینک و پیوندهای آن به منظور کشف کردن سایر صفحات، استفاده میگردد. در واقع کرال کردن، اولی قدم برای کشف صفحات جانور در وب میباشد. از آنجایی که یک رجیستری مرکزی برای تمامی صفحات وب وجود ندارد، گوگل می بایست دائما صفحه های جدید را جستجو و آنانرا به لیست صفحات شناخته شده خود، اضافه کند. اما بعضا از این صفحه ها شناخته شدهاند زیرا گوگل قبلا از آنها بازدید کرده است. وقتی گوگل لینکی از یک صفحه شناخته شده به یک ورقه نو را دنبال میکند، سایر صفحات دیسکاور (کشف) میشوند. زمانی رئیس وبوب سایت، لیستی از صفحه ها (نقشه وب سایت) را برای کرال شدن توسط گوگل ارسال میکند، سایر صفحه ها دیسکاور میشوند. در شرایطی که از یک وب هاست مدیریت شده مانند وردپرس یا Blogger به کار گیری میکنید، ممکن می باشد آنان به گوگل بگویند که هر برگه به روز شده یا جدیدی را که ایجاد کرد میکنید، جستجو کند. وقتی که گوگل یک URL صفحه را دیسکاور میکند، از آن شیت بازدید کرده یا عبور میکند، تا بفهمد چه چیزی در آن وجود دارااست. گوگل برگه را ارائه میدهد و متن و محتوای غیرمتنی آن را تجزیه و رسیدگی میکند تا تصمیم بگیرد که کجا می بایست این صفحه را در نتایج جستجو نشانه بدهد. هرچه گوگل خوب بتواند سایت شما را فهم کند، بهتر میتواند آن را به افرادی که درپی محتوای مرتبط با سایت شما میباشند، نشان بدهد. صفحات شناخته شده برای موتور جستجو بهصورت مجالای کرال میگردند تا مشخص و معلوم شود آیا از آخرین باری که رباتها از آن برگه بازدید کردهاند، تغییری در محتوای آن تاسیس شده است یا خیر. اگر یک موتور جستجو پس از کرال کردن یک صفحه، تغییرات آن را تشخیص دهد، این شاخص را در پاسخ به این تغییرات شناسایی شده، به روز میکند.
کرالینک وب چطور فعالیت میکند؟
موتورهای جستجو از خزنده وب خود برای دیسکاور کردن و دسترسی به صفحات وب استعمال میکنند. تمام کرالرهای موتور جستجو با بارگیری فایل robots.txt آن، که حاوی قوانینی درباره صفحه های هست که به موتورهای جستجو اجازه میدهند آن صفحه ها را کرال کنند. فایل robots.txt همچنین ممکن هست حاوی اطلاعاتی دربارهی نقشه وب سایت یا همان سایتمپ باشد. این فایل مشمول لیستی از URLهایی است که یک وبسایت، میخواهد خزندههای موتور جستجو آن ها را کرال کنند. خزندههای موتور جستجو از چند الگوریتم و قانون برای تعیین تعداد دفعات بازدید مجدد یک صفحه و ایندکس شدن تعداد صفحه های در یک سایت استعمال میکنند. مثلا، صفحهای که به طور منظم تغییر تحول میکند، ممکن است بیشتر از ورقهای که بندرت آپیدت میشود، کرال شود.
چه گونه میقدرت کرالرهای موتور جستجو را شناسایی کرد؟
رباتهای موتور جستجو که در حال کرال کردن یک تارنما هستند، میتوانند از طریق «حرفه استدلال کاربر» یا همان user agent string که هنگام درخواست صفحات وب به وب سرور منتقل می گردند، شناسایی شوند. در اینجا یکسری نمونه از حرفههای استدلال مخاطب که به وسیله موتورهای جستجو استعمال میشود را به شما معرفی خوا هیم کرد:
عامل کاربر Googlebot
Mozilla / 5.0 (compatible; Googlebot/2.1; +https://www.google.com/bot.html)
عامل کاربرBingbot
Mozilla/5.0 (compatible; bingbot/2.0; +https://www.bing.com/bingbot.htm)
عامل کاربر Baidu
Mozilla/5.0 (compatible; Baiduspider/2.0; +https://www.baidu.com/search/spider.html)
استدلال کاربر Yandex
Mozilla/5.0 (compatible; YandexBot/3.0; +https://yandex.com/bots)
هر کسی قادر است از user agent یا استدلال مخاطب مشابه موتورهای جستجو استفاده کند. با این حال، آدرس IP که درخواست را ایفا داده هست، میتواند تایید کند که این درخواست از سوی موتور جستجو آمده می باشد. این مراحل، DNS reverse lookup نامیده می گردد.
کرال شدن تصاویر و سایر پوشههای غیرمتنی
موتورهای جستجو معمولا عملکرد میکنند هر URLی که با آن عکس العمل میکنند را کرال و ایندکس کنند. با این هم اکنون، درحالتی که URL از نوع فایل غیرمتنی مانند تصویر، فیلم یا پوشه صوتی باشد، موتورهای جستجو معمولا قدرتمند به تلاوت محتوای فایل به غیر از نام آن و متادیتای مرتبط با آن نخواهند بود. اگرچه ممکن میباشد یک موتور جستجو تنها بتواند اطلاعات محدودی در ارتباط اشکال پوشههای غیرمتنی استخراج کند، اما باز هم میتوان آنها را ایندکس یا در حاصل جستجو جایگاهبندی کرد و از طریق آن، ترافیک بیشتری به دست آورد.
کرال کردن و دستیابی لینکها از صفحات
خزندهها با کرال کردن مجدد صفحات جان دار که قبلا در خصوص آن ها اطلاعات داشتهاند، صفحات جدید را دیسکاور کرده و آن گاه پیوندهای سایر صفحات را برای یافتن URLهای جدید استخراج میکنند. این URLهای جدید به صف صفحاتی که قرار است کرال شوند، اضافه میشوند تا بتوانند در حین دیگری دانلود شوند. از طریق این فرآیند در لینک و پیوندهای فالو، موتورهای جستجو حاذق به یافت کردن هر کاغذ وبی میباشند که در اینترنت موجود هست و حداقل از یک شیت دیگر به آن پیوند داده شده است.
برچسب: سئو در مشهد،