លោតទៅកាន់មាតិកា
S

sCrawler

អ្នកបោះពុម្ពផ្សាយ: SqrBox
បានស្វែងរកវីរុស Windows Free
ទាញយក v1.0 292 ការទាញយក
កំណែ1.0
អ្នកបោះពុម្ពផ្សាយ SqrBox
កាលបរិច្ឆេទចេញផ្សាយ18 មីនា 2013
កាលបរិច្ឆេទ​ដែល​បាន​បន្ថែម18 មីនា 2013
តម្រូវការ OsWindows
តម្រូវការ.NET Framework 3.5
ការទាញយកសរុប292
តម្លៃFree

ការពិពណ៌នា

មានហេតុផលជាច្រើនដែលមិនចេះចប់ ហេតុអ្វីបានជាបុគ្គល ឬក្រុមហ៊ុនចង់ប្រើកម្មវិធីរុករកគេហទំព័រ។ ប្រភេទនៃកម្មវិធីនេះរុករកគេហទំព័រតាមរបៀបដែលបានកំណត់ដែលអាចដោយស្វ័យប្រវត្តិ វិធីសាស្រ្ត ឬតាមលំដាប់លំដោយ។ ប្រសិនបើអ្នកទើបនឹងប្រើពាក្យថា web crawler software ប្រហែលជាអ្នកធ្លាប់លឺពីពីងពាង bots ស្រមោច សន្ទស្សន៍ស្វ័យប្រវត្តិ មនុស្សយន្ត ឬ scutters? ពួកគេទាំងអស់គឺដូចគ្នា!

គោលបំណងនៃកម្មវិធី Web Crawler

នៅពេលអ្នកគិតពីកម្មវិធីរុករកតាមអ៊ីនធឺណិត អ្នកប្រហែលជាមើលឃើញម៉ាស៊ីនស្វែងរកឈ្មោះធំៗដូចជា Google, Bing និង Yahoo។ bots របស់ពួកគេរុករកតាមគេហទំព័រដើម្បីកំណត់មាតិកា ភាពពាក់ព័ន្ធ និងការធ្វើលិបិក្រម។ តាមរយៈការបង្កើតច្បាប់ចម្លងនៃទំព័រដែលបានចូលមើល ពួកគេអាចផ្តល់នូវការស្វែងរកលឿន និងត្រឹមត្រូវជាងមុន។ SqrBox នឹងប្រាប់អ្នកថា អ្នកពិតជាមិនចាំបាច់ជាម៉ាស៊ីនស្វែងរក ដើម្បីមានតម្រូវការសម្រាប់កម្មវិធី crawler គេហទំព័រ។ អ្នកគ្រាន់តែត្រូវជាមនុស្សម្នាក់ដែលមានតម្រូវការក្នុងការប្រមូលបរិមាណច្រើន ឬព័ត៌មានស្មុគស្មាញបំផុត។

ប្រភេទនៃកម្មវិធី Web Crawler

ប្រសិនបើអ្នកមានគម្រោងប្រើប្រាស់សេវាកម្មរបស់ក្រុមហ៊ុនជំនាញដូចជា SqrBox អ្នកពិតជាមិនចាំបាច់ខ្វល់ខ្វាយជាមួយនឹងភាសាស្មុគស្មាញទាំងអស់ទាក់ទងនឹងកម្មវិធី crawler គេហទំព័រនោះទេ។ ទោះយ៉ាងណាក៏ដោយ វាមានប្រយោជន៍ក្នុងការយល់ដឹងអំពីរឿងមួយចំនួនអំពីវា។

Focused Crawling - គោលបំណងនៃប្រភេទនៃកម្មវិធី crawler គេហទំព័រនេះគឺដើម្បីទាញយកទំព័រដែលហាក់ដូចជាមានព័ត៌មានស្រដៀងគ្នា។ ជារឿយៗមានគុណវិបត្តិមួយចំនួនដែលទាក់ទងនឹងវិធីសាស្ត្រនេះ ហើយការអនុវត្តន៍ជាក់ស្តែង និងលទ្ធផលរបស់ crawler គឺអាស្រ័យលើថាតើតំណភ្ជាប់មានភាពសម្បូរបែបលើប្រធានបទជាក់លាក់នោះដែលកំពុងស្វែងរក។ ប្រភេទនៃកម្មវិធី crawler គេហទំព័រនេះត្រូវបានគេប្រើជាញឹកញាប់ជាចំណុចចាប់ផ្តើមដើម្បីបង្រួមការស្វែងរកសម្រាប់ការរុករកបន្ថែមទៀត។

ការធ្វើឱ្យ URL Normalization - កម្មវិធីស្វែងរកគេហទំព័រជាញឹកញាប់នឹងអនុវត្តកម្រិតមួយចំនួននៃការធ្វើឱ្យ URL មានលក្ខណៈធម្មតា ដែលជួយកាត់បន្ថយការរុករកដដែលៗនៃប្រភពដូចគ្នាច្រើនជាងម្តង។

ការដាក់កម្រិតលើតំណភ្ជាប់ដែលបានតាមដាន - ក្នុងករណីខ្លះ កម្មវិធីរុករកគេហទំព័រអាចចង់ជៀសវាងមាតិកាគេហទំព័រជាក់លាក់ ហើយស្វែងរកតែទំព័រ .html ប៉ុណ្ណោះ។ ដើម្បីធ្វើដូច្នេះ ជាញឹកញាប់ URL ត្រូវបានពិនិត្យ ហើយបន្ទាប់មកធនធាននឹងត្រូវបានស្នើសុំលុះត្រាតែមានតួអក្សរជាក់លាក់នៅក្នុង URL ដូចជា .html, .asp, .htm, .php, .aspx, .jspx ឬ .jsp ។ ជាធម្មតាកម្មវិធី crawler គេហទំព័រនឹងមិនអើពើធនធានជាមួយ "?" ដើម្បីជៀសវាងអន្ទាក់ពីងពាង។

កម្មវិធីស្រដៀងគ្នា

ជម្រើសផ្សេងៗ