Der Youdao-Crawler geht mir gewaltig auf den Sack. An manchen Tagen
macht er die H�lfte meiner Zugriffe aus und probiert dabei alle
m�glichen Pfade durch, von "/j" �ber "/mc66" bis "/dshen".
<http://www.youdao.com/help/webmaster/spider/> kann ich nicht lesen.
Wie wird man diese Arschl�cher also los? Tut es
User-agent: Youdao
Disallow: /
in der robots.txt? Oder vielleicht mit "YoudaoBot"?
--
<http://schneegans.de/web/xhtml/> � Klare Antworten zu XHTML
Am 19.09.2009 17:33 schrieb Christoph Schneegans:
> <http://www.youdao.com/help/webmaster/spider/> kann ich nicht lesen.
> Wie wird man diese Arschl�cher also los? Tut es
>
> User-agent: Youdao
> Disallow: /
>
> in der robots.txt? Oder vielleicht mit "YoudaoBot"?
Evtl. den Inhalt, den hier keiner lesen kann, ich
<http://www.google.de/language_tools?hl=de> kopieren, dann auf Sprache
erkennen und hoffen es zu verstehen.
bei <http://www.youdao.com/help/webmaster/robot/> kommen so Sachen raus:
\\\
* Robots.txt Was n�tzt's?
* Wie robots.txt verwenden?
* Wie in der robots.txt-Datei zu schreiben?
* Wie Geben Sie einen anderen Web-Crawler?
///
Viel Gl�ck!
--
MfG - Lupus Goebel
Der Sumpf- Morasthobbybastler und Anfaenger mit
Wissensdurst (http://www.lupusdw.de http://foto.lupusdw.de)
Urlaub macht man in Irland: http://www.eaglesnest-bb.com/
> Evtl. den Inhalt, den hier keiner lesen kann, ich
> <http://www.google.de/language_tools?hl=de> kopieren, dann auf
> Sprache erkennen und hoffen es zu verstehen.
Wenn man sich da durchklickt, wird irgendwo "YodaoBot" erw�hnt.
Nein, nicht etwa "YoudaoBot", das w�re wohl zu leicht, obwohl
<http://www.yodao.com/> auf <http://www.youdao.com/> weiterleitet,
also letzteres wohl die kanonische Schreibweise sein sollte...
--
<http://schneegans.de/web/kanonische-adressen/> � Gute URLs
> Der Youdao-Crawler geht mir gewaltig auf den Sack. An manchen Tagen
> macht er die H�lfte meiner Zugriffe aus und probiert dabei alle
> m�glichen Pfade durch, von "/j" �ber "/mc66" bis "/dshen".
>
> <http://www.youdao.com/help/webmaster/spider/> kann ich nicht lesen.
> Wie wird man diese Arschl�cher also los? Tut es
>
> User-agent: Youdao
> Disallow: /
>
> in der robots.txt? Oder vielleicht mit "YoudaoBot"?
versuchs mal mit:
User-agent: Youdao*
Disallow: /
Bei mir h�lt er sich aber manchmal nicht dran. (Warum auch immer) Daher
hab ich diesen Spider gleich nochmal mit in die Apache-Config aufgenommen:
SetEnvIfNoCase User-Agent "^(envolk|Eurobot|Exabot|Gigabot|Youdao)"
Order allow,deny
Allow from all
Deny from env=bad_bot
Wenn Du keinen Zugriff auf die entsprechende Datei hast kannste ja auch
versuchen das �ber eine .htaccess einzubinden (vorausgesetzt Dein Hoster
erlaubt das)
MfG, Ulf
> Steht in den Logs nicht, unter welchem Namen der Bot zugreift?
Der User-Agent-Header sieht in der Tat so aus:
Nokia3650/1.0 SymbianOS/6.1 Series60/1.2 Profile/MIDP-1.0 Configuration/CLDC-1.0/
(compatible; YodaoBot-Mobile/1.0; http://www.youdao.com/help/webmaster/spider/; )
Idioten.
--
<http://schneegans.de/web/kanonische-adressen/> � Gute URLs
> Angeblich h�lt sich das Ding auch an die robots.txt (siehe
> <http://www.youdao.com/help/webmaster/robot/003/>):
Das versprechen viele, die Realit�t sieht anders aus. Bei mir dreht
der jobs.de robot durch.
Lutz
>> Wie kann man den Weg machen, nicht alle Links auf einer Seite kriechen?
>> Sie k�nnen den Kopf zur Seite, indem Sie dieses Meta-Informationen:
>> <META NAME="YodaoBot" CONTENT="NOFOLLOW">
Warum mu� man sowas f�r jeden Bot einzeln eintragen? Warum k�nnen
die sich nicht an einem allgemeinen NAME="Bot" orientieren?
Pa
>> Steht in den Logs nicht, unter welchem Namen der Bot zugreift?
> Der User-Agent-Header sieht in der Tat so aus:
>
> Nokia3650/1.0 SymbianOS/6.1 Series60/1.2 Profile/MIDP-1.0 Configuration/CLDC-1.0/
> (compatible; YodaoBot-Mobile/1.0; http://www.youdao.com/help/webmaster/spider/; )
Der Suchmaschinenserver l�uft auf einem Handy? Unter einer mobilen
Website stelle ich mir was anderes vor.
Pa
Kann man im Prinzip: http://www.robotstxt.org/meta.html
Warum der YodaoBot da eine Extrawurst haben will, wei� ich nicht. Aber
vielleicht akzeptiert er eh beides.
hp
Nein, der Bot tut so, als ob er auf einem Handy laufen w�rde, damit die
handy-spezifische Version der Seiten zu sehen bekommt. Offensichtlich
gibt es genug Websites die je nach User-Agent entscheiden, was sie
herzeigen, dass sich das auszahlt - Google macht das auch.
hp
Siehe z.B.
http://de.selfhtml.org/diverses/robots.htm
http://de.wikipedia.org/wiki/Robots_Exclusion_Standard
http://www.spider-trap.de/
Gruss
E. Gregor Fluge