[poipiku] use 'img-org.poipiku.com' as image domain (#2796)

This commit is contained in:
Mike Fährmann
2022-09-12 11:21:01 +02:00
parent 4ca1a6e5f3
commit 673b6f1218

View File

@@ -42,6 +42,7 @@ class PoipikuExtractor(Extractor):
'<h2 class="UserInfoUserName">', '</').rpartition(">")[2]), '<h2 class="UserInfoUserName">', '</').rpartition(">")[2]),
"description": text.unescape(extr( "description": text.unescape(extr(
'class="IllustItemDesc" >', '<')), 'class="IllustItemDesc" >', '<')),
"_http_headers": {"Referer": post_url},
} }
yield Message.Directory, post yield Message.Directory, post
@@ -54,7 +55,8 @@ class PoipikuExtractor(Extractor):
elif thumb.startswith(("//img.poipiku.com/img/", "/img/")): elif thumb.startswith(("//img.poipiku.com/img/", "/img/")):
continue continue
post["num"] += 1 post["num"] += 1
url = text.ensure_http_scheme(thumb[:-8]) url = text.ensure_http_scheme(thumb[:-8]).replace(
"//img.", "//img-org.", 1)
yield Message.Url, url, text.nameext_from_url(url, post) yield Message.Url, url, text.nameext_from_url(url, post)
if not extr('> show all', '<'): if not extr('> show all', '<'):
@@ -80,7 +82,8 @@ class PoipikuExtractor(Extractor):
for thumb in text.extract_iter( for thumb in text.extract_iter(
page, 'class="IllustItemThumbImg" src="', '"'): page, 'class="IllustItemThumbImg" src="', '"'):
post["num"] += 1 post["num"] += 1
url = text.ensure_http_scheme(thumb[:-8]) url = text.ensure_http_scheme(thumb[:-8]).replace(
"//img.", "//img-org.", 1)
yield Message.Url, url, text.nameext_from_url(url, post) yield Message.Url, url, text.nameext_from_url(url, post)
@@ -91,7 +94,7 @@ class PoipikuUserExtractor(PoipikuExtractor):
r"(\d+)/?(?:$|[?&#])") r"(\d+)/?(?:$|[?&#])")
test = ( test = (
("https://poipiku.com/25049/", { ("https://poipiku.com/25049/", {
"pattern": r"https://img\.poipiku\.com/user_img\d+/000025049" "pattern": r"https://img-org\.poipiku\.com/user_img\d+/000025049"
r"/\d+_\w+\.(jpe?g|png)$", r"/\d+_\w+\.(jpe?g|png)$",
"range": "1-10", "range": "1-10",
"count": 10, "count": 10,
@@ -131,7 +134,7 @@ class PoipikuPostExtractor(PoipikuExtractor):
pattern = BASE_PATTERN + r"/(\d+)/(\d+)" pattern = BASE_PATTERN + r"/(\d+)/(\d+)"
test = ( test = (
("https://poipiku.com/25049/5864576.html", { ("https://poipiku.com/25049/5864576.html", {
"pattern": r"https://img\.poipiku\.com/user_img\d+/000025049" "pattern": r"https://img-org\.poipiku\.com/user_img\d+/000025049"
r"/005864576_EWN1Y65gQ\.png$", r"/005864576_EWN1Y65gQ\.png$",
"keyword": { "keyword": {
"count": "1", "count": "1",
@@ -146,7 +149,7 @@ class PoipikuPostExtractor(PoipikuExtractor):
}, },
}), }),
("https://poipiku.com/2166245/6411749.html", { ("https://poipiku.com/2166245/6411749.html", {
"pattern": r"https://img\.poipiku\.com/user_img\d+/002166245" "pattern": r"https://img-org\.poipiku\.com/user_img\d+/002166245"
r"/006411749_\w+\.jpeg$", r"/006411749_\w+\.jpeg$",
"count": 4, "count": 4,
"keyword": { "keyword": {