from pathlib import Path
from rf4_research.media_assets import extract_media_candidates, merge_manifest, store_asset
def test_extracts_and_classifies_unique_https_media() -> None:
html = '''

'''
items = extract_media_candidates(html, source_page="https://example.test/guide")
assert [(item.entity_type, item.asset_url) for item in items] == [
("fish", "https://example.test/media/fish/pike.png"),
("waterbody", "https://cdn.example/maps/kuori.webp"),
]
assert items[0].external_id == "pike"
def test_does_not_mistake_seafishing_screenshot_for_fish_entity() -> None:
items = extract_media_candidates('
', source_page="https://rf4game.de/userguide/")
assert items[0].entity_type == "reference"
def test_manifest_merges_and_binary_store_is_content_addressed(tmp_path: Path) -> None:
item = extract_media_candidates('
', source_page="https://example.test")[0]
first = merge_manifest(tmp_path / "manifest.json", [item])
second = merge_manifest(tmp_path / "manifest.json", [item])
assert len(first["assets"]) == len(second["assets"]) == 1
digest, relative = store_asset(tmp_path, b"image", content_type="image/png", source_url=item.asset_url)
assert len(digest) == 64
assert (tmp_path / relative).read_bytes() == b"image"