# retoor from devplacepy.services.jobs.deepsearch.extract import extract_html, relevant_links PAGE = """ Framework Trends - Blog
Home About Login
We use cookies to improve your experience on this website today.

Trends that define web development

Server components became the default rendering model, cutting client bundles by forty percent according to the survey.

Signals-based reactivity landed in the standards pipeline; see the signals deep dive article.

""" def test_extract_prefers_article_content_and_drops_chrome(): page = extract_html(PAGE, base_url="https://blog.example.com/trends/") assert page.title == "Framework Trends - Blog" assert "Server components" in page.text assert "Signals-based reactivity" in page.text assert "cookies" not in page.text assert "Copyright" not in page.text assert "Home" not in page.text def test_extract_emits_blank_line_paragraphs(): page = extract_html(PAGE, base_url="https://blog.example.com/trends/") assert "\n\n" in page.text def test_extract_resolves_links_absolute_and_skips_nav(): page = extract_html(PAGE, base_url="https://blog.example.com/trends/") urls = [url for url, _text in page.links] assert "https://blog.example.com/signals-deep-dive" in urls assert "https://blog.example.com/blog" not in urls def test_extract_unescapes_entities(): page = extract_html( "

Ampersand & arrow → and more text to pass the length gate.

" ) assert "&" not in page.text assert "→" not in page.text assert "&" in page.text def test_extract_survives_malformed_html(): page = extract_html("

Unclosed paragraph with enough characters to be kept around.

") assert "Unclosed paragraph" in page.text def test_relevant_links_scores_by_query_overlap(): links = [ ("https://a.example/web-frameworks-2026", "web frameworks in 2026"), ("https://a.example/cookie-policy", "cookie policy"), ("https://a.example/logo.png", "frameworks logo"), ] picked = relevant_links(links, "latest web frameworks 2026", 2) assert picked == ["https://a.example/web-frameworks-2026"] def test_relevant_links_empty_query_returns_nothing(): assert relevant_links([("https://a.example/x", "text")], "", 3) == []