{"as_of":"2026-08-10T14:10:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b1473dbb597b70920bdd0bf0a413bcd784cf9b51045baef0d7180fbb57bd8d28","coverage":[{"denominator":57,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":57,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T01:06:13.824469Z","state":"measured"},{"denominator":57,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":57,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.12148/citation-record","integrity":"/paper/2506.12148/integrity","json":"/paper/2506.12148/citation-record.json","paper":"/paper/2506.12148"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:06:19.023116Z","title":null,"venue":null,"work_id":"487cec3d-685b-416d-9341-f16ef6c205a9","year":2023},"citing_paper":{"arxiv_id":"2506.12148","last_updated":"2025-06-13T18:08:19Z","snapshot_observed_at":"2026-08-09T12:18:43.237679Z","submitted_at":"2025-06-13T18:08:19Z","title":"Hatevolution: What Static Benchmarks Don't Tell Us","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T01:06:08.391358Z"},"links":{"citing_paper":"/paper/2506.12148"},"observation_digest":"sha256:8a48078f3d1be4698b5f4bc151aca84eb8f94535a77bdcac2ac6ef2aa56326d6","observation_id":"292e83d3-851e-489d-859a-b6463e048e26","resolution":{"observed_at":"2026-08-07T01:06:19.093192Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:06:18.828452Z","title":null,"venue":null,"work_id":"a88c1fde-7b70-4a73-811b-916eabed365d","year":2009},"citing_paper":{"arxiv_id":"2506.12148","last_updated":"2025-06-13T18:08:19Z","snapshot_observed_at":"2026-08-09T12:18:43.237679Z","submitted_at":"2025-06-13T18:08:19Z","title":"Hatevolution: What Static Benchmarks Don't Tell Us","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T01:06:08.468614Z"},"links":{"citing_paper":"/paper/2506.12148"},"observation_digest":"sha256:9e716b90b38a98c72f94007fde9ff3045e26ad65645582042dbb73d986d9b429","observation_id":"88f2bc62-90c0-4318-9c1a-74c794071b10","resolution":{"observed_at":"2026-08-07T01:06:18.905747Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:06:18.659092Z","title":null,"venue":null,"work_id":"574adc77-734f-4509-851f-3be14ba01cb2","year":2023},"citing_paper":{"arxiv_id":"2506.12148","last_updated":"2025-06-13T18:08:19Z","snapshot_observed_at":"2026-08-09T12:18:43.237679Z","submitted_at":"2025-06-13T18:08:19Z","title":"Hatevolution: What Static Benchmarks Don't Tell Us","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T01:06:08.587057Z"},"links":{"citing_paper":"/paper/2506.12148"},"observation_digest":"sha256:869ce6b0d4a2ea75921d0ac9d7ce445f3e3b78151047ee4d82c6295eb98d852d","observation_id":"00afc726-9112-4e7b-b2e7-fc1159f3903e","resolution":{"observed_at":"2026-08-07T01:06:18.731897Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:06:08.654957Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.12148","last_updated":"2025-06-13T18:08:19Z","snapshot_observed_at":"2026-08-09T12:18:43.237679Z","submitted_at":"2025-06-13T18:08:19Z","title":"Hatevolution: What Static Benchmarks Don't Tell Us","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T01:06:08.654957Z"},"links":{"citing_paper":"/paper/2506.12148"},"observation_digest":"sha256:6a3dcb7ef9a488cc705a25ca184782210a2c2d5dd60b807c99da29dd3c389afa","observation_id":"54676e8d-363c-4a0b-bcf0-fadd4c1db234","resolution":{"observed_at":"2026-08-07T01:06:08.654957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:06:18.484955Z","title":null,"venue":null,"work_id":"1fcb7d71-22ac-4ad4-80f7-549256215ab9","year":2020},"citing_paper":{"arxiv_id":"2506.12148","last_updated":"2025-06-13T18:08:19Z","snapshot_observed_at":"2026-08-09T12:18:43.237679Z","submitted_at":"2025-06-13T18:08:19Z","title":"Hatevolution: What Static Benchmarks Don't Tell Us","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T01:06:08.749389Z"},"links":{"citing_paper":"/paper/2506.12148"},"observation_digest":"sha256:bb2623b0d8cd866142bb75647aba00d78ba2016115e373056fcb184178870704","observation_id":"d73c9db5-3288-42d1-b80b-9be930f42f42","resolution":{"observed_at":"2026-08-07T01:06:18.560502Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.18403","last_updated":"2025-06-02T11:31:19Z","snapshot_observed_at":"2026-07-06T18:37:21.973331Z","submitted_at":"2024-06-26T14:56:13Z","title":"LLMs instead of Human Judges? A Large Scale Empirical Study across 20 NLP Evaluation Tasks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.18403","snapshot_observed_at":"2026-08-07T01:06:08.843925Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12148","last_updated":"2025-06-13T18:08:19Z","snapshot_observed_at":"2026-08-09T12:18:43.237679Z","submitted_at":"2025-06-13T18:08:19Z","title":"Hatevolution: What Static Benchmarks Don't Tell Us","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T01:06:08.843925Z"},"links":{"cited_paper":"/paper/2406.18403","citing_paper":"/paper/2506.12148"},"observation_digest":"sha256:1c21b3eaa33f30915b843063e6991f7db513c74cf16801fcd4d6035eb6e7b96a","observation_id":"a6320319-de2b-45dd-8b78-e569c378aecc","resolution":{"observed_at":"2026-08-07T01:06:08.843925Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.09662","last_updated":"2023-08-30T10:21:00Z","snapshot_observed_at":"2026-08-06T17:01:00.147032Z","submitted_at":"2023-08-18T16:27:04Z","title":"Red-Teaming Large Language Models using Chain of Utterances for Safety-Alignment","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.09662","snapshot_observed_at":"2026-08-07T01:06:08.903210Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.12148","last_updated":"2025-06-13T18:08:19Z","snapshot_observed_at":"2026-08-09T12:18:43.237679Z","submitted_at":"2025-06-13T18:08:19Z","title":"Hatevolution: What Static Benchmarks Don't Tell Us","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T01:06:08.903210Z"},"links":{"cited_paper":"/paper/2308.09662","citing_paper":"/paper/2506.12148"},"observation_digest":"sha256:2f6e271b1633e77ff62e27fdd96c69d16c291e2a67fdd59fc14c9d32269b6f8b","observation_id":"c2c388da-08b8-437f-9576-e73b9fee28e6","resolution":{"observed_at":"2026-08-07T01:06:08.903210Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:06:18.320931Z","title":"Quantifying memorization across neural language models","venue":null,"work_id":"82599fbf-02ef-416a-8eb0-b5046014a86a","year":null},"citing_paper":{"arxiv_id":"2506.12148","last_updated":"2025-06-13T18:08:19Z","snapshot_observed_at":"2026-08-09T12:18:43.237679Z","submitted_at":"2025-06-13T18:08:19Z","title":"Hatevolution: What Static Benchmarks Don't Tell Us","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T01:06:08.998401Z"},"links":{"citing_paper":"/paper/2506.12148"},"observation_digest":"sha256:c435ed63dbd7902710f53679fdafdaddbaaebfed851fe572feb4e042b5d3dc11","observation_id":"36c92940-484b-4193-8abc-0f7bf1bdfd61","resolution":{"observed_at":"2026-08-07T01:06:18.391538Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:06:09.076763Z","title":null,"venue":null,"work_id":null,"year":1960},"citing_paper":{"arxiv_id":"2506.12148","last_updated":"2025-06-13T18:08:19Z","snapshot_observed_at":"2026-08-09T12:18:43.237679Z","submitted_at":"2025-06-13T18:08:19Z","title":"Hatevolution: What Static Benchmarks Don't Tell Us","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T01:06:09.076763Z"},"links":{"citing_paper":"/paper/2506.12148"},"observation_digest":"sha256:69663b3dfb547b102a7ffe18daad60c435dda9985cc5db7d006f651914a1357f","observation_id":"97f9fcd5-9cb9-4534-92f6-d638fb4c8a4f","resolution":{"observed_at":"2026-08-07T01:06:09.076763Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:06:18.143947Z","title":null,"venue":null,"work_id":"14870a41-86c2-4ffe-88fa-43aec4773e4b","year":2022},"citing_paper":{"arxiv_id":"2506.12148","last_updated":"2025-06-13T18:08:19Z","snapshot_observed_at":"2026-08-09T12:18:43.237679Z","submitted_at":"2025-06-13T18:08:19Z","title":"Hatevolution: What Static Benchmarks Don't Tell Us","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T01:06:09.159218Z"},"links":{"citing_paper":"/paper/2506.12148"},"observation_digest":"sha256:c7c00ba194c750408b62ed52a7706a5cb2bdb1292703bbda57193b4a2f121944","observation_id":"8a20df55-94b2-4a97-9a7a-0a114cccff8a","resolution":{"observed_at":"2026-08-07T01:06:18.216213Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:06:17.972218Z","title":null,"venue":null,"work_id":"24210c43-fa47-4b6e-baa6-dc3e38f0c4b5","year":2025},"citing_paper":{"arxiv_id":"2506.12148","last_updated":"2025-06-13T18:08:19Z","snapshot_observed_at":"2026-08-09T12:18:43.237679Z","submitted_at":"2025-06-13T18:08:19Z","title":"Hatevolution: What Static Benchmarks Don't Tell Us","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T01:06:09.245706Z"},"links":{"citing_paper":"/paper/2506.12148"},"observation_digest":"sha256:4e3ac8ec246c6b218ee07993b46a362f8d0e76003bdd516a887e7931bb5bf676","observation_id":"8f2fd6e8-718b-4509-ab82-acb0d8df9d48","resolution":{"observed_at":"2026-08-07T01:06:18.053203Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:06:09.336423Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12148","last_updated":"2025-06-13T18:08:19Z","snapshot_observed_at":"2026-08-09T12:18:43.237679Z","submitted_at":"2025-06-13T18:08:19Z","title":"Hatevolution: What Static Benchmarks Don't Tell Us","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T01:06:09.336423Z"},"links":{"citing_paper":"/paper/2506.12148"},"observation_digest":"sha256:8202532dc45d41b9a6691fa5adc5f328dc0ed8bd20d9dc33565cc5d905a4c8d0","observation_id":"cf3fddad-ee70-4577-979b-af556235e8d6","resolution":{"observed_at":"2026-08-07T01:06:09.336423Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:06:17.778102Z","title":null,"venue":null,"work_id":"6c67318a-020e-4a38-a1c8-d63fa0f979f7","year":2014},"citing_paper":{"arxiv_id":"2506.12148","last_updated":"2025-06-13T18:08:19Z","snapshot_observed_at":"2026-08-09T12:18:43.237679Z","submitted_at":"2025-06-13T18:08:19Z","title":"Hatevolution: What Static Benchmarks Don't Tell Us","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T01:06:09.423840Z"},"links":{"citing_paper":"/paper/2506.12148"},"observation_digest":"sha256:9e351929a88bbc7531381f8ad62cdcf1cbfec9247af34ac5cbab1364590b3855","observation_id":"5c00185d-b306-4dcc-a2d3-c3441be727be","resolution":{"observed_at":"2026-08-07T01:06:17.876476Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:06:09.489969Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.12148","last_updated":"2025-06-13T18:08:19Z","snapshot_observed_at":"2026-08-09T12:18:43.237679Z","submitted_at":"2025-06-13T18:08:19Z","title":"Hatevolution: What Static Benchmarks Don't Tell Us","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T01:06:09.489969Z"},"links":{"citing_paper":"/paper/2506.12148"},"observation_digest":"sha256:d546dc4a6850322e7cdcc4fb120ff1c9286b69eeff0dea1dc42c2496d7b69205","observation_id":"bc1b6a7f-e7bf-4b2b-a7af-76d752b8ac2a","resolution":{"observed_at":"2026-08-07T01:06:09.489969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09170","last_updated":"2024-06-13T14:31:19Z","snapshot_observed_at":"2026-08-09T15:29:45.493907Z","submitted_at":"2024-06-13T14:31:19Z","title":"Test of Time: A Benchmark for Evaluating LLMs on Temporal Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09170","snapshot_observed_at":"2026-08-07T01:06:09.583331Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12148","last_updated":"2025-06-13T18:08:19Z","snapshot_observed_at":"2026-08-09T12:18:43.237679Z","submitted_at":"2025-06-13T18:08:19Z","title":"Hatevolution: What Static Benchmarks Don't Tell Us","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T01:06:09.583331Z"},"links":{"cited_paper":"/paper/2406.09170","citing_paper":"/paper/2506.12148"},"observation_digest":"sha256:91463298f737614433c6f77b993fc49f6262f89840c785649ce6aa04fa004fd2","observation_id":"008eed55-694a-4f47-b6c7-f3108658c80e","resolution":{"observed_at":"2026-08-07T01:06:09.583331Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:06:17.656090Z","title":null,"venue":null,"work_id":"27754596-a2ad-441c-b955-6f3557bb8f67","year":2020},"citing_paper":{"arxiv_id":"2506.12148","last_updated":"2025-06-13T18:08:19Z","snapshot_observed_at":"2026-08-09T12:18:43.237679Z","submitted_at":"2025-06-13T18:08:19Z","title":"Hatevolution: What Static Benchmarks Don't Tell Us","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T01:06:09.654129Z"},"links":{"citing_paper":"/paper/2506.12148"},"observation_digest":"sha256:6824788b98ab73f5295553ba0cc635499f30417b3182bfe5dc6a3a568985b843","observation_id":"90cb8bbc-340a-42c4-8eb0-41853c74a9f9","resolution":{"observed_at":"2026-08-07T01:06:17.711163Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:06:09.761770Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.12148","last_updated":"2025-06-13T18:08:19Z","snapshot_observed_at":"2026-08-09T12:18:43.237679Z","submitted_at":"2025-06-13T18:08:19Z","title":"Hatevolution: What Static Benchmarks Don't Tell Us","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T01:06:09.761770Z"},"links":{"citing_paper":"/paper/2506.12148"},"observation_digest":"sha256:bc098852f775f347aacaa38625d05bafc89fb2babebdb259578e76d656118219","observation_id":"58a1bf6c-ece8-4d57-9f9d-713ceb9acb4e","resolution":{"observed_at":"2026-08-07T01:06:09.761770Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2023.acl-long.711","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":null,"venue":null,"work_id":"c8236f8d-c9bb-4be2-9dae-79017f434f5e","year":2023},"citing_paper":{"arxiv_id":"2506.12148","last_updated":"2025-06-13T18:08:19Z","snapshot_observed_at":"2026-08-09T12:18:43.237679Z","submitted_at":"2025-06-13T18:08:19Z","title":"Hatevolution: What Static Benchmarks Don't Tell Us","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T01:06:09.840553Z"},"links":{"citing_paper":"/paper/2506.12148"},"observation_digest":"sha256:31cd71a389a50afe7ed4557a966195b5c862ef7834d12de85760d18bcc99e9d1","observation_id":"c9573411-eea0-4148-9f8a-b2f760830017","resolution":{"observed_at":"2026-08-07T01:06:14.283350Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:06:17.483356Z","title":null,"venue":null,"work_id":"51fd5eb7-845c-4510-8b01-d983783b42ec","year":2023},"citing_paper":{"arxiv_id":"2506.12148","last_updated":"2025-06-13T18:08:19Z","snapshot_observed_at":"2026-08-09T12:18:43.237679Z","submitted_at":"2025-06-13T18:08:19Z","title":"Hatevolution: What Static Benchmarks Don't Tell Us","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T01:06:09.948336Z"},"links":{"citing_paper":"/paper/2506.12148"},"observation_digest":"sha256:beee61aa9bf3e1fdd9a9677bf4a712fb89352ffe7f89100142dbba570463701f","observation_id":"52fb7bba-82d6-4843-9df7-2e156402375e","resolution":{"observed_at":"2026-08-07T01:06:17.536779Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.03215","last_updated":"2022-05-24T13:15:25Z","snapshot_observed_at":"2026-08-09T12:18:17.982740Z","submitted_at":"2021-10-07T07:00:57Z","title":"Towards Continual Knowledge Learning of Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.03215","snapshot_observed_at":"2026-08-07T01:06:10.053228Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.12148","last_updated":"2025-06-13T18:08:19Z","snapshot_observed_at":"2026-08-09T12:18:43.237679Z","submitted_at":"2025-06-13T18:08:19Z","title":"Hatevolution: What Static Benchmarks Don't Tell Us","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T01:06:10.053228Z"},"links":{"cited_paper":"/paper/2110.03215","citing_paper":"/paper/2506.12148"},"observation_digest":"sha256:8ff8543469cee6dbbdf6db0660ea21d5fa53d324eb75097791f0dbb7600e9c96","observation_id":"b3d36d37-8d7a-4c0f-a90d-ebb440432834","resolution":{"observed_at":"2026-08-07T01:06:10.053228Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.14146","last_updated":"2023-09-25T13:59:39Z","snapshot_observed_at":"2026-07-06T16:23:18.453624Z","submitted_at":"2023-09-25T13:59:39Z","title":"Examining Temporal Bias in Abusive Language Detection","version":1},"cited_work":{"arxiv_id":"2309.14146","doi":null,"metadata_source":"pith","pith_arxiv_id":"2309.14146","snapshot_observed_at":"2026-08-07T01:06:14.586146Z","title":"Examining Temporal Bias in Abusive Language Detection","venue":"cs.CL","work_id":"28043e32-f694-4ff2-9fff-3a6447a5ab5b","year":2023},"citing_paper":{"arxiv_id":"2506.12148","last_updated":"2025-06-13T18:08:19Z","snapshot_observed_at":"2026-08-09T12:18:43.237679Z","submitted_at":"2025-06-13T18:08:19Z","title":"Hatevolution: What Static Benchmarks Don't Tell Us","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T01:06:10.163464Z"},"links":{"cited_paper":"/paper/2309.14146","citing_paper":"/paper/2506.12148"},"observation_digest":"sha256:41e484cbc06192cef586638ef0394c0a8ba011bd1f3f46306493606f2dad1058","observation_id":"ae0f9e18-b099-4270-b793-0dae6848c6de","resolution":{"observed_at":"2026-08-07T01:06:14.650515Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:06:10.269767Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.12148","last_updated":"2025-06-13T18:08:19Z","snapshot_observed_at":"2026-08-09T12:18:43.237679Z","submitted_at":"2025-06-13T18:08:19Z","title":"Hatevolution: What Static Benchmarks Don't Tell Us","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T01:06:10.269767Z"},"links":{"citing_paper":"/paper/2506.12148"},"observation_digest":"sha256:b4701c8d18394ba05b26c6d4ebf27fab4a142116fff6afe0cbfde744e1c26eb5","observation_id":"c16d5593-d26d-46e2-bf1d-adfc9d8d4b31","resolution":{"observed_at":"2026-08-07T01:06:10.269767Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:06:17.319407Z","title":null,"venue":null,"work_id":"b7b5129e-f462-4beb-8495-b9c981a0b5be","year":2024},"citing_paper":{"arxiv_id":"2506.12148","last_updated":"2025-06-13T18:08:19Z","snapshot_observed_at":"2026-08-09T12:18:43.237679Z","submitted_at":"2025-06-13T18:08:19Z","title":"Hatevolution: What Static Benchmarks Don't Tell Us","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T01:06:10.387958Z"},"links":{"citing_paper":"/paper/2506.12148"},"observation_digest":"sha256:bbe673c7db7d1c007367e46a2f287bec0c469c8ee2de41e3665b72d6130a86ab","observation_id":"bfb6b384-6940-4ce8-a375-2685355605f1","resolution":{"observed_at":"2026-08-07T01:06:17.417963Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:06:17.117398Z","title":null,"venue":null,"work_id":"870bee62-73ff-4d6e-8e3c-59633d25e927","year":2011},"citing_paper":{"arxiv_id":"2506.12148","last_updated":"2025-06-13T18:08:19Z","snapshot_observed_at":"2026-08-09T12:18:43.237679Z","submitted_at":"2025-06-13T18:08:19Z","title":"Hatevolution: What Static Benchmarks Don't Tell Us","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T01:06:10.496097Z"},"links":{"citing_paper":"/paper/2506.12148"},"observation_digest":"sha256:e54683865779f61b3cc7e944992972d22f747cae2aa939cab6c2b3e57287481c","observation_id":"60c717b3-c858-461e-9788-d4635be3a4aa","resolution":{"observed_at":"2026-08-07T01:06:17.240788Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:06:16.899770Z","title":null,"venue":null,"work_id":"507505bb-0a03-4eff-b8be-fb564aa1cfc6","year":2021},"citing_paper":{"arxiv_id":"2506.12148","last_updated":"2025-06-13T18:08:19Z","snapshot_observed_at":"2026-08-09T12:18:43.237679Z","submitted_at":"2025-06-13T18:08:19Z","title":"Hatevolution: What Static Benchmarks Don't Tell Us","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T01:06:10.606968Z"},"links":{"citing_paper":"/paper/2506.12148"},"observation_digest":"sha256:e2c30f4178ef6195dee55a1742ab668ad370c7c50c73596f73592647c7c0943e","observation_id":"90b6d151-dfef-490d-9548-c85d15b2a46e","resolution":{"observed_at":"2026-08-07T01:06:16.986364Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:06:16.720412Z","title":null,"venue":null,"work_id":"4a9296aa-af7c-4227-a2a8-9d82baea01ec","year":2023},"citing_paper":{"arxiv_id":"2506.12148","last_updated":"2025-06-13T18:08:19Z","snapshot_observed_at":"2026-08-09T12:18:43.237679Z","submitted_at":"2025-06-13T18:08:19Z","title":"Hatevolution: What Static Benchmarks Don't Tell Us","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T01:06:10.725011Z"},"links":{"citing_paper":"/paper/2506.12148"},"observation_digest":"sha256:158d58065b7404b22bf098725eb41755b976a341971439e0638d8807b2eee465","observation_id":"9e7d22c4-0e69-428a-a951-3528065ffed6","resolution":{"observed_at":"2026-08-07T01:06:16.805795Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1907.11692","last_updated":"2019-07-26T17:48:29Z","snapshot_observed_at":"2026-07-31T22:31:37.910868Z","submitted_at":"2019-07-26T17:48:29Z","title":"RoBERTa: A Robustly Optimized BERT Pretraining Approach","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1907.11692","snapshot_observed_at":"2026-08-07T01:06:10.833177Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.12148","last_updated":"2025-06-13T18:08:19Z","snapshot_observed_at":"2026-08-09T12:18:43.237679Z","submitted_at":"2025-06-13T18:08:19Z","title":"Hatevolution: What Static Benchmarks Don't Tell Us","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T01:06:10.833177Z"},"links":{"cited_paper":"/paper/1907.11692","citing_paper":"/paper/2506.12148"},"observation_digest":"sha256:47b2adccfc6993f24b944a45c0dd290896b4eb7a7a2d89b5dba80daa60661610","observation_id":"192dd590-04c7-412d-9ef1-f42eda2f4738","resolution":{"observed_at":"2026-08-07T01:06:10.833177Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:06:10.918001Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.12148","last_updated":"2025-06-13T18:08:19Z","snapshot_observed_at":"2026-08-09T12:18:43.237679Z","submitted_at":"2025-06-13T18:08:19Z","title":"Hatevolution: What Static Benchmarks Don't Tell Us","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T01:06:10.918001Z"},"links":{"citing_paper":"/paper/2506.12148"},"observation_digest":"sha256:0ad1a28a622d46fa0c78b8401114e5ead45a7f31b8e940ad90a974eb22ad6b26","observation_id":"ed49a2a3-1191-487a-97cf-baceede5ecf0","resolution":{"observed_at":"2026-08-07T01:06:10.918001Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:06:16.532535Z","title":null,"venue":null,"work_id":"958b8550-aac6-47be-8b13-bd51fb2edeb4","year":2022},"citing_paper":{"arxiv_id":"2506.12148","last_updated":"2025-06-13T18:08:19Z","snapshot_observed_at":"2026-08-09T12:18:43.237679Z","submitted_at":"2025-06-13T18:08:19Z","title":"Hatevolution: What Static Benchmarks Don't Tell Us","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T01:06:10.994223Z"},"links":{"citing_paper":"/paper/2506.12148"},"observation_digest":"sha256:921e5ceff5ebd7649f07914c5e2f3c9bb1cbdc95d3a4422bf34d768068b28b2e","observation_id":"e12205b3-944b-46c7-93ec-424a794bb29f","resolution":{"observed_at":"2026-08-07T01:06:16.624567Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:06:16.355537Z","title":null,"venue":null,"work_id":"69334418-fcf6-46f3-899a-a3ef292df9a7","year":2020},"citing_paper":{"arxiv_id":"2506.12148","last_updated":"2025-06-13T18:08:19Z","snapshot_observed_at":"2026-08-09T12:18:43.237679Z","submitted_at":"2025-06-13T18:08:19Z","title":"Hatevolution: What Static Benchmarks Don't Tell Us","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T01:06:11.121544Z"},"links":{"citing_paper":"/paper/2506.12148"},"observation_digest":"sha256:892b84cc82d27ebabd86e5227dcc49b508e6f69d4f54e535d5f1bd2a81f0456a","observation_id":"ed7f30bd-7407-4fc9-9c6f-b3a74a5f8610","resolution":{"observed_at":"2026-08-07T01:06:16.421349Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:06:16.163819Z","title":null,"venue":null,"work_id":"8bcf6197-7a42-4293-9231-4d26bc81de33","year":2021},"citing_paper":{"arxiv_id":"2506.12148","last_updated":"2025-06-13T18:08:19Z","snapshot_observed_at":"2026-08-09T12:18:43.237679Z","submitted_at":"2025-06-13T18:08:19Z","title":"Hatevolution: What Static Benchmarks Don't Tell Us","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T01:06:11.191623Z"},"links":{"citing_paper":"/paper/2506.12148"},"observation_digest":"sha256:4d1207c5d6d7818479963726328fbba15054d2103b8562ad83e347fc5626f591","observation_id":"e7cc30b2-1663-40be-b5ac-1923f4f9fd4f","resolution":{"observed_at":"2026-08-07T01:06:16.259152Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:06:16.007325Z","title":null,"venue":null,"work_id":"425d1b77-2928-415b-80ce-5576696465c0","year":2022},"citing_paper":{"arxiv_id":"2506.12148","last_updated":"2025-06-13T18:08:19Z","snapshot_observed_at":"2026-08-09T12:18:43.237679Z","submitted_at":"2025-06-13T18:08:19Z","title":"Hatevolution: What Static Benchmarks Don't Tell Us","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T01:06:11.309509Z"},"links":{"citing_paper":"/paper/2506.12148"},"observation_digest":"sha256:fe495a2563200aad1e8582fd2751c7a29632b0f0876f4c6a9bc5be819aa52ddf","observation_id":"c2c83654-c5d4-4250-8056-12fe5bd98003","resolution":{"observed_at":"2026-08-07T01:06:16.095106Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:06:11.422890Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.12148","last_updated":"2025-06-13T18:08:19Z","snapshot_observed_at":"2026-08-09T12:18:43.237679Z","submitted_at":"2025-06-13T18:08:19Z","title":"Hatevolution: What Static Benchmarks Don't Tell Us","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T01:06:11.422890Z"},"links":{"citing_paper":"/paper/2506.12148"},"observation_digest":"sha256:5eaff2c0cd8864ae48567353742f40c30a0df00e2f2ed1eb895d27079c7cd23e","observation_id":"3d8eac42-c676-4966-9e84-d92b8a5d0203","resolution":{"observed_at":"2026-08-07T01:06:11.422890Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:06:11.548125Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.12148","last_updated":"2025-06-13T18:08:19Z","snapshot_observed_at":"2026-08-09T12:18:43.237679Z","submitted_at":"2025-06-13T18:08:19Z","title":"Hatevolution: What Static Benchmarks Don't Tell Us","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T01:06:11.548125Z"},"links":{"citing_paper":"/paper/2506.12148"},"observation_digest":"sha256:a90530fa9724f8db10c7897623b6df664182b102b25243fb13a808fa2c3defff","observation_id":"ca677080-4632-48c2-9f3b-37d3cb908ca4","resolution":{"observed_at":"2026-08-07T01:06:11.548125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:06:15.820705Z","title":null,"venue":null,"work_id":"ef3accf6-2e86-4e45-bd1f-617f2d068b35","year":2023},"citing_paper":{"arxiv_id":"2506.12148","last_updated":"2025-06-13T18:08:19Z","snapshot_observed_at":"2026-08-09T12:18:43.237679Z","submitted_at":"2025-06-13T18:08:19Z","title":"Hatevolution: What Static Benchmarks Don't Tell Us","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T01:06:11.657505Z"},"links":{"citing_paper":"/paper/2506.12148"},"observation_digest":"sha256:e36db8abf78d4619265158c3b0ded5cfda039f45c23a4787685442e8c45cd93d","observation_id":"ae72fa0f-072c-4848-bd8f-6b6267640822","resolution":{"observed_at":"2026-08-07T01:06:15.905144Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:06:15.633047Z","title":null,"venue":null,"work_id":"a0fefdac-1031-4e78-afcd-f15c49f81eaf","year":2021},"citing_paper":{"arxiv_id":"2506.12148","last_updated":"2025-06-13T18:08:19Z","snapshot_observed_at":"2026-08-09T12:18:43.237679Z","submitted_at":"2025-06-13T18:08:19Z","title":"Hatevolution: What Static Benchmarks Don't Tell Us","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T01:06:11.735239Z"},"links":{"citing_paper":"/paper/2506.12148"},"observation_digest":"sha256:9c3adcddaedef62a70ba7c0da2af1218b92115fb27f4dbf67a2ae25234f00e12","observation_id":"4022a241-00b0-45f9-9fc8-918ecf83d23b","resolution":{"observed_at":"2026-08-07T01:06:15.700052Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.03612","last_updated":"2022-02-08T02:53:48Z","snapshot_observed_at":"2026-08-01T15:43:54.871003Z","submitted_at":"2022-02-08T02:53:48Z","title":"HistBERT: A Pre-trained Language Model for Diachronic Lexical Semantic Analysis","version":1},"cited_work":{"arxiv_id":"2202.03612","doi":null,"metadata_source":"pith","pith_arxiv_id":"2202.03612","snapshot_observed_at":"2026-08-07T01:06:14.390573Z","title":"HistBERT: A Pre-trained Language Model for Diachronic Lexical Semantic Analysis","venue":"cs.CL","work_id":"be90475f-77fd-463b-8e79-886ecd896230","year":2022},"citing_paper":{"arxiv_id":"2506.12148","last_updated":"2025-06-13T18:08:19Z","snapshot_observed_at":"2026-08-09T12:18:43.237679Z","submitted_at":"2025-06-13T18:08:19Z","title":"Hatevolution: What Static Benchmarks Don't Tell Us","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-07T01:06:11.857428Z"},"links":{"cited_paper":"/paper/2202.03612","citing_paper":"/paper/2506.12148"},"observation_digest":"sha256:2b399930793b5a5b4d6ab68195475f1e21534ead322fa5582bca12b298faf23c","observation_id":"02e2f012-4635-4789-8636-7a3d1e67d98b","resolution":{"observed_at":"2026-08-07T01:06:14.452631Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:06:11.979252Z","title":"Rosin and Kira Radinsky","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.12148","last_updated":"2025-06-13T18:08:19Z","snapshot_observed_at":"2026-08-09T12:18:43.237679Z","submitted_at":"2025-06-13T18:08:19Z","title":"Hatevolution: What Static Benchmarks Don't Tell Us","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-07T01:06:11.979252Z"},"links":{"citing_paper":"/paper/2506.12148"},"observation_digest":"sha256:1e4c6e160413feda996b3d20c3eed1cf10a6693a87614f6a6c0b09cd4ac07bf6","observation_id":"d22abb5f-677b-4a92-be1d-8f57bbf8a8ae","resolution":{"observed_at":"2026-08-07T01:06:11.979252Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:06:12.100353Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.12148","last_updated":"2025-06-13T18:08:19Z","snapshot_observed_at":"2026-08-09T12:18:43.237679Z","submitted_at":"2025-06-13T18:08:19Z","title":"Hatevolution: What Static Benchmarks Don't Tell Us","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-07T01:06:12.100353Z"},"links":{"citing_paper":"/paper/2506.12148"},"observation_digest":"sha256:a2a59e4256ca535a37149fb6985280c18877617f4fae07db0a4fd46149834ef6","observation_id":"e4b8df33-f631-41f7-b126-dd0ef1d3caf2","resolution":{"observed_at":"2026-08-07T01:06:12.100353Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:06:12.185614Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.12148","last_updated":"2025-06-13T18:08:19Z","snapshot_observed_at":"2026-08-09T12:18:43.237679Z","submitted_at":"2025-06-13T18:08:19Z","title":"Hatevolution: What Static Benchmarks Don't Tell Us","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-07T01:06:12.185614Z"},"links":{"citing_paper":"/paper/2506.12148"},"observation_digest":"sha256:098e51b76e19c7509f5a2439f0f2729070b5bf0f3e876cc02a19318319813ca7","observation_id":"dabd322f-338c-4e92-bb22-063f1f30611e","resolution":{"observed_at":"2026-08-07T01:06:12.185614Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:06:12.303011Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.12148","last_updated":"2025-06-13T18:08:19Z","snapshot_observed_at":"2026-08-09T12:18:43.237679Z","submitted_at":"2025-06-13T18:08:19Z","title":"Hatevolution: What Static Benchmarks Don't Tell Us","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-07T01:06:12.303011Z"},"links":{"citing_paper":"/paper/2506.12148"},"observation_digest":"sha256:c602e831fb1f529c9110ae5030ae466d0d5e1b3f684d312498deaeb3df620ac7","observation_id":"83bdf392-77d3-4393-9a2b-1a8f5ae1ca28","resolution":{"observed_at":"2026-08-07T01:06:12.303011Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:06:15.482572Z","title":null,"venue":null,"work_id":"e5ac40ad-f429-4777-93bf-7945eaf1b4d8","year":2023},"citing_paper":{"arxiv_id":"2506.12148","last_updated":"2025-06-13T18:08:19Z","snapshot_observed_at":"2026-08-09T12:18:43.237679Z","submitted_at":"2025-06-13T18:08:19Z","title":"Hatevolution: What Static Benchmarks Don't Tell Us","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-07T01:06:12.417939Z"},"links":{"citing_paper":"/paper/2506.12148"},"observation_digest":"sha256:f29df4b63a932aa3dda9639503570a17e576a4bd3056ebf21648a73db830558b","observation_id":"e4e2ca2a-63e4-41a7-9fc7-6eebbbdb5449","resolution":{"observed_at":"2026-08-07T01:06:15.526501Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:06:12.535848Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.12148","last_updated":"2025-06-13T18:08:19Z","snapshot_observed_at":"2026-08-09T12:18:43.237679Z","submitted_at":"2025-06-13T18:08:19Z","title":"Hatevolution: What Static Benchmarks Don't Tell Us","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-07T01:06:12.535848Z"},"links":{"citing_paper":"/paper/2506.12148"},"observation_digest":"sha256:306aab82791290ef9febc663dea46b033eab5744608ef0b8229a637a323cffa8","observation_id":"d1d6cabf-8b09-46f5-a290-784a78b6371e","resolution":{"observed_at":"2026-08-07T01:06:12.535848Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:06:12.643476Z","title":"Hashimoto","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.12148","last_updated":"2025-06-13T18:08:19Z","snapshot_observed_at":"2026-08-09T12:18:43.237679Z","submitted_at":"2025-06-13T18:08:19Z","title":"Hatevolution: What Static Benchmarks Don't Tell Us","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-07T01:06:12.643476Z"},"links":{"citing_paper":"/paper/2506.12148"},"observation_digest":"sha256:a2325a3a44434cfa77ae1224c15e381f0c6c4b806d3776654b75c37cdd58c4ff","observation_id":"beb04adc-2aca-498c-965d-cacd422da9dc","resolution":{"observed_at":"2026-08-07T01:06:12.643476Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:06:12.707712Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.12148","last_updated":"2025-06-13T18:08:19Z","snapshot_observed_at":"2026-08-09T12:18:43.237679Z","submitted_at":"2025-06-13T18:08:19Z","title":"Hatevolution: What Static Benchmarks Don't Tell Us","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-07T01:06:12.707712Z"},"links":{"citing_paper":"/paper/2506.12148"},"observation_digest":"sha256:293bc9097b4f1227a76d61dc75e5d87e20d6c5c5db7af0da0c8e547098cbf868","observation_id":"065f2831-b530-432d-b3a1-68760009e3ab","resolution":{"observed_at":"2026-08-07T01:06:12.707712Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:06:15.318210Z","title":null,"venue":null,"work_id":"f37f34aa-744f-456f-aeaf-b3c3f3b66d4d","year":2021},"citing_paper":{"arxiv_id":"2506.12148","last_updated":"2025-06-13T18:08:19Z","snapshot_observed_at":"2026-08-09T12:18:43.237679Z","submitted_at":"2025-06-13T18:08:19Z","title":"Hatevolution: What Static Benchmarks Don't Tell Us","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-07T01:06:12.776123Z"},"links":{"citing_paper":"/paper/2506.12148"},"observation_digest":"sha256:8536658cb1135227cc8883e18a2d06e8f1fdced4dea66f50b5223da60f38a666","observation_id":"670cdfbc-50ca-4c25-8fca-d73cce020ac6","resolution":{"observed_at":"2026-08-07T01:06:15.405136Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:06:12.861746Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.12148","last_updated":"2025-06-13T18:08:19Z","snapshot_observed_at":"2026-08-09T12:18:43.237679Z","submitted_at":"2025-06-13T18:08:19Z","title":"Hatevolution: What Static Benchmarks Don't Tell Us","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-07T01:06:12.861746Z"},"links":{"citing_paper":"/paper/2506.12148"},"observation_digest":"sha256:64c587c0cb8e7516a026901ec7ac88e4b8a2d72f63af8e1546b3b5bffda7dcdd","observation_id":"863c2f32-87a3-4728-a5eb-f7cc0dde7b1e","resolution":{"observed_at":"2026-08-07T01:06:12.861746Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:06:15.152352Z","title":null,"venue":null,"work_id":"f128b381-6f7c-414a-921b-e1bbfdbb9fdc","year":2021},"citing_paper":{"arxiv_id":"2506.12148","last_updated":"2025-06-13T18:08:19Z","snapshot_observed_at":"2026-08-09T12:18:43.237679Z","submitted_at":"2025-06-13T18:08:19Z","title":"Hatevolution: What Static Benchmarks Don't Tell Us","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-07T01:06:12.977746Z"},"links":{"citing_paper":"/paper/2506.12148"},"observation_digest":"sha256:20088ee5dd774613c507cc6d2550c568011946ff77967fdf244be9dc36ce30b8","observation_id":"6798217d-542a-43af-a7af-0c5ea25e4ecf","resolution":{"observed_at":"2026-08-07T01:06:15.219541Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:06:13.100974Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12148","last_updated":"2025-06-13T18:08:19Z","snapshot_observed_at":"2026-08-09T12:18:43.237679Z","submitted_at":"2025-06-13T18:08:19Z","title":"Hatevolution: What Static Benchmarks Don't Tell Us","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-07T01:06:13.100974Z"},"links":{"citing_paper":"/paper/2506.12148"},"observation_digest":"sha256:ef538cdbb5ec78ff28b82fec44933d9c2d04fd1b3bda6719b0a04fb7dd782c5e","observation_id":"f8b0c2c7-8d37-4a77-afca-9ad2c74f0ab4","resolution":{"observed_at":"2026-08-07T01:06:13.100974Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:06:14.977646Z","title":null,"venue":null,"work_id":"c676d634-d7b3-4eae-8ba6-2d5fd4ba54b5","year":2021},"citing_paper":{"arxiv_id":"2506.12148","last_updated":"2025-06-13T18:08:19Z","snapshot_observed_at":"2026-08-09T12:18:43.237679Z","submitted_at":"2025-06-13T18:08:19Z","title":"Hatevolution: What Static Benchmarks Don't Tell Us","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-07T01:06:13.204743Z"},"links":{"citing_paper":"/paper/2506.12148"},"observation_digest":"sha256:d4f574753ad9aee37d80fad4d6fa21b83247a4918d7a62704b190edf20ea68cf","observation_id":"85a66b5b-36a1-4dd4-bb72-77ad10609880","resolution":{"observed_at":"2026-08-07T01:06:15.054616Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:06:13.282274Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.12148","last_updated":"2025-06-13T18:08:19Z","snapshot_observed_at":"2026-08-09T12:18:43.237679Z","submitted_at":"2025-06-13T18:08:19Z","title":"Hatevolution: What Static Benchmarks Don't Tell Us","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-07T01:06:13.282274Z"},"links":{"citing_paper":"/paper/2506.12148"},"observation_digest":"sha256:328332da61aee8d857c37e2e1c4ef812be5164f9a8231512d41d677bf9836260","observation_id":"c7ecf7bc-feb0-4a78-95b7-64469a3e955e","resolution":{"observed_at":"2026-08-07T01:06:13.282274Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.18927","last_updated":"2024-10-24T17:14:40Z","snapshot_observed_at":"2026-07-06T19:39:15.025945Z","submitted_at":"2024-10-24T17:14:40Z","title":"SafeBench: A Safety Evaluation Framework for Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.18927","snapshot_observed_at":"2026-08-07T01:06:13.360109Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12148","last_updated":"2025-06-13T18:08:19Z","snapshot_observed_at":"2026-08-09T12:18:43.237679Z","submitted_at":"2025-06-13T18:08:19Z","title":"Hatevolution: What Static Benchmarks Don't Tell Us","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-07T01:06:13.360109Z"},"links":{"cited_paper":"/paper/2410.18927","citing_paper":"/paper/2506.12148"},"observation_digest":"sha256:dcaa6d792447f36708cc2bde2a8dfa9b36112317ad775285a6040ab8f2ba455c","observation_id":"d5647fa7-95cb-4631-8574-7e64036abdc8","resolution":{"observed_at":"2026-08-07T01:06:13.360109Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2024.acl-long.749","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":null,"venue":null,"work_id":"3ef512d2-7377-4573-86ad-fda6cbb76564","year":2024},"citing_paper":{"arxiv_id":"2506.12148","last_updated":"2025-06-13T18:08:19Z","snapshot_observed_at":"2026-08-09T12:18:43.237679Z","submitted_at":"2025-06-13T18:08:19Z","title":"Hatevolution: What Static Benchmarks Don't Tell Us","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-07T01:06:13.420771Z"},"links":{"citing_paper":"/paper/2506.12148"},"observation_digest":"sha256:9a3775f15c497ffbe5b20b0ca35a4b4859eae25bb08c6130cd3f77143dc89175","observation_id":"66cdd967-cbe0-4c98-b484-18c14eb8eb3f","resolution":{"observed_at":"2026-08-07T01:06:14.010683Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:06:13.540083Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.12148","last_updated":"2025-06-13T18:08:19Z","snapshot_observed_at":"2026-08-09T12:18:43.237679Z","submitted_at":"2025-06-13T18:08:19Z","title":"Hatevolution: What Static Benchmarks Don't Tell Us","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-07T01:06:13.540083Z"},"links":{"citing_paper":"/paper/2506.12148"},"observation_digest":"sha256:194aed4863235899d0be5a31655c6ca5f898c1ebbb995087603b7168c33ee4af","observation_id":"70d2199d-df87-4b94-b820-dc77a828f5c1","resolution":{"observed_at":"2026-08-07T01:06:13.540083Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:06:14.812926Z","title":null,"venue":null,"work_id":"a49e32b6-590f-45af-9c2f-75143efa4c5a","year":2024},"citing_paper":{"arxiv_id":"2506.12148","last_updated":"2025-06-13T18:08:19Z","snapshot_observed_at":"2026-08-09T12:18:43.237679Z","submitted_at":"2025-06-13T18:08:19Z","title":"Hatevolution: What Static Benchmarks Don't Tell Us","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-07T01:06:13.613755Z"},"links":{"citing_paper":"/paper/2506.12148"},"observation_digest":"sha256:fe97eaa53acd9e586ed3afd0077c2259d1fcd64759f2bf265dd4b0ea7bc3e99c","observation_id":"104d6ed4-5814-4b19-b75a-ba1ac8f635cd","resolution":{"observed_at":"2026-08-07T01:06:14.873465Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:06:13.723317Z","title":"online\" 'onlinestring :=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.12148","last_updated":"2025-06-13T18:08:19Z","snapshot_observed_at":"2026-08-09T12:18:43.237679Z","submitted_at":"2025-06-13T18:08:19Z","title":"Hatevolution: What Static Benchmarks Don't Tell Us","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-07T01:06:13.723317Z"},"links":{"citing_paper":"/paper/2506.12148"},"observation_digest":"sha256:592aedaeba421f448a632aa355be91f5839289936d006c197c3eb7ecb20b055c","observation_id":"86ea44ac-46cb-4303-974b-fe6ef2052e83","resolution":{"observed_at":"2026-08-07T01:06:13.723317Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:06:13.824469Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.12148","last_updated":"2025-06-13T18:08:19Z","snapshot_observed_at":"2026-08-09T12:18:43.237679Z","submitted_at":"2025-06-13T18:08:19Z","title":"Hatevolution: What Static Benchmarks Don't Tell Us","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-07T01:06:13.824469Z"},"links":{"citing_paper":"/paper/2506.12148"},"observation_digest":"sha256:76024518b7eeb13fa2372d1007d9d4c690281c54fcc256e4b5d12fa810f05d87","observation_id":"f89af8f3-ce43-463c-85aa-3d0fd6c864f6","resolution":{"observed_at":"2026-08-07T01:06:13.824469Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.12148","last_updated":"2025-06-13T18:08:19Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-09T12:18:43.237679Z","submitted_at":"2025-06-13T18:08:19Z","title":"Hatevolution: What Static Benchmarks Don't Tell Us"},"reference_resolution":{"displayed":57,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":52,"verified_exact":4,"verified_fuzzy":1},"total_outbound_references":57},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 57 of 57 outbound references and 0 inbound Pith citation observations for arXiv:2506.12148."}