{"as_of":"2026-08-09T21:56:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e3d6a045bd38e2913b3c0199b2bd5035f713fb453b1bbeaf91bba1b8a260097c","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":6,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":6,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":6,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":6,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T04:57:54.119975Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-16T15:27:04.356488Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2410.21220","last_updated":"2024-10-28T17:04:18Z","snapshot_observed_at":"2026-07-06T19:40:57.049203Z","submitted_at":"2024-10-28T17:04:18Z","title":"Vision Search Assistant: Empower Vision-Language Models as Multimodal Search Engines","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21220","snapshot_observed_at":"2026-08-07T04:57:54.119975Z","title":"Vision search assistant: Empower vision-language models as multimodal search engines.arXiv preprint arXiv:2410.21220, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.09247","last_updated":"2025-06-10T21:04:18Z","snapshot_observed_at":"2026-08-09T05:35:23.605224Z","submitted_at":"2025-06-10T21:04:18Z","title":"Agent-based Condition Monitoring Assistance with Multimodal Industrial Database Retrieval Augmented Generation","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T04:57:54.119975Z"},"links":{"cited_paper":"/paper/2410.21220","citing_paper":"/paper/2506.09247"},"observation_digest":"sha256:b382a817e2b0c4162cacfede241c4630c5a68eb973f9da78c22745aa6445e350","observation_id":"366a2314-cb85-48de-a10c-ec5e863ee7ff","resolution":{"observed_at":"2026-08-07T04:57:54.119975Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21220","last_updated":"2024-10-28T17:04:18Z","snapshot_observed_at":"2026-07-06T19:40:57.049203Z","submitted_at":"2024-10-28T17:04:18Z","title":"Vision Search Assistant: Empower Vision-Language Models as Multimodal Search Engines","version":1},"cited_work":{"arxiv_id":"2410.21220","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.21220","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Vision search assistant: Em- power vision-language models as multimodal search engines","venue":null,"work_id":"b8776ac3-ff10-4830-8639-e5200cb5cb19","year":2024},"citing_paper":{"arxiv_id":"2506.20670","last_updated":"2025-06-25T17:59:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-25T17:59:42Z","title":"MMSearch-R1: Incentivizing LMMs to Search","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-05-16T15:27:04.228144Z"},"links":{"cited_paper":"/paper/2410.21220","citing_paper":"/paper/2506.20670"},"observation_digest":"sha256:7f3ea54dca6251b7580b027bb79e805701155e49acdf20b9f9265e3702f9aed2","observation_id":"fdd8921a-fe0a-40e5-b704-e73f448640eb","resolution":{"observed_at":"2026-05-16T15:27:04.359334Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21220","last_updated":"2024-10-28T17:04:18Z","snapshot_observed_at":"2026-07-06T19:40:57.049203Z","submitted_at":"2024-10-28T17:04:18Z","title":"Vision Search Assistant: Empower Vision-Language Models as Multimodal Search Engines","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21220","snapshot_observed_at":"2026-08-05T16:15:28.012224Z","title":"Vision Search Assistant: Empower Vision- Language Models as Multimodal Search Engines","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.18805","last_updated":"2025-08-26T08:40:22Z","snapshot_observed_at":"2026-08-08T01:12:52.353250Z","submitted_at":"2025-08-26T08:40:22Z","title":"Hidden Tail: Adversarial Image Causing Stealthy Resource Consumption in Vision-Language Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-05T16:15:28.012224Z"},"links":{"cited_paper":"/paper/2410.21220","citing_paper":"/paper/2508.18805"},"observation_digest":"sha256:3163cdd6b4df96482d8a35c8450df6890803179fe85ed9ec1a0c98035f298331","observation_id":"fdafa1c5-c530-4513-85cb-d8b059f3caab","resolution":{"observed_at":"2026-08-05T16:15:28.012224Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21220","last_updated":"2024-10-28T17:04:18Z","snapshot_observed_at":"2026-07-06T19:40:57.049203Z","submitted_at":"2024-10-28T17:04:18Z","title":"Vision Search Assistant: Empower Vision-Language Models as Multimodal Search Engines","version":1},"cited_work":{"arxiv_id":"2410.21220","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.21220","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Vision search assistant: Em- power vision-language models as multimodal search engines","venue":null,"work_id":"b8776ac3-ff10-4830-8639-e5200cb5cb19","year":2024},"citing_paper":{"arxiv_id":"2604.19264","last_updated":"2026-04-21T09:28:34Z","snapshot_observed_at":"2026-07-31T12:03:21.545054Z","submitted_at":"2026-04-21T09:28:34Z","title":"DR-MMSearchAgent: Deepening Reasoning in Multimodal Search Agents","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-05-10T03:21:30.732925Z"},"links":{"cited_paper":"/paper/2410.21220","citing_paper":"/paper/2604.19264"},"observation_digest":"sha256:167d3591b9bd2b224c500d1397b53a52d08d10f79d4e86872dd599dcfdd8f3af","observation_id":"87c3752c-9c26-4dbd-a70f-c555aeab7736","resolution":{"observed_at":"2026-05-11T12:31:07.876274Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21220","last_updated":"2024-10-28T17:04:18Z","snapshot_observed_at":"2026-07-06T19:40:57.049203Z","submitted_at":"2024-10-28T17:04:18Z","title":"Vision Search Assistant: Empower Vision-Language Models as Multimodal Search Engines","version":1},"cited_work":{"arxiv_id":"2410.21220","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.21220","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Vision search assistant: Em- power vision-language models as multimodal search engines","venue":null,"work_id":"b8776ac3-ff10-4830-8639-e5200cb5cb19","year":2024},"citing_paper":{"arxiv_id":"2604.20486","last_updated":"2026-04-22T12:20:46Z","snapshot_observed_at":"2026-08-06T20:38:43.258492Z","submitted_at":"2026-04-22T12:20:46Z","title":"ProMMSearchAgent: A Generalizable Multimodal Search Agent Trained with Process-Oriented Rewards","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-10T01:12:17.469552Z"},"links":{"cited_paper":"/paper/2410.21220","citing_paper":"/paper/2604.20486"},"observation_digest":"sha256:9d72eaa416dea29c4e43f01259b331ed13d1c01aff5958d4892224649b50e84a","observation_id":"eb930070-8b28-49f4-8e0b-cc3f4616b474","resolution":{"observed_at":"2026-05-11T13:41:10.100388Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21220","last_updated":"2024-10-28T17:04:18Z","snapshot_observed_at":"2026-07-06T19:40:57.049203Z","submitted_at":"2024-10-28T17:04:18Z","title":"Vision Search Assistant: Empower Vision-Language Models as Multimodal Search Engines","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21220","snapshot_observed_at":"2026-08-02T10:20:56.272120Z","title":"arXiv preprint arXiv:2410.21220 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.22643","last_updated":"2026-06-24T02:40:49Z","snapshot_observed_at":"2026-08-08T03:20:50.943223Z","submitted_at":"2026-06-24T02:40:49Z","title":"Reason Before You Retrieve: Agentic Planning for Multi-modal RAG","version":1},"reference_index":156,"source":"arxiv_source","source_observed_at":"2026-08-02T10:20:56.272120Z"},"links":{"cited_paper":"/paper/2410.21220","citing_paper":"/paper/2607.22643"},"observation_digest":"sha256:a8cb61fa545338ecc76f8bd3e2cdb6e1ac2ef8e7831720d2ba60b89b4107e0a0","observation_id":"69f8f00b-ff32-477a-a004-e9721ce81336","resolution":{"observed_at":"2026-08-02T10:20:56.272120Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2410.21220/citation-record","integrity":"/paper/2410.21220/integrity","json":"/paper/2410.21220/citation-record.json","paper":"/paper/2410.21220"},"outbound":[],"paper":{"arxiv_id":"2410.21220","last_updated":"2024-10-28T17:04:18Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-07-06T19:40:57.049203Z","submitted_at":"2024-10-28T17:04:18Z","title":"Vision Search Assistant: Empower Vision-Language Models as Multimodal Search Engines"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 6 inbound Pith citation observations for arXiv:2410.21220."}