{"as_of":"2026-08-10T15:34:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f9d7533ffe1f4e2f2ef241bafb3866276bbb81a7dd3bb032ed04fc7cbea3d034","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":12,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":12,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":12,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":12,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T12:42:19.724749Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T00:19:13.788988Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2410.02746","last_updated":"2025-02-19T05:59:59Z","snapshot_observed_at":"2026-08-10T09:36:55.367438Z","submitted_at":"2024-10-03T17:56:09Z","title":"Contrastive Localized Language-Image Pre-Training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02746","snapshot_observed_at":"2026-08-07T12:42:19.724749Z","title":"Contrastive lo- calized language-image pre-training","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23766","last_updated":"2025-05-29T17:59:56Z","snapshot_observed_at":"2026-08-08T00:05:10.710300Z","submitted_at":"2025-05-29T17:59:56Z","title":"Argus: Vision-Centric Reasoning with Grounded Chain-of-Thought","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T12:42:19.724749Z"},"links":{"cited_paper":"/paper/2410.02746","citing_paper":"/paper/2505.23766"},"observation_digest":"sha256:cb0e19547d92d601a6e9e167623e80c18a96351e563c373de711df2a2e60b2cb","observation_id":"10317e8e-dfcd-4da6-b919-f54e55f45b5d","resolution":{"observed_at":"2026-08-07T12:42:19.724749Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02746","last_updated":"2025-02-19T05:59:59Z","snapshot_observed_at":"2026-08-10T09:36:55.367438Z","submitted_at":"2024-10-03T17:56:09Z","title":"Contrastive Localized Language-Image Pre-Training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02746","snapshot_observed_at":"2026-08-06T20:37:31.659608Z","title":"Con- trastive localized language-image pre-training,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02273","last_updated":"2025-07-03T03:27:11Z","snapshot_observed_at":"2026-08-09T02:56:40.719184Z","submitted_at":"2025-07-03T03:27:11Z","title":"Fx-Encoder++: Extracting Instrument-Wise Audio Effects Representations from Mixtures","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T20:37:31.659608Z"},"links":{"cited_paper":"/paper/2410.02746","citing_paper":"/paper/2507.02273"},"observation_digest":"sha256:8cbf0752298ba1821a6f8312d7f5ea71d4969452a3b1f8f7e4a4b718033bbd7f","observation_id":"db769080-4e8a-4ec9-bb79-9fcfc021e317","resolution":{"observed_at":"2026-08-06T20:37:31.659608Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02746","last_updated":"2025-02-19T05:59:59Z","snapshot_observed_at":"2026-08-10T09:36:55.367438Z","submitted_at":"2024-10-03T17:56:09Z","title":"Contrastive Localized Language-Image Pre-Training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02746","snapshot_observed_at":"2026-08-05T18:47:45.225148Z","title":"URL https://arxiv.org/abs/2410.02746","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.18235","last_updated":"2025-08-20T00:57:21Z","snapshot_observed_at":"2026-08-05T18:44:01.835548Z","submitted_at":"2025-08-20T00:57:21Z","title":"Sealing The Backdoor: Unlearning Adversarial Text Triggers In Diffusion Models Using Knowledge Distillation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-05T18:47:45.225148Z"},"links":{"cited_paper":"/paper/2410.02746","citing_paper":"/paper/2508.18235"},"observation_digest":"sha256:3ec5ec027e6670bbdef4e77ca91e4486a4b09bd869afe88c91a06eeea618193f","observation_id":"97a0e847-3537-4f22-8915-6afb4ad9b595","resolution":{"observed_at":"2026-08-05T18:47:45.225148Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02746","last_updated":"2025-02-19T05:59:59Z","snapshot_observed_at":"2026-08-10T09:36:55.367438Z","submitted_at":"2024-10-03T17:56:09Z","title":"Contrastive Localized Language-Image Pre-Training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02746","snapshot_observed_at":"2026-08-05T10:46:04.661105Z","title":"Contrastive localized language-image pre-training","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.03800","last_updated":"2025-09-04T01:28:44Z","snapshot_observed_at":"2026-08-09T03:19:11.380391Z","submitted_at":"2025-09-04T01:28:44Z","title":"MedVista3D: Vision-Language Modeling for Reducing Diagnostic Errors in 3D CT Disease Detection, Understanding and Reporting","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-05T10:46:04.661105Z"},"links":{"cited_paper":"/paper/2410.02746","citing_paper":"/paper/2509.03800"},"observation_digest":"sha256:df5696597acdb933bfd012ce6ab80b58c21597c1926454f49e1b2bbeeba6e02f","observation_id":"41ed5110-7327-4e3d-bafa-1a1622ef2ee5","resolution":{"observed_at":"2026-08-05T10:46:04.661105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02746","last_updated":"2025-02-19T05:59:59Z","snapshot_observed_at":"2026-08-10T09:36:55.367438Z","submitted_at":"2024-10-03T17:56:09Z","title":"Contrastive Localized Language-Image Pre-Training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02746","snapshot_observed_at":"2026-08-04T10:18:42.682062Z","title":"Contrastive localized language-image pre-training","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.10921","last_updated":"2026-05-25T02:35:42Z","snapshot_observed_at":"2026-08-04T10:18:40.408381Z","submitted_at":"2025-10-13T02:32:07Z","title":"FG-CLIP 2: A Bilingual Fine-grained Vision-Language Alignment Model","version":3},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-04T10:18:42.682062Z"},"links":{"cited_paper":"/paper/2410.02746","citing_paper":"/paper/2510.10921"},"observation_digest":"sha256:d04cbed25523cc6146a42060406c0cb97f2f363bef8584ffc99f0afca299571e","observation_id":"21d5ce15-807a-4a5b-b0db-72252ee48611","resolution":{"observed_at":"2026-08-04T10:18:42.682062Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02746","last_updated":"2025-02-19T05:59:59Z","snapshot_observed_at":"2026-08-10T09:36:55.367438Z","submitted_at":"2024-10-03T17:56:09Z","title":"Contrastive Localized Language-Image Pre-Training","version":2},"cited_work":{"arxiv_id":"2410.02746","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.02746","snapshot_observed_at":"2026-07-04T00:19:13.788988Z","title":"Contrastive localized language-image pre-training","venue":null,"work_id":"73043e5e-bcc6-467c-9c9e-5ed3881fc65a","year":2024},"citing_paper":{"arxiv_id":"2604.09552","last_updated":"2026-06-05T13:56:30Z","snapshot_observed_at":"2026-08-03T06:07:39.172822Z","submitted_at":"2026-01-31T03:09:47Z","title":"MCERF: Advancing Multimodal LLM Evaluation of Engineering Documentation with Enhanced Retrieval","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-16T09:29:32.250418Z"},"links":{"cited_paper":"/paper/2410.02746","citing_paper":"/paper/2604.09552"},"observation_digest":"sha256:8d1c95f435bc258fb474b1fcad450f6a83e7a5e0973cc3f5549709f6139d098a","observation_id":"206d0ac7-b75d-4f82-bf73-4bb50d3769c9","resolution":{"observed_at":"2026-05-16T09:30:48.231935Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02746","last_updated":"2025-02-19T05:59:59Z","snapshot_observed_at":"2026-08-10T09:36:55.367438Z","submitted_at":"2024-10-03T17:56:09Z","title":"Contrastive Localized Language-Image Pre-Training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02746","snapshot_observed_at":"2026-08-03T06:07:40.022288Z","title":"Contrastive localized language-image pre-training,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2604.09552","last_updated":"2026-06-05T13:56:30Z","snapshot_observed_at":"2026-08-03T06:07:39.172822Z","submitted_at":"2026-01-31T03:09:47Z","title":"MCERF: Advancing Multimodal LLM Evaluation of Engineering Documentation with Enhanced Retrieval","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-03T06:07:40.022288Z"},"links":{"cited_paper":"/paper/2410.02746","citing_paper":"/paper/2604.09552"},"observation_digest":"sha256:a12b74414466b743f687f63f9bf9682f178246843ddc42d5c928f2da76ba016f","observation_id":"b6db835f-6bf8-4700-a978-b909f73139ca","resolution":{"observed_at":"2026-08-03T06:07:40.022288Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02746","last_updated":"2025-02-19T05:59:59Z","snapshot_observed_at":"2026-08-10T09:36:55.367438Z","submitted_at":"2024-10-03T17:56:09Z","title":"Contrastive Localized Language-Image Pre-Training","version":2},"cited_work":{"arxiv_id":"2410.02746","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.02746","snapshot_observed_at":"2026-07-04T00:19:13.788988Z","title":"Contrastive localized language-image pre-training","venue":null,"work_id":"73043e5e-bcc6-467c-9c9e-5ed3881fc65a","year":2024},"citing_paper":{"arxiv_id":"2605.29776","last_updated":"2026-05-28T11:21:44Z","snapshot_observed_at":"2026-08-03T05:52:15.988085Z","submitted_at":"2026-05-28T11:21:44Z","title":"Improving CLIP Adaptation by Breaking Tail Alignment for Source-Free Cross-Domain Few-Shot Learning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-29T08:16:57.329872Z"},"links":{"cited_paper":"/paper/2410.02746","citing_paper":"/paper/2605.29776"},"observation_digest":"sha256:396ea1fecf098db3707c1926cc7f6a63eeff34e5c99c71c550ae1653c017b280","observation_id":"14c2ff8d-487a-420e-9634-def8d146bdca","resolution":{"observed_at":"2026-06-29T08:23:15.562958Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02746","last_updated":"2025-02-19T05:59:59Z","snapshot_observed_at":"2026-08-10T09:36:55.367438Z","submitted_at":"2024-10-03T17:56:09Z","title":"Contrastive Localized Language-Image Pre-Training","version":2},"cited_work":{"arxiv_id":"2410.02746","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.02746","snapshot_observed_at":"2026-07-04T00:19:13.788988Z","title":"Contrastive localized language-image pre-training","venue":null,"work_id":"73043e5e-bcc6-467c-9c9e-5ed3881fc65a","year":2024},"citing_paper":{"arxiv_id":"2606.01825","last_updated":"2026-07-01T05:50:06Z","snapshot_observed_at":"2026-08-05T10:25:09.105468Z","submitted_at":"2026-06-01T07:41:44Z","title":"ROGLE: Robust Global-Local Alignment with Automated Region Supervision for Text-Based Person Search","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-06-28T15:18:17.427707Z"},"links":{"cited_paper":"/paper/2410.02746","citing_paper":"/paper/2606.01825"},"observation_digest":"sha256:053b7863a539b741d9decdd97f265b8b8d75ed2b5f7a79d3cf2a1019a5583242","observation_id":"3c81927d-03e5-4188-a63f-84cfb6a3c2b0","resolution":{"observed_at":"2026-07-01T22:36:16.876040Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02746","last_updated":"2025-02-19T05:59:59Z","snapshot_observed_at":"2026-08-10T09:36:55.367438Z","submitted_at":"2024-10-03T17:56:09Z","title":"Contrastive Localized Language-Image Pre-Training","version":2},"cited_work":{"arxiv_id":"2410.02746","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.02746","snapshot_observed_at":"2026-07-04T00:19:13.788988Z","title":"Contrastive localized language-image pre-training","venue":null,"work_id":"73043e5e-bcc6-467c-9c9e-5ed3881fc65a","year":2024},"citing_paper":{"arxiv_id":"2606.01825","last_updated":"2026-07-01T05:50:06Z","snapshot_observed_at":"2026-08-05T10:25:09.105468Z","submitted_at":"2026-06-01T07:41:44Z","title":"ROGLE: Robust Global-Local Alignment with Automated Region Supervision for Text-Based Person Search","version":2},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-07-02T23:17:03.456746Z"},"links":{"cited_paper":"/paper/2410.02746","citing_paper":"/paper/2606.01825"},"observation_digest":"sha256:1233bddc2f1c5ca5315eb9166e98aaf3f0cf8eecee5bd926f5444361588458c7","observation_id":"2c58a7a9-7f40-4e70-a6dd-a1069d22512b","resolution":{"observed_at":"2026-07-02T23:17:28.864002Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02746","last_updated":"2025-02-19T05:59:59Z","snapshot_observed_at":"2026-08-10T09:36:55.367438Z","submitted_at":"2024-10-03T17:56:09Z","title":"Contrastive Localized Language-Image Pre-Training","version":2},"cited_work":{"arxiv_id":"2410.02746","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.02746","snapshot_observed_at":"2026-07-04T00:19:13.788988Z","title":"Contrastive localized language-image pre-training","venue":null,"work_id":"73043e5e-bcc6-467c-9c9e-5ed3881fc65a","year":2024},"citing_paper":{"arxiv_id":"2606.19489","last_updated":"2026-06-17T18:27:17Z","snapshot_observed_at":"2026-08-08T00:47:44.045909Z","submitted_at":"2026-06-17T18:27:17Z","title":"Concept Flow Models: Anchoring Concept-Based Reasoning with Hierarchical Bottlenecks","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-26T21:16:21.252304Z"},"links":{"cited_paper":"/paper/2410.02746","citing_paper":"/paper/2606.19489"},"observation_digest":"sha256:87aed9d917281ffb1cad99aa8571e4f1a782e1471e0cf5510f5be8da7936d205","observation_id":"7cb20dff-3047-436b-b11c-4a52cd1dafc0","resolution":{"observed_at":"2026-07-04T00:19:13.790413Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02746","last_updated":"2025-02-19T05:59:59Z","snapshot_observed_at":"2026-08-10T09:36:55.367438Z","submitted_at":"2024-10-03T17:56:09Z","title":"Contrastive Localized Language-Image Pre-Training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02746","snapshot_observed_at":"2026-08-01T11:31:04.191369Z","title":"Contrastive localized language-image pre-training,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.19889","last_updated":"2026-07-22T08:20:52Z","snapshot_observed_at":"2026-08-08T10:17:50.117528Z","submitted_at":"2026-07-22T08:20:52Z","title":"LAVIFT: Latent-Action-Guided Vision Fine-Tuning for Surgical Interaction Recognition","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-01T11:31:04.191369Z"},"links":{"cited_paper":"/paper/2410.02746","citing_paper":"/paper/2607.19889"},"observation_digest":"sha256:7fdb2d83b23a44091bad5b0ca88545e94035ea73111867d912e3612f77c061f0","observation_id":"29fc88c7-d200-4558-8e6a-94ca6844798f","resolution":{"observed_at":"2026-08-01T11:31:04.191369Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2410.02746/citation-record","integrity":"/paper/2410.02746/integrity","json":"/paper/2410.02746/citation-record.json","paper":"/paper/2410.02746"},"outbound":[],"paper":{"arxiv_id":"2410.02746","last_updated":"2025-02-19T05:59:59Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-10T09:36:55.367438Z","submitted_at":"2024-10-03T17:56:09Z","title":"Contrastive Localized Language-Image Pre-Training"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 12 inbound Pith citation observations for arXiv:2410.02746."}