{"as_of":"2026-08-14T01:59:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:1daec6fbe87a2ea92a2b9d8ced3c34764ac61f2c3fa1ae62c627101ffba4be1f","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":8,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":8,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":8,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":8,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T11:27:56.303341Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T06:39:37.507046Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2310.20550","last_updated":"2024-04-05T05:29:29Z","snapshot_observed_at":"2026-08-13T05:35:44.608694Z","submitted_at":"2023-10-31T15:31:39Z","title":"CapsFusion: Rethinking Image-Text Data at Scale","version":3},"cited_work":{"arxiv_id":"2310.20550","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2310.20550","snapshot_observed_at":"2026-07-04T06:39:37.507046Z","title":"Capsfusion: Rethinking image-text data at scale","venue":null,"work_id":"74c6af5e-21d8-426b-bf6d-91f2049fc16f","year":2023},"citing_paper":{"arxiv_id":"2403.05525","last_updated":"2024-03-11T16:47:41Z","snapshot_observed_at":"2026-08-11T01:38:59.827005Z","submitted_at":"2024-03-08T18:46:00Z","title":"DeepSeek-VL: Towards Real-World Vision-Language Understanding","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-11T17:58:54.177359Z"},"links":{"cited_paper":"/paper/2310.20550","citing_paper":"/paper/2403.05525"},"observation_digest":"sha256:f581d676b32aab688ec9e2ab6f763fe3f75d40b52d1697fdbdc4419117af0bba","observation_id":"b687545a-f19e-447e-9c3a-50662f4f4cad","resolution":{"observed_at":"2026-05-11T17:58:54.751043Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.20550","last_updated":"2024-04-05T05:29:29Z","snapshot_observed_at":"2026-08-13T05:35:44.608694Z","submitted_at":"2023-10-31T15:31:39Z","title":"CapsFusion: Rethinking Image-Text Data at Scale","version":3},"cited_work":{"arxiv_id":"2310.20550","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2310.20550","snapshot_observed_at":"2026-07-04T06:39:37.507046Z","title":"Capsfusion: Rethinking image-text data at scale","venue":null,"work_id":"74c6af5e-21d8-426b-bf6d-91f2049fc16f","year":2023},"citing_paper":{"arxiv_id":"2404.14396","last_updated":"2025-03-02T07:53:44Z","snapshot_observed_at":"2026-08-12T19:12:43.246639Z","submitted_at":"2024-04-22T17:56:09Z","title":"SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-05-15T22:48:36.010306Z"},"links":{"cited_paper":"/paper/2310.20550","citing_paper":"/paper/2404.14396"},"observation_digest":"sha256:493309ad718797ed9e1786aa287fc4a93a08727ceb42e214d7121a4b14866c50","observation_id":"2b097277-fe44-431b-a487-4ff794e18289","resolution":{"observed_at":"2026-05-15T22:48:36.115040Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.20550","last_updated":"2024-04-05T05:29:29Z","snapshot_observed_at":"2026-08-13T05:35:44.608694Z","submitted_at":"2023-10-31T15:31:39Z","title":"CapsFusion: Rethinking Image-Text Data at Scale","version":3},"cited_work":{"arxiv_id":"2310.20550","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2310.20550","snapshot_observed_at":"2026-07-04T06:39:37.507046Z","title":"Capsfusion: Rethinking image-text data at scale","venue":null,"work_id":"74c6af5e-21d8-426b-bf6d-91f2049fc16f","year":2023},"citing_paper":{"arxiv_id":"2405.08748","last_updated":"2024-05-14T16:33:25Z","snapshot_observed_at":"2026-07-06T18:14:16.386835Z","submitted_at":"2024-05-14T16:33:25Z","title":"Hunyuan-DiT: A Powerful Multi-Resolution Diffusion Transformer with Fine-Grained Chinese Understanding","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-16T14:58:37.383749Z"},"links":{"cited_paper":"/paper/2310.20550","citing_paper":"/paper/2405.08748"},"observation_digest":"sha256:f48ed8d949d624bdaac0d860f2b2a239e2c8b02bc6b8405238c68184ce814f70","observation_id":"a7276b04-4dc2-40a0-9297-790122fa7487","resolution":{"observed_at":"2026-05-16T14:58:37.488355Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.20550","last_updated":"2024-04-05T05:29:29Z","snapshot_observed_at":"2026-08-13T05:35:44.608694Z","submitted_at":"2023-10-31T15:31:39Z","title":"CapsFusion: Rethinking Image-Text Data at Scale","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.20550","snapshot_observed_at":"2026-08-12T11:27:56.303341Z","title":"Caps- fusion: Rethinking image-text data at scale","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.18211","last_updated":"2024-11-27T10:45:40Z","snapshot_observed_at":"2026-08-12T14:25:01.260850Z","submitted_at":"2024-11-27T10:45:40Z","title":"TimeMarker: A Versatile Video-LLM for Long and Short Video Understanding with Superior Temporal Localization Ability","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-12T11:27:56.303341Z"},"links":{"cited_paper":"/paper/2310.20550","citing_paper":"/paper/2411.18211"},"observation_digest":"sha256:6775d07194e315dde11e9c0f466fb82a1b8d7995e3927227b39a9a8acf59cf3f","observation_id":"126d5ada-14ae-4a02-936e-105d0ab7aa12","resolution":{"observed_at":"2026-08-12T11:27:56.303341Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.20550","last_updated":"2024-04-05T05:29:29Z","snapshot_observed_at":"2026-08-13T05:35:44.608694Z","submitted_at":"2023-10-31T15:31:39Z","title":"CapsFusion: Rethinking Image-Text Data at Scale","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.20550","snapshot_observed_at":"2026-08-07T13:08:08.450760Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22613","last_updated":"2025-05-28T17:29:34Z","snapshot_observed_at":"2026-08-13T00:07:33.143025Z","submitted_at":"2025-05-28T17:29:34Z","title":"RICO: Improving Accuracy and Completeness in Image Recaptioning via Visual Reconstruction","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-07T13:08:08.450760Z"},"links":{"cited_paper":"/paper/2310.20550","citing_paper":"/paper/2505.22613"},"observation_digest":"sha256:106b1cf4dafb6431a4bfad69b8e40d67b257760aef24cc4242380dd69caaf4c6","observation_id":"282cb1db-1d9d-4e8f-86a7-92e62621b0dd","resolution":{"observed_at":"2026-08-07T13:08:08.450760Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.20550","last_updated":"2024-04-05T05:29:29Z","snapshot_observed_at":"2026-08-13T05:35:44.608694Z","submitted_at":"2023-10-31T15:31:39Z","title":"CapsFusion: Rethinking Image-Text Data at Scale","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.20550","snapshot_observed_at":"2026-08-06T11:46:45.543788Z","title":"Caps- fusion: Rethinking image-text data at scale","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.22431","last_updated":"2025-07-30T07:21:36Z","snapshot_observed_at":"2026-08-11T02:29:56.004773Z","submitted_at":"2025-07-30T07:21:36Z","title":"HQ-CLIP: Leveraging Large Vision-Language Models to Create High-Quality Image-Text Datasets and CLIP Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T11:46:45.543788Z"},"links":{"cited_paper":"/paper/2310.20550","citing_paper":"/paper/2507.22431"},"observation_digest":"sha256:5ac50fa7d9c153ff262b581a5f04297074c001a636ee1965953e820ba8875d64","observation_id":"85b5c121-2c3c-4e77-9e74-d93c9127a5d4","resolution":{"observed_at":"2026-08-06T11:46:45.543788Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.20550","last_updated":"2024-04-05T05:29:29Z","snapshot_observed_at":"2026-08-13T05:35:44.608694Z","submitted_at":"2023-10-31T15:31:39Z","title":"CapsFusion: Rethinking Image-Text Data at Scale","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.20550","snapshot_observed_at":"2026-08-03T08:15:36.678781Z","title":"Capsfusion: Rethinking image-text data at scale, 2024 b","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.17717","last_updated":"2026-06-09T20:25:14Z","snapshot_observed_at":"2026-08-08T23:34:38.789355Z","submitted_at":"2026-01-25T06:40:25Z","title":"A Survey on Evaluating Quality and Trustworthiness in LLM-Generated Data","version":3},"reference_index":259,"source":"arxiv_source","source_observed_at":"2026-08-03T08:15:36.678781Z"},"links":{"cited_paper":"/paper/2310.20550","citing_paper":"/paper/2601.17717"},"observation_digest":"sha256:3cd221caa1220212d4e3ba62c1e102bed0595124d419df7e2e03c54eacbbf2a3","observation_id":"3191fa67-74b5-4f33-b0bd-8457f0ec7b40","resolution":{"observed_at":"2026-08-03T08:15:36.678781Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.20550","last_updated":"2024-04-05T05:29:29Z","snapshot_observed_at":"2026-08-13T05:35:44.608694Z","submitted_at":"2023-10-31T15:31:39Z","title":"CapsFusion: Rethinking Image-Text Data at Scale","version":3},"cited_work":{"arxiv_id":"2310.20550","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2310.20550","snapshot_observed_at":"2026-07-04T06:39:37.507046Z","title":"Capsfusion: Rethinking image-text data at scale","venue":null,"work_id":"74c6af5e-21d8-426b-bf6d-91f2049fc16f","year":2023},"citing_paper":{"arxiv_id":"2606.21734","last_updated":"2026-06-19T20:43:49Z","snapshot_observed_at":"2026-08-05T18:05:51.515234Z","submitted_at":"2026-06-19T20:43:49Z","title":"HPP: Hierarchical Programmatic Probing for Long Video Understanding by Decoupling Perception and Reasoning","version":1},"reference_index":250,"source":"arxiv_source","source_observed_at":"2026-06-26T14:19:53.450263Z"},"links":{"cited_paper":"/paper/2310.20550","citing_paper":"/paper/2606.21734"},"observation_digest":"sha256:03452d976288a998e40f89dfed873b56d82e1d82f318ca54ced0b80a733c7408","observation_id":"b3543965-c233-40b3-83c7-965407277f72","resolution":{"observed_at":"2026-07-04T06:39:37.508435Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2310.20550/citation-record","integrity":"/paper/2310.20550/integrity","json":"/paper/2310.20550/citation-record.json","paper":"/paper/2310.20550"},"outbound":[],"paper":{"arxiv_id":"2310.20550","last_updated":"2024-04-05T05:29:29Z","latest_version":3,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-13T05:35:44.608694Z","submitted_at":"2023-10-31T15:31:39Z","title":"CapsFusion: Rethinking Image-Text Data at Scale"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 8 inbound Pith citation observations for arXiv:2310.20550."}