{"as_of":"2026-08-22T22:43:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:2d4d05ae9b608940fecc29253c667ff71a6e674408ffe9888ab417f6f4f97a26","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":3,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":3,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-22T06:32:14.747728+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T14:10:55.455485Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T00:17:28.562753Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2403.12042","last_updated":"2024-07-06T04:32:58Z","snapshot_observed_at":"2026-08-16T14:08:40.726991Z","submitted_at":"2024-03-18T17:59:58Z","title":"Exploring Pre-trained Text-to-Video Diffusion Models for Referring Video Object Segmentation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.12042","snapshot_observed_at":"2026-08-08T14:10:55.455485Z","title":"squeezing some- thing","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.07001","last_updated":"2025-03-19T21:27:28Z","snapshot_observed_at":"2026-08-21T17:19:56.692845Z","submitted_at":"2025-02-10T19:53:46Z","title":"From Image to Video: An Empirical Study of Diffusion Representations","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-08T14:10:55.455485Z"},"links":{"cited_paper":"/paper/2403.12042","citing_paper":"/paper/2502.07001"},"observation_digest":"sha256:ed2826217157177181128da0c18e9a3aa1361cca96012c995a69ebde333de9c4","observation_id":"6e333442-b790-49a6-871e-4f4bcf9c06e7","resolution":{"observed_at":"2026-08-08T14:10:55.455485Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.12042","last_updated":"2024-07-06T04:32:58Z","snapshot_observed_at":"2026-08-16T14:08:40.726991Z","submitted_at":"2024-03-18T17:59:58Z","title":"Exploring Pre-trained Text-to-Video Diffusion Models for Referring Video Object Segmentation","version":2},"cited_work":{"arxiv_id":"2403.12042","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2403.12042","snapshot_observed_at":"2026-07-03T00:17:28.562753Z","title":"arXiv preprint arXiv:2403.12042 , year=","venue":null,"work_id":"9a698691-b760-4c73-b0d9-7294d3c367aa","year":null},"citing_paper":{"arxiv_id":"2605.18010","last_updated":"2026-08-19T23:39:30Z","snapshot_observed_at":"2026-08-22T22:11:46.695664Z","submitted_at":"2026-05-18T08:05:07Z","title":"Functionalization via Structure Completion and Motion Rectification","version":1},"reference_index":212,"source":"arxiv_source","source_observed_at":"2026-05-20T12:25:07.157086Z"},"links":{"cited_paper":"/paper/2403.12042","citing_paper":"/paper/2605.18010"},"observation_digest":"sha256:057981c3f4e08385ed55a50181712cd18866056c07feceec5c424e6e7a6b2581","observation_id":"c54dd21c-a65e-40f0-b9e1-7e1dcf5e44bc","resolution":{"observed_at":"2026-05-20T12:28:16.971374Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.12042","last_updated":"2024-07-06T04:32:58Z","snapshot_observed_at":"2026-08-16T14:08:40.726991Z","submitted_at":"2024-03-18T17:59:58Z","title":"Exploring Pre-trained Text-to-Video Diffusion Models for Referring Video Object Segmentation","version":2},"cited_work":{"arxiv_id":"2403.12042","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2403.12042","snapshot_observed_at":"2026-07-03T00:17:28.562753Z","title":"arXiv preprint arXiv:2403.12042 , year=","venue":null,"work_id":"9a698691-b760-4c73-b0d9-7294d3c367aa","year":null},"citing_paper":{"arxiv_id":"2606.09646","last_updated":"2026-06-08T15:40:32Z","snapshot_observed_at":"2026-08-09T02:42:00.413846Z","submitted_at":"2026-06-08T15:40:32Z","title":"Do Video Foundation Models Understand Intuitive Physics? A Layerwise Probing Analysis","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-27T17:25:15.493925Z"},"links":{"cited_paper":"/paper/2403.12042","citing_paper":"/paper/2606.09646"},"observation_digest":"sha256:17ec3de4d5d9ef24778a529c6a68b7d534dd40a81b629790399c0ec7d50f0a44","observation_id":"abf7b814-e248-449b-b3a6-6bad47182fbd","resolution":{"observed_at":"2026-07-03T00:17:28.564434Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2403.12042/citation-record","integrity":"/paper/2403.12042/integrity","json":"/paper/2403.12042/citation-record.json","paper":"/paper/2403.12042"},"outbound":[],"paper":{"arxiv_id":"2403.12042","last_updated":"2024-07-06T04:32:58Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-16T14:08:40.726991Z","submitted_at":"2024-03-18T17:59:58Z","title":"Exploring Pre-trained Text-to-Video Diffusion Models for Referring Video Object Segmentation"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"thesis":"As of 22 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 3 inbound Pith citation observations for arXiv:2403.12042."}