{"as_of":"2026-08-10T16:42:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:016366e59c67963803d2d98b99ce4f0d2653c14ad3cc4203cfa653b92dad98f8","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":8,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":8,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":8,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":8,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T00:30:58.529480Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T11:09:46.106651Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2503.01739","last_updated":"2025-05-13T16:54:08Z","snapshot_observed_at":"2026-08-07T17:33:03.445527Z","submitted_at":"2025-03-03T17:00:36Z","title":"VideoUFO: A Million-Scale User-Focused Dataset for Text-to-Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.01739","snapshot_observed_at":"2026-08-07T00:30:58.529480Z","title":"Wang and Y","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.13691","last_updated":"2025-06-16T16:52:52Z","snapshot_observed_at":"2026-08-08T15:16:17.202058Z","submitted_at":"2025-06-16T16:52:52Z","title":"UltraVideo: High-Quality UHD Video Dataset with Comprehensive Captions","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T00:30:58.529480Z"},"links":{"cited_paper":"/paper/2503.01739","citing_paper":"/paper/2506.13691"},"observation_digest":"sha256:9ed2720c2e1d6b129f1b8703283391f14ff9406c6156bc964059b7b538abb5f5","observation_id":"862c20d3-9476-46a4-9914-345f1ab09f43","resolution":{"observed_at":"2026-08-07T00:30:58.529480Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01739","last_updated":"2025-05-13T16:54:08Z","snapshot_observed_at":"2026-08-07T17:33:03.445527Z","submitted_at":"2025-03-03T17:00:36Z","title":"VideoUFO: A Million-Scale User-Focused Dataset for Text-to-Video Generation","version":2},"cited_work":{"arxiv_id":"2503.01739","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.01739","snapshot_observed_at":"2026-07-04T11:09:46.106651Z","title":"Videoufo: A million-scale user- focused dataset for text-to-video generation","venue":null,"work_id":"e59a4b9f-ed33-4401-9f78-f46163e320d3","year":2025},"citing_paper":{"arxiv_id":"2601.04068","last_updated":"2026-05-20T06:08:56Z","snapshot_observed_at":"2026-07-06T22:41:01.254450Z","submitted_at":"2026-01-07T16:32:17Z","title":"Mind the Generative Details: Direct Localized Detail Preference Optimization for Video Diffusion Models","version":3},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-05-16T16:25:03.743594Z"},"links":{"cited_paper":"/paper/2503.01739","citing_paper":"/paper/2601.04068"},"observation_digest":"sha256:5a6c5a96ebdccf6d00e2c4d6398550d314ff6f44de2bef7df3bcdcdeea734809","observation_id":"4aee2bd6-5d3c-4d94-a2b9-725fb09da934","resolution":{"observed_at":"2026-05-16T16:28:05.535575Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01739","last_updated":"2025-05-13T16:54:08Z","snapshot_observed_at":"2026-08-07T17:33:03.445527Z","submitted_at":"2025-03-03T17:00:36Z","title":"VideoUFO: A Million-Scale User-Focused Dataset for Text-to-Video Generation","version":2},"cited_work":{"arxiv_id":"2503.01739","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.01739","snapshot_observed_at":"2026-07-04T11:09:46.106651Z","title":"Videoufo: A million-scale user- focused dataset for text-to-video generation","venue":null,"work_id":"e59a4b9f-ed33-4401-9f78-f46163e320d3","year":2025},"citing_paper":{"arxiv_id":"2601.04068","last_updated":"2026-05-20T06:08:56Z","snapshot_observed_at":"2026-07-06T22:41:01.254450Z","submitted_at":"2026-01-07T16:32:17Z","title":"Mind the Generative Details: Direct Localized Detail Preference Optimization for Video Diffusion Models","version":4},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-05-21T16:01:52.150950Z"},"links":{"cited_paper":"/paper/2503.01739","citing_paper":"/paper/2601.04068"},"observation_digest":"sha256:a4e3e2185f4bca6d00e163f94af79b8948420b70ed7cab003675eacf9bb15891","observation_id":"c8530916-28e0-4eeb-af3e-16c5b687b48e","resolution":{"observed_at":"2026-05-21T16:04:14.691778Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01739","last_updated":"2025-05-13T16:54:08Z","snapshot_observed_at":"2026-08-07T17:33:03.445527Z","submitted_at":"2025-03-03T17:00:36Z","title":"VideoUFO: A Million-Scale User-Focused Dataset for Text-to-Video Generation","version":2},"cited_work":{"arxiv_id":"2503.01739","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.01739","snapshot_observed_at":"2026-07-04T11:09:46.106651Z","title":"Videoufo: A million-scale user- focused dataset for text-to-video generation","venue":null,"work_id":"e59a4b9f-ed33-4401-9f78-f46163e320d3","year":2025},"citing_paper":{"arxiv_id":"2604.11627","last_updated":"2026-04-13T15:38:22Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-13T15:38:22Z","title":"POINTS-Long: Adaptive Dual-Mode Visual Reasoning in MLLMs","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-05-10T15:23:08.671342Z"},"links":{"cited_paper":"/paper/2503.01739","citing_paper":"/paper/2604.11627"},"observation_digest":"sha256:938fec5cb4efa4d2c012d23d4cbd128572979f493e9d8dc1f543a809f3683aee","observation_id":"63616cb3-5061-4cb2-b624-85d1710fbf61","resolution":{"observed_at":"2026-05-11T10:41:03.717562Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01739","last_updated":"2025-05-13T16:54:08Z","snapshot_observed_at":"2026-08-07T17:33:03.445527Z","submitted_at":"2025-03-03T17:00:36Z","title":"VideoUFO: A Million-Scale User-Focused Dataset for Text-to-Video Generation","version":2},"cited_work":{"arxiv_id":"2503.01739","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.01739","snapshot_observed_at":"2026-07-04T11:09:46.106651Z","title":"Videoufo: A million-scale user- focused dataset for text-to-video generation","venue":null,"work_id":"e59a4b9f-ed33-4401-9f78-f46163e320d3","year":2025},"citing_paper":{"arxiv_id":"2606.09639","last_updated":"2026-06-11T05:58:22Z","snapshot_observed_at":"2026-08-02T02:07:05.154330Z","submitted_at":"2026-06-08T15:35:51Z","title":"CineDance: Towards Next-Generation Multi-Shot Long-Form Cinematic Audio-Video Generation","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-06-27T17:30:25.371658Z"},"links":{"cited_paper":"/paper/2503.01739","citing_paper":"/paper/2606.09639"},"observation_digest":"sha256:23f669f6f76707245c61dd46307dc65095cf4c0c262cbb13953141d42d3361de","observation_id":"1672e185-056c-4d87-b13f-6e8da2329eae","resolution":{"observed_at":"2026-07-03T00:07:28.108003Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01739","last_updated":"2025-05-13T16:54:08Z","snapshot_observed_at":"2026-08-07T17:33:03.445527Z","submitted_at":"2025-03-03T17:00:36Z","title":"VideoUFO: A Million-Scale User-Focused Dataset for Text-to-Video Generation","version":2},"cited_work":{"arxiv_id":"2503.01739","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.01739","snapshot_observed_at":"2026-07-04T11:09:46.106651Z","title":"Videoufo: A million-scale user- focused dataset for text-to-video generation","venue":null,"work_id":"e59a4b9f-ed33-4401-9f78-f46163e320d3","year":2025},"citing_paper":{"arxiv_id":"2606.24937","last_updated":"2026-07-27T15:17:17Z","snapshot_observed_at":"2026-08-02T23:19:25.465662Z","submitted_at":"2026-06-22T17:48:54Z","title":"The Hitchhiker's Guide to Agentic AI: From Foundations to Systems","version":1},"reference_index":201,"source":"pdf_text","source_observed_at":"2026-06-26T08:09:57.542558Z"},"links":{"cited_paper":"/paper/2503.01739","citing_paper":"/paper/2606.24937"},"observation_digest":"sha256:ba87f4fdb66f56ae2f769f83ddbfcfedf75b53d6a6b8e5e508102275ad479c27","observation_id":"0054afe7-ded0-49f5-b2a8-c4b6b914e564","resolution":{"observed_at":"2026-07-04T11:09:46.108197Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01739","last_updated":"2025-05-13T16:54:08Z","snapshot_observed_at":"2026-08-07T17:33:03.445527Z","submitted_at":"2025-03-03T17:00:36Z","title":"VideoUFO: A Million-Scale User-Focused Dataset for Text-to-Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.01739","snapshot_observed_at":"2026-08-02T10:27:18.442300Z","title":"SAPO: Soft Adaptive Policy Optimization for Efficient LLM Alignment.arXiv Preprint arXiv:2503.01739, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.24937","last_updated":"2026-07-27T15:17:17Z","snapshot_observed_at":"2026-08-02T23:19:25.465662Z","submitted_at":"2026-06-22T17:48:54Z","title":"The Hitchhiker's Guide to Agentic AI: From Foundations to Systems","version":2},"reference_index":188,"source":"pdf_text","source_observed_at":"2026-08-02T10:27:18.442300Z"},"links":{"cited_paper":"/paper/2503.01739","citing_paper":"/paper/2606.24937"},"observation_digest":"sha256:4426a39f0ba9dd9b32ac94288e1b1ef991d6a35d5bbf5d83ce8b88478e651162","observation_id":"e8a14d5c-6dec-4773-9dce-7df3f8e7bf41","resolution":{"observed_at":"2026-08-02T10:27:18.442300Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01739","last_updated":"2025-05-13T16:54:08Z","snapshot_observed_at":"2026-08-07T17:33:03.445527Z","submitted_at":"2025-03-03T17:00:36Z","title":"VideoUFO: A Million-Scale User-Focused Dataset for Text-to-Video Generation","version":2},"cited_work":{"arxiv_id":"2503.01739","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.01739","snapshot_observed_at":"2026-07-04T11:09:46.106651Z","title":"Videoufo: A million-scale user- focused dataset for text-to-video generation","venue":null,"work_id":"e59a4b9f-ed33-4401-9f78-f46163e320d3","year":2025},"citing_paper":{"arxiv_id":"2607.00858","last_updated":"2026-07-01T12:23:38Z","snapshot_observed_at":"2026-08-07T05:20:54.117065Z","submitted_at":"2026-07-01T12:23:38Z","title":"MoVA: Learning Asymmetric Dual Projections for Modular Long Video-Text Alignment","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-07-02T14:25:04.811472Z"},"links":{"cited_paper":"/paper/2503.01739","citing_paper":"/paper/2607.00858"},"observation_digest":"sha256:903c516aca8ec56ffc54b346807867978cab9182d5fc461713f8de27c7773d10","observation_id":"551b0c30-eac3-4054-ba50-fae16926901a","resolution":{"observed_at":"2026-07-02T14:27:03.018488Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2503.01739/citation-record","integrity":"/paper/2503.01739/integrity","json":"/paper/2503.01739/citation-record.json","paper":"/paper/2503.01739"},"outbound":[],"paper":{"arxiv_id":"2503.01739","last_updated":"2025-05-13T16:54:08Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T17:33:03.445527Z","submitted_at":"2025-03-03T17:00:36Z","title":"VideoUFO: A Million-Scale User-Focused Dataset for Text-to-Video Generation"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 8 inbound Pith citation observations for arXiv:2503.01739."}