{"as_of":"2026-08-19T03:19:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b805dd64776f57931bd8273e0cfb7d810c4bd58124b8a9717f0fb2c8665f46d5","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":13,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":13,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":13,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":13,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T14:26:22.078469Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T08:17:45.921041Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2401.07781","last_updated":"2024-01-15T15:42:39Z","snapshot_observed_at":"2026-08-16T14:27:25.161652Z","submitted_at":"2024-01-15T15:42:39Z","title":"Towards A Better Metric for Text-to-Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.07781","snapshot_observed_at":"2026-08-12T14:26:22.078469Z","title":"Towards a better metric for text-to-video generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.16718","last_updated":"2025-04-25T02:50:58Z","snapshot_observed_at":"2026-08-18T14:50:45.868697Z","submitted_at":"2024-11-22T23:59:12Z","title":"Neuro-Symbolic Evaluation of Text-to-Video Models using Formal Verification","version":5},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-12T14:26:22.078469Z"},"links":{"cited_paper":"/paper/2401.07781","citing_paper":"/paper/2411.16718"},"observation_digest":"sha256:7633df0b26480087ddf7346dfc16aead4656cb786c87b5ecf3825074a1cfded3","observation_id":"b12f0e9c-2bdb-4259-ae5f-bed25f8e91d2","resolution":{"observed_at":"2026-08-12T14:26:22.078469Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.07781","last_updated":"2024-01-15T15:42:39Z","snapshot_observed_at":"2026-08-16T14:27:25.161652Z","submitted_at":"2024-01-15T15:42:39Z","title":"Towards A Better Metric for Text-to-Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.07781","snapshot_observed_at":"2026-08-11T21:45:10.147322Z","title":"Towards a better metric for text-to-video generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.04189","last_updated":"2025-07-14T02:27:36Z","snapshot_observed_at":"2026-08-16T06:57:10.202945Z","submitted_at":"2024-12-05T14:29:10Z","title":"HANDI: Hand-Centric Text-and-Image Conditioned Video Generation","version":5},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-11T21:45:10.147322Z"},"links":{"cited_paper":"/paper/2401.07781","citing_paper":"/paper/2412.04189"},"observation_digest":"sha256:6bb96c964d15fa0fd7fd9339b748cb1b5d25a5fdbbacf338c2dab80ada124434","observation_id":"c3a86d49-5613-41b7-80cf-553565c35d36","resolution":{"observed_at":"2026-08-11T21:45:10.147322Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.07781","last_updated":"2024-01-15T15:42:39Z","snapshot_observed_at":"2026-08-16T14:27:25.161652Z","submitted_at":"2024-01-15T15:42:39Z","title":"Towards A Better Metric for Text-to-Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.07781","snapshot_observed_at":"2026-08-11T20:10:47.626159Z","title":"Towards a better metric for text-to-video generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.06016","last_updated":"2025-04-07T11:16:47Z","snapshot_observed_at":"2026-08-11T20:03:50.332267Z","submitted_at":"2024-12-08T18:21:00Z","title":"Track4Gen: Teaching Video Diffusion Models to Track Points Improves Video Generation","version":3},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-11T20:10:47.626159Z"},"links":{"cited_paper":"/paper/2401.07781","citing_paper":"/paper/2412.06016"},"observation_digest":"sha256:7127fe7b21aa43753e4fb88617270c2965f39bcbcfed8500544b8bf8b4eabcc5","observation_id":"75ac7204-a380-491e-8ef3-f137b7f14726","resolution":{"observed_at":"2026-08-11T20:10:47.626159Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.07781","last_updated":"2024-01-15T15:42:39Z","snapshot_observed_at":"2026-08-16T14:27:25.161652Z","submitted_at":"2024-01-15T15:42:39Z","title":"Towards A Better Metric for Text-to-Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.07781","snapshot_observed_at":"2026-08-11T12:29:09.671977Z","title":"Towards a better metric for text-to-video generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.14167","last_updated":"2024-12-18T18:59:49Z","snapshot_observed_at":"2026-08-18T04:02:16.803113Z","submitted_at":"2024-12-18T18:59:49Z","title":"VideoDPO: Omni-Preference Alignment for Video Diffusion Generation","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-11T12:29:09.671977Z"},"links":{"cited_paper":"/paper/2401.07781","citing_paper":"/paper/2412.14167"},"observation_digest":"sha256:136d680c95cb2c5608bc6acaa318ea740d22fd1d3a4a4a4df3c9fb2d3a968050","observation_id":"646c1d86-a489-4340-ba33-775ab3af110b","resolution":{"observed_at":"2026-08-11T12:29:09.671977Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.07781","last_updated":"2024-01-15T15:42:39Z","snapshot_observed_at":"2026-08-16T14:27:25.161652Z","submitted_at":"2024-01-15T15:42:39Z","title":"Towards A Better Metric for Text-to-Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.07781","snapshot_observed_at":"2026-08-07T14:46:52.645716Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17727","last_updated":"2025-05-23T10:45:43Z","snapshot_observed_at":"2026-08-16T05:37:40.773071Z","submitted_at":"2025-05-23T10:45:43Z","title":"SafeMVDrive: Multi-view Safety-Critical Driving Video Synthesis in the Real World Domain","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T14:46:52.645716Z"},"links":{"cited_paper":"/paper/2401.07781","citing_paper":"/paper/2505.17727"},"observation_digest":"sha256:496d02f7f2b19cdffd735165558212fc1c7227e212a90c9de11ab75847782202","observation_id":"2bc85961-b5da-4802-9ecb-18e9262208b7","resolution":{"observed_at":"2026-08-07T14:46:52.645716Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.07781","last_updated":"2024-01-15T15:42:39Z","snapshot_observed_at":"2026-08-16T14:27:25.161652Z","submitted_at":"2024-01-15T15:42:39Z","title":"Towards A Better Metric for Text-to-Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.07781","snapshot_observed_at":"2026-08-07T13:59:35.615058Z","title":"Towards a better metric for text-to-video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20292","last_updated":"2025-06-03T10:11:00Z","snapshot_observed_at":"2026-08-14T22:17:57.799591Z","submitted_at":"2025-05-26T17:59:46Z","title":"OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation","version":4},"reference_index":101,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:35.615058Z"},"links":{"cited_paper":"/paper/2401.07781","citing_paper":"/paper/2505.20292"},"observation_digest":"sha256:eb73b190263a5e9b1b8ca6ee8550838147441e756029563233947cc95ec9cd6c","observation_id":"c48c9115-7c42-4700-92cb-3b8a15840695","resolution":{"observed_at":"2026-08-07T13:59:35.615058Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.07781","last_updated":"2024-01-15T15:42:39Z","snapshot_observed_at":"2026-08-16T14:27:25.161652Z","submitted_at":"2024-01-15T15:42:39Z","title":"Towards A Better Metric for Text-to-Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.07781","snapshot_observed_at":"2026-08-06T19:06:15.889647Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.06523","last_updated":"2025-07-09T03:51:27Z","snapshot_observed_at":"2026-08-13T14:31:46.361177Z","submitted_at":"2025-07-09T03:51:27Z","title":"FIFA: Unified Faithfulness Evaluation Framework for Text-to-Video and Video-to-Text Generation","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-06T19:06:15.889647Z"},"links":{"cited_paper":"/paper/2401.07781","citing_paper":"/paper/2507.06523"},"observation_digest":"sha256:25f4435c6f5b6d7a6ea79180e8d243e7c77fd5aa9dea46f139fc0e8266527463","observation_id":"d94fbeeb-4f90-4105-8084-6e11203b2c68","resolution":{"observed_at":"2026-08-06T19:06:15.889647Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.07781","last_updated":"2024-01-15T15:42:39Z","snapshot_observed_at":"2026-08-16T14:27:25.161652Z","submitted_at":"2024-01-15T15:42:39Z","title":"Towards A Better Metric for Text-to-Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.07781","snapshot_observed_at":"2026-08-05T17:19:20.415679Z","title":"Towards a better metric for text-to-video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.16512","last_updated":"2025-08-22T16:35:19Z","snapshot_observed_at":"2026-08-15T21:47:45.565508Z","submitted_at":"2025-08-22T16:35:19Z","title":"Seeing Clearly, Forgetting Deeply: Revisiting Fine-Tuned Video Generators for Driving Simulation","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-05T17:19:20.415679Z"},"links":{"cited_paper":"/paper/2401.07781","citing_paper":"/paper/2508.16512"},"observation_digest":"sha256:7fbe8406afc84cc8aa0ff7ce83e163f5e214d0e6686a07bc2c37b7dcd983700b","observation_id":"e648002b-7a69-4abb-8ff1-b27fb60f6bd6","resolution":{"observed_at":"2026-08-05T17:19:20.415679Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.07781","last_updated":"2024-01-15T15:42:39Z","snapshot_observed_at":"2026-08-16T14:27:25.161652Z","submitted_at":"2024-01-15T15:42:39Z","title":"Towards A Better Metric for Text-to-Video Generation","version":1},"cited_work":{"arxiv_id":"2401.07781","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2401.07781","snapshot_observed_at":"2026-07-03T08:17:45.921041Z","title":"Towards a better metric for text-to-video generation.arXiv preprint arXiv:2401.07781","venue":null,"work_id":"f2a47a6c-5765-4a38-ab98-9fcd63233fd4","year":2024},"citing_paper":{"arxiv_id":"2604.08546","last_updated":"2026-04-09T17:59:57Z","snapshot_observed_at":"2026-08-10T23:58:04.364158Z","submitted_at":"2026-04-09T17:59:57Z","title":"When Numbers Speak: Aligning Textual Numerals and Visual Instances in Text-to-Video Diffusion Models","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-05-10T18:39:26.420463Z"},"links":{"cited_paper":"/paper/2401.07781","citing_paper":"/paper/2604.08546"},"observation_digest":"sha256:29a34518872e5b05d150ccb430bdf4aedb051dbad19135b6fe97971ac100e818","observation_id":"00d1c516-17f7-4edc-ab3c-1c61dd76310f","resolution":{"observed_at":"2026-05-11T00:10:52.960076Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.07781","last_updated":"2024-01-15T15:42:39Z","snapshot_observed_at":"2026-08-16T14:27:25.161652Z","submitted_at":"2024-01-15T15:42:39Z","title":"Towards A Better Metric for Text-to-Video Generation","version":1},"cited_work":{"arxiv_id":"2401.07781","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2401.07781","snapshot_observed_at":"2026-07-03T08:17:45.921041Z","title":"Towards a better metric for text-to-video generation.arXiv preprint arXiv:2401.07781","venue":null,"work_id":"f2a47a6c-5765-4a38-ab98-9fcd63233fd4","year":2024},"citing_paper":{"arxiv_id":"2606.11670","last_updated":"2026-06-10T05:29:09Z","snapshot_observed_at":"2026-08-16T19:08:07.882437Z","submitted_at":"2026-06-10T05:29:09Z","title":"ARGUS: Stacked Multi-View Identity Mosaic Injection for Subject-Preserving Video Generation","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-06-27T10:46:56.871174Z"},"links":{"cited_paper":"/paper/2401.07781","citing_paper":"/paper/2606.11670"},"observation_digest":"sha256:9637e55ae301fc0b8c74a06271f9cbeef7ecb316105ca06f0bfe7f37a2291b96","observation_id":"d82f33b4-5749-48de-9e74-4788ad43eb00","resolution":{"observed_at":"2026-07-03T08:17:45.922557Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.07781","last_updated":"2024-01-15T15:42:39Z","snapshot_observed_at":"2026-08-16T14:27:25.161652Z","submitted_at":"2024-01-15T15:42:39Z","title":"Towards A Better Metric for Text-to-Video Generation","version":1},"cited_work":{"arxiv_id":"2401.07781","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2401.07781","snapshot_observed_at":"2026-07-03T08:17:45.921041Z","title":"Towards a better metric for text-to-video generation.arXiv preprint arXiv:2401.07781","venue":null,"work_id":"f2a47a6c-5765-4a38-ab98-9fcd63233fd4","year":2024},"citing_paper":{"arxiv_id":"2606.28757","last_updated":"2026-07-07T07:21:54Z","snapshot_observed_at":"2026-07-12T11:18:57.822920Z","submitted_at":"2026-06-27T06:13:35Z","title":"A Physics-Grounded Benchmark for Multi-Agent Dynamics in World Models","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-06-30T09:51:45.272494Z"},"links":{"cited_paper":"/paper/2401.07781","citing_paper":"/paper/2606.28757"},"observation_digest":"sha256:0ff319c2224788da7704de311a469f06df955441fa550931d69aaccc30d73a6a","observation_id":"8739ceaa-b1c5-42ac-b2c1-4e45991434c3","resolution":{"observed_at":"2026-06-30T09:54:34.937252Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.07781","last_updated":"2024-01-15T15:42:39Z","snapshot_observed_at":"2026-08-16T14:27:25.161652Z","submitted_at":"2024-01-15T15:42:39Z","title":"Towards A Better Metric for Text-to-Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.07781","snapshot_observed_at":"2026-07-12T11:18:58.558989Z","title":"arXiv preprint arXiv:2401.07781 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.28757","last_updated":"2026-07-07T07:21:54Z","snapshot_observed_at":"2026-07-12T11:18:57.822920Z","submitted_at":"2026-06-27T06:13:35Z","title":"A Physics-Grounded Benchmark for Multi-Agent Dynamics in World Models","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-07-12T11:18:58.558989Z"},"links":{"cited_paper":"/paper/2401.07781","citing_paper":"/paper/2606.28757"},"observation_digest":"sha256:f6969e4d3d28e721ca4f1328a6a25687cc80a08e12e2d0a30f180050c32fb6b2","observation_id":"0beb3a96-74c9-4d75-83ef-09340d4870a0","resolution":{"observed_at":"2026-07-12T11:18:58.558989Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.07781","last_updated":"2024-01-15T15:42:39Z","snapshot_observed_at":"2026-08-16T14:27:25.161652Z","submitted_at":"2024-01-15T15:42:39Z","title":"Towards A Better Metric for Text-to-Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.07781","snapshot_observed_at":"2026-08-04T02:48:05.322308Z","title":"InProceedingsoftheAAAIConferenceonArtificial Intelligence, volume 40, 17841–17849","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.00629","last_updated":"2026-08-01T12:38:25Z","snapshot_observed_at":"2026-08-16T00:58:30.995340Z","submitted_at":"2026-08-01T12:38:25Z","title":"ParticleGen: A Multi-Agent System for Particle Effects Generation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-04T02:48:05.322308Z"},"links":{"cited_paper":"/paper/2401.07781","citing_paper":"/paper/2608.00629"},"observation_digest":"sha256:40e6ae8d3e42f9fa4c1fc31f54852e96a9f08925784682947c27ebc2f8195f42","observation_id":"71475724-7945-4ddc-a12c-9e501990faf3","resolution":{"observed_at":"2026-08-04T02:48:05.322308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2401.07781/citation-record","integrity":"/paper/2401.07781/integrity","json":"/paper/2401.07781/citation-record.json","paper":"/paper/2401.07781"},"outbound":[],"paper":{"arxiv_id":"2401.07781","last_updated":"2024-01-15T15:42:39Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-16T14:27:25.161652Z","submitted_at":"2024-01-15T15:42:39Z","title":"Towards A Better Metric for Text-to-Video Generation"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 13 inbound Pith citation observations for arXiv:2401.07781."}