{"as_of":"2026-08-10T08:38:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d2f5cfa4fe3f585e2982936700e635ab01578700d9f26beddc5da79f371183c4","coverage":[{"denominator":45,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":45,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T04:57:36.864989Z","state":"measured"},{"denominator":45,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":45,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.13527/citation-record","integrity":"/paper/2607.13527/integrity","json":"/paper/2607.13527/citation-record.json","paper":"/paper/2607.13527"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.13211","last_updated":"2025-05-19T14:58:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-19T14:58:50Z","title":"MAGI-1: Autoregressive Video Generation at Scale","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.13211","snapshot_observed_at":"2026-08-02T04:57:33.384745Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13527","last_updated":"2026-07-15T07:26:05Z","snapshot_observed_at":"2026-08-05T04:43:47.810355Z","submitted_at":"2026-07-15T07:26:05Z","title":"VGIF-Score: Interpretable and Diagnostic Evaluation of Spatio-Temporal Instruction Following in Video Generation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-02T04:57:33.384745Z"},"links":{"cited_paper":"/paper/2505.13211","citing_paper":"/paper/2607.13527"},"observation_digest":"sha256:3f39b70b4491bbdfac1e9cc2beab438af7252c29156e7ad3b4209fd2cbe397e0","observation_id":"24afd336-8a58-4111-a743-07ed92a7145b","resolution":{"observed_at":"2026-08-02T04:57:33.384745Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T04:57:33.477322Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recog- nition","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.13527","last_updated":"2026-07-15T07:26:05Z","snapshot_observed_at":"2026-08-05T04:43:47.810355Z","submitted_at":"2026-07-15T07:26:05Z","title":"VGIF-Score: Interpretable and Diagnostic Evaluation of Spatio-Temporal Instruction Following in Video Generation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-02T04:57:33.477322Z"},"links":{"citing_paper":"/paper/2607.13527"},"observation_digest":"sha256:ccdbb4d7b3b2403a5254283972ad5b56d97831ccc1b336df6e045380b44151e7","observation_id":"e41fa792-b1f0-4204-91be-57f7f0ce8db7","resolution":{"observed_at":"2026-08-02T04:57:33.477322Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T04:57:33.625820Z","title":"In: Proceedings of the IEEE/CVF Winter Conference on Applications of Computer Vision","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.13527","last_updated":"2026-07-15T07:26:05Z","snapshot_observed_at":"2026-08-05T04:43:47.810355Z","submitted_at":"2026-07-15T07:26:05Z","title":"VGIF-Score: Interpretable and Diagnostic Evaluation of Spatio-Temporal Instruction Following in Video Generation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-02T04:57:33.625820Z"},"links":{"citing_paper":"/paper/2607.13527"},"observation_digest":"sha256:9a792c599afa542bf14046b49cd0c0d1d76a1e74370cdf6d1cfd7bc0917e9902","observation_id":"a3db8d7a-144d-4046-85ec-d58a05244da4","resolution":{"observed_at":"2026-08-02T04:57:33.625820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T04:57:33.758733Z","title":"In: The Twelfth International Conference on Learning Representations","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.13527","last_updated":"2026-07-15T07:26:05Z","snapshot_observed_at":"2026-08-05T04:43:47.810355Z","submitted_at":"2026-07-15T07:26:05Z","title":"VGIF-Score: Interpretable and Diagnostic Evaluation of Spatio-Temporal Instruction Following in Video Generation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-02T04:57:33.758733Z"},"links":{"citing_paper":"/paper/2607.13527"},"observation_digest":"sha256:a258004342353e078a17e2f188985eaebe155335d33dda2aef62cf6e81df3494","observation_id":"8ea3e244-4bbc-493c-858f-c4ef3f134d50","resolution":{"observed_at":"2026-08-02T04:57:33.758733Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T04:57:33.834673Z","title":"Educational and psycho- logical measurement20(1), 37–46 (1960)","venue":null,"work_id":null,"year":1960},"citing_paper":{"arxiv_id":"2607.13527","last_updated":"2026-07-15T07:26:05Z","snapshot_observed_at":"2026-08-05T04:43:47.810355Z","submitted_at":"2026-07-15T07:26:05Z","title":"VGIF-Score: Interpretable and Diagnostic Evaluation of Spatio-Temporal Instruction Following in Video Generation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-02T04:57:33.834673Z"},"links":{"citing_paper":"/paper/2607.13527"},"observation_digest":"sha256:67dd76fd8edae8d182d37c7b9513ee744f2a0d60412aa0a66ae376d52008af16","observation_id":"6e1ee7ee-53f0-4d68-969a-20616b7bcc85","resolution":{"observed_at":"2026-08-02T04:57:33.834673Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T04:57:33.914536Z","title":"arXiv preprint arXiv:2510.24717 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13527","last_updated":"2026-07-15T07:26:05Z","snapshot_observed_at":"2026-08-05T04:43:47.810355Z","submitted_at":"2026-07-15T07:26:05Z","title":"VGIF-Score: Interpretable and Diagnostic Evaluation of Spatio-Temporal Instruction Following in Video Generation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-02T04:57:33.914536Z"},"links":{"citing_paper":"/paper/2607.13527"},"observation_digest":"sha256:3670bded303c2b2f38a4ea360b5e31dfd95410d3d01214001f98685ca8a86669","observation_id":"22bcd9eb-b872-4ed4-955b-cf7e048cf6e6","resolution":{"observed_at":"2026-08-02T04:57:33.914536Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08656","last_updated":"2024-06-12T21:41:32Z","snapshot_observed_at":"2026-08-09T14:33:45.074869Z","submitted_at":"2024-06-12T21:41:32Z","title":"TC-Bench: Benchmarking Temporal Compositionality in Text-to-Video and Image-to-Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08656","snapshot_observed_at":"2026-08-02T04:57:34.021666Z","title":"arXiv preprint arXiv:2406.08656 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13527","last_updated":"2026-07-15T07:26:05Z","snapshot_observed_at":"2026-08-05T04:43:47.810355Z","submitted_at":"2026-07-15T07:26:05Z","title":"VGIF-Score: Interpretable and Diagnostic Evaluation of Spatio-Temporal Instruction Following in Video Generation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-02T04:57:34.021666Z"},"links":{"cited_paper":"/paper/2406.08656","citing_paper":"/paper/2607.13527"},"observation_digest":"sha256:429828e97b4efbd3bbc5da3229563dc314a630583100c81b63c8f1b848a1ded1","observation_id":"763678e9-f1d8-4bc6-81bc-4e197037d136","resolution":{"observed_at":"2026-08-02T04:57:34.021666Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T04:57:34.116361Z","title":"IEEE Transactions on Image Processing35, 3395–3410 (2026)","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.13527","last_updated":"2026-07-15T07:26:05Z","snapshot_observed_at":"2026-08-05T04:43:47.810355Z","submitted_at":"2026-07-15T07:26:05Z","title":"VGIF-Score: Interpretable and Diagnostic Evaluation of Spatio-Temporal Instruction Following in Video Generation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-02T04:57:34.116361Z"},"links":{"citing_paper":"/paper/2607.13527"},"observation_digest":"sha256:4da02fa835814e69aca65b5e58bead9acd33f1043b3453f62a7fdf693ea04f86","observation_id":"17c63e0c-e3f1-4121-a8c4-e9866e736ab1","resolution":{"observed_at":"2026-08-02T04:57:34.116361Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T04:57:34.159467Z","title":"In: BMVC","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.13527","last_updated":"2026-07-15T07:26:05Z","snapshot_observed_at":"2026-08-05T04:43:47.810355Z","submitted_at":"2026-07-15T07:26:05Z","title":"VGIF-Score: Interpretable and Diagnostic Evaluation of Spatio-Temporal Instruction Following in Video Generation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-02T04:57:34.159467Z"},"links":{"citing_paper":"/paper/2607.13527"},"observation_digest":"sha256:4fb0ea41449e60b4f00b832fef03ce268b19cc3b6d61d82291727c6df03c5955","observation_id":"66d411d7-8173-43b6-9924-ead91b40663a","resolution":{"observed_at":"2026-08-02T04:57:34.159467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T04:57:34.207368Z","title":"Advances in neural in- formation processing systems27(2014)","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2607.13527","last_updated":"2026-07-15T07:26:05Z","snapshot_observed_at":"2026-08-05T04:43:47.810355Z","submitted_at":"2026-07-15T07:26:05Z","title":"VGIF-Score: Interpretable and Diagnostic Evaluation of Spatio-Temporal Instruction Following in Video Generation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-02T04:57:34.207368Z"},"links":{"citing_paper":"/paper/2607.13527"},"observation_digest":"sha256:ab8f0f8172f20e6b01f95d09edc424811ece343bd50dbe85b2f05ee4f6f43dc1","observation_id":"a96d5a03-2012-431d-a3f8-527873d573d4","resolution":{"observed_at":"2026-08-02T04:57:34.207368Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T04:57:34.251455Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.13527","last_updated":"2026-07-15T07:26:05Z","snapshot_observed_at":"2026-08-05T04:43:47.810355Z","submitted_at":"2026-07-15T07:26:05Z","title":"VGIF-Score: Interpretable and Diagnostic Evaluation of Spatio-Temporal Instruction Following in Video Generation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-02T04:57:34.251455Z"},"links":{"citing_paper":"/paper/2607.13527"},"observation_digest":"sha256:9afafd59514a4c379cfd1564c241cb6189567b2fc51da27c31e7a7bace58f480","observation_id":"182bf8da-2e07-43bd-add6-c67d3e8d3729","resolution":{"observed_at":"2026-08-02T04:57:34.251455Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.03233","last_updated":"2026-01-06T18:24:41Z","snapshot_observed_at":"2026-07-06T22:40:51.136169Z","submitted_at":"2026-01-06T18:24:41Z","title":"LTX-2: Efficient Joint Audio-Visual Foundation Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.03233","snapshot_observed_at":"2026-08-02T04:57:34.335075Z","title":"arXiv preprint arXiv:2601.03233 (2026)","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.13527","last_updated":"2026-07-15T07:26:05Z","snapshot_observed_at":"2026-08-05T04:43:47.810355Z","submitted_at":"2026-07-15T07:26:05Z","title":"VGIF-Score: Interpretable and Diagnostic Evaluation of Spatio-Temporal Instruction Following in Video Generation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-02T04:57:34.335075Z"},"links":{"cited_paper":"/paper/2601.03233","citing_paper":"/paper/2607.13527"},"observation_digest":"sha256:08c05bf8020c5a8aba89494ed5587ea1f542b02a71c4aaaaf7be48aa2030ea39","observation_id":"1321e538-cfd7-4b2d-9a1f-60443e628021","resolution":{"observed_at":"2026-08-02T04:57:34.335075Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T04:57:34.396580Z","title":"In: Proceedings of the 2021 conference on empirical methods in natural language processing","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.13527","last_updated":"2026-07-15T07:26:05Z","snapshot_observed_at":"2026-08-05T04:43:47.810355Z","submitted_at":"2026-07-15T07:26:05Z","title":"VGIF-Score: Interpretable and Diagnostic Evaluation of Spatio-Temporal Instruction Following in Video Generation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-02T04:57:34.396580Z"},"links":{"citing_paper":"/paper/2607.13527"},"observation_digest":"sha256:c971f0f75f7fea1426def2572a03011ec320fb32a159e9d7d806d21e017add01","observation_id":"e8f911f9-1793-4927-8202-8c47a5bf86bd","resolution":{"observed_at":"2026-08-02T04:57:34.396580Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T04:57:34.468486Z","title":"Advances in neural information processing systems35, 8633– 8646 (2022)","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.13527","last_updated":"2026-07-15T07:26:05Z","snapshot_observed_at":"2026-08-05T04:43:47.810355Z","submitted_at":"2026-07-15T07:26:05Z","title":"VGIF-Score: Interpretable and Diagnostic Evaluation of Spatio-Temporal Instruction Following in Video Generation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-02T04:57:34.468486Z"},"links":{"citing_paper":"/paper/2607.13527"},"observation_digest":"sha256:d2f95235c9c0d560f96b0c666be8fcdf6346ad977e460922b5f7087e3b467aca","observation_id":"7c49f466-3147-439e-86f3-2d65c11029ac","resolution":{"observed_at":"2026-08-02T04:57:34.468486Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T04:57:34.536072Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13527","last_updated":"2026-07-15T07:26:05Z","snapshot_observed_at":"2026-08-05T04:43:47.810355Z","submitted_at":"2026-07-15T07:26:05Z","title":"VGIF-Score: Interpretable and Diagnostic Evaluation of Spatio-Temporal Instruction Following in Video Generation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-02T04:57:34.536072Z"},"links":{"citing_paper":"/paper/2607.13527"},"observation_digest":"sha256:e213ab206c76e85cf9a6f6938724d37b5abb7814d482b850d70adc4a220a03fc","observation_id":"7635286d-8ab3-4bb8-9084-10c9d9845bdb","resolution":{"observed_at":"2026-08-02T04:57:34.536072Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T04:57:34.625959Z","title":"IEEE Transactions on Pattern Analysis and Machine Intelligence (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13527","last_updated":"2026-07-15T07:26:05Z","snapshot_observed_at":"2026-08-05T04:43:47.810355Z","submitted_at":"2026-07-15T07:26:05Z","title":"VGIF-Score: Interpretable and Diagnostic Evaluation of Spatio-Temporal Instruction Following in Video Generation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-02T04:57:34.625959Z"},"links":{"citing_paper":"/paper/2607.13527"},"observation_digest":"sha256:fadf098c5b803eab0d6a85c986d7defc28fffda70daa4647aefdde40ae5bcad4","observation_id":"7659f198-dbb6-4589-8681-8aac06c1c51f","resolution":{"observed_at":"2026-08-02T04:57:34.625959Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1312.6114","last_updated":"2022-12-10T21:04:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2013-12-20T20:58:10Z","title":"Auto-Encoding Variational Bayes","version":11},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1312.6114","snapshot_observed_at":"2026-08-02T04:57:34.711830Z","title":"arXiv preprint arXiv:1312.6114 (2013)","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2607.13527","last_updated":"2026-07-15T07:26:05Z","snapshot_observed_at":"2026-08-05T04:43:47.810355Z","submitted_at":"2026-07-15T07:26:05Z","title":"VGIF-Score: Interpretable and Diagnostic Evaluation of Spatio-Temporal Instruction Following in Video Generation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-02T04:57:34.711830Z"},"links":{"cited_paper":"/paper/1312.6114","citing_paper":"/paper/2607.13527"},"observation_digest":"sha256:cc13bccc501e58c563862d399d24242f1e7a7b93ec4e878192a11434eb381cad","observation_id":"b20fd7ff-1f30-4c32-b8b8-80b108d3dfae","resolution":{"observed_at":"2026-08-02T04:57:34.711830Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.13743","last_updated":"2024-11-03T20:22:32Z","snapshot_observed_at":"2026-07-30T19:48:58.731788Z","submitted_at":"2024-06-19T18:00:07Z","title":"GenAI-Bench: Evaluating and Improving Compositional Text-to-Visual Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.13743","snapshot_observed_at":"2026-08-02T04:57:34.799559Z","title":"arXiv preprint arXiv:2406.13743 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13527","last_updated":"2026-07-15T07:26:05Z","snapshot_observed_at":"2026-08-05T04:43:47.810355Z","submitted_at":"2026-07-15T07:26:05Z","title":"VGIF-Score: Interpretable and Diagnostic Evaluation of Spatio-Temporal Instruction Following in Video Generation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-02T04:57:34.799559Z"},"links":{"cited_paper":"/paper/2406.13743","citing_paper":"/paper/2607.13527"},"observation_digest":"sha256:e43f1b8caa15a79d48d3b49df694c25e84f1513c337859dbe320a7d10ee15c6a","observation_id":"978a0430-c666-4568-b00c-89b57bb9aab0","resolution":{"observed_at":"2026-08-02T04:57:34.799559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T04:57:34.885748Z","title":"In: Proceedings of the IEEE/CVF International Conference on Computer Vision","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13527","last_updated":"2026-07-15T07:26:05Z","snapshot_observed_at":"2026-08-05T04:43:47.810355Z","submitted_at":"2026-07-15T07:26:05Z","title":"VGIF-Score: Interpretable and Diagnostic Evaluation of Spatio-Temporal Instruction Following in Video Generation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-02T04:57:34.885748Z"},"links":{"citing_paper":"/paper/2607.13527"},"observation_digest":"sha256:2d1d4c293b4bb8bd2dd2ecda2fae1f277368224009f355b4150743092d05b012","observation_id":"f185dac9-18db-4324-b6d8-cb5bb146b110","resolution":{"observed_at":"2026-08-02T04:57:34.885748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T04:57:34.974929Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13527","last_updated":"2026-07-15T07:26:05Z","snapshot_observed_at":"2026-08-05T04:43:47.810355Z","submitted_at":"2026-07-15T07:26:05Z","title":"VGIF-Score: Interpretable and Diagnostic Evaluation of Spatio-Temporal Instruction Following in Video Generation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-02T04:57:34.974929Z"},"links":{"citing_paper":"/paper/2607.13527"},"observation_digest":"sha256:ceb42c8d0371efb1d7d2217baa066c0d49675bf658d7310c340f5247963518d7","observation_id":"5ad97fc0-d9fd-4d88-b612-d156d0e5bd6f","resolution":{"observed_at":"2026-08-02T04:57:34.974929Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T04:57:35.061852Z","title":"In: Proceedings of the IEEE/CVF conference on computer vision and pattern recognition","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13527","last_updated":"2026-07-15T07:26:05Z","snapshot_observed_at":"2026-08-05T04:43:47.810355Z","submitted_at":"2026-07-15T07:26:05Z","title":"VGIF-Score: Interpretable and Diagnostic Evaluation of Spatio-Temporal Instruction Following in Video Generation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-02T04:57:35.061852Z"},"links":{"citing_paper":"/paper/2607.13527"},"observation_digest":"sha256:2554fe59b7a850511b99ede6b244fc0c91392723786e0a200e9c820c7075b58e","observation_id":"43a5c25e-a944-4b1d-b6fd-b7097c8dcfa8","resolution":{"observed_at":"2026-08-02T04:57:35.061852Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T04:57:35.145942Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13527","last_updated":"2026-07-15T07:26:05Z","snapshot_observed_at":"2026-08-05T04:43:47.810355Z","submitted_at":"2026-07-15T07:26:05Z","title":"VGIF-Score: Interpretable and Diagnostic Evaluation of Spatio-Temporal Instruction Following in Video Generation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-02T04:57:35.145942Z"},"links":{"citing_paper":"/paper/2607.13527"},"observation_digest":"sha256:b2192236441579a8563ad074e2ef49bb93e7a36ac5a72df0ae1940d4d6ce0eaa","observation_id":"b24c155b-1f91-4cb3-b9cb-070735124505","resolution":{"observed_at":"2026-08-02T04:57:35.145942Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T04:57:35.223404Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.13527","last_updated":"2026-07-15T07:26:05Z","snapshot_observed_at":"2026-08-05T04:43:47.810355Z","submitted_at":"2026-07-15T07:26:05Z","title":"VGIF-Score: Interpretable and Diagnostic Evaluation of Spatio-Temporal Instruction Following in Video Generation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-02T04:57:35.223404Z"},"links":{"citing_paper":"/paper/2607.13527"},"observation_digest":"sha256:788bccbab852eafd160d87bf73365739cece7e7e529843e2aad7ba30f65ec283","observation_id":"3a19d52f-d149-4ee3-9a96-ad0060c007e8","resolution":{"observed_at":"2026-08-02T04:57:35.223404Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15217","last_updated":"2025-05-21T07:46:26Z","snapshot_observed_at":"2026-08-09T14:30:19.955989Z","submitted_at":"2025-05-21T07:46:26Z","title":"Multimodal Conditional Information Bottleneck for Generalizable AI-Generated Image Detection","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.15217","snapshot_observed_at":"2026-08-02T04:57:35.293936Z","title":"arXiv preprint arXiv:2505.15217 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13527","last_updated":"2026-07-15T07:26:05Z","snapshot_observed_at":"2026-08-05T04:43:47.810355Z","submitted_at":"2026-07-15T07:26:05Z","title":"VGIF-Score: Interpretable and Diagnostic Evaluation of Spatio-Temporal Instruction Following in Video Generation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-02T04:57:35.293936Z"},"links":{"cited_paper":"/paper/2505.15217","citing_paper":"/paper/2607.13527"},"observation_digest":"sha256:9c488d31bf4dcca7d1469797ec098514cb35272e79f7c1c189a12551f1c4764c","observation_id":"b51ef482-0f8b-4969-850b-96ecff96020e","resolution":{"observed_at":"2026-08-02T04:57:35.293936Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T04:57:35.378713Z","title":null,"venue":null,"work_id":null,"year":1961},"citing_paper":{"arxiv_id":"2607.13527","last_updated":"2026-07-15T07:26:05Z","snapshot_observed_at":"2026-08-05T04:43:47.810355Z","submitted_at":"2026-07-15T07:26:05Z","title":"VGIF-Score: Interpretable and Diagnostic Evaluation of Spatio-Temporal Instruction Following in Video Generation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-02T04:57:35.378713Z"},"links":{"citing_paper":"/paper/2607.13527"},"observation_digest":"sha256:af85f5590922ed65331d936c7dd8970df7cdf23e983983d12d15a457a6d40401","observation_id":"1178344e-a3cc-445c-8029-168506cebc53","resolution":{"observed_at":"2026-08-02T04:57:35.378713Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T04:57:35.439940Z","title":"In: Proceed- ings of the Computer Vision and Pattern Recognition Conference","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13527","last_updated":"2026-07-15T07:26:05Z","snapshot_observed_at":"2026-08-05T04:43:47.810355Z","submitted_at":"2026-07-15T07:26:05Z","title":"VGIF-Score: Interpretable and Diagnostic Evaluation of Spatio-Temporal Instruction Following in Video Generation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-02T04:57:35.439940Z"},"links":{"citing_paper":"/paper/2607.13527"},"observation_digest":"sha256:2dc2139327ef00db4a74c413fe505690726798378c82f587e891d808f0a394c5","observation_id":"9001b3e7-e206-4de5-b5ba-d4dd5d596658","resolution":{"observed_at":"2026-08-02T04:57:35.439940Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T04:57:35.501214Z","title":"In: International Conference on Pattern Recognition","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13527","last_updated":"2026-07-15T07:26:05Z","snapshot_observed_at":"2026-08-05T04:43:47.810355Z","submitted_at":"2026-07-15T07:26:05Z","title":"VGIF-Score: Interpretable and Diagnostic Evaluation of Spatio-Temporal Instruction Following in Video Generation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-02T04:57:35.501214Z"},"links":{"citing_paper":"/paper/2607.13527"},"observation_digest":"sha256:a60df0c03d49bfd3d21068083ab6e101702d037d76ecf825fa13d35b4edefd7f","observation_id":"69565d2c-e82f-470f-981d-c5ce69197800","resolution":{"observed_at":"2026-08-02T04:57:35.501214Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T04:57:35.561196Z","title":"In: Proceedings of the AAAI Conference on Artificial Intelligence","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.13527","last_updated":"2026-07-15T07:26:05Z","snapshot_observed_at":"2026-08-05T04:43:47.810355Z","submitted_at":"2026-07-15T07:26:05Z","title":"VGIF-Score: Interpretable and Diagnostic Evaluation of Spatio-Temporal Instruction Following in Video Generation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-02T04:57:35.561196Z"},"links":{"citing_paper":"/paper/2607.13527"},"observation_digest":"sha256:1cc2b145d4a8a75ee67805e96e91eed2c43a0e0ecec22481c66cbb4e422d561c","observation_id":"c2ead5b5-c16c-48df-870c-052cdb7dbb90","resolution":{"observed_at":"2026-08-02T04:57:35.561196Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T04:57:35.597078Z","title":"arXiv preprint arXiv:2601.20305 (2026) VGIF-Score 15","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.13527","last_updated":"2026-07-15T07:26:05Z","snapshot_observed_at":"2026-08-05T04:43:47.810355Z","submitted_at":"2026-07-15T07:26:05Z","title":"VGIF-Score: Interpretable and Diagnostic Evaluation of Spatio-Temporal Instruction Following in Video Generation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-02T04:57:35.597078Z"},"links":{"citing_paper":"/paper/2607.13527"},"observation_digest":"sha256:0bbca826c3d07c3b0e6d4b76320529e85674c8c126a93572d9bbc3b4025a29c3","observation_id":"c0ea7eb9-9a31-4df1-8736-79e241dbd724","resolution":{"observed_at":"2026-08-02T04:57:35.597078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T04:57:35.660945Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13527","last_updated":"2026-07-15T07:26:05Z","snapshot_observed_at":"2026-08-05T04:43:47.810355Z","submitted_at":"2026-07-15T07:26:05Z","title":"VGIF-Score: Interpretable and Diagnostic Evaluation of Spatio-Temporal Instruction Following in Video Generation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-02T04:57:35.660945Z"},"links":{"citing_paper":"/paper/2607.13527"},"observation_digest":"sha256:49399b2b7c49fc8b4cd21dc6a953e32be0c254008abfc04f42f65cf33223ba2c","observation_id":"f19d6bb9-cfd7-4dfd-afda-31ba8185d00a","resolution":{"observed_at":"2026-08-02T04:57:35.660945Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2512.16776","last_updated":"2025-12-18T17:08:12Z","snapshot_observed_at":"2026-07-06T22:39:28.855621Z","submitted_at":"2025-12-18T17:08:12Z","title":"Kling-Omni Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2512.16776","snapshot_observed_at":"2026-08-02T04:57:35.730736Z","title":"arXiv preprint arXiv:2512.16776 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13527","last_updated":"2026-07-15T07:26:05Z","snapshot_observed_at":"2026-08-05T04:43:47.810355Z","submitted_at":"2026-07-15T07:26:05Z","title":"VGIF-Score: Interpretable and Diagnostic Evaluation of Spatio-Temporal Instruction Following in Video Generation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-02T04:57:35.730736Z"},"links":{"cited_paper":"/paper/2512.16776","citing_paper":"/paper/2607.13527"},"observation_digest":"sha256:49ccc5897aa3b20935c59be5305d906f8c2d0c2a1957094ba98d519c450762dd","observation_id":"3715e158-aaeb-436a-aa84-6400c9d7be47","resolution":{"observed_at":"2026-08-02T04:57:35.730736Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T04:57:35.815073Z","title":"arXiv preprint arXiv:2510.22200 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13527","last_updated":"2026-07-15T07:26:05Z","snapshot_observed_at":"2026-08-05T04:43:47.810355Z","submitted_at":"2026-07-15T07:26:05Z","title":"VGIF-Score: Interpretable and Diagnostic Evaluation of Spatio-Temporal Instruction Following in Video Generation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-02T04:57:35.815073Z"},"links":{"citing_paper":"/paper/2607.13527"},"observation_digest":"sha256:e3064d2ad2bb680eb306d7cd098b8a37d499f4121936cda13fd715491f1ca6cd","observation_id":"047816c8-f150-4ede-bed6-8c88d4ffb80e","resolution":{"observed_at":"2026-08-02T04:57:35.815073Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.01719","last_updated":"2025-02-07T03:54:34Z","snapshot_observed_at":"2026-08-10T02:03:37.501894Z","submitted_at":"2025-02-03T18:56:33Z","title":"MJ-VIDEO: Fine-Grained Benchmarking and Rewarding Video Preferences in Video Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.01719","snapshot_observed_at":"2026-08-02T04:57:35.897847Z","title":"arXiv preprint arXiv:2502.01719 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13527","last_updated":"2026-07-15T07:26:05Z","snapshot_observed_at":"2026-08-05T04:43:47.810355Z","submitted_at":"2026-07-15T07:26:05Z","title":"VGIF-Score: Interpretable and Diagnostic Evaluation of Spatio-Temporal Instruction Following in Video Generation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-02T04:57:35.897847Z"},"links":{"cited_paper":"/paper/2502.01719","citing_paper":"/paper/2607.13527"},"observation_digest":"sha256:a0fd42512b3f11dc24d6c8c0c69a22b86480753fc044fba5e564582562e21992","observation_id":"425b4dc6-3fd3-4a6c-a61f-331fce530317","resolution":{"observed_at":"2026-08-02T04:57:35.897847Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1812.01717","last_updated":"2019-03-27T16:43:17Z","snapshot_observed_at":"2026-07-06T07:19:11.957225Z","submitted_at":"2018-12-03T03:57:42Z","title":"Towards Accurate Generative Models of Video: A New Metric & Challenges","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.01717","snapshot_observed_at":"2026-08-02T04:57:35.965500Z","title":"arXiv preprint arXiv:1812.01717 (2018)","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.13527","last_updated":"2026-07-15T07:26:05Z","snapshot_observed_at":"2026-08-05T04:43:47.810355Z","submitted_at":"2026-07-15T07:26:05Z","title":"VGIF-Score: Interpretable and Diagnostic Evaluation of Spatio-Temporal Instruction Following in Video Generation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-02T04:57:35.965500Z"},"links":{"cited_paper":"/paper/1812.01717","citing_paper":"/paper/2607.13527"},"observation_digest":"sha256:22d59945a594bdb63a410b062a4f9e0765aa33aecbec0eef6a026c70ed81c758","observation_id":"1f9aecb1-d0d8-4439-b18d-f77a0339fb25","resolution":{"observed_at":"2026-08-02T04:57:35.965500Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20314","last_updated":"2025-04-19T02:22:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-26T08:25:43Z","title":"Wan: Open and Advanced Large-Scale Video Generative Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20314","snapshot_observed_at":"2026-08-02T04:57:36.040340Z","title":"arXiv preprint arXiv:2503.20314 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13527","last_updated":"2026-07-15T07:26:05Z","snapshot_observed_at":"2026-08-05T04:43:47.810355Z","submitted_at":"2026-07-15T07:26:05Z","title":"VGIF-Score: Interpretable and Diagnostic Evaluation of Spatio-Temporal Instruction Following in Video Generation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-02T04:57:36.040340Z"},"links":{"cited_paper":"/paper/2503.20314","citing_paper":"/paper/2607.13527"},"observation_digest":"sha256:66012906b15e1ef1663eb6e9a47334156350a59b65c0a7079c77391930b29a03","observation_id":"7a42704d-4ad8-4ada-b32c-4711482efe28","resolution":{"observed_at":"2026-08-02T04:57:36.040340Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.18518","last_updated":"2026-05-28T03:18:18Z","snapshot_observed_at":"2026-08-08T16:34:03.216972Z","submitted_at":"2026-04-20T17:16:50Z","title":"UDM-GRPO: Stable and Efficient Group Relative Policy Optimization for Uniform Discrete Diffusion Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.18518","snapshot_observed_at":"2026-08-02T04:57:36.109021Z","title":"arXiv preprint arXiv:2604.18518 (2026)","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.13527","last_updated":"2026-07-15T07:26:05Z","snapshot_observed_at":"2026-08-05T04:43:47.810355Z","submitted_at":"2026-07-15T07:26:05Z","title":"VGIF-Score: Interpretable and Diagnostic Evaluation of Spatio-Temporal Instruction Following in Video Generation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-02T04:57:36.109021Z"},"links":{"cited_paper":"/paper/2604.18518","citing_paper":"/paper/2607.13527"},"observation_digest":"sha256:7006a5f35c5bc1762903ff29913aeff2d38628f6964cdaf576fc49a05f0f30bf","observation_id":"3d15d22c-22fd-45d9-a6d9-068d409238b0","resolution":{"observed_at":"2026-08-02T04:57:36.109021Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T04:57:36.203050Z","title":"Advances in Neural Information Processing Systems38(2026)","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.13527","last_updated":"2026-07-15T07:26:05Z","snapshot_observed_at":"2026-08-05T04:43:47.810355Z","submitted_at":"2026-07-15T07:26:05Z","title":"VGIF-Score: Interpretable and Diagnostic Evaluation of Spatio-Temporal Instruction Following in Video Generation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-02T04:57:36.203050Z"},"links":{"citing_paper":"/paper/2607.13527"},"observation_digest":"sha256:1dbf78669c1382daf95512d2e8597e067a7bff08a223f41364f11982200102e0","observation_id":"6a9fbf5f-86c3-49c1-a1b9-af3d2bacd682","resolution":{"observed_at":"2026-08-02T04:57:36.203050Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.05623","last_updated":"2026-04-07T09:27:01Z","snapshot_observed_at":"2026-07-06T22:54:16.913706Z","submitted_at":"2026-04-07T09:27:01Z","title":"DetailVerifyBench: A Benchmark for Dense Hallucination Localization in Long Image Captions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.05623","snapshot_observed_at":"2026-08-02T04:57:36.296198Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.13527","last_updated":"2026-07-15T07:26:05Z","snapshot_observed_at":"2026-08-05T04:43:47.810355Z","submitted_at":"2026-07-15T07:26:05Z","title":"VGIF-Score: Interpretable and Diagnostic Evaluation of Spatio-Temporal Instruction Following in Video Generation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-02T04:57:36.296198Z"},"links":{"cited_paper":"/paper/2604.05623","citing_paper":"/paper/2607.13527"},"observation_digest":"sha256:2995b8a169a2f5955f5e8fc780f153e9ce8d4715b62874351241f098ddfa3e7b","observation_id":"ce377e47-852f-432e-a085-7d60dc655806","resolution":{"observed_at":"2026-08-02T04:57:36.296198Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.18870","last_updated":"2025-11-25T02:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-24T08:22:07Z","title":"HunyuanVideo 1.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.18870","snapshot_observed_at":"2026-08-02T04:57:36.378250Z","title":"arXiv preprint arXiv:2511.18870 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13527","last_updated":"2026-07-15T07:26:05Z","snapshot_observed_at":"2026-08-05T04:43:47.810355Z","submitted_at":"2026-07-15T07:26:05Z","title":"VGIF-Score: Interpretable and Diagnostic Evaluation of Spatio-Temporal Instruction Following in Video Generation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-02T04:57:36.378250Z"},"links":{"cited_paper":"/paper/2511.18870","citing_paper":"/paper/2607.13527"},"observation_digest":"sha256:dbb10a15dea6778a6d91cf42c0cee07ef491ed764935b99513bf445cc92b471a","observation_id":"51de27ce-342b-4b6d-a646-b0a581cce483","resolution":{"observed_at":"2026-08-02T04:57:36.378250Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T04:57:36.490143Z","title":"arXiv preprint arXiv:2510.17314 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13527","last_updated":"2026-07-15T07:26:05Z","snapshot_observed_at":"2026-08-05T04:43:47.810355Z","submitted_at":"2026-07-15T07:26:05Z","title":"VGIF-Score: Interpretable and Diagnostic Evaluation of Spatio-Temporal Instruction Following in Video Generation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-02T04:57:36.490143Z"},"links":{"citing_paper":"/paper/2607.13527"},"observation_digest":"sha256:88a646429cbdf5d0afcf0d2a98dbd3c982cc1c1827bd6cd6b032826b58daa380","observation_id":"0d897e31-a70a-4e11-956a-e64b435d6c0e","resolution":{"observed_at":"2026-08-02T04:57:36.490143Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.10157","last_updated":"2021-09-14T21:20:06Z","snapshot_observed_at":"2026-07-06T11:02:11.424356Z","submitted_at":"2021-04-20T17:58:03Z","title":"VideoGPT: Video Generation using VQ-VAE and Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.10157","snapshot_observed_at":"2026-08-02T04:57:36.587647Z","title":"arXiv preprint arXiv:2104.10157 (2021)","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.13527","last_updated":"2026-07-15T07:26:05Z","snapshot_observed_at":"2026-08-05T04:43:47.810355Z","submitted_at":"2026-07-15T07:26:05Z","title":"VGIF-Score: Interpretable and Diagnostic Evaluation of Spatio-Temporal Instruction Following in Video Generation","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-02T04:57:36.587647Z"},"links":{"cited_paper":"/paper/2104.10157","citing_paper":"/paper/2607.13527"},"observation_digest":"sha256:5ecc473f5debe517b75949f6fc74a0c534b41ef0593f2c3932e27244278e615b","observation_id":"4b3ef084-518a-4f6b-999e-253f327a1d42","resolution":{"observed_at":"2026-08-02T04:57:36.587647Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T04:57:36.675488Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.13527","last_updated":"2026-07-15T07:26:05Z","snapshot_observed_at":"2026-08-05T04:43:47.810355Z","submitted_at":"2026-07-15T07:26:05Z","title":"VGIF-Score: Interpretable and Diagnostic Evaluation of Spatio-Temporal Instruction Following in Video Generation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-02T04:57:36.675488Z"},"links":{"citing_paper":"/paper/2607.13527"},"observation_digest":"sha256:f48ed9c4b4fcdf612a873e662a6e7863bd1bdb2c07430135d3d3fc48f375fd24","observation_id":"a852e512-b04a-4c21-97dd-4eecb05f4abd","resolution":{"observed_at":"2026-08-02T04:57:36.675488Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.06072","last_updated":"2025-03-26T08:33:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-12T11:47:11Z","title":"CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.06072","snapshot_observed_at":"2026-08-02T04:57:36.744154Z","title":"arXiv preprint arXiv:2408.06072 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13527","last_updated":"2026-07-15T07:26:05Z","snapshot_observed_at":"2026-08-05T04:43:47.810355Z","submitted_at":"2026-07-15T07:26:05Z","title":"VGIF-Score: Interpretable and Diagnostic Evaluation of Spatio-Temporal Instruction Following in Video Generation","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-02T04:57:36.744154Z"},"links":{"cited_paper":"/paper/2408.06072","citing_paper":"/paper/2607.13527"},"observation_digest":"sha256:9edbe84283c466c0a430198aa96302956a7e21493f893da111a58b3da1a6f0e9","observation_id":"29cea2ed-ea1f-468a-b8b8-4ec4a7d80ec8","resolution":{"observed_at":"2026-08-02T04:57:36.744154Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T04:57:36.800767Z","title":"Advances in Neural Information Processing Systems37, 21236–21270 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13527","last_updated":"2026-07-15T07:26:05Z","snapshot_observed_at":"2026-08-05T04:43:47.810355Z","submitted_at":"2026-07-15T07:26:05Z","title":"VGIF-Score: Interpretable and Diagnostic Evaluation of Spatio-Temporal Instruction Following in Video Generation","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-02T04:57:36.800767Z"},"links":{"citing_paper":"/paper/2607.13527"},"observation_digest":"sha256:0ebda559a863b90712ea9f0e9bc9594a83f7f40dd0c0d24fba4ca204de147df3","observation_id":"c284c615-bc75-45a3-b78a-c4dbaf7715dd","resolution":{"observed_at":"2026-08-02T04:57:36.800767Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21755","last_updated":"2025-08-20T15:49:30Z","snapshot_observed_at":"2026-08-10T02:47:20.223653Z","submitted_at":"2025-03-27T17:57:01Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.21755","snapshot_observed_at":"2026-08-02T04:57:36.864989Z","title":"arXiv preprint arXiv:2503.21755 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13527","last_updated":"2026-07-15T07:26:05Z","snapshot_observed_at":"2026-08-05T04:43:47.810355Z","submitted_at":"2026-07-15T07:26:05Z","title":"VGIF-Score: Interpretable and Diagnostic Evaluation of Spatio-Temporal Instruction Following in Video Generation","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-02T04:57:36.864989Z"},"links":{"cited_paper":"/paper/2503.21755","citing_paper":"/paper/2607.13527"},"observation_digest":"sha256:24531446160296ae439be7a937fc5078c025ee3bb8e77d54230346195b4d1da7","observation_id":"fee034c3-3ba7-4f9a-9c29-6b40192a12f1","resolution":{"observed_at":"2026-08-02T04:57:36.864989Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.13527","last_updated":"2026-07-15T07:26:05Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-05T04:43:47.810355Z","submitted_at":"2026-07-15T07:26:05Z","title":"VGIF-Score: Interpretable and Diagnostic Evaluation of Spatio-Temporal Instruction Following in Video Generation"},"reference_resolution":{"displayed":45,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":45,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":45},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 45 of 45 outbound references and 0 inbound Pith citation observations for arXiv:2607.13527."}