{"as_of":"2026-08-14T09:05:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:0aa8671261f2119195b5802c84fd1e6b23d5c000710e33e8fd11438d5d06c58d","coverage":[{"denominator":77,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":77,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T21:28:21.301097Z","state":"measured"},{"denominator":79,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":79,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T05:27:16.731285Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T19:28:52.699573Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.04440","last_updated":"2024-12-05T18:56:05Z","snapshot_observed_at":"2026-08-13T08:37:38.494788Z","submitted_at":"2024-12-05T18:56:05Z","title":"GenMAC: Compositional Text-to-Video Generation with Multi-Agent Collaboration","version":1},"cited_work":{"arxiv_id":"2412.04440","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.04440","snapshot_observed_at":"2026-07-03T19:28:52.699573Z","title":"Genmac: Compositional text- to-video generation with multi-agent collabora- tion.arXiv preprint arXiv:2412.04440, 2024","venue":null,"work_id":"cc8411fc-314c-40ad-9f29-f2dc4a7ccc73","year":2024},"citing_paper":{"arxiv_id":"2606.17536","last_updated":"2026-06-16T05:25:55Z","snapshot_observed_at":"2026-07-31T01:15:07.358009Z","submitted_at":"2026-06-16T05:25:55Z","title":"OmniDrive: An LLM-Choreographed Multi-Agent World Model with Unified Latent Co-Compression for Multi-View Driving Video Generation","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-06-27T01:46:14.430539Z"},"links":{"cited_paper":"/paper/2412.04440","citing_paper":"/paper/2606.17536"},"observation_digest":"sha256:31f541930dd776537cfd7acea5ff5b5966351f31d70807b8bb5bbfca63ba7e7f","observation_id":"c7a59eb6-89c6-4ad0-868b-3e2c394d4aab","resolution":{"observed_at":"2026-07-03T19:28:52.701228Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04440","last_updated":"2024-12-05T18:56:05Z","snapshot_observed_at":"2026-08-13T08:37:38.494788Z","submitted_at":"2024-12-05T18:56:05Z","title":"GenMAC: Compositional Text-to-Video Generation with Multi-Agent Collaboration","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.04440","snapshot_observed_at":"2026-08-01T05:27:16.731285Z","title":"Genmac: compositional text-to-video generation with multi-agent collaboration.arXiv preprint arXiv:2412.04440, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.22241","last_updated":"2026-07-30T03:34:42Z","snapshot_observed_at":"2026-08-06T04:16:05.161328Z","submitted_at":"2026-07-24T12:17:57Z","title":"AgentHOI: Multi-Agent Reasoning for Human-Object-Interaction Video Generation via Implicit Representation Alignment","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-01T05:27:16.731285Z"},"links":{"cited_paper":"/paper/2412.04440","citing_paper":"/paper/2607.22241"},"observation_digest":"sha256:1e4d92104e27a9dfe1d557a11196eaea0783aa7ad606c588f8f6cefdfcff8ffa","observation_id":"e5024161-ddd4-46bd-b301-a60898369938","resolution":{"observed_at":"2026-08-01T05:27:16.731285Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2412.04440/citation-record","integrity":"/paper/2412.04440/integrity","json":"/paper/2412.04440/citation-record.json","paper":"/paper/2412.04440"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:28:24.042149Z","title":"https : / / huggingface","venue":null,"work_id":"f434b95d-8e5f-4190-8567-deb2ce379f1a","year":2023},"citing_paper":{"arxiv_id":"2412.04440","last_updated":"2024-12-05T18:56:05Z","snapshot_observed_at":"2026-08-13T08:37:38.494788Z","submitted_at":"2024-12-05T18:56:05Z","title":"GenMAC: Compositional Text-to-Video Generation with Multi-Agent Collaboration","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-11T21:28:20.831324Z"},"links":{"citing_paper":"/paper/2412.04440"},"observation_digest":"sha256:66cef52f9419891a2bdaeb9d4723063c0054494e712e049ef408f66cb833ab81","observation_id":"aeab1852-7b01-4467-9d91-286f901f7c31","resolution":{"observed_at":"2026-08-11T21:28:24.048844Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:28:23.913833Z","title":"https://pika.art/, 2023","venue":null,"work_id":"4be59f5b-1f98-4a00-bdcf-d913d2697365","year":2023},"citing_paper":{"arxiv_id":"2412.04440","last_updated":"2024-12-05T18:56:05Z","snapshot_observed_at":"2026-08-13T08:37:38.494788Z","submitted_at":"2024-12-05T18:56:05Z","title":"GenMAC: Compositional Text-to-Video Generation with Multi-Agent Collaboration","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-11T21:28:20.837758Z"},"links":{"citing_paper":"/paper/2412.04440"},"observation_digest":"sha256:c92293b9fc0927562ed5b0345fdf3c95482aaf205ed49a2dc0a35e7c8f172395","observation_id":"1e572bb3-01f3-4908-bbc1-bb97e7630d3f","resolution":{"observed_at":"2026-08-11T21:28:23.993015Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-11T21:28:20.845667Z","title":"Stable video diffusion: Scaling latent video diffusion models to large datasets","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.04440","last_updated":"2024-12-05T18:56:05Z","snapshot_observed_at":"2026-08-13T08:37:38.494788Z","submitted_at":"2024-12-05T18:56:05Z","title":"GenMAC: Compositional Text-to-Video Generation with Multi-Agent Collaboration","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-11T21:28:20.845667Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2412.04440"},"observation_digest":"sha256:26183c3adcaa9ac46a514e7b8fdb66093d3182fef038c8d9398122e65523002b","observation_id":"00949303-f71d-41d2-ab55-2af4b7c42bd2","resolution":{"observed_at":"2026-08-11T21:28:20.845667Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:28:20.853812Z","title":"Align your latents: High-resolution video synthesis with la- tent diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.04440","last_updated":"2024-12-05T18:56:05Z","snapshot_observed_at":"2026-08-13T08:37:38.494788Z","submitted_at":"2024-12-05T18:56:05Z","title":"GenMAC: Compositional Text-to-Video Generation with Multi-Agent Collaboration","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-11T21:28:20.853812Z"},"links":{"citing_paper":"/paper/2412.04440"},"observation_digest":"sha256:135a5683084719f15c2f8a396a36dd1eda4824370739d0df2a8f7d68c74530bb","observation_id":"9f78e4b8-de1c-4845-b63f-431a7f652e93","resolution":{"observed_at":"2026-08-11T21:28:20.853812Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:28:20.860177Z","title":"Maskgit: Masked generative image transformer","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.04440","last_updated":"2024-12-05T18:56:05Z","snapshot_observed_at":"2026-08-13T08:37:38.494788Z","submitted_at":"2024-12-05T18:56:05Z","title":"GenMAC: Compositional Text-to-Video Generation with Multi-Agent Collaboration","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-11T21:28:20.860177Z"},"links":{"citing_paper":"/paper/2412.04440"},"observation_digest":"sha256:8e941439b0f4b2a2decbcd82dbc31d2c07b942f9f98a9c130a0c0996bf7a6e2e","observation_id":"e99f32f2-07b0-4a7f-a178-e43bb1e08591","resolution":{"observed_at":"2026-08-11T21:28:20.860177Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.00704","last_updated":"2023-01-02T14:43:38Z","snapshot_observed_at":"2026-08-13T13:10:50.058243Z","submitted_at":"2023-01-02T14:43:38Z","title":"Muse: Text-To-Image Generation via Masked Generative Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.00704","snapshot_observed_at":"2026-08-11T21:28:20.865826Z","title":"Muse: Text-to-image generation via masked generative transform- ers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.04440","last_updated":"2024-12-05T18:56:05Z","snapshot_observed_at":"2026-08-13T08:37:38.494788Z","submitted_at":"2024-12-05T18:56:05Z","title":"GenMAC: Compositional Text-to-Video Generation with Multi-Agent Collaboration","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-11T21:28:20.865826Z"},"links":{"cited_paper":"/paper/2301.00704","citing_paper":"/paper/2412.04440"},"observation_digest":"sha256:28eb2244404a9abf28232205b1185726ed85ebc9b98f0bd2449f73c8cd846cdb","observation_id":"29928a2a-1cda-4304-9885-ba0406f0924a","resolution":{"observed_at":"2026-08-11T21:28:20.865826Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:28:23.788350Z","title":"Attend-and-excite: Attention-based se- mantic guidance for text-to-image diffusion models","venue":null,"work_id":"12bb59a4-4594-43fc-9c24-eae1035a917d","year":2023},"citing_paper":{"arxiv_id":"2412.04440","last_updated":"2024-12-05T18:56:05Z","snapshot_observed_at":"2026-08-13T08:37:38.494788Z","submitted_at":"2024-12-05T18:56:05Z","title":"GenMAC: Compositional Text-to-Video Generation with Multi-Agent Collaboration","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T21:28:20.875964Z"},"links":{"citing_paper":"/paper/2412.04440"},"observation_digest":"sha256:8dc39860e8cffc452c283d4ea313851ca9828a0c02d70eb87bcc6a5626c0b52e","observation_id":"6138a6df-d913-445a-8d82-ac3d5e9ba11a","resolution":{"observed_at":"2026-08-11T21:28:23.806787Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.09047","last_updated":"2024-01-17T08:30:32Z","snapshot_observed_at":"2026-08-13T04:40:49.704758Z","submitted_at":"2024-01-17T08:30:32Z","title":"VideoCrafter2: Overcoming Data Limitations for High-Quality Video Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.09047","snapshot_observed_at":"2026-08-11T21:28:20.884384Z","title":"Videocrafter2: Overcoming data limitations for high-quality video diffusion models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.04440","last_updated":"2024-12-05T18:56:05Z","snapshot_observed_at":"2026-08-13T08:37:38.494788Z","submitted_at":"2024-12-05T18:56:05Z","title":"GenMAC: Compositional Text-to-Video Generation with Multi-Agent Collaboration","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-11T21:28:20.884384Z"},"links":{"cited_paper":"/paper/2401.09047","citing_paper":"/paper/2412.04440"},"observation_digest":"sha256:9900d1b53d3415980d34620817dde272aa01a832d416ba0ef30515172454d3c6","observation_id":"8e0ca905-fd28-49c0-bb89-10eb207807d1","resolution":{"observed_at":"2026-08-11T21:28:20.884384Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:28:23.765589Z","title":"Training- free layout control with cross-attention guidance","venue":null,"work_id":"f6a827d7-7445-4dc8-9303-b05828906b5d","year":null},"citing_paper":{"arxiv_id":"2412.04440","last_updated":"2024-12-05T18:56:05Z","snapshot_observed_at":"2026-08-13T08:37:38.494788Z","submitted_at":"2024-12-05T18:56:05Z","title":"GenMAC: Compositional Text-to-Video Generation with Multi-Agent Collaboration","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-11T21:28:20.890486Z"},"links":{"citing_paper":"/paper/2412.04440"},"observation_digest":"sha256:3d34045fa54c302fac33d4aabe4947a060d2b2d5241296acdf3b753961a49f49","observation_id":"066dbf94-aa40-489c-b320-9e17afd41d7c","resolution":{"observed_at":"2026-08-11T21:28:23.771600Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.17126","last_updated":"2023-11-28T14:51:13Z","snapshot_observed_at":"2026-08-14T02:28:05.300904Z","submitted_at":"2023-11-28T14:51:13Z","title":"Reason out Your Layout: Evoking the Layout Master from Large Language Models for Text-to-Image Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.17126","snapshot_observed_at":"2026-08-11T21:28:20.896387Z","title":"Reason out your layout: Evoking the layout master from large lan- guage models for text-to-image synthesis","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.04440","last_updated":"2024-12-05T18:56:05Z","snapshot_observed_at":"2026-08-13T08:37:38.494788Z","submitted_at":"2024-12-05T18:56:05Z","title":"GenMAC: Compositional Text-to-Video Generation with Multi-Agent Collaboration","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-11T21:28:20.896387Z"},"links":{"cited_paper":"/paper/2311.17126","citing_paper":"/paper/2412.04440"},"observation_digest":"sha256:8e85d9cbc73c80d17d4d38b90a4bed4ccbf5b573a4bd680fa1e17edb34018109","observation_id":"312f5fcb-2635-4e50-a77f-746ae2dc346d","resolution":{"observed_at":"2026-08-11T21:28:20.896387Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:28:23.738878Z","title":"Mind2web: Towards a generalist agent for the web, 2023","venue":null,"work_id":"37f0fb1c-bf49-4a80-9a75-75b001d70a8c","year":2023},"citing_paper":{"arxiv_id":"2412.04440","last_updated":"2024-12-05T18:56:05Z","snapshot_observed_at":"2026-08-13T08:37:38.494788Z","submitted_at":"2024-12-05T18:56:05Z","title":"GenMAC: Compositional Text-to-Video Generation with Multi-Agent Collaboration","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T21:28:20.902905Z"},"links":{"citing_paper":"/paper/2412.04440"},"observation_digest":"sha256:39138087cd65f29205e8782eb99617cb79b2ba3b316f6751e329425c1e204a02","observation_id":"669d1303-adaa-4124-9bc6-408fcf5d7652","resolution":{"observed_at":"2026-08-11T21:28:23.747093Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:28:23.709134Z","title":null,"venue":null,"work_id":"537c2a91-ed79-4f0b-8bcb-8e8bbb3d1fe6","year":2023},"citing_paper":{"arxiv_id":"2412.04440","last_updated":"2024-12-05T18:56:05Z","snapshot_observed_at":"2026-08-13T08:37:38.494788Z","submitted_at":"2024-12-05T18:56:05Z","title":"GenMAC: Compositional Text-to-Video Generation with Multi-Agent Collaboration","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-11T21:28:20.909328Z"},"links":{"citing_paper":"/paper/2412.04440"},"observation_digest":"sha256:ff1c818c04cd3f4d1c2a1ef1c53b63b0af6fa3d697674471720ac846b8520429","observation_id":"329da210-fafc-444c-8bf0-1b790c8f685b","resolution":{"observed_at":"2026-08-11T21:28:23.724429Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:28:23.671533Z","title":"Training-free structured diffu- sion guidance for compositional text-to-image synthesis","venue":null,"work_id":"75e631f9-53a4-43c9-8a65-f5b8361990cf","year":2023},"citing_paper":{"arxiv_id":"2412.04440","last_updated":"2024-12-05T18:56:05Z","snapshot_observed_at":"2026-08-13T08:37:38.494788Z","submitted_at":"2024-12-05T18:56:05Z","title":"GenMAC: Compositional Text-to-Video Generation with Multi-Agent Collaboration","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-11T21:28:20.916649Z"},"links":{"citing_paper":"/paper/2412.04440"},"observation_digest":"sha256:1fa23c031e3dbb2b4e783439c7d8a5c00c22d2c56b6af878463160a5f8a3c1fa","observation_id":"5652a914-6f6f-41ae-a5a1-5ace08a38c5d","resolution":{"observed_at":"2026-08-11T21:28:23.690044Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.10640","last_updated":"2024-02-25T23:23:00Z","snapshot_observed_at":"2026-08-13T05:48:12.806673Z","submitted_at":"2023-10-16T17:57:37Z","title":"LLM Blueprint: Enabling Text-to-Image Generation with Complex and Detailed Prompts","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.10640","snapshot_observed_at":"2026-08-11T21:28:20.922439Z","title":"Llm blueprint: Enabling text-to-image generation with complex and detailed prompts","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.04440","last_updated":"2024-12-05T18:56:05Z","snapshot_observed_at":"2026-08-13T08:37:38.494788Z","submitted_at":"2024-12-05T18:56:05Z","title":"GenMAC: Compositional Text-to-Video Generation with Multi-Agent Collaboration","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-11T21:28:20.922439Z"},"links":{"cited_paper":"/paper/2310.10640","citing_paper":"/paper/2412.04440"},"observation_digest":"sha256:443b0b3420807b29d5d3f42b16caa9ff93b52696fc8adef0deabf10723afc7e8","observation_id":"26858460-4a3b-4e46-ae38-82b138f5d128","resolution":{"observed_at":"2026-08-11T21:28:20.922439Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.04725","last_updated":"2024-02-08T18:08:57Z","snapshot_observed_at":"2026-08-12T14:50:50.360929Z","submitted_at":"2023-07-10T17:34:16Z","title":"AnimateDiff: Animate Your Personalized Text-to-Image Diffusion Models without Specific Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.04725","snapshot_observed_at":"2026-08-11T21:28:20.928645Z","title":"Animatediff: Animate your personalized text-to-image diffusion models without specific tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.04440","last_updated":"2024-12-05T18:56:05Z","snapshot_observed_at":"2026-08-13T08:37:38.494788Z","submitted_at":"2024-12-05T18:56:05Z","title":"GenMAC: Compositional Text-to-Video Generation with Multi-Agent Collaboration","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-11T21:28:20.928645Z"},"links":{"cited_paper":"/paper/2307.04725","citing_paper":"/paper/2412.04440"},"observation_digest":"sha256:bd067a4e7bbee8be94afebe52185eda3cd744140b1817f6248604d6de399f204","observation_id":"9b2ac166-c2b6-40db-acfd-a90c8f860000","resolution":{"observed_at":"2026-08-11T21:28:20.928645Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.13221","last_updated":"2023-03-20T17:29:45Z","snapshot_observed_at":"2026-08-13T08:59:59.906684Z","submitted_at":"2022-11-23T18:58:39Z","title":"Latent Video Diffusion Models for High-Fidelity Long Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.13221","snapshot_observed_at":"2026-08-11T21:28:20.934639Z","title":"Latent video diffusion models for high-fidelity long video generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.04440","last_updated":"2024-12-05T18:56:05Z","snapshot_observed_at":"2026-08-13T08:37:38.494788Z","submitted_at":"2024-12-05T18:56:05Z","title":"GenMAC: Compositional Text-to-Video Generation with Multi-Agent Collaboration","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-11T21:28:20.934639Z"},"links":{"cited_paper":"/paper/2211.13221","citing_paper":"/paper/2412.04440"},"observation_digest":"sha256:9bbb7e4ac774292f04a6a90095f513c902dabbeab656782c773f7f9d604769af","observation_id":"a0ab5767-075c-456e-a619-15566b85d415","resolution":{"observed_at":"2026-08-11T21:28:20.934639Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:28:20.941001Z","title":"Denoising diffu- sion probabilistic models, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.04440","last_updated":"2024-12-05T18:56:05Z","snapshot_observed_at":"2026-08-13T08:37:38.494788Z","submitted_at":"2024-12-05T18:56:05Z","title":"GenMAC: Compositional Text-to-Video Generation with Multi-Agent Collaboration","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-11T21:28:20.941001Z"},"links":{"citing_paper":"/paper/2412.04440"},"observation_digest":"sha256:68f2f105bb7425a448c63719187787ee496d17478396d10e7c3e4a6bd741b286","observation_id":"04a428a9-d5fa-4965-ade5-0c35fd06b96b","resolution":{"observed_at":"2026-08-11T21:28:20.941001Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02303","last_updated":"2022-10-05T14:41:38Z","snapshot_observed_at":"2026-07-06T13:59:57.800591Z","submitted_at":"2022-10-05T14:41:38Z","title":"Imagen Video: High Definition Video Generation with Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.02303","snapshot_observed_at":"2026-08-11T21:28:20.946653Z","title":"Imagen video: High definition video generation with diffusion mod- els","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.04440","last_updated":"2024-12-05T18:56:05Z","snapshot_observed_at":"2026-08-13T08:37:38.494788Z","submitted_at":"2024-12-05T18:56:05Z","title":"GenMAC: Compositional Text-to-Video Generation with Multi-Agent Collaboration","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-11T21:28:20.946653Z"},"links":{"cited_paper":"/paper/2210.02303","citing_paper":"/paper/2412.04440"},"observation_digest":"sha256:dec5816288bde4aa94637d32e75485f5ad4eb6f8636fc16b94e783ec12298912","observation_id":"3e93b76c-5144-466c-a344-6fe5aae94940","resolution":{"observed_at":"2026-08-11T21:28:20.946653Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:28:23.628793Z","title":"Metagpt: Meta programming for a multi-agent collaborative framework, 2024","venue":null,"work_id":"dbbdb513-68a2-4d38-b8e4-46566882f128","year":2024},"citing_paper":{"arxiv_id":"2412.04440","last_updated":"2024-12-05T18:56:05Z","snapshot_observed_at":"2026-08-13T08:37:38.494788Z","submitted_at":"2024-12-05T18:56:05Z","title":"GenMAC: Compositional Text-to-Video Generation with Multi-Agent Collaboration","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-11T21:28:20.953139Z"},"links":{"citing_paper":"/paper/2412.04440"},"observation_digest":"sha256:891959c381308427dec5493488e8c3715d49d20a0244a45b444a9ced2a880c38","observation_id":"71828357-ae88-4d65-9c55-caf33b423133","resolution":{"observed_at":"2026-08-11T21:28:23.636186Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.15868","last_updated":"2022-05-29T19:02:15Z","snapshot_observed_at":"2026-08-12T19:21:15.526321Z","submitted_at":"2022-05-29T19:02:15Z","title":"CogVideo: Large-scale Pretraining for Text-to-Video Generation via Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.15868","snapshot_observed_at":"2026-08-11T21:28:20.960029Z","title":"Cogvideo: Large-scale pretraining for text-to-video generation via transformers","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.04440","last_updated":"2024-12-05T18:56:05Z","snapshot_observed_at":"2026-08-13T08:37:38.494788Z","submitted_at":"2024-12-05T18:56:05Z","title":"GenMAC: Compositional Text-to-Video Generation with Multi-Agent Collaboration","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-11T21:28:20.960029Z"},"links":{"cited_paper":"/paper/2205.15868","citing_paper":"/paper/2412.04440"},"observation_digest":"sha256:46514c41b0a0e70ce67cfc7afbb59f12d04829e227d6c43c2fc078a859726896","observation_id":"cf084e4a-06a1-4d8f-8d7d-3607b8e36167","resolution":{"observed_at":"2026-08-11T21:28:20.960029Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:28:23.597337Z","title":"Open-sora: Democratizing efficient video pro- duction for all, 2024","venue":null,"work_id":"f8eac192-483f-4365-bea8-329fc109a406","year":2024},"citing_paper":{"arxiv_id":"2412.04440","last_updated":"2024-12-05T18:56:05Z","snapshot_observed_at":"2026-08-13T08:37:38.494788Z","submitted_at":"2024-12-05T18:56:05Z","title":"GenMAC: Compositional Text-to-Video Generation with Multi-Agent Collaboration","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-11T21:28:20.965574Z"},"links":{"citing_paper":"/paper/2412.04440"},"observation_digest":"sha256:84060ebf55ab06d2c883f28124221eb3d5df5004d16bdfd994a5e29ff951c2a2","observation_id":"42b64119-d7f0-43f5-a8ec-c9bb6bbda202","resolution":{"observed_at":"2026-08-11T21:28:23.610098Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:28:23.566633Z","title":"T2i-compbench: A comprehensive bench- mark for open-world compositional text-to-image genera- tion","venue":null,"work_id":"d53ad62a-a7c5-4d22-8f6b-a8c94fe09bb8","year":2024},"citing_paper":{"arxiv_id":"2412.04440","last_updated":"2024-12-05T18:56:05Z","snapshot_observed_at":"2026-08-13T08:37:38.494788Z","submitted_at":"2024-12-05T18:56:05Z","title":"GenMAC: Compositional Text-to-Video Generation with Multi-Agent Collaboration","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-11T21:28:20.972538Z"},"links":{"citing_paper":"/paper/2412.04440"},"observation_digest":"sha256:ce5480f60ab6c99705658262b7ebfa455f7188648fb402b9fee7911428708c92","observation_id":"3aa475d1-7bf5-41d1-ba44-0ea23c3a5db5","resolution":{"observed_at":"2026-08-11T21:28:23.576063Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:28:20.978399Z","title":"Text2video-zero: Text- to-image diffusion models are zero-shot video generators","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.04440","last_updated":"2024-12-05T18:56:05Z","snapshot_observed_at":"2026-08-13T08:37:38.494788Z","submitted_at":"2024-12-05T18:56:05Z","title":"GenMAC: Compositional Text-to-Video Generation with Multi-Agent Collaboration","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-11T21:28:20.978399Z"},"links":{"citing_paper":"/paper/2412.04440"},"observation_digest":"sha256:91c33d5f180de58f00095f62e87d4264297b668615dfc9a6d48c95757377a92e","observation_id":"e612d41b-dd4a-4e01-9bdb-366cb2138164","resolution":{"observed_at":"2026-08-11T21:28:20.978399Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:28:23.513280Z","title":"Dense text-to-image generation with attention modulation","venue":null,"work_id":"6cbc67a3-ff3b-4f53-9c80-101f09da7c4b","year":2023},"citing_paper":{"arxiv_id":"2412.04440","last_updated":"2024-12-05T18:56:05Z","snapshot_observed_at":"2026-08-13T08:37:38.494788Z","submitted_at":"2024-12-05T18:56:05Z","title":"GenMAC: Compositional Text-to-Video Generation with Multi-Agent Collaboration","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-11T21:28:20.984086Z"},"links":{"citing_paper":"/paper/2412.04440"},"observation_digest":"sha256:1d2d52b6c4cc8ff015c8041f59ee394f40bf17b0fbb76ebc1e0479aa600a2f7c","observation_id":"576d222d-0cec-4343-8aa9-8dc60fcb3a59","resolution":{"observed_at":"2026-08-11T21:28:23.521624Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14125","last_updated":"2024-06-04T17:25:20Z","snapshot_observed_at":"2026-07-30T23:45:07.963944Z","submitted_at":"2023-12-21T18:46:41Z","title":"VideoPoet: A Large Language Model for Zero-Shot Video Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.14125","snapshot_observed_at":"2026-08-11T21:28:20.989614Z","title":"Videopoet: A large language model for zero-shot video generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.04440","last_updated":"2024-12-05T18:56:05Z","snapshot_observed_at":"2026-08-13T08:37:38.494788Z","submitted_at":"2024-12-05T18:56:05Z","title":"GenMAC: Compositional Text-to-Video Generation with Multi-Agent Collaboration","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-11T21:28:20.989614Z"},"links":{"cited_paper":"/paper/2312.14125","citing_paper":"/paper/2412.04440"},"observation_digest":"sha256:9329d54daf438bf408a2adadb1730498f92a710c786be9dd2e56ae69abf8cabb","observation_id":"72995c45-1d99-47d1-98ca-5be64aecafe3","resolution":{"observed_at":"2026-08-11T21:28:20.989614Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:28:23.491284Z","title":"Open-sora-plan, 2024","venue":null,"work_id":"e8ca9af8-885f-4142-9ce9-958067be36c9","year":2024},"citing_paper":{"arxiv_id":"2412.04440","last_updated":"2024-12-05T18:56:05Z","snapshot_observed_at":"2026-08-13T08:37:38.494788Z","submitted_at":"2024-12-05T18:56:05Z","title":"GenMAC: Compositional Text-to-Video Generation with Multi-Agent Collaboration","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-11T21:28:20.995116Z"},"links":{"citing_paper":"/paper/2412.04440"},"observation_digest":"sha256:08fd706a0605d7432f802a0d56d54a05d534798efbb8cf4c6a3c1ccfd50e863a","observation_id":"6439a76a-ddde-400c-932f-87ea3dd8f53a","resolution":{"observed_at":"2026-08-11T21:28:23.498187Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:28:23.467810Z","title":"Gligen: Open-set grounded text-to-image generation","venue":null,"work_id":"e9dbd60e-ae24-449a-b668-4ecdc6744690","year":2023},"citing_paper":{"arxiv_id":"2412.04440","last_updated":"2024-12-05T18:56:05Z","snapshot_observed_at":"2026-08-13T08:37:38.494788Z","submitted_at":"2024-12-05T18:56:05Z","title":"GenMAC: Compositional Text-to-Video Generation with Multi-Agent Collaboration","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-11T21:28:21.000489Z"},"links":{"citing_paper":"/paper/2412.04440"},"observation_digest":"sha256:0ab3fe325bb9b9e553852ae9351b5c57b09faece7182bb0faf2d3c6c60a9a950","observation_id":"136af769-2592-4035-bf3f-b883f43945ac","resolution":{"observed_at":"2026-08-11T21:28:23.475878Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:28:23.447791Z","title":"Stylet2i: Toward compositional and high-fidelity text- to-image synthesis","venue":null,"work_id":"8f15a9c9-e9c4-49ac-ad69-0093cda30eb7","year":2022},"citing_paper":{"arxiv_id":"2412.04440","last_updated":"2024-12-05T18:56:05Z","snapshot_observed_at":"2026-08-13T08:37:38.494788Z","submitted_at":"2024-12-05T18:56:05Z","title":"GenMAC: Compositional Text-to-Video Generation with Multi-Agent Collaboration","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-11T21:28:21.006516Z"},"links":{"citing_paper":"/paper/2412.04440"},"observation_digest":"sha256:f9c2c25d652922329a4ac6feb208b46ec80224772b6b30dfad4271c244bbc5ff","observation_id":"94a1fafa-c26a-42a6-95dc-c6aba4f41d32","resolution":{"observed_at":"2026-08-11T21:28:23.453249Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17444","last_updated":"2024-05-04T19:28:10Z","snapshot_observed_at":"2026-08-13T10:01:55.605067Z","submitted_at":"2023-09-29T17:54:46Z","title":"LLM-grounded Video Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.17444","snapshot_observed_at":"2026-08-11T21:28:21.012192Z","title":"Llm-grounded video diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.04440","last_updated":"2024-12-05T18:56:05Z","snapshot_observed_at":"2026-08-13T08:37:38.494788Z","submitted_at":"2024-12-05T18:56:05Z","title":"GenMAC: Compositional Text-to-Video Generation with Multi-Agent Collaboration","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-11T21:28:21.012192Z"},"links":{"cited_paper":"/paper/2309.17444","citing_paper":"/paper/2412.04440"},"observation_digest":"sha256:a6c3c1b202bb2469f075509d52a950789433e84699bc62644332b77992a99913","observation_id":"6521fa0a-33c7-4ef2-8f1b-009026c3036c","resolution":{"observed_at":"2026-08-11T21:28:21.012192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:28:23.427132Z","title":"Videodirectorgpt: Consistent multi-scene video generation via llm-guided planning","venue":null,"work_id":"b9c99721-8026-4acb-9282-36147aca7963","year":2024},"citing_paper":{"arxiv_id":"2412.04440","last_updated":"2024-12-05T18:56:05Z","snapshot_observed_at":"2026-08-13T08:37:38.494788Z","submitted_at":"2024-12-05T18:56:05Z","title":"GenMAC: Compositional Text-to-Video Generation with Multi-Agent Collaboration","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-11T21:28:21.017820Z"},"links":{"citing_paper":"/paper/2412.04440"},"observation_digest":"sha256:50beea549e1b35da5c4453cfd51eef04005df31200d74691662475bd8c1eed35","observation_id":"cce2e134-ac28-47d5-a1cf-1bb3d2984ef9","resolution":{"observed_at":"2026-08-11T21:28:23.433787Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:28:23.406280Z","title":"Compositional visual generation with composable diffusion models","venue":null,"work_id":"96787292-b995-471c-a24e-c14ab7dd79c8","year":2022},"citing_paper":{"arxiv_id":"2412.04440","last_updated":"2024-12-05T18:56:05Z","snapshot_observed_at":"2026-08-13T08:37:38.494788Z","submitted_at":"2024-12-05T18:56:05Z","title":"GenMAC: Compositional Text-to-Video Generation with Multi-Agent Collaboration","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-11T21:28:21.024562Z"},"links":{"citing_paper":"/paper/2412.04440"},"observation_digest":"sha256:f21f126e211d7eedba16e5895a12489b0d429fc50f9700fc64db99e8c27e8ddd","observation_id":"6371f809-fffd-491b-a83b-5c2469aa593b","resolution":{"observed_at":"2026-08-11T21:28:23.413400Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.16305","last_updated":"2024-02-26T05:08:40Z","snapshot_observed_at":"2026-08-14T07:06:24.883528Z","submitted_at":"2024-02-26T05:08:40Z","title":"Referee Can Play: An Alternative Approach to Conditional Generation via Model Inversion","version":1},"cited_work":{"arxiv_id":"2402.16305","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.16305","snapshot_observed_at":"2026-08-11T21:28:21.966025Z","title":"Referee Can Play: An Alternative Approach to Conditional Generation via Model Inversion","venue":"cs.LG","work_id":"d8ccd592-7972-4020-a8e6-4c16daf9adb8","year":2024},"citing_paper":{"arxiv_id":"2412.04440","last_updated":"2024-12-05T18:56:05Z","snapshot_observed_at":"2026-08-13T08:37:38.494788Z","submitted_at":"2024-12-05T18:56:05Z","title":"GenMAC: Compositional Text-to-Video Generation with Multi-Agent Collaboration","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-11T21:28:21.030570Z"},"links":{"cited_paper":"/paper/2402.16305","citing_paper":"/paper/2412.04440"},"observation_digest":"sha256:fb446aaf826f4f61b9b1126bb187268614641a95c2c03deea032d869e6cf59e4","observation_id":"8feb338f-f5b1-478a-a0d4-22e1450bbe3f","resolution":{"observed_at":"2026-08-11T21:28:21.972406Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:28:21.037497Z","title":"Videofusion: Decomposed diffusion mod- els for high-quality video generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.04440","last_updated":"2024-12-05T18:56:05Z","snapshot_observed_at":"2026-08-13T08:37:38.494788Z","submitted_at":"2024-12-05T18:56:05Z","title":"GenMAC: Compositional Text-to-Video Generation with Multi-Agent Collaboration","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-11T21:28:21.037497Z"},"links":{"citing_paper":"/paper/2412.04440"},"observation_digest":"sha256:f344987eb2ea4b6d098426e1d6177a6473c2bd9656ea1c699259662cf21d4d03","observation_id":"157268f6-b8e6-4b87-9ac8-364bd77b8a3d","resolution":{"observed_at":"2026-08-11T21:28:21.037497Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.03048","last_updated":"2025-05-01T09:40:21Z","snapshot_observed_at":"2026-08-13T10:28:06.516901Z","submitted_at":"2024-01-05T19:55:15Z","title":"Latte: Latent Diffusion Transformer for Video Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.03048","snapshot_observed_at":"2026-08-11T21:28:21.043729Z","title":"Latte: Latent diffusion transformer for video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.04440","last_updated":"2024-12-05T18:56:05Z","snapshot_observed_at":"2026-08-13T08:37:38.494788Z","submitted_at":"2024-12-05T18:56:05Z","title":"GenMAC: Compositional Text-to-Video Generation with Multi-Agent Collaboration","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-11T21:28:21.043729Z"},"links":{"cited_paper":"/paper/2401.03048","citing_paper":"/paper/2412.04440"},"observation_digest":"sha256:9e47fd0af41da96f915501d1aba5229e002fd29ffb9a94971d8346e45ab3a6eb","observation_id":"b54aa1d8-d318-476c-b764-ec1dc3bd9910","resolution":{"observed_at":"2026-08-11T21:28:21.043729Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06059","last_updated":"2023-12-11T01:42:15Z","snapshot_observed_at":"2026-08-13T05:05:30.682309Z","submitted_at":"2023-12-11T01:42:15Z","title":"CONFORM: Contrast is All You Need For High-Fidelity Text-to-Image Diffusion Models","version":1},"cited_work":{"arxiv_id":"2312.06059","doi":null,"metadata_source":"pith","pith_arxiv_id":"2312.06059","snapshot_observed_at":"2026-08-11T21:28:21.788003Z","title":"CONFORM: Contrast is All You Need For High-Fidelity Text-to-Image Diffusion Models","venue":"cs.CV","work_id":"f2ac040c-4305-4dae-b8b0-62163ee9c2a7","year":2023},"citing_paper":{"arxiv_id":"2412.04440","last_updated":"2024-12-05T18:56:05Z","snapshot_observed_at":"2026-08-13T08:37:38.494788Z","submitted_at":"2024-12-05T18:56:05Z","title":"GenMAC: Compositional Text-to-Video Generation with Multi-Agent Collaboration","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-11T21:28:21.050467Z"},"links":{"cited_paper":"/paper/2312.06059","citing_paper":"/paper/2412.04440"},"observation_digest":"sha256:cb08f61b91bc43b382ce82eea5661a09a0e88f0b8cb6c32a4ea6fa65135e1a6f","observation_id":"a15a99a0-4c63-44b2-92ef-2367495773b8","resolution":{"observed_at":"2026-08-11T21:28:21.841376Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:28:23.365220Z","title":"Hello GPT-4o","venue":null,"work_id":"384da5ab-3a57-41d4-a224-e667df109bd0","year":2024},"citing_paper":{"arxiv_id":"2412.04440","last_updated":"2024-12-05T18:56:05Z","snapshot_observed_at":"2026-08-13T08:37:38.494788Z","submitted_at":"2024-12-05T18:56:05Z","title":"GenMAC: Compositional Text-to-Video Generation with Multi-Agent Collaboration","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-11T21:28:21.060129Z"},"links":{"citing_paper":"/paper/2412.04440"},"observation_digest":"sha256:54aab8782d6f3d13ae3e54d745c76b7b12a36b0f4f2c217d7d12a21c4a2e8603","observation_id":"c22d51a9-b364-430d-ba1c-ec13120a1db0","resolution":{"observed_at":"2026-08-11T21:28:23.373456Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:28:23.335743Z","title":"Benchmark for compositional text-to- image synthesis","venue":null,"work_id":"b90446df-1c4a-406b-bb40-3d033fc18185","year":2021},"citing_paper":{"arxiv_id":"2412.04440","last_updated":"2024-12-05T18:56:05Z","snapshot_observed_at":"2026-08-13T08:37:38.494788Z","submitted_at":"2024-12-05T18:56:05Z","title":"GenMAC: Compositional Text-to-Video Generation with Multi-Agent Collaboration","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-11T21:28:21.065423Z"},"links":{"citing_paper":"/paper/2412.04440"},"observation_digest":"sha256:86b83b4e89f410af82acb656c31e6d812a1dd2722048b2a08d6c9a4a88dedc51","observation_id":"c44c8540-211f-4c8c-bd29-13b59bfbf17c","resolution":{"observed_at":"2026-08-11T21:28:23.346098Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:28:21.070725Z","title":"O’Brien, Carrie J","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.04440","last_updated":"2024-12-05T18:56:05Z","snapshot_observed_at":"2026-08-13T08:37:38.494788Z","submitted_at":"2024-12-05T18:56:05Z","title":"GenMAC: Compositional Text-to-Video Generation with Multi-Agent Collaboration","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-11T21:28:21.070725Z"},"links":{"citing_paper":"/paper/2412.04440"},"observation_digest":"sha256:8e54bf71f10cca191e6b9df8ce79e97f98c4a098484feb5ec1ccccd8deded4b7","observation_id":"41d8b418-01cd-4c26-933d-4d201263626c","resolution":{"observed_at":"2026-08-11T21:28:21.070725Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.04655","last_updated":"2023-12-07T19:32:39Z","snapshot_observed_at":"2026-08-13T05:07:40.030743Z","submitted_at":"2023-12-07T19:32:39Z","title":"ECLIPSE: A Resource-Efficient Text-to-Image Prior for Image Generations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.04655","snapshot_observed_at":"2026-08-11T21:28:21.077475Z","title":"Eclipse: A resource-efficient text-to-image prior for image generations","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.04440","last_updated":"2024-12-05T18:56:05Z","snapshot_observed_at":"2026-08-13T08:37:38.494788Z","submitted_at":"2024-12-05T18:56:05Z","title":"GenMAC: Compositional Text-to-Video Generation with Multi-Agent Collaboration","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-11T21:28:21.077475Z"},"links":{"cited_paper":"/paper/2312.04655","citing_paper":"/paper/2412.04440"},"observation_digest":"sha256:b2b655dd86025430057b9f1ef833fe01de7c1f4f3e45cfe7d8443307d1c1d754","observation_id":"2834ab87-5a69-4fa6-859f-e324e5f24fcb","resolution":{"observed_at":"2026-08-11T21:28:21.077475Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:28:23.290232Z","title":"Chatdev: Communicative agents for software development,","venue":null,"work_id":"2e2cb262-e1b1-4094-90bb-7df208167494","year":null},"citing_paper":{"arxiv_id":"2412.04440","last_updated":"2024-12-05T18:56:05Z","snapshot_observed_at":"2026-08-13T08:37:38.494788Z","submitted_at":"2024-12-05T18:56:05Z","title":"GenMAC: Compositional Text-to-Video Generation with Multi-Agent Collaboration","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-11T21:28:21.084722Z"},"links":{"citing_paper":"/paper/2412.04440"},"observation_digest":"sha256:4ff6ae44efa862a45e00f47a2038de90021d18adfcc911c23671ef1057cce0b1","observation_id":"82e7c30b-7ceb-4d65-85dc-7e5b0a23679d","resolution":{"observed_at":"2026-08-11T21:28:23.296452Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:28:23.267928Z","title":"Linguistic bind- ing in diffusion models: Enhancing attribute correspondence through attention map alignment","venue":null,"work_id":"39279ffc-b259-42b6-aadf-1bf7b75e1583","year":2024},"citing_paper":{"arxiv_id":"2412.04440","last_updated":"2024-12-05T18:56:05Z","snapshot_observed_at":"2026-08-13T08:37:38.494788Z","submitted_at":"2024-12-05T18:56:05Z","title":"GenMAC: Compositional Text-to-Video Generation with Multi-Agent Collaboration","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-11T21:28:21.090503Z"},"links":{"citing_paper":"/paper/2412.04440"},"observation_digest":"sha256:60b77dccb76390bb92e352f17eabf154aa21f7c50c4578aec27bd9656df946a2","observation_id":"ff19bb7a-faec-4850-84eb-9a81bfa2940c","resolution":{"observed_at":"2026-08-11T21:28:23.275394Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:28:23.247994Z","title":null,"venue":null,"work_id":"e8dfa856-712b-488e-863b-a3bff9dc752f","year":2024},"citing_paper":{"arxiv_id":"2412.04440","last_updated":"2024-12-05T18:56:05Z","snapshot_observed_at":"2026-08-13T08:37:38.494788Z","submitted_at":"2024-12-05T18:56:05Z","title":"GenMAC: Compositional Text-to-Video Generation with Multi-Agent Collaboration","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-11T21:28:21.095761Z"},"links":{"citing_paper":"/paper/2412.04440"},"observation_digest":"sha256:5680dfca861289011505f664246f8dc4fc7931c983a41dfac3835c1f66e91287","observation_id":"670c746c-b792-41e2-9aa9-6dbc1dae81cd","resolution":{"observed_at":"2026-08-11T21:28:23.253803Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.14792","last_updated":"2022-09-29T13:59:46Z","snapshot_observed_at":"2026-07-06T13:57:47.051387Z","submitted_at":"2022-09-29T13:59:46Z","title":"Make-A-Video: Text-to-Video Generation without Text-Video Data","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.14792","snapshot_observed_at":"2026-08-11T21:28:21.101571Z","title":"Make-a-video: Text-to-video generation without text-video data","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.04440","last_updated":"2024-12-05T18:56:05Z","snapshot_observed_at":"2026-08-13T08:37:38.494788Z","submitted_at":"2024-12-05T18:56:05Z","title":"GenMAC: Compositional Text-to-Video Generation with Multi-Agent Collaboration","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-11T21:28:21.101571Z"},"links":{"cited_paper":"/paper/2209.14792","citing_paper":"/paper/2412.04440"},"observation_digest":"sha256:ff3f97efb0bf8d09603c5eb95eb36b1d946a37b15b8de0ac5ce5f45958dfc34a","observation_id":"e4d34dee-ca87-434b-b2ae-72f80196fc43","resolution":{"observed_at":"2026-08-11T21:28:21.101571Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:28:21.108351Z","title":"Weiss, Niru Mah- eswaranathan, and Surya Ganguli","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2412.04440","last_updated":"2024-12-05T18:56:05Z","snapshot_observed_at":"2026-08-13T08:37:38.494788Z","submitted_at":"2024-12-05T18:56:05Z","title":"GenMAC: Compositional Text-to-Video Generation with Multi-Agent Collaboration","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-11T21:28:21.108351Z"},"links":{"citing_paper":"/paper/2412.04440"},"observation_digest":"sha256:6cd7a46ab75e0937ae3ab60696d6a486a3acdd7eb4aeb1622d8dae9cf82798f2","observation_id":"10d5fbc1-b7aa-4ff8-84a3-ddbfea11f1d4","resolution":{"observed_at":"2026-08-11T21:28:21.108351Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:28:23.218644Z","title":"Kingma, Ab- hishek Kumar, Stefano Ermon, and Ben Poole","venue":null,"work_id":"a1a6fc11-ff8b-4ad9-b633-b68593fbeb73","year":2021},"citing_paper":{"arxiv_id":"2412.04440","last_updated":"2024-12-05T18:56:05Z","snapshot_observed_at":"2026-08-13T08:37:38.494788Z","submitted_at":"2024-12-05T18:56:05Z","title":"GenMAC: Compositional Text-to-Video Generation with Multi-Agent Collaboration","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-11T21:28:21.113904Z"},"links":{"citing_paper":"/paper/2412.04440"},"observation_digest":"sha256:4cf377a0c4a66abc717f0171aa0a41a73789b46e968d7a9214c50327f3b50ec4","observation_id":"95fcbebf-e845-4075-825d-4d21b10b961f","resolution":{"observed_at":"2026-08-11T21:28:23.223987Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:28:21.118962Z","title":"T2v-compbench: A comprehen- sive benchmark for compositional text-to-video generation,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.04440","last_updated":"2024-12-05T18:56:05Z","snapshot_observed_at":"2026-08-13T08:37:38.494788Z","submitted_at":"2024-12-05T18:56:05Z","title":"GenMAC: Compositional Text-to-Video Generation with Multi-Agent Collaboration","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-11T21:28:21.118962Z"},"links":{"citing_paper":"/paper/2412.04440"},"observation_digest":"sha256:3a2dcab3fbe7d558475fd5e6acb47ef16b9a97c91855a8a366a5614915a3da5d","observation_id":"0d6b7f9e-7fda-4fda-88f6-e6b44df02246","resolution":{"observed_at":"2026-08-11T21:28:21.118962Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:28:23.183897Z","title":"A survey of neural code intelligence: Paradigms, advances and beyond, 2024","venue":null,"work_id":"afa79a8c-330c-47e0-8724-14d0e88c6d85","year":2024},"citing_paper":{"arxiv_id":"2412.04440","last_updated":"2024-12-05T18:56:05Z","snapshot_observed_at":"2026-08-13T08:37:38.494788Z","submitted_at":"2024-12-05T18:56:05Z","title":"GenMAC: Compositional Text-to-Video Generation with Multi-Agent Collaboration","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-11T21:28:21.125094Z"},"links":{"citing_paper":"/paper/2412.04440"},"observation_digest":"sha256:ccb9a9fbd6600d1007bf98e708cca7cfe5eb4a4d832f5f2d3f21cda63bb50bb0","observation_id":"6573c5c3-ecf7-4add-9040-9f3fc96951d8","resolution":{"observed_at":"2026-08-11T21:28:23.190825Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:28:23.157274Z","title":"Corex: Pushing the boundaries of complex reasoning through multi-model collaboration, 2024","venue":null,"work_id":"3d20a6d7-8c4b-4abc-b314-4c487a7dd0a8","year":2024},"citing_paper":{"arxiv_id":"2412.04440","last_updated":"2024-12-05T18:56:05Z","snapshot_observed_at":"2026-08-13T08:37:38.494788Z","submitted_at":"2024-12-05T18:56:05Z","title":"GenMAC: Compositional Text-to-Video Generation with Multi-Agent Collaboration","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-11T21:28:21.130009Z"},"links":{"citing_paper":"/paper/2412.04440"},"observation_digest":"sha256:63efb05124e8732504bd0e7d490a27361deb76f53c85caaa7642b0b8bdf25bcd","observation_id":"5a05c921-02da-40ff-8e2f-1df422505941","resolution":{"observed_at":"2026-08-11T21:28:23.165481Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.17910","last_updated":"2024-02-27T21:51:32Z","snapshot_observed_at":"2026-08-13T04:08:44.301404Z","submitted_at":"2024-02-27T21:51:32Z","title":"Box It to Bind It: Unified Layout Control and Attribute Binding in T2I Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.17910","snapshot_observed_at":"2026-08-11T21:28:21.135761Z","title":"Box it to bind it: Unified layout control and at- tribute binding in t2i diffusion models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.04440","last_updated":"2024-12-05T18:56:05Z","snapshot_observed_at":"2026-08-13T08:37:38.494788Z","submitted_at":"2024-12-05T18:56:05Z","title":"GenMAC: Compositional Text-to-Video Generation with Multi-Agent Collaboration","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-11T21:28:21.135761Z"},"links":{"cited_paper":"/paper/2402.17910","citing_paper":"/paper/2412.04440"},"observation_digest":"sha256:fbeadeae9cb34abef808ddef093ee119d7cbc0f37507c1f11ba30c503d17b9f2","observation_id":"a4455696-ccec-4398-8a8a-56f3e3a6c2c7","resolution":{"observed_at":"2026-08-11T21:28:21.135761Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:28:23.088111Z","title":"Prioritizing safeguarding over autonomy: Risks of llm agents for science, 2024","venue":null,"work_id":"0fbb2a9b-1a06-4fea-8d76-daf1defd741e","year":2024},"citing_paper":{"arxiv_id":"2412.04440","last_updated":"2024-12-05T18:56:05Z","snapshot_observed_at":"2026-08-13T08:37:38.494788Z","submitted_at":"2024-12-05T18:56:05Z","title":"GenMAC: Compositional Text-to-Video Generation with Multi-Agent Collaboration","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-11T21:28:21.141345Z"},"links":{"citing_paper":"/paper/2412.04440"},"observation_digest":"sha256:6dfe6aa05b56a19bf08dceb16918fa74a69f95423af1ae1cada29c499688cd3f","observation_id":"4d632eb3-f1da-4d43-b1c4-4a221893d24c","resolution":{"observed_at":"2026-08-11T21:28:23.142452Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:28:23.003839Z","title":"Videotetris: Towards compo- sitional text-to-video generation, 2024","venue":null,"work_id":"c5bbc914-31e2-4471-ba17-c4a69f27ef95","year":2024},"citing_paper":{"arxiv_id":"2412.04440","last_updated":"2024-12-05T18:56:05Z","snapshot_observed_at":"2026-08-13T08:37:38.494788Z","submitted_at":"2024-12-05T18:56:05Z","title":"GenMAC: Compositional Text-to-Video Generation with Multi-Agent Collaboration","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-11T21:28:21.146892Z"},"links":{"citing_paper":"/paper/2412.04440"},"observation_digest":"sha256:012cfe1cd135a1994034a6d8935690a7892741fda8e09a5f4dd4431b1ed32f0d","observation_id":"5149d81d-e953-4d74-ae43-56418f823262","resolution":{"observed_at":"2026-08-11T21:28:23.025872Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:28:21.152506Z","title":"Phenaki: Variable length video generation from open domain textual descriptions","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.04440","last_updated":"2024-12-05T18:56:05Z","snapshot_observed_at":"2026-08-13T08:37:38.494788Z","submitted_at":"2024-12-05T18:56:05Z","title":"GenMAC: Compositional Text-to-Video Generation with Multi-Agent Collaboration","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-11T21:28:21.152506Z"},"links":{"citing_paper":"/paper/2412.04440"},"observation_digest":"sha256:60d978d009cbc974f6398ee36b5c785ae2c867849cd38c2931a078d76a870731","observation_id":"b59720f1-3ece-412e-911a-05fcf03c7e8b","resolution":{"observed_at":"2026-08-11T21:28:21.152506Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:28:22.973728Z","title":"V oyager: An open-ended embodied agent with large language models, 2023","venue":null,"work_id":"bd10da21-f97f-4226-9ba6-22d8e5bab8b2","year":2023},"citing_paper":{"arxiv_id":"2412.04440","last_updated":"2024-12-05T18:56:05Z","snapshot_observed_at":"2026-08-13T08:37:38.494788Z","submitted_at":"2024-12-05T18:56:05Z","title":"GenMAC: Compositional Text-to-Video Generation with Multi-Agent Collaboration","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-11T21:28:21.157710Z"},"links":{"citing_paper":"/paper/2412.04440"},"observation_digest":"sha256:6f222b4055e5222d90874e6df21163f695dd432cf6723ec6e1395bed6c318299","observation_id":"1efbd637-6b74-493d-90ed-0314e0ebe016","resolution":{"observed_at":"2026-08-11T21:28:22.979056Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.06571","last_updated":"2023-08-12T13:53:10Z","snapshot_observed_at":"2026-08-10T01:52:30.999213Z","submitted_at":"2023-08-12T13:53:10Z","title":"ModelScope Text-to-Video Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.06571","snapshot_observed_at":"2026-08-11T21:28:21.164023Z","title":"Modelscope text-to-video technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.04440","last_updated":"2024-12-05T18:56:05Z","snapshot_observed_at":"2026-08-13T08:37:38.494788Z","submitted_at":"2024-12-05T18:56:05Z","title":"GenMAC: Compositional Text-to-Video Generation with Multi-Agent Collaboration","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-11T21:28:21.164023Z"},"links":{"cited_paper":"/paper/2308.06571","citing_paper":"/paper/2412.04440"},"observation_digest":"sha256:756baebf1428e8b42aeb2096ec01ee0285d58c61a0a29641f2e940ccdaa72872","observation_id":"ff78e883-b859-4042-89d8-9d4c4f69b305","resolution":{"observed_at":"2026-08-11T21:28:21.164023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13921","last_updated":"2023-12-13T03:46:54Z","snapshot_observed_at":"2026-08-13T21:47:17.214526Z","submitted_at":"2023-05-23T10:49:22Z","title":"Compositional Text-to-Image Synthesis with Attention Map Control of Diffusion Models","version":2},"cited_work":{"arxiv_id":"2305.13921","doi":null,"metadata_source":"pith","pith_arxiv_id":"2305.13921","snapshot_observed_at":"2026-08-11T21:28:21.580580Z","title":"Compositional Text-to-Image Synthesis with Attention Map Control of Diffusion Models","venue":"cs.CV","work_id":"b205cb78-dcaf-4068-a275-75ee7215211e","year":2023},"citing_paper":{"arxiv_id":"2412.04440","last_updated":"2024-12-05T18:56:05Z","snapshot_observed_at":"2026-08-13T08:37:38.494788Z","submitted_at":"2024-12-05T18:56:05Z","title":"GenMAC: Compositional Text-to-Video Generation with Multi-Agent Collaboration","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-11T21:28:21.169358Z"},"links":{"cited_paper":"/paper/2305.13921","citing_paper":"/paper/2412.04440"},"observation_digest":"sha256:7504935bbef2fcb157861e3d32919de1617b347f5a431582ec0998ecc3adcccb","observation_id":"a3fb2505-7ccb-4402-ba3e-77c4e901c229","resolution":{"observed_at":"2026-08-11T21:28:21.624631Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:28:22.956804Z","title":"Xu, Xian- gru Tang, Mingchen Zhuge, Jiayi Pan, Yueqi Song, Bowen Li, Jaskirat Singh, Hoang H","venue":null,"work_id":"effbe2a0-a73f-4bba-add3-d6efe8558060","year":2024},"citing_paper":{"arxiv_id":"2412.04440","last_updated":"2024-12-05T18:56:05Z","snapshot_observed_at":"2026-08-13T08:37:38.494788Z","submitted_at":"2024-12-05T18:56:05Z","title":"GenMAC: Compositional Text-to-Video Generation with Multi-Agent Collaboration","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-11T21:28:21.175569Z"},"links":{"citing_paper":"/paper/2412.04440"},"observation_digest":"sha256:e7c5ccb889d01b791ae8db2eefc2fe09122c1ac8757552cd9c56d4d3372db19f","observation_id":"7316e80a-c952-4674-9b79-96f0a490c7e9","resolution":{"observed_at":"2026-08-11T21:28:22.962499Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:28:22.930820Z","title":"Genartist: Multimodal llm as an agent for unified image gen- eration and editing, 2024","venue":null,"work_id":"48218580-e43d-410c-bbc3-5993474f80ee","year":2024},"citing_paper":{"arxiv_id":"2412.04440","last_updated":"2024-12-05T18:56:05Z","snapshot_observed_at":"2026-08-13T08:37:38.494788Z","submitted_at":"2024-12-05T18:56:05Z","title":"GenMAC: Compositional Text-to-Video Generation with Multi-Agent Collaboration","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-11T21:28:21.181372Z"},"links":{"citing_paper":"/paper/2412.04440"},"observation_digest":"sha256:960ee75068a75acdbada439b9487f423899a3d99636471bb14f49309fbf3baca","observation_id":"fcf40c8d-af20-4f0f-ae94-866d3074409d","resolution":{"observed_at":"2026-08-11T21:28:22.936409Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.15688","last_updated":"2024-01-30T13:05:13Z","snapshot_observed_at":"2026-08-13T04:33:14.914274Z","submitted_at":"2024-01-28T16:18:39Z","title":"Divide and Conquer: Language Models can Plan and Self-Correct for Compositional Text-to-Image Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.15688","snapshot_observed_at":"2026-08-11T21:28:21.187840Z","title":"Divide and conquer: Language mod- els can plan and self-correct for compositional text-to-image generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.04440","last_updated":"2024-12-05T18:56:05Z","snapshot_observed_at":"2026-08-13T08:37:38.494788Z","submitted_at":"2024-12-05T18:56:05Z","title":"GenMAC: Compositional Text-to-Video Generation with Multi-Agent Collaboration","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-11T21:28:21.187840Z"},"links":{"cited_paper":"/paper/2401.15688","citing_paper":"/paper/2412.04440"},"observation_digest":"sha256:d30a04fd5ab106a70d2eace090dc6810301b4216077d2e95b87a65f0e2bfb997","observation_id":"a6f86732-2de4-403c-b4d3-cb37a9736e51","resolution":{"observed_at":"2026-08-11T21:28:21.187840Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.14806","last_updated":"2021-04-30T07:40:35Z","snapshot_observed_at":"2026-08-12T04:22:15.303374Z","submitted_at":"2021-04-30T07:40:35Z","title":"GODIVA: Generating Open-DomaIn Videos from nAtural Descriptions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.14806","snapshot_observed_at":"2026-08-11T21:28:21.193411Z","title":"Godiva: Gen- erating open-domain videos from natural descriptions","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.04440","last_updated":"2024-12-05T18:56:05Z","snapshot_observed_at":"2026-08-13T08:37:38.494788Z","submitted_at":"2024-12-05T18:56:05Z","title":"GenMAC: Compositional Text-to-Video Generation with Multi-Agent Collaboration","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-11T21:28:21.193411Z"},"links":{"cited_paper":"/paper/2104.14806","citing_paper":"/paper/2412.04440"},"observation_digest":"sha256:3002b88592e200d86bc10bc698ee87cf6a193aba0d084362b69a6b3af0cdc109","observation_id":"27ad0aa7-92dd-4dc5-ab06-0db6b0e011fe","resolution":{"observed_at":"2026-08-11T21:28:21.193411Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:28:22.906716Z","title":"N ¨uwa: Visual synthesis pre- training for neural visual world creation","venue":null,"work_id":"65982bb0-4c5b-4374-80ed-ce28a995cade","year":2022},"citing_paper":{"arxiv_id":"2412.04440","last_updated":"2024-12-05T18:56:05Z","snapshot_observed_at":"2026-08-13T08:37:38.494788Z","submitted_at":"2024-12-05T18:56:05Z","title":"GenMAC: Compositional Text-to-Video Generation with Multi-Agent Collaboration","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-11T21:28:21.199173Z"},"links":{"citing_paper":"/paper/2412.04440"},"observation_digest":"sha256:29dead0a3ae44f4ad64564e2b4fd46a8bb132bda46c730ca10750bfc35d9efb0","observation_id":"b63825ae-12ee-481d-8340-099df8e54477","resolution":{"observed_at":"2026-08-11T21:28:22.913597Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:28:22.878665Z","title":"Autogen: Enabling next-gen llm ap- plications via multi-agent conversation, 2023","venue":null,"work_id":"51b41bd2-6caf-40a7-9983-68885a2fe93f","year":2023},"citing_paper":{"arxiv_id":"2412.04440","last_updated":"2024-12-05T18:56:05Z","snapshot_observed_at":"2026-08-13T08:37:38.494788Z","submitted_at":"2024-12-05T18:56:05Z","title":"GenMAC: Compositional Text-to-Video Generation with Multi-Agent Collaboration","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-11T21:28:21.204183Z"},"links":{"citing_paper":"/paper/2412.04440"},"observation_digest":"sha256:eaf7fe694202cad32de4d6464c9a0d528c7312ea4682ad84559bdfdbd79ed2cd","observation_id":"f5df9352-2121-47bb-a119-2d62c8d5d7fc","resolution":{"observed_at":"2026-08-11T21:28:22.885930Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:28:22.852643Z","title":"Harnessing the spatial- temporal attention of diffusion models for high-fidelity text- to-image synthesis","venue":null,"work_id":"fc084e45-cc47-4f9d-8f29-1edaa44d0e87","year":2023},"citing_paper":{"arxiv_id":"2412.04440","last_updated":"2024-12-05T18:56:05Z","snapshot_observed_at":"2026-08-13T08:37:38.494788Z","submitted_at":"2024-12-05T18:56:05Z","title":"GenMAC: Compositional Text-to-Video Generation with Multi-Agent Collaboration","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-11T21:28:21.209518Z"},"links":{"citing_paper":"/paper/2412.04440"},"observation_digest":"sha256:f7f319088386aa66d61ec3aeb7d5c603ee3f16236ec5be66555ea9980eecc9bb","observation_id":"c0fcfc26-6ac0-4cff-9a7a-25c7ceb18449","resolution":{"observed_at":"2026-08-11T21:28:22.861717Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:28:22.826529Z","title":"Gonzalez, Boyi Li, and Trevor Darrell","venue":null,"work_id":"73a22832-58e0-48df-9efd-6072c619c385","year":2023},"citing_paper":{"arxiv_id":"2412.04440","last_updated":"2024-12-05T18:56:05Z","snapshot_observed_at":"2026-08-13T08:37:38.494788Z","submitted_at":"2024-12-05T18:56:05Z","title":"GenMAC: Compositional Text-to-Video Generation with Multi-Agent Collaboration","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-11T21:28:21.215085Z"},"links":{"citing_paper":"/paper/2412.04440"},"observation_digest":"sha256:7c71b4f964e4d65d6a66ab1bce1a1bf157d389fe1b97ecbea0cbbf1577e4a4bd","observation_id":"51b5997b-13ba-4828-b530-76bf3d409050","resolution":{"observed_at":"2026-08-11T21:28:22.835815Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.11708","last_updated":"2024-05-05T04:50:54Z","snapshot_observed_at":"2026-08-13T10:47:54.326171Z","submitted_at":"2024-01-22T06:16:29Z","title":"Mastering Text-to-Image Diffusion: Recaptioning, Planning, and Generating with Multimodal LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.11708","snapshot_observed_at":"2026-08-11T21:28:21.219961Z","title":"Mastering text-to-image diffu- sion: Recaptioning, planning, and generating with multi- modal llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.04440","last_updated":"2024-12-05T18:56:05Z","snapshot_observed_at":"2026-08-13T08:37:38.494788Z","submitted_at":"2024-12-05T18:56:05Z","title":"GenMAC: Compositional Text-to-Video Generation with Multi-Agent Collaboration","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-11T21:28:21.219961Z"},"links":{"cited_paper":"/paper/2401.11708","citing_paper":"/paper/2412.04440"},"observation_digest":"sha256:dc004710685ccc0b0880c81d72aae6c16053b6c4c98d18f8ed3ce856529cb28c","observation_id":"d18b211b-9d12-46c5-9a1e-15169c08dc39","resolution":{"observed_at":"2026-08-11T21:28:21.219961Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:28:22.783625Z","title":"Compositional video gen- eration as flow equalization, 2024","venue":null,"work_id":"153a40be-c096-4e4d-a2dc-4f9cec036f32","year":2024},"citing_paper":{"arxiv_id":"2412.04440","last_updated":"2024-12-05T18:56:05Z","snapshot_observed_at":"2026-08-13T08:37:38.494788Z","submitted_at":"2024-12-05T18:56:05Z","title":"GenMAC: Compositional Text-to-Video Generation with Multi-Agent Collaboration","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-11T21:28:21.225607Z"},"links":{"citing_paper":"/paper/2412.04440"},"observation_digest":"sha256:d0673d37dc3926b78bb514181746c5e06d2d173f6199ffb58293151c498ff01f","observation_id":"3179a8cc-d168-4553-ad50-504e9936edf5","resolution":{"observed_at":"2026-08-11T21:28:22.789679Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.06072","last_updated":"2025-03-26T08:33:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-12T11:47:11Z","title":"CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.06072","snapshot_observed_at":"2026-08-11T21:28:21.230637Z","title":"Cogvideox: Text-to-video diffusion models with an expert transformer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.04440","last_updated":"2024-12-05T18:56:05Z","snapshot_observed_at":"2026-08-13T08:37:38.494788Z","submitted_at":"2024-12-05T18:56:05Z","title":"GenMAC: Compositional Text-to-Video Generation with Multi-Agent Collaboration","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-11T21:28:21.230637Z"},"links":{"cited_paper":"/paper/2408.06072","citing_paper":"/paper/2412.04440"},"observation_digest":"sha256:cd21a0e3604e2147452ff4fb94979213c3fb9ad0ef91f231ab35876a6eb140fd","observation_id":"6fe3f2b2-8432-45fa-a21b-54d7148d909d","resolution":{"observed_at":"2026-08-11T21:28:21.230637Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:28:22.700066Z","title":"Webshop: Towards scalable real-world web interaction with grounded language agents, 2023","venue":null,"work_id":"5ea47d14-f440-49bd-9dcf-b947f1227214","year":2023},"citing_paper":{"arxiv_id":"2412.04440","last_updated":"2024-12-05T18:56:05Z","snapshot_observed_at":"2026-08-13T08:37:38.494788Z","submitted_at":"2024-12-05T18:56:05Z","title":"GenMAC: Compositional Text-to-Video Generation with Multi-Agent Collaboration","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-11T21:28:21.236451Z"},"links":{"citing_paper":"/paper/2412.04440"},"observation_digest":"sha256:0fd235aeccdc843a7feb97bf07c605106387d4f2ce181bd9cd6a7ba1c5eedfb1","observation_id":"4b1cb226-ee5e-472f-bd39-fe4fcbdc1f87","resolution":{"observed_at":"2026-08-11T21:28:22.735156Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:28:21.242478Z","title":"Magvit: Masked generative video transformer","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.04440","last_updated":"2024-12-05T18:56:05Z","snapshot_observed_at":"2026-08-13T08:37:38.494788Z","submitted_at":"2024-12-05T18:56:05Z","title":"GenMAC: Compositional Text-to-Video Generation with Multi-Agent Collaboration","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-11T21:28:21.242478Z"},"links":{"citing_paper":"/paper/2412.04440"},"observation_digest":"sha256:4b743a211d87d1ab46c608adb24079e1a1deb9e890cbd1e8a13d25bebd5c38e6","observation_id":"fd5e7ede-a858-4c9e-ae27-41ba85e031f3","resolution":{"observed_at":"2026-08-11T21:28:21.242478Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05737","last_updated":"2024-03-29T17:44:41Z","snapshot_observed_at":"2026-08-02T18:23:02.746177Z","submitted_at":"2023-10-09T14:10:29Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.05737","snapshot_observed_at":"2026-08-11T21:28:21.247742Z","title":"Language model beats diffusion–tokenizer is key to visual generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.04440","last_updated":"2024-12-05T18:56:05Z","snapshot_observed_at":"2026-08-13T08:37:38.494788Z","submitted_at":"2024-12-05T18:56:05Z","title":"GenMAC: Compositional Text-to-Video Generation with Multi-Agent Collaboration","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-11T21:28:21.247742Z"},"links":{"cited_paper":"/paper/2310.05737","citing_paper":"/paper/2412.04440"},"observation_digest":"sha256:5d0a84ba659c2d0ee2393069c4b0215594f06853061a3f1a8c40c26ad888f98b","observation_id":"0f53b9e2-e613-46b4-bb31-e3be780a5bdd","resolution":{"observed_at":"2026-08-11T21:28:21.247742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.05014","last_updated":"2025-04-06T03:43:41Z","snapshot_observed_at":"2026-08-13T00:35:31.672654Z","submitted_at":"2024-04-07T16:49:07Z","title":"MagicTime: Time-lapse Video Generation Models as Metamorphic Simulators","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.05014","snapshot_observed_at":"2026-08-11T21:28:21.252713Z","title":"Mag- ictime: Time-lapse video generation models as metamorphic simulators","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.04440","last_updated":"2024-12-05T18:56:05Z","snapshot_observed_at":"2026-08-13T08:37:38.494788Z","submitted_at":"2024-12-05T18:56:05Z","title":"GenMAC: Compositional Text-to-Video Generation with Multi-Agent Collaboration","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-11T21:28:21.252713Z"},"links":{"cited_paper":"/paper/2404.05014","citing_paper":"/paper/2412.04440"},"observation_digest":"sha256:3d9a7a06e5afb17d7164bd61031bdb15fc2621b47580b2c28c0f871543475bb1","observation_id":"e2a25fc4-6444-4931-a668-21f21abf41ae","resolution":{"observed_at":"2026-08-11T21:28:21.252713Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:28:22.638197Z","title":"Mora: En- abling generalist video generation via a multi-agent frame- work, 2024","venue":null,"work_id":"48d861dd-ca3b-4979-85b3-ae4f785f2787","year":2024},"citing_paper":{"arxiv_id":"2412.04440","last_updated":"2024-12-05T18:56:05Z","snapshot_observed_at":"2026-08-13T08:37:38.494788Z","submitted_at":"2024-12-05T18:56:05Z","title":"GenMAC: Compositional Text-to-Video Generation with Multi-Agent Collaboration","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-11T21:28:21.259547Z"},"links":{"citing_paper":"/paper/2412.04440"},"observation_digest":"sha256:cdcdeba1b3a304770eda6b5a9f8a3a5298c550cff2d7b5c129761810bff452f9","observation_id":"05aaf634-d709-4dca-a0cd-73623d514bd3","resolution":{"observed_at":"2026-08-11T21:28:22.646011Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.15818","last_updated":"2025-05-30T03:55:20Z","snapshot_observed_at":"2026-08-13T10:03:45.103373Z","submitted_at":"2023-09-27T17:44:18Z","title":"Show-1: Marrying Pixel and Latent Diffusion Models for Text-to-Video Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.15818","snapshot_observed_at":"2026-08-11T21:28:21.264413Z","title":"Show-1: Marrying pixel and latent dif- fusion models for text-to-video generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.04440","last_updated":"2024-12-05T18:56:05Z","snapshot_observed_at":"2026-08-13T08:37:38.494788Z","submitted_at":"2024-12-05T18:56:05Z","title":"GenMAC: Compositional Text-to-Video Generation with Multi-Agent Collaboration","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-11T21:28:21.264413Z"},"links":{"cited_paper":"/paper/2309.15818","citing_paper":"/paper/2412.04440"},"observation_digest":"sha256:5557529e47b5cca93fb1a5209bdd6fe7162c05f4d2209d7a4794cab14b384c4e","observation_id":"4000ac06-1fad-46c9-b138-cd51eea9b84c","resolution":{"observed_at":"2026-08-11T21:28:21.264413Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.11018","last_updated":"2023-05-11T11:23:03Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-11-20T16:40:31Z","title":"MagicVideo: Efficient Video Generation With Latent Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.11018","snapshot_observed_at":"2026-08-11T21:28:21.269581Z","title":"Big Ben”, one on the left and the other on the right. In the second example of Figure A10 (the second row), VideoTetris [51] and Gen-3 [42] do not de- pict “sitting on haunches","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.04440","last_updated":"2024-12-05T18:56:05Z","snapshot_observed_at":"2026-08-13T08:37:38.494788Z","submitted_at":"2024-12-05T18:56:05Z","title":"GenMAC: Compositional Text-to-Video Generation with Multi-Agent Collaboration","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-11T21:28:21.269581Z"},"links":{"cited_paper":"/paper/2211.11018","citing_paper":"/paper/2412.04440"},"observation_digest":"sha256:6119077600f791b7e98d1d156f2cfdfbb7ba0603f9b47b77633aa6bbe16c35e1","observation_id":"9f010a1f-46a8-4d8c-80e8-b16658ce10fc","resolution":{"observed_at":"2026-08-11T21:28:21.269581Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:28:22.603548Z","title":"a glass sculpture","venue":null,"work_id":"68ac57da-239d-4e85-b767-c3f8f5a6222a","year":null},"citing_paper":{"arxiv_id":"2412.04440","last_updated":"2024-12-05T18:56:05Z","snapshot_observed_at":"2026-08-13T08:37:38.494788Z","submitted_at":"2024-12-05T18:56:05Z","title":"GenMAC: Compositional Text-to-Video Generation with Multi-Agent Collaboration","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-11T21:28:21.274783Z"},"links":{"citing_paper":"/paper/2412.04440"},"observation_digest":"sha256:1741eb004c6fe41396badcb96c66a19736a4d5410ec77d998adb326a66ea4c08","observation_id":"727b02a2-57de-4ab2-901e-9bbf57dbf13f","resolution":{"observed_at":"2026-08-11T21:28:22.623594Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:28:22.446915Z","title":"porcelain rabbit","venue":null,"work_id":"1c4aca2d-bfa0-49dc-a187-ffbe07e3667f","year":null},"citing_paper":{"arxiv_id":"2412.04440","last_updated":"2024-12-05T18:56:05Z","snapshot_observed_at":"2026-08-13T08:37:38.494788Z","submitted_at":"2024-12-05T18:56:05Z","title":"GenMAC: Compositional Text-to-Video Generation with Multi-Agent Collaboration","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-11T21:28:21.281714Z"},"links":{"citing_paper":"/paper/2412.04440"},"observation_digest":"sha256:780fb9e8cb0bdc89f11bd236878d7658334f0d4256f0ef356371aafc7331b4ea","observation_id":"942799bb-1375-47e3-ba4f-7d28aa06eac9","resolution":{"observed_at":"2026-08-11T21:28:22.525704Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:28:22.426290Z","title":"Rabbit police officer directs traffic","venue":null,"work_id":"b450e103-3427-4044-be67-8caf743171ad","year":null},"citing_paper":{"arxiv_id":"2412.04440","last_updated":"2024-12-05T18:56:05Z","snapshot_observed_at":"2026-08-13T08:37:38.494788Z","submitted_at":"2024-12-05T18:56:05Z","title":"GenMAC: Compositional Text-to-Video Generation with Multi-Agent Collaboration","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-11T21:28:21.293365Z"},"links":{"citing_paper":"/paper/2412.04440"},"observation_digest":"sha256:79060dfafd2f41c0297e316f6e7912e95bc5f2d89b9b3ffc827ae5cf33270929","observation_id":"edca6bb7-095b-4d6c-82c5-2b347e971ccf","resolution":{"observed_at":"2026-08-11T21:28:22.431932Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:28:22.239804Z","title":"This could involve positioning the rabbit with an arm raised or using a gesture to indicate traffic direction.2","venue":null,"work_id":"7c77a8cb-8918-43c2-8cb4-be198e5858be","year":null},"citing_paper":{"arxiv_id":"2412.04440","last_updated":"2024-12-05T18:56:05Z","snapshot_observed_at":"2026-08-13T08:37:38.494788Z","submitted_at":"2024-12-05T18:56:05Z","title":"GenMAC: Compositional Text-to-Video Generation with Multi-Agent Collaboration","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-11T21:28:21.301097Z"},"links":{"citing_paper":"/paper/2412.04440"},"observation_digest":"sha256:ebcbfc5837a21e95fbe8eacd3032b22c89a95235546140301fdc42bb50d40a83","observation_id":"cec2947f-d5c4-424a-81a0-70f46b6003bf","resolution":{"observed_at":"2026-08-11T21:28:22.330466Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2412.04440","last_updated":"2024-12-05T18:56:05Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-13T08:37:38.494788Z","submitted_at":"2024-12-05T18:56:05Z","title":"GenMAC: Compositional Text-to-Video Generation with Multi-Agent Collaboration"},"reference_resolution":{"displayed":77,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":36,"verified_exact":3,"verified_fuzzy":38},"total_outbound_references":77},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 77 of 77 outbound references and 2 inbound Pith citation observations for arXiv:2412.04440."}