{"as_of":"2026-08-13T07:10:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f84fdfe741925ef3deff1cc44570ca2d91c6f5207ec4b17011398b1273eb6444","coverage":[{"denominator":77,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":77,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T06:47:12.160381Z","state":"measured"},{"denominator":79,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":79,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T19:08:49.594504Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T03:29:31.039583Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2511.20635","last_updated":"2026-08-02T05:27:14Z","snapshot_observed_at":"2026-08-13T04:12:46.695260Z","submitted_at":"2025-11-25T18:54:16Z","title":"iMontage: Unified, Versatile, Highly Dynamic Many-to-many Image Generation","version":3},"cited_work":{"arxiv_id":"2511.20635","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2511.20635","snapshot_observed_at":"2026-08-04T02:24:10.739854Z","title":"arXiv preprint arXiv:2511.20635 , year=","venue":null,"work_id":"3b377496-101a-45a7-b5d2-8d0740845f84","year":null},"citing_paper":{"arxiv_id":"2606.20506","last_updated":"2026-06-18T17:24:27Z","snapshot_observed_at":"2026-08-12T23:00:25.667979Z","submitted_at":"2026-06-18T17:24:27Z","title":"FreeStyle: Free Control of Style-Content Dual-Reference Generation from Community LoRA Mining","version":1},"reference_index":99,"source":"arxiv_source","source_observed_at":"2026-06-26T17:59:00.685869Z"},"links":{"cited_paper":"/paper/2511.20635","citing_paper":"/paper/2606.20506"},"observation_digest":"sha256:87956879340ec95f3ee4a49ff2d71e705fdbbbeeae48824b0ac3ef1362a5403c","observation_id":"4777e389-dbf3-463b-8163-6f5f9b762b5d","resolution":{"observed_at":"2026-08-04T02:24:10.739854Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.20635","last_updated":"2026-08-02T05:27:14Z","snapshot_observed_at":"2026-08-13T04:12:46.695260Z","submitted_at":"2025-11-25T18:54:16Z","title":"iMontage: Unified, Versatile, Highly Dynamic Many-to-many Image Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.20635","snapshot_observed_at":"2026-08-10T19:08:49.594504Z","title":"arXiv preprint arXiv:2511.20635 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06878","last_updated":"2026-08-07T07:05:25Z","snapshot_observed_at":"2026-08-13T04:13:31.692294Z","submitted_at":"2026-08-07T07:05:25Z","title":"ControlRef: Efficient Layout-Guided Multi-Instance Generation via Anchored 4D-RoPE","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-10T19:08:49.594504Z"},"links":{"cited_paper":"/paper/2511.20635","citing_paper":"/paper/2608.06878"},"observation_digest":"sha256:d1fe4ecfee0235c3e0097eefe8ff1a8bc43e8323b63d79d3ac4df37cb03cd46c","observation_id":"ab42dc16-8c92-4fa1-8467-e2109f11d4cf","resolution":{"observed_at":"2026-08-10T19:08:49.594504Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2511.20635/citation-record","integrity":"/paper/2511.20635/integrity","json":"/paper/2511.20635/citation-record.json","paper":"/paper/2511.20635"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-08-12T17:29:41.806995Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-04T06:47:02.521174Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.20635","last_updated":"2026-08-02T05:27:14Z","snapshot_observed_at":"2026-08-13T04:12:46.695260Z","submitted_at":"2025-11-25T18:54:16Z","title":"iMontage: Unified, Versatile, Highly Dynamic Many-to-many Image Generation","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-04T06:47:02.521174Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2511.20635"},"observation_digest":"sha256:394225e360f1e722066aaf320e7be7b759ca676187def450735d7fcdb891a2f6","observation_id":"dbb1bb02-68da-4bb9-bb5b-81dc0779e639","resolution":{"observed_at":"2026-08-04T06:47:02.521174Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T06:47:02.678126Z","title":"Lumiere: A space-time diffu- sion model for video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.20635","last_updated":"2026-08-02T05:27:14Z","snapshot_observed_at":"2026-08-13T04:12:46.695260Z","submitted_at":"2025-11-25T18:54:16Z","title":"iMontage: Unified, Versatile, Highly Dynamic Many-to-many Image Generation","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-04T06:47:02.678126Z"},"links":{"citing_paper":"/paper/2511.20635"},"observation_digest":"sha256:a8aa1f6416d0d7103d10a7b94045d6e8fe6b39c560a4fb1ced47bbc6a0f47c0a","observation_id":"544374ec-8a64-4add-937d-82fbd5e53e5a","resolution":{"observed_at":"2026-08-04T06:47:02.678126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T06:47:02.818809Z","title":"Seedream4.0, 2025.https : / / seed","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.20635","last_updated":"2026-08-02T05:27:14Z","snapshot_observed_at":"2026-08-13T04:12:46.695260Z","submitted_at":"2025-11-25T18:54:16Z","title":"iMontage: Unified, Versatile, Highly Dynamic Many-to-many Image Generation","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-04T06:47:02.818809Z"},"links":{"citing_paper":"/paper/2511.20635"},"observation_digest":"sha256:8ebfd600a3a87534c6120adad03cb98e95782f13a18247112c247afd6905fac3","observation_id":"b7242dd7-d25f-4d0a-b8aa-827df50abd9d","resolution":{"observed_at":"2026-08-04T06:47:02.818809Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22705","last_updated":"2025-05-28T17:59:15Z","snapshot_observed_at":"2026-07-30T00:45:52.058972Z","submitted_at":"2025-05-28T17:59:15Z","title":"HiDream-I1: A High-Efficient Image Generative Foundation Model with Sparse Diffusion Transformer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.22705","snapshot_observed_at":"2026-08-04T06:47:02.976356Z","title":"Hidream-i1: A high-efficient image gen- erative foundation model with sparse diffusion transformer","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.20635","last_updated":"2026-08-02T05:27:14Z","snapshot_observed_at":"2026-08-13T04:12:46.695260Z","submitted_at":"2025-11-25T18:54:16Z","title":"iMontage: Unified, Versatile, Highly Dynamic Many-to-many Image Generation","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-04T06:47:02.976356Z"},"links":{"cited_paper":"/paper/2505.22705","citing_paper":"/paper/2511.20635"},"observation_digest":"sha256:c2b5812a067fa3ee9ba2380c3af37ea7ee5fa1dc183fecce5b01c89256330462","observation_id":"ea4bcddd-a7e2-4cf2-a067-1ae53cde2aba","resolution":{"observed_at":"2026-08-04T06:47:02.976356Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T06:47:03.114478Z","title":"Openpose: Realtime multi-person 2d pose estimation using part affinity fields.IEEE transactions on pattern analysis and machine intelligence, 43(1):172–186,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.20635","last_updated":"2026-08-02T05:27:14Z","snapshot_observed_at":"2026-08-13T04:12:46.695260Z","submitted_at":"2025-11-25T18:54:16Z","title":"iMontage: Unified, Versatile, Highly Dynamic Many-to-many Image Generation","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-04T06:47:03.114478Z"},"links":{"citing_paper":"/paper/2511.20635"},"observation_digest":"sha256:b509cea85408bf801cd0fad95e6a6c7a1a66b4902d3d457dd23414f20c2cbdd1","observation_id":"ae6c611a-2f56-484a-845c-83de3644cc8c","resolution":{"observed_at":"2026-08-04T06:47:03.114478Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T06:47:03.233924Z","title":"Emerg- ing properties in self-supervised vision transformers","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2511.20635","last_updated":"2026-08-02T05:27:14Z","snapshot_observed_at":"2026-08-13T04:12:46.695260Z","submitted_at":"2025-11-25T18:54:16Z","title":"iMontage: Unified, Versatile, Highly Dynamic Many-to-many Image Generation","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-04T06:47:03.233924Z"},"links":{"citing_paper":"/paper/2511.20635"},"observation_digest":"sha256:16b6375eb247d9fc370cceeab511b86f02c75bc04109a60d8380868cb66b64e8","observation_id":"834da371-fb5d-422e-a978-70b69116f43e","resolution":{"observed_at":"2026-08-04T06:47:03.233924Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00426","last_updated":"2023-12-29T16:42:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-30T16:18:00Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.00426","snapshot_observed_at":"2026-08-04T06:47:03.411590Z","title":"Pixart: Fast training of diffusion transformer for photorealistic text-to-image synthesis.arXiv preprint arXiv:2310.00426, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2511.20635","last_updated":"2026-08-02T05:27:14Z","snapshot_observed_at":"2026-08-13T04:12:46.695260Z","submitted_at":"2025-11-25T18:54:16Z","title":"iMontage: Unified, Versatile, Highly Dynamic Many-to-many Image Generation","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-04T06:47:03.411590Z"},"links":{"cited_paper":"/paper/2310.00426","citing_paper":"/paper/2511.20635"},"observation_digest":"sha256:56f03b89ebe90010c7a5299cee7a7815ada87f31a1de3af2ed10077e2ed2e0b0","observation_id":"c0df67fd-3efc-4aad-b2af-120ea6c208c9","resolution":{"observed_at":"2026-08-04T06:47:03.411590Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.01103","last_updated":"2025-06-01T17:58:36Z","snapshot_observed_at":"2026-08-07T11:48:19.621062Z","submitted_at":"2025-06-01T17:58:36Z","title":"DeepVerse: 4D Autoregressive Video Generation as a World Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.01103","snapshot_observed_at":"2026-08-04T06:47:03.534918Z","title":"Deepverse: 4d autoregres- sive video generation as a world model.arXiv preprint arXiv:2506.01103, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.20635","last_updated":"2026-08-02T05:27:14Z","snapshot_observed_at":"2026-08-13T04:12:46.695260Z","submitted_at":"2025-11-25T18:54:16Z","title":"iMontage: Unified, Versatile, Highly Dynamic Many-to-many Image Generation","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-04T06:47:03.534918Z"},"links":{"cited_paper":"/paper/2506.01103","citing_paper":"/paper/2511.20635"},"observation_digest":"sha256:4d6a90ef28dc2a4931e2c4fccd3dec87ed3d771eda1fdf524c537d3398638275","observation_id":"233482c9-4fb8-49e6-96f0-7c51ef73cc7e","resolution":{"observed_at":"2026-08-04T06:47:03.534918Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T06:47:03.642270Z","title":"Univid: Unifying vi- sion tasks with pre-trained video generation models.arXiv preprint arXiv:2509.21760, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.20635","last_updated":"2026-08-02T05:27:14Z","snapshot_observed_at":"2026-08-13T04:12:46.695260Z","submitted_at":"2025-11-25T18:54:16Z","title":"iMontage: Unified, Versatile, Highly Dynamic Many-to-many Image Generation","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-04T06:47:03.642270Z"},"links":{"citing_paper":"/paper/2511.20635"},"observation_digest":"sha256:777e3bb822183491508ac6ed6a3fce06b010632efe62b826c903ca661430ae62","observation_id":"cfca67ec-e377-438a-b390-a5741ff25a3e","resolution":{"observed_at":"2026-08-04T06:47:03.642270Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T06:47:03.758730Z","title":"Unireal: Universal image generation and editing via learning real-world dynamics","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.20635","last_updated":"2026-08-02T05:27:14Z","snapshot_observed_at":"2026-08-13T04:12:46.695260Z","submitted_at":"2025-11-25T18:54:16Z","title":"iMontage: Unified, Versatile, Highly Dynamic Many-to-many Image Generation","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-04T06:47:03.758730Z"},"links":{"citing_paper":"/paper/2511.20635"},"observation_digest":"sha256:cdede532909f94fc7597cfe18246528263dfd63f83b181fd7930337021233270","observation_id":"5e545dbb-c9a7-4593-90bb-e0a3eb1220c8","resolution":{"observed_at":"2026-08-04T06:47:03.758730Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.06818","last_updated":"2025-09-08T15:54:55Z","snapshot_observed_at":"2026-08-12T23:25:36.464524Z","submitted_at":"2025-09-08T15:54:55Z","title":"UMO: Scaling Multi-Identity Consistency for Image Customization via Matching Reward","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.06818","snapshot_observed_at":"2026-08-04T06:47:03.874746Z","title":"Umo: Scaling multi-identity consistency for image customization via matching reward.arXiv preprint arXiv:2509.06818, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.20635","last_updated":"2026-08-02T05:27:14Z","snapshot_observed_at":"2026-08-13T04:12:46.695260Z","submitted_at":"2025-11-25T18:54:16Z","title":"iMontage: Unified, Versatile, Highly Dynamic Many-to-many Image Generation","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-04T06:47:03.874746Z"},"links":{"cited_paper":"/paper/2509.06818","citing_paper":"/paper/2511.20635"},"observation_digest":"sha256:ed37717465700d35fc12997f0f24afbe75c455792fddafead79f23f4aab36445","observation_id":"c491ff43-79cd-40bf-9599-455153a9b709","resolution":{"observed_at":"2026-08-04T06:47:03.874746Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T06:47:04.050275Z","title":"Gemini2.5, 2025.https : / / deepmind.google/models/gemini/pro/","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.20635","last_updated":"2026-08-02T05:27:14Z","snapshot_observed_at":"2026-08-13T04:12:46.695260Z","submitted_at":"2025-11-25T18:54:16Z","title":"iMontage: Unified, Versatile, Highly Dynamic Many-to-many Image Generation","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-04T06:47:04.050275Z"},"links":{"citing_paper":"/paper/2511.20635"},"observation_digest":"sha256:b5f752b63bbb172765d2a5f68b7ae053cb221c58e205bb1c5939dc2ffe1f0e88","observation_id":"89ebe157-906e-4531-b344-3e903c4f4837","resolution":{"observed_at":"2026-08-04T06:47:04.050275Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T06:47:04.195649Z","title":"Veo3, 2025.https://deepmind","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.20635","last_updated":"2026-08-02T05:27:14Z","snapshot_observed_at":"2026-08-13T04:12:46.695260Z","submitted_at":"2025-11-25T18:54:16Z","title":"iMontage: Unified, Versatile, Highly Dynamic Many-to-many Image Generation","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-04T06:47:04.195649Z"},"links":{"citing_paper":"/paper/2511.20635"},"observation_digest":"sha256:91b20962b5c0513e59d0db1e6d2c536f38f7673b56475e3da9b4fc4a253dd6a6","observation_id":"df3f48df-8c46-4420-98f2-1f9dad40af31","resolution":{"observed_at":"2026-08-04T06:47:04.195649Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14683","last_updated":"2025-07-27T11:45:16Z","snapshot_observed_at":"2026-08-11T10:16:40.394612Z","submitted_at":"2025-05-20T17:59:30Z","title":"Emerging Properties in Unified Multimodal Pretraining","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.14683","snapshot_observed_at":"2026-08-04T06:47:04.340696Z","title":"Emerging properties in unified multimodal pretraining.arXiv preprint arXiv:2505.14683, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.20635","last_updated":"2026-08-02T05:27:14Z","snapshot_observed_at":"2026-08-13T04:12:46.695260Z","submitted_at":"2025-11-25T18:54:16Z","title":"iMontage: Unified, Versatile, Highly Dynamic Many-to-many Image Generation","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-04T06:47:04.340696Z"},"links":{"cited_paper":"/paper/2505.14683","citing_paper":"/paper/2511.20635"},"observation_digest":"sha256:a8c5aaa96e5e3e1b47768c9e1fd725b4f193faea076dbe7a297a59992f96a338","observation_id":"7fd60b4b-f7a4-4183-8bde-3ab79de1b739","resolution":{"observed_at":"2026-08-04T06:47:04.340696Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T06:47:04.500990Z","title":"Yolov8-face-detection, 2024.https : //huggingface.co/arnabdhar/YOLOv8- Face- Detection","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.20635","last_updated":"2026-08-02T05:27:14Z","snapshot_observed_at":"2026-08-13T04:12:46.695260Z","submitted_at":"2025-11-25T18:54:16Z","title":"iMontage: Unified, Versatile, Highly Dynamic Many-to-many Image Generation","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-04T06:47:04.500990Z"},"links":{"citing_paper":"/paper/2511.20635"},"observation_digest":"sha256:72a5a8fd9a01c94cc23a08f8946f7981f55b0f3b68d1747f500ca8134cc6f57d","observation_id":"5634c617-34c3-446f-8757-adcaa3ce3a45","resolution":{"observed_at":"2026-08-04T06:47:04.500990Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T06:47:04.674385Z","title":"Scaling recti- fied flow transformers for high-resolution image synthesis","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.20635","last_updated":"2026-08-02T05:27:14Z","snapshot_observed_at":"2026-08-13T04:12:46.695260Z","submitted_at":"2025-11-25T18:54:16Z","title":"iMontage: Unified, Versatile, Highly Dynamic Many-to-many Image Generation","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-04T06:47:04.674385Z"},"links":{"citing_paper":"/paper/2511.20635"},"observation_digest":"sha256:886afcd677f196e047855396b991467dcb384b8261650ce8b87cef27396a3a5f","observation_id":"153b526b-2c38-4feb-ae71-57b7ed1e5f13","resolution":{"observed_at":"2026-08-04T06:47:04.674385Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.12652","last_updated":"2025-04-22T18:52:05Z","snapshot_observed_at":"2026-08-07T17:00:09.152276Z","submitted_at":"2025-03-16T21:11:25Z","title":"UniVG: A Generalist Diffusion Model for Unified Image Generation and Editing","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.12652","snapshot_observed_at":"2026-08-04T06:47:04.847612Z","title":"Univg: A generalist diffusion model for unified image generation and editing.arXiv preprint arXiv:2503.12652, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.20635","last_updated":"2026-08-02T05:27:14Z","snapshot_observed_at":"2026-08-13T04:12:46.695260Z","submitted_at":"2025-11-25T18:54:16Z","title":"iMontage: Unified, Versatile, Highly Dynamic Many-to-many Image Generation","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-04T06:47:04.847612Z"},"links":{"cited_paper":"/paper/2503.12652","citing_paper":"/paper/2511.20635"},"observation_digest":"sha256:c6b4047341345bb2ed87bbfd2f0331a17fb66259d86672c9e6c7527c05d43b02","observation_id":"dfb39ff3-0d2e-4d03-bc8a-581c4b679924","resolution":{"observed_at":"2026-08-04T06:47:04.847612Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.05945","last_updated":"2024-06-13T11:13:39Z","snapshot_observed_at":"2026-08-13T00:10:49.002216Z","submitted_at":"2024-05-09T17:35:16Z","title":"Lumina-T2X: Transforming Text into Any Modality, Resolution, and Duration via Flow-based Large Diffusion Transformers","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.05945","snapshot_observed_at":"2026-08-04T06:47:04.960072Z","title":"Lumina-t2x: Transforming text into any modality, resolution, and duration via flow-based large diffu- sion transformers.arXiv preprint arXiv:2405.05945, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.20635","last_updated":"2026-08-02T05:27:14Z","snapshot_observed_at":"2026-08-13T04:12:46.695260Z","submitted_at":"2025-11-25T18:54:16Z","title":"iMontage: Unified, Versatile, Highly Dynamic Many-to-many Image Generation","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-04T06:47:04.960072Z"},"links":{"cited_paper":"/paper/2405.05945","citing_paper":"/paper/2511.20635"},"observation_digest":"sha256:85784f756ddbe34acdc9f0521b6d6e02861ff4d97a9f6209df4db6586b043d26","observation_id":"e22bf4ad-90c0-485e-9b86-15ba0e62355b","resolution":{"observed_at":"2026-08-04T06:47:04.960072Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.01430","last_updated":"2024-12-02T12:10:04Z","snapshot_observed_at":"2026-08-12T04:21:17.073040Z","submitted_at":"2024-12-02T12:10:04Z","title":"MVImgNet2.0: A Larger-scale Dataset of Multi-view Images","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.01430","snapshot_observed_at":"2026-08-04T06:47:05.055172Z","title":"Mvimgnet2","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.20635","last_updated":"2026-08-02T05:27:14Z","snapshot_observed_at":"2026-08-13T04:12:46.695260Z","submitted_at":"2025-11-25T18:54:16Z","title":"iMontage: Unified, Versatile, Highly Dynamic Many-to-many Image Generation","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-04T06:47:05.055172Z"},"links":{"cited_paper":"/paper/2412.01430","citing_paper":"/paper/2511.20635"},"observation_digest":"sha256:9ea32f4fc62eaac383cfa22db9f6156fb714fd0c13420760eb30f02b0e46017f","observation_id":"db6a5d71-0ece-4bd4-b225-0255de6e02e2","resolution":{"observed_at":"2026-08-04T06:47:05.055172Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T06:47:05.221223Z","title":"Hidream-e1-1, 2025.https : / / huggingface.co/HiDream-ai/HiDream-E1-1","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.20635","last_updated":"2026-08-02T05:27:14Z","snapshot_observed_at":"2026-08-13T04:12:46.695260Z","submitted_at":"2025-11-25T18:54:16Z","title":"iMontage: Unified, Versatile, Highly Dynamic Many-to-many Image Generation","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-04T06:47:05.221223Z"},"links":{"citing_paper":"/paper/2511.20635"},"observation_digest":"sha256:553d4381186580bd120b9ad75221db5067710891365baf9e3571fa0cea7fef22","observation_id":"6d27e716-eb2b-4890-9a26-5a76ad0398d6","resolution":{"observed_at":"2026-08-04T06:47:05.221223Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T06:47:05.359216Z","title":"Vbench: Comprehensive bench- mark suite for video generative models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.20635","last_updated":"2026-08-02T05:27:14Z","snapshot_observed_at":"2026-08-13T04:12:46.695260Z","submitted_at":"2025-11-25T18:54:16Z","title":"iMontage: Unified, Versatile, Highly Dynamic Many-to-many Image Generation","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-04T06:47:05.359216Z"},"links":{"citing_paper":"/paper/2511.20635"},"observation_digest":"sha256:6aa51564e817de173e8035b4da4253890a1357fe3bfd307e016b1fd44538a159","observation_id":"ea1c90d0-21d7-435b-a5b1-5b0a465c8a75","resolution":{"observed_at":"2026-08-04T06:47:05.359216Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T06:47:05.516200Z","title":"Controlnet auxiliary models.https : //github.com/huggingface/controlnet_aux? tab=readme-ov-file, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2511.20635","last_updated":"2026-08-02T05:27:14Z","snapshot_observed_at":"2026-08-13T04:12:46.695260Z","submitted_at":"2025-11-25T18:54:16Z","title":"iMontage: Unified, Versatile, Highly Dynamic Many-to-many Image Generation","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-04T06:47:05.516200Z"},"links":{"citing_paper":"/paper/2511.20635"},"observation_digest":"sha256:13bf903956ce4d6aac8f93c509fba2662b476df3a84a37b82f285b70fe0e4ca7","observation_id":"a3a24969-3acf-4f36-a1bb-19263558f5e7","resolution":{"observed_at":"2026-08-04T06:47:05.516200Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.16418","last_updated":"2025-07-29T01:42:34Z","snapshot_observed_at":"2026-08-07T16:48:21.587377Z","submitted_at":"2025-03-20T17:59:34Z","title":"InfiniteYou: Flexible Photo Recrafting While Preserving Your Identity","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.16418","snapshot_observed_at":"2026-08-04T06:47:05.660498Z","title":"Infiniteyou: Flexible photo recrafting while preserving your identity.arXiv preprint arXiv:2503.16418,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.20635","last_updated":"2026-08-02T05:27:14Z","snapshot_observed_at":"2026-08-13T04:12:46.695260Z","submitted_at":"2025-11-25T18:54:16Z","title":"iMontage: Unified, Versatile, Highly Dynamic Many-to-many Image Generation","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-04T06:47:05.660498Z"},"links":{"cited_paper":"/paper/2503.16418","citing_paper":"/paper/2511.20635"},"observation_digest":"sha256:0a7fab77834c6b2f001d33acb3f3175ccbd8b8a07d79386ef93c84c23b2e929c","observation_id":"86bf3562-4b8f-4605-a262-6c5acb8e9d04","resolution":{"observed_at":"2026-08-04T06:47:05.660498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03603","snapshot_observed_at":"2026-08-04T06:47:05.784126Z","title":"Hunyuanvideo: A systematic framework for large video generative models.arXiv preprint arXiv:2412.03603, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.20635","last_updated":"2026-08-02T05:27:14Z","snapshot_observed_at":"2026-08-13T04:12:46.695260Z","submitted_at":"2025-11-25T18:54:16Z","title":"iMontage: Unified, Versatile, Highly Dynamic Many-to-many Image Generation","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-04T06:47:05.784126Z"},"links":{"cited_paper":"/paper/2412.03603","citing_paper":"/paper/2511.20635"},"observation_digest":"sha256:ae93ead49e34bbbde51f1e34937bfa168939f6c4297554ecfcfa892773b3b453","observation_id":"bef57812-93d2-4e07-a8cf-e4998f49a69b","resolution":{"observed_at":"2026-08-04T06:47:05.784126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22647","last_updated":"2025-05-28T17:57:06Z","snapshot_observed_at":"2026-08-07T20:49:17.257002Z","submitted_at":"2025-05-28T17:57:06Z","title":"Let Them Talk: Audio-Driven Multi-Person Conversational Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.22647","snapshot_observed_at":"2026-08-04T06:47:05.973725Z","title":"Let them talk: Audio-driven multi-person conversa- tional video generation.arXiv preprint arXiv:2505.22647,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.20635","last_updated":"2026-08-02T05:27:14Z","snapshot_observed_at":"2026-08-13T04:12:46.695260Z","submitted_at":"2025-11-25T18:54:16Z","title":"iMontage: Unified, Versatile, Highly Dynamic Many-to-many Image Generation","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-04T06:47:05.973725Z"},"links":{"cited_paper":"/paper/2505.22647","citing_paper":"/paper/2511.20635"},"observation_digest":"sha256:2cd61004dba0a8f7da7d3402383acd9ee28e649e7451d4615fe2005184b3b0e9","observation_id":"8a4458db-a56d-4c30-b58b-9acbacd29f39","resolution":{"observed_at":"2026-08-04T06:47:05.973725Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T06:47:06.138680Z","title":"Flux.1 [dev], 2024.https : / / huggingface","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.20635","last_updated":"2026-08-02T05:27:14Z","snapshot_observed_at":"2026-08-13T04:12:46.695260Z","submitted_at":"2025-11-25T18:54:16Z","title":"iMontage: Unified, Versatile, Highly Dynamic Many-to-many Image Generation","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-04T06:47:06.138680Z"},"links":{"citing_paper":"/paper/2511.20635"},"observation_digest":"sha256:4b1389622ee3889e537071b037bbff4918157178b58aeb5c6ed7d0f0eef24b29","observation_id":"f1a681b0-f1e2-47e3-b7b9-5cbdfc014ca0","resolution":{"observed_at":"2026-08-04T06:47:06.138680Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T06:47:06.255830Z","title":"Clip-based nsfw detector, 2021.https : //github.com/LAION- AI/CLIP- based- NSFW- Detector","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2511.20635","last_updated":"2026-08-02T05:27:14Z","snapshot_observed_at":"2026-08-13T04:12:46.695260Z","submitted_at":"2025-11-25T18:54:16Z","title":"iMontage: Unified, Versatile, Highly Dynamic Many-to-many Image Generation","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-04T06:47:06.255830Z"},"links":{"citing_paper":"/paper/2511.20635"},"observation_digest":"sha256:df318a656656fc78303d8134163b8f9e84c59494c138b15a884383b313abbf1a","observation_id":"939b3a07-c8b7-4aae-8688-1cee7bee5837","resolution":{"observed_at":"2026-08-04T06:47:06.255830Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.13388","last_updated":"2024-06-06T13:25:09Z","snapshot_observed_at":"2026-08-13T04:35:38.055358Z","submitted_at":"2024-01-24T11:36:44Z","title":"UNIMO-G: Unified Image Generation through Multimodal Conditional Diffusion","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.13388","snapshot_observed_at":"2026-08-04T06:47:06.384931Z","title":"Unimo- g: Unified image generation through multimodal conditional diffusion.arXiv preprint arXiv:2401.13388, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.20635","last_updated":"2026-08-02T05:27:14Z","snapshot_observed_at":"2026-08-13T04:12:46.695260Z","submitted_at":"2025-11-25T18:54:16Z","title":"iMontage: Unified, Versatile, Highly Dynamic Many-to-many Image Generation","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-04T06:47:06.384931Z"},"links":{"cited_paper":"/paper/2401.13388","citing_paper":"/paper/2511.20635"},"observation_digest":"sha256:5c747f26434836256d33ef14590ba3a1644f9371957d350a64806808366d0704","observation_id":"8f7a22fb-330f-43cb-8124-2416e21e5e00","resolution":{"observed_at":"2026-08-04T06:47:06.384931Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03147","last_updated":"2025-06-18T18:00:05Z","snapshot_observed_at":"2026-08-12T23:49:38.644434Z","submitted_at":"2025-06-03T17:59:33Z","title":"UniWorld-V1: High-Resolution Semantic Encoders for Unified Visual Understanding and Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.03147","snapshot_observed_at":"2026-08-04T06:47:06.552623Z","title":"Uniworld: High-resolution semantic en- coders for unified visual understanding and generation.arXiv preprint arXiv:2506.03147, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.20635","last_updated":"2026-08-02T05:27:14Z","snapshot_observed_at":"2026-08-13T04:12:46.695260Z","submitted_at":"2025-11-25T18:54:16Z","title":"iMontage: Unified, Versatile, Highly Dynamic Many-to-many Image Generation","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-04T06:47:06.552623Z"},"links":{"cited_paper":"/paper/2506.03147","citing_paper":"/paper/2511.20635"},"observation_digest":"sha256:28236fa60855b890ca9a7f9589ab739c31ff08e9011af8dc006535b590409cdb","observation_id":"cdf09944-1623-4c3a-8eec-a6edbe2ab54f","resolution":{"observed_at":"2026-08-04T06:47:06.552623Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10406","last_updated":"2025-07-20T08:44:35Z","snapshot_observed_at":"2026-08-07T17:06:58.996059Z","submitted_at":"2025-03-13T14:31:52Z","title":"RealGeneral: Unifying Visual Generation via Temporal In-Context Learning with Video Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.10406","snapshot_observed_at":"2026-08-04T06:47:06.699287Z","title":"Realgeneral: Unifying visual generation via tempo- ral in-context learning with video models.arXiv preprint arXiv:2503.10406, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.20635","last_updated":"2026-08-02T05:27:14Z","snapshot_observed_at":"2026-08-13T04:12:46.695260Z","submitted_at":"2025-11-25T18:54:16Z","title":"iMontage: Unified, Versatile, Highly Dynamic Many-to-many Image Generation","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-04T06:47:06.699287Z"},"links":{"cited_paper":"/paper/2503.10406","citing_paper":"/paper/2511.20635"},"observation_digest":"sha256:902824c52be4c0d479a4ba86e695514e5a0d5dec9fe996b03f9daa244bb4df5c","observation_id":"f62f80e7-74cf-4f58-b552-a6f1ad172d51","resolution":{"observed_at":"2026-08-04T06:47:06.699287Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02747","last_updated":"2023-02-08T15:46:05Z","snapshot_observed_at":"2026-08-02T18:24:58.914589Z","submitted_at":"2022-10-06T08:32:20Z","title":"Flow Matching for Generative Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.02747","snapshot_observed_at":"2026-08-04T06:47:06.821286Z","title":"Flow matching for generative mod- eling.arXiv preprint arXiv:2210.02747, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2511.20635","last_updated":"2026-08-02T05:27:14Z","snapshot_observed_at":"2026-08-13T04:12:46.695260Z","submitted_at":"2025-11-25T18:54:16Z","title":"iMontage: Unified, Versatile, Highly Dynamic Many-to-many Image Generation","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-04T06:47:06.821286Z"},"links":{"cited_paper":"/paper/2210.02747","citing_paper":"/paper/2511.20635"},"observation_digest":"sha256:5628b5cbe74c94546c0c6475db8f1a54b571ae006b9f2b28b37af8dfb870d7c1","observation_id":"579d9b89-804f-43d1-9098-27a306c19693","resolution":{"observed_at":"2026-08-04T06:47:06.821286Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T06:47:06.925885Z","title":"Audioldm 2: Learning holistic audio gen- eration with self-supervised pretraining.IEEE/ACM Trans- actions on Audio, Speech, and Language Processing, 32: 2871–2883, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.20635","last_updated":"2026-08-02T05:27:14Z","snapshot_observed_at":"2026-08-13T04:12:46.695260Z","submitted_at":"2025-11-25T18:54:16Z","title":"iMontage: Unified, Versatile, Highly Dynamic Many-to-many Image Generation","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-04T06:47:06.925885Z"},"links":{"citing_paper":"/paper/2511.20635"},"observation_digest":"sha256:b84844720810498b4177cba745715b6fbbcba27bb5e235c3c881c3f784648591","observation_id":"54d1c0b1-7c25-4dab-bbe8-624cb88cfcf7","resolution":{"observed_at":"2026-08-04T06:47:06.925885Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.17761","last_updated":"2025-07-31T05:05:45Z","snapshot_observed_at":"2026-07-06T21:14:24.007428Z","submitted_at":"2025-04-24T17:25:12Z","title":"Step1X-Edit: A Practical Framework for General Image Editing","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.17761","snapshot_observed_at":"2026-08-04T06:47:07.058673Z","title":"Step1x-edit: A practical framework for general image editing.arXiv preprint arXiv:2504.17761, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.20635","last_updated":"2026-08-02T05:27:14Z","snapshot_observed_at":"2026-08-13T04:12:46.695260Z","submitted_at":"2025-11-25T18:54:16Z","title":"iMontage: Unified, Versatile, Highly Dynamic Many-to-many Image Generation","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-04T06:47:07.058673Z"},"links":{"cited_paper":"/paper/2504.17761","citing_paper":"/paper/2511.20635"},"observation_digest":"sha256:957e0b65a778651ab72d20f6dbfb527901b4794d940e52f5c40e9e73fd59f773","observation_id":"f5fc3315-0aef-4440-8444-b48a322f6ca7","resolution":{"observed_at":"2026-08-04T06:47:07.058673Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T06:47:07.182018Z","title":"Univid: The open-source unified video model.arXiv preprint arXiv:2509.24200, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.20635","last_updated":"2026-08-02T05:27:14Z","snapshot_observed_at":"2026-08-13T04:12:46.695260Z","submitted_at":"2025-11-25T18:54:16Z","title":"iMontage: Unified, Versatile, Highly Dynamic Many-to-many Image Generation","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-04T06:47:07.182018Z"},"links":{"citing_paper":"/paper/2511.20635"},"observation_digest":"sha256:f5f42be055a94513311f66f669272c3c10703748b8c19cf71fbf458bbb154482","observation_id":"a3ef9fcc-9480-4d6b-be50-8857081a835a","resolution":{"observed_at":"2026-08-04T06:47:07.182018Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.02487","last_updated":"2025-01-15T13:07:56Z","snapshot_observed_at":"2026-08-10T22:09:22.084462Z","submitted_at":"2025-01-05T09:40:58Z","title":"ACE++: Instruction-Based Image Creation and Editing via Context-Aware Content Filling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.02487","snapshot_observed_at":"2026-08-04T06:47:07.337393Z","title":"Ace++: Instruction- based image creation and editing via context-aware content filling.arXiv preprint arXiv:2501.02487, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.20635","last_updated":"2026-08-02T05:27:14Z","snapshot_observed_at":"2026-08-13T04:12:46.695260Z","submitted_at":"2025-11-25T18:54:16Z","title":"iMontage: Unified, Versatile, Highly Dynamic Many-to-many Image Generation","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-04T06:47:07.337393Z"},"links":{"cited_paper":"/paper/2501.02487","citing_paper":"/paper/2511.20635"},"observation_digest":"sha256:4997738a75b372cf91d68cc3fdeb168d588b6f9864227b7ecb906a2aec9fd6d3","observation_id":"f1b6c4e2-b526-4fb1-9e77-3f7c237e4e89","resolution":{"observed_at":"2026-08-04T06:47:07.337393Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T06:47:07.445105Z","title":"Gpt4o, 2024.https://www.openai.com/","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.20635","last_updated":"2026-08-02T05:27:14Z","snapshot_observed_at":"2026-08-13T04:12:46.695260Z","submitted_at":"2025-11-25T18:54:16Z","title":"iMontage: Unified, Versatile, Highly Dynamic Many-to-many Image Generation","version":3},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-04T06:47:07.445105Z"},"links":{"citing_paper":"/paper/2511.20635"},"observation_digest":"sha256:b44eb3f02239fe5a9ef9cb62a7766236031872e9c3156d928f040f128b1ec274","observation_id":"4341b93e-1ebc-4738-a333-ef7647fefc4c","resolution":{"observed_at":"2026-08-04T06:47:07.445105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T06:47:07.542754Z","title":"Sora2, 2025.https://openai.com/index/ sora-2/","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.20635","last_updated":"2026-08-02T05:27:14Z","snapshot_observed_at":"2026-08-13T04:12:46.695260Z","submitted_at":"2025-11-25T18:54:16Z","title":"iMontage: Unified, Versatile, Highly Dynamic Many-to-many Image Generation","version":3},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-04T06:47:07.542754Z"},"links":{"citing_paper":"/paper/2511.20635"},"observation_digest":"sha256:1a7c1f99fedcf9a7b60357423871e150376cdb442e67dd2fd06cd4a0fc3ada79","observation_id":"b6e49269-494e-484e-bba9-2dae4769ec21","resolution":{"observed_at":"2026-08-04T06:47:07.542754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T06:47:07.647770Z","title":"Scalable diffusion models with transformers","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.20635","last_updated":"2026-08-02T05:27:14Z","snapshot_observed_at":"2026-08-13T04:12:46.695260Z","submitted_at":"2025-11-25T18:54:16Z","title":"iMontage: Unified, Versatile, Highly Dynamic Many-to-many Image Generation","version":3},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-04T06:47:07.647770Z"},"links":{"citing_paper":"/paper/2511.20635"},"observation_digest":"sha256:f799243939b5a3c2272d2875f9c2f673692e2e4eb7d90225af19d6b70a77dc22","observation_id":"2c0b917d-e397-4cc1-94d9-9a5cfe995558","resolution":{"observed_at":"2026-08-04T06:47:07.647770Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.01952","last_updated":"2023-07-04T23:04:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-04T23:04:57Z","title":"SDXL: Improving Latent Diffusion Models for High-Resolution Image Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.01952","snapshot_observed_at":"2026-08-04T06:47:07.767318Z","title":"Sdxl: Improving latent diffusion mod- els for high-resolution image synthesis.arXiv preprint arXiv:2307.01952, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2511.20635","last_updated":"2026-08-02T05:27:14Z","snapshot_observed_at":"2026-08-13T04:12:46.695260Z","submitted_at":"2025-11-25T18:54:16Z","title":"iMontage: Unified, Versatile, Highly Dynamic Many-to-many Image Generation","version":3},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-04T06:47:07.767318Z"},"links":{"cited_paper":"/paper/2307.01952","citing_paper":"/paper/2511.20635"},"observation_digest":"sha256:344a370954cd5b721f93a506982697630d4b5a1eede4fb9d14b469742ec89194","observation_id":"b05af249-c56d-429f-816d-d6f449bae16d","resolution":{"observed_at":"2026-08-04T06:47:07.767318Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21758","last_updated":"2025-03-27T17:57:07Z","snapshot_observed_at":"2026-08-07T16:59:27.482089Z","submitted_at":"2025-03-27T17:57:07Z","title":"Lumina-Image 2.0: A Unified and Efficient Image Generative Framework","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.21758","snapshot_observed_at":"2026-08-04T06:47:07.873473Z","title":"Lumina- image 2.0: A unified and efficient image generative frame- work.arXiv preprint arXiv:2503.21758, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.20635","last_updated":"2026-08-02T05:27:14Z","snapshot_observed_at":"2026-08-13T04:12:46.695260Z","submitted_at":"2025-11-25T18:54:16Z","title":"iMontage: Unified, Versatile, Highly Dynamic Many-to-many Image Generation","version":3},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-04T06:47:07.873473Z"},"links":{"cited_paper":"/paper/2503.21758","citing_paper":"/paper/2511.20635"},"observation_digest":"sha256:58c3c024740f4e875817fa4a9f8a5bb3dfb5a4ea60d4ef15d970c4cdbc0bdf80","observation_id":"edb03314-eab6-4b4d-bcdb-be41978b3855","resolution":{"observed_at":"2026-08-04T06:47:07.873473Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T06:47:08.020620Z","title":"Learning transferable visual models from natural language supervi- sion","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2511.20635","last_updated":"2026-08-02T05:27:14Z","snapshot_observed_at":"2026-08-13T04:12:46.695260Z","submitted_at":"2025-11-25T18:54:16Z","title":"iMontage: Unified, Versatile, Highly Dynamic Many-to-many Image Generation","version":3},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-04T06:47:08.020620Z"},"links":{"citing_paper":"/paper/2511.20635"},"observation_digest":"sha256:9813ce372a91c0d536fb64e110a09308d0941050c042ed549e3a0d3fb4069850","observation_id":"03b10944-c7ca-4d04-8723-9cd6e51ff104","resolution":{"observed_at":"2026-08-04T06:47:08.020620Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T06:47:08.151908Z","title":"Make-a-story: Visual memory conditioned consistent story generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2511.20635","last_updated":"2026-08-02T05:27:14Z","snapshot_observed_at":"2026-08-13T04:12:46.695260Z","submitted_at":"2025-11-25T18:54:16Z","title":"iMontage: Unified, Versatile, Highly Dynamic Many-to-many Image Generation","version":3},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-04T06:47:08.151908Z"},"links":{"citing_paper":"/paper/2511.20635"},"observation_digest":"sha256:ff4403bcdef6f57b49143bc1032c0f9a70abecbf4679ca56e1db254b2f3de482","observation_id":"82d39e5b-8256-4159-9f93-d2df42ef8617","resolution":{"observed_at":"2026-08-04T06:47:08.151908Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.14159","last_updated":"2024-01-25T13:12:09Z","snapshot_observed_at":"2026-07-06T17:20:25.138890Z","submitted_at":"2024-01-25T13:12:09Z","title":"Grounded SAM: Assembling Open-World Models for Diverse Visual Tasks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.14159","snapshot_observed_at":"2026-08-04T06:47:08.251845Z","title":"Grounded sam: Assembling open-world models for diverse visual tasks.arXiv preprint arXiv:2401.14159,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.20635","last_updated":"2026-08-02T05:27:14Z","snapshot_observed_at":"2026-08-13T04:12:46.695260Z","submitted_at":"2025-11-25T18:54:16Z","title":"iMontage: Unified, Versatile, Highly Dynamic Many-to-many Image Generation","version":3},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-04T06:47:08.251845Z"},"links":{"cited_paper":"/paper/2401.14159","citing_paper":"/paper/2511.20635"},"observation_digest":"sha256:449e88f8c1f8934a7478f451b7b8be1f994d3cb9aeb40347e202b33ea7eabd83","observation_id":"855b24d5-0b9e-4d05-91fe-08f815e53b20","resolution":{"observed_at":"2026-08-04T06:47:08.251845Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T06:47:08.346628Z","title":"High-resolution image synthesis with latent diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2511.20635","last_updated":"2026-08-02T05:27:14Z","snapshot_observed_at":"2026-08-13T04:12:46.695260Z","submitted_at":"2025-11-25T18:54:16Z","title":"iMontage: Unified, Versatile, Highly Dynamic Many-to-many Image Generation","version":3},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-04T06:47:08.346628Z"},"links":{"citing_paper":"/paper/2511.20635"},"observation_digest":"sha256:c51719e4e7aed9f84c3bc41361dac4238584242a1b35903f7d17d2a59bc9e265","observation_id":"9f78cc0b-b93a-4168-b640-1ab405708b96","resolution":{"observed_at":"2026-08-04T06:47:08.346628Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T06:47:08.450256Z","title":"Pathways on the image manifold: Image editing via video generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.20635","last_updated":"2026-08-02T05:27:14Z","snapshot_observed_at":"2026-08-13T04:12:46.695260Z","submitted_at":"2025-11-25T18:54:16Z","title":"iMontage: Unified, Versatile, Highly Dynamic Many-to-many Image Generation","version":3},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-04T06:47:08.450256Z"},"links":{"citing_paper":"/paper/2511.20635"},"observation_digest":"sha256:207c0b1fd657902b3b3031231dd13daca634def7aa3debd228a4f242792fdc5c","observation_id":"aabc1dd7-94e0-4512-a15f-e3f5e0fb6295","resolution":{"observed_at":"2026-08-04T06:47:08.450256Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T06:47:08.559024Z","title":"Photorealistic text-to-image diffusion models with deep language understanding.Advances in neural information processing systems, 35:36479–36494, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2511.20635","last_updated":"2026-08-02T05:27:14Z","snapshot_observed_at":"2026-08-13T04:12:46.695260Z","submitted_at":"2025-11-25T18:54:16Z","title":"iMontage: Unified, Versatile, Highly Dynamic Many-to-many Image Generation","version":3},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-04T06:47:08.559024Z"},"links":{"citing_paper":"/paper/2511.20635"},"observation_digest":"sha256:60280e72c62360bc47e21f2875b136736e522fcc1122b52f2b8e74bce69bedea","observation_id":"11b55f3f-1f22-4257-9fcc-85987052d015","resolution":{"observed_at":"2026-08-04T06:47:08.559024Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.16930","last_updated":"2025-08-23T07:30:18Z","snapshot_observed_at":"2026-08-09T16:55:24.799888Z","submitted_at":"2025-08-23T07:30:18Z","title":"HunyuanVideo-Foley: Multimodal Diffusion with Representation Alignment for High-Fidelity Foley Audio Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.16930","snapshot_observed_at":"2026-08-04T06:47:08.625247Z","title":"Hunyuanvideo- foley: Multimodal diffusion with representation alignment for high-fidelity foley audio generation.arXiv preprint arXiv:2508.16930, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.20635","last_updated":"2026-08-02T05:27:14Z","snapshot_observed_at":"2026-08-13T04:12:46.695260Z","submitted_at":"2025-11-25T18:54:16Z","title":"iMontage: Unified, Versatile, Highly Dynamic Many-to-many Image Generation","version":3},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-04T06:47:08.625247Z"},"links":{"cited_paper":"/paper/2508.16930","citing_paper":"/paper/2511.20635"},"observation_digest":"sha256:2191dfdaf6752417208dd5825c9ff43873a903257924cb9b3f23a9935233f656","observation_id":"120f5d7d-03a0-429f-8f58-2eeb5103adaf","resolution":{"observed_at":"2026-08-04T06:47:08.625247Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.18945","last_updated":"2025-07-28T15:42:31Z","snapshot_observed_at":"2026-08-07T16:40:26.916364Z","submitted_at":"2025-03-24T17:59:51Z","title":"Aether: Geometric-Aware Unified World Modeling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.18945","snapshot_observed_at":"2026-08-04T06:47:08.711461Z","title":"Aether: Geometric-aware unified world modeling.arXiv preprint arXiv:2503.18945,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.20635","last_updated":"2026-08-02T05:27:14Z","snapshot_observed_at":"2026-08-13T04:12:46.695260Z","submitted_at":"2025-11-25T18:54:16Z","title":"iMontage: Unified, Versatile, Highly Dynamic Many-to-many Image Generation","version":3},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-04T06:47:08.711461Z"},"links":{"cited_paper":"/paper/2503.18945","citing_paper":"/paper/2511.20635"},"observation_digest":"sha256:40225d8f2237e9f7039158437e246e94176eda66d43852a3e48df5090eb8c9ec","observation_id":"27d13411-0f0b-4ff9-ba90-53307b885476","resolution":{"observed_at":"2026-08-04T06:47:08.711461Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T06:47:08.797000Z","title":"Raft: Recurrent all-pairs field transforms for optical flow","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2511.20635","last_updated":"2026-08-02T05:27:14Z","snapshot_observed_at":"2026-08-13T04:12:46.695260Z","submitted_at":"2025-11-25T18:54:16Z","title":"iMontage: Unified, Versatile, Highly Dynamic Many-to-many Image Generation","version":3},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-04T06:47:08.797000Z"},"links":{"citing_paper":"/paper/2511.20635"},"observation_digest":"sha256:7cfc4101956afed8f8aeb5b13b9566dde434ddf03e842da39c6366405b3a9ed5","observation_id":"620b5149-c115-419a-9a7d-099a1b7c3c37","resolution":{"observed_at":"2026-08-04T06:47:08.797000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.15821","last_updated":"2023-12-25T22:24:49Z","snapshot_observed_at":"2026-08-13T04:54:07.077274Z","submitted_at":"2023-12-25T22:24:49Z","title":"Audiobox: Unified Audio Generation with Natural Language Prompts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.15821","snapshot_observed_at":"2026-08-04T06:47:08.922024Z","title":"Audiobox: Unified au- dio generation with natural language prompts.arXiv preprint arXiv:2312.15821, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2511.20635","last_updated":"2026-08-02T05:27:14Z","snapshot_observed_at":"2026-08-13T04:12:46.695260Z","submitted_at":"2025-11-25T18:54:16Z","title":"iMontage: Unified, Versatile, Highly Dynamic Many-to-many Image Generation","version":3},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-04T06:47:08.922024Z"},"links":{"cited_paper":"/paper/2312.15821","citing_paper":"/paper/2511.20635"},"observation_digest":"sha256:474bc108e154ee2c90b409b1bcba3cfb61ec2753127e54771dbe64fcbb62bc33","observation_id":"abe87faf-64e1-4cfe-9174-d11e04825029","resolution":{"observed_at":"2026-08-04T06:47:08.922024Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.07519","last_updated":"2024-02-02T16:15:22Z","snapshot_observed_at":"2026-08-06T23:08:20.817133Z","submitted_at":"2024-01-15T07:50:18Z","title":"InstantID: Zero-shot Identity-Preserving Generation in Seconds","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.07519","snapshot_observed_at":"2026-08-04T06:47:09.006094Z","title":"Instantid: Zero-shot identity-preserving generation in seconds.arXiv preprint arXiv:2401.07519, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.20635","last_updated":"2026-08-02T05:27:14Z","snapshot_observed_at":"2026-08-13T04:12:46.695260Z","submitted_at":"2025-11-25T18:54:16Z","title":"iMontage: Unified, Versatile, Highly Dynamic Many-to-many Image Generation","version":3},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-04T06:47:09.006094Z"},"links":{"cited_paper":"/paper/2401.07519","citing_paper":"/paper/2511.20635"},"observation_digest":"sha256:de7c1baf0eb0a8e2ade26fe0ef3a2e281f087ac0b52df5af3e810e8e03929b2b","observation_id":"98cd8732-bba7-4c19-a051-0aa3d3eae5c3","resolution":{"observed_at":"2026-08-04T06:47:09.006094Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T06:47:09.122053Z","title":"Autostory: Generating diverse storytelling images with minimal human efforts.Interna- tional Journal of Computer Vision, pages 1–22, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.20635","last_updated":"2026-08-02T05:27:14Z","snapshot_observed_at":"2026-08-13T04:12:46.695260Z","submitted_at":"2025-11-25T18:54:16Z","title":"iMontage: Unified, Versatile, Highly Dynamic Many-to-many Image Generation","version":3},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-04T06:47:09.122053Z"},"links":{"citing_paper":"/paper/2511.20635"},"observation_digest":"sha256:c70ebdda8a7d0e6262688d91b37f284da0d2eb977a8c2f64c909b8a1f47abd8a","observation_id":"b22e0ecf-34f4-4222-a246-8505d0bfe88a","resolution":{"observed_at":"2026-08-04T06:47:09.122053Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.08377","last_updated":"2026-07-03T16:46:11Z","snapshot_observed_at":"2026-08-07T16:29:46.498912Z","submitted_at":"2025-10-09T16:01:30Z","title":"UniVideo: Unified Understanding, Generation, and Editing for Videos","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.08377","snapshot_observed_at":"2026-08-04T06:47:09.213780Z","title":"Univideo: Unified understanding, generation, and editing for videos","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.20635","last_updated":"2026-08-02T05:27:14Z","snapshot_observed_at":"2026-08-13T04:12:46.695260Z","submitted_at":"2025-11-25T18:54:16Z","title":"iMontage: Unified, Versatile, Highly Dynamic Many-to-many Image Generation","version":3},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-04T06:47:09.213780Z"},"links":{"cited_paper":"/paper/2510.08377","citing_paper":"/paper/2511.20635"},"observation_digest":"sha256:fb27f5f4826f0caa2711ce342deedae2d6d7b8043a13c4d28cf694a9d3f47597","observation_id":"5b95dbdd-b7d7-40cd-8b07-15eb457e9171","resolution":{"observed_at":"2026-08-04T06:47:09.213780Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18871","last_updated":"2026-04-21T17:32:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-23T17:38:54Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.18871","snapshot_observed_at":"2026-08-04T06:47:09.354756Z","title":"Omnigen2: Exploration to advanced multimodal 10 generation.arXiv preprint arXiv:2506.18871, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.20635","last_updated":"2026-08-02T05:27:14Z","snapshot_observed_at":"2026-08-13T04:12:46.695260Z","submitted_at":"2025-11-25T18:54:16Z","title":"iMontage: Unified, Versatile, Highly Dynamic Many-to-many Image Generation","version":3},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-04T06:47:09.354756Z"},"links":{"cited_paper":"/paper/2506.18871","citing_paper":"/paper/2511.20635"},"observation_digest":"sha256:5db656154bd845f519eacf29d778d9649076955e4f1c42e501b792562e3a794a","observation_id":"fe4599e1-f29a-4df5-9c6c-ec9a0030f03f","resolution":{"observed_at":"2026-08-04T06:47:09.354756Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T06:47:09.491668Z","title":"Chronoedit: Towards temporal reason- ing for image editing and world simulation.arXiv preprint arXiv:2510.04290, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.20635","last_updated":"2026-08-02T05:27:14Z","snapshot_observed_at":"2026-08-13T04:12:46.695260Z","submitted_at":"2025-11-25T18:54:16Z","title":"iMontage: Unified, Versatile, Highly Dynamic Many-to-many Image Generation","version":3},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-04T06:47:09.491668Z"},"links":{"citing_paper":"/paper/2511.20635"},"observation_digest":"sha256:b5547942778bc8ae4197c696a8f4e9a094edfeaaa30abd261c42377c7ed13e9c","observation_id":"090f917d-1ab2-4756-9670-8ceaf496dc68","resolution":{"observed_at":"2026-08-04T06:47:09.491668Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.18966","last_updated":"2025-08-26T12:10:24Z","snapshot_observed_at":"2026-08-10T12:07:58.643256Z","submitted_at":"2025-08-26T12:10:24Z","title":"USO: Unified Style and Subject-Driven Generation via Disentangled and Reward Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.18966","snapshot_observed_at":"2026-08-04T06:47:09.609041Z","title":"Uso: Unified style and subject-driven generation via disentangled and re- ward learning.arXiv preprint arXiv:2508.18966, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.20635","last_updated":"2026-08-02T05:27:14Z","snapshot_observed_at":"2026-08-13T04:12:46.695260Z","submitted_at":"2025-11-25T18:54:16Z","title":"iMontage: Unified, Versatile, Highly Dynamic Many-to-many Image Generation","version":3},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-04T06:47:09.609041Z"},"links":{"cited_paper":"/paper/2508.18966","citing_paper":"/paper/2511.20635"},"observation_digest":"sha256:3d533359da219bbf600d94a506e469b21817ce3b751f21c9ec4061046131a9c3","observation_id":"b453d790-b836-49af-bfa6-d49d5f7e63d5","resolution":{"observed_at":"2026-08-04T06:47:09.609041Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.02160","last_updated":"2025-04-02T22:20:21Z","snapshot_observed_at":"2026-08-07T16:13:24.968703Z","submitted_at":"2025-04-02T22:20:21Z","title":"Less-to-More Generalization: Unlocking More Controllability by In-Context Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.02160","snapshot_observed_at":"2026-08-04T06:47:09.770582Z","title":"Less-to-more generalization: Unlocking more controllability by in-context generation.arXiv preprint arXiv:2504.02160, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.20635","last_updated":"2026-08-02T05:27:14Z","snapshot_observed_at":"2026-08-13T04:12:46.695260Z","submitted_at":"2025-11-25T18:54:16Z","title":"iMontage: Unified, Versatile, Highly Dynamic Many-to-many Image Generation","version":3},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-04T06:47:09.770582Z"},"links":{"cited_paper":"/paper/2504.02160","citing_paper":"/paper/2511.20635"},"observation_digest":"sha256:b044874603eb2f65c862139faaccec4129d3775ae94c7702b8ecd5e1e36e18dc","observation_id":"9ec24dd0-c196-4990-81ed-38cfda623f4c","resolution":{"observed_at":"2026-08-04T06:47:09.770582Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T06:47:09.894429Z","title":"Dreamomni: Unified image generation and editing","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.20635","last_updated":"2026-08-02T05:27:14Z","snapshot_observed_at":"2026-08-13T04:12:46.695260Z","submitted_at":"2025-11-25T18:54:16Z","title":"iMontage: Unified, Versatile, Highly Dynamic Many-to-many Image Generation","version":3},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-04T06:47:09.894429Z"},"links":{"citing_paper":"/paper/2511.20635"},"observation_digest":"sha256:2caecb21a95b8b6deefc80c4ee7bf5df33240e4eb6c8f3914b18f72823a426aa","observation_id":"27c86e6a-e60e-4684-9736-24f0fb670d28","resolution":{"observed_at":"2026-08-04T06:47:09.894429Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T06:47:10.046196Z","title":"Omnigen: Unified image genera- tion","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.20635","last_updated":"2026-08-02T05:27:14Z","snapshot_observed_at":"2026-08-13T04:12:46.695260Z","submitted_at":"2025-11-25T18:54:16Z","title":"iMontage: Unified, Versatile, Highly Dynamic Many-to-many Image Generation","version":3},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-04T06:47:10.046196Z"},"links":{"citing_paper":"/paper/2511.20635"},"observation_digest":"sha256:5a4f8d849d54b250f2b3aeddbdafc5ef37140ad1390891cc5d7c1f93d707e9a2","observation_id":"3b7a6045-e1a2-43d3-9564-57f4e992f09f","resolution":{"observed_at":"2026-08-04T06:47:10.046196Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.12528","last_updated":"2025-09-08T02:42:57Z","snapshot_observed_at":"2026-07-06T19:04:43.716629Z","submitted_at":"2024-08-22T16:32:32Z","title":"Show-o: One Single Transformer to Unify Multimodal Understanding and Generation","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.12528","snapshot_observed_at":"2026-08-04T06:47:10.169710Z","title":"Show-o: One single transformer to unify multimodal understanding and generation.arXiv preprint arXiv:2408.12528, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.20635","last_updated":"2026-08-02T05:27:14Z","snapshot_observed_at":"2026-08-13T04:12:46.695260Z","submitted_at":"2025-11-25T18:54:16Z","title":"iMontage: Unified, Versatile, Highly Dynamic Many-to-many Image Generation","version":3},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-04T06:47:10.169710Z"},"links":{"cited_paper":"/paper/2408.12528","citing_paper":"/paper/2511.20635"},"observation_digest":"sha256:a934b36e4797e73e7f4b0f2ad56df5019357af44e66ee0df13a2e94064504026","observation_id":"81d87c44-f2d2-41c6-89e0-4d9a13bd4347","resolution":{"observed_at":"2026-08-04T06:47:10.169710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.16766","last_updated":"2024-09-04T10:42:41Z","snapshot_observed_at":"2026-08-12T22:54:57.488526Z","submitted_at":"2024-08-29T17:59:30Z","title":"CSGO: Content-Style Composition in Text-to-Image Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.16766","snapshot_observed_at":"2026-08-04T06:47:10.328950Z","title":"Csgo: Content-style composition in text-to-image genera- tion.arXiv preprint arXiv:2408.16766, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.20635","last_updated":"2026-08-02T05:27:14Z","snapshot_observed_at":"2026-08-13T04:12:46.695260Z","submitted_at":"2025-11-25T18:54:16Z","title":"iMontage: Unified, Versatile, Highly Dynamic Many-to-many Image Generation","version":3},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-04T06:47:10.328950Z"},"links":{"cited_paper":"/paper/2408.16766","citing_paper":"/paper/2511.20635"},"observation_digest":"sha256:d196bcc13e4d43cb8ffed0a27a74463120f53c5b5507606d3ec9eac26ab7dbbe","observation_id":"0dfa7745-8b8d-4803-b8f7-4b5edcad2b7c","resolution":{"observed_at":"2026-08-04T06:47:10.328950Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T06:47:10.390873Z","title":"Withanyone: Towards control- lable and id consistent image generation.arXiv preprint arXiv:2510.14975, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.20635","last_updated":"2026-08-02T05:27:14Z","snapshot_observed_at":"2026-08-13T04:12:46.695260Z","submitted_at":"2025-11-25T18:54:16Z","title":"iMontage: Unified, Versatile, Highly Dynamic Many-to-many Image Generation","version":3},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-04T06:47:10.390873Z"},"links":{"citing_paper":"/paper/2511.20635"},"observation_digest":"sha256:f00cc3c7f1df501e38ceb123459152b1dabcd5f388dd0a67bd59c4ee184a4b3c","observation_id":"c16ad3f9-1e63-47d0-a882-c7d3c5f377f3","resolution":{"observed_at":"2026-08-04T06:47:10.390873Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00704","last_updated":"2024-12-10T03:17:56Z","snapshot_observed_at":"2026-08-13T05:59:53.255898Z","submitted_at":"2023-10-01T15:49:46Z","title":"UniAudio: An Audio Foundation Model Toward Universal Audio Generation","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.00704","snapshot_observed_at":"2026-08-04T06:47:10.473180Z","title":"Uniaudio: An audio founda- tion model toward universal audio generation.arXiv preprint arXiv:2310.00704, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2511.20635","last_updated":"2026-08-02T05:27:14Z","snapshot_observed_at":"2026-08-13T04:12:46.695260Z","submitted_at":"2025-11-25T18:54:16Z","title":"iMontage: Unified, Versatile, Highly Dynamic Many-to-many Image Generation","version":3},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-04T06:47:10.473180Z"},"links":{"cited_paper":"/paper/2310.00704","citing_paper":"/paper/2511.20635"},"observation_digest":"sha256:3840c63ff90142090d9d3bf605ef29cc47feab43115e6e0f8505479a5adec964","observation_id":"3fb4263e-3399-4e4f-b0ee-b933c3288000","resolution":{"observed_at":"2026-08-04T06:47:10.473180Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T06:47:10.539305Z","title":"Depth any- thing v2.Advances in Neural Information Processing Sys- tems, 37:21875–21911, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.20635","last_updated":"2026-08-02T05:27:14Z","snapshot_observed_at":"2026-08-13T04:12:46.695260Z","submitted_at":"2025-11-25T18:54:16Z","title":"iMontage: Unified, Versatile, Highly Dynamic Many-to-many Image Generation","version":3},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-04T06:47:10.539305Z"},"links":{"citing_paper":"/paper/2511.20635"},"observation_digest":"sha256:00d7a3f2ef9c260e08bd1b81f3350a8a0fb995af81ed2437f7e6d0960d57e5df","observation_id":"ed23f208-f311-426c-b74c-e7ebf9059ae4","resolution":{"observed_at":"2026-08-04T06:47:10.539305Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.06072","last_updated":"2025-03-26T08:33:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-12T11:47:11Z","title":"CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.06072","snapshot_observed_at":"2026-08-04T06:47:10.554757Z","title":"Cogvideox: Text-to-video diffusion models with an expert transformer.arXiv preprint arXiv:2408.06072, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.20635","last_updated":"2026-08-02T05:27:14Z","snapshot_observed_at":"2026-08-13T04:12:46.695260Z","submitted_at":"2025-11-25T18:54:16Z","title":"iMontage: Unified, Versatile, Highly Dynamic Many-to-many Image Generation","version":3},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-04T06:47:10.554757Z"},"links":{"cited_paper":"/paper/2408.06072","citing_paper":"/paper/2511.20635"},"observation_digest":"sha256:3e50ee4290dc37a29c4c625233279e08c65a6114ddcb5dda4b3f172d6912e8b3","observation_id":"2b5ee6e0-242a-49d6-9209-000c2d6bb892","resolution":{"observed_at":"2026-08-04T06:47:10.554757Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.06721","last_updated":"2023-08-13T08:34:51Z","snapshot_observed_at":"2026-07-06T16:05:39.158819Z","submitted_at":"2023-08-13T08:34:51Z","title":"IP-Adapter: Text Compatible Image Prompt Adapter for Text-to-Image Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.06721","snapshot_observed_at":"2026-08-04T06:47:10.638722Z","title":"Ip- adapter: Text compatible image prompt adapter for text-to- image diffusion models.arXiv preprint arXiv:2308.06721,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.20635","last_updated":"2026-08-02T05:27:14Z","snapshot_observed_at":"2026-08-13T04:12:46.695260Z","submitted_at":"2025-11-25T18:54:16Z","title":"iMontage: Unified, Versatile, Highly Dynamic Many-to-many Image Generation","version":3},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-04T06:47:10.638722Z"},"links":{"cited_paper":"/paper/2308.06721","citing_paper":"/paper/2511.20635"},"observation_digest":"sha256:cde817772787c2062145ea827e953de62f34dafe579e639cf5c18cc4990c29c4","observation_id":"34440ad9-f74a-43e0-816f-c8d31e660894","resolution":{"observed_at":"2026-08-04T06:47:10.638722Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.09987","last_updated":"2025-08-13T17:59:28Z","snapshot_observed_at":"2026-08-09T07:45:34.680113Z","submitted_at":"2025-08-13T17:59:28Z","title":"Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.09987","snapshot_observed_at":"2026-08-04T06:47:10.728416Z","title":"Echo-4o: Harnessing the power of gpt- 4o synthetic images for improved image generation.arXiv preprint arXiv:2508.09987, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.20635","last_updated":"2026-08-02T05:27:14Z","snapshot_observed_at":"2026-08-13T04:12:46.695260Z","submitted_at":"2025-11-25T18:54:16Z","title":"iMontage: Unified, Versatile, Highly Dynamic Many-to-many Image Generation","version":3},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-04T06:47:10.728416Z"},"links":{"cited_paper":"/paper/2508.09987","citing_paper":"/paper/2511.20635"},"observation_digest":"sha256:7b2009c4afe2ca2a0b3851f7e1d288dfdd01b2840f1ac3ca1caef257261dee9c","observation_id":"930cac71-df1c-4ade-85a8-a73f533250b2","resolution":{"observed_at":"2026-08-04T06:47:10.728416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20275","last_updated":"2025-05-26T17:53:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-26T17:53:33Z","title":"ImgEdit: A Unified Image Editing Dataset and Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.20275","snapshot_observed_at":"2026-08-04T06:47:10.830159Z","title":"Imgedit: A uni- fied image editing dataset and benchmark.arXiv preprint arXiv:2505.20275, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.20635","last_updated":"2026-08-02T05:27:14Z","snapshot_observed_at":"2026-08-13T04:12:46.695260Z","submitted_at":"2025-11-25T18:54:16Z","title":"iMontage: Unified, Versatile, Highly Dynamic Many-to-many Image Generation","version":3},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-04T06:47:10.830159Z"},"links":{"cited_paper":"/paper/2505.20275","citing_paper":"/paper/2511.20635"},"observation_digest":"sha256:c0c8e73ce8e51f1dbcc091efc42dea767bfa10c329ba248f49e33e7c54b1d70e","observation_id":"7a6b1941-4420-4b9d-b3fa-ea4cc57e6778","resolution":{"observed_at":"2026-08-04T06:47:10.830159Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T06:47:10.929454Z","title":"Adding conditional control to text-to-image diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2511.20635","last_updated":"2026-08-02T05:27:14Z","snapshot_observed_at":"2026-08-13T04:12:46.695260Z","submitted_at":"2025-11-25T18:54:16Z","title":"iMontage: Unified, Versatile, Highly Dynamic Many-to-many Image Generation","version":3},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-04T06:47:10.929454Z"},"links":{"citing_paper":"/paper/2511.20635"},"observation_digest":"sha256:beee27c1d088ee8360efc47a95064f8d00aab788fa25c71a465a3daa67da6d4e","observation_id":"b1f5b6d1-ed67-41a6-89ee-3564bae7afc7","resolution":{"observed_at":"2026-08-04T06:47:10.929454Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.20690","last_updated":"2025-09-23T02:34:36Z","snapshot_observed_at":"2026-08-13T04:37:50.242337Z","submitted_at":"2025-04-29T12:14:47Z","title":"In-Context Edit: Enabling Instructional Image Editing with In-Context Generation in Large Scale Diffusion Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.20690","snapshot_observed_at":"2026-08-04T06:47:11.109575Z","title":"In-context edit: Enabling instructional image editing with in- context generation in large scale diffusion transformer.arXiv preprint arXiv:2504.20690, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.20635","last_updated":"2026-08-02T05:27:14Z","snapshot_observed_at":"2026-08-13T04:12:46.695260Z","submitted_at":"2025-11-25T18:54:16Z","title":"iMontage: Unified, Versatile, Highly Dynamic Many-to-many Image Generation","version":3},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-04T06:47:11.109575Z"},"links":{"cited_paper":"/paper/2504.20690","citing_paper":"/paper/2511.20635"},"observation_digest":"sha256:26c0e1e868455e14639603e7b7c11984d208a38a301bb3b8213fe49dbc98e89c","observation_id":"4e43feea-a87f-439a-9f7a-1c4a7f78eee5","resolution":{"observed_at":"2026-08-04T06:47:11.109575Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21755","last_updated":"2025-08-20T15:49:30Z","snapshot_observed_at":"2026-08-12T17:56:21.544451Z","submitted_at":"2025-03-27T17:57:01Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.21755","snapshot_observed_at":"2026-08-04T06:47:11.222875Z","title":"Vbench-2.0: Advancing video generation benchmark suite for intrinsic faithfulness.arXiv preprint arXiv:2503.21755, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.20635","last_updated":"2026-08-02T05:27:14Z","snapshot_observed_at":"2026-08-13T04:12:46.695260Z","submitted_at":"2025-11-25T18:54:16Z","title":"iMontage: Unified, Versatile, Highly Dynamic Many-to-many Image Generation","version":3},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-04T06:47:11.222875Z"},"links":{"cited_paper":"/paper/2503.21755","citing_paper":"/paper/2511.20635"},"observation_digest":"sha256:6aecb0618756d3bde37a00464871f49e73346917ee98ecbf9fe9e208d785d2fd","observation_id":"6a715269-7317-4d48-bd85-48f9045caa8f","resolution":{"observed_at":"2026-08-04T06:47:11.222875Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.20404","last_updated":"2024-12-29T08:52:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-29T08:52:49Z","title":"Open-Sora: Democratizing Efficient Video Production for All","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.20404","snapshot_observed_at":"2026-08-04T06:47:11.394627Z","title":"Open-sora: Democratizing efficient video production for all.arXiv preprint arXiv:2412.20404, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.20635","last_updated":"2026-08-02T05:27:14Z","snapshot_observed_at":"2026-08-13T04:12:46.695260Z","submitted_at":"2025-11-25T18:54:16Z","title":"iMontage: Unified, Versatile, Highly Dynamic Many-to-many Image Generation","version":3},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-04T06:47:11.394627Z"},"links":{"cited_paper":"/paper/2412.20404","citing_paper":"/paper/2511.20635"},"observation_digest":"sha256:136aa05a5d684c36ab342a4eba1b790912f720144b8262314010ca5efd268808","observation_id":"e17bd8a3-7b86-4592-ab72-e872ba646a3d","resolution":{"observed_at":"2026-08-04T06:47:11.394627Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T06:47:11.584253Z","title":"Storydiffusion: Consistent self- attention for long-range image and video generation.Ad- vances in Neural Information Processing Systems, 37: 110315–110340, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.20635","last_updated":"2026-08-02T05:27:14Z","snapshot_observed_at":"2026-08-13T04:12:46.695260Z","submitted_at":"2025-11-25T18:54:16Z","title":"iMontage: Unified, Versatile, Highly Dynamic Many-to-many Image Generation","version":3},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-04T06:47:11.584253Z"},"links":{"citing_paper":"/paper/2511.20635"},"observation_digest":"sha256:447857845c243439fb6782498efeac72f142e86e5aa7bf59e660187fddea589d","observation_id":"07bda8c2-5a14-440b-92ee-f4e36c3c7e56","resolution":{"observed_at":"2026-08-04T06:47:11.584253Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T06:47:11.754908Z","title":"In pre- training stage, we start with more video clip data and less image editing data, then gradually counting more image editing data for better instruction following capability","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.20635","last_updated":"2026-08-02T05:27:14Z","snapshot_observed_at":"2026-08-13T04:12:46.695260Z","submitted_at":"2025-11-25T18:54:16Z","title":"iMontage: Unified, Versatile, Highly Dynamic Many-to-many Image Generation","version":3},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-04T06:47:11.754908Z"},"links":{"citing_paper":"/paper/2511.20635"},"observation_digest":"sha256:624c8442ee3bb701bf12c4dd1dd4b3e43b8c2c7b6b9c65c1d844218c523358ee","observation_id":"ca84c11a-e5f1-4be1-b78e-5c0caa3d8f09","resolution":{"observed_at":"2026-08-04T06:47:11.754908Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T06:47:11.930219Z","title":"Please find our image editing results in Fig","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.20635","last_updated":"2026-08-02T05:27:14Z","snapshot_observed_at":"2026-08-13T04:12:46.695260Z","submitted_at":"2025-11-25T18:54:16Z","title":"iMontage: Unified, Versatile, Highly Dynamic Many-to-many Image Generation","version":3},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-04T06:47:11.930219Z"},"links":{"citing_paper":"/paper/2511.20635"},"observation_digest":"sha256:0addbcfdbfe2a51e989bf5c72c391b457d825aa7ee3f909abd5f0a13b2480f47","observation_id":"8b79f121-43a9-444a-84bd-23a83d6a3c5c","resolution":{"observed_at":"2026-08-04T06:47:11.930219Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T06:47:12.052977Z","title":"Storyboard Generation Evaluation For a comprehensive evaluation on our many-to-many set- ting, we choose storyboard generation to report numerical metrics","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.20635","last_updated":"2026-08-02T05:27:14Z","snapshot_observed_at":"2026-08-13T04:12:46.695260Z","submitted_at":"2025-11-25T18:54:16Z","title":"iMontage: Unified, Versatile, Highly Dynamic Many-to-many Image Generation","version":3},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-04T06:47:12.052977Z"},"links":{"citing_paper":"/paper/2511.20635"},"observation_digest":"sha256:a559730eff62efa8c850b31cc2352ec2f7911656f99111729f3b0d2515e68342","observation_id":"0133ca88-3140-498a-b29e-eade5444e621","resolution":{"observed_at":"2026-08-04T06:47:12.052977Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T06:47:12.160381Z","title":"vi- sual sentences,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.20635","last_updated":"2026-08-02T05:27:14Z","snapshot_observed_at":"2026-08-13T04:12:46.695260Z","submitted_at":"2025-11-25T18:54:16Z","title":"iMontage: Unified, Versatile, Highly Dynamic Many-to-many Image Generation","version":3},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-04T06:47:12.160381Z"},"links":{"citing_paper":"/paper/2511.20635"},"observation_digest":"sha256:ddba2bb15a3d60ea222634f24b54b1750508f81f65689b891f8c760711c6580a","observation_id":"72300f1b-3abf-465a-9cf1-e0b7f802ec3d","resolution":{"observed_at":"2026-08-04T06:47:12.160381Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2511.20635","last_updated":"2026-08-02T05:27:14Z","latest_version":3,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-13T04:12:46.695260Z","submitted_at":"2025-11-25T18:54:16Z","title":"iMontage: Unified, Versatile, Highly Dynamic Many-to-many Image Generation"},"reference_resolution":{"displayed":77,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":77,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":77},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 77 of 77 outbound references and 2 inbound Pith citation observations for arXiv:2511.20635."}