{"as_of":"2026-08-14T18:21:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:7a18abefc97d57f04eb264760fafd0fda4bbb1dfa2695c4df5f01819d5d36d03","coverage":[{"denominator":81,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":81,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T22:05:33.961490Z","state":"measured"},{"denominator":91,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":91,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":10,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":10,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T12:40:43.078627Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-02T08:26:47.756395Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.03859","last_updated":"2025-08-06T16:10:06Z","snapshot_observed_at":"2026-08-14T02:28:13.930087Z","submitted_at":"2024-12-05T04:09:47Z","title":"CreatiLayout: Siamese Multimodal Diffusion Transformer for Creative Layout-to-Image Generation","version":3},"cited_work":{"arxiv_id":"2412.03859","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.03859","snapshot_observed_at":"2026-07-02T08:26:47.756395Z","title":"Creatilayout: Siamese multimodal diffusion transformer for creative layout-to-image generation","venue":null,"work_id":"466097fd-703b-42fc-9c6f-b5cfcca0df46","year":2024},"citing_paper":{"arxiv_id":"2503.12605","last_updated":"2025-03-23T13:47:43Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-16T18:39:13Z","title":"Multimodal Chain-of-Thought Reasoning: A Comprehensive Survey","version":2},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-05-15T17:18:52.996467Z"},"links":{"cited_paper":"/paper/2412.03859","citing_paper":"/paper/2503.12605"},"observation_digest":"sha256:1780f77ac4796903db736cfa394cc4b1dc188efe2e6fd7c06baefb28d1bf91fa","observation_id":"ac8abb00-9e24-45e4-9d47-8739112168cd","resolution":{"observed_at":"2026-05-15T17:18:53.739050Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03859","last_updated":"2025-08-06T16:10:06Z","snapshot_observed_at":"2026-08-14T02:28:13.930087Z","submitted_at":"2024-12-05T04:09:47Z","title":"CreatiLayout: Siamese Multimodal Diffusion Transformer for Creative Layout-to-Image Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03859","snapshot_observed_at":"2026-08-07T12:40:43.078627Z","title":"Creatilayout: Siamese multimodal diffusion transformer for creative layout-to-image generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24086","last_updated":"2025-05-30T00:13:36Z","snapshot_observed_at":"2026-08-13T23:12:12.846413Z","submitted_at":"2025-05-30T00:13:36Z","title":"ComposeAnything: Composite Object Priors for Text-to-Image Generation","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T12:40:43.078627Z"},"links":{"cited_paper":"/paper/2412.03859","citing_paper":"/paper/2505.24086"},"observation_digest":"sha256:451ba1248a93ecaa75303c58b8e2cd713cf1109b638b77b724338e379c677cf7","observation_id":"089b1b99-3426-4303-bf25-1d647def6bff","resolution":{"observed_at":"2026-08-07T12:40:43.078627Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03859","last_updated":"2025-08-06T16:10:06Z","snapshot_observed_at":"2026-08-14T02:28:13.930087Z","submitted_at":"2024-12-05T04:09:47Z","title":"CreatiLayout: Siamese Multimodal Diffusion Transformer for Creative Layout-to-Image Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03859","snapshot_observed_at":"2026-08-06T19:59:29.010130Z","title":"Creatilayout: Siamese multimodal diffusion transformer for creative layout-to-image generation.arXiv preprintarXiv:2412.03859, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.04218","last_updated":"2025-07-06T03:06:45Z","snapshot_observed_at":"2026-08-14T00:47:18.914829Z","submitted_at":"2025-07-06T03:06:45Z","title":"DreamPoster: A Unified Framework for Image-Conditioned Generative Poster Design","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T19:59:29.010130Z"},"links":{"cited_paper":"/paper/2412.03859","citing_paper":"/paper/2507.04218"},"observation_digest":"sha256:252dd7979826926a55e7a563366078e791bb36eac286a03bccb8420a088d3480","observation_id":"92ca400d-5d62-4101-a4f9-5de2536ec658","resolution":{"observed_at":"2026-08-06T19:59:29.010130Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03859","last_updated":"2025-08-06T16:10:06Z","snapshot_observed_at":"2026-08-14T02:28:13.930087Z","submitted_at":"2024-12-05T04:09:47Z","title":"CreatiLayout: Siamese Multimodal Diffusion Transformer for Creative Layout-to-Image Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03859","snapshot_observed_at":"2026-08-04T16:43:53.304734Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.12046","last_updated":"2026-07-04T12:10:43Z","snapshot_observed_at":"2026-08-13T13:57:34.064755Z","submitted_at":"2025-09-15T15:27:29Z","title":"Layout-Conditioned Autoregressive Text-to-Image Generation via Structured Masking","version":3},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-04T16:43:53.304734Z"},"links":{"cited_paper":"/paper/2412.03859","citing_paper":"/paper/2509.12046"},"observation_digest":"sha256:ce7d9837eccb46e044ac66dcdc1aaccdf9d3456481ec518a5f4f64231d2b654b","observation_id":"980fec80-ed73-4571-a9b3-f7c778860428","resolution":{"observed_at":"2026-08-04T16:43:53.304734Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03859","last_updated":"2025-08-06T16:10:06Z","snapshot_observed_at":"2026-08-14T02:28:13.930087Z","submitted_at":"2024-12-05T04:09:47Z","title":"CreatiLayout: Siamese Multimodal Diffusion Transformer for Creative Layout-to-Image Generation","version":3},"cited_work":{"arxiv_id":"2412.03859","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.03859","snapshot_observed_at":"2026-07-02T08:26:47.756395Z","title":"Creatilayout: Siamese multimodal diffusion transformer for creative layout-to-image generation","venue":null,"work_id":"466097fd-703b-42fc-9c6f-b5cfcca0df46","year":2024},"citing_paper":{"arxiv_id":"2604.06870","last_updated":"2026-04-08T09:32:15Z","snapshot_observed_at":"2026-07-06T22:55:15.791334Z","submitted_at":"2026-04-08T09:32:15Z","title":"RefineAnything: Multimodal Region-Specific Refinement for Perfect Local Details","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-10T19:11:43.172296Z"},"links":{"cited_paper":"/paper/2412.03859","citing_paper":"/paper/2604.06870"},"observation_digest":"sha256:790f228b4b7cf7614a6d311138b07ad7694787277423a7055f433027a8c3f0d2","observation_id":"380659ca-630c-49bb-b413-9395a8638c4c","resolution":{"observed_at":"2026-05-10T23:20:53.845509Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03859","last_updated":"2025-08-06T16:10:06Z","snapshot_observed_at":"2026-08-14T02:28:13.930087Z","submitted_at":"2024-12-05T04:09:47Z","title":"CreatiLayout: Siamese Multimodal Diffusion Transformer for Creative Layout-to-Image Generation","version":3},"cited_work":{"arxiv_id":"2412.03859","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.03859","snapshot_observed_at":"2026-07-02T08:26:47.756395Z","title":"Creatilayout: Siamese multimodal diffusion transformer for creative layout-to-image generation","venue":null,"work_id":"466097fd-703b-42fc-9c6f-b5cfcca0df46","year":2024},"citing_paper":{"arxiv_id":"2604.25358","last_updated":"2026-04-28T08:25:32Z","snapshot_observed_at":"2026-08-11T06:07:08.658090Z","submitted_at":"2026-04-28T08:25:32Z","title":"Benchmarking Layout-Guided Diffusion Models through Unified Semantic-Spatial Evaluation in Closed and Open Settings","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-07T16:58:28.380188Z"},"links":{"cited_paper":"/paper/2412.03859","citing_paper":"/paper/2604.25358"},"observation_digest":"sha256:319943edf0d1e853c8f918ab3660a47ae41b4eb8afcc7d3adbd7d92984c591a9","observation_id":"c06090a0-57d8-4db8-ae76-3157feff1802","resolution":{"observed_at":"2026-05-11T23:26:21.818643Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03859","last_updated":"2025-08-06T16:10:06Z","snapshot_observed_at":"2026-08-14T02:28:13.930087Z","submitted_at":"2024-12-05T04:09:47Z","title":"CreatiLayout: Siamese Multimodal Diffusion Transformer for Creative Layout-to-Image Generation","version":3},"cited_work":{"arxiv_id":"2412.03859","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.03859","snapshot_observed_at":"2026-07-02T08:26:47.756395Z","title":"Creatilayout: Siamese multimodal diffusion transformer for creative layout-to-image generation","venue":null,"work_id":"466097fd-703b-42fc-9c6f-b5cfcca0df46","year":2024},"citing_paper":{"arxiv_id":"2604.28185","last_updated":"2026-04-30T17:59:02Z","snapshot_observed_at":"2026-08-10T07:23:48.304270Z","submitted_at":"2026-04-30T17:59:02Z","title":"Visual Generation in the New Era: An Evolution from Atomic Mapping to Agentic World Modeling","version":1},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-05-07T06:38:04.459129Z"},"links":{"cited_paper":"/paper/2412.03859","citing_paper":"/paper/2604.28185"},"observation_digest":"sha256:f3a77f245c575f2a10981a990c4e1ecaadd88f84d53e28ece074a9b41bae44ca","observation_id":"90e92c45-3511-40f5-a257-f526b0da77af","resolution":{"observed_at":"2026-05-12T10:16:28.822243Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03859","last_updated":"2025-08-06T16:10:06Z","snapshot_observed_at":"2026-08-14T02:28:13.930087Z","submitted_at":"2024-12-05T04:09:47Z","title":"CreatiLayout: Siamese Multimodal Diffusion Transformer for Creative Layout-to-Image Generation","version":3},"cited_work":{"arxiv_id":"2412.03859","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.03859","snapshot_observed_at":"2026-07-02T08:26:47.756395Z","title":"Creatilayout: Siamese multimodal diffusion transformer for creative layout-to-image generation","venue":null,"work_id":"466097fd-703b-42fc-9c6f-b5cfcca0df46","year":2024},"citing_paper":{"arxiv_id":"2605.28615","last_updated":"2026-05-27T15:27:13Z","snapshot_observed_at":"2026-08-11T23:33:03.733557Z","submitted_at":"2026-05-27T15:27:13Z","title":"Compositional Text-to-Image Generation Via Region-aware Bimodal Direct Preference Optimization","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-06-29T13:15:24.299457Z"},"links":{"cited_paper":"/paper/2412.03859","citing_paper":"/paper/2605.28615"},"observation_digest":"sha256:57487b7fa6e2dfaa665625b2e5f44f045d786b45d6a98acb60eaef9a2cd05170","observation_id":"b2376fc3-d09e-491b-ab3d-ff9d59f8ace6","resolution":{"observed_at":"2026-06-29T13:23:28.291397Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03859","last_updated":"2025-08-06T16:10:06Z","snapshot_observed_at":"2026-08-14T02:28:13.930087Z","submitted_at":"2024-12-05T04:09:47Z","title":"CreatiLayout: Siamese Multimodal Diffusion Transformer for Creative Layout-to-Image Generation","version":3},"cited_work":{"arxiv_id":"2412.03859","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.03859","snapshot_observed_at":"2026-07-02T08:26:47.756395Z","title":"Creatilayout: Siamese multimodal diffusion transformer for creative layout-to-image generation","venue":null,"work_id":"466097fd-703b-42fc-9c6f-b5cfcca0df46","year":2024},"citing_paper":{"arxiv_id":"2606.05031","last_updated":"2026-06-03T15:58:56Z","snapshot_observed_at":"2026-08-13T09:30:06.328516Z","submitted_at":"2026-06-03T15:58:56Z","title":"MetaPoint: Unlocking Precise Spatial Control in Agentic Visual Generation","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-06-28T06:07:06.056441Z"},"links":{"cited_paper":"/paper/2412.03859","citing_paper":"/paper/2606.05031"},"observation_digest":"sha256:6364e0dac919d99a0a0228d8969be3b8bdb4398e4ff3d4895b30b5c79b6693a4","observation_id":"7d35254a-a1fc-4346-b477-e36c11b4937d","resolution":{"observed_at":"2026-07-02T08:26:47.757884Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03859","last_updated":"2025-08-06T16:10:06Z","snapshot_observed_at":"2026-08-14T02:28:13.930087Z","submitted_at":"2024-12-05T04:09:47Z","title":"CreatiLayout: Siamese Multimodal Diffusion Transformer for Creative Layout-to-Image Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03859","snapshot_observed_at":"2026-08-01T21:08:01.026456Z","title":"Creatilayout: Siamese multimodal diffusion transformer for creative layout-to-image generation.arXiv preprint arXiv:2412.03859, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.16409","last_updated":"2026-07-17T18:02:44Z","snapshot_observed_at":"2026-08-11T19:44:36.914847Z","submitted_at":"2026-07-17T18:02:44Z","title":"Think, Plan, Paint: Layout-Aware Reasoning for Controllable Image Generation in Unified Models","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-01T21:08:01.026456Z"},"links":{"cited_paper":"/paper/2412.03859","citing_paper":"/paper/2607.16409"},"observation_digest":"sha256:c1991d8c010c8ce69035dee7da6402985cd656d2f19d32e9e5fe0cb8aad50080","observation_id":"e0e5a2c1-0688-43dc-a5ca-ca7e2a97a114","resolution":{"observed_at":"2026-08-01T21:08:01.026456Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2412.03859/citation-record","integrity":"/paper/2412.03859/integrity","json":"/paper/2412.03859/citation-record.json","paper":"/paper/2412.03859"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-11T22:05:33.607999Z","title":"Gpt-4 technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.03859","last_updated":"2025-08-06T16:10:06Z","snapshot_observed_at":"2026-08-14T02:28:13.930087Z","submitted_at":"2024-12-05T04:09:47Z","title":"CreatiLayout: Siamese Multimodal Diffusion Transformer for Creative Layout-to-Image Generation","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-11T22:05:33.607999Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2412.03859"},"observation_digest":"sha256:ac49877e7d903b6be245ed10fe24ceecf66bbc17a8193fd9f7b7f2df43aef19e","observation_id":"dde7cb6b-6ca6-496c-b485-422903a65b18","resolution":{"observed_at":"2026-08-11T22:05:33.607999Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:05:33.613655Z","title":"All are worth words: A vit backbone for diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.03859","last_updated":"2025-08-06T16:10:06Z","snapshot_observed_at":"2026-08-14T02:28:13.930087Z","submitted_at":"2024-12-05T04:09:47Z","title":"CreatiLayout: Siamese Multimodal Diffusion Transformer for Creative Layout-to-Image Generation","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-11T22:05:33.613655Z"},"links":{"citing_paper":"/paper/2412.03859"},"observation_digest":"sha256:9fa1d68346083d04c93589ae9eb671d0435099a6345845fae3d1f87bdd70dddf","observation_id":"8c7eb923-77e6-4f70-8bd8-3d7057203b1b","resolution":{"observed_at":"2026-08-11T22:05:33.613655Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:05:35.374368Z","title":"Improving image generation with better captions","venue":null,"work_id":"4fa6840e-ebfc-4a02-9913-83a9b1bca3ad","year":2023},"citing_paper":{"arxiv_id":"2412.03859","last_updated":"2025-08-06T16:10:06Z","snapshot_observed_at":"2026-08-14T02:28:13.930087Z","submitted_at":"2024-12-05T04:09:47Z","title":"CreatiLayout: Siamese Multimodal Diffusion Transformer for Creative Layout-to-Image Generation","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-11T22:05:33.618856Z"},"links":{"citing_paper":"/paper/2412.03859"},"observation_digest":"sha256:6ef412a98cc423785a6e3560f0de7dfb7d2876022aef803eb8c4f2aee3bc1a3e","observation_id":"677ce3e1-9b45-42f4-b45c-793471d677c1","resolution":{"observed_at":"2026-08-11T22:05:35.378858Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:05:35.360255Z","title":"Attend-and-excite: Attention-based semantic guid- ance for text-to-image diffusion models","venue":null,"work_id":"9c47da05-6e4f-4809-85f3-59785f7ad390","year":2023},"citing_paper":{"arxiv_id":"2412.03859","last_updated":"2025-08-06T16:10:06Z","snapshot_observed_at":"2026-08-14T02:28:13.930087Z","submitted_at":"2024-12-05T04:09:47Z","title":"CreatiLayout: Siamese Multimodal Diffusion Transformer for Creative Layout-to-Image Generation","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-11T22:05:33.623795Z"},"links":{"citing_paper":"/paper/2412.03859"},"observation_digest":"sha256:529b6fb8b4d6aa755066e44a87e9ac9bd02c6451fbb6fe5f1662a1bedbd9a0b1","observation_id":"ed7e54ed-6d3f-4c73-b7e9-9a19ec7bdd5d","resolution":{"observed_at":"2026-08-11T22:05:35.365429Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:05:35.345796Z","title":"Textdiffuser-2: Unleashing the power of language models for text rendering","venue":null,"work_id":"be5b7949-1a3e-4c72-8859-8ea89effd788","year":2024},"citing_paper":{"arxiv_id":"2412.03859","last_updated":"2025-08-06T16:10:06Z","snapshot_observed_at":"2026-08-14T02:28:13.930087Z","submitted_at":"2024-12-05T04:09:47Z","title":"CreatiLayout: Siamese Multimodal Diffusion Transformer for Creative Layout-to-Image Generation","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-11T22:05:33.628329Z"},"links":{"citing_paper":"/paper/2412.03859"},"observation_digest":"sha256:5e39f89966b11998c37779774a77e5c99b80cd2e801c24af24b5742cffc2c5a9","observation_id":"9f84a8f3-c602-4eec-a369-d115eaa22c42","resolution":{"observed_at":"2026-08-11T22:05:35.350978Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:05:35.328709Z","title":"Pixart- α: Fast training of diffusion transformer for photorealistic text-to-image synthesis","venue":null,"work_id":"11f7fb4d-15bd-444d-a61d-8efb80a42b89","year":2024},"citing_paper":{"arxiv_id":"2412.03859","last_updated":"2025-08-06T16:10:06Z","snapshot_observed_at":"2026-08-14T02:28:13.930087Z","submitted_at":"2024-12-05T04:09:47Z","title":"CreatiLayout: Siamese Multimodal Diffusion Transformer for Creative Layout-to-Image Generation","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-11T22:05:33.632652Z"},"links":{"citing_paper":"/paper/2412.03859"},"observation_digest":"sha256:78b6ced3d12e8e6c42dc1c24bfc8dfa3cc4aaaacddfa36a9786f462281cabfc8","observation_id":"e67f4de6-2d24-4899-b046-64bdfff50aad","resolution":{"observed_at":"2026-08-11T22:05:35.334739Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.17126","last_updated":"2023-11-28T14:51:13Z","snapshot_observed_at":"2026-08-14T02:28:05.300904Z","submitted_at":"2023-11-28T14:51:13Z","title":"Reason out Your Layout: Evoking the Layout Master from Large Language Models for Text-to-Image Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.17126","snapshot_observed_at":"2026-08-11T22:05:33.637744Z","title":"Reason out your layout: Evoking the layout master from large lan- guage models for text-to-image synthesis","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.03859","last_updated":"2025-08-06T16:10:06Z","snapshot_observed_at":"2026-08-14T02:28:13.930087Z","submitted_at":"2024-12-05T04:09:47Z","title":"CreatiLayout: Siamese Multimodal Diffusion Transformer for Creative Layout-to-Image Generation","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T22:05:33.637744Z"},"links":{"cited_paper":"/paper/2311.17126","citing_paper":"/paper/2412.03859"},"observation_digest":"sha256:30ed6d690c150807699574666614d531737217f2f15177c300c42f97197ea45e","observation_id":"f56d5274-4670-4d52-a659-4a0762c5ca6b","resolution":{"observed_at":"2026-08-11T22:05:33.637744Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:05:35.311726Z","title":"Visual program- ming for step-by-step text-to-image generation and evaluation","venue":null,"work_id":"ba8785c2-e5e6-4656-b55e-b6954a7165ba","year":2023},"citing_paper":{"arxiv_id":"2412.03859","last_updated":"2025-08-06T16:10:06Z","snapshot_observed_at":"2026-08-14T02:28:13.930087Z","submitted_at":"2024-12-05T04:09:47Z","title":"CreatiLayout: Siamese Multimodal Diffusion Transformer for Creative Layout-to-Image Generation","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-11T22:05:33.642220Z"},"links":{"citing_paper":"/paper/2412.03859"},"observation_digest":"sha256:a93aa2fa808eb8665db261339aa39bcc187069d44063175d5f81849aa471d979","observation_id":"d242a493-9f20-4e08-b10c-97060422e4eb","resolution":{"observed_at":"2026-08-11T22:05:35.318705Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:05:35.293792Z","title":"Be yourself: Bounded attention for multi-subject text-to-image generation","venue":null,"work_id":"2a5d4363-9af7-452b-9cf2-e330591aac0b","year":2024},"citing_paper":{"arxiv_id":"2412.03859","last_updated":"2025-08-06T16:10:06Z","snapshot_observed_at":"2026-08-14T02:28:13.930087Z","submitted_at":"2024-12-05T04:09:47Z","title":"CreatiLayout: Siamese Multimodal Diffusion Transformer for Creative Layout-to-Image Generation","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-11T22:05:33.646602Z"},"links":{"citing_paper":"/paper/2412.03859"},"observation_digest":"sha256:12a649b7e7b76f65ad0471c454f6b39d3538b538f2d211c769f6de89018448f8","observation_id":"82a46ef0-b064-4648-82ab-02345ab05bbe","resolution":{"observed_at":"2026-08-11T22:05:35.298889Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-11T22:05:33.650509Z","title":"The llama 3 herd of models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.03859","last_updated":"2025-08-06T16:10:06Z","snapshot_observed_at":"2026-08-14T02:28:13.930087Z","submitted_at":"2024-12-05T04:09:47Z","title":"CreatiLayout: Siamese Multimodal Diffusion Transformer for Creative Layout-to-Image Generation","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-11T22:05:33.650509Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2412.03859"},"observation_digest":"sha256:7f27d0539f0eaa5666b656ba5c198bf964cab2fdbe0d2bd13f447936893a731f","observation_id":"ee663d83-3818-44a4-9e26-0a1118a9c889","resolution":{"observed_at":"2026-08-11T22:05:33.650509Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03206","last_updated":"2024-03-05T18:45:39Z","snapshot_observed_at":"2026-08-13T01:47:21.043519Z","submitted_at":"2024-03-05T18:45:39Z","title":"Scaling Rectified Flow Transformers for High-Resolution Image Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.03206","snapshot_observed_at":"2026-08-11T22:05:33.655435Z","title":"Scaling rectified flow trans- formers for high-resolution image synthesis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.03859","last_updated":"2025-08-06T16:10:06Z","snapshot_observed_at":"2026-08-14T02:28:13.930087Z","submitted_at":"2024-12-05T04:09:47Z","title":"CreatiLayout: Siamese Multimodal Diffusion Transformer for Creative Layout-to-Image Generation","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T22:05:33.655435Z"},"links":{"cited_paper":"/paper/2403.03206","citing_paper":"/paper/2412.03859"},"observation_digest":"sha256:86cbbad46a0abb23ed3b1bd87884d36c32f76e000230bfb22898df38391937e3","observation_id":"0978cecc-9323-4cc9-80e4-c821c3e254a0","resolution":{"observed_at":"2026-08-11T22:05:33.655435Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:05:35.275778Z","title":"Layoutgpt: Compositional visual plan- ning and generation with large language models","venue":null,"work_id":"d1359b93-46d6-43da-a6ff-8e6ca6735cc0","year":null},"citing_paper":{"arxiv_id":"2412.03859","last_updated":"2025-08-06T16:10:06Z","snapshot_observed_at":"2026-08-14T02:28:13.930087Z","submitted_at":"2024-12-05T04:09:47Z","title":"CreatiLayout: Siamese Multimodal Diffusion Transformer for Creative Layout-to-Image Generation","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-11T22:05:33.660019Z"},"links":{"citing_paper":"/paper/2412.03859"},"observation_digest":"sha256:f5897fb375d1db9f86caab3d69f59cecd66e4da45b959985e8b6b9750b7ab9fe","observation_id":"917bc8d4-2e9e-44d7-9931-24031007c25f","resolution":{"observed_at":"2026-08-11T22:05:35.281786Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:05:35.254385Z","title":"Ranni: Taming text-to-image diffusion for accurate instruction following","venue":null,"work_id":"095697b9-91ef-4859-b0bb-b00b1319f817","year":2024},"citing_paper":{"arxiv_id":"2412.03859","last_updated":"2025-08-06T16:10:06Z","snapshot_observed_at":"2026-08-14T02:28:13.930087Z","submitted_at":"2024-12-05T04:09:47Z","title":"CreatiLayout: Siamese Multimodal Diffusion Transformer for Creative Layout-to-Image Generation","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-11T22:05:33.664188Z"},"links":{"citing_paper":"/paper/2412.03859"},"observation_digest":"sha256:b4a088f409d0d1019dc8895ca9d7c8e5defb539c4aac9a1b2347caa3b10d6735","observation_id":"96d17313-8599-424a-a9c3-4a47ae00a08d","resolution":{"observed_at":"2026-08-11T22:05:35.262897Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.05945","last_updated":"2024-06-13T11:13:39Z","snapshot_observed_at":"2026-08-13T00:10:49.002216Z","submitted_at":"2024-05-09T17:35:16Z","title":"Lumina-T2X: Transforming Text into Any Modality, Resolution, and Duration via Flow-based Large Diffusion Transformers","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.05945","snapshot_observed_at":"2026-08-11T22:05:33.668005Z","title":"Lumina-t2x: Transforming text into any modality, resolu- tion, and duration via flow-based large diffusion transformers","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.03859","last_updated":"2025-08-06T16:10:06Z","snapshot_observed_at":"2026-08-14T02:28:13.930087Z","submitted_at":"2024-12-05T04:09:47Z","title":"CreatiLayout: Siamese Multimodal Diffusion Transformer for Creative Layout-to-Image Generation","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-11T22:05:33.668005Z"},"links":{"cited_paper":"/paper/2405.05945","citing_paper":"/paper/2412.03859"},"observation_digest":"sha256:bf25b4a5a1f606df029286194ab8c2fd252c8fe19060519770ce7dcc90f55d9d","observation_id":"6a0b6586-9b77-499a-b583-d36255a26bf2","resolution":{"observed_at":"2026-08-11T22:05:33.668005Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:05:35.239297Z","title":"Check locate rectify: A training- free layout calibration system for text-to-image generation","venue":null,"work_id":"3af59263-6577-46d6-ac9e-e972851d1ea0","year":2024},"citing_paper":{"arxiv_id":"2412.03859","last_updated":"2025-08-06T16:10:06Z","snapshot_observed_at":"2026-08-14T02:28:13.930087Z","submitted_at":"2024-12-05T04:09:47Z","title":"CreatiLayout: Siamese Multimodal Diffusion Transformer for Creative Layout-to-Image Generation","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-11T22:05:33.672009Z"},"links":{"citing_paper":"/paper/2412.03859"},"observation_digest":"sha256:5f2f47cbe05ad96f869c5df5d6f3279c9088ff6ff32641258997e04e7dbf710d","observation_id":"1cfe4114-b8ec-4d6f-a53e-936f75e4d4eb","resolution":{"observed_at":"2026-08-11T22:05:35.244578Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:05:35.209640Z","title":"Gemma-7b-it","venue":null,"work_id":"91d44bfe-2ead-433b-8b32-d3405bc653c6","year":2024},"citing_paper":{"arxiv_id":"2412.03859","last_updated":"2025-08-06T16:10:06Z","snapshot_observed_at":"2026-08-14T02:28:13.930087Z","submitted_at":"2024-12-05T04:09:47Z","title":"CreatiLayout: Siamese Multimodal Diffusion Transformer for Creative Layout-to-Image Generation","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-11T22:05:33.676336Z"},"links":{"citing_paper":"/paper/2412.03859"},"observation_digest":"sha256:1de748d2d86ea21f1fc7c1c71e98006e86c1fd279451cc0b6693d02188703205","observation_id":"d950db3b-7894-4755-b2d3-2502ed0ef0ba","resolution":{"observed_at":"2026-08-11T22:05:35.219104Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:05:35.187728Z","title":"Qwen-vl-chat-finetuned-dense-captioner","venue":null,"work_id":"00e08d28-0c26-49d5-999f-d2a8f6aa0d01","year":2024},"citing_paper":{"arxiv_id":"2412.03859","last_updated":"2025-08-06T16:10:06Z","snapshot_observed_at":"2026-08-14T02:28:13.930087Z","submitted_at":"2024-12-05T04:09:47Z","title":"CreatiLayout: Siamese Multimodal Diffusion Transformer for Creative Layout-to-Image Generation","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-11T22:05:33.680326Z"},"links":{"citing_paper":"/paper/2412.03859"},"observation_digest":"sha256:bd1472ffdba397e92d143e79eff2f9cda9eb31b5274f0ce9371f7d8f06f2f3eb","observation_id":"5115498c-3644-43a3-af71-7bd0b4a8d75e","resolution":{"observed_at":"2026-08-11T22:05:35.192500Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:05:35.168947Z","title":"Qwen2.5-7b-it","venue":null,"work_id":"3165a84c-2f4b-4760-b60c-7d9ace58d323","year":2024},"citing_paper":{"arxiv_id":"2412.03859","last_updated":"2025-08-06T16:10:06Z","snapshot_observed_at":"2026-08-14T02:28:13.930087Z","submitted_at":"2024-12-05T04:09:47Z","title":"CreatiLayout: Siamese Multimodal Diffusion Transformer for Creative Layout-to-Image Generation","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-11T22:05:33.684170Z"},"links":{"citing_paper":"/paper/2412.03859"},"observation_digest":"sha256:5b78235fba8cc7faacf13b43dd62514ba7f085cd46dd97627d9a415a97fa54ab","observation_id":"a96ccd68-fbfa-4327-bb67-19751e36e785","resolution":{"observed_at":"2026-08-11T22:05:35.175481Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:05:35.145603Z","title":"Layoutflow: Flow matching for layout generation","venue":null,"work_id":"31f0d751-4496-411e-ab28-d956d4a62f6f","year":2024},"citing_paper":{"arxiv_id":"2412.03859","last_updated":"2025-08-06T16:10:06Z","snapshot_observed_at":"2026-08-14T02:28:13.930087Z","submitted_at":"2024-12-05T04:09:47Z","title":"CreatiLayout: Siamese Multimodal Diffusion Transformer for Creative Layout-to-Image Generation","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-11T22:05:33.688344Z"},"links":{"citing_paper":"/paper/2412.03859"},"observation_digest":"sha256:5e1ec5fa86af64585056f2adea6afdfeedf11a2f3c4bc0dfb1838b4f7de160fc","observation_id":"dee13355-d281-402e-a115-1ff847f4bcb7","resolution":{"observed_at":"2026-08-11T22:05:35.151023Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:05:33.692142Z","title":"Gans trained by a two time-scale update rule converge to a local nash equilibrium","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.03859","last_updated":"2025-08-06T16:10:06Z","snapshot_observed_at":"2026-08-14T02:28:13.930087Z","submitted_at":"2024-12-05T04:09:47Z","title":"CreatiLayout: Siamese Multimodal Diffusion Transformer for Creative Layout-to-Image Generation","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-11T22:05:33.692142Z"},"links":{"citing_paper":"/paper/2412.03859"},"observation_digest":"sha256:b842a22b8f92a91c4c1d7f2ba917fd526f4ede498eaff58438fe6db433302d0f","observation_id":"51082934-53bc-4534-a1d4-fafe8f5ea16f","resolution":{"observed_at":"2026-08-11T22:05:33.692142Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:05:33.696264Z","title":"Denoising diffu- sion probabilistic models","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.03859","last_updated":"2025-08-06T16:10:06Z","snapshot_observed_at":"2026-08-14T02:28:13.930087Z","submitted_at":"2024-12-05T04:09:47Z","title":"CreatiLayout: Siamese Multimodal Diffusion Transformer for Creative Layout-to-Image Generation","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-11T22:05:33.696264Z"},"links":{"citing_paper":"/paper/2412.03859"},"observation_digest":"sha256:a7b6962936c9dbc3b21615ded65823e6592b353ba4c51089ff7278604d5e69f3","observation_id":"0c98c773-dca2-4065-8859-041c8e51a584","resolution":{"observed_at":"2026-08-11T22:05:33.696264Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:05:35.107524Z","title":"Interactdiffusion: Interaction control in text-to-image diffusion models","venue":null,"work_id":"99f8de59-5c6e-4218-8e5b-e23874e4c1ff","year":2024},"citing_paper":{"arxiv_id":"2412.03859","last_updated":"2025-08-06T16:10:06Z","snapshot_observed_at":"2026-08-14T02:28:13.930087Z","submitted_at":"2024-12-05T04:09:47Z","title":"CreatiLayout: Siamese Multimodal Diffusion Transformer for Creative Layout-to-Image Generation","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-11T22:05:33.699710Z"},"links":{"citing_paper":"/paper/2412.03859"},"observation_digest":"sha256:5547ecc425f0bb4e7b68d4cea35014163e998c5d37c134fc2ed6773e008f51f6","observation_id":"4523de25-1d9c-4421-acde-23eea7302b50","resolution":{"observed_at":"2026-08-11T22:05:35.115405Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:05:35.089191Z","title":"Retrieval-augmented layout trans- former for content-aware layout generation","venue":null,"work_id":"2d39290e-b7d1-4334-99fe-61fa30dafd00","year":2024},"citing_paper":{"arxiv_id":"2412.03859","last_updated":"2025-08-06T16:10:06Z","snapshot_observed_at":"2026-08-14T02:28:13.930087Z","submitted_at":"2024-12-05T04:09:47Z","title":"CreatiLayout: Siamese Multimodal Diffusion Transformer for Creative Layout-to-Image Generation","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-11T22:05:33.703860Z"},"links":{"citing_paper":"/paper/2412.03859"},"observation_digest":"sha256:716a2bdf22c795fcaac6275887746316c8004e25b242fd09ea9fb965fae2b303","observation_id":"5aa908e3-9e8e-479b-b439-37faadb1b35e","resolution":{"observed_at":"2026-08-11T22:05:35.094819Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-08-11T08:20:29.798517Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-11T22:05:33.707742Z","title":"Lora: Low-rank adaptation of large language models","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.03859","last_updated":"2025-08-06T16:10:06Z","snapshot_observed_at":"2026-08-14T02:28:13.930087Z","submitted_at":"2024-12-05T04:09:47Z","title":"CreatiLayout: Siamese Multimodal Diffusion Transformer for Creative Layout-to-Image Generation","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-11T22:05:33.707742Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2412.03859"},"observation_digest":"sha256:7e6094c27a8785bd03ca0be097cdbca52ab142fcbb331ceb5f082359eb516c8a","observation_id":"77cfa17d-416a-4a7d-96bb-26656625b847","resolution":{"observed_at":"2026-08-11T22:05:33.707742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.06395","last_updated":"2024-06-03T08:54:38Z","snapshot_observed_at":"2026-08-12T13:10:06.472493Z","submitted_at":"2024-04-09T15:36:50Z","title":"MiniCPM: Unveiling the Potential of Small Language Models with Scalable Training Strategies","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.06395","snapshot_observed_at":"2026-08-11T22:05:33.712028Z","title":"Minicpm: Unveiling the potential of small lan- guage models with scalable training strategies","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.03859","last_updated":"2025-08-06T16:10:06Z","snapshot_observed_at":"2026-08-14T02:28:13.930087Z","submitted_at":"2024-12-05T04:09:47Z","title":"CreatiLayout: Siamese Multimodal Diffusion Transformer for Creative Layout-to-Image Generation","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-11T22:05:33.712028Z"},"links":{"cited_paper":"/paper/2404.06395","citing_paper":"/paper/2412.03859"},"observation_digest":"sha256:08fcdf15688394ecb6dc1b1d823cc8aebd6666d599d88a49c91095fc3103dd58","observation_id":"f5e818b9-5861-4f14-9567-a44610a4d411","resolution":{"observed_at":"2026-08-11T22:05:33.712028Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:05:35.072679Z","title":"T2i-compbench: A comprehensive benchmark for open- world compositional text-to-image generation","venue":null,"work_id":"ea503d88-4098-4879-a385-da57ee5e50c0","year":null},"citing_paper":{"arxiv_id":"2412.03859","last_updated":"2025-08-06T16:10:06Z","snapshot_observed_at":"2026-08-14T02:28:13.930087Z","submitted_at":"2024-12-05T04:09:47Z","title":"CreatiLayout: Siamese Multimodal Diffusion Transformer for Creative Layout-to-Image Generation","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-11T22:05:33.716794Z"},"links":{"citing_paper":"/paper/2412.03859"},"observation_digest":"sha256:d3ab1ac2dc13a50c03c15fc095f9baf611f59630b6291fd511f67f475ae8241e","observation_id":"e9e63d8c-3d57-41ac-b815-1bae8f515038","resolution":{"observed_at":"2026-08-11T22:05:35.077595Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12186","last_updated":"2024-11-12T13:24:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-18T17:57:57Z","title":"Qwen2.5-Coder Technical Report","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12186","snapshot_observed_at":"2026-08-11T22:05:33.720697Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.03859","last_updated":"2025-08-06T16:10:06Z","snapshot_observed_at":"2026-08-14T02:28:13.930087Z","submitted_at":"2024-12-05T04:09:47Z","title":"CreatiLayout: Siamese Multimodal Diffusion Transformer for Creative Layout-to-Image Generation","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-11T22:05:33.720697Z"},"links":{"cited_paper":"/paper/2409.12186","citing_paper":"/paper/2412.03859"},"observation_digest":"sha256:6f3f7751dc7c37738acce6045e67ca68dba33d1dcd8539ea0bacf3f587f3604a","observation_id":"ff541deb-427e-43e2-9aff-dca559902a1a","resolution":{"observed_at":"2026-08-11T22:05:33.720697Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:05:35.057468Z","title":"Ssmg: Spatial-semantic map guided diffusion model for free-form layout-to-image generation","venue":null,"work_id":"ce33ebdd-b6d5-4d2c-a8d8-7734f0a029cc","year":2024},"citing_paper":{"arxiv_id":"2412.03859","last_updated":"2025-08-06T16:10:06Z","snapshot_observed_at":"2026-08-14T02:28:13.930087Z","submitted_at":"2024-12-05T04:09:47Z","title":"CreatiLayout: Siamese Multimodal Diffusion Transformer for Creative Layout-to-Image Generation","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-11T22:05:33.724941Z"},"links":{"citing_paper":"/paper/2412.03859"},"observation_digest":"sha256:8ccf83b6257fffb85f5f4c3966484206f3002601db4d01b704f2b955a3922f25","observation_id":"ebeef20e-1b99-46c9-831b-0433b079b4aa","resolution":{"observed_at":"2026-08-11T22:05:35.062015Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.17725","last_updated":"2024-10-23T09:55:22Z","snapshot_observed_at":"2026-08-13T01:57:27.555320Z","submitted_at":"2024-10-23T09:55:22Z","title":"YOLOv11: An Overview of the Key Architectural Enhancements","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.17725","snapshot_observed_at":"2026-08-11T22:05:33.728754Z","title":"Yolov11: An overview of the key architectural enhancements","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.03859","last_updated":"2025-08-06T16:10:06Z","snapshot_observed_at":"2026-08-14T02:28:13.930087Z","submitted_at":"2024-12-05T04:09:47Z","title":"CreatiLayout: Siamese Multimodal Diffusion Transformer for Creative Layout-to-Image Generation","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-11T22:05:33.728754Z"},"links":{"cited_paper":"/paper/2410.17725","citing_paper":"/paper/2412.03859"},"observation_digest":"sha256:267d51337ea7412ac834d80f2499a5ecd43e65cdbfa9188cac370b7cab5e5e7a","observation_id":"6ce962de-516e-40a0-989b-345aea679cab","resolution":{"observed_at":"2026-08-11T22:05:33.728754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1312.6114","last_updated":"2022-12-10T21:04:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2013-12-20T20:58:10Z","title":"Auto-Encoding Variational Bayes","version":11},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1312.6114","snapshot_observed_at":"2026-08-11T22:05:33.733418Z","title":"Auto-encoding variational bayes","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2412.03859","last_updated":"2025-08-06T16:10:06Z","snapshot_observed_at":"2026-08-14T02:28:13.930087Z","submitted_at":"2024-12-05T04:09:47Z","title":"CreatiLayout: Siamese Multimodal Diffusion Transformer for Creative Layout-to-Image Generation","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-11T22:05:33.733418Z"},"links":{"cited_paper":"/paper/1312.6114","citing_paper":"/paper/2412.03859"},"observation_digest":"sha256:a3eb6ab98780eab1c4fc6b1c557c2a35d8a616eecd5b5da3275763640bb1fff2","observation_id":"fe405240-e763-4be0-83b9-f9c7b5e1fb35","resolution":{"observed_at":"2026-08-11T22:05:33.733418Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:05:35.039895Z","title":"Segment any- thing","venue":null,"work_id":"ec109cdf-ff2b-4936-aa76-8b75b5b89c32","year":2023},"citing_paper":{"arxiv_id":"2412.03859","last_updated":"2025-08-06T16:10:06Z","snapshot_observed_at":"2026-08-14T02:28:13.930087Z","submitted_at":"2024-12-05T04:09:47Z","title":"CreatiLayout: Siamese Multimodal Diffusion Transformer for Creative Layout-to-Image Generation","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-11T22:05:33.738062Z"},"links":{"citing_paper":"/paper/2412.03859"},"observation_digest":"sha256:9056f9a5200ef792c0bc4423325a5512ea409b64bd0d685d97b0d40f889934d1","observation_id":"5593edec-d8c1-40ad-ab7e-e07140ed461a","resolution":{"observed_at":"2026-08-11T22:05:35.045145Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.01569","last_updated":"2023-11-23T17:07:58Z","snapshot_observed_at":"2026-08-13T11:50:39.438461Z","submitted_at":"2023-05-02T16:18:11Z","title":"Pick-a-Pic: An Open Dataset of User Preferences for Text-to-Image Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.01569","snapshot_observed_at":"2026-08-11T22:05:33.742011Z","title":"Pick-a-pic: An open dataset of user preferences for text-to-image generation.arXiv preprint arXiv:2305.01569, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.03859","last_updated":"2025-08-06T16:10:06Z","snapshot_observed_at":"2026-08-14T02:28:13.930087Z","submitted_at":"2024-12-05T04:09:47Z","title":"CreatiLayout: Siamese Multimodal Diffusion Transformer for Creative Layout-to-Image Generation","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-11T22:05:33.742011Z"},"links":{"cited_paper":"/paper/2305.01569","citing_paper":"/paper/2412.03859"},"observation_digest":"sha256:dba23a1ccbd69cd4ac3f519cd4f9a8aeb2e6660b7eb18e4cabf1d5b7b73069a6","observation_id":"7e29d7ed-5f3a-48b3-ac39-ee60a6b858e5","resolution":{"observed_at":"2026-08-11T22:05:33.742011Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:05:35.019376Z","title":null,"venue":null,"work_id":"664e1dee-6c0f-490e-a6b0-05099ac69dd2","year":2024},"citing_paper":{"arxiv_id":"2412.03859","last_updated":"2025-08-06T16:10:06Z","snapshot_observed_at":"2026-08-14T02:28:13.930087Z","submitted_at":"2024-12-05T04:09:47Z","title":"CreatiLayout: Siamese Multimodal Diffusion Transformer for Creative Layout-to-Image Generation","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-11T22:05:33.746292Z"},"links":{"citing_paper":"/paper/2412.03859"},"observation_digest":"sha256:8900142efd5aadf864dad02be13020dfe748b4373b6bf75562c5df3acc015b13","observation_id":"4de00f28-f2d1-437a-904e-17ca85bb337e","resolution":{"observed_at":"2026-08-11T22:05:35.025822Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:05:34.999968Z","title":"Laion-aesthetics v2","venue":null,"work_id":"f4cca496-45ee-4682-ac35-75ff81701f79","year":2022},"citing_paper":{"arxiv_id":"2412.03859","last_updated":"2025-08-06T16:10:06Z","snapshot_observed_at":"2026-08-14T02:28:13.930087Z","submitted_at":"2024-12-05T04:09:47Z","title":"CreatiLayout: Siamese Multimodal Diffusion Transformer for Creative Layout-to-Image Generation","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-11T22:05:33.750188Z"},"links":{"citing_paper":"/paper/2412.03859"},"observation_digest":"sha256:2b05ca3b28058b0968502bcd4ab7b841ffed53dec5dd908151970e42e3fbbaea","observation_id":"e0c1d53d-6763-4ae4-8cbb-ea2978498e56","resolution":{"observed_at":"2026-08-11T22:05:35.007692Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.20474","last_updated":"2024-11-01T04:33:52Z","snapshot_observed_at":"2026-08-12T22:14:22.074821Z","submitted_at":"2024-10-27T15:30:45Z","title":"GrounDiT: Grounding Diffusion Transformers via Noisy Patch Transplantation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.20474","snapshot_observed_at":"2026-08-11T22:05:33.754136Z","title":"Groundit: Grounding diffusion transformers via noisy patch transplanta- tion","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.03859","last_updated":"2025-08-06T16:10:06Z","snapshot_observed_at":"2026-08-14T02:28:13.930087Z","submitted_at":"2024-12-05T04:09:47Z","title":"CreatiLayout: Siamese Multimodal Diffusion Transformer for Creative Layout-to-Image Generation","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-11T22:05:33.754136Z"},"links":{"cited_paper":"/paper/2410.20474","citing_paper":"/paper/2412.03859"},"observation_digest":"sha256:1174797fad1852ae2b18ecd086502812f13a0fd0e14f7a4ba7b68d0bdbe419ed","observation_id":"9f399cbd-1d45-420c-8405-9e63cb2088fa","resolution":{"observed_at":"2026-08-11T22:05:33.754136Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.17245","last_updated":"2024-02-27T06:31:52Z","snapshot_observed_at":"2026-07-06T17:36:01.939242Z","submitted_at":"2024-02-27T06:31:52Z","title":"Playground v2.5: Three Insights towards Enhancing Aesthetic Quality in Text-to-Image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.17245","snapshot_observed_at":"2026-08-11T22:05:33.757962Z","title":"Playground v2","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.03859","last_updated":"2025-08-06T16:10:06Z","snapshot_observed_at":"2026-08-14T02:28:13.930087Z","submitted_at":"2024-12-05T04:09:47Z","title":"CreatiLayout: Siamese Multimodal Diffusion Transformer for Creative Layout-to-Image Generation","version":3},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-11T22:05:33.757962Z"},"links":{"cited_paper":"/paper/2402.17245","citing_paper":"/paper/2412.03859"},"observation_digest":"sha256:11b7061abb381b0d590dd61c812cc52b31ce745a34b7cd9a5540ad2f319dd503","observation_id":"4da9a0db-4be4-4185-bc8e-53d50651aa65","resolution":{"observed_at":"2026-08-11T22:05:33.757962Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:05:33.761586Z","title":"Magicmotion: Controllable video genera- tion with dense-to-sparse trajectory guidance","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2412.03859","last_updated":"2025-08-06T16:10:06Z","snapshot_observed_at":"2026-08-14T02:28:13.930087Z","submitted_at":"2024-12-05T04:09:47Z","title":"CreatiLayout: Siamese Multimodal Diffusion Transformer for Creative Layout-to-Image Generation","version":3},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-11T22:05:33.761586Z"},"links":{"citing_paper":"/paper/2412.03859"},"observation_digest":"sha256:2a240f70372202b758ae464f3556cc9b4abf93397d808f59b78ca045b714fa5f","observation_id":"a92f2f6a-18c2-45ee-9073-65986c826ef4","resolution":{"observed_at":"2026-08-11T22:05:33.761586Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1708.02862","last_updated":"2017-08-09T14:59:30Z","snapshot_observed_at":"2026-07-06T05:54:38.912241Z","submitted_at":"2017-08-09T14:59:30Z","title":"WebVision Database: Visual Learning and Understanding from Web Data","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1708.02862","snapshot_observed_at":"2026-08-11T22:05:33.765315Z","title":"Webvision database: Visual learning and under- standing from web data","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.03859","last_updated":"2025-08-06T16:10:06Z","snapshot_observed_at":"2026-08-14T02:28:13.930087Z","submitted_at":"2024-12-05T04:09:47Z","title":"CreatiLayout: Siamese Multimodal Diffusion Transformer for Creative Layout-to-Image Generation","version":3},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-11T22:05:33.765315Z"},"links":{"cited_paper":"/paper/1708.02862","citing_paper":"/paper/2412.03859"},"observation_digest":"sha256:d00781989c1be54ad6eae73d4cf5a377c08e0a27f711921aef0af7829a339a06","observation_id":"91a0041f-f01a-4d61-9f25-fd59fcf9c256","resolution":{"observed_at":"2026-08-11T22:05:33.765315Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:05:34.984989Z","title":"Gligen: Open-set grounded text-to-image generation","venue":null,"work_id":"7d7b0c8d-1094-4171-9c56-3e73d4ff0e47","year":2023},"citing_paper":{"arxiv_id":"2412.03859","last_updated":"2025-08-06T16:10:06Z","snapshot_observed_at":"2026-08-14T02:28:13.930087Z","submitted_at":"2024-12-05T04:09:47Z","title":"CreatiLayout: Siamese Multimodal Diffusion Transformer for Creative Layout-to-Image Generation","version":3},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-11T22:05:33.769068Z"},"links":{"citing_paper":"/paper/2412.03859"},"observation_digest":"sha256:e49e69152af5fd18d921a5f3976eced5e3a962e78c36892de21f7ca42cb63ece","observation_id":"673e0759-53a0-4dc1-a458-cc4905230d1a","resolution":{"observed_at":"2026-08-11T22:05:34.989702Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:05:34.972145Z","title":"Hunyuan-dit: A powerful multi- resolution diffusion transformer with fine-grained chinese understanding","venue":null,"work_id":"0cd81c65-c829-45c9-9b5d-69a6db879b3e","year":2024},"citing_paper":{"arxiv_id":"2412.03859","last_updated":"2025-08-06T16:10:06Z","snapshot_observed_at":"2026-08-14T02:28:13.930087Z","submitted_at":"2024-12-05T04:09:47Z","title":"CreatiLayout: Siamese Multimodal Diffusion Transformer for Creative Layout-to-Image Generation","version":3},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-11T22:05:33.773168Z"},"links":{"citing_paper":"/paper/2412.03859"},"observation_digest":"sha256:4b12cb33760a66cf7694d7a270ca0b6cd5eeddddd9ea446a340dbedfa6283965","observation_id":"c273de19-dd59-4a5c-81c9-e0b9d4f7d568","resolution":{"observed_at":"2026-08-11T22:05:34.977019Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:05:34.957780Z","title":"Llm- grounded diffusion: Enhancing prompt understanding of text-to-image diffusion models with large language models","venue":null,"work_id":"4c014d7c-8c31-4e4b-a7d2-4e32692f9520","year":2024},"citing_paper":{"arxiv_id":"2412.03859","last_updated":"2025-08-06T16:10:06Z","snapshot_observed_at":"2026-08-14T02:28:13.930087Z","submitted_at":"2024-12-05T04:09:47Z","title":"CreatiLayout: Siamese Multimodal Diffusion Transformer for Creative Layout-to-Image Generation","version":3},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-11T22:05:33.777267Z"},"links":{"citing_paper":"/paper/2412.03859"},"observation_digest":"sha256:ff2446b723eb1153b47474396309217675b5c95bdb14a7ab9aa00d95cae22b2c","observation_id":"6cfdf3d3-5561-4be1-91ee-2b8700674404","resolution":{"observed_at":"2026-08-11T22:05:34.963421Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:05:33.781480Z","title":"Microsoft coco: Common objects in context","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2412.03859","last_updated":"2025-08-06T16:10:06Z","snapshot_observed_at":"2026-08-14T02:28:13.930087Z","submitted_at":"2024-12-05T04:09:47Z","title":"CreatiLayout: Siamese Multimodal Diffusion Transformer for Creative Layout-to-Image Generation","version":3},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-11T22:05:33.781480Z"},"links":{"citing_paper":"/paper/2412.03859"},"observation_digest":"sha256:b7fbb0a9c004bc75e3384e27d94a293136a50057dbee2561d455e92bef782832","observation_id":"917bae66-e05d-412c-8ba3-ec6ce8b2b8cf","resolution":{"observed_at":"2026-08-11T22:05:33.781480Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.10695","last_updated":"2024-10-21T20:01:13Z","snapshot_observed_at":"2026-08-13T17:26:48.873943Z","submitted_at":"2024-09-16T19:52:24Z","title":"Playground v3: Improving Text-to-Image Alignment with Deep-Fusion Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.10695","snapshot_observed_at":"2026-08-11T22:05:33.785966Z","title":"Playground v3: Improving text-to- image alignment with deep-fusion large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.03859","last_updated":"2025-08-06T16:10:06Z","snapshot_observed_at":"2026-08-14T02:28:13.930087Z","submitted_at":"2024-12-05T04:09:47Z","title":"CreatiLayout: Siamese Multimodal Diffusion Transformer for Creative Layout-to-Image Generation","version":3},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-11T22:05:33.785966Z"},"links":{"cited_paper":"/paper/2409.10695","citing_paper":"/paper/2412.03859"},"observation_digest":"sha256:4b6279daf4446f4260860803e13258ca63f70524fd424c08940bf3c6538dc8f1","observation_id":"a114ed54-6af2-4595-9c78-ef507dfa1625","resolution":{"observed_at":"2026-08-11T22:05:33.785966Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.05499","last_updated":"2024-07-19T06:00:41Z","snapshot_observed_at":"2026-07-06T15:00:58.804337Z","submitted_at":"2023-03-09T18:52:16Z","title":"Grounding DINO: Marrying DINO with Grounded Pre-Training for Open-Set Object Detection","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.05499","snapshot_observed_at":"2026-08-11T22:05:33.790107Z","title":"Grounding dino: Marrying dino with grounded pre-training for open-set object detection","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.03859","last_updated":"2025-08-06T16:10:06Z","snapshot_observed_at":"2026-08-14T02:28:13.930087Z","submitted_at":"2024-12-05T04:09:47Z","title":"CreatiLayout: Siamese Multimodal Diffusion Transformer for Creative Layout-to-Image Generation","version":3},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-11T22:05:33.790107Z"},"links":{"cited_paper":"/paper/2303.05499","citing_paper":"/paper/2412.03859"},"observation_digest":"sha256:6a38c2f6687055fafb5bd9e2bab25552183f3cfdfc538518c2e23dedde667b44","observation_id":"43774304-a336-4d34-bf58-96fd872bfd28","resolution":{"observed_at":"2026-08-11T22:05:33.790107Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:05:34.929455Z","title":"Hico: Hierarchical controllable diffusion model for layout-to-image generation","venue":null,"work_id":"0458569b-6cfe-4e35-925f-90e90400135d","year":2025},"citing_paper":{"arxiv_id":"2412.03859","last_updated":"2025-08-06T16:10:06Z","snapshot_observed_at":"2026-08-14T02:28:13.930087Z","submitted_at":"2024-12-05T04:09:47Z","title":"CreatiLayout: Siamese Multimodal Diffusion Transformer for Creative Layout-to-Image Generation","version":3},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-11T22:05:33.794641Z"},"links":{"citing_paper":"/paper/2412.03859"},"observation_digest":"sha256:e234e3d3d24f89e8639012c8ca219369509bee02254b6ecc48ce07c42d0baad2","observation_id":"fa15e9e3-a838-40c1-b1c9-66195f7e859f","resolution":{"observed_at":"2026-08-11T22:05:34.934378Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:05:34.914755Z","title":"Llama-3.1-8b-instruct","venue":null,"work_id":"bb53d40b-e325-4d42-bba3-5cecf7842f8a","year":2024},"citing_paper":{"arxiv_id":"2412.03859","last_updated":"2025-08-06T16:10:06Z","snapshot_observed_at":"2026-08-14T02:28:13.930087Z","submitted_at":"2024-12-05T04:09:47Z","title":"CreatiLayout: Siamese Multimodal Diffusion Transformer for Creative Layout-to-Image Generation","version":3},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-11T22:05:33.798832Z"},"links":{"citing_paper":"/paper/2412.03859"},"observation_digest":"sha256:6c5de018c3f099fb5b633143a5e69396611bd3be06b0cf4544ce6c0f98e6d73a","observation_id":"1968cad9-8563-4d8a-be55-f05bc08ef31e","resolution":{"observed_at":"2026-08-11T22:05:34.920248Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:05:33.803104Z","title":"Nerf: Representing scenes as neural radiance fields for view synthe- sis","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.03859","last_updated":"2025-08-06T16:10:06Z","snapshot_observed_at":"2026-08-14T02:28:13.930087Z","submitted_at":"2024-12-05T04:09:47Z","title":"CreatiLayout: Siamese Multimodal Diffusion Transformer for Creative Layout-to-Image Generation","version":3},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-11T22:05:33.803104Z"},"links":{"citing_paper":"/paper/2412.03859"},"observation_digest":"sha256:3b63b11ebf1ed748a460cee91f65ac9ae8155be1109ea4eec56e965388dce706","observation_id":"eb20fdf2-a8b7-4011-80cf-922fb65ab373","resolution":{"observed_at":"2026-08-11T22:05:33.803104Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.08246","last_updated":"2024-05-14T00:22:06Z","snapshot_observed_at":"2026-08-13T02:52:38.024033Z","submitted_at":"2024-05-14T00:22:06Z","title":"Compositional Text-to-Image Generation with Dense Blob Representations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.08246","snapshot_observed_at":"2026-08-11T22:05:33.808311Z","title":"Compositional text-to-image generation with dense blob representations","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.03859","last_updated":"2025-08-06T16:10:06Z","snapshot_observed_at":"2026-08-14T02:28:13.930087Z","submitted_at":"2024-12-05T04:09:47Z","title":"CreatiLayout: Siamese Multimodal Diffusion Transformer for Creative Layout-to-Image Generation","version":3},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-11T22:05:33.808311Z"},"links":{"cited_paper":"/paper/2405.08246","citing_paper":"/paper/2412.03859"},"observation_digest":"sha256:58872d0687cf131e99df518ea9a83999611c903277651f52610f81c73c28be9a","observation_id":"183e40a0-0d4c-46e1-b30a-0000493de82b","resolution":{"observed_at":"2026-08-11T22:05:33.808311Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:05:34.891454Z","title":"Minicpm-v-2.6","venue":null,"work_id":"9632a980-4f72-4da4-868d-0127017af7c0","year":2024},"citing_paper":{"arxiv_id":"2412.03859","last_updated":"2025-08-06T16:10:06Z","snapshot_observed_at":"2026-08-14T02:28:13.930087Z","submitted_at":"2024-12-05T04:09:47Z","title":"CreatiLayout: Siamese Multimodal Diffusion Transformer for Creative Layout-to-Image Generation","version":3},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-11T22:05:33.812929Z"},"links":{"citing_paper":"/paper/2412.03859"},"observation_digest":"sha256:7ee0bba41f5b379ae1ca0176f4897e04aa800166ecd897935a37461927e6084f","observation_id":"7c8928a9-1c35-418d-825e-4f9e38715e10","resolution":{"observed_at":"2026-08-11T22:05:34.896324Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:05:34.876842Z","title":"Scalable diffusion models with transformers","venue":null,"work_id":"46b5777a-2798-432f-b807-407ed58a890f","year":2023},"citing_paper":{"arxiv_id":"2412.03859","last_updated":"2025-08-06T16:10:06Z","snapshot_observed_at":"2026-08-14T02:28:13.930087Z","submitted_at":"2024-12-05T04:09:47Z","title":"CreatiLayout: Siamese Multimodal Diffusion Transformer for Creative Layout-to-Image Generation","version":3},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-11T22:05:33.817454Z"},"links":{"citing_paper":"/paper/2412.03859"},"observation_digest":"sha256:67bde57d13e6b0f06298e09aad87989c7da2c3d12c9c16a28919d66d9291584a","observation_id":"5ecf1184-0071-4c1b-8cdc-598515f6b6d4","resolution":{"observed_at":"2026-08-11T22:05:34.881590Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:05:33.823023Z","title":"Grounded text-to-image synthesis with attention refocusing","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.03859","last_updated":"2025-08-06T16:10:06Z","snapshot_observed_at":"2026-08-14T02:28:13.930087Z","submitted_at":"2024-12-05T04:09:47Z","title":"CreatiLayout: Siamese Multimodal Diffusion Transformer for Creative Layout-to-Image Generation","version":3},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-11T22:05:33.823023Z"},"links":{"citing_paper":"/paper/2412.03859"},"observation_digest":"sha256:63e6ce667d85058747ff34d81a9fe92f9c144c3f7be19fab481c97afa7e255c0","observation_id":"141d6be0-9ff5-4368-9e0f-4cbc3a2698ca","resolution":{"observed_at":"2026-08-11T22:05:33.823023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:05:34.855084Z","title":"Sdxl: Improving latent diffusion models for high-resolution image synthesis","venue":null,"work_id":"85cfc337-604c-41fc-86ed-58efa1b8300a","year":2024},"citing_paper":{"arxiv_id":"2412.03859","last_updated":"2025-08-06T16:10:06Z","snapshot_observed_at":"2026-08-14T02:28:13.930087Z","submitted_at":"2024-12-05T04:09:47Z","title":"CreatiLayout: Siamese Multimodal Diffusion Transformer for Creative Layout-to-Image Generation","version":3},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-11T22:05:33.828162Z"},"links":{"citing_paper":"/paper/2412.03859"},"observation_digest":"sha256:88876390a45ecf6bd93d19aeed826613200d094dd5260de0f29ee410afda1695","observation_id":"cb58164b-b9f3-447b-bf49-f0cf1900ae76","resolution":{"observed_at":"2026-08-11T22:05:34.859874Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:05:34.839630Z","title":"Layoutllm-t2i: Eliciting layout guidance from llm for text-to-image generation","venue":null,"work_id":"1b0a1724-c3bf-437a-a19d-0adbc31face7","year":2023},"citing_paper":{"arxiv_id":"2412.03859","last_updated":"2025-08-06T16:10:06Z","snapshot_observed_at":"2026-08-14T02:28:13.930087Z","submitted_at":"2024-12-05T04:09:47Z","title":"CreatiLayout: Siamese Multimodal Diffusion Transformer for Creative Layout-to-Image Generation","version":3},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-11T22:05:33.833468Z"},"links":{"citing_paper":"/paper/2412.03859"},"observation_digest":"sha256:49335ccd0e51fb3b1ae72135b7c43cf6c1f23ea9271b1e0f95ccbc9b44170e6d","observation_id":"ce8fe400-5101-4bfa-9fc1-670791425991","resolution":{"observed_at":"2026-08-11T22:05:34.844373Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:05:34.825362Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":"c679a06f-9d96-43eb-bbe4-0afe41afc9b2","year":2021},"citing_paper":{"arxiv_id":"2412.03859","last_updated":"2025-08-06T16:10:06Z","snapshot_observed_at":"2026-08-14T02:28:13.930087Z","submitted_at":"2024-12-05T04:09:47Z","title":"CreatiLayout: Siamese Multimodal Diffusion Transformer for Creative Layout-to-Image Generation","version":3},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-11T22:05:33.839111Z"},"links":{"citing_paper":"/paper/2412.03859"},"observation_digest":"sha256:1ac4b39c42d7f7c1ac6ee8d61fc2483fd9616dae9faa545a32d5503d7c5486bf","observation_id":"18ce0ed1-09d8-4704-bbd9-3023903deb95","resolution":{"observed_at":"2026-08-11T22:05:34.830187Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:05:33.844464Z","title":"Exploring the limits of transfer learning with a unified text-to-text transformer","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.03859","last_updated":"2025-08-06T16:10:06Z","snapshot_observed_at":"2026-08-14T02:28:13.930087Z","submitted_at":"2024-12-05T04:09:47Z","title":"CreatiLayout: Siamese Multimodal Diffusion Transformer for Creative Layout-to-Image Generation","version":3},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-11T22:05:33.844464Z"},"links":{"citing_paper":"/paper/2412.03859"},"observation_digest":"sha256:02bd39d7d5aba8b13cc9b173271381a973f78a28b870fcc28c67cfb9e73f2068","observation_id":"c2163677-835d-44b3-84f6-48af9125147f","resolution":{"observed_at":"2026-08-11T22:05:33.844464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.10300","last_updated":"2024-06-01T03:35:22Z","snapshot_observed_at":"2026-08-13T00:27:10.979145Z","submitted_at":"2024-05-16T17:54:15Z","title":"Grounding DINO 1.5: Advance the \"Edge\" of Open-Set Object Detection","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.10300","snapshot_observed_at":"2026-08-11T22:05:33.848961Z","title":"Grounding dino 1.5: Advance the” edge” of open-set object detection","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.03859","last_updated":"2025-08-06T16:10:06Z","snapshot_observed_at":"2026-08-14T02:28:13.930087Z","submitted_at":"2024-12-05T04:09:47Z","title":"CreatiLayout: Siamese Multimodal Diffusion Transformer for Creative Layout-to-Image Generation","version":3},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-11T22:05:33.848961Z"},"links":{"cited_paper":"/paper/2405.10300","citing_paper":"/paper/2412.03859"},"observation_digest":"sha256:b17d7227ce7c1b0e1629ee4f0e51aef00c1a5f83b2d425f94a83eb11baea36b9","observation_id":"c71bbf37-d996-4972-ba74-bba306e8b3ad","resolution":{"observed_at":"2026-08-11T22:05:33.848961Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:05:33.853806Z","title":"High-resolution image synthesis with latent diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.03859","last_updated":"2025-08-06T16:10:06Z","snapshot_observed_at":"2026-08-14T02:28:13.930087Z","submitted_at":"2024-12-05T04:09:47Z","title":"CreatiLayout: Siamese Multimodal Diffusion Transformer for Creative Layout-to-Image Generation","version":3},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-11T22:05:33.853806Z"},"links":{"citing_paper":"/paper/2412.03859"},"observation_digest":"sha256:2a281b04a6aeb03c62cb2af0d3f537123398a147a8c001ccaadaf0b6734599ac","observation_id":"ed319180-1018-4fcb-974b-d9e7ca5b12a9","resolution":{"observed_at":"2026-08-11T22:05:33.853806Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:05:34.786773Z","title":"Pho- torealistic text-to-image diffusion models with deep language understanding","venue":null,"work_id":"88382248-4045-474c-83f3-11fcbb966ddf","year":2022},"citing_paper":{"arxiv_id":"2412.03859","last_updated":"2025-08-06T16:10:06Z","snapshot_observed_at":"2026-08-14T02:28:13.930087Z","submitted_at":"2024-12-05T04:09:47Z","title":"CreatiLayout: Siamese Multimodal Diffusion Transformer for Creative Layout-to-Image Generation","version":3},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-11T22:05:33.859052Z"},"links":{"citing_paper":"/paper/2412.03859"},"observation_digest":"sha256:556411c3512f5373ac190e5f45fcd932e261216c891f5709156e34dde6912580","observation_id":"f89ec6df-a78f-49fd-b36e-d9e7cb582568","resolution":{"observed_at":"2026-08-11T22:05:34.792154Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:05:34.769663Z","title":"Improved techniques for training gans","venue":null,"work_id":"982dc26f-e4ba-4a55-b33f-ed6028889cf4","year":2016},"citing_paper":{"arxiv_id":"2412.03859","last_updated":"2025-08-06T16:10:06Z","snapshot_observed_at":"2026-08-14T02:28:13.930087Z","submitted_at":"2024-12-05T04:09:47Z","title":"CreatiLayout: Siamese Multimodal Diffusion Transformer for Creative Layout-to-Image Generation","version":3},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-11T22:05:33.864002Z"},"links":{"citing_paper":"/paper/2412.03859"},"observation_digest":"sha256:2591f7fa85539dadf1cb52b1e894e662d4832858cfecc87f3c635b6a899be897","observation_id":"590c86bc-bd44-434b-9c13-ceec6ae60ff7","resolution":{"observed_at":"2026-08-11T22:05:34.773788Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:05:34.755132Z","title":"Laion-5b: An open large-scale dataset for training next gener- ation image-text models","venue":null,"work_id":"d34280b1-6ba0-4a17-b2a8-c5cd40e31783","year":2022},"citing_paper":{"arxiv_id":"2412.03859","last_updated":"2025-08-06T16:10:06Z","snapshot_observed_at":"2026-08-14T02:28:13.930087Z","submitted_at":"2024-12-05T04:09:47Z","title":"CreatiLayout: Siamese Multimodal Diffusion Transformer for Creative Layout-to-Image Generation","version":3},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-11T22:05:33.868297Z"},"links":{"citing_paper":"/paper/2412.03859"},"observation_digest":"sha256:22300687a25e8afa6881aa4596e7fd0ddb4aeb1e9ce0ed1ffbbe3bd7cc3c0476","observation_id":"a8809984-29d2-49d4-b8f0-8d8f1040824e","resolution":{"observed_at":"2026-08-11T22:05:34.760276Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:05:34.739318Z","title":"Noisecollage: A layout-aware text-to-image diffusion model based on noise cropping and merging","venue":null,"work_id":"15ba2db3-40fe-494a-a0a2-0da5da47fa9a","year":2024},"citing_paper":{"arxiv_id":"2412.03859","last_updated":"2025-08-06T16:10:06Z","snapshot_observed_at":"2026-08-14T02:28:13.930087Z","submitted_at":"2024-12-05T04:09:47Z","title":"CreatiLayout: Siamese Multimodal Diffusion Transformer for Creative Layout-to-Image Generation","version":3},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-11T22:05:33.872985Z"},"links":{"citing_paper":"/paper/2412.03859"},"observation_digest":"sha256:ff2099f8465c2e0ee0928d80b1a7236b334a9d222426fbb43be7d745f0a361f4","observation_id":"15356828-e118-4e34-aaf6-7d2fdff56f9d","resolution":{"observed_at":"2026-08-11T22:05:34.744123Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:05:33.877060Z","title":"Denoising diffusion implicit models","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.03859","last_updated":"2025-08-06T16:10:06Z","snapshot_observed_at":"2026-08-14T02:28:13.930087Z","submitted_at":"2024-12-05T04:09:47Z","title":"CreatiLayout: Siamese Multimodal Diffusion Transformer for Creative Layout-to-Image Generation","version":3},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-11T22:05:33.877060Z"},"links":{"citing_paper":"/paper/2412.03859"},"observation_digest":"sha256:7d558ead31ac4eb0a666cb9111f6df5d2310b999e41f2309d2b9e0311a835fb6","observation_id":"86f215b8-fd06-43dc-a8b8-f12d29134a7b","resolution":{"observed_at":"2026-08-11T22:05:33.877060Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:05:34.715647Z","title":"Stable diffusion 3.5","venue":null,"work_id":"7eb3bd3e-0db6-4d80-8896-a08cbb3759ae","year":2024},"citing_paper":{"arxiv_id":"2412.03859","last_updated":"2025-08-06T16:10:06Z","snapshot_observed_at":"2026-08-14T02:28:13.930087Z","submitted_at":"2024-12-05T04:09:47Z","title":"CreatiLayout: Siamese Multimodal Diffusion Transformer for Creative Layout-to-Image Generation","version":3},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-11T22:05:33.881055Z"},"links":{"citing_paper":"/paper/2412.03859"},"observation_digest":"sha256:596d803d54b146aa9c35b530db5fec35b22b76cc8ad72947f7e89ea57dd48d8c","observation_id":"57ab6d1c-8c72-47ab-9269-21a6900362f6","resolution":{"observed_at":"2026-08-11T22:05:34.719693Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.08295","last_updated":"2024-04-16T12:52:47Z","snapshot_observed_at":"2026-08-03T03:29:01.959523Z","submitted_at":"2024-03-13T06:59:16Z","title":"Gemma: Open Models Based on Gemini Research and Technology","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.08295","snapshot_observed_at":"2026-08-11T22:05:33.885027Z","title":"Gemma: Open models based on gemini research and technol- ogy","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.03859","last_updated":"2025-08-06T16:10:06Z","snapshot_observed_at":"2026-08-14T02:28:13.930087Z","submitted_at":"2024-12-05T04:09:47Z","title":"CreatiLayout: Siamese Multimodal Diffusion Transformer for Creative Layout-to-Image Generation","version":3},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-11T22:05:33.885027Z"},"links":{"cited_paper":"/paper/2403.08295","citing_paper":"/paper/2412.03859"},"observation_digest":"sha256:2780b7e9709b9040697a496c1b52722bb1b455d6838e2fca60a916616e2fa469","observation_id":"6fd0e363-cb66-4685-ba11-f537d274d88b","resolution":{"observed_at":"2026-08-11T22:05:33.885027Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:05:34.703381Z","title":"Omost github page","venue":null,"work_id":"5bd61c63-b8f0-40c1-be45-f0c6330366c1","year":2024},"citing_paper":{"arxiv_id":"2412.03859","last_updated":"2025-08-06T16:10:06Z","snapshot_observed_at":"2026-08-14T02:28:13.930087Z","submitted_at":"2024-12-05T04:09:47Z","title":"CreatiLayout: Siamese Multimodal Diffusion Transformer for Creative Layout-to-Image Generation","version":3},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-11T22:05:33.889224Z"},"links":{"citing_paper":"/paper/2412.03859"},"observation_digest":"sha256:9e3f4c49399c944acec393149abd0325674276b005ddd45d7eefe265286a33d2","observation_id":"87a96ed2-df30-4622-90fa-87a0abd5e49a","resolution":{"observed_at":"2026-08-11T22:05:34.707951Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14682","last_updated":"2025-05-20T17:59:26Z","snapshot_observed_at":"2026-08-13T02:57:53.245907Z","submitted_at":"2025-05-20T17:59:26Z","title":"UniGen: Enhanced Training & Test-Time Strategies for Unified Multimodal Understanding and Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.14682","snapshot_observed_at":"2026-08-11T22:05:33.892978Z","title":"Uni- gen: Enhanced training & test-time strategies for unified multimodal understanding and generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2412.03859","last_updated":"2025-08-06T16:10:06Z","snapshot_observed_at":"2026-08-14T02:28:13.930087Z","submitted_at":"2024-12-05T04:09:47Z","title":"CreatiLayout: Siamese Multimodal Diffusion Transformer for Creative Layout-to-Image Generation","version":3},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-11T22:05:33.892978Z"},"links":{"cited_paper":"/paper/2505.14682","citing_paper":"/paper/2412.03859"},"observation_digest":"sha256:ab79509bf8d44cc568f301bcdbe34a07c7efff47132327e9bffa3d804419fc9c","observation_id":"7529171f-8a64-4c7a-bce7-ccd3c5170588","resolution":{"observed_at":"2026-08-11T22:05:33.892978Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:05:34.687930Z","title":"Instancediffusion: Instance-level control for image generation","venue":null,"work_id":"a8e2df0b-e0e4-4c8f-ad38-3bff09f957ae","year":2024},"citing_paper":{"arxiv_id":"2412.03859","last_updated":"2025-08-06T16:10:06Z","snapshot_observed_at":"2026-08-14T02:28:13.930087Z","submitted_at":"2024-12-05T04:09:47Z","title":"CreatiLayout: Siamese Multimodal Diffusion Transformer for Creative Layout-to-Image Generation","version":3},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-11T22:05:33.897507Z"},"links":{"citing_paper":"/paper/2412.03859"},"observation_digest":"sha256:c544d63695741d61600a7af3f46bbf996d0ff192f1df2600f77dfc7c19957236","observation_id":"dbafb880-3815-4c74-8328-98761a31635a","resolution":{"observed_at":"2026-08-11T22:05:34.693466Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:05:34.672659Z","title":"Desigen: A pipeline for controllable design template generation","venue":null,"work_id":"27774e14-c0ae-4ed1-8cfb-e5a0f1b1d27e","year":2024},"citing_paper":{"arxiv_id":"2412.03859","last_updated":"2025-08-06T16:10:06Z","snapshot_observed_at":"2026-08-14T02:28:13.930087Z","submitted_at":"2024-12-05T04:09:47Z","title":"CreatiLayout: Siamese Multimodal Diffusion Transformer for Creative Layout-to-Image Generation","version":3},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-11T22:05:33.902123Z"},"links":{"citing_paper":"/paper/2412.03859"},"observation_digest":"sha256:911f801fbe9fc173756a8525ac3c0987597d1ea1db95bf5c5131fcd58d97a8f9","observation_id":"5bf8faf5-f475-4580-b945-46f2226ea138","resolution":{"observed_at":"2026-08-11T22:05:34.677121Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:05:34.648573Z","title":"Self-correcting llm-controlled diffusion models","venue":null,"work_id":"4ef77b67-6d39-4741-8c56-7ee4c49c59e9","year":2024},"citing_paper":{"arxiv_id":"2412.03859","last_updated":"2025-08-06T16:10:06Z","snapshot_observed_at":"2026-08-14T02:28:13.930087Z","submitted_at":"2024-12-05T04:09:47Z","title":"CreatiLayout: Siamese Multimodal Diffusion Transformer for Creative Layout-to-Image Generation","version":3},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-11T22:05:33.906891Z"},"links":{"citing_paper":"/paper/2412.03859"},"observation_digest":"sha256:62d39431f6aec50b8cf646aa21f035ec14246024bbae80ce555f9210e7331e75","observation_id":"04250b7e-024e-4945-a136-202eb064c248","resolution":{"observed_at":"2026-08-11T22:05:34.654520Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.08240","last_updated":"2024-11-06T13:03:20Z","snapshot_observed_at":"2026-08-14T00:54:44.244536Z","submitted_at":"2024-09-12T17:39:23Z","title":"IFAdapter: Instance Feature Control for Grounded Text-to-Image Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.08240","snapshot_observed_at":"2026-08-11T22:05:33.911518Z","title":"Ifadapter: Instance feature con- trol for grounded text-to-image generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.03859","last_updated":"2025-08-06T16:10:06Z","snapshot_observed_at":"2026-08-14T02:28:13.930087Z","submitted_at":"2024-12-05T04:09:47Z","title":"CreatiLayout: Siamese Multimodal Diffusion Transformer for Creative Layout-to-Image Generation","version":3},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-11T22:05:33.911518Z"},"links":{"cited_paper":"/paper/2409.08240","citing_paper":"/paper/2412.03859"},"observation_digest":"sha256:d7fa65f4221397b0ec8b445c5dd2f6cb3ec3e2c136f5e471b59ceb75de42b5fd","observation_id":"7fed15b3-479f-4821-be91-fd4d2259133a","resolution":{"observed_at":"2026-08-11T22:05:33.911518Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.18837","last_updated":"2023-11-30T18:59:52Z","snapshot_observed_at":"2026-08-13T05:12:58.321249Z","submitted_at":"2023-11-30T18:59:52Z","title":"VIDiff: Translating Videos via Multi-Modal Instructions with Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.18837","snapshot_observed_at":"2026-08-11T22:05:33.916043Z","title":"Vidiff: Translating videos via multi-modal instructions with diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.03859","last_updated":"2025-08-06T16:10:06Z","snapshot_observed_at":"2026-08-14T02:28:13.930087Z","submitted_at":"2024-12-05T04:09:47Z","title":"CreatiLayout: Siamese Multimodal Diffusion Transformer for Creative Layout-to-Image Generation","version":3},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-11T22:05:33.916043Z"},"links":{"cited_paper":"/paper/2311.18837","citing_paper":"/paper/2412.03859"},"observation_digest":"sha256:6b801458abcc86dc71efcb4a3a6b7d70855efe3bae1544cf9623beb37ae01659","observation_id":"d245cd8c-5fba-462d-aff4-78cccdbf6981","resolution":{"observed_at":"2026-08-11T22:05:33.916043Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:05:34.632683Z","title":"Simda: Simple diffusion adapter for efficient video generation","venue":null,"work_id":"d5f83003-e55e-4504-ace9-425bd31c6446","year":2024},"citing_paper":{"arxiv_id":"2412.03859","last_updated":"2025-08-06T16:10:06Z","snapshot_observed_at":"2026-08-14T02:28:13.930087Z","submitted_at":"2024-12-05T04:09:47Z","title":"CreatiLayout: Siamese Multimodal Diffusion Transformer for Creative Layout-to-Image Generation","version":3},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-11T22:05:33.920822Z"},"links":{"citing_paper":"/paper/2412.03859"},"observation_digest":"sha256:fb4a10755e2030ef6f3dc20bbda906254344e431c226541bc0c401e9080b28ca","observation_id":"0a399c3b-4058-47c9-9419-442a4feb5a27","resolution":{"observed_at":"2026-08-11T22:05:34.637301Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06465","last_updated":"2024-06-10T17:02:08Z","snapshot_observed_at":"2026-08-14T01:56:59.603441Z","submitted_at":"2024-06-10T17:02:08Z","title":"AID: Adapting Image2Video Diffusion Models for Instruction-guided Video Prediction","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.06465","snapshot_observed_at":"2026-08-11T22:05:33.924765Z","title":"Aid: Adapting image2video diffusion mod- els for instruction-guided video prediction","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.03859","last_updated":"2025-08-06T16:10:06Z","snapshot_observed_at":"2026-08-14T02:28:13.930087Z","submitted_at":"2024-12-05T04:09:47Z","title":"CreatiLayout: Siamese Multimodal Diffusion Transformer for Creative Layout-to-Image Generation","version":3},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-11T22:05:33.924765Z"},"links":{"cited_paper":"/paper/2406.06465","citing_paper":"/paper/2412.03859"},"observation_digest":"sha256:3437f84f655a23a49bcaec18eaa86381753d371083eceefa3372dddc6425aaa1","observation_id":"3be4c486-dc70-4ef5-9862-1835e5a33be5","resolution":{"observed_at":"2026-08-11T22:05:33.924765Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:05:34.617809Z","title":"A survey on video diffusion models","venue":null,"work_id":"29200b79-7fd0-44d4-a554-4011fca15469","year":2024},"citing_paper":{"arxiv_id":"2412.03859","last_updated":"2025-08-06T16:10:06Z","snapshot_observed_at":"2026-08-14T02:28:13.930087Z","submitted_at":"2024-12-05T04:09:47Z","title":"CreatiLayout: Siamese Multimodal Diffusion Transformer for Creative Layout-to-Image Generation","version":3},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-11T22:05:33.930216Z"},"links":{"citing_paper":"/paper/2412.03859"},"observation_digest":"sha256:38a10b56c1d6a9aa73aaec155e055b5808e9af0efda92bf40c71770456e6b4b7","observation_id":"1e6362bf-01c0-46eb-93b3-fa7088e21d83","resolution":{"observed_at":"2026-08-11T22:05:34.623164Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:05:34.601991Z","title":"Imagereward: Learning and evaluating human preferences for text-to-image generation","venue":null,"work_id":"0b14f8b4-c430-453c-bd0c-5ff5b2d11ac5","year":2023},"citing_paper":{"arxiv_id":"2412.03859","last_updated":"2025-08-06T16:10:06Z","snapshot_observed_at":"2026-08-14T02:28:13.930087Z","submitted_at":"2024-12-05T04:09:47Z","title":"CreatiLayout: Siamese Multimodal Diffusion Transformer for Creative Layout-to-Image Generation","version":3},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-11T22:05:33.936573Z"},"links":{"citing_paper":"/paper/2412.03859"},"observation_digest":"sha256:96e0b48c47e61ef9eeb1215a6105fba2524d29d6c9c50924c824e76025bdbc28","observation_id":"0338289c-af01-433e-bca9-405a9937e1c4","resolution":{"observed_at":"2026-08-11T22:05:34.607588Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:05:34.583410Z","title":"Freestyle layout-to-image synthesis","venue":null,"work_id":"60adc246-5876-4062-aac2-1f70dc8db2b3","year":2023},"citing_paper":{"arxiv_id":"2412.03859","last_updated":"2025-08-06T16:10:06Z","snapshot_observed_at":"2026-08-14T02:28:13.930087Z","submitted_at":"2024-12-05T04:09:47Z","title":"CreatiLayout: Siamese Multimodal Diffusion Transformer for Creative Layout-to-Image Generation","version":3},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-11T22:05:33.940846Z"},"links":{"citing_paper":"/paper/2412.03859"},"observation_digest":"sha256:a68464b8698f815dfa843adf58069be517915f70bbc4e8a470487c896cff210f","observation_id":"c8a0465f-6fbb-44bd-9c49-29e1e81a0c20","resolution":{"observed_at":"2026-08-11T22:05:34.588757Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:05:34.565064Z","title":"Law-diffusion: Complex scene generation by diffusion with layouts","venue":null,"work_id":"644840db-51b5-4a6d-aaba-4da0051c170e","year":2023},"citing_paper":{"arxiv_id":"2412.03859","last_updated":"2025-08-06T16:10:06Z","snapshot_observed_at":"2026-08-14T02:28:13.930087Z","submitted_at":"2024-12-05T04:09:47Z","title":"CreatiLayout: Siamese Multimodal Diffusion Transformer for Creative Layout-to-Image Generation","version":3},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-11T22:05:33.944624Z"},"links":{"citing_paper":"/paper/2412.03859"},"observation_digest":"sha256:60dca5ee07311278ea4073a34a6fbfc5f1657d0a35208781003b8514961aca49","observation_id":"a605c30e-9520-406e-9a5c-a15313a0e538","resolution":{"observed_at":"2026-08-11T22:05:34.569900Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:05:34.548041Z","title":"Mastering text-to-image diffusion: Recaptioning, planning, and generating with multimodal llms","venue":null,"work_id":"1f1b6d7b-53e1-4ebb-8e15-d483b8b537fb","year":2024},"citing_paper":{"arxiv_id":"2412.03859","last_updated":"2025-08-06T16:10:06Z","snapshot_observed_at":"2026-08-14T02:28:13.930087Z","submitted_at":"2024-12-05T04:09:47Z","title":"CreatiLayout: Siamese Multimodal Diffusion Transformer for Creative Layout-to-Image Generation","version":3},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-11T22:05:33.948565Z"},"links":{"citing_paper":"/paper/2412.03859"},"observation_digest":"sha256:83518e580d0fbc4bea0c58a5c63ab95c64184264935241acdbcf2883f5ccc39f","observation_id":"e94a0421-4d8a-4b71-8085-c6ea8ef84593","resolution":{"observed_at":"2026-08-11T22:05:34.553344Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.06721","last_updated":"2023-08-13T08:34:51Z","snapshot_observed_at":"2026-07-06T16:05:39.158819Z","submitted_at":"2023-08-13T08:34:51Z","title":"IP-Adapter: Text Compatible Image Prompt Adapter for Text-to-Image Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.06721","snapshot_observed_at":"2026-08-11T22:05:33.952489Z","title":"Ip- adapter: Text compatible image prompt adapter for text-to- image diffusion models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.03859","last_updated":"2025-08-06T16:10:06Z","snapshot_observed_at":"2026-08-14T02:28:13.930087Z","submitted_at":"2024-12-05T04:09:47Z","title":"CreatiLayout: Siamese Multimodal Diffusion Transformer for Creative Layout-to-Image Generation","version":3},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-11T22:05:33.952489Z"},"links":{"cited_paper":"/paper/2308.06721","citing_paper":"/paper/2412.03859"},"observation_digest":"sha256:0c2f70cfc4e19078941d630f011013ee6a307ce77dd9eedbf4851d6c7d717561","observation_id":"466c2556-3d30-4979-9910-7bfbc9a38232","resolution":{"observed_at":"2026-08-11T22:05:33.952489Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:05:34.532030Z","title":"Layoutdiffusion: Controllable diffusion model for layout-to-image generation","venue":null,"work_id":"92fe6a80-0867-4c59-bfcc-f0d54846aa1c","year":2023},"citing_paper":{"arxiv_id":"2412.03859","last_updated":"2025-08-06T16:10:06Z","snapshot_observed_at":"2026-08-14T02:28:13.930087Z","submitted_at":"2024-12-05T04:09:47Z","title":"CreatiLayout: Siamese Multimodal Diffusion Transformer for Creative Layout-to-Image Generation","version":3},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-11T22:05:33.957317Z"},"links":{"citing_paper":"/paper/2412.03859"},"observation_digest":"sha256:97dc4641850e707897b46687ade0406324006c2164afb3e925f4ae1489ec3624","observation_id":"adaf16fa-094e-45a8-9c93-d968faa6d153","resolution":{"observed_at":"2026-08-11T22:05:34.537773Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"7171.8974","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:05:34.064742Z","title":"Layout Image Text SiamLayout-FLUX Global Caption TokensImage TokensLayout Tokensℎ!ℎ","venue":null,"work_id":"5c1e8cff-f7a8-4c4f-86eb-eca9c3baa071","year":2024},"citing_paper":{"arxiv_id":"2412.03859","last_updated":"2025-08-06T16:10:06Z","snapshot_observed_at":"2026-08-14T02:28:13.930087Z","submitted_at":"2024-12-05T04:09:47Z","title":"CreatiLayout: Siamese Multimodal Diffusion Transformer for Creative Layout-to-Image Generation","version":3},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-11T22:05:33.961490Z"},"links":{"citing_paper":"/paper/2412.03859"},"observation_digest":"sha256:7baaeab87ab20c5ff425c3032ac839a78311f186adba6b73a7c11718fa255bdd","observation_id":"99544d28-def6-46d8-bcf8-dafb204db096","resolution":{"observed_at":"2026-08-11T22:05:34.074029Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2412.03859","last_updated":"2025-08-06T16:10:06Z","latest_version":3,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-14T02:28:13.930087Z","submitted_at":"2024-12-05T04:09:47Z","title":"CreatiLayout: Siamese Multimodal Diffusion Transformer for Creative Layout-to-Image Generation"},"reference_resolution":{"displayed":81,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":35,"verified_exact":0,"verified_fuzzy":45},"total_outbound_references":81},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 81 of 81 outbound references and 10 inbound Pith citation observations for arXiv:2412.03859."}