{"as_of":"2026-08-16T22:23:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:21eebd4da95c07b47cfa6a5867e1e84c66799234a3389d00109bb586588a87c7","coverage":[{"denominator":48,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":48,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T11:23:39.194911Z","state":"measured"},{"denominator":54,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":54,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":6,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":6,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T10:46:55.020093Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-05T22:02:50.398472Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2411.18301","last_updated":"2024-11-27T12:47:06Z","snapshot_observed_at":"2026-08-14T15:46:18.711516Z","submitted_at":"2024-11-27T12:47:06Z","title":"Enhancing MMDiT-Based Text-to-Image Models for Similar Subject Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.18301","snapshot_observed_at":"2026-08-12T10:46:55.020093Z","title":"En- hancing mmdit-based text-to-image models for similar sub- ject generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.18936","last_updated":"2025-03-24T19:58:03Z","snapshot_observed_at":"2026-08-15T23:35:40.048462Z","submitted_at":"2024-11-28T05:58:03Z","title":"Self-Cross Diffusion Guidance for Text-to-Image Synthesis of Similar Subjects","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-12T10:46:55.020093Z"},"links":{"cited_paper":"/paper/2411.18301","citing_paper":"/paper/2411.18936"},"observation_digest":"sha256:31bafb9cc200167fc3fd78929cebe17f872beb8c391164ee309c72a829a9c2e2","observation_id":"64cd234c-1b99-421e-83c6-3df2b3ec6c14","resolution":{"observed_at":"2026-08-12T10:46:55.020093Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.18301","last_updated":"2024-11-27T12:47:06Z","snapshot_observed_at":"2026-08-14T15:46:18.711516Z","submitted_at":"2024-11-27T12:47:06Z","title":"Enhancing MMDiT-Based Text-to-Image Models for Similar Subject Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.18301","snapshot_observed_at":"2026-08-07T14:21:36.425140Z","title":"Enhancing mmdit-based text-to-image models for similar subject generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19166","last_updated":"2025-07-23T12:14:57Z","snapshot_observed_at":"2026-08-15T16:32:34.264086Z","submitted_at":"2025-05-25T14:32:24Z","title":"JEDI: The Force of Jensen-Shannon Divergence in Disentangling Diffusion Models","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T14:21:36.425140Z"},"links":{"cited_paper":"/paper/2411.18301","citing_paper":"/paper/2505.19166"},"observation_digest":"sha256:8da9495bab63fc9601c62b80725f40455e3846bdc1b1b62611ddd2ec9cd3a179","observation_id":"856ae90a-91db-4aef-bce8-f6a7f4ba09ff","resolution":{"observed_at":"2026-08-07T14:21:36.425140Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.18301","last_updated":"2024-11-27T12:47:06Z","snapshot_observed_at":"2026-08-14T15:46:18.711516Z","submitted_at":"2024-11-27T12:47:06Z","title":"Enhancing MMDiT-Based Text-to-Image Models for Similar Subject Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.18301","snapshot_observed_at":"2026-08-06T15:19:24.182520Z","title":"Enhancing mmdit-based text-to-image models for similar subject generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.16240","last_updated":"2025-07-22T05:25:38Z","snapshot_observed_at":"2026-08-13T20:22:14.596107Z","submitted_at":"2025-07-22T05:25:38Z","title":"Scale Your Instructions: Enhance the Instruction-Following Fidelity of Unified Image Generation Model by Self-Adaptive Attention Scaling","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T15:19:24.182520Z"},"links":{"cited_paper":"/paper/2411.18301","citing_paper":"/paper/2507.16240"},"observation_digest":"sha256:1eb98c6b7cbe4d7fd2b030cdada5b50d3407f4e9262505579e226c54c815820f","observation_id":"4de35d14-f731-4746-ba70-481e00658dbf","resolution":{"observed_at":"2026-08-06T15:19:24.182520Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.18301","last_updated":"2024-11-27T12:47:06Z","snapshot_observed_at":"2026-08-14T15:46:18.711516Z","submitted_at":"2024-11-27T12:47:06Z","title":"Enhancing MMDiT-Based Text-to-Image Models for Similar Subject Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.18301","snapshot_observed_at":"2026-08-06T14:45:53.470401Z","title":"Enhancing mmdit-based text-to-image models for similar subject generation.arXiv preprint arXiv:2411.18301, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.17853","last_updated":"2026-06-21T15:14:16Z","snapshot_observed_at":"2026-08-14T15:47:00.181656Z","submitted_at":"2025-07-23T18:20:46Z","title":"Detail++: Training-Free Detail Enhancer for T2I Diffusion Models","version":3},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-06T14:45:53.470401Z"},"links":{"cited_paper":"/paper/2411.18301","citing_paper":"/paper/2507.17853"},"observation_digest":"sha256:fae0c26205680f569bc28716f8247d87013a3f723aae2861cb03bd75643109fb","observation_id":"9bfe246e-1ad4-4f52-8f8e-d93c200fa060","resolution":{"observed_at":"2026-08-06T14:45:53.470401Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.18301","last_updated":"2024-11-27T12:47:06Z","snapshot_observed_at":"2026-08-14T15:46:18.711516Z","submitted_at":"2024-11-27T12:47:06Z","title":"Enhancing MMDiT-Based Text-to-Image Models for Similar Subject Generation","version":1},"cited_work":{"arxiv_id":"2411.18301","doi":null,"metadata_source":"pith","pith_arxiv_id":"2411.18301","snapshot_observed_at":"2026-08-05T22:02:50.398472Z","title":"Enhancing MMDiT-Based Text-to-Image Models for Similar Subject Generation","venue":"cs.CV","work_id":"93f32975-ad2f-4960-a3f5-82c282dc5b8f","year":2024},"citing_paper":{"arxiv_id":"2508.07647","last_updated":"2025-08-11T05:57:59Z","snapshot_observed_at":"2026-08-15T01:37:40.126934Z","submitted_at":"2025-08-11T05:57:59Z","title":"LaRender: Training-Free Occlusion Control in Image Generation via Latent Rendering","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-05T22:02:50.152765Z"},"links":{"cited_paper":"/paper/2411.18301","citing_paper":"/paper/2508.07647"},"observation_digest":"sha256:bdd79a0e4fb33efae47a79034f31c1d8484966ac4f30a001aa82d9d8bb9b2f30","observation_id":"50c1ff24-d2f5-4c3c-a041-996742e60fc0","resolution":{"observed_at":"2026-08-05T22:02:50.403741Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.18301","last_updated":"2024-11-27T12:47:06Z","snapshot_observed_at":"2026-08-14T15:46:18.711516Z","submitted_at":"2024-11-27T12:47:06Z","title":"Enhancing MMDiT-Based Text-to-Image Models for Similar Subject Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.18301","snapshot_observed_at":"2026-08-03T20:15:30.592173Z","title":"Enhancing mmdit-based text-to-image models for similar subject generation.arXiv preprint arXiv:2411.18301, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.20651","last_updated":"2026-07-21T00:23:00Z","snapshot_observed_at":"2026-08-14T13:42:29.127732Z","submitted_at":"2025-11-25T18:59:55Z","title":"RubricRL: Simple Generalizable Rewards for Text-to-Image Generation","version":4},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-03T20:15:30.592173Z"},"links":{"cited_paper":"/paper/2411.18301","citing_paper":"/paper/2511.20651"},"observation_digest":"sha256:6a92dcfaa8ba99ae1a5d89e955828ff0005305c7db0a9194d91d31d864b79e3c","observation_id":"d5ea9f5f-5257-4c32-a219-cd3e9235ba5b","resolution":{"observed_at":"2026-08-03T20:15:30.592173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2411.18301/citation-record","integrity":"/paper/2411.18301/integrity","json":"/paper/2411.18301/citation-record.json","paper":"/paper/2411.18301"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:23:38.043236Z","title":"A-star: Test-time attention segregation and retention for text-to-image synthesis","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.18301","last_updated":"2024-11-27T12:47:06Z","snapshot_observed_at":"2026-08-14T15:46:18.711516Z","submitted_at":"2024-11-27T12:47:06Z","title":"Enhancing MMDiT-Based Text-to-Image Models for Similar Subject Generation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T11:23:38.043236Z"},"links":{"citing_paper":"/paper/2411.18301"},"observation_digest":"sha256:9c9de2d134dbf3015cd07358355293899ef8553dc6d9f6d168e4704b9a82387f","observation_id":"9b7ac967-ad2d-469f-b8f1-0833d46bd194","resolution":{"observed_at":"2026-08-12T11:23:38.043236Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:23:38.116696Z","title":"Separate-and-enhance: Composi- tional finetuning for text-to-image diffusion models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.18301","last_updated":"2024-11-27T12:47:06Z","snapshot_observed_at":"2026-08-14T15:46:18.711516Z","submitted_at":"2024-11-27T12:47:06Z","title":"Enhancing MMDiT-Based Text-to-Image Models for Similar Subject Generation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T11:23:38.116696Z"},"links":{"citing_paper":"/paper/2411.18301"},"observation_digest":"sha256:ea7b7b12ebdd1422e9075aaa4e7841214281a79cef20e20b24c26d53702d99f2","observation_id":"b6b36b74-55fa-402f-a2f7-786da14c8a48","resolution":{"observed_at":"2026-08-12T11:23:38.116696Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10210","last_updated":"2024-06-14T17:46:08Z","snapshot_observed_at":"2026-08-16T13:42:52.013374Z","submitted_at":"2024-06-14T17:46:08Z","title":"Make It Count: Text-to-Image Generation with an Accurate Number of Objects","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10210","snapshot_observed_at":"2026-08-12T11:23:38.197831Z","title":"Make it count: Text-to-image gen- eration with an accurate number of objects","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.18301","last_updated":"2024-11-27T12:47:06Z","snapshot_observed_at":"2026-08-14T15:46:18.711516Z","submitted_at":"2024-11-27T12:47:06Z","title":"Enhancing MMDiT-Based Text-to-Image Models for Similar Subject Generation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T11:23:38.197831Z"},"links":{"cited_paper":"/paper/2406.10210","citing_paper":"/paper/2411.18301"},"observation_digest":"sha256:e516f0621e61a9df8a7251c5e6bc8b4646ec35029ea3327a2d5d88fd72e5a7e1","observation_id":"fa70afa9-7a6c-4d04-81f7-b2c69bd1fbbb","resolution":{"observed_at":"2026-08-12T11:23:38.197831Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:23:40.540694Z","title":"Attend-and-excite: Attention-based se- mantic guidance for text-to-image diffusion models","venue":null,"work_id":"41282d42-c67f-4fb1-9d6d-bbe4dcff4124","year":2023},"citing_paper":{"arxiv_id":"2411.18301","last_updated":"2024-11-27T12:47:06Z","snapshot_observed_at":"2026-08-14T15:46:18.711516Z","submitted_at":"2024-11-27T12:47:06Z","title":"Enhancing MMDiT-Based Text-to-Image Models for Similar Subject Generation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T11:23:38.201989Z"},"links":{"citing_paper":"/paper/2411.18301"},"observation_digest":"sha256:5f18b744db00ad350ffbedb9cd4bbe013229eaf7072b6782a26668fa2c77e145","observation_id":"40e1ba90-e595-4ba4-9e11-527794ca7a5d","resolution":{"observed_at":"2026-08-12T11:23:40.544596Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:23:38.205808Z","title":"Training-free layout control with cross-attention guidance","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.18301","last_updated":"2024-11-27T12:47:06Z","snapshot_observed_at":"2026-08-14T15:46:18.711516Z","submitted_at":"2024-11-27T12:47:06Z","title":"Enhancing MMDiT-Based Text-to-Image Models for Similar Subject Generation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T11:23:38.205808Z"},"links":{"citing_paper":"/paper/2411.18301"},"observation_digest":"sha256:4bff5b07d444291d8a4d47151fa4919235b5b2685a3684707c0d7fb5f18dfe1e","observation_id":"d6dea554-32b1-4bff-afb4-d1a4bf206666","resolution":{"observed_at":"2026-08-12T11:23:38.205808Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:23:38.209892Z","title":"Reproducible scal- ing laws for contrastive language-image learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.18301","last_updated":"2024-11-27T12:47:06Z","snapshot_observed_at":"2026-08-14T15:46:18.711516Z","submitted_at":"2024-11-27T12:47:06Z","title":"Enhancing MMDiT-Based Text-to-Image Models for Similar Subject Generation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-12T11:23:38.209892Z"},"links":{"citing_paper":"/paper/2411.18301"},"observation_digest":"sha256:1877d909f131a73aec0e1cebb48b1b1d375f945db534f057ba08294f070973db","observation_id":"83f0ef26-6420-4f2f-8cac-dd06f889bf94","resolution":{"observed_at":"2026-08-12T11:23:38.209892Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:23:40.514097Z","title":"Be yourself: Bounded attention for multi-subject text-to-image generation","venue":null,"work_id":"d13af87c-4de8-4cb6-90ea-7a4bd6bdbe51","year":2024},"citing_paper":{"arxiv_id":"2411.18301","last_updated":"2024-11-27T12:47:06Z","snapshot_observed_at":"2026-08-14T15:46:18.711516Z","submitted_at":"2024-11-27T12:47:06Z","title":"Enhancing MMDiT-Based Text-to-Image Models for Similar Subject Generation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T11:23:38.214371Z"},"links":{"citing_paper":"/paper/2411.18301"},"observation_digest":"sha256:709fea81ebf1c25d6fcdc722076e5f1e40a3287e7101a87a1ef46d992e739b8f","observation_id":"7cf3d7aa-6c68-418a-8afe-ab3ca7c4052b","resolution":{"observed_at":"2026-08-12T11:23:40.518462Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:23:40.474688Z","title":"Scaling recti- fied flow transformers for high-resolution image synthesis","venue":null,"work_id":"341f491b-fd80-498e-86d3-40ee4eb7f9a9","year":2024},"citing_paper":{"arxiv_id":"2411.18301","last_updated":"2024-11-27T12:47:06Z","snapshot_observed_at":"2026-08-14T15:46:18.711516Z","submitted_at":"2024-11-27T12:47:06Z","title":"Enhancing MMDiT-Based Text-to-Image Models for Similar Subject Generation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T11:23:38.218347Z"},"links":{"citing_paper":"/paper/2411.18301"},"observation_digest":"sha256:fad26ed68911c26b5ae2ac841ea7429b2a94de5226adf31afbcea7d4cd934086","observation_id":"1b5e9962-00ee-4125-b24f-dd661b0b1715","resolution":{"observed_at":"2026-08-12T11:23:40.505675Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:23:40.397298Z","title":"Training- free structured diffusion guidance for compositional text-to- image synthesis","venue":null,"work_id":"d488c5d4-11d0-423c-9323-f047ff93d8d0","year":null},"citing_paper":{"arxiv_id":"2411.18301","last_updated":"2024-11-27T12:47:06Z","snapshot_observed_at":"2026-08-14T15:46:18.711516Z","submitted_at":"2024-11-27T12:47:06Z","title":"Enhancing MMDiT-Based Text-to-Image Models for Similar Subject Generation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T11:23:38.221834Z"},"links":{"citing_paper":"/paper/2411.18301"},"observation_digest":"sha256:bfd49c2f37072a49639d32545e94ab1081853f38859a373b4a079524afc213a5","observation_id":"1daa7a5c-3cf4-46b9-9a32-f40123d61b80","resolution":{"observed_at":"2026-08-12T11:23:40.401492Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:23:38.225772Z","title":"Initno: Boosting text-to-image diffu- sion models via initial noise optimization","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.18301","last_updated":"2024-11-27T12:47:06Z","snapshot_observed_at":"2026-08-14T15:46:18.711516Z","submitted_at":"2024-11-27T12:47:06Z","title":"Enhancing MMDiT-Based Text-to-Image Models for Similar Subject Generation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-12T11:23:38.225772Z"},"links":{"citing_paper":"/paper/2411.18301"},"observation_digest":"sha256:45f9e066124897d60fef88010e1f3b161b20b6b6a717ed2320cf9974f8ba82f7","observation_id":"bdccbab0-6763-4c00-b01c-b515802fe92d","resolution":{"observed_at":"2026-08-12T11:23:38.225772Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:23:40.376944Z","title":"Optimizing prompts for text-to-image generation","venue":null,"work_id":"cabd7946-01fe-4d6e-85e7-46a471aac958","year":2024},"citing_paper":{"arxiv_id":"2411.18301","last_updated":"2024-11-27T12:47:06Z","snapshot_observed_at":"2026-08-14T15:46:18.711516Z","submitted_at":"2024-11-27T12:47:06Z","title":"Enhancing MMDiT-Based Text-to-Image Models for Similar Subject Generation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T11:23:38.338635Z"},"links":{"citing_paper":"/paper/2411.18301"},"observation_digest":"sha256:f235b654e9fe3fa746a09e86e7cc53c8136a02be394829258b2b84f066847279","observation_id":"8d9f2fa3-cece-4ba7-aef5-a1ea67106a9a","resolution":{"observed_at":"2026-08-12T11:23:40.381571Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:23:40.258680Z","title":"Gans trained by a two time-scale update rule converge to a local nash equilib- rium","venue":null,"work_id":"c1e1c06c-8b3d-463e-a550-2356f98f8266","year":2017},"citing_paper":{"arxiv_id":"2411.18301","last_updated":"2024-11-27T12:47:06Z","snapshot_observed_at":"2026-08-14T15:46:18.711516Z","submitted_at":"2024-11-27T12:47:06Z","title":"Enhancing MMDiT-Based Text-to-Image Models for Similar Subject Generation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T11:23:38.342137Z"},"links":{"citing_paper":"/paper/2411.18301"},"observation_digest":"sha256:797d4e1a8b77884c68785d26ba065299050016e8f90bb8cbdefd57b097945ad9","observation_id":"3f75a776-ea8c-411a-a646-47dcc18c425a","resolution":{"observed_at":"2026-08-12T11:23:40.315509Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2207.12598","last_updated":"2022-07-26T01:42:07Z","snapshot_observed_at":"2026-08-14T06:37:15.299690Z","submitted_at":"2022-07-26T01:42:07Z","title":"Classifier-Free Diffusion Guidance","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.12598","snapshot_observed_at":"2026-08-12T11:23:38.346111Z","title":"Classifier-free diffusion guidance","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.18301","last_updated":"2024-11-27T12:47:06Z","snapshot_observed_at":"2026-08-14T15:46:18.711516Z","submitted_at":"2024-11-27T12:47:06Z","title":"Enhancing MMDiT-Based Text-to-Image Models for Similar Subject Generation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-12T11:23:38.346111Z"},"links":{"cited_paper":"/paper/2207.12598","citing_paper":"/paper/2411.18301"},"observation_digest":"sha256:20f93a171c2f0948e0b3134084510e22e4ee3d8ea6b61f0212f0457bd4a2a64a","observation_id":"49d280ce-a727-4b10-8bd7-f62a4de6b2e1","resolution":{"observed_at":"2026-08-12T11:23:38.346111Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:23:38.350184Z","title":"Denoising dif- fusion probabilistic models","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2411.18301","last_updated":"2024-11-27T12:47:06Z","snapshot_observed_at":"2026-08-14T15:46:18.711516Z","submitted_at":"2024-11-27T12:47:06Z","title":"Enhancing MMDiT-Based Text-to-Image Models for Similar Subject Generation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T11:23:38.350184Z"},"links":{"citing_paper":"/paper/2411.18301"},"observation_digest":"sha256:1070c464e8ad1aaaf94f1920aaf95e2afb0bb39ba81369daa1154755ba537cd2","observation_id":"bdd953a8-8959-458d-a57c-51bd1f9222d3","resolution":{"observed_at":"2026-08-12T11:23:38.350184Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:23:38.353310Z","title":"Scal- ing up gans for text-to-image synthesis","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.18301","last_updated":"2024-11-27T12:47:06Z","snapshot_observed_at":"2026-08-14T15:46:18.711516Z","submitted_at":"2024-11-27T12:47:06Z","title":"Enhancing MMDiT-Based Text-to-Image Models for Similar Subject Generation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T11:23:38.353310Z"},"links":{"citing_paper":"/paper/2411.18301"},"observation_digest":"sha256:024c2b3e6ca1decca46016f65487a565733dcbc124fa003ad103e1398da20857","observation_id":"1a7572d9-e64a-4f5d-afbc-e07231b7c4a4","resolution":{"observed_at":"2026-08-12T11:23:38.353310Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.17567","last_updated":"2025-03-05T11:52:00Z","snapshot_observed_at":"2026-08-16T15:19:46.756672Z","submitted_at":"2023-06-30T11:40:35Z","title":"Counting Guidance for High Fidelity Text-to-Image Synthesis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.17567","snapshot_observed_at":"2026-08-12T11:23:38.356572Z","title":"Count- ing guidance for high fidelity text-to-image synthesis","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.18301","last_updated":"2024-11-27T12:47:06Z","snapshot_observed_at":"2026-08-14T15:46:18.711516Z","submitted_at":"2024-11-27T12:47:06Z","title":"Enhancing MMDiT-Based Text-to-Image Models for Similar Subject Generation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T11:23:38.356572Z"},"links":{"cited_paper":"/paper/2306.17567","citing_paper":"/paper/2411.18301"},"observation_digest":"sha256:5bd91bca5dac0cf953e5b0f42cbf76b2c8571f4948fe0f08115eac3ae0d71d5b","observation_id":"579048d3-32b6-456e-9780-b08236d76551","resolution":{"observed_at":"2026-08-12T11:23:38.356572Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:23:40.231149Z","title":"Compositional visual generation with composable diffusion models","venue":null,"work_id":"c32dc288-68b3-4077-9d7a-9350f1e6d8af","year":2022},"citing_paper":{"arxiv_id":"2411.18301","last_updated":"2024-11-27T12:47:06Z","snapshot_observed_at":"2026-08-14T15:46:18.711516Z","submitted_at":"2024-11-27T12:47:06Z","title":"Enhancing MMDiT-Based Text-to-Image Models for Similar Subject Generation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T11:23:38.360200Z"},"links":{"citing_paper":"/paper/2411.18301"},"observation_digest":"sha256:b2ce01e3544b4994815a56919f816b7f69cfafd6f24a2259a87ba1947f200dd8","observation_id":"a996a307-abfb-422b-ba7c-1e7d880a0cf2","resolution":{"observed_at":"2026-08-12T11:23:40.236070Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:23:40.217873Z","title":"Grounding dino: Mar- rying dino with grounded pre-training for open-set object detection","venue":null,"work_id":"646e9156-5e73-4ba1-bffd-ced2e86062c3","year":2024},"citing_paper":{"arxiv_id":"2411.18301","last_updated":"2024-11-27T12:47:06Z","snapshot_observed_at":"2026-08-14T15:46:18.711516Z","submitted_at":"2024-11-27T12:47:06Z","title":"Enhancing MMDiT-Based Text-to-Image Models for Similar Subject Generation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-12T11:23:38.363438Z"},"links":{"citing_paper":"/paper/2411.18301"},"observation_digest":"sha256:681d6c964ac065a1c8a21e50224f237f4c0a8f8c721a3801d83a771049037f2a","observation_id":"e2196b6c-4a59-4244-8517-5ccbd57801d6","resolution":{"observed_at":"2026-08-12T11:23:40.222124Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:23:40.203980Z","title":"Design guidelines for prompt engineering text-to-image generative models","venue":null,"work_id":"063c8890-c41e-4d6e-9ce0-3ffaa4b57919","year":2022},"citing_paper":{"arxiv_id":"2411.18301","last_updated":"2024-11-27T12:47:06Z","snapshot_observed_at":"2026-08-14T15:46:18.711516Z","submitted_at":"2024-11-27T12:47:06Z","title":"Enhancing MMDiT-Based Text-to-Image Models for Similar Subject Generation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T11:23:38.366729Z"},"links":{"citing_paper":"/paper/2411.18301"},"observation_digest":"sha256:005a5bbb9af3ffd90efbb1a6c6dbf3f9a4b8d98725f1e0ff7219a87efcf08137","observation_id":"edeb82ba-38fb-4ce5-a7a5-c462eabb3979","resolution":{"observed_at":"2026-08-12T11:23:40.208524Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:23:40.191082Z","title":"Flow straight and fast: Learning to generate and transfer data with rectified flow","venue":null,"work_id":"68021114-a894-4c6f-9d67-569321d0bee4","year":null},"citing_paper":{"arxiv_id":"2411.18301","last_updated":"2024-11-27T12:47:06Z","snapshot_observed_at":"2026-08-14T15:46:18.711516Z","submitted_at":"2024-11-27T12:47:06Z","title":"Enhancing MMDiT-Based Text-to-Image Models for Similar Subject Generation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-12T11:23:38.370565Z"},"links":{"citing_paper":"/paper/2411.18301"},"observation_digest":"sha256:99afc801becea92f0fadf13c3d0e2442d9eaca594978f46102cc7bc170a4ea49","observation_id":"7118c30c-170f-499b-9d9c-6a3c05c1c738","resolution":{"observed_at":"2026-08-12T11:23:40.195227Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:23:40.097378Z","title":"Conform: Contrast is all you need for high- fidelity text-to-image diffusion models","venue":null,"work_id":"c7b24389-4802-4bf4-b60b-9273a794c7d9","year":2024},"citing_paper":{"arxiv_id":"2411.18301","last_updated":"2024-11-27T12:47:06Z","snapshot_observed_at":"2026-08-14T15:46:18.711516Z","submitted_at":"2024-11-27T12:47:06Z","title":"Enhancing MMDiT-Based Text-to-Image Models for Similar Subject Generation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-12T11:23:38.374575Z"},"links":{"citing_paper":"/paper/2411.18301"},"observation_digest":"sha256:8bc3e3a211bfb8530cfd13cdfa8525339453c4236578f1892cc79d351f171675","observation_id":"990cc766-901a-481e-8f4e-b0dac7a31e8f","resolution":{"observed_at":"2026-08-12T11:23:40.156326Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:23:38.378170Z","title":"Glide: Towards photorealis- tic image generation and editing with text-guided diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.18301","last_updated":"2024-11-27T12:47:06Z","snapshot_observed_at":"2026-08-14T15:46:18.711516Z","submitted_at":"2024-11-27T12:47:06Z","title":"Enhancing MMDiT-Based Text-to-Image Models for Similar Subject Generation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-12T11:23:38.378170Z"},"links":{"citing_paper":"/paper/2411.18301"},"observation_digest":"sha256:8ac4a1568baa3703fbefef5b81b4f27119570f5d7cdd6d52f6e35446be3951d0","observation_id":"1e700a80-f3a4-4760-b714-24a165f5a6cd","resolution":{"observed_at":"2026-08-12T11:23:38.378170Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:23:38.449916Z","title":"Gpt-4o mini: Advancing cost-efficient intelligence","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.18301","last_updated":"2024-11-27T12:47:06Z","snapshot_observed_at":"2026-08-14T15:46:18.711516Z","submitted_at":"2024-11-27T12:47:06Z","title":"Enhancing MMDiT-Based Text-to-Image Models for Similar Subject Generation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-12T11:23:38.449916Z"},"links":{"citing_paper":"/paper/2411.18301"},"observation_digest":"sha256:1ecdd3848256045c229ab4257a0bccb7cd3c9590ba8741baacfc5f9781012bb3","observation_id":"228509c5-4103-470a-9d7f-963f73be38c6","resolution":{"observed_at":"2026-08-12T11:23:38.449916Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:23:40.020731Z","title":null,"venue":null,"work_id":"bc1b1262-8033-4e08-95c9-e765f68bfa5c","year":2024},"citing_paper":{"arxiv_id":"2411.18301","last_updated":"2024-11-27T12:47:06Z","snapshot_observed_at":"2026-08-14T15:46:18.711516Z","submitted_at":"2024-11-27T12:47:06Z","title":"Enhancing MMDiT-Based Text-to-Image Models for Similar Subject Generation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-12T11:23:38.745755Z"},"links":{"citing_paper":"/paper/2411.18301"},"observation_digest":"sha256:9f1ff79b1084a01f619d931a1e89ed648a9a3f38c6f1fdaf006f1957b4ba3991","observation_id":"d882c672-e587-4f36-bbd5-b90109b6f892","resolution":{"observed_at":"2026-08-12T11:23:40.024964Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:23:38.800435Z","title":"Scalable diffusion models with transformers","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.18301","last_updated":"2024-11-27T12:47:06Z","snapshot_observed_at":"2026-08-14T15:46:18.711516Z","submitted_at":"2024-11-27T12:47:06Z","title":"Enhancing MMDiT-Based Text-to-Image Models for Similar Subject Generation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-12T11:23:38.800435Z"},"links":{"citing_paper":"/paper/2411.18301"},"observation_digest":"sha256:5796431ea1877757577bd12c61cdb11f3425a72ca90d2e8782a65629bc456025","observation_id":"71b2bb50-a706-4842-8904-281f3d02f709","resolution":{"observed_at":"2026-08-12T11:23:38.800435Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.01952","last_updated":"2023-07-04T23:04:57Z","snapshot_observed_at":"2026-08-14T22:54:08.184266Z","submitted_at":"2023-07-04T23:04:57Z","title":"SDXL: Improving Latent Diffusion Models for High-Resolution Image Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.01952","snapshot_observed_at":"2026-08-12T11:23:38.804926Z","title":"Sdxl: Improving latent diffusion mod- els for high-resolution image synthesis","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.18301","last_updated":"2024-11-27T12:47:06Z","snapshot_observed_at":"2026-08-14T15:46:18.711516Z","submitted_at":"2024-11-27T12:47:06Z","title":"Enhancing MMDiT-Based Text-to-Image Models for Similar Subject Generation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-12T11:23:38.804926Z"},"links":{"cited_paper":"/paper/2307.01952","citing_paper":"/paper/2411.18301"},"observation_digest":"sha256:95666ae8d715d1f137061be2aa5d2b5246409698c00a1c7746e729d6028ced7d","observation_id":"017b59e2-16c9-4f77-9d47-34dc4eba6bc1","resolution":{"observed_at":"2026-08-12T11:23:38.804926Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:23:38.809870Z","title":"Learning transferable visual models from natural language supervi- sion","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.18301","last_updated":"2024-11-27T12:47:06Z","snapshot_observed_at":"2026-08-14T15:46:18.711516Z","submitted_at":"2024-11-27T12:47:06Z","title":"Enhancing MMDiT-Based Text-to-Image Models for Similar Subject Generation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-12T11:23:38.809870Z"},"links":{"citing_paper":"/paper/2411.18301"},"observation_digest":"sha256:3d98738ac55da238e16d9b573f1c08a97ac7e59bb911c1cdff3a0178d633dc0b","observation_id":"b4ca5c12-b16d-42e1-93e7-ad7b07fa1124","resolution":{"observed_at":"2026-08-12T11:23:38.809870Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:23:39.987720Z","title":"Exploring the limits of transfer learning with a unified text-to-text transformer","venue":null,"work_id":"286cba9f-f17a-4e13-89f0-2b5ff460569b","year":2020},"citing_paper":{"arxiv_id":"2411.18301","last_updated":"2024-11-27T12:47:06Z","snapshot_observed_at":"2026-08-14T15:46:18.711516Z","submitted_at":"2024-11-27T12:47:06Z","title":"Enhancing MMDiT-Based Text-to-Image Models for Similar Subject Generation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-12T11:23:38.813882Z"},"links":{"citing_paper":"/paper/2411.18301"},"observation_digest":"sha256:f63de649c644ec7724c3b19c14cb73a72fa62c11e77389a953c73c0ca1a31ab2","observation_id":"33675c2e-1086-4084-9b9f-8670baea0a5d","resolution":{"observed_at":"2026-08-12T11:23:39.992127Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:23:39.959782Z","title":"Hierarchical text-conditional image gener- ation with clip latents","venue":null,"work_id":"f5b74eff-05f4-4196-ab4a-638c2bb314f8","year":null},"citing_paper":{"arxiv_id":"2411.18301","last_updated":"2024-11-27T12:47:06Z","snapshot_observed_at":"2026-08-14T15:46:18.711516Z","submitted_at":"2024-11-27T12:47:06Z","title":"Enhancing MMDiT-Based Text-to-Image Models for Similar Subject Generation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-12T11:23:38.817211Z"},"links":{"citing_paper":"/paper/2411.18301"},"observation_digest":"sha256:5f40f760fe6d8049121679c615e6b29a2cee45e062d731baa987888ae2107e58","observation_id":"4d9d0ce6-8b5b-413d-a542-f780ee614bf0","resolution":{"observed_at":"2026-08-12T11:23:39.977758Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:23:39.827302Z","title":"Linguistic bind- ing in diffusion models: Enhancing attribute correspondence through attention map alignment","venue":null,"work_id":"b0f46695-c48b-4219-8a0a-7fb62f8ffdd2","year":2024},"citing_paper":{"arxiv_id":"2411.18301","last_updated":"2024-11-27T12:47:06Z","snapshot_observed_at":"2026-08-14T15:46:18.711516Z","submitted_at":"2024-11-27T12:47:06Z","title":"Enhancing MMDiT-Based Text-to-Image Models for Similar Subject Generation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-12T11:23:38.822841Z"},"links":{"citing_paper":"/paper/2411.18301"},"observation_digest":"sha256:cf75053e7ed3314b59e5fd5b713527df1e55a72f9563ccead45bc940f02ee961","observation_id":"bbd40059-bcac-475d-9ee8-36fcaa52e920","resolution":{"observed_at":"2026-08-12T11:23:39.893358Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:23:38.826536Z","title":"High-resolution image synthesis with latent diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.18301","last_updated":"2024-11-27T12:47:06Z","snapshot_observed_at":"2026-08-14T15:46:18.711516Z","submitted_at":"2024-11-27T12:47:06Z","title":"Enhancing MMDiT-Based Text-to-Image Models for Similar Subject Generation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-12T11:23:38.826536Z"},"links":{"citing_paper":"/paper/2411.18301"},"observation_digest":"sha256:7958fd85411daebada1bba14fc631ff64bded0a9ae0e05f368cab18334717704","observation_id":"3dcf6604-d04d-4d1a-a5cb-732fd86de452","resolution":{"observed_at":"2026-08-12T11:23:38.826536Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:23:38.829757Z","title":"U- net: Convolutional networks for biomedical image segmen- tation","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2411.18301","last_updated":"2024-11-27T12:47:06Z","snapshot_observed_at":"2026-08-14T15:46:18.711516Z","submitted_at":"2024-11-27T12:47:06Z","title":"Enhancing MMDiT-Based Text-to-Image Models for Similar Subject Generation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-12T11:23:38.829757Z"},"links":{"citing_paper":"/paper/2411.18301"},"observation_digest":"sha256:be52798eff1fcf2d9d20148fad375085fac053f01c89b64fb7f558991597447b","observation_id":"b67d03b8-8170-4235-af1c-9b8d201f5b6d","resolution":{"observed_at":"2026-08-12T11:23:38.829757Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:23:39.797215Z","title":"Photorealistic text-to-image diffusion models with deep language understanding","venue":null,"work_id":"eb00edd5-1d4e-4186-98a9-d62dca4d414e","year":2022},"citing_paper":{"arxiv_id":"2411.18301","last_updated":"2024-11-27T12:47:06Z","snapshot_observed_at":"2026-08-14T15:46:18.711516Z","submitted_at":"2024-11-27T12:47:06Z","title":"Enhancing MMDiT-Based Text-to-Image Models for Similar Subject Generation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-12T11:23:38.833381Z"},"links":{"citing_paper":"/paper/2411.18301"},"observation_digest":"sha256:30366744f050fe1665eed9fe566ae6353c5cffebbdfc06aa7e7e46a0ba060fed","observation_id":"833800c9-b2ad-4aa3-8cf2-26678c44e1f4","resolution":{"observed_at":"2026-08-12T11:23:39.801556Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:23:39.784149Z","title":"Denois- ing diffusion implicit models","venue":null,"work_id":"5d59d41b-c059-48d6-8056-b5eae2daca32","year":null},"citing_paper":{"arxiv_id":"2411.18301","last_updated":"2024-11-27T12:47:06Z","snapshot_observed_at":"2026-08-14T15:46:18.711516Z","submitted_at":"2024-11-27T12:47:06Z","title":"Enhancing MMDiT-Based Text-to-Image Models for Similar Subject Generation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-12T11:23:38.837770Z"},"links":{"citing_paper":"/paper/2411.18301"},"observation_digest":"sha256:97d63aa3311581a04c99d4d1ff91c421b094982017054f9d30114b06ef08c366","observation_id":"23863b69-e10b-4b33-8ced-ae041f090424","resolution":{"observed_at":"2026-08-12T11:23:39.788266Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:23:39.772046Z","title":"Predicated diffusion: Predicate logic-based attention guidance for text-to-image diffusion models","venue":null,"work_id":"f6ff609f-29c4-4ddc-98d6-00e693bd88c1","year":2024},"citing_paper":{"arxiv_id":"2411.18301","last_updated":"2024-11-27T12:47:06Z","snapshot_observed_at":"2026-08-14T15:46:18.711516Z","submitted_at":"2024-11-27T12:47:06Z","title":"Enhancing MMDiT-Based Text-to-Image Models for Similar Subject Generation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-12T11:23:38.842029Z"},"links":{"citing_paper":"/paper/2411.18301"},"observation_digest":"sha256:9497add06e1134e939fa37328cf077c530672fe0fbafa30a9921146f977926d9","observation_id":"d781a978-54d4-47d8-bc54-39682746c2ee","resolution":{"observed_at":"2026-08-12T11:23:39.775875Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:23:39.758231Z","title":"Diffu- siondb: A large-scale prompt gallery dataset for text-to- image generative models","venue":null,"work_id":"dcd90476-0285-4b51-93c3-22fe27a103f4","year":2023},"citing_paper":{"arxiv_id":"2411.18301","last_updated":"2024-11-27T12:47:06Z","snapshot_observed_at":"2026-08-14T15:46:18.711516Z","submitted_at":"2024-11-27T12:47:06Z","title":"Enhancing MMDiT-Based Text-to-Image Models for Similar Subject Generation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-12T11:23:38.845366Z"},"links":{"citing_paper":"/paper/2411.18301"},"observation_digest":"sha256:aaea6b80a6cb57e4e20fd5149e75f0716e296a09fabe75db6465db7d14057598","observation_id":"0935ab0c-1cbc-422a-a4a6-4218777fd227","resolution":{"observed_at":"2026-08-12T11:23:39.762730Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:23:39.745918Z","title":"Hairclipv2: Unifying hair editing via proxy feature blending","venue":null,"work_id":"d6278de7-4594-46ca-9571-76795851168a","year":2023},"citing_paper":{"arxiv_id":"2411.18301","last_updated":"2024-11-27T12:47:06Z","snapshot_observed_at":"2026-08-14T15:46:18.711516Z","submitted_at":"2024-11-27T12:47:06Z","title":"Enhancing MMDiT-Based Text-to-Image Models for Similar Subject Generation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-12T11:23:38.848565Z"},"links":{"citing_paper":"/paper/2411.18301"},"observation_digest":"sha256:f129bdc76cef8960b64e7979df3f2f05e1e019d57dd643ca22650900a2ba1107","observation_id":"eaeb710e-71b3-4f0b-ba2c-9a265ee8c7ff","resolution":{"observed_at":"2026-08-12T11:23:39.749619Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.15462","last_updated":"2022-11-21T07:07:19Z","snapshot_observed_at":"2026-08-16T16:14:39.476525Z","submitted_at":"2022-11-21T07:07:19Z","title":"Investigating Prompt Engineering in Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.15462","snapshot_observed_at":"2026-08-12T11:23:38.935021Z","title":"Investigating prompt engineering in diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.18301","last_updated":"2024-11-27T12:47:06Z","snapshot_observed_at":"2026-08-14T15:46:18.711516Z","submitted_at":"2024-11-27T12:47:06Z","title":"Enhancing MMDiT-Based Text-to-Image Models for Similar Subject Generation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-12T11:23:38.935021Z"},"links":{"cited_paper":"/paper/2211.15462","citing_paper":"/paper/2411.18301"},"observation_digest":"sha256:0428ef868dc790bfa60d5a9f169c0b4a8fb015a06c5ceea3a6c42f03c64f4d48","observation_id":"386e4eb0-ce3a-4e38-9ec9-68c1cb288040","resolution":{"observed_at":"2026-08-12T11:23:38.935021Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:23:39.031605Z","title":"Attngan: Fine- grained text to image generation with attentional generative adversarial networks","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2411.18301","last_updated":"2024-11-27T12:47:06Z","snapshot_observed_at":"2026-08-14T15:46:18.711516Z","submitted_at":"2024-11-27T12:47:06Z","title":"Enhancing MMDiT-Based Text-to-Image Models for Similar Subject Generation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-12T11:23:39.031605Z"},"links":{"citing_paper":"/paper/2411.18301"},"observation_digest":"sha256:4935e720fd080793c90819701fda0d085e4505369ed5beaabd957744c3735098","observation_id":"a3b47955-6427-45c6-b4fa-3806bf67e7cf","resolution":{"observed_at":"2026-08-12T11:23:39.031605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:23:39.657811Z","title":"Scaling autoregressive models for content-rich text-to-image generation","venue":null,"work_id":"2810c19b-ad5e-4880-9bc7-c2e28170cd64","year":2022},"citing_paper":{"arxiv_id":"2411.18301","last_updated":"2024-11-27T12:47:06Z","snapshot_observed_at":"2026-08-14T15:46:18.711516Z","submitted_at":"2024-11-27T12:47:06Z","title":"Enhancing MMDiT-Based Text-to-Image Models for Similar Subject Generation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-12T11:23:39.099350Z"},"links":{"citing_paper":"/paper/2411.18301"},"observation_digest":"sha256:467005162a81faee9be62de69bd513509418c22046eb97b38c6e298dc337f960","observation_id":"3937ba5c-5a9e-4c13-9691-b1a363dc67b4","resolution":{"observed_at":"2026-08-12T11:23:39.706860Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:23:39.127432Z","title":"Cross-modal contrastive learning for text-to- image generation","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.18301","last_updated":"2024-11-27T12:47:06Z","snapshot_observed_at":"2026-08-14T15:46:18.711516Z","submitted_at":"2024-11-27T12:47:06Z","title":"Enhancing MMDiT-Based Text-to-Image Models for Similar Subject Generation","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-12T11:23:39.127432Z"},"links":{"citing_paper":"/paper/2411.18301"},"observation_digest":"sha256:415e3dba0d6b5a28301cf2e9053f6b29c8ea9001602dc2882a91f013918fff5f","observation_id":"4a5d5aa7-326c-437b-b9d7-3813dbe6e9f3","resolution":{"observed_at":"2026-08-12T11:23:39.127432Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:23:39.562769Z","title":"Enhancing semantic fidelity in text- to-image synthesis: Attention regulation in diffusion mod- els","venue":null,"work_id":"43cc62fb-8540-4cf3-ab80-b00260f9f3ba","year":null},"citing_paper":{"arxiv_id":"2411.18301","last_updated":"2024-11-27T12:47:06Z","snapshot_observed_at":"2026-08-14T15:46:18.711516Z","submitted_at":"2024-11-27T12:47:06Z","title":"Enhancing MMDiT-Based Text-to-Image Models for Similar Subject Generation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-12T11:23:39.172903Z"},"links":{"citing_paper":"/paper/2411.18301"},"observation_digest":"sha256:9962bb33948eff5d3ec152bf9374f5d59b6b8a0ad17cebe3100a969613ee0071","observation_id":"34a71818-393a-4627-8d68-66ed0062a84a","resolution":{"observed_at":"2026-08-12T11:23:39.567076Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:23:39.545879Z","title":"Object- conditioned energy-based attention map alignment in text-to- image diffusion models","venue":null,"work_id":"4f180655-2c41-4df6-8c04-cefee0099860","year":2024},"citing_paper":{"arxiv_id":"2411.18301","last_updated":"2024-11-27T12:47:06Z","snapshot_observed_at":"2026-08-14T15:46:18.711516Z","submitted_at":"2024-11-27T12:47:06Z","title":"Enhancing MMDiT-Based Text-to-Image Models for Similar Subject Generation","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-12T11:23:39.177983Z"},"links":{"citing_paper":"/paper/2411.18301"},"observation_digest":"sha256:ebf9b08382298848d27adaf41d934ccea17a75929cbeadda1874c387c5c961df","observation_id":"9d8882ee-abb8-4a05-8a66-9349763eba9c","resolution":{"observed_at":"2026-08-12T11:23:39.551247Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:23:39.532408Z","title":null,"venue":null,"work_id":"1091dbf1-a761-42b4-a078-5e542f86d268","year":null},"citing_paper":{"arxiv_id":"2411.18301","last_updated":"2024-11-27T12:47:06Z","snapshot_observed_at":"2026-08-14T15:46:18.711516Z","submitted_at":"2024-11-27T12:47:06Z","title":"Enhancing MMDiT-Based Text-to-Image Models for Similar Subject Generation","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-12T11:23:39.182240Z"},"links":{"citing_paper":"/paper/2411.18301"},"observation_digest":"sha256:2e9f06905e0ca58c4b269cd1780ccee8844ebfce6c3a5c9e561d02e8672305ff","observation_id":"f5e1e28f-bba3-4172-917f-852acd81b526","resolution":{"observed_at":"2026-08-12T11:23:39.536358Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:23:39.518787Z","title":"a chicken and a duck and a goose","venue":null,"work_id":"6f4bdd7c-b1b0-4b6c-b36d-330c1da94e17","year":null},"citing_paper":{"arxiv_id":"2411.18301","last_updated":"2024-11-27T12:47:06Z","snapshot_observed_at":"2026-08-14T15:46:18.711516Z","submitted_at":"2024-11-27T12:47:06Z","title":"Enhancing MMDiT-Based Text-to-Image Models for Similar Subject Generation","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-12T11:23:39.186305Z"},"links":{"citing_paper":"/paper/2411.18301"},"observation_digest":"sha256:e177cdaa9893c74b4a1a5ec2e7b425cc049be8cf8d3fec313f3b492315be36e2","observation_id":"6a8b929b-d4ec-465c-8218-775c44242288","resolution":{"observed_at":"2026-08-12T11:23:39.523545Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:23:39.428054Z","title":null,"venue":null,"work_id":"2f7aae54-320c-44e4-91c2-c6634652daca","year":null},"citing_paper":{"arxiv_id":"2411.18301","last_updated":"2024-11-27T12:47:06Z","snapshot_observed_at":"2026-08-14T15:46:18.711516Z","submitted_at":"2024-11-27T12:47:06Z","title":"Enhancing MMDiT-Based Text-to-Image Models for Similar Subject Generation","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-12T11:23:39.190833Z"},"links":{"citing_paper":"/paper/2411.18301"},"observation_digest":"sha256:04c805df27623d822580ecf29770c59a7ec10bf19b249f0cf63aabf5d67c2c8e","observation_id":"265dfc8c-1306-4a5d-bcba-b7c41d48760d","resolution":{"observed_at":"2026-08-12T11:23:39.472133Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:23:39.292313Z","title":"Bad seed, rejected sampling!","venue":null,"work_id":"52ef9266-4164-4255-9f69-06f8aaafdd9f","year":null},"citing_paper":{"arxiv_id":"2411.18301","last_updated":"2024-11-27T12:47:06Z","snapshot_observed_at":"2026-08-14T15:46:18.711516Z","submitted_at":"2024-11-27T12:47:06Z","title":"Enhancing MMDiT-Based Text-to-Image Models for Similar Subject Generation","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-12T11:23:39.194911Z"},"links":{"citing_paper":"/paper/2411.18301"},"observation_digest":"sha256:ccaa2e3cb26b6884bcea6197819c7025029870befb9a2289adc6e414b8dab253","observation_id":"9e4b1081-bce4-4cd1-9985-1ab3b9884c33","resolution":{"observed_at":"2026-08-12T11:23:39.353278Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:23:40.034217Z","title":"7, 8, 12","venue":null,"work_id":"fec13377-c7bd-4f8f-8ce4-e232046b7414","year":2024},"citing_paper":{"arxiv_id":"2411.18301","last_updated":"2024-11-27T12:47:06Z","snapshot_observed_at":"2026-08-14T15:46:18.711516Z","submitted_at":"2024-11-27T12:47:06Z","title":"Enhancing MMDiT-Based Text-to-Image Models for Similar Subject Generation","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-12T11:23:38.637135Z"},"links":{"citing_paper":"/paper/2411.18301"},"observation_digest":"sha256:93b29e85594bae00db5fc11c7493078deb183a8d6f6c7df70f812e63e9dfe85a","observation_id":"d0ead241-0e83-4425-a886-40783f5d320b","resolution":{"observed_at":"2026-08-12T11:23:40.041015Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2411.18301","last_updated":"2024-11-27T12:47:06Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-14T15:46:18.711516Z","submitted_at":"2024-11-27T12:47:06Z","title":"Enhancing MMDiT-Based Text-to-Image Models for Similar Subject Generation"},"reference_resolution":{"displayed":48,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":23,"verified_exact":0,"verified_fuzzy":24},"total_outbound_references":48},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 16 August 2026, this Paper Citation Record lists 48 of 48 outbound references and 6 inbound Pith citation observations for arXiv:2411.18301."}