{"as_of":"2026-08-18T05:15:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a37ccd9e333501fef1613b6df422d288766abe9046f6cf88b73d61fd1236cce7","coverage":[{"denominator":65,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":65,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T10:46:55.077302Z","state":"measured"},{"denominator":66,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":66,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T00:48:07.360602Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-07T00:48:09.935086Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2411.18936","last_updated":"2025-03-24T19:58:03Z","snapshot_observed_at":"2026-08-15T23:35:40.048462Z","submitted_at":"2024-11-28T05:58:03Z","title":"Self-Cross Diffusion Guidance for Text-to-Image Synthesis of Similar Subjects","version":2},"cited_work":{"arxiv_id":"2411.18936","doi":null,"metadata_source":"pith","pith_arxiv_id":"2411.18936","snapshot_observed_at":"2026-08-07T00:48:09.935086Z","title":"Self-Cross Diffusion Guidance for Text-to-Image Synthesis of Similar Subjects","venue":"cs.CV","work_id":"d522338b-5589-495b-ae08-9ccbf5250420","year":2024},"citing_paper":{"arxiv_id":"2506.12633","last_updated":"2025-06-14T21:25:08Z","snapshot_observed_at":"2026-08-16T14:15:52.428508Z","submitted_at":"2025-06-14T21:25:08Z","title":"Performance Plateaus in Inference-Time Scaling for Text-to-Image Diffusion Without External Models","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T00:48:07.360602Z"},"links":{"cited_paper":"/paper/2411.18936","citing_paper":"/paper/2506.12633"},"observation_digest":"sha256:be12c7b2afe7238c2a4fdc345984c101433688092436d5d36c88fc923ed42bb1","observation_id":"8e26f502-36de-45d3-84c9-5f0333ae9fb3","resolution":{"observed_at":"2026-08-07T00:48:10.022788Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2411.18936/citation-record","integrity":"/paper/2411.18936/integrity","json":"/paper/2411.18936/citation-record.json","paper":"/paper/2411.18936"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-17T09:58:46.058102Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-12T10:46:54.852033Z","title":"Gpt-4 technical report","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.18936","last_updated":"2025-03-24T19:58:03Z","snapshot_observed_at":"2026-08-15T23:35:40.048462Z","submitted_at":"2024-11-28T05:58:03Z","title":"Self-Cross Diffusion Guidance for Text-to-Image Synthesis of Similar Subjects","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T10:46:54.852033Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2411.18936"},"observation_digest":"sha256:d2c93f623ccce27afcd905e1c00a428998c744f27cb5d52ebbd489ea2bbf732d","observation_id":"867b2174-f76d-4873-900d-be8b5d3c69f9","resolution":{"observed_at":"2026-08-12T10:46:54.852033Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:46:55.663816Z","title":"A-star: Test-time attention segregation and retention for text-to-image synthesis","venue":null,"work_id":"33803962-d214-4a31-b545-9a03e1d73479","year":2023},"citing_paper":{"arxiv_id":"2411.18936","last_updated":"2025-03-24T19:58:03Z","snapshot_observed_at":"2026-08-15T23:35:40.048462Z","submitted_at":"2024-11-28T05:58:03Z","title":"Self-Cross Diffusion Guidance for Text-to-Image Synthesis of Similar Subjects","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T10:46:54.856579Z"},"links":{"citing_paper":"/paper/2411.18936"},"observation_digest":"sha256:47a506cdaf1983d5ddbe2f244c1059cceff3299f1ce6b16382a771e591b7148a","observation_id":"27941070-00c5-4cb4-a400-6cdb83350e1b","resolution":{"observed_at":"2026-08-12T10:46:55.667455Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:46:55.652854Z","title":"Separate-and-enhance: Compo- sitional finetuning for text2image diffusion models","venue":null,"work_id":"57a9fe22-4dff-4384-9123-202bb5b0dd66","year":2024},"citing_paper":{"arxiv_id":"2411.18936","last_updated":"2025-03-24T19:58:03Z","snapshot_observed_at":"2026-08-15T23:35:40.048462Z","submitted_at":"2024-11-28T05:58:03Z","title":"Self-Cross Diffusion Guidance for Text-to-Image Synthesis of Similar Subjects","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T10:46:54.860537Z"},"links":{"citing_paper":"/paper/2411.18936"},"observation_digest":"sha256:0dcfc1e88a98e3ac4eee7f57b836f152c54478178a531733c5f995700d126d86","observation_id":"e0cdd8dd-c864-4308-9bd8-79dd30cb69bd","resolution":{"observed_at":"2026-08-12T10:46:55.656574Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:46:54.864734Z","title":"Improving image generation with better captions","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.18936","last_updated":"2025-03-24T19:58:03Z","snapshot_observed_at":"2026-08-15T23:35:40.048462Z","submitted_at":"2024-11-28T05:58:03Z","title":"Self-Cross Diffusion Guidance for Text-to-Image Synthesis of Similar Subjects","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T10:46:54.864734Z"},"links":{"citing_paper":"/paper/2411.18936"},"observation_digest":"sha256:d9abfca762b07fd4325590e626134189fa8bbe37089c757373586b8edcbea97f","observation_id":"d86b3594-ba4f-4313-bf25-612c40810975","resolution":{"observed_at":"2026-08-12T10:46:54.864734Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:46:54.868259Z","title":"Video generation models as world simulators","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.18936","last_updated":"2025-03-24T19:58:03Z","snapshot_observed_at":"2026-08-15T23:35:40.048462Z","submitted_at":"2024-11-28T05:58:03Z","title":"Self-Cross Diffusion Guidance for Text-to-Image Synthesis of Similar Subjects","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T10:46:54.868259Z"},"links":{"citing_paper":"/paper/2411.18936"},"observation_digest":"sha256:8fd3b0ce163767911d328bcdf363d7ed1e8aa1d963622c802727d9cd2bdb11bb","observation_id":"759e9d3b-a68b-44c3-b6ad-9b681a367431","resolution":{"observed_at":"2026-08-12T10:46:54.868259Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:46:54.871683Z","title":"Masactrl: Tuning-free mu- tual self-attention control for consistent image synthesis and editing","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.18936","last_updated":"2025-03-24T19:58:03Z","snapshot_observed_at":"2026-08-15T23:35:40.048462Z","submitted_at":"2024-11-28T05:58:03Z","title":"Self-Cross Diffusion Guidance for Text-to-Image Synthesis of Similar Subjects","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-12T10:46:54.871683Z"},"links":{"citing_paper":"/paper/2411.18936"},"observation_digest":"sha256:6da1392cd9e73b47b959a1e0ab03fe9bf81e29e19c48f0ae2231e1e1e28f8f40","observation_id":"63e19866-2722-445d-9fd5-6ecdb1430584","resolution":{"observed_at":"2026-08-12T10:46:54.871683Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:46:55.623209Z","title":"Freeman, Michael Ru- binstein, Yuanzhen Li, and Dilip Krishnan","venue":null,"work_id":"1cf2b13f-d4a6-4820-ad37-70d808779a93","year":2023},"citing_paper":{"arxiv_id":"2411.18936","last_updated":"2025-03-24T19:58:03Z","snapshot_observed_at":"2026-08-15T23:35:40.048462Z","submitted_at":"2024-11-28T05:58:03Z","title":"Self-Cross Diffusion Guidance for Text-to-Image Synthesis of Similar Subjects","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T10:46:54.875117Z"},"links":{"citing_paper":"/paper/2411.18936"},"observation_digest":"sha256:b7f27497f9036ee321c5a38361e9c436039259f396749fde247b1463fb80ef4d","observation_id":"12541d63-38f5-4e89-88b2-dac1e68a4a9e","resolution":{"observed_at":"2026-08-12T10:46:55.627125Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:46:55.612826Z","title":"Attend-and-excite: Attention-based se- mantic guidance for text-to-image diffusion models","venue":null,"work_id":"d831afab-ae6b-4465-ba43-183bd3efd292","year":2023},"citing_paper":{"arxiv_id":"2411.18936","last_updated":"2025-03-24T19:58:03Z","snapshot_observed_at":"2026-08-15T23:35:40.048462Z","submitted_at":"2024-11-28T05:58:03Z","title":"Self-Cross Diffusion Guidance for Text-to-Image Synthesis of Similar Subjects","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T10:46:54.878462Z"},"links":{"citing_paper":"/paper/2411.18936"},"observation_digest":"sha256:47c74bb0f6b934d20fbf18881e3389c959d7e94999fc87c621a3ff4e6eb8bd5f","observation_id":"e94a5149-afc3-4dab-a174-8cc33276a1f2","resolution":{"observed_at":"2026-08-12T10:46:55.616520Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:46:54.881670Z","title":"Diffusion models beat gans on image synthesis","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.18936","last_updated":"2025-03-24T19:58:03Z","snapshot_observed_at":"2026-08-15T23:35:40.048462Z","submitted_at":"2024-11-28T05:58:03Z","title":"Self-Cross Diffusion Guidance for Text-to-Image Synthesis of Similar Subjects","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T10:46:54.881670Z"},"links":{"citing_paper":"/paper/2411.18936"},"observation_digest":"sha256:2c4ff25dd3ae37fcfb8c22c44d667651c610e725ec3cddd151ed82e1a34c6ecc","observation_id":"0fcc0d7c-14be-4f2d-aaed-56f4a2dabbbc","resolution":{"observed_at":"2026-08-12T10:46:54.881670Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:46:54.885388Z","title":"Cogview: Mastering text-to-image generation via transformers","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.18936","last_updated":"2025-03-24T19:58:03Z","snapshot_observed_at":"2026-08-15T23:35:40.048462Z","submitted_at":"2024-11-28T05:58:03Z","title":"Self-Cross Diffusion Guidance for Text-to-Image Synthesis of Similar Subjects","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-12T10:46:54.885388Z"},"links":{"citing_paper":"/paper/2411.18936"},"observation_digest":"sha256:692eb3bee9031a528bc23635058b96c3d28a64d880ea90e79e95b38348b8943e","observation_id":"1470ac48-1ead-4def-a714-1e42fe523b5c","resolution":{"observed_at":"2026-08-12T10:46:54.885388Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:46:54.889094Z","title":"Cogview2: Faster and better text-to-image generation via hierarchical transformers","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.18936","last_updated":"2025-03-24T19:58:03Z","snapshot_observed_at":"2026-08-15T23:35:40.048462Z","submitted_at":"2024-11-28T05:58:03Z","title":"Self-Cross Diffusion Guidance for Text-to-Image Synthesis of Similar Subjects","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T10:46:54.889094Z"},"links":{"citing_paper":"/paper/2411.18936"},"observation_digest":"sha256:6aef2c4ce3b8c3eb263877d139a3dfc671ff3ef7a9e6aa9266edb9e9d3cd5162","observation_id":"73113ef5-4ee5-423f-8111-852a966c16c3","resolution":{"observed_at":"2026-08-12T10:46:54.889094Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:46:54.892657Z","title":"Diffusion self-guidance for control- lable image generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.18936","last_updated":"2025-03-24T19:58:03Z","snapshot_observed_at":"2026-08-15T23:35:40.048462Z","submitted_at":"2024-11-28T05:58:03Z","title":"Self-Cross Diffusion Guidance for Text-to-Image Synthesis of Similar Subjects","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T10:46:54.892657Z"},"links":{"citing_paper":"/paper/2411.18936"},"observation_digest":"sha256:e5e7ba3c28941d5566a7cffd1a0cdbc4a9abc1e1319ea26d366ab6775cc0bbaf","observation_id":"864d09cc-ae67-4797-9c84-e90360443a79","resolution":{"observed_at":"2026-08-12T10:46:54.892657Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:46:55.576922Z","title":"Scaling recti- fied flow transformers for high-resolution image synthesis","venue":null,"work_id":"2c4fd587-1e2e-485f-b470-d239c75c2ba8","year":2024},"citing_paper":{"arxiv_id":"2411.18936","last_updated":"2025-03-24T19:58:03Z","snapshot_observed_at":"2026-08-15T23:35:40.048462Z","submitted_at":"2024-11-28T05:58:03Z","title":"Self-Cross Diffusion Guidance for Text-to-Image Synthesis of Similar Subjects","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-12T10:46:54.896048Z"},"links":{"citing_paper":"/paper/2411.18936"},"observation_digest":"sha256:fe48ff465f041a52aaf4062578d4c3e311fcf9a5ec090e4f1648a9ddb11c6604","observation_id":"c3d5f95c-4055-4340-844a-7f798fa8e773","resolution":{"observed_at":"2026-08-12T10:46:55.580674Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:46:54.899545Z","title":"Make-a-scene: Scene- based text-to-image generation with human priors","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.18936","last_updated":"2025-03-24T19:58:03Z","snapshot_observed_at":"2026-08-15T23:35:40.048462Z","submitted_at":"2024-11-28T05:58:03Z","title":"Self-Cross Diffusion Guidance for Text-to-Image Synthesis of Similar Subjects","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T10:46:54.899545Z"},"links":{"citing_paper":"/paper/2411.18936"},"observation_digest":"sha256:643e30cc372dcaaf4883a7069429b9516f14b1b583946e7847750c7325ee2672","observation_id":"97093992-3930-40c8-ac6d-4bf0e379f2bb","resolution":{"observed_at":"2026-08-12T10:46:54.899545Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:46:55.560677Z","title":"Expressive text-to-image generation with rich text","venue":null,"work_id":"59a69a7c-1fa9-478c-94fc-7f978af6f604","year":2023},"citing_paper":{"arxiv_id":"2411.18936","last_updated":"2025-03-24T19:58:03Z","snapshot_observed_at":"2026-08-15T23:35:40.048462Z","submitted_at":"2024-11-28T05:58:03Z","title":"Self-Cross Diffusion Guidance for Text-to-Image Synthesis of Similar Subjects","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T10:46:54.902807Z"},"links":{"citing_paper":"/paper/2411.18936"},"observation_digest":"sha256:196139de72423d49e1c8cca8f691d371661d509439cf3047927c958686f462f6","observation_id":"e6c6f8fa-2774-4b29-8ee4-4131d092d389","resolution":{"observed_at":"2026-08-12T10:46:55.564514Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:46:54.906003Z","title":"Generative adversarial nets","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2411.18936","last_updated":"2025-03-24T19:58:03Z","snapshot_observed_at":"2026-08-15T23:35:40.048462Z","submitted_at":"2024-11-28T05:58:03Z","title":"Self-Cross Diffusion Guidance for Text-to-Image Synthesis of Similar Subjects","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T10:46:54.906003Z"},"links":{"citing_paper":"/paper/2411.18936"},"observation_digest":"sha256:a4d05d99aa427b5f5596efda1e197b1c6cd5881cd3b3cb1853ef5bc4e0a5b0df","observation_id":"33135ddf-8a47-4304-8cc9-ea051ab99c48","resolution":{"observed_at":"2026-08-12T10:46:54.906003Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:46:55.545685Z","title":"Initno: Boosting text-to-image diffu- sion models via initial noise optimization","venue":null,"work_id":"9159088a-85c4-4dc1-bb7e-9dc6f3597545","year":2024},"citing_paper":{"arxiv_id":"2411.18936","last_updated":"2025-03-24T19:58:03Z","snapshot_observed_at":"2026-08-15T23:35:40.048462Z","submitted_at":"2024-11-28T05:58:03Z","title":"Self-Cross Diffusion Guidance for Text-to-Image Synthesis of Similar Subjects","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T10:46:54.909153Z"},"links":{"citing_paper":"/paper/2411.18936"},"observation_digest":"sha256:a37aacad96595fc4847cd9db2468378d566300144ec02ac358bd30645d770816","observation_id":"2637f5ab-5837-412d-95c0-86fcc92028ee","resolution":{"observed_at":"2026-08-12T10:46:55.549133Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:46:55.535442Z","title":"Prompt-to-prompt image editing with cross attention control","venue":null,"work_id":"77125d85-1c85-4e97-97d4-721e9b100c7c","year":2022},"citing_paper":{"arxiv_id":"2411.18936","last_updated":"2025-03-24T19:58:03Z","snapshot_observed_at":"2026-08-15T23:35:40.048462Z","submitted_at":"2024-11-28T05:58:03Z","title":"Self-Cross Diffusion Guidance for Text-to-Image Synthesis of Similar Subjects","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-12T10:46:54.912354Z"},"links":{"citing_paper":"/paper/2411.18936"},"observation_digest":"sha256:ada6c4e2caa465765347dc8d998ffe607ed402fac16eb8595d295026ca01ac1c","observation_id":"addfdf03-a8ca-4ed7-aba0-a5ebc9e224e9","resolution":{"observed_at":"2026-08-12T10:46:55.538961Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:46:54.915620Z","title":"Prompt-to-prompt image editing with cross-attention control","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.18936","last_updated":"2025-03-24T19:58:03Z","snapshot_observed_at":"2026-08-15T23:35:40.048462Z","submitted_at":"2024-11-28T05:58:03Z","title":"Self-Cross Diffusion Guidance for Text-to-Image Synthesis of Similar Subjects","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T10:46:54.915620Z"},"links":{"citing_paper":"/paper/2411.18936"},"observation_digest":"sha256:ebfcc37558fa559dc83f8d4f2db3d314fa2434d4098b32fdc0a57bd9dbceaa0a","observation_id":"4ec12c56-1edf-4a05-b302-5d5560a40d7d","resolution":{"observed_at":"2026-08-12T10:46:54.915620Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.12598","last_updated":"2022-07-26T01:42:07Z","snapshot_observed_at":"2026-08-14T06:37:15.299690Z","submitted_at":"2022-07-26T01:42:07Z","title":"Classifier-Free Diffusion Guidance","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.12598","snapshot_observed_at":"2026-08-12T10:46:54.918893Z","title":"Classifier-free diffusion guidance","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.18936","last_updated":"2025-03-24T19:58:03Z","snapshot_observed_at":"2026-08-15T23:35:40.048462Z","submitted_at":"2024-11-28T05:58:03Z","title":"Self-Cross Diffusion Guidance for Text-to-Image Synthesis of Similar Subjects","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-12T10:46:54.918893Z"},"links":{"cited_paper":"/paper/2207.12598","citing_paper":"/paper/2411.18936"},"observation_digest":"sha256:f36fb040e5985d24036a2f42e80377ae05ad6018f9cba2aff3d2c2cfbfa7fe8d","observation_id":"f1ce83cd-b86e-4e33-bcd2-41701f94d255","resolution":{"observed_at":"2026-08-12T10:46:54.918893Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:46:54.922703Z","title":"Denoising dif- fusion probabilistic models","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2411.18936","last_updated":"2025-03-24T19:58:03Z","snapshot_observed_at":"2026-08-15T23:35:40.048462Z","submitted_at":"2024-11-28T05:58:03Z","title":"Self-Cross Diffusion Guidance for Text-to-Image Synthesis of Similar Subjects","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-12T10:46:54.922703Z"},"links":{"citing_paper":"/paper/2411.18936"},"observation_digest":"sha256:afcc628442047272f7f6656ba2989b653687dee54dd1105335ab799ba30dabcb","observation_id":"7e969cce-2b23-445a-b967-4db2721e3494","resolution":{"observed_at":"2026-08-12T10:46:54.922703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:46:55.512909Z","title":"Tifa: Accu- rate and interpretable text-to-image faithfulness evaluation with question answering","venue":null,"work_id":"da3b0f1b-41e5-4d20-ae8e-f9136221a581","year":2023},"citing_paper":{"arxiv_id":"2411.18936","last_updated":"2025-03-24T19:58:03Z","snapshot_observed_at":"2026-08-15T23:35:40.048462Z","submitted_at":"2024-11-28T05:58:03Z","title":"Self-Cross Diffusion Guidance for Text-to-Image Synthesis of Similar Subjects","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-12T10:46:54.926060Z"},"links":{"citing_paper":"/paper/2411.18936"},"observation_digest":"sha256:7954559a2f9530464822b6470f3f6678054687a2e5a57ccb4ca4310f1889842f","observation_id":"40de2e34-552b-4b38-85df-341f1acbe14b","resolution":{"observed_at":"2026-08-12T10:46:55.516535Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06350","last_updated":"2025-03-08T14:57:45Z","snapshot_observed_at":"2026-08-17T00:02:32.691472Z","submitted_at":"2023-07-12T17:59:42Z","title":"T2I-CompBench++: An Enhanced and Comprehensive Benchmark for Compositional Text-to-image Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.06350","snapshot_observed_at":"2026-08-12T10:46:54.929428Z","title":"T2i-compbench: A comprehensive benchmark for open-world compositional text-to-image generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.18936","last_updated":"2025-03-24T19:58:03Z","snapshot_observed_at":"2026-08-15T23:35:40.048462Z","submitted_at":"2024-11-28T05:58:03Z","title":"Self-Cross Diffusion Guidance for Text-to-Image Synthesis of Similar Subjects","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-12T10:46:54.929428Z"},"links":{"cited_paper":"/paper/2307.06350","citing_paper":"/paper/2411.18936"},"observation_digest":"sha256:6a10dc4c46858038d5e993799727fdefd29f3218749bab342a40a2af94b5722f","observation_id":"89063730-bdb9-4440-b5a9-83d0f8c9f11e","resolution":{"observed_at":"2026-08-12T10:46:54.929428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:46:55.502801Z","title":"T2I-CompBench++: An Enhanced and Comprehensive Benchmark for Compositional Text-to- Image Generation","venue":null,"work_id":"2b8991f7-04a0-4af6-967a-3c1aa6e0bafa","year":null},"citing_paper":{"arxiv_id":"2411.18936","last_updated":"2025-03-24T19:58:03Z","snapshot_observed_at":"2026-08-15T23:35:40.048462Z","submitted_at":"2024-11-28T05:58:03Z","title":"Self-Cross Diffusion Guidance for Text-to-Image Synthesis of Similar Subjects","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-12T10:46:54.933157Z"},"links":{"citing_paper":"/paper/2411.18936"},"observation_digest":"sha256:2eaee62064404a73050d2554e26892b1ad4782a4a6f8a31786c887d1a2ff5451","observation_id":"2604f282-a306-4708-b82f-196b4ad2193e","resolution":{"observed_at":"2026-08-12T10:46:55.506458Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:46:55.492076Z","title":"Scal- ing up gans for text-to-image synthesis","venue":null,"work_id":"dda45cf1-f9c1-46a8-864a-ed4657830277","year":2023},"citing_paper":{"arxiv_id":"2411.18936","last_updated":"2025-03-24T19:58:03Z","snapshot_observed_at":"2026-08-15T23:35:40.048462Z","submitted_at":"2024-11-28T05:58:03Z","title":"Self-Cross Diffusion Guidance for Text-to-Image Synthesis of Similar Subjects","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-12T10:46:54.936601Z"},"links":{"citing_paper":"/paper/2411.18936"},"observation_digest":"sha256:41909a64b2395748682a25d68cfafdab979d6beeb0074a7a6361bd35cbfdba1f","observation_id":"e60c0b41-c7df-4726-948a-2fcf08a0e323","resolution":{"observed_at":"2026-08-12T10:46:55.495853Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:46:55.481792Z","title":"Dense text-to-image generation with attention modulation","venue":null,"work_id":"377b6cbb-eb39-4d6f-ad3f-8dd69e0c305b","year":null},"citing_paper":{"arxiv_id":"2411.18936","last_updated":"2025-03-24T19:58:03Z","snapshot_observed_at":"2026-08-15T23:35:40.048462Z","submitted_at":"2024-11-28T05:58:03Z","title":"Self-Cross Diffusion Guidance for Text-to-Image Synthesis of Similar Subjects","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-12T10:46:54.939778Z"},"links":{"citing_paper":"/paper/2411.18936"},"observation_digest":"sha256:97c9d99ca70f4fbf8193595162e645ee194e713feca9abeff25e2080abaae12a","observation_id":"8ef1d3ce-a9d9-4aa7-acf2-5a92555836c5","resolution":{"observed_at":"2026-08-12T10:46:55.485504Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:46:55.471067Z","title":"Autoregressive image generation using residual quantization","venue":null,"work_id":"4acc418b-b07c-4c9c-9490-7037b7a74871","year":2022},"citing_paper":{"arxiv_id":"2411.18936","last_updated":"2025-03-24T19:58:03Z","snapshot_observed_at":"2026-08-15T23:35:40.048462Z","submitted_at":"2024-11-28T05:58:03Z","title":"Self-Cross Diffusion Guidance for Text-to-Image Synthesis of Similar Subjects","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-12T10:46:54.943132Z"},"links":{"citing_paper":"/paper/2411.18936"},"observation_digest":"sha256:161728184399d7728274dabca724ef5f70173dffcf0545820025244aea0caa9b","observation_id":"c5de3cdd-9f9e-448d-936a-e10f5f1708a7","resolution":{"observed_at":"2026-08-12T10:46:55.474750Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:46:54.946616Z","title":"Blip: Bootstrapping language-image pre-training for unified vision-language understanding and generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.18936","last_updated":"2025-03-24T19:58:03Z","snapshot_observed_at":"2026-08-15T23:35:40.048462Z","submitted_at":"2024-11-28T05:58:03Z","title":"Self-Cross Diffusion Guidance for Text-to-Image Synthesis of Similar Subjects","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-12T10:46:54.946616Z"},"links":{"citing_paper":"/paper/2411.18936"},"observation_digest":"sha256:7778138017a24dd92cae89f9c7bcaa33ffa14569d5e7a130570c6914f3a4c6c4","observation_id":"f15c35e0-66c8-4730-8193-b2f9dc0c2330","resolution":{"observed_at":"2026-08-12T10:46:54.946616Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:46:54.950514Z","title":"Pseudo numerical methods for diffusion models on manifolds","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.18936","last_updated":"2025-03-24T19:58:03Z","snapshot_observed_at":"2026-08-15T23:35:40.048462Z","submitted_at":"2024-11-28T05:58:03Z","title":"Self-Cross Diffusion Guidance for Text-to-Image Synthesis of Similar Subjects","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-12T10:46:54.950514Z"},"links":{"citing_paper":"/paper/2411.18936"},"observation_digest":"sha256:ac248fa1dd9d2efb4ae813821d84c9ff4b28430d0740a898c184f7b103625753","observation_id":"ffa5ea6d-4571-4692-9946-82782b49205f","resolution":{"observed_at":"2026-08-12T10:46:54.950514Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:46:54.953603Z","title":"Sdedit: Guided image synthesis and editing with stochastic differential equa- tions","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.18936","last_updated":"2025-03-24T19:58:03Z","snapshot_observed_at":"2026-08-15T23:35:40.048462Z","submitted_at":"2024-11-28T05:58:03Z","title":"Self-Cross Diffusion Guidance for Text-to-Image Synthesis of Similar Subjects","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-12T10:46:54.953603Z"},"links":{"citing_paper":"/paper/2411.18936"},"observation_digest":"sha256:f9c1cbdc57e67f8fcaa141c381fcb4f9c0b7c5c67362b8ee4249421c2a58b042","observation_id":"d17f3bd6-1a0e-49ba-a2df-69e5a10cb0af","resolution":{"observed_at":"2026-08-12T10:46:54.953603Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:46:55.441680Z","title":"Conform: Contrast is all you need for high- fidelity text-to-image diffusion models","venue":null,"work_id":"60a9fc96-b68c-47ef-b4ff-bb700cfbd38a","year":2024},"citing_paper":{"arxiv_id":"2411.18936","last_updated":"2025-03-24T19:58:03Z","snapshot_observed_at":"2026-08-15T23:35:40.048462Z","submitted_at":"2024-11-28T05:58:03Z","title":"Self-Cross Diffusion Guidance for Text-to-Image Synthesis of Similar Subjects","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-12T10:46:54.956899Z"},"links":{"citing_paper":"/paper/2411.18936"},"observation_digest":"sha256:3d9595b97a083ab8aa359183169c64c23454141810d02aaeed17d93862e52dc9","observation_id":"b697ecea-e62b-4fe1-ba2e-cfbb0f5f2868","resolution":{"observed_at":"2026-08-12T10:46:55.445195Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:46:54.960844Z","title":"Freecontrol: Training-free spatial control of any text-to-image diffusion model with any condition","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.18936","last_updated":"2025-03-24T19:58:03Z","snapshot_observed_at":"2026-08-15T23:35:40.048462Z","submitted_at":"2024-11-28T05:58:03Z","title":"Self-Cross Diffusion Guidance for Text-to-Image Synthesis of Similar Subjects","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-12T10:46:54.960844Z"},"links":{"citing_paper":"/paper/2411.18936"},"observation_digest":"sha256:11d5b412d087ac50837f5f0415f3532b9305e88884087da8f5005db56158fa72","observation_id":"adbbb3eb-e8a8-4f6e-bc14-fb9a2c73992d","resolution":{"observed_at":"2026-08-12T10:46:54.960844Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:46:55.425559Z","title":"Improved denoising diffusion probabilistic models","venue":null,"work_id":"62fc0a5f-6b6e-4abb-930d-ef5fbadaaa31","year":2021},"citing_paper":{"arxiv_id":"2411.18936","last_updated":"2025-03-24T19:58:03Z","snapshot_observed_at":"2026-08-15T23:35:40.048462Z","submitted_at":"2024-11-28T05:58:03Z","title":"Self-Cross Diffusion Guidance for Text-to-Image Synthesis of Similar Subjects","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-12T10:46:54.964336Z"},"links":{"citing_paper":"/paper/2411.18936"},"observation_digest":"sha256:675ec634ccb1eca772fdfda48f31f23a77c1a5e9126f57e8488efb95b8e966ce","observation_id":"2ccf1564-2804-4f7b-a964-353676dc680f","resolution":{"observed_at":"2026-08-12T10:46:55.429331Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:46:55.415171Z","title":"A threshold selection method from gray- level histograms","venue":null,"work_id":"0972955a-908a-421b-ac4c-1f488dd18b89","year":1979},"citing_paper":{"arxiv_id":"2411.18936","last_updated":"2025-03-24T19:58:03Z","snapshot_observed_at":"2026-08-15T23:35:40.048462Z","submitted_at":"2024-11-28T05:58:03Z","title":"Self-Cross Diffusion Guidance for Text-to-Image Synthesis of Similar Subjects","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-12T10:46:54.967610Z"},"links":{"citing_paper":"/paper/2411.18936"},"observation_digest":"sha256:4c2a7fbf3578ba96dafeb891bb514f9baefcea2f5ce2e274814ba6d62e4064b7","observation_id":"1122305e-8c16-4e90-a773-f79f73911fd3","resolution":{"observed_at":"2026-08-12T10:46:55.419108Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:46:55.404577Z","title":"Grounded text-to-image synthesis with attention refocusing","venue":null,"work_id":"b96391a8-2beb-4748-8079-2e454b5b8165","year":2024},"citing_paper":{"arxiv_id":"2411.18936","last_updated":"2025-03-24T19:58:03Z","snapshot_observed_at":"2026-08-15T23:35:40.048462Z","submitted_at":"2024-11-28T05:58:03Z","title":"Self-Cross Diffusion Guidance for Text-to-Image Synthesis of Similar Subjects","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-12T10:46:54.970808Z"},"links":{"citing_paper":"/paper/2411.18936"},"observation_digest":"sha256:cdf7333f2fea70e0c31b03395dee5c535a75063a16b259394b5dd4c49488a283","observation_id":"8d48ec44-9e93-478e-a16a-89c2ab7024ae","resolution":{"observed_at":"2026-08-12T10:46:55.408479Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:46:54.974626Z","title":"SDXL: Improving latent diffusion models for high-resolution image synthesis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.18936","last_updated":"2025-03-24T19:58:03Z","snapshot_observed_at":"2026-08-15T23:35:40.048462Z","submitted_at":"2024-11-28T05:58:03Z","title":"Self-Cross Diffusion Guidance for Text-to-Image Synthesis of Similar Subjects","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-12T10:46:54.974626Z"},"links":{"citing_paper":"/paper/2411.18936"},"observation_digest":"sha256:77fbf7e4ecec14404ab6450d725fff8bb1bc2aed80a000b11fb5d7acbf45832c","observation_id":"b31c765b-a960-42f4-bdc8-af40d73bfd53","resolution":{"observed_at":"2026-08-12T10:46:54.974626Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:46:54.977860Z","title":"Dreamfusion: Text-to-3d using 2d diffusion","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.18936","last_updated":"2025-03-24T19:58:03Z","snapshot_observed_at":"2026-08-15T23:35:40.048462Z","submitted_at":"2024-11-28T05:58:03Z","title":"Self-Cross Diffusion Guidance for Text-to-Image Synthesis of Similar Subjects","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-12T10:46:54.977860Z"},"links":{"citing_paper":"/paper/2411.18936"},"observation_digest":"sha256:a9c6698f9c70d490f8f7fd57b764f06c3d9c9cc8b5d1090570d23fac3a4d785d","observation_id":"5729aef0-7f5d-4dbb-a28c-526398b2d8ee","resolution":{"observed_at":"2026-08-12T10:46:54.977860Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:46:54.980882Z","title":"Zero-shot text-to-image generation","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.18936","last_updated":"2025-03-24T19:58:03Z","snapshot_observed_at":"2026-08-15T23:35:40.048462Z","submitted_at":"2024-11-28T05:58:03Z","title":"Self-Cross Diffusion Guidance for Text-to-Image Synthesis of Similar Subjects","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-12T10:46:54.980882Z"},"links":{"citing_paper":"/paper/2411.18936"},"observation_digest":"sha256:97b5b075a6fa22fed5015890dee136ea0cddf1ffff4bd4ccfa269b70517fdd20","observation_id":"c8c9ae3c-326f-4e93-b74e-5807aa627bef","resolution":{"observed_at":"2026-08-12T10:46:54.980882Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:46:55.373803Z","title":"Hierarchical text-conditional image gener- ation with clip latents","venue":null,"work_id":"ca1ee171-d26f-4c7e-9c47-9ef974b1ff87","year":2022},"citing_paper":{"arxiv_id":"2411.18936","last_updated":"2025-03-24T19:58:03Z","snapshot_observed_at":"2026-08-15T23:35:40.048462Z","submitted_at":"2024-11-28T05:58:03Z","title":"Self-Cross Diffusion Guidance for Text-to-Image Synthesis of Similar Subjects","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-12T10:46:54.984187Z"},"links":{"citing_paper":"/paper/2411.18936"},"observation_digest":"sha256:97ecce599a4acccc91ac2bfba2ff8bc5e9b070e538501642918a010b1cf9c567","observation_id":"b00ca42a-6a0a-4b9e-a626-981c2617d325","resolution":{"observed_at":"2026-08-12T10:46:55.377534Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:46:55.363057Z","title":"Linguistic bind- ing in diffusion models: Enhancing attribute correspondence through attention map alignment","venue":null,"work_id":"022abfda-50de-486a-9792-30b51a7b5ef5","year":2024},"citing_paper":{"arxiv_id":"2411.18936","last_updated":"2025-03-24T19:58:03Z","snapshot_observed_at":"2026-08-15T23:35:40.048462Z","submitted_at":"2024-11-28T05:58:03Z","title":"Self-Cross Diffusion Guidance for Text-to-Image Synthesis of Similar Subjects","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-12T10:46:54.987622Z"},"links":{"citing_paper":"/paper/2411.18936"},"observation_digest":"sha256:64674d75d0ad7407938c23233f19186d10e9f0168b6593b26e9e266036b7c544","observation_id":"1d8d80a9-dd33-455b-878f-9d0d1cbe56ca","resolution":{"observed_at":"2026-08-12T10:46:55.366864Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:46:55.351876Z","title":"High-resolution image syn- thesis with latent diffusion models","venue":null,"work_id":"2eec3728-594a-4009-aefd-6111d396a06b","year":2022},"citing_paper":{"arxiv_id":"2411.18936","last_updated":"2025-03-24T19:58:03Z","snapshot_observed_at":"2026-08-15T23:35:40.048462Z","submitted_at":"2024-11-28T05:58:03Z","title":"Self-Cross Diffusion Guidance for Text-to-Image Synthesis of Similar Subjects","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-12T10:46:54.990856Z"},"links":{"citing_paper":"/paper/2411.18936"},"observation_digest":"sha256:8fe6b17d5adc61cbd09ec52e61194d6cfb2ac0fc90d005a08f17c671f473d19d","observation_id":"66ce4b90-e1e4-462a-bed7-82c972521315","resolution":{"observed_at":"2026-08-12T10:46:55.355969Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:46:54.994355Z","title":"U-net: Convolutional networks for biomedical image segmentation","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2411.18936","last_updated":"2025-03-24T19:58:03Z","snapshot_observed_at":"2026-08-15T23:35:40.048462Z","submitted_at":"2024-11-28T05:58:03Z","title":"Self-Cross Diffusion Guidance for Text-to-Image Synthesis of Similar Subjects","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-12T10:46:54.994355Z"},"links":{"citing_paper":"/paper/2411.18936"},"observation_digest":"sha256:6d004068a5f2b5843843639f4dee38548a9aaa0e1e15749c320375518da35dac","observation_id":"be017625-1c41-4d5b-805a-20c273e8204b","resolution":{"observed_at":"2026-08-12T10:46:54.994355Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:46:54.997753Z","title":"Photorealistic text-to-image diffusion models with deep language understanding","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.18936","last_updated":"2025-03-24T19:58:03Z","snapshot_observed_at":"2026-08-15T23:35:40.048462Z","submitted_at":"2024-11-28T05:58:03Z","title":"Self-Cross Diffusion Guidance for Text-to-Image Synthesis of Similar Subjects","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-12T10:46:54.997753Z"},"links":{"citing_paper":"/paper/2411.18936"},"observation_digest":"sha256:62ba198d4ba784e23a52fe54f7b57edd2629099dad983fc4e298105c5cdd1a3b","observation_id":"339bb67e-5ac4-4133-a2b6-34fd8f8bc010","resolution":{"observed_at":"2026-08-12T10:46:54.997753Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:46:55.001605Z","title":"Stylegan-t: Unlocking the power of gans for fast large-scale text-to-image synthesis","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.18936","last_updated":"2025-03-24T19:58:03Z","snapshot_observed_at":"2026-08-15T23:35:40.048462Z","submitted_at":"2024-11-28T05:58:03Z","title":"Self-Cross Diffusion Guidance for Text-to-Image Synthesis of Similar Subjects","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-12T10:46:55.001605Z"},"links":{"citing_paper":"/paper/2411.18936"},"observation_digest":"sha256:3bfe316df74b0e24279255df6e72a48c0c0e07a31523ac154529f4c8838b19ca","observation_id":"45203a6c-627c-4bf2-8787-d74d65110756","resolution":{"observed_at":"2026-08-12T10:46:55.001605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:46:55.322555Z","title":"A picture is worth a thousand words: Principled recaptioning improves image generation, 2023","venue":null,"work_id":"cd746790-91c1-4ab1-a0b7-3c971e830bc2","year":2023},"citing_paper":{"arxiv_id":"2411.18936","last_updated":"2025-03-24T19:58:03Z","snapshot_observed_at":"2026-08-15T23:35:40.048462Z","submitted_at":"2024-11-28T05:58:03Z","title":"Self-Cross Diffusion Guidance for Text-to-Image Synthesis of Similar Subjects","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-12T10:46:55.006091Z"},"links":{"citing_paper":"/paper/2411.18936"},"observation_digest":"sha256:9807c711d622d1a36a5796cf403d59fbcb0f5b4e345c855e49ae662b8f94de96","observation_id":"3162f971-c04b-4ca2-b9b2-215140295e1f","resolution":{"observed_at":"2026-08-12T10:46:55.326214Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:46:55.311715Z","title":"Deep unsupervised learning using nonequilibrium thermodynamics","venue":null,"work_id":"99196985-e5e4-487a-b44b-0b5399d3adf3","year":2015},"citing_paper":{"arxiv_id":"2411.18936","last_updated":"2025-03-24T19:58:03Z","snapshot_observed_at":"2026-08-15T23:35:40.048462Z","submitted_at":"2024-11-28T05:58:03Z","title":"Self-Cross Diffusion Guidance for Text-to-Image Synthesis of Similar Subjects","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-12T10:46:55.009632Z"},"links":{"citing_paper":"/paper/2411.18936"},"observation_digest":"sha256:d8873d43bb33908295d8108e95c65015cf9e72218275af569715d7603671a9f7","observation_id":"14a1f090-b85c-4050-98de-e1b7ff3ba304","resolution":{"observed_at":"2026-08-12T10:46:55.315648Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:46:55.012974Z","title":"Score-based generative modeling through stochastic differential equa- tions","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.18936","last_updated":"2025-03-24T19:58:03Z","snapshot_observed_at":"2026-08-15T23:35:40.048462Z","submitted_at":"2024-11-28T05:58:03Z","title":"Self-Cross Diffusion Guidance for Text-to-Image Synthesis of Similar Subjects","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-12T10:46:55.012974Z"},"links":{"citing_paper":"/paper/2411.18936"},"observation_digest":"sha256:df85cd8df4fc6453db79f64b3b05a013c3d44bbd17987cc2f8748aaa98d7ca3f","observation_id":"a2f10c0d-f0df-4a27-bb82-72cd7c183bd3","resolution":{"observed_at":"2026-08-12T10:46:55.012974Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:46:55.016575Z","title":"Df-gan: A simple and effec- tive baseline for text-to-image synthesis","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.18936","last_updated":"2025-03-24T19:58:03Z","snapshot_observed_at":"2026-08-15T23:35:40.048462Z","submitted_at":"2024-11-28T05:58:03Z","title":"Self-Cross Diffusion Guidance for Text-to-Image Synthesis of Similar Subjects","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-12T10:46:55.016575Z"},"links":{"citing_paper":"/paper/2411.18936"},"observation_digest":"sha256:433f57ea6d938d73956f42ba0f9f394b18d9efcc5b80aa01f193526da37c4124","observation_id":"751b3846-7ff2-4080-9473-7580e8c215c9","resolution":{"observed_at":"2026-08-12T10:46:55.016575Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.18301","last_updated":"2024-11-27T12:47:06Z","snapshot_observed_at":"2026-08-14T15:46:18.711516Z","submitted_at":"2024-11-27T12:47:06Z","title":"Enhancing MMDiT-Based Text-to-Image Models for Similar Subject Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.18301","snapshot_observed_at":"2026-08-12T10:46:55.020093Z","title":"En- hancing mmdit-based text-to-image models for similar sub- ject generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.18936","last_updated":"2025-03-24T19:58:03Z","snapshot_observed_at":"2026-08-15T23:35:40.048462Z","submitted_at":"2024-11-28T05:58:03Z","title":"Self-Cross Diffusion Guidance for Text-to-Image Synthesis of Similar Subjects","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-12T10:46:55.020093Z"},"links":{"cited_paper":"/paper/2411.18301","citing_paper":"/paper/2411.18936"},"observation_digest":"sha256:31bafb9cc200167fc3fd78929cebe17f872beb8c391164ee309c72a829a9c2e2","observation_id":"64cd234c-1b99-421e-83c6-3df2b3ec6c14","resolution":{"observed_at":"2026-08-12T10:46:55.020093Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:46:55.024146Z","title":"Plug-and-play diffusion features for text-driven image-to-image translation","venue":null,"work_id":null,"year":1921},"citing_paper":{"arxiv_id":"2411.18936","last_updated":"2025-03-24T19:58:03Z","snapshot_observed_at":"2026-08-15T23:35:40.048462Z","submitted_at":"2024-11-28T05:58:03Z","title":"Self-Cross Diffusion Guidance for Text-to-Image Synthesis of Similar Subjects","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-12T10:46:55.024146Z"},"links":{"citing_paper":"/paper/2411.18936"},"observation_digest":"sha256:e874dbffc2518425a174e4bc798439e73730eee90a49b5f48dacaf049bb646a0","observation_id":"a2b3a364-427f-4739-a6b3-7933c27d4b65","resolution":{"observed_at":"2026-08-12T10:46:55.024146Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:46:55.027913Z","title":"Attention is all you need","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.18936","last_updated":"2025-03-24T19:58:03Z","snapshot_observed_at":"2026-08-15T23:35:40.048462Z","submitted_at":"2024-11-28T05:58:03Z","title":"Self-Cross Diffusion Guidance for Text-to-Image Synthesis of Similar Subjects","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-12T10:46:55.027913Z"},"links":{"citing_paper":"/paper/2411.18936"},"observation_digest":"sha256:aa47331dfeaacdc2ce9f4971e80cefba1d64f904bdaf6235a2ba11aad712ab98","observation_id":"d8bf8eae-59d9-44e0-84c0-a260a89af162","resolution":{"observed_at":"2026-08-12T10:46:55.027913Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:46:55.275859Z","title":"Tokencompose: Text-to-image diffusion with token-level supervision","venue":null,"work_id":"04453b40-41bf-4a80-a601-78cb2a7469b8","year":2024},"citing_paper":{"arxiv_id":"2411.18936","last_updated":"2025-03-24T19:58:03Z","snapshot_observed_at":"2026-08-15T23:35:40.048462Z","submitted_at":"2024-11-28T05:58:03Z","title":"Self-Cross Diffusion Guidance for Text-to-Image Synthesis of Similar Subjects","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-12T10:46:55.031610Z"},"links":{"citing_paper":"/paper/2411.18936"},"observation_digest":"sha256:59cd95ad4d2633be6c2d6c15a87aa91a159f8c597a7d772a6b764f59bc79a147","observation_id":"5de08dc8-3cd3-45e3-a70d-52d98259ef1a","resolution":{"observed_at":"2026-08-12T10:46:55.279782Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:46:55.035179Z","title":"Boxdiff: Text-to-image synthesis with training-free box-constrained diffusion","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.18936","last_updated":"2025-03-24T19:58:03Z","snapshot_observed_at":"2026-08-15T23:35:40.048462Z","submitted_at":"2024-11-28T05:58:03Z","title":"Self-Cross Diffusion Guidance for Text-to-Image Synthesis of Similar Subjects","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-12T10:46:55.035179Z"},"links":{"citing_paper":"/paper/2411.18936"},"observation_digest":"sha256:0e799d43c787223372a13101a088edd99b2cfed69f5fd67d0f69620857fe0e49","observation_id":"6d55f517-c3d2-4fb6-ba80-f56bfc9b6fe9","resolution":{"observed_at":"2026-08-12T10:46:55.035179Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:46:55.038461Z","title":"Attngan: Fine- grained text to image generation with attentional generative adversarial networks","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2411.18936","last_updated":"2025-03-24T19:58:03Z","snapshot_observed_at":"2026-08-15T23:35:40.048462Z","submitted_at":"2024-11-28T05:58:03Z","title":"Self-Cross Diffusion Guidance for Text-to-Image Synthesis of Similar Subjects","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-12T10:46:55.038461Z"},"links":{"citing_paper":"/paper/2411.18936"},"observation_digest":"sha256:6c4118893877e15242da4e0a22949a125a2b10fb078ab8ea091e9e4de1879f63","observation_id":"c0dd81ff-00e6-43cb-bf9c-adf146e8a570","resolution":{"observed_at":"2026-08-12T10:46:55.038461Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:46:55.251758Z","title":"Scaling autoregressive models for content-rich text-to-image generation","venue":null,"work_id":"038aae90-6ecd-47f3-b41d-7cf6c9ff49c7","year":2022},"citing_paper":{"arxiv_id":"2411.18936","last_updated":"2025-03-24T19:58:03Z","snapshot_observed_at":"2026-08-15T23:35:40.048462Z","submitted_at":"2024-11-28T05:58:03Z","title":"Self-Cross Diffusion Guidance for Text-to-Image Synthesis of Similar Subjects","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-12T10:46:55.042010Z"},"links":{"citing_paper":"/paper/2411.18936"},"observation_digest":"sha256:cc48bf0cec2eda98ff660c38d6f7110d00f99e3e2181a13cd8e1a25518ee78d5","observation_id":"23274e42-8353-4953-9797-68d205c5656d","resolution":{"observed_at":"2026-08-12T10:46:55.255285Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.02591","last_updated":"2023-09-05T21:27:27Z","snapshot_observed_at":"2026-08-16T15:03:02.519968Z","submitted_at":"2023-09-05T21:27:27Z","title":"Scaling Autoregressive Multi-Modal Models: Pretraining and Instruction Tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.02591","snapshot_observed_at":"2026-08-12T10:46:55.045572Z","title":"Scaling autoregressive multi- modal models: Pretraining and instruction tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.18936","last_updated":"2025-03-24T19:58:03Z","snapshot_observed_at":"2026-08-15T23:35:40.048462Z","submitted_at":"2024-11-28T05:58:03Z","title":"Self-Cross Diffusion Guidance for Text-to-Image Synthesis of Similar Subjects","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-12T10:46:55.045572Z"},"links":{"cited_paper":"/paper/2309.02591","citing_paper":"/paper/2411.18936"},"observation_digest":"sha256:03717b131c8a962dcaa9e7befa2c72de7d73c9f8a1ca8efd43b9e73e461eae2b","observation_id":"eac800dc-0087-4118-8c34-c436b9866f7a","resolution":{"observed_at":"2026-08-12T10:46:55.045572Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:46:55.241246Z","title":"Attention calibration for disentangled text-to-image person- alization","venue":null,"work_id":"8f6a7fb6-eeff-4f85-97fb-1b5ea1df4f87","year":2024},"citing_paper":{"arxiv_id":"2411.18936","last_updated":"2025-03-24T19:58:03Z","snapshot_observed_at":"2026-08-15T23:35:40.048462Z","submitted_at":"2024-11-28T05:58:03Z","title":"Self-Cross Diffusion Guidance for Text-to-Image Synthesis of Similar Subjects","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-12T10:46:55.049424Z"},"links":{"citing_paper":"/paper/2411.18936"},"observation_digest":"sha256:18ef6bf82eb8e6803b28cb3a520590086224b60f3560dd7c5c2b61f52da6b2e1","observation_id":"161816cb-b77d-4461-8f47-bc53124469ff","resolution":{"observed_at":"2026-08-12T10:46:55.245243Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05121","last_updated":"2024-03-08T07:32:50Z","snapshot_observed_at":"2026-08-16T14:11:42.486634Z","submitted_at":"2024-03-08T07:32:50Z","title":"CogView3: Finer and Faster Text-to-Image Generation via Relay Diffusion","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05121","snapshot_observed_at":"2026-08-12T10:46:55.052802Z","title":"Cogview3: Finer and faster text-to-image generation via relay diffusion","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.18936","last_updated":"2025-03-24T19:58:03Z","snapshot_observed_at":"2026-08-15T23:35:40.048462Z","submitted_at":"2024-11-28T05:58:03Z","title":"Self-Cross Diffusion Guidance for Text-to-Image Synthesis of Similar Subjects","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-12T10:46:55.052802Z"},"links":{"cited_paper":"/paper/2403.05121","citing_paper":"/paper/2411.18936"},"observation_digest":"sha256:2666057df62e5f059a280af6fdbb12b5757ff15f373c5181b2c52f96c2df43b6","observation_id":"5f1d241a-6087-4577-a6fc-1a5c6ee886a9","resolution":{"observed_at":"2026-08-12T10:46:55.052802Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:46:55.230892Z","title":"bear” self-attn “elephant","venue":null,"work_id":"e3463d1f-6934-4216-a5f5-a0929d43faed","year":2019},"citing_paper":{"arxiv_id":"2411.18936","last_updated":"2025-03-24T19:58:03Z","snapshot_observed_at":"2026-08-15T23:35:40.048462Z","submitted_at":"2024-11-28T05:58:03Z","title":"Self-Cross Diffusion Guidance for Text-to-Image Synthesis of Similar Subjects","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-12T10:46:55.056723Z"},"links":{"citing_paper":"/paper/2411.18936"},"observation_digest":"sha256:946e9ec33e9206d063cccd0f679873d0c6573600035e3f3dc47bd364716e6cd0","observation_id":"43fc530e-705c-4f2e-9741-529b7f6663f9","resolution":{"observed_at":"2026-08-12T10:46:55.234494Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:46:55.219482Z","title":null,"venue":null,"work_id":"f3cb4be5-0ce9-4840-adaf-307cf0dca547","year":null},"citing_paper":{"arxiv_id":"2411.18936","last_updated":"2025-03-24T19:58:03Z","snapshot_observed_at":"2026-08-15T23:35:40.048462Z","submitted_at":"2024-11-28T05:58:03Z","title":"Self-Cross Diffusion Guidance for Text-to-Image Synthesis of Similar Subjects","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-12T10:46:55.060646Z"},"links":{"citing_paper":"/paper/2411.18936"},"observation_digest":"sha256:4c52e34f9084f40218227ad0a88282b58a92951dd57979f7dfac0ff271e015d1","observation_id":"040e0cde-1ad8-49b2-822b-8ba9aeb844b5","resolution":{"observed_at":"2026-08-12T10:46:55.223056Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:46:55.208896Z","title":"Ignore style, object size in comparison to its surroundings","venue":null,"work_id":"ce005292-eb71-4bfe-8550-f844000e2640","year":null},"citing_paper":{"arxiv_id":"2411.18936","last_updated":"2025-03-24T19:58:03Z","snapshot_observed_at":"2026-08-15T23:35:40.048462Z","submitted_at":"2024-11-28T05:58:03Z","title":"Self-Cross Diffusion Guidance for Text-to-Image Synthesis of Similar Subjects","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-12T10:46:55.064030Z"},"links":{"citing_paper":"/paper/2411.18936"},"observation_digest":"sha256:ec7e004b0bd5c4c70947f273ea23ca78be1ee9bd44f46b17cfe167dc1f3b2708","observation_id":"2d03c113-cba0-4959-ba7a-3637af4c3500","resolution":{"observed_at":"2026-08-12T10:46:55.212371Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:46:55.198098Z","title":null,"venue":null,"work_id":"8331e948-d7db-4cf1-af89-89ebe78ed287","year":null},"citing_paper":{"arxiv_id":"2411.18936","last_updated":"2025-03-24T19:58:03Z","snapshot_observed_at":"2026-08-15T23:35:40.048462Z","submitted_at":"2024-11-28T05:58:03Z","title":"Self-Cross Diffusion Guidance for Text-to-Image Synthesis of Similar Subjects","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-12T10:46:55.067434Z"},"links":{"citing_paper":"/paper/2411.18936"},"observation_digest":"sha256:9b460336dbfde426157b8c7925e3fd6a3186027e52dd568206a4726b17096e40","observation_id":"4cf3b6bc-2fe1-4549-a5fd-c9ac979d0428","resolution":{"observed_at":"2026-08-12T10:46:55.201986Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:46:55.186789Z","title":"Ignore style, object size in comparison to its surroundings","venue":null,"work_id":"484fcd0b-43ae-415b-83d3-c651e0f30db6","year":null},"citing_paper":{"arxiv_id":"2411.18936","last_updated":"2025-03-24T19:58:03Z","snapshot_observed_at":"2026-08-15T23:35:40.048462Z","submitted_at":"2024-11-28T05:58:03Z","title":"Self-Cross Diffusion Guidance for Text-to-Image Synthesis of Similar Subjects","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-12T10:46:55.070796Z"},"links":{"citing_paper":"/paper/2411.18936"},"observation_digest":"sha256:376491b4bfbefb59331f23ae04dedfc661122994ef6edc04277baf9a51869769","observation_id":"6d558a4e-5fca-4224-a069-213ad6af3d6c","resolution":{"observed_at":"2026-08-12T10:46:55.191121Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:46:55.175801Z","title":"A appears","venue":null,"work_id":"25bbbcc3-ab1c-402e-9d94-67ce6ab5c350","year":null},"citing_paper":{"arxiv_id":"2411.18936","last_updated":"2025-03-24T19:58:03Z","snapshot_observed_at":"2026-08-15T23:35:40.048462Z","submitted_at":"2024-11-28T05:58:03Z","title":"Self-Cross Diffusion Guidance for Text-to-Image Synthesis of Similar Subjects","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-12T10:46:55.073983Z"},"links":{"citing_paper":"/paper/2411.18936"},"observation_digest":"sha256:6a624f32b0dad302932a71956d65c8046c3902f94b7a2ae2938b8dabd7c1b02c","observation_id":"32618c0d-ebfc-487e-8d00-0f9046ae8bcd","resolution":{"observed_at":"2026-08-12T10:46:55.179677Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:46:55.163802Z","title":"As shown in Tab","venue":null,"work_id":"7b8d54d8-06d7-4206-bc7d-72ecf3f20f67","year":null},"citing_paper":{"arxiv_id":"2411.18936","last_updated":"2025-03-24T19:58:03Z","snapshot_observed_at":"2026-08-15T23:35:40.048462Z","submitted_at":"2024-11-28T05:58:03Z","title":"Self-Cross Diffusion Guidance for Text-to-Image Synthesis of Similar Subjects","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-12T10:46:55.077302Z"},"links":{"citing_paper":"/paper/2411.18936"},"observation_digest":"sha256:28ae60bf0b3315827db7c72a6c4b08403ea32a99dc9f6b0171570895ee346038","observation_id":"97315f23-0792-4307-a0bf-4bebb18562af","resolution":{"observed_at":"2026-08-12T10:46:55.168132Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2411.18936","last_updated":"2025-03-24T19:58:03Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-15T23:35:40.048462Z","submitted_at":"2024-11-28T05:58:03Z","title":"Self-Cross Diffusion Guidance for Text-to-Image Synthesis of Similar Subjects"},"reference_resolution":{"displayed":65,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":35,"verified_exact":0,"verified_fuzzy":30},"total_outbound_references":65},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 65 of 65 outbound references and 1 inbound Pith citation observation for arXiv:2411.18936."}