{"as_of":"2026-08-19T07:21:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:fa03b590f831cc644270ce6a0ac6142513f91cd0fb1bbf41427846db611a6182","coverage":[{"denominator":40,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":40,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T22:38:08.796809Z","state":"measured"},{"denominator":47,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":47,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":7,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":7,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T05:10:53.539457Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-02T08:16:48.480071Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2501.01097","last_updated":"2025-01-30T04:51:26Z","snapshot_observed_at":"2026-08-13T10:35:36.489840Z","submitted_at":"2025-01-02T06:46:13Z","title":"EliGen: Entity-Level Controlled Image Generation with Regional Attention","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.01097","snapshot_observed_at":"2026-08-16T05:10:53.539457Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2504.21356","last_updated":"2025-07-15T09:23:42Z","snapshot_observed_at":"2026-08-16T11:46:59.313125Z","submitted_at":"2025-04-30T06:30:48Z","title":"Nexus-Gen: Unified Image Understanding, Generation, and Editing via Prefilled Autoregression in Shared Embedding Space","version":3},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-16T05:10:53.539457Z"},"links":{"cited_paper":"/paper/2501.01097","citing_paper":"/paper/2504.21356"},"observation_digest":"sha256:2298d23f3561bbb7996ae23e94ec3699b47b694adf5aa5602087296b56072858","observation_id":"7ed96fd2-5ea7-4652-bd25-c2cd89e6c9c6","resolution":{"observed_at":"2026-08-16T05:10:53.539457Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.01097","last_updated":"2025-01-30T04:51:26Z","snapshot_observed_at":"2026-08-13T10:35:36.489840Z","submitted_at":"2025-01-02T06:46:13Z","title":"EliGen: Entity-Level Controlled Image Generation with Regional Attention","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.01097","snapshot_observed_at":"2026-08-06T19:55:03.579238Z","title":"Zhang, Z","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.04451","last_updated":"2025-07-06T16:17:32Z","snapshot_observed_at":"2026-08-17T05:05:00.761342Z","submitted_at":"2025-07-06T16:17:32Z","title":"CoT-lized Diffusion: Let's Reinforce T2I Generation Step-by-step","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T19:55:03.579238Z"},"links":{"cited_paper":"/paper/2501.01097","citing_paper":"/paper/2507.04451"},"observation_digest":"sha256:333a4dcc9823739f431d5444abd73e855bf0e8db11fcb24587bdaaa8be8218e9","observation_id":"eeeaac15-8634-4f58-92de-f7201b31668e","resolution":{"observed_at":"2026-08-06T19:55:03.579238Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.01097","last_updated":"2025-01-30T04:51:26Z","snapshot_observed_at":"2026-08-13T10:35:36.489840Z","submitted_at":"2025-01-02T06:46:13Z","title":"EliGen: Entity-Level Controlled Image Generation with Regional Attention","version":3},"cited_work":{"arxiv_id":"2501.01097","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.01097","snapshot_observed_at":"2026-07-02T08:16:48.480071Z","title":"arXiv preprint arXiv:2501.01097 (2025)","venue":null,"work_id":"c11b4806-7419-414b-83dd-aab7fc8cd41a","year":2025},"citing_paper":{"arxiv_id":"2604.06870","last_updated":"2026-04-08T09:32:15Z","snapshot_observed_at":"2026-07-06T22:55:15.791334Z","submitted_at":"2026-04-08T09:32:15Z","title":"RefineAnything: Multimodal Region-Specific Refinement for Perfect Local Details","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-10T19:11:43.172296Z"},"links":{"cited_paper":"/paper/2501.01097","citing_paper":"/paper/2604.06870"},"observation_digest":"sha256:ae94e4e98683ee02fabfc0d75ea3e9b510baaa46a2134b5cdc10ce62bc2453e1","observation_id":"f502d698-26c5-4ded-89df-d98dea8f06c1","resolution":{"observed_at":"2026-05-10T23:20:53.873507Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.01097","last_updated":"2025-01-30T04:51:26Z","snapshot_observed_at":"2026-08-13T10:35:36.489840Z","submitted_at":"2025-01-02T06:46:13Z","title":"EliGen: Entity-Level Controlled Image Generation with Regional Attention","version":3},"cited_work":{"arxiv_id":"2501.01097","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.01097","snapshot_observed_at":"2026-07-02T08:16:48.480071Z","title":"arXiv preprint arXiv:2501.01097 (2025)","venue":null,"work_id":"c11b4806-7419-414b-83dd-aab7fc8cd41a","year":2025},"citing_paper":{"arxiv_id":"2604.14062","last_updated":"2026-04-15T16:37:36Z","snapshot_observed_at":"2026-08-11T06:28:13.134172Z","submitted_at":"2026-04-15T16:37:36Z","title":"OneHOI: Unifying Human-Object Interaction Generation and Editing","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-10T14:22:30.898080Z"},"links":{"cited_paper":"/paper/2501.01097","citing_paper":"/paper/2604.14062"},"observation_digest":"sha256:507150bf0ea4f4533da45183db59a5212e1fe53bc1da9f8c0947f68a39935575","observation_id":"218b3b44-83e7-4777-8f44-ed3adfd63cd9","resolution":{"observed_at":"2026-05-10T14:25:29.959224Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.01097","last_updated":"2025-01-30T04:51:26Z","snapshot_observed_at":"2026-08-13T10:35:36.489840Z","submitted_at":"2025-01-02T06:46:13Z","title":"EliGen: Entity-Level Controlled Image Generation with Regional Attention","version":3},"cited_work":{"arxiv_id":"2501.01097","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.01097","snapshot_observed_at":"2026-07-02T08:16:48.480071Z","title":"arXiv preprint arXiv:2501.01097 (2025)","venue":null,"work_id":"c11b4806-7419-414b-83dd-aab7fc8cd41a","year":2025},"citing_paper":{"arxiv_id":"2605.04609","last_updated":"2026-05-06T07:56:16Z","snapshot_observed_at":"2026-08-03T01:43:19.583154Z","submitted_at":"2026-05-06T07:56:16Z","title":"Advancing Aesthetic Image Generation via Composition Transfer","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-08T18:23:12.827094Z"},"links":{"cited_paper":"/paper/2501.01097","citing_paper":"/paper/2605.04609"},"observation_digest":"sha256:295ede6bc13ee8d8a9da92255b1d36bffc59e313bce2dae1f60eb8b8dfe60e48","observation_id":"3c11992e-fa72-4d41-b16f-b7860bf1d6a0","resolution":{"observed_at":"2026-05-09T06:30:44.322037Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.01097","last_updated":"2025-01-30T04:51:26Z","snapshot_observed_at":"2026-08-13T10:35:36.489840Z","submitted_at":"2025-01-02T06:46:13Z","title":"EliGen: Entity-Level Controlled Image Generation with Regional Attention","version":3},"cited_work":{"arxiv_id":"2501.01097","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.01097","snapshot_observed_at":"2026-07-02T08:16:48.480071Z","title":"arXiv preprint arXiv:2501.01097 (2025)","venue":null,"work_id":"c11b4806-7419-414b-83dd-aab7fc8cd41a","year":2025},"citing_paper":{"arxiv_id":"2606.05031","last_updated":"2026-06-03T15:58:56Z","snapshot_observed_at":"2026-08-13T09:30:06.328516Z","submitted_at":"2026-06-03T15:58:56Z","title":"MetaPoint: Unlocking Precise Spatial Control in Agentic Visual Generation","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-06-28T06:07:06.056441Z"},"links":{"cited_paper":"/paper/2501.01097","citing_paper":"/paper/2606.05031"},"observation_digest":"sha256:dc2723e2591865b1450a94cba6eaa008a8cd90e388841ae890d3a21dffd983e4","observation_id":"865bc7ed-5995-407f-9c96-85809f8bd855","resolution":{"observed_at":"2026-07-02T08:16:48.481537Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.01097","last_updated":"2025-01-30T04:51:26Z","snapshot_observed_at":"2026-08-13T10:35:36.489840Z","submitted_at":"2025-01-02T06:46:13Z","title":"EliGen: Entity-Level Controlled Image Generation with Regional Attention","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.01097","snapshot_observed_at":"2026-08-01T12:45:20.944604Z","title":"arXiv preprint arXiv:2501.01097 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.19344","last_updated":"2026-07-21T17:59:12Z","snapshot_observed_at":"2026-08-17T23:26:38.310510Z","submitted_at":"2026-07-21T17:59:12Z","title":"Appearance Pointers -- Multimodal Region Control of Diffusion Transformers","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-01T12:45:20.944604Z"},"links":{"cited_paper":"/paper/2501.01097","citing_paper":"/paper/2607.19344"},"observation_digest":"sha256:e2fc6dd6beaa7d31289effb16171cc5d9fca8f493f9b04bd9784b01aae7f1590","observation_id":"c690b184-8562-4fcc-85c0-20756f9e1408","resolution":{"observed_at":"2026-08-01T12:45:20.944604Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2501.01097/citation-record","integrity":"/paper/2501.01097/integrity","json":"/paper/2501.01097/citation-record.json","paper":"/paper/2501.01097"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:38:09.317104Z","title":"Multidiffusion: Fusing diffusion paths for controlled image generation","venue":null,"work_id":"94d391d7-910e-42a9-8799-b027645dce31","year":2023},"citing_paper":{"arxiv_id":"2501.01097","last_updated":"2025-01-30T04:51:26Z","snapshot_observed_at":"2026-08-13T10:35:36.489840Z","submitted_at":"2025-01-02T06:46:13Z","title":"EliGen: Entity-Level Controlled Image Generation with Regional Attention","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-10T22:38:08.613917Z"},"links":{"citing_paper":"/paper/2501.01097"},"observation_digest":"sha256:24156a34f18cbb614ea30d04063c75edc50d33577ee590650e7741cd58d04b1b","observation_id":"d5a79a7e-5ea1-4a8c-ac45-a223d3e64e30","resolution":{"observed_at":"2026-08-10T22:38:09.321463Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03206","last_updated":"2024-03-05T18:45:39Z","snapshot_observed_at":"2026-08-13T01:47:21.043519Z","submitted_at":"2024-03-05T18:45:39Z","title":"Scaling Rectified Flow Transformers for High-Resolution Image Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.03206","snapshot_observed_at":"2026-08-10T22:38:08.627180Z","title":"Scaling rectified flow transformers for high-resolution image synthesis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.01097","last_updated":"2025-01-30T04:51:26Z","snapshot_observed_at":"2026-08-13T10:35:36.489840Z","submitted_at":"2025-01-02T06:46:13Z","title":"EliGen: Entity-Level Controlled Image Generation with Regional Attention","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-10T22:38:08.627180Z"},"links":{"cited_paper":"/paper/2403.03206","citing_paper":"/paper/2501.01097"},"observation_digest":"sha256:3ff8af2ff2e0ea0061bd860dc9779b607aab800b6094c8afd63b539332af2456","observation_id":"be90677b-0bc9-426e-9c16-1ec9735c9290","resolution":{"observed_at":"2026-08-10T22:38:08.627180Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.12598","last_updated":"2022-07-26T01:42:07Z","snapshot_observed_at":"2026-08-14T06:37:15.299690Z","submitted_at":"2022-07-26T01:42:07Z","title":"Classifier-Free Diffusion Guidance","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.12598","snapshot_observed_at":"2026-08-10T22:38:08.631506Z","title":"Classifier-free diffusion guidance","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.01097","last_updated":"2025-01-30T04:51:26Z","snapshot_observed_at":"2026-08-13T10:35:36.489840Z","submitted_at":"2025-01-02T06:46:13Z","title":"EliGen: Entity-Level Controlled Image Generation with Regional Attention","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-10T22:38:08.631506Z"},"links":{"cited_paper":"/paper/2207.12598","citing_paper":"/paper/2501.01097"},"observation_digest":"sha256:393764e3e6baf47173b78a17193329250008ae963a96bc1415cca0f860d53cfe","observation_id":"8dac1ee8-704d-4aaa-a420-c2dc4ed2b52e","resolution":{"observed_at":"2026-08-10T22:38:08.631506Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-08-17T18:04:53.578114Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-10T22:38:08.645351Z","title":"Lora: Low-rank adaptation of large language models","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.01097","last_updated":"2025-01-30T04:51:26Z","snapshot_observed_at":"2026-08-13T10:35:36.489840Z","submitted_at":"2025-01-02T06:46:13Z","title":"EliGen: Entity-Level Controlled Image Generation with Regional Attention","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-10T22:38:08.645351Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2501.01097"},"observation_digest":"sha256:9ec5b47c56b9324e7f5f98b731b7a5856fb059c1b5db6bc063615c27b2aef10a","observation_id":"49598589-de54-430b-888b-cdd0bc87211e","resolution":{"observed_at":"2026-08-10T22:38:08.645351Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.23775","last_updated":"2024-11-05T06:41:27Z","snapshot_observed_at":"2026-08-17T23:31:59.305347Z","submitted_at":"2024-10-31T09:45:00Z","title":"In-Context LoRA for Diffusion Transformers","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.23775","snapshot_observed_at":"2026-08-10T22:38:08.656231Z","title":"In-context lora for dif- fusion transformers","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.01097","last_updated":"2025-01-30T04:51:26Z","snapshot_observed_at":"2026-08-13T10:35:36.489840Z","submitted_at":"2025-01-02T06:46:13Z","title":"EliGen: Entity-Level Controlled Image Generation with Regional Attention","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-10T22:38:08.656231Z"},"links":{"cited_paper":"/paper/2410.23775","citing_paper":"/paper/2501.01097"},"observation_digest":"sha256:63b00158e872cd4348b432d6ddc43e36179b1bc9dde45507e9f5d19a2f8fcd69","observation_id":"729c17b6-93ff-4943-be79-f53f9ff62540","resolution":{"observed_at":"2026-08-10T22:38:08.656231Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:38:09.268238Z","title":"Elucidating the design space of diffusion-based generative models","venue":null,"work_id":"56ac18be-a994-45e5-bf2d-28ce45d8fc97","year":2022},"citing_paper":{"arxiv_id":"2501.01097","last_updated":"2025-01-30T04:51:26Z","snapshot_observed_at":"2026-08-13T10:35:36.489840Z","submitted_at":"2025-01-02T06:46:13Z","title":"EliGen: Entity-Level Controlled Image Generation with Regional Attention","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-10T22:38:08.660654Z"},"links":{"citing_paper":"/paper/2501.01097"},"observation_digest":"sha256:3771a1a8f12d1fb099471d88e4004143055698d4e79cd815c77aee4976bd82de","observation_id":"65951187-75b4-4ace-8da7-c5a2714f9f52","resolution":{"observed_at":"2026-08-10T22:38:09.272557Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.17725","last_updated":"2024-10-23T09:55:22Z","snapshot_observed_at":"2026-08-13T01:57:27.555320Z","submitted_at":"2024-10-23T09:55:22Z","title":"YOLOv11: An Overview of the Key Architectural Enhancements","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.17725","snapshot_observed_at":"2026-08-10T22:38:08.665191Z","title":"Yolov11: An overview of the key archi- tectural enhancements","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.01097","last_updated":"2025-01-30T04:51:26Z","snapshot_observed_at":"2026-08-13T10:35:36.489840Z","submitted_at":"2025-01-02T06:46:13Z","title":"EliGen: Entity-Level Controlled Image Generation with Regional Attention","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-10T22:38:08.665191Z"},"links":{"cited_paper":"/paper/2410.17725","citing_paper":"/paper/2501.01097"},"observation_digest":"sha256:2a93787779eeaba93553246f8963d6c39fd2d7e77c6233296464080c428e6bf6","observation_id":"0e614677-d924-470a-9822-545d08696c9b","resolution":{"observed_at":"2026-08-10T22:38:08.665191Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:38:09.255532Z","title":"Pick-a-pic: An open dataset of user preferences for text- to-image generation","venue":null,"work_id":"f547f183-6ec4-4f5c-865e-1700cec48a3f","year":2023},"citing_paper":{"arxiv_id":"2501.01097","last_updated":"2025-01-30T04:51:26Z","snapshot_observed_at":"2026-08-13T10:35:36.489840Z","submitted_at":"2025-01-02T06:46:13Z","title":"EliGen: Entity-Level Controlled Image Generation with Regional Attention","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-10T22:38:08.669582Z"},"links":{"citing_paper":"/paper/2501.01097"},"observation_digest":"sha256:8bb3921e37d99a72d5a81b354c70cd2ec751ebe943ce06c014fba9a35b92d7b9","observation_id":"c879f410-e260-44f2-8dcb-4c7487cc978d","resolution":{"observed_at":"2026-08-10T22:38:09.259552Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:38:09.243341Z","title":null,"venue":null,"work_id":"bd4bf653-6d84-48f9-9f9d-db4ccbb5e2c1","year":2024},"citing_paper":{"arxiv_id":"2501.01097","last_updated":"2025-01-30T04:51:26Z","snapshot_observed_at":"2026-08-13T10:35:36.489840Z","submitted_at":"2025-01-02T06:46:13Z","title":"EliGen: Entity-Level Controlled Image Generation with Regional Attention","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-10T22:38:08.673448Z"},"links":{"citing_paper":"/paper/2501.01097"},"observation_digest":"sha256:3bd6f168b47fbd3f660030072757d330af79ba6d00104200f9174adad67f630b","observation_id":"f1737201-10ee-4970-bc12-0f184de028a5","resolution":{"observed_at":"2026-08-10T22:38:09.247548Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:38:09.229236Z","title":"Laion-aesthetics v2","venue":null,"work_id":"72f472f1-6f52-4b95-8650-2eb0cd2809e3","year":2022},"citing_paper":{"arxiv_id":"2501.01097","last_updated":"2025-01-30T04:51:26Z","snapshot_observed_at":"2026-08-13T10:35:36.489840Z","submitted_at":"2025-01-02T06:46:13Z","title":"EliGen: Entity-Level Controlled Image Generation with Regional Attention","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-10T22:38:08.677408Z"},"links":{"citing_paper":"/paper/2501.01097"},"observation_digest":"sha256:ac3eb3f8cdc0f539597b8f30721a6ac7eeca79c2223b7eba7b3b8c6e46564c26","observation_id":"fb3bb521-b8e9-4c3a-8601-d9c864d513a3","resolution":{"observed_at":"2026-08-10T22:38:09.233246Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:38:09.217472Z","title":"Gligen: Open-set grounded text-to- image generation","venue":null,"work_id":"4f3472d9-103d-4cc1-80ab-eb3f2e498f77","year":2023},"citing_paper":{"arxiv_id":"2501.01097","last_updated":"2025-01-30T04:51:26Z","snapshot_observed_at":"2026-08-13T10:35:36.489840Z","submitted_at":"2025-01-02T06:46:13Z","title":"EliGen: Entity-Level Controlled Image Generation with Regional Attention","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-10T22:38:08.682085Z"},"links":{"citing_paper":"/paper/2501.01097"},"observation_digest":"sha256:7710e130ce8304a03ff2b112944e3b152dc29a0d7390e17ad00c0f6527d5bbe3","observation_id":"105fde20-2a88-4bb2-a312-176fb4a10dff","resolution":{"observed_at":"2026-08-10T22:38:09.221416Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:38:09.205491Z","title":"Hunyuan-dit: A powerful multi-resolution diffusion trans- former with fine-grained chinese understanding","venue":null,"work_id":"507fdb44-d0ed-4ebf-b8d5-aaf265c07a09","year":2024},"citing_paper":{"arxiv_id":"2501.01097","last_updated":"2025-01-30T04:51:26Z","snapshot_observed_at":"2026-08-13T10:35:36.489840Z","submitted_at":"2025-01-02T06:46:13Z","title":"EliGen: Entity-Level Controlled Image Generation with Regional Attention","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-10T22:38:08.686060Z"},"links":{"citing_paper":"/paper/2501.01097"},"observation_digest":"sha256:8643c2a9f9bfb20a1b2ac1ecc00ee89eb8f86db6cea1797c79aa93141814be15","observation_id":"a63399d1-d5c4-4fcd-991d-5dcf80ff1b08","resolution":{"observed_at":"2026-08-10T22:38:09.209715Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:38:09.193021Z","title":"Microsoft coco: Com- mon objects in context","venue":null,"work_id":"e6d294f4-a80e-47f0-b369-645c0730e62a","year":2014},"citing_paper":{"arxiv_id":"2501.01097","last_updated":"2025-01-30T04:51:26Z","snapshot_observed_at":"2026-08-13T10:35:36.489840Z","submitted_at":"2025-01-02T06:46:13Z","title":"EliGen: Entity-Level Controlled Image Generation with Regional Attention","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-10T22:38:08.690447Z"},"links":{"citing_paper":"/paper/2501.01097"},"observation_digest":"sha256:0c4355b5ce877c6a2a96969b2dc098cc7c70390889419a236b1811076be53080","observation_id":"8736c1f2-aba9-41cd-858c-87b436c065f7","resolution":{"observed_at":"2026-08-10T22:38:09.198083Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:38:09.180746Z","title":"Directed diffusion: Direct control of object placement through at- tention guidance","venue":null,"work_id":"73d584b2-baff-4b58-9bee-ee43f79a719c","year":2024},"citing_paper":{"arxiv_id":"2501.01097","last_updated":"2025-01-30T04:51:26Z","snapshot_observed_at":"2026-08-13T10:35:36.489840Z","submitted_at":"2025-01-02T06:46:13Z","title":"EliGen: Entity-Level Controlled Image Generation with Regional Attention","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-10T22:38:08.700385Z"},"links":{"citing_paper":"/paper/2501.01097"},"observation_digest":"sha256:956e9abe0018dd43f614aa1f2dc337766dafdc6f1b1042b7b231c19c404a0186","observation_id":"2cdf22cd-498a-435b-96f8-6ca9bf8bd54f","resolution":{"observed_at":"2026-08-10T22:38:09.184914Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:38:08.704559Z","title":"Nerf: Representing scenes as neural radiance fields for view synthesis.Communications of the ACM, 65(1):99–106,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.01097","last_updated":"2025-01-30T04:51:26Z","snapshot_observed_at":"2026-08-13T10:35:36.489840Z","submitted_at":"2025-01-02T06:46:13Z","title":"EliGen: Entity-Level Controlled Image Generation with Regional Attention","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-10T22:38:08.704559Z"},"links":{"citing_paper":"/paper/2501.01097"},"observation_digest":"sha256:44dce52943c2f8cb8df4c6aa9a807eed045a768ee496a1bb110ab3ef69686b61","observation_id":"f924e519-bc9f-4d4c-9e14-d9d9a7f7873b","resolution":{"observed_at":"2026-08-10T22:38:08.704559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.08453","last_updated":"2023-03-20T10:52:26Z","snapshot_observed_at":"2026-08-13T05:43:28.614772Z","submitted_at":"2023-02-16T17:56:08Z","title":"T2I-Adapter: Learning Adapters to Dig out More Controllable Ability for Text-to-Image Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.08453","snapshot_observed_at":"2026-08-10T22:38:08.708981Z","title":"T2i-adapter: Learning adapters to dig out more controllable ability for text-to-image diffusion mod- els","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.01097","last_updated":"2025-01-30T04:51:26Z","snapshot_observed_at":"2026-08-13T10:35:36.489840Z","submitted_at":"2025-01-02T06:46:13Z","title":"EliGen: Entity-Level Controlled Image Generation with Regional Attention","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-10T22:38:08.708981Z"},"links":{"cited_paper":"/paper/2302.08453","citing_paper":"/paper/2501.01097"},"observation_digest":"sha256:dca46bcebce2a993522065f3f46f7cf08061393515232a5f5476dc3e6a9db38b","observation_id":"191b8f6b-b8c1-4852-9fa7-8f84caee2718","resolution":{"observed_at":"2026-08-10T22:38:08.708981Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.09748","last_updated":"2023-03-02T09:06:55Z","snapshot_observed_at":"2026-08-17T19:22:44.145403Z","submitted_at":"2022-12-19T18:59:58Z","title":"Scalable Diffusion Models with Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.09748","snapshot_observed_at":"2026-08-10T22:38:08.713640Z","title":"Scalable diffusion models with transformers","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.01097","last_updated":"2025-01-30T04:51:26Z","snapshot_observed_at":"2026-08-13T10:35:36.489840Z","submitted_at":"2025-01-02T06:46:13Z","title":"EliGen: Entity-Level Controlled Image Generation with Regional Attention","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-10T22:38:08.713640Z"},"links":{"cited_paper":"/paper/2212.09748","citing_paper":"/paper/2501.01097"},"observation_digest":"sha256:d8e04074fe015272c6b42b338c858ae18a17d682a2130547f5c64ed9308eafb2","observation_id":"a5811c39-76b8-4b72-b51e-50d77ce71e7f","resolution":{"observed_at":"2026-08-10T22:38:08.713640Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:38:09.160088Z","title":"Sdxl: Improving latent diffusion models for high-resolution image synthesis","venue":null,"work_id":"dbffe4bc-783f-44e0-a2c4-ff0adcf42a37","year":2024},"citing_paper":{"arxiv_id":"2501.01097","last_updated":"2025-01-30T04:51:26Z","snapshot_observed_at":"2026-08-13T10:35:36.489840Z","submitted_at":"2025-01-02T06:46:13Z","title":"EliGen: Entity-Level Controlled Image Generation with Regional Attention","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-10T22:38:08.718182Z"},"links":{"citing_paper":"/paper/2501.01097"},"observation_digest":"sha256:a3c8da4a28cca4ef702b26ccabe12fdc2fa4fba5aeced924c08ae95a57804444","observation_id":"12264308-9c77-4e15-9577-16f077273477","resolution":{"observed_at":"2026-08-10T22:38:09.164480Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:38:09.147036Z","title":"Exploring the lim- its of transfer learning with a unified text-to-text trans- former","venue":null,"work_id":"ff5b7875-c5f7-4c51-adb6-19aa58950ed8","year":2020},"citing_paper":{"arxiv_id":"2501.01097","last_updated":"2025-01-30T04:51:26Z","snapshot_observed_at":"2026-08-13T10:35:36.489840Z","submitted_at":"2025-01-02T06:46:13Z","title":"EliGen: Entity-Level Controlled Image Generation with Regional Attention","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-10T22:38:08.722259Z"},"links":{"citing_paper":"/paper/2501.01097"},"observation_digest":"sha256:79c87887483ca68ad099779b9cf152aea18ed46dfd7cbf58b4f6525b0365c193","observation_id":"82129aea-3888-4c87-94ca-c72b9cd55a72","resolution":{"observed_at":"2026-08-10T22:38:09.151089Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:38:09.134545Z","title":"Deepspeed: System optimizations enable training deep learning models with over 100 billion parameters","venue":null,"work_id":"04bd3698-d628-4e6d-8c72-985419b77740","year":2020},"citing_paper":{"arxiv_id":"2501.01097","last_updated":"2025-01-30T04:51:26Z","snapshot_observed_at":"2026-08-13T10:35:36.489840Z","submitted_at":"2025-01-02T06:46:13Z","title":"EliGen: Entity-Level Controlled Image Generation with Regional Attention","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-10T22:38:08.726239Z"},"links":{"citing_paper":"/paper/2501.01097"},"observation_digest":"sha256:8045de8854130a3bf04ebafdbcc631ebacb0ebaec3eb02407d8979002591024e","observation_id":"d7d77227-8139-41cb-ab3c-24e182a48b0f","resolution":{"observed_at":"2026-08-10T22:38:09.138946Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:38:08.730917Z","title":"U-net: Convolutional networks for biomedical image segmentation","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2501.01097","last_updated":"2025-01-30T04:51:26Z","snapshot_observed_at":"2026-08-13T10:35:36.489840Z","submitted_at":"2025-01-02T06:46:13Z","title":"EliGen: Entity-Level Controlled Image Generation with Regional Attention","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-10T22:38:08.730917Z"},"links":{"citing_paper":"/paper/2501.01097"},"observation_digest":"sha256:349bf0539caafbb1850289c2b07622208ff6e3e92443883460ee1f8de264f6f4","observation_id":"c822e9fa-d4aa-4500-8c68-395bd2719bfc","resolution":{"observed_at":"2026-08-10T22:38:08.730917Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:38:09.112694Z","title":"Instantx flux.1-dev ip-adapter page,","venue":null,"work_id":"cbac814d-f47a-411e-a39a-cc32a0b84c74","year":2024},"citing_paper":{"arxiv_id":"2501.01097","last_updated":"2025-01-30T04:51:26Z","snapshot_observed_at":"2026-08-13T10:35:36.489840Z","submitted_at":"2025-01-02T06:46:13Z","title":"EliGen: Entity-Level Controlled Image Generation with Regional Attention","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-10T22:38:08.741146Z"},"links":{"citing_paper":"/paper/2501.01097"},"observation_digest":"sha256:dd9274d009cacec3426b9720c05d69e26a6929c35ccabaec8824eae059d5c5c7","observation_id":"661b8e76-0951-4378-b02d-a6ac425cfaab","resolution":{"observed_at":"2026-08-10T22:38:09.116982Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.14896","last_updated":"2023-07-06T11:53:19Z","snapshot_observed_at":"2026-08-16T16:20:53.427900Z","submitted_at":"2022-10-26T17:54:20Z","title":"DiffusionDB: A Large-scale Prompt Gallery Dataset for Text-to-Image Generative Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.14896","snapshot_observed_at":"2026-08-10T22:38:08.745345Z","title":"Wang, Evan Montoya, David Munechika, Haoyang Yang, Benjamin Hoover, and Duen Horng Chau","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.01097","last_updated":"2025-01-30T04:51:26Z","snapshot_observed_at":"2026-08-13T10:35:36.489840Z","submitted_at":"2025-01-02T06:46:13Z","title":"EliGen: Entity-Level Controlled Image Generation with Regional Attention","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-10T22:38:08.745345Z"},"links":{"cited_paper":"/paper/2210.14896","citing_paper":"/paper/2501.01097"},"observation_digest":"sha256:d866dec577fbe78a14d5536f6aa509a6e1880fb168fcb6ce6e60067eb1a1e1fe","observation_id":"1ef87f4f-a882-4156-a97f-2557562bb6dd","resolution":{"observed_at":"2026-08-10T22:38:08.745345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-10T22:38:08.750078Z","title":"Qwen2-vl: Enhanc- ing vision-language model’s perception of the world at any resolution","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.01097","last_updated":"2025-01-30T04:51:26Z","snapshot_observed_at":"2026-08-13T10:35:36.489840Z","submitted_at":"2025-01-02T06:46:13Z","title":"EliGen: Entity-Level Controlled Image Generation with Regional Attention","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-10T22:38:08.750078Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2501.01097"},"observation_digest":"sha256:c71a412da8d2f323ce35b1c58381855e2a477e72231be36b161f17dc5b07d512","observation_id":"caaf9b86-3d58-4073-9405-b09439043244","resolution":{"observed_at":"2026-08-10T22:38:08.750078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.08240","last_updated":"2024-11-06T13:03:20Z","snapshot_observed_at":"2026-08-16T13:19:03.280787Z","submitted_at":"2024-09-12T17:39:23Z","title":"IFAdapter: Instance Feature Control for Grounded Text-to-Image Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.08240","snapshot_observed_at":"2026-08-10T22:38:08.754787Z","title":"Ifadapter: In- stance feature control for grounded text-to-image gener- ation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.01097","last_updated":"2025-01-30T04:51:26Z","snapshot_observed_at":"2026-08-13T10:35:36.489840Z","submitted_at":"2025-01-02T06:46:13Z","title":"EliGen: Entity-Level Controlled Image Generation with Regional Attention","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-10T22:38:08.754787Z"},"links":{"cited_paper":"/paper/2409.08240","citing_paper":"/paper/2501.01097"},"observation_digest":"sha256:60d10f05b3ac928add17e48a11dfcd27690beeb011deb7338e03b37c6f166afa","observation_id":"02d7bb37-3de3-4b67-aa1b-23eb152965dd","resolution":{"observed_at":"2026-08-10T22:38:08.754787Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-08-17T18:50:07.059564Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-10T22:38:08.760053Z","title":"Qwen2.5 technical report","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.01097","last_updated":"2025-01-30T04:51:26Z","snapshot_observed_at":"2026-08-13T10:35:36.489840Z","submitted_at":"2025-01-02T06:46:13Z","title":"EliGen: Entity-Level Controlled Image Generation with Regional Attention","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-10T22:38:08.760053Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2501.01097"},"observation_digest":"sha256:31ba3a7f4d0da3247e1f2e8f7a5d57d6c0c7d8fd0ab6e1bb501f696cdce3df19","observation_id":"71b8fb80-ab8b-487d-a00e-429c92774ec5","resolution":{"observed_at":"2026-08-10T22:38:08.760053Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.06721","last_updated":"2023-08-13T08:34:51Z","snapshot_observed_at":"2026-07-06T16:05:39.158819Z","submitted_at":"2023-08-13T08:34:51Z","title":"IP-Adapter: Text Compatible Image Prompt Adapter for Text-to-Image Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.06721","snapshot_observed_at":"2026-08-10T22:38:08.764674Z","title":"Ip-adapter: Text compatible image prompt adapter for text-to-image diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.01097","last_updated":"2025-01-30T04:51:26Z","snapshot_observed_at":"2026-08-13T10:35:36.489840Z","submitted_at":"2025-01-02T06:46:13Z","title":"EliGen: Entity-Level Controlled Image Generation with Regional Attention","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-10T22:38:08.764674Z"},"links":{"cited_paper":"/paper/2308.06721","citing_paper":"/paper/2501.01097"},"observation_digest":"sha256:b48e0a7f009fb95a47d41bea3ff2f175c9be59f0b4918e65067cb1606459bbaa","observation_id":"1176fe0d-f308-4d3f-983e-c009b12f7f2c","resolution":{"observed_at":"2026-08-10T22:38:08.764674Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:38:09.099625Z","title":"Adding conditional control to text-to-image dif- fusion models","venue":null,"work_id":"3be7a009-266a-4530-a829-c1518a75a7c9","year":2023},"citing_paper":{"arxiv_id":"2501.01097","last_updated":"2025-01-30T04:51:26Z","snapshot_observed_at":"2026-08-13T10:35:36.489840Z","submitted_at":"2025-01-02T06:46:13Z","title":"EliGen: Entity-Level Controlled Image Generation with Regional Attention","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-10T22:38:08.768947Z"},"links":{"citing_paper":"/paper/2501.01097"},"observation_digest":"sha256:f37ed6460ef7839c19fbf1254d4429ffb27ae33ae7e763df3e5b9c25eb2e136f","observation_id":"7fe84694-7bab-4de1-81e9-522f6922f763","resolution":{"observed_at":"2026-08-10T22:38:09.104059Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:38:09.084820Z","title":"Learning multi-dimensional human preference for text-to-image generation","venue":null,"work_id":"0d85c88d-dbd0-4e17-a0b5-22696729d8ac","year":2024},"citing_paper":{"arxiv_id":"2501.01097","last_updated":"2025-01-30T04:51:26Z","snapshot_observed_at":"2026-08-13T10:35:36.489840Z","submitted_at":"2025-01-02T06:46:13Z","title":"EliGen: Entity-Level Controlled Image Generation with Regional Attention","version":3},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-10T22:38:08.773689Z"},"links":{"citing_paper":"/paper/2501.01097"},"observation_digest":"sha256:9a06e47d368c1acb2a0d25b77f85b8b1503a14687963fead8fe55bb62cda1488","observation_id":"2db8a89c-00d0-4e9a-8f69-afef18264b8d","resolution":{"observed_at":"2026-08-10T22:38:09.089454Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:38:09.071100Z","title":"Layoutd- iffusion: Controllable diffusion model for layout-to-image generation","venue":null,"work_id":"2c8879ca-ce66-448a-81c1-dbda15daed60","year":2023},"citing_paper":{"arxiv_id":"2501.01097","last_updated":"2025-01-30T04:51:26Z","snapshot_observed_at":"2026-08-13T10:35:36.489840Z","submitted_at":"2025-01-02T06:46:13Z","title":"EliGen: Entity-Level Controlled Image Generation with Regional Attention","version":3},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-10T22:38:08.779058Z"},"links":{"citing_paper":"/paper/2501.01097"},"observation_digest":"sha256:62e89e93586f4dff225952a283c66ea12ba21d291403f5b90aef86c0e2786171","observation_id":"9bc6529c-ba28-421e-8699-e69d8393ec83","resolution":{"observed_at":"2026-08-10T22:38:09.075335Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:38:09.056241Z","title":"Migc: Multi-instance generation con- troller for text-to-image synthesis","venue":null,"work_id":"1c022c66-94a8-4676-9f9d-80509f30cbbd","year":2024},"citing_paper":{"arxiv_id":"2501.01097","last_updated":"2025-01-30T04:51:26Z","snapshot_observed_at":"2026-08-13T10:35:36.489840Z","submitted_at":"2025-01-02T06:46:13Z","title":"EliGen: Entity-Level Controlled Image Generation with Regional Attention","version":3},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-10T22:38:08.784726Z"},"links":{"citing_paper":"/paper/2501.01097"},"observation_digest":"sha256:d50d8c77d820a7eccfde7020bba3757d797d9859a162ecc810ffc548a0cc1758","observation_id":"f765febd-78d5-4cd1-9265-65579d92063a","resolution":{"observed_at":"2026-08-10T22:38:09.061137Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:38:09.041316Z","title":"Flux Qwen2-VL 72B Global Prompt:A cute orange and white striped kitten sitting on a fluffy white cloud in a blue sky with other clouds around","venue":null,"work_id":"c0a6b092-7d88-42b1-a0eb-c3276b902987","year":2024},"citing_paper":{"arxiv_id":"2501.01097","last_updated":"2025-01-30T04:51:26Z","snapshot_observed_at":"2026-08-13T10:35:36.489840Z","submitted_at":"2025-01-02T06:46:13Z","title":"EliGen: Entity-Level Controlled Image Generation with Regional Attention","version":3},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-10T22:38:08.788959Z"},"links":{"citing_paper":"/paper/2501.01097"},"observation_digest":"sha256:dacd7300624841af0d81999caa9d7d58f3ebb419ca641998df01015898ecafa6","observation_id":"ac460fc8-f463-42b5-a187-7c806ac2f33f","resolution":{"observed_at":"2026-08-10T22:38:09.046664Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:38:09.027435Z","title":"At each denoising step, the predicted noise from the DiT is fused with the noise derived from the original image","venue":null,"work_id":"c5f6fce0-6dd1-4da4-8da3-b9f60f4c1601","year":2024},"citing_paper":{"arxiv_id":"2501.01097","last_updated":"2025-01-30T04:51:26Z","snapshot_observed_at":"2026-08-13T10:35:36.489840Z","submitted_at":"2025-01-02T06:46:13Z","title":"EliGen: Entity-Level Controlled Image Generation with Regional Attention","version":3},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-10T22:38:08.792923Z"},"links":{"citing_paper":"/paper/2501.01097"},"observation_digest":"sha256:fab8ea7e91daebecc8e906ed0d4f3f74acdc459fd84a9ff3c0a1200b7f283fb9","observation_id":"0aac2343-edc9-4edf-b93a-66c8cc132b2b","resolution":{"observed_at":"2026-08-10T22:38:09.032112Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:38:09.011193Z","title":"Moreover, the image distribution within the dataset should closely align with the output distribution of the model itself","venue":null,"work_id":"33ee6302-d69c-4a2a-a0b2-857e62299f01","year":2022},"citing_paper":{"arxiv_id":"2501.01097","last_updated":"2025-01-30T04:51:26Z","snapshot_observed_at":"2026-08-13T10:35:36.489840Z","submitted_at":"2025-01-02T06:46:13Z","title":"EliGen: Entity-Level Controlled Image Generation with Regional Attention","version":3},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-10T22:38:08.796809Z"},"links":{"citing_paper":"/paper/2501.01097"},"observation_digest":"sha256:4872c6b1914531867677515ec051f922562ded51f06b9c1eaddda6bf1128ea12","observation_id":"02b3fefc-9415-4f4d-b071-55de234082c7","resolution":{"observed_at":"2026-08-10T22:38:09.017765Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.05499","last_updated":"2024-07-19T06:00:41Z","snapshot_observed_at":"2026-07-06T15:00:58.804337Z","submitted_at":"2023-03-09T18:52:16Z","title":"Grounding DINO: Marrying DINO with Grounded Pre-Training for Open-Set Object Detection","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.05499","snapshot_observed_at":"2026-08-10T22:38:08.695381Z","title":"Grounding dino: Marrying dino with grounded pre-training for open-set object detec- tion","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.01097","last_updated":"2025-01-30T04:51:26Z","snapshot_observed_at":"2026-08-13T10:35:36.489840Z","submitted_at":"2025-01-02T06:46:13Z","title":"EliGen: Entity-Level Controlled Image Generation with Regional Attention","version":3},"reference_index":2014,"source":"pdf_text","source_observed_at":"2026-08-10T22:38:08.695381Z"},"links":{"cited_paper":"/paper/2303.05499","citing_paper":"/paper/2501.01097"},"observation_digest":"sha256:27aaa8df9fad03c2a20dbad77aa1dc6fec423b80038aa63168aa787c5bb2fe02","observation_id":"4fa2f574-e723-4bba-a8e7-63aff32e69da","resolution":{"observed_at":"2026-08-10T22:38:08.695381Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.02502","last_updated":"2022-10-05T20:19:21Z","snapshot_observed_at":"2026-08-11T15:38:14.931716Z","submitted_at":"2020-10-06T06:15:51Z","title":"Denoising Diffusion Implicit Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.02502","snapshot_observed_at":"2026-08-10T22:38:08.736672Z","title":"Denoising diffusion implicit models","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.01097","last_updated":"2025-01-30T04:51:26Z","snapshot_observed_at":"2026-08-13T10:35:36.489840Z","submitted_at":"2025-01-02T06:46:13Z","title":"EliGen: Entity-Level Controlled Image Generation with Regional Attention","version":3},"reference_index":2015,"source":"pdf_text","source_observed_at":"2026-08-10T22:38:08.736672Z"},"links":{"cited_paper":"/paper/2010.02502","citing_paper":"/paper/2501.01097"},"observation_digest":"sha256:93cee3c5a798f8a7a0e45354183ef083e836da958a289b0cd5fb77f24a512c45","observation_id":"9658cb3f-2565-40d8-b50b-9126d268966f","resolution":{"observed_at":"2026-08-10T22:38:08.736672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.16500","last_updated":"2024-08-29T12:59:12Z","snapshot_observed_at":"2026-08-18T00:01:15.410179Z","submitted_at":"2024-08-29T12:59:12Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.16500","snapshot_observed_at":"2026-08-10T22:38:08.640912Z","title":"Cogvlm2: Vi- sual language models for image and video understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.01097","last_updated":"2025-01-30T04:51:26Z","snapshot_observed_at":"2026-08-13T10:35:36.489840Z","submitted_at":"2025-01-02T06:46:13Z","title":"EliGen: Entity-Level Controlled Image Generation with Regional Attention","version":3},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-10T22:38:08.640912Z"},"links":{"cited_paper":"/paper/2408.16500","citing_paper":"/paper/2501.01097"},"observation_digest":"sha256:7934b3edd7f71b0f7856e1b04cc7fab7ae2cac42ac8ea4e23e847f9b1161405b","observation_id":"e17633e3-7103-4a5c-b930-5c03bcfedcc7","resolution":{"observed_at":"2026-08-10T22:38:08.640912Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:38:09.280851Z","title":"Denoising diffusion probabilistic models","venue":null,"work_id":"700d765e-9035-4d28-afbd-5cce8322f492","year":2020},"citing_paper":{"arxiv_id":"2501.01097","last_updated":"2025-01-30T04:51:26Z","snapshot_observed_at":"2026-08-13T10:35:36.489840Z","submitted_at":"2025-01-02T06:46:13Z","title":"EliGen: Entity-Level Controlled Image Generation with Regional Attention","version":3},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-10T22:38:08.636278Z"},"links":{"citing_paper":"/paper/2501.01097"},"observation_digest":"sha256:d66fe943d26959741d7c3ecc5af16dbe691846f63e640596c0d227bb4090b2c5","observation_id":"0d5656e6-a5cd-491f-b60a-12d605ded63e","resolution":{"observed_at":"2026-08-10T22:38:09.284955Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:38:09.305305Z","title":"Internvl: Scaling up vision foundation models and aligning for generic visual- linguistic tasks","venue":null,"work_id":"add22100-e2d3-4204-a8b1-d4e3654ba19b","year":2024},"citing_paper":{"arxiv_id":"2501.01097","last_updated":"2025-01-30T04:51:26Z","snapshot_observed_at":"2026-08-13T10:35:36.489840Z","submitted_at":"2025-01-02T06:46:13Z","title":"EliGen: Entity-Level Controlled Image Generation with Regional Attention","version":3},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-10T22:38:08.618716Z"},"links":{"citing_paper":"/paper/2501.01097"},"observation_digest":"sha256:f145dc2f6372e5bbf56cc43cc6f2756f738e59948c2cbe7e31b5404172c900b3","observation_id":"89fda64e-c7a6-4b8f-80b3-407bdc6ef76e","resolution":{"observed_at":"2026-08-10T22:38:09.309623Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:38:09.293325Z","title":"Flux-controlnet- inpainting","venue":null,"work_id":"eca8692d-4166-4b70-ae18-c7eec9f9e2a1","year":2024},"citing_paper":{"arxiv_id":"2501.01097","last_updated":"2025-01-30T04:51:26Z","snapshot_observed_at":"2026-08-13T10:35:36.489840Z","submitted_at":"2025-01-02T06:46:13Z","title":"EliGen: Entity-Level Controlled Image Generation with Regional Attention","version":3},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-10T22:38:08.623097Z"},"links":{"citing_paper":"/paper/2501.01097"},"observation_digest":"sha256:23c558ccc1c8de7eb5958cd0ab1df1f05111953e226a1b6e72d71806483f2f42","observation_id":"6ef67408-cb49-43a7-b43b-5686fb2a38bb","resolution":{"observed_at":"2026-08-10T22:38:09.297333Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2501.01097","last_updated":"2025-01-30T04:51:26Z","latest_version":3,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-13T10:35:36.489840Z","submitted_at":"2025-01-02T06:46:13Z","title":"EliGen: Entity-Level Controlled Image Generation with Regional Attention"},"reference_resolution":{"displayed":40,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":18,"verified_exact":0,"verified_fuzzy":22},"total_outbound_references":40},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 40 of 40 outbound references and 7 inbound Pith citation observations for arXiv:2501.01097."}