{"as_of":"2026-08-09T21:03:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:bb06c1126d9050be73f255426ef6f8d02f48d739f627847bb65ba29923ade57a","coverage":[{"denominator":69,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":69,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T11:26:31.248399Z","state":"measured"},{"denominator":77,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":77,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":8,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":8,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-09T16:37:25.787185Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T21:00:08.960735Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.02528","last_updated":"2025-06-03T07:06:35Z","snapshot_observed_at":"2026-08-09T09:19:35.331602Z","submitted_at":"2025-06-03T07:06:35Z","title":"RelationAdapter: Learning and Transferring Visual Relation with Diffusion Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.02528","snapshot_observed_at":"2026-08-09T16:37:25.787185Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2502.01105","last_updated":"2025-08-13T17:32:12Z","snapshot_observed_at":"2026-08-09T16:30:48.628851Z","submitted_at":"2025-02-03T06:49:58Z","title":"LayerTracer: Cognitive-Aligned Layered SVG Synthesis via Diffusion Transformer","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-09T16:37:25.787185Z"},"links":{"cited_paper":"/paper/2506.02528","citing_paper":"/paper/2502.01105"},"observation_digest":"sha256:ad617f5bf99a80e022b7045c9f739290ec1101fa1d30cead60ae40e416356e98","observation_id":"83146b11-4a7c-41af-b08c-fbc15b18f7b4","resolution":{"observed_at":"2026-08-09T16:37:25.787185Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.02528","last_updated":"2025-06-03T07:06:35Z","snapshot_observed_at":"2026-08-09T09:19:35.331602Z","submitted_at":"2025-06-03T07:06:35Z","title":"RelationAdapter: Learning and Transferring Visual Relation with Diffusion Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.02528","snapshot_observed_at":"2026-08-03T19:54:47.490062Z","title":"Relationadapter: Learning and transferring vi- sual relation with diffusion transformers.arXiv preprint arXiv:2506.02528, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.22098","last_updated":"2026-07-16T03:47:27Z","snapshot_observed_at":"2026-08-03T19:54:46.253087Z","submitted_at":"2025-11-27T04:40:37Z","title":"WorldWander: Bridging Egocentric and Exocentric Worlds in Video Generation","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-03T19:54:47.490062Z"},"links":{"cited_paper":"/paper/2506.02528","citing_paper":"/paper/2511.22098"},"observation_digest":"sha256:90d697c9d2c72d0eafa20f71bf6fe4b7618f1215520ab22eff0d164ec2973c91","observation_id":"df5cc13a-d604-40a9-9119-28f9617c8ded","resolution":{"observed_at":"2026-08-03T19:54:47.490062Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.02528","last_updated":"2025-06-03T07:06:35Z","snapshot_observed_at":"2026-08-09T09:19:35.331602Z","submitted_at":"2025-06-03T07:06:35Z","title":"RelationAdapter: Learning and Transferring Visual Relation with Diffusion Transformers","version":1},"cited_work":{"arxiv_id":"2506.02528","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.02528","snapshot_observed_at":"2026-07-04T21:00:08.960735Z","title":"Relationadapter: Learning and transferring visual relation with diffusion transformers","venue":null,"work_id":"49b2a563-4863-4c8d-816c-0de6098d2c98","year":2025},"citing_paper":{"arxiv_id":"2605.17019","last_updated":"2026-05-16T14:45:32Z","snapshot_observed_at":"2026-07-06T23:28:06.971959Z","submitted_at":"2026-05-16T14:45:32Z","title":"StreamingEffect: Real-Time Human-Centric Video Effect Generation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-19T20:11:47.359922Z"},"links":{"cited_paper":"/paper/2506.02528","citing_paper":"/paper/2605.17019"},"observation_digest":"sha256:16429d63a4e30b8c2e6df7f18e738572dded3b8f5b0720d73ed7a81cd2469b35","observation_id":"a1449e96-b8bd-4110-94e1-2fbd95d8502b","resolution":{"observed_at":"2026-05-19T20:12:44.741376Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.02528","last_updated":"2025-06-03T07:06:35Z","snapshot_observed_at":"2026-08-09T09:19:35.331602Z","submitted_at":"2025-06-03T07:06:35Z","title":"RelationAdapter: Learning and Transferring Visual Relation with Diffusion Transformers","version":1},"cited_work":{"arxiv_id":"2506.02528","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.02528","snapshot_observed_at":"2026-07-04T21:00:08.960735Z","title":"Relationadapter: Learning and transferring visual relation with diffusion transformers","venue":null,"work_id":"49b2a563-4863-4c8d-816c-0de6098d2c98","year":2025},"citing_paper":{"arxiv_id":"2605.17312","last_updated":"2026-05-17T08:03:53Z","snapshot_observed_at":"2026-07-06T23:28:21.395050Z","submitted_at":"2026-05-17T08:03:53Z","title":"VISTA: Triplet-Supervised Video Style Transfer with Diffusion Transformers","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-20T14:14:41.662856Z"},"links":{"cited_paper":"/paper/2506.02528","citing_paper":"/paper/2605.17312"},"observation_digest":"sha256:67ac9aec687a5c150a69f8df797c05945281bfc65871b94f5638ceeb6fbf1ae8","observation_id":"c4940a23-4c0d-46f0-9344-4c44d7c9aed7","resolution":{"observed_at":"2026-05-20T14:18:21.356872Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.02528","last_updated":"2025-06-03T07:06:35Z","snapshot_observed_at":"2026-08-09T09:19:35.331602Z","submitted_at":"2025-06-03T07:06:35Z","title":"RelationAdapter: Learning and Transferring Visual Relation with Diffusion Transformers","version":1},"cited_work":{"arxiv_id":"2506.02528","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.02528","snapshot_observed_at":"2026-07-04T21:00:08.960735Z","title":"Relationadapter: Learning and transferring visual relation with diffusion transformers","venue":null,"work_id":"49b2a563-4863-4c8d-816c-0de6098d2c98","year":2025},"citing_paper":{"arxiv_id":"2605.19319","last_updated":"2026-05-19T03:54:46Z","snapshot_observed_at":"2026-08-02T08:21:58.883943Z","submitted_at":"2026-05-19T03:54:46Z","title":"SWEET: Sparse World Modeling with Image Editing for Embodied Task Execution","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-20T07:04:24.854846Z"},"links":{"cited_paper":"/paper/2506.02528","citing_paper":"/paper/2605.19319"},"observation_digest":"sha256:1e9d3c60a39dead3355e7b773d60a5c3fad34421287b354906a43aaa2621866b","observation_id":"017e772e-181b-478d-be57-999c9dae427d","resolution":{"observed_at":"2026-05-20T07:08:07.203306Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.02528","last_updated":"2025-06-03T07:06:35Z","snapshot_observed_at":"2026-08-09T09:19:35.331602Z","submitted_at":"2025-06-03T07:06:35Z","title":"RelationAdapter: Learning and Transferring Visual Relation with Diffusion Transformers","version":1},"cited_work":{"arxiv_id":"2506.02528","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.02528","snapshot_observed_at":"2026-07-04T21:00:08.960735Z","title":"Relationadapter: Learning and transferring visual relation with diffusion transformers","venue":null,"work_id":"49b2a563-4863-4c8d-816c-0de6098d2c98","year":2025},"citing_paper":{"arxiv_id":"2606.26092","last_updated":"2026-07-03T12:28:57Z","snapshot_observed_at":"2026-08-02T05:18:16.697250Z","submitted_at":"2026-06-24T17:59:06Z","title":"TryOnCrafter: Unleashing Camera Trajectories for Realistic Video Virtual Try-on via a Renderable 4D Try-on Proxy","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-25T19:20:45.217627Z"},"links":{"cited_paper":"/paper/2506.02528","citing_paper":"/paper/2606.26092"},"observation_digest":"sha256:fd36d7abbb34bd579711f40d4ca8a3ca11884ce0801475962aa1f3022df7d0eb","observation_id":"cd800ed7-9c54-4bc0-b297-a112e4c960da","resolution":{"observed_at":"2026-07-04T21:00:08.962307Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.02528","last_updated":"2025-06-03T07:06:35Z","snapshot_observed_at":"2026-08-09T09:19:35.331602Z","submitted_at":"2025-06-03T07:06:35Z","title":"RelationAdapter: Learning and Transferring Visual Relation with Diffusion Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.02528","snapshot_observed_at":"2026-07-12T12:05:10.800662Z","title":"arXiv preprint arXiv:2506.02528 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.26092","last_updated":"2026-07-03T12:28:57Z","snapshot_observed_at":"2026-08-02T05:18:16.697250Z","submitted_at":"2026-06-24T17:59:06Z","title":"TryOnCrafter: Unleashing Camera Trajectories for Realistic Video Virtual Try-on via a Renderable 4D Try-on Proxy","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-12T12:05:10.800662Z"},"links":{"cited_paper":"/paper/2506.02528","citing_paper":"/paper/2606.26092"},"observation_digest":"sha256:41fd42874893a1f2f22dc7598a0eba373f53a0299d5e78366507d88918446ce7","observation_id":"997ff181-f4d9-47b1-9a52-543d5e44ffd1","resolution":{"observed_at":"2026-07-12T12:05:10.800662Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.02528","last_updated":"2025-06-03T07:06:35Z","snapshot_observed_at":"2026-08-09T09:19:35.331602Z","submitted_at":"2025-06-03T07:06:35Z","title":"RelationAdapter: Learning and Transferring Visual Relation with Diffusion Transformers","version":1},"cited_work":{"arxiv_id":"2506.02528","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.02528","snapshot_observed_at":"2026-07-04T21:00:08.960735Z","title":"Relationadapter: Learning and transferring visual relation with diffusion transformers","venue":null,"work_id":"49b2a563-4863-4c8d-816c-0de6098d2c98","year":2025},"citing_paper":{"arxiv_id":"2606.29308","last_updated":"2026-06-28T10:07:38Z","snapshot_observed_at":"2026-07-07T00:03:16.968118Z","submitted_at":"2026-06-28T10:07:38Z","title":"MirrorPPR: Exemplar-Based Portrait Photo Retouching","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-30T07:50:25.117845Z"},"links":{"cited_paper":"/paper/2506.02528","citing_paper":"/paper/2606.29308"},"observation_digest":"sha256:eca3a682d7e5f0625abf2f3d16f75953321b9cb2a437c53cca61c90b2b20ef86","observation_id":"1de58fa4-05cd-4812-b226-df6adb71cc14","resolution":{"observed_at":"2026-06-30T07:54:22.094711Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.02528/citation-record","integrity":"/paper/2506.02528/integrity","json":"/paper/2506.02528/citation-record.json","paper":"/paper/2506.02528"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:36.272919Z","title":"Flux: Official inference repository for flux.1 models","venue":null,"work_id":"b2303cc3-62a2-4f7e-90b4-fe50d556b156","year":2024},"citing_paper":{"arxiv_id":"2506.02528","last_updated":"2025-06-03T07:06:35Z","snapshot_observed_at":"2026-08-09T09:19:35.331602Z","submitted_at":"2025-06-03T07:06:35Z","title":"RelationAdapter: Learning and Transferring Visual Relation with Diffusion Transformers","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T11:26:25.503759Z"},"links":{"citing_paper":"/paper/2506.02528"},"observation_digest":"sha256:4c151bf2ce8b590531f5972fd4ea93b0e6fe3cdc017cb4657f6da1cd41085063","observation_id":"a310153a-8271-4e45-81c3-95c41f1e41c0","resolution":{"observed_at":"2026-08-07T11:26:36.319170Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:36.104314Z","title":"Flux.1-dev: A 12b parameter rectified flow transformer for text-to-image generation","venue":null,"work_id":"7f09d684-058b-44bb-b367-157721dcca5a","year":2024},"citing_paper":{"arxiv_id":"2506.02528","last_updated":"2025-06-03T07:06:35Z","snapshot_observed_at":"2026-08-09T09:19:35.331602Z","submitted_at":"2025-06-03T07:06:35Z","title":"RelationAdapter: Learning and Transferring Visual Relation with Diffusion Transformers","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T11:26:25.577765Z"},"links":{"citing_paper":"/paper/2506.02528"},"observation_digest":"sha256:a89447076bbce714cc83013d2f1ec95cfb687dea2273e59be58cf55a5f71bacb","observation_id":"70770c67-1c34-4fc1-9507-b4d288d6fb0d","resolution":{"observed_at":"2026-08-07T11:26:36.221934Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:35.831014Z","title":"Flux.1 redux-dev","venue":null,"work_id":"13a18a42-9e72-4ae9-b0d5-cc2bb54150dc","year":2024},"citing_paper":{"arxiv_id":"2506.02528","last_updated":"2025-06-03T07:06:35Z","snapshot_observed_at":"2026-08-09T09:19:35.331602Z","submitted_at":"2025-06-03T07:06:35Z","title":"RelationAdapter: Learning and Transferring Visual Relation with Diffusion Transformers","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T11:26:25.642200Z"},"links":{"citing_paper":"/paper/2506.02528"},"observation_digest":"sha256:269158a28611ec5f16d451bc9388249126f94995b01c03d303cd380b8376edcd","observation_id":"8ccc135a-053c-4dc6-ac9d-041e39f79a66","resolution":{"observed_at":"2026-08-07T11:26:35.945195Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:25.718579Z","title":"Instructpix2pix: Learning to follow image editing instructions","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.02528","last_updated":"2025-06-03T07:06:35Z","snapshot_observed_at":"2026-08-09T09:19:35.331602Z","submitted_at":"2025-06-03T07:06:35Z","title":"RelationAdapter: Learning and Transferring Visual Relation with Diffusion Transformers","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T11:26:25.718579Z"},"links":{"citing_paper":"/paper/2506.02528"},"observation_digest":"sha256:2b337d4b0dc23ef063053f2c126704e1ba1c48abcd9662ef55318a5af2dd1783","observation_id":"76754b25-7c54-455f-b5da-624931d8228b","resolution":{"observed_at":"2026-08-07T11:26:25.718579Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:25.794555Z","title":"Masactrl: Tuning-free mutual self-attention control for consistent image synthesis and editing","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.02528","last_updated":"2025-06-03T07:06:35Z","snapshot_observed_at":"2026-08-09T09:19:35.331602Z","submitted_at":"2025-06-03T07:06:35Z","title":"RelationAdapter: Learning and Transferring Visual Relation with Diffusion Transformers","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T11:26:25.794555Z"},"links":{"citing_paper":"/paper/2506.02528"},"observation_digest":"sha256:89c1bd0266773771790e8a3ff9a51bba87fe44717b2ec4f9442d1988c2bd35b0","observation_id":"260b2e52-8a14-449e-83dc-e00838354ce2","resolution":{"observed_at":"2026-08-07T11:26:25.794555Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.13327","last_updated":"2025-07-01T12:30:24Z","snapshot_observed_at":"2026-08-08T01:07:38.124750Z","submitted_at":"2025-03-17T16:04:44Z","title":"Edit Transfer: Learning Image Editing via Vision In-Context Relations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.13327","snapshot_observed_at":"2026-08-07T11:26:25.872473Z","title":"Edit transfer: Learning image editing via vision in-context relations","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.02528","last_updated":"2025-06-03T07:06:35Z","snapshot_observed_at":"2026-08-09T09:19:35.331602Z","submitted_at":"2025-06-03T07:06:35Z","title":"RelationAdapter: Learning and Transferring Visual Relation with Diffusion Transformers","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T11:26:25.872473Z"},"links":{"cited_paper":"/paper/2503.13327","citing_paper":"/paper/2506.02528"},"observation_digest":"sha256:145c8cb40b869f01611ca0bae6e5f1b5e18fa3505fb6f942e7fb1501271a395f","observation_id":"bf585d37-4e1a-45a5-9dfb-c19b35ed685c","resolution":{"observed_at":"2026-08-07T11:26:25.872473Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:35.667275Z","title":"Ringid: Rethinking tree-ring watermarking for enhanced multi-key identification","venue":null,"work_id":"79443684-3a84-408a-9dec-3a84f4969033","year":2024},"citing_paper":{"arxiv_id":"2506.02528","last_updated":"2025-06-03T07:06:35Z","snapshot_observed_at":"2026-08-09T09:19:35.331602Z","submitted_at":"2025-06-03T07:06:35Z","title":"RelationAdapter: Learning and Transferring Visual Relation with Diffusion Transformers","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T11:26:25.954693Z"},"links":{"citing_paper":"/paper/2506.02528"},"observation_digest":"sha256:8edecf0c17bd1e12de673c7702e86e387ffc4f5e9eb5bdc723450c1243d94eef","observation_id":"caf7f31f-6af9-4073-9bf9-293f0fa33b41","resolution":{"observed_at":"2026-08-07T11:26:35.735335Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:35.488318Z","title":"Video demoireing with relation-based temporal consistency","venue":null,"work_id":"1b3263d2-f0f9-4eea-acf1-82484c4b929f","year":2022},"citing_paper":{"arxiv_id":"2506.02528","last_updated":"2025-06-03T07:06:35Z","snapshot_observed_at":"2026-08-09T09:19:35.331602Z","submitted_at":"2025-06-03T07:06:35Z","title":"RelationAdapter: Learning and Transferring Visual Relation with Diffusion Transformers","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T11:26:25.994644Z"},"links":{"citing_paper":"/paper/2506.02528"},"observation_digest":"sha256:bf58f069d7c8721656f01d93ed3820d01da641d169b7e86be5e8340f7af4433b","observation_id":"27442a58-4f25-4067-bab7-a4c340f16deb","resolution":{"observed_at":"2026-08-07T11:26:35.595400Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:35.313979Z","title":"The cube++ illumination estimation dataset","venue":null,"work_id":"51baf552-692b-44ce-80fe-5833a39c42ac","year":2020},"citing_paper":{"arxiv_id":"2506.02528","last_updated":"2025-06-03T07:06:35Z","snapshot_observed_at":"2026-08-09T09:19:35.331602Z","submitted_at":"2025-06-03T07:06:35Z","title":"RelationAdapter: Learning and Transferring Visual Relation with Diffusion Transformers","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T11:26:26.064372Z"},"links":{"citing_paper":"/paper/2506.02528"},"observation_digest":"sha256:23757a1a724e4b9faf9a5c45128fed112b0557ae196919fc640b9825955b8125","observation_id":"9e73cc68-f07c-40a1-97ad-8e0dc4a05fee","resolution":{"observed_at":"2026-08-07T11:26:35.426601Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:35.167705Z","title":"Geometric representation learning for document image rectification","venue":null,"work_id":"ca29865d-976a-49e9-8885-7115cc888e79","year":2022},"citing_paper":{"arxiv_id":"2506.02528","last_updated":"2025-06-03T07:06:35Z","snapshot_observed_at":"2026-08-09T09:19:35.331602Z","submitted_at":"2025-06-03T07:06:35Z","title":"RelationAdapter: Learning and Transferring Visual Relation with Diffusion Transformers","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T11:26:26.145803Z"},"links":{"citing_paper":"/paper/2506.02528"},"observation_digest":"sha256:79ee1725b7d6637dacd4bb1e3d5bbc7038f50cfe81031293d8b3a45421e00f82","observation_id":"05c80204-00ab-4742-b650-3213580a0e36","resolution":{"observed_at":"2026-08-07T11:26:35.245083Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:34.994451Z","title":"Concept sliders: Lora adaptors for precise control in diffusion models","venue":null,"work_id":"0bea731a-bfd2-4645-8d72-02e60a50daf1","year":2024},"citing_paper":{"arxiv_id":"2506.02528","last_updated":"2025-06-03T07:06:35Z","snapshot_observed_at":"2026-08-09T09:19:35.331602Z","submitted_at":"2025-06-03T07:06:35Z","title":"RelationAdapter: Learning and Transferring Visual Relation with Diffusion Transformers","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T11:26:26.195129Z"},"links":{"citing_paper":"/paper/2506.02528"},"observation_digest":"sha256:2e74756d5e6a1567ab9a0f2e3c5964a6775ac8e2284665c5652269ef66c269e8","observation_id":"f83ab52a-7c07-407e-99d8-eb6038014a9e","resolution":{"observed_at":"2026-08-07T11:26:35.071299Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.15891","last_updated":"2025-03-26T02:08:33Z","snapshot_observed_at":"2026-07-06T20:26:37.280206Z","submitted_at":"2025-01-27T09:33:23Z","title":"Any2AnyTryon: Leveraging Adaptive Position Embeddings for Versatile Virtual Clothing Tasks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.15891","snapshot_observed_at":"2026-08-07T11:26:26.252338Z","title":"Any2anytryon: Leveraging adaptive position embeddings for versatile virtual clothing tasks","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.02528","last_updated":"2025-06-03T07:06:35Z","snapshot_observed_at":"2026-08-09T09:19:35.331602Z","submitted_at":"2025-06-03T07:06:35Z","title":"RelationAdapter: Learning and Transferring Visual Relation with Diffusion Transformers","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T11:26:26.252338Z"},"links":{"cited_paper":"/paper/2501.15891","citing_paper":"/paper/2506.02528"},"observation_digest":"sha256:398a96db2ae54cf674c70f87ec2de2ff81d852743f9accd40b950db7b1636d78","observation_id":"2faeb9cd-0ad5-427e-b92d-b4db75a6e7e6","resolution":{"observed_at":"2026-08-07T11:26:26.252338Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:34.868511Z","title":"From sky to the ground: A large-scale benchmark and simple baseline towards real rain removal","venue":null,"work_id":"967ae100-438b-4e95-ae73-b45354c3270a","year":2023},"citing_paper":{"arxiv_id":"2506.02528","last_updated":"2025-06-03T07:06:35Z","snapshot_observed_at":"2026-08-09T09:19:35.331602Z","submitted_at":"2025-06-03T07:06:35Z","title":"RelationAdapter: Learning and Transferring Visual Relation with Diffusion Transformers","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T11:26:26.362249Z"},"links":{"citing_paper":"/paper/2506.02528"},"observation_digest":"sha256:62fa505044500df6166613f91f87266c976287070c26d9230e61078265037c1a","observation_id":"2ff2661a-d827-4ef5-8a63-e36e26b3da65","resolution":{"observed_at":"2026-08-07T11:26:34.920211Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2208.01626","last_updated":"2022-08-02T17:55:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-08-02T17:55:41Z","title":"Prompt-to-Prompt Image Editing with Cross Attention Control","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.01626","snapshot_observed_at":"2026-08-07T11:26:26.421202Z","title":"Prompt-to- prompt image editing with cross attention control","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.02528","last_updated":"2025-06-03T07:06:35Z","snapshot_observed_at":"2026-08-09T09:19:35.331602Z","submitted_at":"2025-06-03T07:06:35Z","title":"RelationAdapter: Learning and Transferring Visual Relation with Diffusion Transformers","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T11:26:26.421202Z"},"links":{"cited_paper":"/paper/2208.01626","citing_paper":"/paper/2506.02528"},"observation_digest":"sha256:f0c74789eba876de42e51bbb5b2eba074a7089446caae1f60bb8d3daa718163f","observation_id":"f004abc8-9d7f-463a-9018-a182b8338906","resolution":{"observed_at":"2026-08-07T11:26:26.421202Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:26.507655Z","title":"Denoising diffusion probabilistic models","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.02528","last_updated":"2025-06-03T07:06:35Z","snapshot_observed_at":"2026-08-09T09:19:35.331602Z","submitted_at":"2025-06-03T07:06:35Z","title":"RelationAdapter: Learning and Transferring Visual Relation with Diffusion Transformers","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T11:26:26.507655Z"},"links":{"citing_paper":"/paper/2506.02528"},"observation_digest":"sha256:1888a16fe8b3b93c87ef13726f2885004cd81a3e90457ac62abc1b0db8560b5b","observation_id":"65ae66d5-36b0-4221-8dfe-4fd6cd453bca","resolution":{"observed_at":"2026-08-07T11:26:26.507655Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:26.581575Z","title":"Lora: Low-rank adaptation of large language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.02528","last_updated":"2025-06-03T07:06:35Z","snapshot_observed_at":"2026-08-09T09:19:35.331602Z","submitted_at":"2025-06-03T07:06:35Z","title":"RelationAdapter: Learning and Transferring Visual Relation with Diffusion Transformers","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T11:26:26.581575Z"},"links":{"citing_paper":"/paper/2506.02528"},"observation_digest":"sha256:a3d2d6ca78ac3ae3ab0f875d55a50c7b0af9c035c53f355e946759dbd737d9c8","observation_id":"ccbc7202-c46f-434e-bdfe-292c1b95dcd7","resolution":{"observed_at":"2026-08-07T11:26:26.581575Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.14397","last_updated":"2025-02-23T06:30:46Z","snapshot_observed_at":"2026-08-07T18:02:32.083931Z","submitted_at":"2025-02-20T09:35:38Z","title":"PhotoDoodle: Learning Artistic Image Editing from Few-Shot Pairwise Data","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.14397","snapshot_observed_at":"2026-08-07T11:26:26.633060Z","title":"Photodoodle: Learning artistic image editing from few-shot pairwise data.arXiv preprint arXiv:2502.14397, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.02528","last_updated":"2025-06-03T07:06:35Z","snapshot_observed_at":"2026-08-09T09:19:35.331602Z","submitted_at":"2025-06-03T07:06:35Z","title":"RelationAdapter: Learning and Transferring Visual Relation with Diffusion Transformers","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T11:26:26.633060Z"},"links":{"cited_paper":"/paper/2502.14397","citing_paper":"/paper/2506.02528"},"observation_digest":"sha256:876a367a9a2374d0248aa8452446e0e1d50db754235e5a4bf79fe3af8447a654","observation_id":"99ec8a21-4ba5-4c4e-897f-6707b727168a","resolution":{"observed_at":"2026-08-07T11:26:26.633060Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:34.724313Z","title":"Humansd: A na- tive skeleton-guided diffusion model for human image generation","venue":null,"work_id":"792c93d2-91e3-48e8-8248-edb8126842e6","year":2023},"citing_paper":{"arxiv_id":"2506.02528","last_updated":"2025-06-03T07:06:35Z","snapshot_observed_at":"2026-08-09T09:19:35.331602Z","submitted_at":"2025-06-03T07:06:35Z","title":"RelationAdapter: Learning and Transferring Visual Relation with Diffusion Transformers","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T11:26:26.707032Z"},"links":{"citing_paper":"/paper/2506.02528"},"observation_digest":"sha256:8b317ff55261d985de233c1dbe4d0808edae52849bad43f26d54e3eb469d2924","observation_id":"8ef90e08-1b43-4de2-a3f1-96bf782f95be","resolution":{"observed_at":"2026-08-07T11:26:34.789002Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:34.533701Z","title":"Imagic: Text-based real image editing with diffusion models","venue":null,"work_id":"c8220da5-f5c4-4f04-b0fa-5312719ebb41","year":2023},"citing_paper":{"arxiv_id":"2506.02528","last_updated":"2025-06-03T07:06:35Z","snapshot_observed_at":"2026-08-09T09:19:35.331602Z","submitted_at":"2025-06-03T07:06:35Z","title":"RelationAdapter: Learning and Transferring Visual Relation with Diffusion Transformers","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T11:26:26.906508Z"},"links":{"citing_paper":"/paper/2506.02528"},"observation_digest":"sha256:dec604925b43d006dad93844571310ffa893281eaaba1c509925681971509fa5","observation_id":"6fc98b77-8af1-4bc2-97a1-d959ff2c51b2","resolution":{"observed_at":"2026-08-07T11:26:34.594054Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:27.005581Z","title":"Auto-encoding variational bayes, 2013","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2506.02528","last_updated":"2025-06-03T07:06:35Z","snapshot_observed_at":"2026-08-09T09:19:35.331602Z","submitted_at":"2025-06-03T07:06:35Z","title":"RelationAdapter: Learning and Transferring Visual Relation with Diffusion Transformers","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T11:26:27.005581Z"},"links":{"citing_paper":"/paper/2506.02528"},"observation_digest":"sha256:129c1bfea7392a6c37f73c71e9f54970651b63724e75fa307d1382b5bf613ddf","observation_id":"4354f44e-61dd-4907-8bc1-7064a3426859","resolution":{"observed_at":"2026-08-07T11:26:27.005581Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:27.119746Z","title":"Gligen: Open-set grounded text-to-image generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.02528","last_updated":"2025-06-03T07:06:35Z","snapshot_observed_at":"2026-08-09T09:19:35.331602Z","submitted_at":"2025-06-03T07:06:35Z","title":"RelationAdapter: Learning and Transferring Visual Relation with Diffusion Transformers","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T11:26:27.119746Z"},"links":{"citing_paper":"/paper/2506.02528"},"observation_digest":"sha256:8ffbd51b87b8a5ef77fe8873f03d25f1b66fd31a14228d5e7eb948ad42b67c2f","observation_id":"f2046233-0781-4d76-97e6-befd9a906b7b","resolution":{"observed_at":"2026-08-07T11:26:27.119746Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:27.232631Z","title":"Visualcloze: A universal image generation framework via visual in-context learning.arXiv preprint arXiv:2504.07960, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.02528","last_updated":"2025-06-03T07:06:35Z","snapshot_observed_at":"2026-08-09T09:19:35.331602Z","submitted_at":"2025-06-03T07:06:35Z","title":"RelationAdapter: Learning and Transferring Visual Relation with Diffusion Transformers","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T11:26:27.232631Z"},"links":{"citing_paper":"/paper/2506.02528"},"observation_digest":"sha256:9839fea34d48778aa326916a761e6f3c335aae895e164c4ef06a8f2315bbf47a","observation_id":"82c30e4b-73fa-4c4c-b69c-2b873b5822fb","resolution":{"observed_at":"2026-08-07T11:26:27.232631Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:27.367235Z","title":"Exploring the limits of weakly supervised pretraining","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.02528","last_updated":"2025-06-03T07:06:35Z","snapshot_observed_at":"2026-08-09T09:19:35.331602Z","submitted_at":"2025-06-03T07:06:35Z","title":"RelationAdapter: Learning and Transferring Visual Relation with Diffusion Transformers","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T11:26:27.367235Z"},"links":{"citing_paper":"/paper/2506.02528"},"observation_digest":"sha256:f5f9cceb9561778e7f96b283d5b3fbc926fca2871e846a288ca5125ef02db2f3","observation_id":"2ad5b333-8a37-432c-b1c7-dc603c95e5fc","resolution":{"observed_at":"2026-08-07T11:26:27.367235Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2108.01073","last_updated":"2022-01-05T00:07:35Z","snapshot_observed_at":"2026-08-08T06:35:17.078531Z","submitted_at":"2021-08-02T17:59:47Z","title":"SDEdit: Guided Image Synthesis and Editing with Stochastic Differential Equations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.01073","snapshot_observed_at":"2026-08-07T11:26:27.535923Z","title":"Sdedit: Guided image synthesis and editing with stochastic differential equations.arXiv preprint arXiv:2108.01073, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.02528","last_updated":"2025-06-03T07:06:35Z","snapshot_observed_at":"2026-08-09T09:19:35.331602Z","submitted_at":"2025-06-03T07:06:35Z","title":"RelationAdapter: Learning and Transferring Visual Relation with Diffusion Transformers","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T11:26:27.535923Z"},"links":{"cited_paper":"/paper/2108.01073","citing_paper":"/paper/2506.02528"},"observation_digest":"sha256:3bb2639c41fc9e0c898dfcbaba3dc8d3b11bec5d3ec4d0e3b4c0ba41a2cea2bc","observation_id":"ec590b87-3435-4d1c-bbcb-bb69992a6727","resolution":{"observed_at":"2026-08-07T11:26:27.535923Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:27.668185Z","title":"T2i- adapter: Learning adapters to dig out more controllable ability for text-to-image diffusion models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02528","last_updated":"2025-06-03T07:06:35Z","snapshot_observed_at":"2026-08-09T09:19:35.331602Z","submitted_at":"2025-06-03T07:06:35Z","title":"RelationAdapter: Learning and Transferring Visual Relation with Diffusion Transformers","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T11:26:27.668185Z"},"links":{"citing_paper":"/paper/2506.02528"},"observation_digest":"sha256:1d5f48af25dc03ed81c7e163b76853ffce8a889e625f637f8c7e5bb985a95def","observation_id":"e83759ad-13a5-47b0-9d42-fed66b85d8b0","resolution":{"observed_at":"2026-08-07T11:26:27.668185Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:34.307624Z","title":"Deep multi-scale convolutional neural network for dynamic scene deblurring","venue":null,"work_id":"fc2b6aea-da09-4ce2-8a49-e1f6208aa721","year":2017},"citing_paper":{"arxiv_id":"2506.02528","last_updated":"2025-06-03T07:06:35Z","snapshot_observed_at":"2026-08-09T09:19:35.331602Z","submitted_at":"2025-06-03T07:06:35Z","title":"RelationAdapter: Learning and Transferring Visual Relation with Diffusion Transformers","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T11:26:27.836599Z"},"links":{"citing_paper":"/paper/2506.02528"},"observation_digest":"sha256:8c37384127cf78e5b197181c81ead7e978aa940ea7305b8bca5dd60d8a3d2bb1","observation_id":"517b936b-c81c-4d9f-ac5b-5bff74d94d97","resolution":{"observed_at":"2026-08-07T11:26:34.368713Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:34.180440Z","title":"Gpt-4o technical report","venue":null,"work_id":"9d0fb8a4-e35d-46c6-bbfe-78e8cd451a05","year":2024},"citing_paper":{"arxiv_id":"2506.02528","last_updated":"2025-06-03T07:06:35Z","snapshot_observed_at":"2026-08-09T09:19:35.331602Z","submitted_at":"2025-06-03T07:06:35Z","title":"RelationAdapter: Learning and Transferring Visual Relation with Diffusion Transformers","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T11:26:27.966603Z"},"links":{"citing_paper":"/paper/2506.02528"},"observation_digest":"sha256:aed591e34f5d5feaac52a0980c89918fc43fb6b2c9535fb9107915f9573715a7","observation_id":"69367777-eb1f-45ee-8472-bfd5d56b5c4e","resolution":{"observed_at":"2026-08-07T11:26:34.221356Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2009.04107","last_updated":"2020-09-09T05:06:44Z","snapshot_observed_at":"2026-07-06T09:54:02.091694Z","submitted_at":"2020-09-09T05:06:44Z","title":"Multi-modal Attention for Speech Emotion Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.04107","snapshot_observed_at":"2026-08-07T11:26:28.052890Z","title":"Multi-modal attention for speech emotion recognition","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2506.02528","last_updated":"2025-06-03T07:06:35Z","snapshot_observed_at":"2026-08-09T09:19:35.331602Z","submitted_at":"2025-06-03T07:06:35Z","title":"RelationAdapter: Learning and Transferring Visual Relation with Diffusion Transformers","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T11:26:28.052890Z"},"links":{"cited_paper":"/paper/2009.04107","citing_paper":"/paper/2506.02528"},"observation_digest":"sha256:1dd61e039140cff0c2fd7f9c9c2670347107ecc3c3d05fb9e3a7b36644e21f65","observation_id":"70218a74-fba3-4563-817a-34557ad3eb31","resolution":{"observed_at":"2026-08-07T11:26:28.052890Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:28.104561Z","title":"Scalable diffusion models with transformers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.02528","last_updated":"2025-06-03T07:06:35Z","snapshot_observed_at":"2026-08-09T09:19:35.331602Z","submitted_at":"2025-06-03T07:06:35Z","title":"RelationAdapter: Learning and Transferring Visual Relation with Diffusion Transformers","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T11:26:28.104561Z"},"links":{"citing_paper":"/paper/2506.02528"},"observation_digest":"sha256:059b6e2eaa06284ccf1abed199c552d67151d41d6473661f2e535e57cdb1d2e7","observation_id":"4cff08b8-a17a-4ab1-bf9a-b2c4b6df10c2","resolution":{"observed_at":"2026-08-07T11:26:28.104561Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:34.040035Z","title":"Ntire 2021 challenge on high dynamic range imaging: Dataset, methods and results","venue":null,"work_id":"4a319664-68cc-465b-993a-1a98305d9401","year":2021},"citing_paper":{"arxiv_id":"2506.02528","last_updated":"2025-06-03T07:06:35Z","snapshot_observed_at":"2026-08-09T09:19:35.331602Z","submitted_at":"2025-06-03T07:06:35Z","title":"RelationAdapter: Learning and Transferring Visual Relation with Diffusion Transformers","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T11:26:28.153472Z"},"links":{"citing_paper":"/paper/2506.02528"},"observation_digest":"sha256:0e3b1501e4e7c18d7398dd836cc3e4927091098bb63743bb88abcd60d89f83b6","observation_id":"d4056f61-c66a-49b6-bf12-618a7ef6e978","resolution":{"observed_at":"2026-08-07T11:26:34.110740Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:33.869747Z","title":"Dense extreme inception network: Towards a robust cnn model for edge detection","venue":null,"work_id":"e0e43f5e-2b94-4f66-9eef-8bc1e653c430","year":1923},"citing_paper":{"arxiv_id":"2506.02528","last_updated":"2025-06-03T07:06:35Z","snapshot_observed_at":"2026-08-09T09:19:35.331602Z","submitted_at":"2025-06-03T07:06:35Z","title":"RelationAdapter: Learning and Transferring Visual Relation with Diffusion Transformers","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T11:26:28.204667Z"},"links":{"citing_paper":"/paper/2506.02528"},"observation_digest":"sha256:c1447beb34d896f555737e8f16519157e7ea1b1d2d0f9b315760c1558c552a64","observation_id":"af979b9c-851e-42fe-b7a4-b1dda2ed31f2","resolution":{"observed_at":"2026-08-07T11:26:33.952402Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:28.269032Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.02528","last_updated":"2025-06-03T07:06:35Z","snapshot_observed_at":"2026-08-09T09:19:35.331602Z","submitted_at":"2025-06-03T07:06:35Z","title":"RelationAdapter: Learning and Transferring Visual Relation with Diffusion Transformers","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T11:26:28.269032Z"},"links":{"citing_paper":"/paper/2506.02528"},"observation_digest":"sha256:1c548ac14bda2f3f9e86e2a9f9da5118f1d42f49bdb9aafa9f9133d790f4110f","observation_id":"19c9f941-4ebc-42a4-8474-5b4b79288d75","resolution":{"observed_at":"2026-08-07T11:26:28.269032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.00020","last_updated":"2021-02-26T19:04:58Z","snapshot_observed_at":"2026-07-06T10:45:03.059688Z","submitted_at":"2021-02-26T19:04:58Z","title":"Learning Transferable Visual Models From Natural Language Supervision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.00020","snapshot_observed_at":"2026-08-07T11:26:28.324295Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.02528","last_updated":"2025-06-03T07:06:35Z","snapshot_observed_at":"2026-08-09T09:19:35.331602Z","submitted_at":"2025-06-03T07:06:35Z","title":"RelationAdapter: Learning and Transferring Visual Relation with Diffusion Transformers","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T11:26:28.324295Z"},"links":{"cited_paper":"/paper/2103.00020","citing_paper":"/paper/2506.02528"},"observation_digest":"sha256:32001027fe68346c09b328124f25dd186b8f4be5d036c34e3f4dec92d0f3d04d","observation_id":"a3f481d8-6aea-40f0-bb8f-99b19c44ae5c","resolution":{"observed_at":"2026-08-07T11:26:28.324295Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:28.386907Z","title":"High-resolution image synthesis with latent diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.02528","last_updated":"2025-06-03T07:06:35Z","snapshot_observed_at":"2026-08-09T09:19:35.331602Z","submitted_at":"2025-06-03T07:06:35Z","title":"RelationAdapter: Learning and Transferring Visual Relation with Diffusion Transformers","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T11:26:28.386907Z"},"links":{"citing_paper":"/paper/2506.02528"},"observation_digest":"sha256:6a9ce52edf6156ca484b0d2bfd67b4bf6fb95a95e05871184cf9cb0709802118","observation_id":"ea39b648-23ff-4acc-a5ad-5232cff0c637","resolution":{"observed_at":"2026-08-07T11:26:28.386907Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:28.422715Z","title":"Dream- booth: Fine tuning text-to-image diffusion models for subject-driven generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.02528","last_updated":"2025-06-03T07:06:35Z","snapshot_observed_at":"2026-08-09T09:19:35.331602Z","submitted_at":"2025-06-03T07:06:35Z","title":"RelationAdapter: Learning and Transferring Visual Relation with Diffusion Transformers","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T11:26:28.422715Z"},"links":{"citing_paper":"/paper/2506.02528"},"observation_digest":"sha256:d7b9f448276bdf109a605577ecb709f58724e65763ab4302416a7af44eb96080","observation_id":"733308b4-23e1-4538-8767-f079716599d4","resolution":{"observed_at":"2026-08-07T11:26:28.422715Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:33.714518Z","title":"Schönberger, Silvano Galliani, Torsten Sattler, Konrad Schindler, Marc Pollefeys, and Andreas Geiger","venue":null,"work_id":"255d9510-6303-455a-bd7e-562fd3b82fe8","year":2017},"citing_paper":{"arxiv_id":"2506.02528","last_updated":"2025-06-03T07:06:35Z","snapshot_observed_at":"2026-08-09T09:19:35.331602Z","submitted_at":"2025-06-03T07:06:35Z","title":"RelationAdapter: Learning and Transferring Visual Relation with Diffusion Transformers","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T11:26:28.458054Z"},"links":{"citing_paper":"/paper/2506.02528"},"observation_digest":"sha256:1bdf0f513b85dc30fde2141f4e4b16d861eb47deb2c9232ab5449a02c30fdb1e","observation_id":"4d8f41e9-81d6-4a4c-a2f0-87919bb3a0d8","resolution":{"observed_at":"2026-08-07T11:26:33.752496Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.00136","last_updated":"2025-07-11T09:19:13Z","snapshot_observed_at":"2026-08-02T05:19:20.505310Z","submitted_at":"2024-11-28T16:19:37Z","title":"FonTS: Text Rendering with Typography and Style Controls","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.00136","snapshot_observed_at":"2026-08-07T11:26:28.536012Z","title":"Fonts: Text rendering with typography and style controls","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02528","last_updated":"2025-06-03T07:06:35Z","snapshot_observed_at":"2026-08-09T09:19:35.331602Z","submitted_at":"2025-06-03T07:06:35Z","title":"RelationAdapter: Learning and Transferring Visual Relation with Diffusion Transformers","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T11:26:28.536012Z"},"links":{"cited_paper":"/paper/2412.00136","citing_paper":"/paper/2506.02528"},"observation_digest":"sha256:ed222cdb75536047decf6e94d9d25891ce4cdff3b26356e111d4e99c38e79be1","observation_id":"72fc49d9-d2d2-4f95-a5db-5b4a877d0a54","resolution":{"observed_at":"2026-08-07T11:26:28.536012Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.15009","last_updated":"2025-04-21T10:19:12Z","snapshot_observed_at":"2026-08-07T16:00:37.570235Z","submitted_at":"2025-04-21T10:19:12Z","title":"Insert Anything: Image Insertion via In-Context Editing in DiT","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.15009","snapshot_observed_at":"2026-08-07T11:26:28.644520Z","title":"Insert anything: Image insertion via in-context editing in dit","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.02528","last_updated":"2025-06-03T07:06:35Z","snapshot_observed_at":"2026-08-09T09:19:35.331602Z","submitted_at":"2025-06-03T07:06:35Z","title":"RelationAdapter: Learning and Transferring Visual Relation with Diffusion Transformers","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T11:26:28.644520Z"},"links":{"cited_paper":"/paper/2504.15009","citing_paper":"/paper/2506.02528"},"observation_digest":"sha256:0c861e9ecaf1f7bcea41b8548728d9badb99e34985c3cc4941a59890528e3f79","observation_id":"c05e11b5-fc5f-4a57-8e49-006855fd60a3","resolution":{"observed_at":"2026-08-07T11:26:28.644520Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.01105","last_updated":"2025-08-13T17:32:12Z","snapshot_observed_at":"2026-08-09T16:30:48.628851Z","submitted_at":"2025-02-03T06:49:58Z","title":"LayerTracer: Cognitive-Aligned Layered SVG Synthesis via Diffusion Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.01105","snapshot_observed_at":"2026-08-07T11:26:28.703173Z","title":"Layertracer: Cognitive-aligned layered svg synthesis via diffusion transformer","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.02528","last_updated":"2025-06-03T07:06:35Z","snapshot_observed_at":"2026-08-09T09:19:35.331602Z","submitted_at":"2025-06-03T07:06:35Z","title":"RelationAdapter: Learning and Transferring Visual Relation with Diffusion Transformers","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T11:26:28.703173Z"},"links":{"cited_paper":"/paper/2502.01105","citing_paper":"/paper/2506.02528"},"observation_digest":"sha256:cde95c8b373abfd47d93fda27e64120d2a6b66c29f2cb9ee8912fc5b0bc7938d","observation_id":"8d076f13-d7f5-4d56-8eba-0d4e75ff391c","resolution":{"observed_at":"2026-08-07T11:26:28.703173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06062","last_updated":"2024-07-20T07:23:19Z","snapshot_observed_at":"2026-08-08T04:08:29.615896Z","submitted_at":"2024-06-10T07:18:41Z","title":"ProcessPainter: Learn Painting Process from Sequence Data","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.06062","snapshot_observed_at":"2026-08-07T11:26:28.863975Z","title":"Processpainter: Learn painting process from sequence data","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02528","last_updated":"2025-06-03T07:06:35Z","snapshot_observed_at":"2026-08-09T09:19:35.331602Z","submitted_at":"2025-06-03T07:06:35Z","title":"RelationAdapter: Learning and Transferring Visual Relation with Diffusion Transformers","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T11:26:28.863975Z"},"links":{"cited_paper":"/paper/2406.06062","citing_paper":"/paper/2506.02528"},"observation_digest":"sha256:0b742e211a24dc79f2e54020cc7ecb3c7aecb1f6b67fafa34e3f8072a333a3a2","observation_id":"396b6781-cf80-4d0e-8524-a94f31c93592","resolution":{"observed_at":"2026-08-07T11:26:28.863975Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.01572","last_updated":"2025-02-05T02:44:42Z","snapshot_observed_at":"2026-08-09T14:52:38.134111Z","submitted_at":"2025-02-03T17:55:30Z","title":"MakeAnything: Harnessing Diffusion Transformers for Multi-Domain Procedural Sequence Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.01572","snapshot_observed_at":"2026-08-07T11:26:28.950281Z","title":"Makeanything: Harnessing diffusion transformers for multi-domain procedural sequence generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.02528","last_updated":"2025-06-03T07:06:35Z","snapshot_observed_at":"2026-08-09T09:19:35.331602Z","submitted_at":"2025-06-03T07:06:35Z","title":"RelationAdapter: Learning and Transferring Visual Relation with Diffusion Transformers","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T11:26:28.950281Z"},"links":{"cited_paper":"/paper/2502.01572","citing_paper":"/paper/2506.02528"},"observation_digest":"sha256:94311294e57c1c647c37cbf08a7b4ed46ebe5fb4599794ce93c1587c2fc81ea7","observation_id":"b82dea6b-4752-40b1-9b8d-7f4016464b36","resolution":{"observed_at":"2026-08-07T11:26:28.950281Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.18445","last_updated":"2025-05-24T01:00:20Z","snapshot_observed_at":"2026-08-09T14:50:47.279582Z","submitted_at":"2025-05-24T01:00:20Z","title":"OmniConsistency: Learning Style-Agnostic Consistency from Paired Stylization Data","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.18445","snapshot_observed_at":"2026-08-07T11:26:29.016351Z","title":"Omniconsistency: Learning style-agnostic consistency from paired stylization data","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.02528","last_updated":"2025-06-03T07:06:35Z","snapshot_observed_at":"2026-08-09T09:19:35.331602Z","submitted_at":"2025-06-03T07:06:35Z","title":"RelationAdapter: Learning and Transferring Visual Relation with Diffusion Transformers","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T11:26:29.016351Z"},"links":{"cited_paper":"/paper/2505.18445","citing_paper":"/paper/2506.02528"},"observation_digest":"sha256:1517c5a0de18759c96aa0ce4380dc41a654642e8e52c1d04cccecbca7f20b621","observation_id":"d8fdb208-d409-4c04-a7fe-831841288831","resolution":{"observed_at":"2026-08-07T11:26:29.016351Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14580","last_updated":"2024-12-19T07:00:03Z","snapshot_observed_at":"2026-08-05T09:39:52.232873Z","submitted_at":"2024-12-19T07:00:03Z","title":"DiffSim: Taming Diffusion Models for Evaluating Visual Similarity","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.14580","snapshot_observed_at":"2026-08-07T11:26:29.117065Z","title":"Diffsim: Taming diffusion models for evaluating visual similarity","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02528","last_updated":"2025-06-03T07:06:35Z","snapshot_observed_at":"2026-08-09T09:19:35.331602Z","submitted_at":"2025-06-03T07:06:35Z","title":"RelationAdapter: Learning and Transferring Visual Relation with Diffusion Transformers","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T11:26:29.117065Z"},"links":{"cited_paper":"/paper/2412.14580","citing_paper":"/paper/2506.02528"},"observation_digest":"sha256:2841f13924fab9f5a634f6a0ea4802d1ec3ed7a56c182c2d45721f643987f669","observation_id":"0491bdea-bb66-4468-9b18-6f31450b14ae","resolution":{"observed_at":"2026-08-07T11:26:29.117065Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05980","last_updated":"2024-12-08T16:04:45Z","snapshot_observed_at":"2026-07-06T20:03:29.510169Z","submitted_at":"2024-12-08T16:04:45Z","title":"Anti-Reference: Universal and Immediate Defense Against Reference-Based Generation","version":1},"cited_work":{"arxiv_id":"2412.05980","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.05980","snapshot_observed_at":"2026-08-07T11:26:31.434484Z","title":"Anti-Reference: Universal and Immediate Defense Against Reference-Based Generation","venue":"cs.CV","work_id":"5bd23d15-0f29-4ed7-8bb9-e4d2572d25dd","year":2024},"citing_paper":{"arxiv_id":"2506.02528","last_updated":"2025-06-03T07:06:35Z","snapshot_observed_at":"2026-08-09T09:19:35.331602Z","submitted_at":"2025-06-03T07:06:35Z","title":"RelationAdapter: Learning and Transferring Visual Relation with Diffusion Transformers","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T11:26:29.199820Z"},"links":{"cited_paper":"/paper/2412.05980","citing_paper":"/paper/2506.02528"},"observation_digest":"sha256:8a7eab5d1ae5a83bb152f9bd58294d43beb7f55c9347ce03b71623282293baad","observation_id":"b2911789-b041-4db1-b350-a10d158acfb4","resolution":{"observed_at":"2026-08-07T11:26:31.465314Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10718","last_updated":"2025-06-30T10:03:43Z","snapshot_observed_at":"2026-07-06T20:06:57.159160Z","submitted_at":"2024-12-14T07:22:03Z","title":"Grid: Omni Visual Generation","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.10718","snapshot_observed_at":"2026-08-07T11:26:29.276612Z","title":"Grid: Visual layout generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02528","last_updated":"2025-06-03T07:06:35Z","snapshot_observed_at":"2026-08-09T09:19:35.331602Z","submitted_at":"2025-06-03T07:06:35Z","title":"RelationAdapter: Learning and Transferring Visual Relation with Diffusion Transformers","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T11:26:29.276612Z"},"links":{"cited_paper":"/paper/2412.10718","citing_paper":"/paper/2506.02528"},"observation_digest":"sha256:dfaa05372e051ad8416f1c81d5db07f85e45298badb270e465475099c71c01de","observation_id":"85d087eb-912c-4aaa-bab6-ea23d41dafd7","resolution":{"observed_at":"2026-08-07T11:26:29.276612Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:29.340378Z","title":"Images speak in images: A generalist painter for in-context visual learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.02528","last_updated":"2025-06-03T07:06:35Z","snapshot_observed_at":"2026-08-09T09:19:35.331602Z","submitted_at":"2025-06-03T07:06:35Z","title":"RelationAdapter: Learning and Transferring Visual Relation with Diffusion Transformers","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T11:26:29.340378Z"},"links":{"citing_paper":"/paper/2506.02528"},"observation_digest":"sha256:f0957aa667a865f40d1932522c65c0f120e43e0be2c117c2f711b4f5ff8ddd4d","observation_id":"c67fcc53-b8c4-4372-be6e-b6eab7cfc90a","resolution":{"observed_at":"2026-08-07T11:26:29.340378Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:29.430480Z","title":"Image quality assessment: From error visibility to structural similarity","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2506.02528","last_updated":"2025-06-03T07:06:35Z","snapshot_observed_at":"2026-08-09T09:19:35.331602Z","submitted_at":"2025-06-03T07:06:35Z","title":"RelationAdapter: Learning and Transferring Visual Relation with Diffusion Transformers","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T11:26:29.430480Z"},"links":{"citing_paper":"/paper/2506.02528"},"observation_digest":"sha256:a0943a3b6bdf6d3510e9b89dd9cadeac7662d538e8c975a5c81c473dabc7744d","observation_id":"8f833c93-77b7-4c7d-b8fc-fa9783aad9d1","resolution":{"observed_at":"2026-08-07T11:26:29.430480Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.15462","last_updated":"2022-11-21T07:07:19Z","snapshot_observed_at":"2026-08-05T11:33:58.973698Z","submitted_at":"2022-11-21T07:07:19Z","title":"Investigating Prompt Engineering in Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.15462","snapshot_observed_at":"2026-08-07T11:26:29.533343Z","title":"Investigating prompt engineering in diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.02528","last_updated":"2025-06-03T07:06:35Z","snapshot_observed_at":"2026-08-09T09:19:35.331602Z","submitted_at":"2025-06-03T07:06:35Z","title":"RelationAdapter: Learning and Transferring Visual Relation with Diffusion Transformers","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T11:26:29.533343Z"},"links":{"cited_paper":"/paper/2211.15462","citing_paper":"/paper/2506.02528"},"observation_digest":"sha256:eb69f363559a9ab65fa697432ed48c04d482e90e0cfae8ccc5b441121eb348fc","observation_id":"f9b2ed42-302f-42aa-8570-66ae28118dd6","resolution":{"observed_at":"2026-08-07T11:26:29.533343Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:33.533688Z","title":"Versatile diffusion: Text, images and variations all in one diffusion model","venue":null,"work_id":"939bcf94-3dcd-41c4-9492-de36175a2ea1","year":2023},"citing_paper":{"arxiv_id":"2506.02528","last_updated":"2025-06-03T07:06:35Z","snapshot_observed_at":"2026-08-09T09:19:35.331602Z","submitted_at":"2025-06-03T07:06:35Z","title":"RelationAdapter: Learning and Transferring Visual Relation with Diffusion Transformers","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T11:26:29.609234Z"},"links":{"citing_paper":"/paper/2506.02528"},"observation_digest":"sha256:4e0dfeff88a586df2258aac50ade056d207b854f729b32a1df6aa6899093c569","observation_id":"0e9691e3-14c4-4f3a-8e0c-4c6a1d2511e8","resolution":{"observed_at":"2026-08-07T11:26:33.605922Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:33.423769Z","title":"Paint by example: Exemplar-based image editing with diffusion models","venue":null,"work_id":"8c57b361-a248-4f22-95c9-c7509417138d","year":2023},"citing_paper":{"arxiv_id":"2506.02528","last_updated":"2025-06-03T07:06:35Z","snapshot_observed_at":"2026-08-09T09:19:35.331602Z","submitted_at":"2025-06-03T07:06:35Z","title":"RelationAdapter: Learning and Transferring Visual Relation with Diffusion Transformers","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T11:26:29.683224Z"},"links":{"citing_paper":"/paper/2506.02528"},"observation_digest":"sha256:5c079672491209accbd51a90fb6a1e5cb1368ea3e6d8970335b9a18f0cecb10e","observation_id":"a7343dc2-e163-41f8-84ac-fc189454df0f","resolution":{"observed_at":"2026-08-07T11:26:33.500647Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:29.755611Z","title":"Imagebrush: Learning visual in-context instructions for exemplar-based image manipulation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.02528","last_updated":"2025-06-03T07:06:35Z","snapshot_observed_at":"2026-08-09T09:19:35.331602Z","submitted_at":"2025-06-03T07:06:35Z","title":"RelationAdapter: Learning and Transferring Visual Relation with Diffusion Transformers","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T11:26:29.755611Z"},"links":{"citing_paper":"/paper/2506.02528"},"observation_digest":"sha256:7868c7d16dc1b677da3bf0008b17cc76bab3bc34e9ba7ff4b956395f89956e54","observation_id":"3b428b54-53b2-4efc-b393-feb13063f2a1","resolution":{"observed_at":"2026-08-07T11:26:29.755611Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:29.860968Z","title":"Sigmoid loss for language image pre-training","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.02528","last_updated":"2025-06-03T07:06:35Z","snapshot_observed_at":"2026-08-09T09:19:35.331602Z","submitted_at":"2025-06-03T07:06:35Z","title":"RelationAdapter: Learning and Transferring Visual Relation with Diffusion Transformers","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T11:26:29.860968Z"},"links":{"citing_paper":"/paper/2506.02528"},"observation_digest":"sha256:61fe41366cf4b40fe4312a86ed21f045d075dae5b50eb1b125faed0343cd2685","observation_id":"a72d8917-89bf-4795-8151-485b40f49652","resolution":{"observed_at":"2026-08-07T11:26:29.860968Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:33.299646Z","title":"Finestyle: Fine-grained controllable style personalization for text-to-image models","venue":null,"work_id":"fd10b265-6b57-4525-bbbd-382203dbec3d","year":2024},"citing_paper":{"arxiv_id":"2506.02528","last_updated":"2025-06-03T07:06:35Z","snapshot_observed_at":"2026-08-09T09:19:35.331602Z","submitted_at":"2025-06-03T07:06:35Z","title":"RelationAdapter: Learning and Transferring Visual Relation with Diffusion Transformers","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T11:26:29.965747Z"},"links":{"citing_paper":"/paper/2506.02528"},"observation_digest":"sha256:46b4ee2253a8a6e1bfd3ef13f4ddc9875f93e719c8d0cf68a25f454e3a53897a","observation_id":"6c2a7556-8077-45c8-b231-038b6f1f95bf","resolution":{"observed_at":"2026-08-07T11:26:33.315640Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.17113","last_updated":"2024-06-23T03:47:27Z","snapshot_observed_at":"2026-08-07T05:26:05.587260Z","submitted_at":"2024-02-27T01:19:53Z","title":"Transparent Image Layer Diffusion using Latent Transparency","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.17113","snapshot_observed_at":"2026-08-07T11:26:30.063204Z","title":"Transparent image layer diffusion using latent transparency","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02528","last_updated":"2025-06-03T07:06:35Z","snapshot_observed_at":"2026-08-09T09:19:35.331602Z","submitted_at":"2025-06-03T07:06:35Z","title":"RelationAdapter: Learning and Transferring Visual Relation with Diffusion Transformers","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T11:26:30.063204Z"},"links":{"cited_paper":"/paper/2402.17113","citing_paper":"/paper/2506.02528"},"observation_digest":"sha256:cf5714105f451ad7f1684873852ccf267f496d6e2cbd2a207cbe41c61ce2d3de","observation_id":"ff729933-4eba-43f6-8f28-56e7b34638f2","resolution":{"observed_at":"2026-08-07T11:26:30.063204Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:30.122524Z","title":"Adding conditional control to text-to-image diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.02528","last_updated":"2025-06-03T07:06:35Z","snapshot_observed_at":"2026-08-09T09:19:35.331602Z","submitted_at":"2025-06-03T07:06:35Z","title":"RelationAdapter: Learning and Transferring Visual Relation with Diffusion Transformers","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T11:26:30.122524Z"},"links":{"citing_paper":"/paper/2506.02528"},"observation_digest":"sha256:b8e95ccb4e526c1076a46d134e9b7c7262c821a1c58c8c496b24d8551482176b","observation_id":"98351591-9fb3-4625-a754-018c2da1c0ae","resolution":{"observed_at":"2026-08-07T11:26:30.122524Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:30.217419Z","title":"Ssr-encoder: Encoding selective subject representation for subject-driven generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02528","last_updated":"2025-06-03T07:06:35Z","snapshot_observed_at":"2026-08-09T09:19:35.331602Z","submitted_at":"2025-06-03T07:06:35Z","title":"RelationAdapter: Learning and Transferring Visual Relation with Diffusion Transformers","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T11:26:30.217419Z"},"links":{"citing_paper":"/paper/2506.02528"},"observation_digest":"sha256:362d0a6d6bb3394f9b1478ba9c643f171dd522b5b116ebfe43aa0d109e5b5e83","observation_id":"f6cb4c78-a4d6-435c-a1ac-ff93d2362a84","resolution":{"observed_at":"2026-08-07T11:26:30.217419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:33.129551Z","title":"Fast personalized text to image synthesis with attention injection","venue":null,"work_id":"878ecb5f-b17e-401f-a1ff-b3eac5cd0140","year":2024},"citing_paper":{"arxiv_id":"2506.02528","last_updated":"2025-06-03T07:06:35Z","snapshot_observed_at":"2026-08-09T09:19:35.331602Z","submitted_at":"2025-06-03T07:06:35Z","title":"RelationAdapter: Learning and Transferring Visual Relation with Diffusion Transformers","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T11:26:30.283277Z"},"links":{"citing_paper":"/paper/2506.02528"},"observation_digest":"sha256:b8971d80dc6560b682676e190f38afb61e1eac73081137428768228cd1b344c7","observation_id":"b561ba52-4045-4d5c-9655-5c99254571dd","resolution":{"observed_at":"2026-08-07T11:26:33.194879Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.07764","last_updated":"2025-04-01T08:37:38Z","snapshot_observed_at":"2026-07-06T17:43:22.965126Z","submitted_at":"2024-03-12T15:53:14Z","title":"Stable-Makeup: When Real-World Makeup Transfer Meets Diffusion Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.07764","snapshot_observed_at":"2026-08-07T11:26:30.361206Z","title":"Stable-makeup: When real-world makeup transfer meets diffusion model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02528","last_updated":"2025-06-03T07:06:35Z","snapshot_observed_at":"2026-08-09T09:19:35.331602Z","submitted_at":"2025-06-03T07:06:35Z","title":"RelationAdapter: Learning and Transferring Visual Relation with Diffusion Transformers","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T11:26:30.361206Z"},"links":{"cited_paper":"/paper/2403.07764","citing_paper":"/paper/2506.02528"},"observation_digest":"sha256:496ec92bd8d39ceafd2ade96bc45e4bd0e030f62d3f5b2d549e80082dc1514c1","observation_id":"d9cdf82b-3356-4a27-950d-6203140bf0a7","resolution":{"observed_at":"2026-08-07T11:26:30.361206Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07027","last_updated":"2025-03-10T08:07:17Z","snapshot_observed_at":"2026-08-07T17:17:43.519906Z","submitted_at":"2025-03-10T08:07:17Z","title":"EasyControl: Adding Efficient and Flexible Control for Diffusion Transformer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.07027","snapshot_observed_at":"2026-08-07T11:26:30.437018Z","title":"Easycontrol: Adding efficient and flexible control for diffusion transformer","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.02528","last_updated":"2025-06-03T07:06:35Z","snapshot_observed_at":"2026-08-09T09:19:35.331602Z","submitted_at":"2025-06-03T07:06:35Z","title":"RelationAdapter: Learning and Transferring Visual Relation with Diffusion Transformers","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T11:26:30.437018Z"},"links":{"cited_paper":"/paper/2503.07027","citing_paper":"/paper/2506.02528"},"observation_digest":"sha256:29fbf085ec6de915e94e2b846acf5cd828f5e8567b56622abc2a2d6d9f69bdc1","observation_id":"72b2355f-0259-4a73-88f7-e4ec95a3036f","resolution":{"observed_at":"2026-08-07T11:26:30.437018Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.14078","last_updated":"2024-12-10T16:04:50Z","snapshot_observed_at":"2026-07-06T18:48:53.833921Z","submitted_at":"2024-07-19T07:14:23Z","title":"Stable-Hair: Real-World Hair Transfer via Diffusion Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.14078","snapshot_observed_at":"2026-08-07T11:26:30.537511Z","title":"Stable-hair: Real-world hair transfer via diffusion model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02528","last_updated":"2025-06-03T07:06:35Z","snapshot_observed_at":"2026-08-09T09:19:35.331602Z","submitted_at":"2025-06-03T07:06:35Z","title":"RelationAdapter: Learning and Transferring Visual Relation with Diffusion Transformers","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T11:26:30.537511Z"},"links":{"cited_paper":"/paper/2407.14078","citing_paper":"/paper/2506.02528"},"observation_digest":"sha256:f3df26f0a9487635e7b91c78ad8a8d4776f35a359fa658bec56d5d7408ec3e0c","observation_id":"0ffebfdb-e4a7-4998-b772-81e63a107d44","resolution":{"observed_at":"2026-08-07T11:26:30.537511Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.18583","last_updated":"2024-06-05T17:53:26Z","snapshot_observed_at":"2026-08-06T11:25:48.819238Z","submitted_at":"2024-06-05T17:53:26Z","title":"Lumina-Next: Making Lumina-T2X Stronger and Faster with Next-DiT","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.18583","snapshot_observed_at":"2026-08-07T11:26:30.614880Z","title":"4 images are organized into a grid of 2 rows and 2 columns","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02528","last_updated":"2025-06-03T07:06:35Z","snapshot_observed_at":"2026-08-09T09:19:35.331602Z","submitted_at":"2025-06-03T07:06:35Z","title":"RelationAdapter: Learning and Transferring Visual Relation with Diffusion Transformers","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T11:26:30.614880Z"},"links":{"cited_paper":"/paper/2406.18583","citing_paper":"/paper/2506.02528"},"observation_digest":"sha256:23430dd7a6b42ea0419c078073e934a854a5be6a2262037ff6831ba59df4f2d4","observation_id":"89787206-df16-40ae-a48d-3588a67b81ed","resolution":{"observed_at":"2026-08-07T11:26:30.614880Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:32.946241Z","title":null,"venue":null,"work_id":"c3ff2583-ef9c-49dd-9b49-b12918abb3f9","year":null},"citing_paper":{"arxiv_id":"2506.02528","last_updated":"2025-06-03T07:06:35Z","snapshot_observed_at":"2026-08-09T09:19:35.331602Z","submitted_at":"2025-06-03T07:06:35Z","title":"RelationAdapter: Learning and Transferring Visual Relation with Diffusion Transformers","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T11:26:30.696048Z"},"links":{"citing_paper":"/paper/2506.02528"},"observation_digest":"sha256:ddc956dfbacb96e79c93d37032f40d490d0f03fd9adf2b235185c2b537ea72fb","observation_id":"1378a512-0f64-4e03-9e00-1d1e3b8b7e29","resolution":{"observed_at":"2026-08-07T11:26:33.017482Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:32.785114Z","title":null,"venue":null,"work_id":"d826da41-dc1e-43bb-b1da-2dfb66fbc9b2","year":null},"citing_paper":{"arxiv_id":"2506.02528","last_updated":"2025-06-03T07:06:35Z","snapshot_observed_at":"2026-08-09T09:19:35.331602Z","submitted_at":"2025-06-03T07:06:35Z","title":"RelationAdapter: Learning and Transferring Visual Relation with Diffusion Transformers","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T11:26:30.778149Z"},"links":{"citing_paper":"/paper/2506.02528"},"observation_digest":"sha256:b85d45a5296bbbd59eb6d0637c9486e9f3b9d14ba87996e82cbcf37de70e11aa","observation_id":"c790220d-72c5-498c-aac0-d718ad0880d5","resolution":{"observed_at":"2026-08-07T11:26:32.858751Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:32.618141Z","title":null,"venue":null,"work_id":"706ca621-8f1c-492c-b318-d2e8d53580db","year":null},"citing_paper":{"arxiv_id":"2506.02528","last_updated":"2025-06-03T07:06:35Z","snapshot_observed_at":"2026-08-09T09:19:35.331602Z","submitted_at":"2025-06-03T07:06:35Z","title":"RelationAdapter: Learning and Transferring Visual Relation with Diffusion Transformers","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-07T11:26:30.850475Z"},"links":{"citing_paper":"/paper/2506.02528"},"observation_digest":"sha256:fdf3d097f310793a1f1f0043f0d1302381dffab200ca2aff0763c5304ee560d6","observation_id":"156ca6d3-9894-4956-b049-c3da08a5d18d","resolution":{"observed_at":"2026-08-07T11:26:32.695543Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:32.426949Z","title":null,"venue":null,"work_id":"3655a525-1e74-4c81-a617-ac10fbc12e04","year":null},"citing_paper":{"arxiv_id":"2506.02528","last_updated":"2025-06-03T07:06:35Z","snapshot_observed_at":"2026-08-09T09:19:35.331602Z","submitted_at":"2025-06-03T07:06:35Z","title":"RelationAdapter: Learning and Transferring Visual Relation with Diffusion Transformers","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-07T11:26:30.923971Z"},"links":{"citing_paper":"/paper/2506.02528"},"observation_digest":"sha256:d237b6710ef7ef249d4ddc60f39ad8f59b50bd72fe5965f70ff847f8ecb076d8","observation_id":"ead06ca3-b213-4e56-8c63-d3b0dc5257c2","resolution":{"observed_at":"2026-08-07T11:26:32.526412Z","resolver_source":"raw_fallback","status":"parse_uncertain"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:32.234121Z","title":null,"venue":null,"work_id":"067c7c9f-91cd-446e-9850-05695cf00af6","year":null},"citing_paper":{"arxiv_id":"2506.02528","last_updated":"2025-06-03T07:06:35Z","snapshot_observed_at":"2026-08-09T09:19:35.331602Z","submitted_at":"2025-06-03T07:06:35Z","title":"RelationAdapter: Learning and Transferring Visual Relation with Diffusion Transformers","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-07T11:26:30.997782Z"},"links":{"citing_paper":"/paper/2506.02528"},"observation_digest":"sha256:7e1b323a05f8cd9dfee982eafd5326bf4247da11cf49958bc1691c7e037f2fb2","observation_id":"ecd19af3-cfd5-42df-ba57-eea803bb5665","resolution":{"observed_at":"2026-08-07T11:26:32.352512Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:32.093490Z","title":"Figure 9: Structured prompt used for labeling image pairs and extracting transformation instructions","venue":null,"work_id":"ec40b6a1-1628-4a6d-a42a-717ee1957f12","year":null},"citing_paper":{"arxiv_id":"2506.02528","last_updated":"2025-06-03T07:06:35Z","snapshot_observed_at":"2026-08-09T09:19:35.331602Z","submitted_at":"2025-06-03T07:06:35Z","title":"RelationAdapter: Learning and Transferring Visual Relation with Diffusion Transformers","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-07T11:26:31.101356Z"},"links":{"citing_paper":"/paper/2506.02528"},"observation_digest":"sha256:8347da6b1a71f76289389215aa2b1d0c7d6955e73f8f8862646a0b7190f89d84","observation_id":"e6c401e2-cac0-4e88-ad32-3d67999d0377","resolution":{"observed_at":"2026-08-07T11:26:32.157655Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:31.935434Z","title":null,"venue":null,"work_id":"a54c352a-016d-49df-b1e4-e6ffd40f8e9e","year":null},"citing_paper":{"arxiv_id":"2506.02528","last_updated":"2025-06-03T07:06:35Z","snapshot_observed_at":"2026-08-09T09:19:35.331602Z","submitted_at":"2025-06-03T07:06:35Z","title":"RelationAdapter: Learning and Transferring Visual Relation with Diffusion Transformers","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-07T11:26:31.151385Z"},"links":{"citing_paper":"/paper/2506.02528"},"observation_digest":"sha256:3200ff91fa1639d22ce985602975d12f8ef711a4083752f214a1f927502e5438","observation_id":"e5e869e3-ec43-4f0c-8dbe-574684e32465","resolution":{"observed_at":"2026-08-07T11:26:32.017466Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:31.817195Z","title":"B1\": {\"consistency","venue":null,"work_id":"a72ec55a-cc70-4409-895d-623bba7efc59","year":null},"citing_paper":{"arxiv_id":"2506.02528","last_updated":"2025-06-03T07:06:35Z","snapshot_observed_at":"2026-08-09T09:19:35.331602Z","submitted_at":"2025-06-03T07:06:35Z","title":"RelationAdapter: Learning and Transferring Visual Relation with Diffusion Transformers","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-07T11:26:31.248399Z"},"links":{"citing_paper":"/paper/2506.02528"},"observation_digest":"sha256:0a5cf1e6fe4345d20fd2f2d563922481a0f718afd91973ce0248c63600de76b2","observation_id":"9f97ab58-dc20-4b42-9160-03ff7c0fa24d","resolution":{"observed_at":"2026-08-07T11:26:31.864166Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.02528","last_updated":"2025-06-03T07:06:35Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-09T09:19:35.331602Z","submitted_at":"2025-06-03T07:06:35Z","title":"RelationAdapter: Learning and Transferring Visual Relation with Diffusion Transformers"},"reference_resolution":{"displayed":69,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":1,"unresolved":45,"verified_exact":1,"verified_fuzzy":22},"total_outbound_references":69},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 69 of 69 outbound references and 8 inbound Pith citation observations for arXiv:2506.02528."}