{"as_of":"2026-08-22T14:46:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:1a2aea068363a180e0242a147b6ffb328641fd0c9041d599a08d3281abaf9ee6","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":13,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":13,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-22T06:32:14.747728+00:00","state":"measured"},{"denominator":13,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":13,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T12:18:26.712338Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T00:19:13.837374Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2411.06558","last_updated":"2024-11-15T14:38:32Z","snapshot_observed_at":"2026-08-20T09:11:36.349143Z","submitted_at":"2024-11-10T18:45:41Z","title":"Region-Aware Text-to-Image Generation via Hard Binding and Soft Refinement","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.06558","snapshot_observed_at":"2026-08-11T06:01:59.578241Z","title":"Region-aware text-to-image generation via hard binding and soft refinement","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.16919","last_updated":"2025-08-09T03:33:36Z","snapshot_observed_at":"2026-08-15T08:30:24.774934Z","submitted_at":"2024-12-22T08:28:20Z","title":"TAR3D: Creating High-Quality 3D Assets via Next-Part Prediction","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-11T06:01:59.578241Z"},"links":{"cited_paper":"/paper/2411.06558","citing_paper":"/paper/2412.16919"},"observation_digest":"sha256:21b90d265058ea62e45196a16ae86f6f523c6d764660deb5c8bdf3cd4b940ca9","observation_id":"08f87b0d-61a4-4975-9540-9f5f46a46a11","resolution":{"observed_at":"2026-08-11T06:01:59.578241Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.06558","last_updated":"2024-11-15T14:38:32Z","snapshot_observed_at":"2026-08-20T09:11:36.349143Z","submitted_at":"2024-11-10T18:45:41Z","title":"Region-Aware Text-to-Image Generation via Hard Binding and Soft Refinement","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.06558","snapshot_observed_at":"2026-08-10T22:42:47.835262Z","title":"Region-aware text-to-image generation via har d binding and soft reﬁnement,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.00917","last_updated":"2025-01-01T18:27:13Z","snapshot_observed_at":"2026-08-14T17:33:14.520162Z","submitted_at":"2025-01-01T18:27:13Z","title":"Hierarchical Vision-Language Alignment for Text-to-Image Generation via Diffusion Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-10T22:42:47.835262Z"},"links":{"cited_paper":"/paper/2411.06558","citing_paper":"/paper/2501.00917"},"observation_digest":"sha256:c442eb88ace253a0e05772ba8fc0493f957869d672a8e7059366770d013499a6","observation_id":"3aad78ac-da31-432d-9ade-f8e89ecaf145","resolution":{"observed_at":"2026-08-10T22:42:47.835262Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.06558","last_updated":"2024-11-15T14:38:32Z","snapshot_observed_at":"2026-08-20T09:11:36.349143Z","submitted_at":"2024-11-10T18:45:41Z","title":"Region-Aware Text-to-Image Generation via Hard Binding and Soft Refinement","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.06558","snapshot_observed_at":"2026-08-16T12:18:26.712338Z","title":"Region-aware text-to-image generation via hard binding and soft refinement","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.13072","last_updated":"2025-04-17T16:33:39Z","snapshot_observed_at":"2026-08-17T13:45:43.188469Z","submitted_at":"2025-04-17T16:33:39Z","title":"HiScene: Creating Hierarchical 3D Scenes with Isometric View Generation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-16T12:18:26.712338Z"},"links":{"cited_paper":"/paper/2411.06558","citing_paper":"/paper/2504.13072"},"observation_digest":"sha256:b847a1f0f3b8f7abfdb0443bf2912875b57e8f5126d7d112ce1ad8bf8b60e917","observation_id":"6c0e0fc7-1b96-4cc8-b362-56def112dc00","resolution":{"observed_at":"2026-08-16T12:18:26.712338Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.06558","last_updated":"2024-11-15T14:38:32Z","snapshot_observed_at":"2026-08-20T09:11:36.349143Z","submitted_at":"2024-11-10T18:45:41Z","title":"Region-Aware Text-to-Image Generation via Hard Binding and Soft Refinement","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.06558","snapshot_observed_at":"2026-08-16T05:48:43.642599Z","title":"arXiv preprint arXiv:2411.06558 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.19724","last_updated":"2025-04-28T12:19:53Z","snapshot_observed_at":"2026-08-17T23:10:34.175088Z","submitted_at":"2025-04-28T12:19:53Z","title":"RepText: Rendering Visual Text via Replicating","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-16T05:48:43.642599Z"},"links":{"cited_paper":"/paper/2411.06558","citing_paper":"/paper/2504.19724"},"observation_digest":"sha256:42c11c061dd971d9906807df8411892d35214dc4c46f8c63a556dd20bf51c9bf","observation_id":"df6407ff-6f84-4d3b-87ba-8776adc56e58","resolution":{"observed_at":"2026-08-16T05:48:43.642599Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.06558","last_updated":"2024-11-15T14:38:32Z","snapshot_observed_at":"2026-08-20T09:11:36.349143Z","submitted_at":"2024-11-10T18:45:41Z","title":"Region-Aware Text-to-Image Generation via Hard Binding and Soft Refinement","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.06558","snapshot_observed_at":"2026-08-07T14:23:05.812424Z","title":"Region-aware text-to-image generation via hard binding and soft refinement","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19149","last_updated":"2025-05-25T13:54:31Z","snapshot_observed_at":"2026-08-15T07:14:06.446798Z","submitted_at":"2025-05-25T13:54:31Z","title":"MIND-Edit: MLLM Insight-Driven Editing via Language-Vision Projection","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:05.812424Z"},"links":{"cited_paper":"/paper/2411.06558","citing_paper":"/paper/2505.19149"},"observation_digest":"sha256:93d874fa5f19a84323dc2d02678bfa1c2d84f9fe912bc34afe334844f54ed09a","observation_id":"d692a309-d3a0-4e9a-873e-1454d442229b","resolution":{"observed_at":"2026-08-07T14:23:05.812424Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.06558","last_updated":"2024-11-15T14:38:32Z","snapshot_observed_at":"2026-08-20T09:11:36.349143Z","submitted_at":"2024-11-10T18:45:41Z","title":"Region-Aware Text-to-Image Generation via Hard Binding and Soft Refinement","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.06558","snapshot_observed_at":"2026-08-06T19:55:01.569424Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.04451","last_updated":"2025-07-06T16:17:32Z","snapshot_observed_at":"2026-08-17T05:05:00.761342Z","submitted_at":"2025-07-06T16:17:32Z","title":"CoT-lized Diffusion: Let's Reinforce T2I Generation Step-by-step","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T19:55:01.569424Z"},"links":{"cited_paper":"/paper/2411.06558","citing_paper":"/paper/2507.04451"},"observation_digest":"sha256:2d4cf07b09b0f5a1515247ef9ac9713bd935d14598c43c506124f63fde1457bc","observation_id":"7cbb73b9-772c-47f3-a2a7-756add78e65d","resolution":{"observed_at":"2026-08-06T19:55:01.569424Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.06558","last_updated":"2024-11-15T14:38:32Z","snapshot_observed_at":"2026-08-20T09:11:36.349143Z","submitted_at":"2024-11-10T18:45:41Z","title":"Region-Aware Text-to-Image Generation via Hard Binding and Soft Refinement","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.06558","snapshot_observed_at":"2026-08-06T15:18:06.126143Z","title":"Region-aware text-to-image generation via hard binding and soft refinement","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.16254","last_updated":"2025-07-22T06:07:07Z","snapshot_observed_at":"2026-08-18T15:05:46.754623Z","submitted_at":"2025-07-22T06:07:07Z","title":"Edge-case Synthesis for Fisheye Object Detection: A Data-centric Perspective","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T15:18:06.126143Z"},"links":{"cited_paper":"/paper/2411.06558","citing_paper":"/paper/2507.16254"},"observation_digest":"sha256:b08b32228c65da99f6fc0cb5bc30a1773c214fc9538a6dce185a078c70a08863","observation_id":"af7351d6-2307-45ad-94a2-195c8401c7ad","resolution":{"observed_at":"2026-08-06T15:18:06.126143Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.06558","last_updated":"2024-11-15T14:38:32Z","snapshot_observed_at":"2026-08-20T09:11:36.349143Z","submitted_at":"2024-11-10T18:45:41Z","title":"Region-Aware Text-to-Image Generation via Hard Binding and Soft Refinement","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.06558","snapshot_observed_at":"2026-08-15T17:47:25.542962Z","title":"Region-aware text-to-image generation via hard binding and soft refinement","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.20536","last_updated":"2025-07-29T06:16:18Z","snapshot_observed_at":"2026-08-21T03:13:14.668626Z","submitted_at":"2025-07-28T05:41:22Z","title":"T2I-Copilot: A Training-Free Multi-Agent Text-to-Image System for Enhanced Prompt Interpretation and Interactive Generation","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-15T17:47:25.542962Z"},"links":{"cited_paper":"/paper/2411.06558","citing_paper":"/paper/2507.20536"},"observation_digest":"sha256:f4eb2c181b131cf9129c95b21cedc25d0697599a7747b913d981b672f907566d","observation_id":"e1fe5714-267d-4c40-876c-44facc09cecc","resolution":{"observed_at":"2026-08-15T17:47:25.542962Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.06558","last_updated":"2024-11-15T14:38:32Z","snapshot_observed_at":"2026-08-20T09:11:36.349143Z","submitted_at":"2024-11-10T18:45:41Z","title":"Region-Aware Text-to-Image Generation via Hard Binding and Soft Refinement","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.06558","snapshot_observed_at":"2026-08-05T15:10:14.391535Z","title":"Region-aware text-to-image generation via hard binding and soft refinement","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.20505","last_updated":"2025-08-28T07:45:08Z","snapshot_observed_at":"2026-08-10T16:33:35.024598Z","submitted_at":"2025-08-28T07:45:08Z","title":"Describe, Don't Dictate: Semantic Image Editing with Natural Language Intent","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:14.391535Z"},"links":{"cited_paper":"/paper/2411.06558","citing_paper":"/paper/2508.20505"},"observation_digest":"sha256:6e3af0164a026e507d8279675ec2d05783085397fd82a9c95eb68b5eac5148ae","observation_id":"0bc4d044-4d0a-45d6-9088-17efc8330089","resolution":{"observed_at":"2026-08-05T15:10:14.391535Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.06558","last_updated":"2024-11-15T14:38:32Z","snapshot_observed_at":"2026-08-20T09:11:36.349143Z","submitted_at":"2024-11-10T18:45:41Z","title":"Region-Aware Text-to-Image Generation via Hard Binding and Soft Refinement","version":2},"cited_work":{"arxiv_id":"2411.06558","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.06558","snapshot_observed_at":"2026-07-04T00:19:13.837374Z","title":"arXiv preprint arXiv:2411.06558 (2024)","venue":null,"work_id":"f9d700cb-bb3f-4fa2-b8ba-ea4a616649bc","year":2024},"citing_paper":{"arxiv_id":"2604.09850","last_updated":"2026-04-10T19:25:24Z","snapshot_observed_at":"2026-08-11T02:39:01.767613Z","submitted_at":"2026-04-10T19:25:24Z","title":"Training-Free Object-Background Compositional T2I via Dynamic Spatial Guidance and Multi-Path Pruning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-10T17:56:06.693585Z"},"links":{"cited_paper":"/paper/2411.06558","citing_paper":"/paper/2604.09850"},"observation_digest":"sha256:487ef4615ff1c4ea44318f441e7179c19ef93f2ebd3a1b186a66a2f9b41df1ef","observation_id":"b3c8ef78-49c2-4c24-be53-3c8237a61f6d","resolution":{"observed_at":"2026-05-11T05:51:02.132084Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.06558","last_updated":"2024-11-15T14:38:32Z","snapshot_observed_at":"2026-08-20T09:11:36.349143Z","submitted_at":"2024-11-10T18:45:41Z","title":"Region-Aware Text-to-Image Generation via Hard Binding and Soft Refinement","version":2},"cited_work":{"arxiv_id":"2411.06558","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.06558","snapshot_observed_at":"2026-07-04T00:19:13.837374Z","title":"arXiv preprint arXiv:2411.06558 (2024)","venue":null,"work_id":"f9d700cb-bb3f-4fa2-b8ba-ea4a616649bc","year":2024},"citing_paper":{"arxiv_id":"2605.11061","last_updated":"2026-05-11T17:59:09Z","snapshot_observed_at":"2026-08-12T23:15:37.229219Z","submitted_at":"2026-05-11T17:59:09Z","title":"HiDream-O1-Image: A Natively Unified Image Generative Foundation Model with Pixel-level Unified Transformer","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-13T07:30:53.939221Z"},"links":{"cited_paper":"/paper/2411.06558","citing_paper":"/paper/2605.11061"},"observation_digest":"sha256:2be679fae93ef80acf927eb9eec3dde444da07a93399984f26afe0af26513a11","observation_id":"9452ff85-47dc-466c-b7de-e940990143e7","resolution":{"observed_at":"2026-05-13T07:32:29.676226Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.06558","last_updated":"2024-11-15T14:38:32Z","snapshot_observed_at":"2026-08-20T09:11:36.349143Z","submitted_at":"2024-11-10T18:45:41Z","title":"Region-Aware Text-to-Image Generation via Hard Binding and Soft Refinement","version":2},"cited_work":{"arxiv_id":"2411.06558","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.06558","snapshot_observed_at":"2026-07-04T00:19:13.837374Z","title":"arXiv preprint arXiv:2411.06558 (2024)","venue":null,"work_id":"f9d700cb-bb3f-4fa2-b8ba-ea4a616649bc","year":2024},"citing_paper":{"arxiv_id":"2606.18906","last_updated":"2026-06-17T10:32:14Z","snapshot_observed_at":"2026-08-12T21:21:41.637013Z","submitted_at":"2026-06-17T10:32:14Z","title":"BindEdit: Taming Attention Leakage for Precise Multi-Object Image Editing","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-26T21:16:13.170736Z"},"links":{"cited_paper":"/paper/2411.06558","citing_paper":"/paper/2606.18906"},"observation_digest":"sha256:d56fb065230f3ebccb47e7e5055b2a942df5e076636c00df81a1686cd32db606","observation_id":"11e06250-7f8b-407f-b924-00113e7e8bfc","resolution":{"observed_at":"2026-07-04T00:19:13.838737Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.06558","last_updated":"2024-11-15T14:38:32Z","snapshot_observed_at":"2026-08-20T09:11:36.349143Z","submitted_at":"2024-11-10T18:45:41Z","title":"Region-Aware Text-to-Image Generation via Hard Binding and Soft Refinement","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.06558","snapshot_observed_at":"2026-08-12T00:44:45.882742Z","title":"arXiv preprint arXiv:2411.06558 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.07948","last_updated":"2026-08-08T06:23:48Z","snapshot_observed_at":"2026-08-15T05:52:24.898852Z","submitted_at":"2026-08-08T06:23:48Z","title":"SynVAR: Synergizing Spatial and Semantic Alignment in Visual Autoregressive Model","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T00:44:45.882742Z"},"links":{"cited_paper":"/paper/2411.06558","citing_paper":"/paper/2608.07948"},"observation_digest":"sha256:ec2b8aa6d15d28033571cf64d2fccfb246140a56e23b9b87efeb77c02bd397ce","observation_id":"604ec7ab-a626-4a21-b16d-6c373ea36c5a","resolution":{"observed_at":"2026-08-12T00:44:45.882742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2411.06558/citation-record","integrity":"/paper/2411.06558/integrity","json":"/paper/2411.06558/citation-record.json","paper":"/paper/2411.06558"},"outbound":[],"paper":{"arxiv_id":"2411.06558","last_updated":"2024-11-15T14:38:32Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-20T09:11:36.349143Z","submitted_at":"2024-11-10T18:45:41Z","title":"Region-Aware Text-to-Image Generation via Hard Binding and Soft Refinement"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"thesis":"As of 22 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 13 inbound Pith citation observations for arXiv:2411.06558."}