{"as_of":"2026-08-08T07:03:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f7db58636cdfb545ff464adf914074dbc91a4b2c1b20e6880ab6cf3c7672b7cb","coverage":[{"denominator":121,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:25:22.585226Z","state":"measured"},{"denominator":103,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":103,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-30T06:38:39.360472Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-06-30T06:44:19.355063Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.19084","last_updated":"2025-05-25T10:40:52Z","snapshot_observed_at":"2026-08-07T22:19:20.729696Z","submitted_at":"2025-05-25T10:40:52Z","title":"Jodi: Unification of Visual Generation and Understanding via Joint Modeling","version":1},"cited_work":{"arxiv_id":"2505.19084","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.19084","snapshot_observed_at":"2026-06-30T06:44:19.355063Z","title":"Jodi: Unification of visual generation and under- standing via joint modeling.arXiv preprint arXiv:2505.19084","venue":null,"work_id":"801af03a-aec0-41fc-8d0c-f200c92303cb","year":2025},"citing_paper":{"arxiv_id":"2605.00658","last_updated":"2026-05-01T13:40:56Z","snapshot_observed_at":"2026-07-06T23:14:01.852096Z","submitted_at":"2026-05-01T13:40:56Z","title":"UniVidX: A Unified Multimodal Framework for Versatile Video Generation via Diffusion Priors","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-05-09T20:05:21.723724Z"},"links":{"cited_paper":"/paper/2505.19084","citing_paper":"/paper/2605.00658"},"observation_digest":"sha256:2ff6bb0637be9fc690333d0eefa9e4961de5a7ab0c56b31728b803e855b99d48","observation_id":"bd0bfbbc-735c-4fab-8c87-1ea894e2b05c","resolution":{"observed_at":"2026-05-11T15:26:07.834476Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.19084","last_updated":"2025-05-25T10:40:52Z","snapshot_observed_at":"2026-08-07T22:19:20.729696Z","submitted_at":"2025-05-25T10:40:52Z","title":"Jodi: Unification of Visual Generation and Understanding via Joint Modeling","version":1},"cited_work":{"arxiv_id":"2505.19084","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.19084","snapshot_observed_at":"2026-06-30T06:44:19.355063Z","title":"Jodi: Unification of visual generation and under- standing via joint modeling.arXiv preprint arXiv:2505.19084","venue":null,"work_id":"801af03a-aec0-41fc-8d0c-f200c92303cb","year":2025},"citing_paper":{"arxiv_id":"2605.09622","last_updated":"2026-05-10T16:08:36Z","snapshot_observed_at":"2026-07-06T23:21:39.966502Z","submitted_at":"2026-05-10T16:08:36Z","title":"Any2Any 3D Diffusion Models with Knowledge Transfer: A Radiotherapy Planning Study","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-05-12T04:53:06.362430Z"},"links":{"cited_paper":"/paper/2505.19084","citing_paper":"/paper/2605.09622"},"observation_digest":"sha256:638499aed303c6d95cd14d08b58b90a7ec49ad64c4ebe75a193991e9d1d59211","observation_id":"31191285-971e-4c0e-862f-aad9e6c2fdd3","resolution":{"observed_at":"2026-05-12T05:51:25.664198Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.19084","last_updated":"2025-05-25T10:40:52Z","snapshot_observed_at":"2026-08-07T22:19:20.729696Z","submitted_at":"2025-05-25T10:40:52Z","title":"Jodi: Unification of Visual Generation and Understanding via Joint Modeling","version":1},"cited_work":{"arxiv_id":"2505.19084","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.19084","snapshot_observed_at":"2026-06-30T06:44:19.355063Z","title":"Jodi: Unification of visual generation and under- standing via joint modeling.arXiv preprint arXiv:2505.19084","venue":null,"work_id":"801af03a-aec0-41fc-8d0c-f200c92303cb","year":2025},"citing_paper":{"arxiv_id":"2606.30332","last_updated":"2026-06-29T14:13:27Z","snapshot_observed_at":"2026-08-06T22:56:43.073041Z","submitted_at":"2026-06-29T14:13:27Z","title":"UniGP: Taming Diffusion Transformer for Prior-Preserved Unified Generation and Perception","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-30T06:38:39.360472Z"},"links":{"cited_paper":"/paper/2505.19084","citing_paper":"/paper/2606.30332"},"observation_digest":"sha256:ad198e24ab0657bd8e3beae6ca21a7160c446a0162c65d185eba3a5ad41795e6","observation_id":"fbb715a8-beff-41b8-b7c4-03b22b9d9b89","resolution":{"observed_at":"2026-06-30T06:44:19.357185Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.19084/citation-record","integrity":"/paper/2505.19084/integrity","json":"/paper/2505.19084/citation-record.json","paper":"/paper/2505.19084"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2404.14219","last_updated":"2024-08-30T21:17:17Z","snapshot_observed_at":"2026-07-06T18:03:47.096406Z","submitted_at":"2024-04-22T14:32:33Z","title":"Phi-3 Technical Report: A Highly Capable Language Model Locally on Your Phone","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14219","snapshot_observed_at":"2026-08-07T14:25:20.023881Z","title":"Phi-3 technical report: A highly capable language model locally on your phone","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19084","last_updated":"2025-05-25T10:40:52Z","snapshot_observed_at":"2026-08-07T22:19:20.729696Z","submitted_at":"2025-05-25T10:40:52Z","title":"Jodi: Unification of Visual Generation and Understanding via Joint Modeling","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:20.023881Z"},"links":{"cited_paper":"/paper/2404.14219","citing_paper":"/paper/2505.19084"},"observation_digest":"sha256:84c1225844d7f01a61983ec5140456d123855f2d84abf18118d1a545042e4813","observation_id":"3d01027f-d400-4688-8fad-0eb0ba28e6a8","resolution":{"observed_at":"2026-08-07T14:25:20.023881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:20.085409Z","title":"Building normalizing flows with stochastic inter- polants","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19084","last_updated":"2025-05-25T10:40:52Z","snapshot_observed_at":"2026-08-07T22:19:20.729696Z","submitted_at":"2025-05-25T10:40:52Z","title":"Jodi: Unification of Visual Generation and Understanding via Joint Modeling","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:20.085409Z"},"links":{"citing_paper":"/paper/2505.19084"},"observation_digest":"sha256:81b1e847cfd1e33fcbfad28b34ba9cf2189908353b4c09e55d2082f83056b241","observation_id":"fd6e124a-d999-445a-a6bc-8e4ceb437b5e","resolution":{"observed_at":"2026-08-07T14:25:20.085409Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.08642","last_updated":"2025-02-12T18:57:12Z","snapshot_observed_at":"2026-08-07T23:55:22.785650Z","submitted_at":"2025-02-12T18:57:12Z","title":"SwiftSketch: A Diffusion Model for Image-to-Vector Sketch Generation","version":1},"cited_work":{"arxiv_id":"2502.08642","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.08642","snapshot_observed_at":"2026-08-07T14:25:23.220455Z","title":"SwiftSketch: A Diffusion Model for Image-to-Vector Sketch Generation","venue":"cs.CV","work_id":"1bdb1f7c-ff42-4be5-90f6-fbe867b05f8b","year":2025},"citing_paper":{"arxiv_id":"2505.19084","last_updated":"2025-05-25T10:40:52Z","snapshot_observed_at":"2026-08-07T22:19:20.729696Z","submitted_at":"2025-05-25T10:40:52Z","title":"Jodi: Unification of Visual Generation and Understanding via Joint Modeling","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:20.166543Z"},"links":{"cited_paper":"/paper/2502.08642","citing_paper":"/paper/2505.19084"},"observation_digest":"sha256:c0bbf1f8eb34cb79ff862b060502d992f5ee2ee3c9d659bb0ba2672b95e4e9e8","observation_id":"a5191bef-b846-4461-8686-53a8bd4b77f4","resolution":{"observed_at":"2026-08-07T14:25:23.226183Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:20.269453Z","title":"Contour detection and hierarchical image segmentation","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2505.19084","last_updated":"2025-05-25T10:40:52Z","snapshot_observed_at":"2026-08-07T22:19:20.729696Z","submitted_at":"2025-05-25T10:40:52Z","title":"Jodi: Unification of Visual Generation and Understanding via Joint Modeling","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:20.269453Z"},"links":{"citing_paper":"/paper/2505.19084"},"observation_digest":"sha256:6b4279151e99d41a1ef7ec6f5447d3bb6c8fe3dd8510f72f12a5127fdd3fc098","observation_id":"15bd8a39-1ea5-4cfb-934a-7ffc4a46fc79","resolution":{"observed_at":"2026-08-07T14:25:20.269453Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.01324","last_updated":"2023-03-14T00:22:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-11-02T17:43:04Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.01324","snapshot_observed_at":"2026-08-07T14:25:20.356553Z","title":"ediff-i: Text-to-image diffusion models with an ensemble of expert denoisers","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.19084","last_updated":"2025-05-25T10:40:52Z","snapshot_observed_at":"2026-08-07T22:19:20.729696Z","submitted_at":"2025-05-25T10:40:52Z","title":"Jodi: Unification of Visual Generation and Understanding via Joint Modeling","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:20.356553Z"},"links":{"cited_paper":"/paper/2211.01324","citing_paper":"/paper/2505.19084"},"observation_digest":"sha256:be651c6c70096b1973b74fe9ef1203f8842002b5e46529a913e42600e7b0d638","observation_id":"0f7ea959-4290-480d-9d5c-248382f79c16","resolution":{"observed_at":"2026-08-07T14:25:20.356553Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:20.438427Z","title":"One transformer fits all distributions in multi-modal diffusion at scale","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19084","last_updated":"2025-05-25T10:40:52Z","snapshot_observed_at":"2026-08-07T22:19:20.729696Z","submitted_at":"2025-05-25T10:40:52Z","title":"Jodi: Unification of Visual Generation and Understanding via Joint Modeling","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:20.438427Z"},"links":{"citing_paper":"/paper/2505.19084"},"observation_digest":"sha256:0316a0e19eee070e710b32598f306ef4b37c55db66cddd1118aa7c0145682ca4","observation_id":"502e35c8-1da1-43ee-98b4-f909b3f00b77","resolution":{"observed_at":"2026-08-07T14:25:20.438427Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:20.520178Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19084","last_updated":"2025-05-25T10:40:52Z","snapshot_observed_at":"2026-08-07T22:19:20.729696Z","submitted_at":"2025-05-25T10:40:52Z","title":"Jodi: Unification of Visual Generation and Understanding via Joint Modeling","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:20.520178Z"},"links":{"citing_paper":"/paper/2505.19084"},"observation_digest":"sha256:d98e200a2d1de19e2e644076ee3f00b6f376be47090edea863e077aaf7ecebd4","observation_id":"79e3745c-1ebb-4f90-985a-310525f35c9b","resolution":{"observed_at":"2026-08-07T14:25:20.520178Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:20.740440Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.19084","last_updated":"2025-05-25T10:40:52Z","snapshot_observed_at":"2026-08-07T22:19:20.729696Z","submitted_at":"2025-05-25T10:40:52Z","title":"Jodi: Unification of Visual Generation and Understanding via Joint Modeling","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:20.740440Z"},"links":{"citing_paper":"/paper/2505.19084"},"observation_digest":"sha256:81a87121f19d96ab1c4d604dd831c8a16ff0c879cb43ff03f8b3c04d3accc81d","observation_id":"8e387625-7020-4d8a-a362-9e4e3bb53d7e","resolution":{"observed_at":"2026-08-07T14:25:20.740440Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:20.900857Z","title":"Intrinsic image decomposition via ordinal shading","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19084","last_updated":"2025-05-25T10:40:52Z","snapshot_observed_at":"2026-08-07T22:19:20.729696Z","submitted_at":"2025-05-25T10:40:52Z","title":"Jodi: Unification of Visual Generation and Understanding via Joint Modeling","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:20.900857Z"},"links":{"citing_paper":"/paper/2505.19084"},"observation_digest":"sha256:1b46f06daa1e5c6accf41a8132bfa803475a57e8802f45d0e85f9ee774a20997","observation_id":"d1a859c1-ac95-496e-b17f-eeb7c2fcfb13","resolution":{"observed_at":"2026-08-07T14:25:20.900857Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:21.067772Z","title":"Colorful diffuse intrinsic image decomposition in the wild","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19084","last_updated":"2025-05-25T10:40:52Z","snapshot_observed_at":"2026-08-07T22:19:20.729696Z","submitted_at":"2025-05-25T10:40:52Z","title":"Jodi: Unification of Visual Generation and Understanding via Joint Modeling","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:21.067772Z"},"links":{"citing_paper":"/paper/2505.19084"},"observation_digest":"sha256:b90b23a863a393c180e8717638cc97ed77341eb8ffea50934c9ba61f384de7be","observation_id":"ebba4899-bf1a-4efb-b1db-2d78d61b6e55","resolution":{"observed_at":"2026-08-07T14:25:21.067772Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:21.233841Z","title":"End-to-end object detection with transformers","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.19084","last_updated":"2025-05-25T10:40:52Z","snapshot_observed_at":"2026-08-07T22:19:20.729696Z","submitted_at":"2025-05-25T10:40:52Z","title":"Jodi: Unification of Visual Generation and Understanding via Joint Modeling","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:21.233841Z"},"links":{"citing_paper":"/paper/2505.19084"},"observation_digest":"sha256:54c075515ccd3d3d232831252dbb0c7e96df249422bb11a3feaeedc7c0004358","observation_id":"1b9a9ad4-5879-41ef-aeee-ce67b278bf62","resolution":{"observed_at":"2026-08-07T14:25:21.233841Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:21.361271Z","title":"Artists as experts in visual cognition: An update","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.19084","last_updated":"2025-05-25T10:40:52Z","snapshot_observed_at":"2026-08-07T22:19:20.729696Z","submitted_at":"2025-05-25T10:40:52Z","title":"Jodi: Unification of Visual Generation and Understanding via Joint Modeling","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:21.361271Z"},"links":{"citing_paper":"/paper/2505.19084"},"observation_digest":"sha256:6c3a34166c57c7d7afa116a818e77159279dc579dce2895ad3b3abc883097c9d","observation_id":"a1fa9929-cb5f-498f-86c0-c5d7d6dec632","resolution":{"observed_at":"2026-08-07T14:25:21.361271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:21.398707Z","title":"Learning to generate line drawings that convey ge- ometry and semantics","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.19084","last_updated":"2025-05-25T10:40:52Z","snapshot_observed_at":"2026-08-07T22:19:20.729696Z","submitted_at":"2025-05-25T10:40:52Z","title":"Jodi: Unification of Visual Generation and Understanding via Joint Modeling","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:21.398707Z"},"links":{"citing_paper":"/paper/2505.19084"},"observation_digest":"sha256:2bc7df94dcb0c03d0a5106b32c85ad30bc56f40340354f7ef01f2b465dece7f1","observation_id":"d45b59d7-5999-4ec0-8189-892cbe76d218","resolution":{"observed_at":"2026-08-07T14:25:21.398707Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:21.463272Z","title":"Pixart- σ: Weak-to-strong training of diffusion transformer for 4k text-to-image generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19084","last_updated":"2025-05-25T10:40:52Z","snapshot_observed_at":"2026-08-07T22:19:20.729696Z","submitted_at":"2025-05-25T10:40:52Z","title":"Jodi: Unification of Visual Generation and Understanding via Joint Modeling","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:21.463272Z"},"links":{"citing_paper":"/paper/2505.19084"},"observation_digest":"sha256:f1ea98b285257adc4a1ab1e318e0a6a82791aa93a89f0be5858a18743949943e","observation_id":"e627f4f8-64db-4e6e-9475-432074c64545","resolution":{"observed_at":"2026-08-07T14:25:21.463272Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:21.609686Z","title":"Deep compression autoencoder for efficient high-resolution diffusion models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19084","last_updated":"2025-05-25T10:40:52Z","snapshot_observed_at":"2026-08-07T22:19:20.729696Z","submitted_at":"2025-05-25T10:40:52Z","title":"Jodi: Unification of Visual Generation and Understanding via Joint Modeling","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:21.609686Z"},"links":{"citing_paper":"/paper/2505.19084"},"observation_digest":"sha256:d6f5b18635d066f82abaf7cb184b2c0a616d82532b4b4b96cfea45132f4d0d80","observation_id":"d218a445-6150-48c6-963b-e6f49d8505a7","resolution":{"observed_at":"2026-08-07T14:25:21.609686Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:21.659977Z","title":"Anydoor: Zero-shot object-level image customization","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19084","last_updated":"2025-05-25T10:40:52Z","snapshot_observed_at":"2026-08-07T22:19:20.729696Z","submitted_at":"2025-05-25T10:40:52Z","title":"Jodi: Unification of Visual Generation and Understanding via Joint Modeling","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:21.659977Z"},"links":{"citing_paper":"/paper/2505.19084"},"observation_digest":"sha256:62deae299a517a10c50926142092da9e7e0ed59fd2ac96073467584dd5bf4529","observation_id":"456e047a-67e1-4267-b9d9-fd4357d45170","resolution":{"observed_at":"2026-08-07T14:25:21.659977Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.07774","last_updated":"2024-12-11T22:51:08Z","snapshot_observed_at":"2026-08-08T03:21:39.147609Z","submitted_at":"2024-12-10T18:59:55Z","title":"UniReal: Universal Image Generation and Editing via Learning Real-world Dynamics","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.07774","snapshot_observed_at":"2026-08-07T14:25:21.664689Z","title":"Unireal: Universal image generation and editing via learning real-world dynamics","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19084","last_updated":"2025-05-25T10:40:52Z","snapshot_observed_at":"2026-08-07T22:19:20.729696Z","submitted_at":"2025-05-25T10:40:52Z","title":"Jodi: Unification of Visual Generation and Understanding via Joint Modeling","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:21.664689Z"},"links":{"cited_paper":"/paper/2412.07774","citing_paper":"/paper/2505.19084"},"observation_digest":"sha256:0106b59ca3163cc6d7de7ed3d5009ac5c00e2bdf748d262038ae567bfecdec0f","observation_id":"ab528964-950d-4149-ab96-c82f5e05e0cd","resolution":{"observed_at":"2026-08-07T14:25:21.664689Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.17811","last_updated":"2025-01-29T18:00:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-29T18:00:19Z","title":"Janus-Pro: Unified Multimodal Understanding and Generation with Data and Model Scaling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.17811","snapshot_observed_at":"2026-08-07T14:25:21.733104Z","title":"Janus-pro: Unified multimodal understanding and generation with data and model scaling","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19084","last_updated":"2025-05-25T10:40:52Z","snapshot_observed_at":"2026-08-07T22:19:20.729696Z","submitted_at":"2025-05-25T10:40:52Z","title":"Jodi: Unification of Visual Generation and Understanding via Joint Modeling","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:21.733104Z"},"links":{"cited_paper":"/paper/2501.17811","citing_paper":"/paper/2505.19084"},"observation_digest":"sha256:ea9540444d2e5b7cfe6fcc4a60e4f708ab905b678857197c3632907f0437ec17","observation_id":"2d08a53e-606c-4d05-b200-576eb63a0664","resolution":{"observed_at":"2026-08-07T14:25:21.733104Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:21.789469Z","title":"Idadapter: Learning mixed features for tuning-free personalization of text-to-image models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19084","last_updated":"2025-05-25T10:40:52Z","snapshot_observed_at":"2026-08-07T22:19:20.729696Z","submitted_at":"2025-05-25T10:40:52Z","title":"Jodi: Unification of Visual Generation and Understanding via Joint Modeling","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:21.789469Z"},"links":{"citing_paper":"/paper/2505.19084"},"observation_digest":"sha256:cc3e22148551b88cf5eafb0176e9e7692be42b90f8774f80e5a31a0cd2fde4a4","observation_id":"3004283c-7d1e-4f43-ad3c-f69b81981ff7","resolution":{"observed_at":"2026-08-07T14:25:21.789469Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:21.869510Z","title":"Scannet: Richly-annotated 3d reconstructions of indoor scenes","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.19084","last_updated":"2025-05-25T10:40:52Z","snapshot_observed_at":"2026-08-07T22:19:20.729696Z","submitted_at":"2025-05-25T10:40:52Z","title":"Jodi: Unification of Visual Generation and Understanding via Joint Modeling","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:21.869510Z"},"links":{"citing_paper":"/paper/2505.19084"},"observation_digest":"sha256:a77aea3a23f3876e0eba11a9c47511de82e048c1c76410974962d2205b127369","observation_id":"c334c49e-2a5d-4c1f-ab37-8a2fecaaac47","resolution":{"observed_at":"2026-08-07T14:25:21.869510Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:21.956584Z","title":"Flashattention: Fast and memory- efficient exact attention with io-awareness.Advances in neural information processing systems, 35:16344– 16359, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.19084","last_updated":"2025-05-25T10:40:52Z","snapshot_observed_at":"2026-08-07T22:19:20.729696Z","submitted_at":"2025-05-25T10:40:52Z","title":"Jodi: Unification of Visual Generation and Understanding via Joint Modeling","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:21.956584Z"},"links":{"citing_paper":"/paper/2505.19084"},"observation_digest":"sha256:90d67508e36e218ea2039853bc6989da8e8b1cb5fb23d54598abb0286abe853e","observation_id":"742df795-4d6a-46ce-9df0-3bbc4911245e","resolution":{"observed_at":"2026-08-07T14:25:21.956584Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:22.030338Z","title":"Imagenet: A large-scale hierarchical image database","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2505.19084","last_updated":"2025-05-25T10:40:52Z","snapshot_observed_at":"2026-08-07T22:19:20.729696Z","submitted_at":"2025-05-25T10:40:52Z","title":"Jodi: Unification of Visual Generation and Understanding via Joint Modeling","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:22.030338Z"},"links":{"citing_paper":"/paper/2505.19084"},"observation_digest":"sha256:e863a967fe96b075742c49119bdcb157d2b8ffe070539f64e8115e161c5669d4","observation_id":"c9a7aaa5-c1c9-45d0-bccc-974431354446","resolution":{"observed_at":"2026-08-07T14:25:22.030338Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1410.8516","last_updated":"2015-04-10T12:27:56Z","snapshot_observed_at":"2026-07-06T03:59:05.142685Z","submitted_at":"2014-10-30T19:44:20Z","title":"NICE: Non-linear Independent Components Estimation","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1410.8516","snapshot_observed_at":"2026-08-07T14:25:22.092599Z","title":"Nice: Non-linear independent components estimation","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2505.19084","last_updated":"2025-05-25T10:40:52Z","snapshot_observed_at":"2026-08-07T22:19:20.729696Z","submitted_at":"2025-05-25T10:40:52Z","title":"Jodi: Unification of Visual Generation and Understanding via Joint Modeling","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:22.092599Z"},"links":{"cited_paper":"/paper/1410.8516","citing_paper":"/paper/2505.19084"},"observation_digest":"sha256:ef27ce05af4d2960aa3f7911dc484ce7a3d6a78a4f053683b38fd9f4cf2b8b8a","observation_id":"19e0a22e-b91e-4bc0-8275-974ff4701e59","resolution":{"observed_at":"2026-08-07T14:25:22.092599Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:22.177856Z","title":"Evaluative and generative modes of thought during the creative process","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2505.19084","last_updated":"2025-05-25T10:40:52Z","snapshot_observed_at":"2026-08-07T22:19:20.729696Z","submitted_at":"2025-05-25T10:40:52Z","title":"Jodi: Unification of Visual Generation and Understanding via Joint Modeling","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:22.177856Z"},"links":{"citing_paper":"/paper/2505.19084"},"observation_digest":"sha256:18098bfe10a22de09b9acc33b79fc816e0cb04bd1c154e6d6e0e56bc389bd02c","observation_id":"e1d25dda-9a3f-4f47-bbb3-9cb702117117","resolution":{"observed_at":"2026-08-07T14:25:22.177856Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:22.229147Z","title":"Scaling rectified flow transformers for high-resolution image synthesis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19084","last_updated":"2025-05-25T10:40:52Z","snapshot_observed_at":"2026-08-07T22:19:20.729696Z","submitted_at":"2025-05-25T10:40:52Z","title":"Jodi: Unification of Visual Generation and Understanding via Joint Modeling","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:22.229147Z"},"links":{"citing_paper":"/paper/2505.19084"},"observation_digest":"sha256:cf30874999515dfe5b308434f048617b49a60f163002098173c1fca8b8ff636a","observation_id":"451cda10-37cc-4624-ab4b-2565953a710a","resolution":{"observed_at":"2026-08-07T14:25:22.229147Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:22.233468Z","title":"Taming transformers for high-resolution image synthesis","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.19084","last_updated":"2025-05-25T10:40:52Z","snapshot_observed_at":"2026-08-07T22:19:20.729696Z","submitted_at":"2025-05-25T10:40:52Z","title":"Jodi: Unification of Visual Generation and Understanding via Joint Modeling","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:22.233468Z"},"links":{"citing_paper":"/paper/2505.19084"},"observation_digest":"sha256:c53c4424aa23bc217a5b354e4869e2750be8175982fb79a26b2dd9f87926f255","observation_id":"c300ea3e-c3eb-4861-946e-6dbe3e3c14ac","resolution":{"observed_at":"2026-08-07T14:25:22.233468Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:22.238046Z","title":"The surprisingly powerful influence of drawing on memory","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.19084","last_updated":"2025-05-25T10:40:52Z","snapshot_observed_at":"2026-08-07T22:19:20.729696Z","submitted_at":"2025-05-25T10:40:52Z","title":"Jodi: Unification of Visual Generation and Understanding via Joint Modeling","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:22.238046Z"},"links":{"citing_paper":"/paper/2505.19084"},"observation_digest":"sha256:01e47b31700215ade0183d3ee7b7869b7c4bffed21f6ebe2b01bc3e6f7bd3368","observation_id":"919ea3c9-db4c-4b48-ab61-07804eda1506","resolution":{"observed_at":"2026-08-07T14:25:22.238046Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.12652","last_updated":"2025-04-22T18:52:05Z","snapshot_observed_at":"2026-08-07T17:00:09.152276Z","submitted_at":"2025-03-16T21:11:25Z","title":"UniVG: A Generalist Diffusion Model for Unified Image Generation and Editing","version":2},"cited_work":{"arxiv_id":"2503.12652","doi":null,"metadata_source":"pith","pith_arxiv_id":"2503.12652","snapshot_observed_at":"2026-08-07T14:25:23.123443Z","title":"UniVG: A Generalist Diffusion Model for Unified Image Generation and Editing","venue":"cs.CV","work_id":"f8abcf88-0232-4051-bdfe-35f6c42811bc","year":2025},"citing_paper":{"arxiv_id":"2505.19084","last_updated":"2025-05-25T10:40:52Z","snapshot_observed_at":"2026-08-07T22:19:20.729696Z","submitted_at":"2025-05-25T10:40:52Z","title":"Jodi: Unification of Visual Generation and Understanding via Joint Modeling","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:22.241809Z"},"links":{"cited_paper":"/paper/2503.12652","citing_paper":"/paper/2505.19084"},"observation_digest":"sha256:a624bc12fa607740a2ccee9e819f9dc859c2b3ed2f550f6a2d3e963124e20e36","observation_id":"d2a5110c-c8d9-4efa-bc82-2ef113613f0a","resolution":{"observed_at":"2026-08-07T14:25:23.130205Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:22.247783Z","title":"Geowizard: Unleashing the diffusion priors for 3d geometry estimation from a single image","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19084","last_updated":"2025-05-25T10:40:52Z","snapshot_observed_at":"2026-08-07T22:19:20.729696Z","submitted_at":"2025-05-25T10:40:52Z","title":"Jodi: Unification of Visual Generation and Understanding via Joint Modeling","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:22.247783Z"},"links":{"citing_paper":"/paper/2505.19084"},"observation_digest":"sha256:099822ee07dca73b08c274ea51e084b5c0c22933671b94e1483c7ced6e95c693","observation_id":"f2637597-011e-4ff8-a947-2307739055e9","resolution":{"observed_at":"2026-08-07T14:25:22.247783Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:22.251756Z","title":"pexels-portrait","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19084","last_updated":"2025-05-25T10:40:52Z","snapshot_observed_at":"2026-08-07T22:19:20.729696Z","submitted_at":"2025-05-25T10:40:52Z","title":"Jodi: Unification of Visual Generation and Understanding via Joint Modeling","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:22.251756Z"},"links":{"citing_paper":"/paper/2505.19084"},"observation_digest":"sha256:f1886e8bd8137b0e38da6dcaa19eeb1236d8c9938f296968a059cf5f4466d0fc","observation_id":"4cfd5468-25f0-4cf3-9061-b3120997a6ab","resolution":{"observed_at":"2026-08-07T14:25:22.251756Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:22.256655Z","title":"Rich feature hierarchies for accurate object detection and semantic segmentation","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2505.19084","last_updated":"2025-05-25T10:40:52Z","snapshot_observed_at":"2026-08-07T22:19:20.729696Z","submitted_at":"2025-05-25T10:40:52Z","title":"Jodi: Unification of Visual Generation and Understanding via Joint Modeling","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:22.256655Z"},"links":{"citing_paper":"/paper/2505.19084"},"observation_digest":"sha256:1c88ae65ece9c2e09d2458f9327988fc4dfaf967056e6ebb1ccbf2e65fa14d43","observation_id":"b9425971-ce73-4695-b7c9-2666ab61252d","resolution":{"observed_at":"2026-08-07T14:25:22.256655Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:22.261526Z","title":"Generative adversarial nets","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2505.19084","last_updated":"2025-05-25T10:40:52Z","snapshot_observed_at":"2026-08-07T22:19:20.729696Z","submitted_at":"2025-05-25T10:40:52Z","title":"Jodi: Unification of Visual Generation and Understanding via Joint Modeling","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:22.261526Z"},"links":{"citing_paper":"/paper/2505.19084"},"observation_digest":"sha256:4c5622483f9fd7b358fced9cf71452c7531c975be5fe1b47bd87af5f313525cf","observation_id":"82a39014-5b84-4f2a-b501-b3ef600bbcc1","resolution":{"observed_at":"2026-08-07T14:25:22.261526Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:22.266396Z","title":"Pulid: Pure and lightning id customization via contrastive alignment","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19084","last_updated":"2025-05-25T10:40:52Z","snapshot_observed_at":"2026-08-07T22:19:20.729696Z","submitted_at":"2025-05-25T10:40:52Z","title":"Jodi: Unification of Visual Generation and Understanding via Joint Modeling","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:22.266396Z"},"links":{"citing_paper":"/paper/2505.19084"},"observation_digest":"sha256:67795ad2e1dcd97f6ade2be97c3e9386f00f31693eaba0f8e8809ad5591b38cd","observation_id":"b2cdb417-a08b-4101-a158-e3e32d41f347","resolution":{"observed_at":"2026-08-07T14:25:22.266396Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:22.270883Z","title":"Svdiff: Compact parameter space for diffusion fine-tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19084","last_updated":"2025-05-25T10:40:52Z","snapshot_observed_at":"2026-08-07T22:19:20.729696Z","submitted_at":"2025-05-25T10:40:52Z","title":"Jodi: Unification of Visual Generation and Understanding via Joint Modeling","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:22.270883Z"},"links":{"citing_paper":"/paper/2505.19084"},"observation_digest":"sha256:d4967d4e3f15445d31833a47adb377c93c8dfc05a008fdf2f4493fbb02e3f5d9","observation_id":"26c8e1b9-7923-4a9b-a678-10a051576392","resolution":{"observed_at":"2026-08-07T14:25:22.270883Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:22.276191Z","title":"Transformer language models without positional encodings still learn positional information","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.19084","last_updated":"2025-05-25T10:40:52Z","snapshot_observed_at":"2026-08-07T22:19:20.729696Z","submitted_at":"2025-05-25T10:40:52Z","title":"Jodi: Unification of Visual Generation and Understanding via Joint Modeling","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:22.276191Z"},"links":{"citing_paper":"/paper/2505.19084"},"observation_digest":"sha256:97b85802e95e734bfeff6a1f5bf7d962d30043c6ba081f7c54d43c8c5f957d35","observation_id":"cfdaebcf-74cb-4790-8fa6-2bfa9d0d0e4b","resolution":{"observed_at":"2026-08-07T14:25:22.276191Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:22.280980Z","title":"Lotus: Diffusion-based visual foundation model for high-quality dense prediction","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19084","last_updated":"2025-05-25T10:40:52Z","snapshot_observed_at":"2026-08-07T22:19:20.729696Z","submitted_at":"2025-05-25T10:40:52Z","title":"Jodi: Unification of Visual Generation and Understanding via Joint Modeling","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:22.280980Z"},"links":{"citing_paper":"/paper/2505.19084"},"observation_digest":"sha256:0cd8690aa67f0998d1886e40d8f1fa53c5f537e9c29264f1ee7038aa44758e4e","observation_id":"cc1ec785-7b50-4e25-80c2-e7ce58fe012f","resolution":{"observed_at":"2026-08-07T14:25:22.280980Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:22.285397Z","title":"Mask r-cnn","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.19084","last_updated":"2025-05-25T10:40:52Z","snapshot_observed_at":"2026-08-07T22:19:20.729696Z","submitted_at":"2025-05-25T10:40:52Z","title":"Jodi: Unification of Visual Generation and Understanding via Joint Modeling","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:22.285397Z"},"links":{"citing_paper":"/paper/2505.19084"},"observation_digest":"sha256:d510f67433d4d1e66a10de1744ca1e522821a4fe7628dd9d8ed99d3adf1263a1","observation_id":"d36af7db-ff5e-4872-b15b-6a7a128f33d8","resolution":{"observed_at":"2026-08-07T14:25:22.285397Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:22.289875Z","title":"Deep residual learning for image recognition","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.19084","last_updated":"2025-05-25T10:40:52Z","snapshot_observed_at":"2026-08-07T22:19:20.729696Z","submitted_at":"2025-05-25T10:40:52Z","title":"Jodi: Unification of Visual Generation and Understanding via Joint Modeling","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:22.289875Z"},"links":{"citing_paper":"/paper/2505.19084"},"observation_digest":"sha256:38937b7de3533f0d644e93e6664a9b7c4d2c224dc31e9f1741718526d31d7c75","observation_id":"dc5859f8-72e4-4d0f-92e7-42cf56f6af5f","resolution":{"observed_at":"2026-08-07T14:25:22.289875Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:22.294337Z","title":"Gans trained by a two time-scale update rule converge to a local nash equilibrium","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.19084","last_updated":"2025-05-25T10:40:52Z","snapshot_observed_at":"2026-08-07T22:19:20.729696Z","submitted_at":"2025-05-25T10:40:52Z","title":"Jodi: Unification of Visual Generation and Understanding via Joint Modeling","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:22.294337Z"},"links":{"citing_paper":"/paper/2505.19084"},"observation_digest":"sha256:9d3ff19bf63d60c56b61027c05245ce11aaf1ed664fd1bbabe8b562e4298c2ab","observation_id":"7e05d896-e9fe-4625-9376-779459bde742","resolution":{"observed_at":"2026-08-07T14:25:22.294337Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:22.299329Z","title":"Denoising diffusion probabilistic models","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.19084","last_updated":"2025-05-25T10:40:52Z","snapshot_observed_at":"2026-08-07T22:19:20.729696Z","submitted_at":"2025-05-25T10:40:52Z","title":"Jodi: Unification of Visual Generation and Understanding via Joint Modeling","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:22.299329Z"},"links":{"citing_paper":"/paper/2505.19084"},"observation_digest":"sha256:d2abe208bf78793343bb26f345d7f89ed8cf116bdab6b1c73a4e6d33c5278614","observation_id":"0a924934-76a8-44cb-a44c-61e7dae76d92","resolution":{"observed_at":"2026-08-07T14:25:22.299329Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.12598","last_updated":"2022-07-26T01:42:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-07-26T01:42:07Z","title":"Classifier-Free Diffusion Guidance","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.12598","snapshot_observed_at":"2026-08-07T14:25:22.303298Z","title":"Classifier-free diffusion guidance","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.19084","last_updated":"2025-05-25T10:40:52Z","snapshot_observed_at":"2026-08-07T22:19:20.729696Z","submitted_at":"2025-05-25T10:40:52Z","title":"Jodi: Unification of Visual Generation and Understanding via Joint Modeling","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:22.303298Z"},"links":{"cited_paper":"/paper/2207.12598","citing_paper":"/paper/2505.19084"},"observation_digest":"sha256:f9e1f30dca765c567c30bd0e87c6ebdc711113d7dc9cd33a4d75fcb5cec95f8c","observation_id":"588a842f-3af9-44e0-a282-3f7e67eeb00e","resolution":{"observed_at":"2026-08-07T14:25:22.303298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:22.307733Z","title":"Oneformer: One transformer to rule universal image segmentation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19084","last_updated":"2025-05-25T10:40:52Z","snapshot_observed_at":"2026-08-07T22:19:20.729696Z","submitted_at":"2025-05-25T10:40:52Z","title":"Jodi: Unification of Visual Generation and Understanding via Joint Modeling","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:22.307733Z"},"links":{"citing_paper":"/paper/2505.19084"},"observation_digest":"sha256:49fd86f0735cb0d15446e3d956c063c97117ae4d19204a054c4183be43771866","observation_id":"b920f5c5-b7ba-4a81-a2df-94ea4fcba894","resolution":{"observed_at":"2026-08-07T14:25:22.307733Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:22.312506Z","title":"A style-based generator architecture for generative adversarial networks","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.19084","last_updated":"2025-05-25T10:40:52Z","snapshot_observed_at":"2026-08-07T22:19:20.729696Z","submitted_at":"2025-05-25T10:40:52Z","title":"Jodi: Unification of Visual Generation and Understanding via Joint Modeling","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:22.312506Z"},"links":{"citing_paper":"/paper/2505.19084"},"observation_digest":"sha256:92318c9602b70682860bb60fd0f510d414c7853bb73453580dbcc0c31522e23b","observation_id":"5c156863-3be1-423c-b09a-805b9a3a4ea6","resolution":{"observed_at":"2026-08-07T14:25:22.312506Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:22.316794Z","title":"Transformers are rnns: Fast autoregressive transformers with linear attention","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.19084","last_updated":"2025-05-25T10:40:52Z","snapshot_observed_at":"2026-08-07T22:19:20.729696Z","submitted_at":"2025-05-25T10:40:52Z","title":"Jodi: Unification of Visual Generation and Understanding via Joint Modeling","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:22.316794Z"},"links":{"citing_paper":"/paper/2505.19084"},"observation_digest":"sha256:4aa4edf8e56518f94e0ff751088c9140312cd8944b36514dad61625616540787","observation_id":"2a57b08c-6051-4221-922b-f2714d0086aa","resolution":{"observed_at":"2026-08-07T14:25:22.316794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:22.321110Z","title":"The impact of positional encoding on length generalization in transformers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19084","last_updated":"2025-05-25T10:40:52Z","snapshot_observed_at":"2026-08-07T22:19:20.729696Z","submitted_at":"2025-05-25T10:40:52Z","title":"Jodi: Unification of Visual Generation and Understanding via Joint Modeling","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:22.321110Z"},"links":{"citing_paper":"/paper/2505.19084"},"observation_digest":"sha256:d73f2646e02d8438661f789477194ef8484e51c34f3e77e8a725f17dab9a5695","observation_id":"00bf20dc-1533-48c0-a6f9-3f3d7b491d0f","resolution":{"observed_at":"2026-08-07T14:25:22.321110Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:22.325277Z","title":"Repurposing diffusion-based image generators for monocular depth estimation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19084","last_updated":"2025-05-25T10:40:52Z","snapshot_observed_at":"2026-08-07T22:19:20.729696Z","submitted_at":"2025-05-25T10:40:52Z","title":"Jodi: Unification of Visual Generation and Understanding via Joint Modeling","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:22.325277Z"},"links":{"citing_paper":"/paper/2505.19084"},"observation_digest":"sha256:8ed6f003d8630f2a121149d154aa001af5e7c9947696bb161f373fd8c9f4ba4e","observation_id":"afd4cb01-edd3-4521-a8dc-75d8958e415e","resolution":{"observed_at":"2026-08-07T14:25:22.325277Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1312.6114","last_updated":"2022-12-10T21:04:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2013-12-20T20:58:10Z","title":"Auto-Encoding Variational Bayes","version":11},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1312.6114","snapshot_observed_at":"2026-08-07T14:25:22.329422Z","title":"Auto-encoding variational bayes","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2505.19084","last_updated":"2025-05-25T10:40:52Z","snapshot_observed_at":"2026-08-07T22:19:20.729696Z","submitted_at":"2025-05-25T10:40:52Z","title":"Jodi: Unification of Visual Generation and Understanding via Joint Modeling","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:22.329422Z"},"links":{"cited_paper":"/paper/1312.6114","citing_paper":"/paper/2505.19084"},"observation_digest":"sha256:ae74a740a04499685d91ec1584946ac6e68e515c405c427e15bba970afdf3842","observation_id":"e274ca9c-b875-43ec-92fd-4143dcfacc17","resolution":{"observed_at":"2026-08-07T14:25:22.329422Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:22.333436Z","title":"Segment anything","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19084","last_updated":"2025-05-25T10:40:52Z","snapshot_observed_at":"2026-08-07T22:19:20.729696Z","submitted_at":"2025-05-25T10:40:52Z","title":"Jodi: Unification of Visual Generation and Understanding via Joint Modeling","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:22.333436Z"},"links":{"citing_paper":"/paper/2505.19084"},"observation_digest":"sha256:1b7db5a811f173fd070371590426ead983952632ff35ba46780833800ea84382","observation_id":"811f385e-1963-4c3e-bc59-606dd577116e","resolution":{"observed_at":"2026-08-07T14:25:22.333436Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:22.337682Z","title":"Evaluation of cnn-based single- image depth estimation methods","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.19084","last_updated":"2025-05-25T10:40:52Z","snapshot_observed_at":"2026-08-07T22:19:20.729696Z","submitted_at":"2025-05-25T10:40:52Z","title":"Jodi: Unification of Visual Generation and Understanding via Joint Modeling","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:22.337682Z"},"links":{"citing_paper":"/paper/2505.19084"},"observation_digest":"sha256:cb62b0d4e6ae396b53a7a1bcb909b5ad64b0b84f72e4f28ab427b0d19848364c","observation_id":"b6ad9372-3893-4659-8528-2b773675776b","resolution":{"observed_at":"2026-08-07T14:25:22.337682Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:22.342567Z","title":"Intrinsic image diffusion for indoor single- view material estimation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19084","last_updated":"2025-05-25T10:40:52Z","snapshot_observed_at":"2026-08-07T22:19:20.729696Z","submitted_at":"2025-05-25T10:40:52Z","title":"Jodi: Unification of Visual Generation and Understanding via Joint Modeling","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:22.342567Z"},"links":{"citing_paper":"/paper/2505.19084"},"observation_digest":"sha256:b1b4bbf5fdeee9ebbae91b74bcf8699a2d622e8d78e55df0b14b08045cb2239e","observation_id":"238b022c-551c-4b10-ac53-bdc8f0b4133f","resolution":{"observed_at":"2026-08-07T14:25:22.342567Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:23.991195Z","title":"Artists as experts in visual cognition","venue":null,"work_id":"03f4777c-557a-4479-8e69-8998752d12a8","year":2001},"citing_paper":{"arxiv_id":"2505.19084","last_updated":"2025-05-25T10:40:52Z","snapshot_observed_at":"2026-08-07T22:19:20.729696Z","submitted_at":"2025-05-25T10:40:52Z","title":"Jodi: Unification of Visual Generation and Understanding via Joint Modeling","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:22.347021Z"},"links":{"citing_paper":"/paper/2505.19084"},"observation_digest":"sha256:90b50d7bc9575ccd290d043f2c8ed463e7f8e7e78bec99e574a7905a55d63a28","observation_id":"c7917e06-628a-4d5b-b870-84caef2c7d8e","resolution":{"observed_at":"2026-08-07T14:25:23.995509Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:22.351696Z","title":"Imagenet classification with deep convolutional neural networks","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2505.19084","last_updated":"2025-05-25T10:40:52Z","snapshot_observed_at":"2026-08-07T22:19:20.729696Z","submitted_at":"2025-05-25T10:40:52Z","title":"Jodi: Unification of Visual Generation and Understanding via Joint Modeling","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:22.351696Z"},"links":{"citing_paper":"/paper/2505.19084"},"observation_digest":"sha256:1ecf452a30207d406c668fbf02e8d7b5fcc2ccf71900eb255afb574d7ff981d1","observation_id":"d6f11f3c-cfe9-4b85-ae82-90d39917510c","resolution":{"observed_at":"2026-08-07T14:25:22.351696Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:23.965863Z","title":"Multi-concept customization of text-to-image diffusion","venue":null,"work_id":"280073f9-e033-4ccf-bc1f-a2081739076c","year":1931},"citing_paper":{"arxiv_id":"2505.19084","last_updated":"2025-05-25T10:40:52Z","snapshot_observed_at":"2026-08-07T22:19:20.729696Z","submitted_at":"2025-05-25T10:40:52Z","title":"Jodi: Unification of Visual Generation and Understanding via Joint Modeling","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:22.355703Z"},"links":{"citing_paper":"/paper/2505.19084"},"observation_digest":"sha256:8ee1e256fbe2a966c2e3ce021f9c042fb185d967dcdbe4a9fd24fb4b8a91f8f8","observation_id":"a3265254-8ec6-4d35-8701-b11f459d5907","resolution":{"observed_at":"2026-08-07T14:25:23.970690Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.16318","last_updated":"2025-06-12T23:46:13Z","snapshot_observed_at":"2026-07-06T19:56:30.344759Z","submitted_at":"2024-11-25T12:11:05Z","title":"One Diffusion to Generate Them All","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.16318","snapshot_observed_at":"2026-08-07T14:25:22.360463Z","title":"One diffusion to generate them all","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19084","last_updated":"2025-05-25T10:40:52Z","snapshot_observed_at":"2026-08-07T22:19:20.729696Z","submitted_at":"2025-05-25T10:40:52Z","title":"Jodi: Unification of Visual Generation and Understanding via Joint Modeling","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:22.360463Z"},"links":{"cited_paper":"/paper/2411.16318","citing_paper":"/paper/2505.19084"},"observation_digest":"sha256:8daa328f69faaa216786f646fbff2840afeed4957cd21bb7896c8877a0722707","observation_id":"b1704c97-8bcd-42c0-9e37-2153ce3b547e","resolution":{"observed_at":"2026-08-07T14:25:22.360463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:22.364853Z","title":"Gradient-based learning applied to document recognition","venue":null,"work_id":null,"year":1998},"citing_paper":{"arxiv_id":"2505.19084","last_updated":"2025-05-25T10:40:52Z","snapshot_observed_at":"2026-08-07T22:19:20.729696Z","submitted_at":"2025-05-25T10:40:52Z","title":"Jodi: Unification of Visual Generation and Understanding via Joint Modeling","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:22.364853Z"},"links":{"citing_paper":"/paper/2505.19084"},"observation_digest":"sha256:d587760fc4c06a317fd0dfcafc44820f9f53aaef3b0271bb8bcc0fd90fb0380e","observation_id":"aafa071c-ad5f-438b-a2c7-8344e83d445e","resolution":{"observed_at":"2026-08-07T14:25:22.364853Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:23.941288Z","title":"Exploiting diffusion prior for generalizable dense prediction","venue":null,"work_id":"67fbece4-6d4c-430b-9473-45d34e65d420","year":2024},"citing_paper":{"arxiv_id":"2505.19084","last_updated":"2025-05-25T10:40:52Z","snapshot_observed_at":"2026-08-07T22:19:20.729696Z","submitted_at":"2025-05-25T10:40:52Z","title":"Jodi: Unification of Visual Generation and Understanding via Joint Modeling","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:22.368903Z"},"links":{"citing_paper":"/paper/2505.19084"},"observation_digest":"sha256:4f55c7c2cb5c3944e9a795d860b39f4f589881d8691f3f8781656dc7642f31e5","observation_id":"d1d375e9-e3f1-4e95-a7d8-5a16e3ce944e","resolution":{"observed_at":"2026-08-07T14:25:23.946089Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.17245","last_updated":"2024-02-27T06:31:52Z","snapshot_observed_at":"2026-07-06T17:36:01.939242Z","submitted_at":"2024-02-27T06:31:52Z","title":"Playground v2.5: Three Insights towards Enhancing Aesthetic Quality in Text-to-Image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.17245","snapshot_observed_at":"2026-08-07T14:25:22.373168Z","title":"Playground v2","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19084","last_updated":"2025-05-25T10:40:52Z","snapshot_observed_at":"2026-08-07T22:19:20.729696Z","submitted_at":"2025-05-25T10:40:52Z","title":"Jodi: Unification of Visual Generation and Understanding via Joint Modeling","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:22.373168Z"},"links":{"cited_paper":"/paper/2402.17245","citing_paper":"/paper/2505.19084"},"observation_digest":"sha256:249cdd3d4300116d2b3f529dc093965aa02280a0e93f54989a87af0a9cbe399c","observation_id":"507d85d1-50d0-4329-8c30-dc4717ec4569","resolution":{"observed_at":"2026-08-07T14:25:22.373168Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:22.378612Z","title":"Blip-2: Bootstrapping language-image pre- training with frozen image encoders and large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19084","last_updated":"2025-05-25T10:40:52Z","snapshot_observed_at":"2026-08-07T22:19:20.729696Z","submitted_at":"2025-05-25T10:40:52Z","title":"Jodi: Unification of Visual Generation and Understanding via Joint Modeling","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:22.378612Z"},"links":{"citing_paper":"/paper/2505.19084"},"observation_digest":"sha256:e507fcaf2492a7330d2e92641fedda6b88c39f741be5aa6aef06b3a1681c0d55","observation_id":"0e19f149-40c9-4c0f-a95f-f08d3513ec3d","resolution":{"observed_at":"2026-08-07T14:25:22.378612Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:23.914414Z","title":"Uniformer: Unified transformer for efficient spatial-temporal representation learning","venue":null,"work_id":"aa7b248e-3a5f-4e3d-9790-767b07fcf662","year":2022},"citing_paper":{"arxiv_id":"2505.19084","last_updated":"2025-05-25T10:40:52Z","snapshot_observed_at":"2026-08-07T22:19:20.729696Z","submitted_at":"2025-05-25T10:40:52Z","title":"Jodi: Unification of Visual Generation and Understanding via Joint Modeling","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:22.382933Z"},"links":{"citing_paper":"/paper/2505.19084"},"observation_digest":"sha256:09129409ab2c1214336c3d7672a23abf42554987d2d158a9de4e22c562b42d74","observation_id":"e493cd5d-fe29-4316-8fac-c760f4498989","resolution":{"observed_at":"2026-08-07T14:25:23.919950Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:22.386866Z","title":"Gligen: Open-set grounded text-to-image generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19084","last_updated":"2025-05-25T10:40:52Z","snapshot_observed_at":"2026-08-07T22:19:20.729696Z","submitted_at":"2025-05-25T10:40:52Z","title":"Jodi: Unification of Visual Generation and Understanding via Joint Modeling","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:22.386866Z"},"links":{"citing_paper":"/paper/2505.19084"},"observation_digest":"sha256:45b249168446ecae430b2d5a8713c9b3d35d07891a986d6b16ddf230c47a99bb","observation_id":"b66de16d-e7a1-485d-8e67-33dcedf2e603","resolution":{"observed_at":"2026-08-07T14:25:22.386866Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:22.390909Z","title":"Photomaker: Customizing realistic human photos via stacked id embedding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19084","last_updated":"2025-05-25T10:40:52Z","snapshot_observed_at":"2026-08-07T22:19:20.729696Z","submitted_at":"2025-05-25T10:40:52Z","title":"Jodi: Unification of Visual Generation and Understanding via Joint Modeling","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:22.390909Z"},"links":{"citing_paper":"/paper/2505.19084"},"observation_digest":"sha256:a05b72005ed4540d364cefc3a255443c4c65f2c720b7aeb83b642c66df47654d","observation_id":"46c467f9-78f9-418d-bd47-fdb1a38194df","resolution":{"observed_at":"2026-08-07T14:25:22.390909Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.00289","last_updated":"2025-04-01T19:09:34Z","snapshot_observed_at":"2026-08-07T22:18:33.579780Z","submitted_at":"2024-12-31T05:49:00Z","title":"Dual Diffusion for Unified Image Generation and Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.00289","snapshot_observed_at":"2026-08-07T14:25:22.394934Z","title":"Dual diffusion for unified image generation and understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19084","last_updated":"2025-05-25T10:40:52Z","snapshot_observed_at":"2026-08-07T22:19:20.729696Z","submitted_at":"2025-05-25T10:40:52Z","title":"Jodi: Unification of Visual Generation and Understanding via Joint Modeling","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:22.394934Z"},"links":{"cited_paper":"/paper/2501.00289","citing_paper":"/paper/2505.19084"},"observation_digest":"sha256:5080ce9be8bd036cd51f67e7500d25b915d7f0cd47575ccbed5903251095c837","observation_id":"ba11db8f-ae42-4811-9e68-11470bdeffb9","resolution":{"observed_at":"2026-08-07T14:25:22.394934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:23.875382Z","title":"Pixwizard: Versatile image-to-image visual assistant with open-language instructions","venue":null,"work_id":"69cb1ad9-9141-4f1d-98df-bd77d78bc64e","year":2025},"citing_paper":{"arxiv_id":"2505.19084","last_updated":"2025-05-25T10:40:52Z","snapshot_observed_at":"2026-08-07T22:19:20.729696Z","submitted_at":"2025-05-25T10:40:52Z","title":"Jodi: Unification of Visual Generation and Understanding via Joint Modeling","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:22.399786Z"},"links":{"citing_paper":"/paper/2505.19084"},"observation_digest":"sha256:90c6d4b76f428660d824b9b408fb641ea174729d1fc5e4cd27a0a010b16192b0","observation_id":"3caba455-76f1-4bac-ae07-9f4787975fa9","resolution":{"observed_at":"2026-08-07T14:25:23.880370Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:22.406222Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19084","last_updated":"2025-05-25T10:40:52Z","snapshot_observed_at":"2026-08-07T22:19:20.729696Z","submitted_at":"2025-05-25T10:40:52Z","title":"Jodi: Unification of Visual Generation and Understanding via Joint Modeling","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:22.406222Z"},"links":{"citing_paper":"/paper/2505.19084"},"observation_digest":"sha256:5ea78645483c5a83806cca063fa5f6a3cfae0ddc42b1caaadfae2e5512ec799f","observation_id":"27f252d0-8c15-4085-8ccb-812893f5a6b6","resolution":{"observed_at":"2026-08-07T14:25:22.406222Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:22.410437Z","title":"Flow straight and fast: Learning to generate and transfer data with rectified flow","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19084","last_updated":"2025-05-25T10:40:52Z","snapshot_observed_at":"2026-08-07T22:19:20.729696Z","submitted_at":"2025-05-25T10:40:52Z","title":"Jodi: Unification of Visual Generation and Understanding via Joint Modeling","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:22.410437Z"},"links":{"citing_paper":"/paper/2505.19084"},"observation_digest":"sha256:a4d675c0078e23bef1852798a04c36674baf89fe0347236eed50577c176fdd4c","observation_id":"5de40839-52c6-484e-92d3-ea71107275ed","resolution":{"observed_at":"2026-08-07T14:25:22.410437Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.01095","last_updated":"2025-05-19T07:56:56Z","snapshot_observed_at":"2026-07-29T20:17:21.488997Z","submitted_at":"2022-11-02T13:14:30Z","title":"DPM-Solver++: Fast Solver for Guided Sampling of Diffusion Probabilistic Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.01095","snapshot_observed_at":"2026-08-07T14:25:22.415198Z","title":"Dpm-solver++: Fast solver for guided sampling of diffusion probabilistic models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.19084","last_updated":"2025-05-25T10:40:52Z","snapshot_observed_at":"2026-08-07T22:19:20.729696Z","submitted_at":"2025-05-25T10:40:52Z","title":"Jodi: Unification of Visual Generation and Understanding via Joint Modeling","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:22.415198Z"},"links":{"cited_paper":"/paper/2211.01095","citing_paper":"/paper/2505.19084"},"observation_digest":"sha256:36d30d8a81cfe7b285443e791a0299c17c2d64e06fd044a5007243201fd64d03","observation_id":"9f9e7c7d-a976-4d9d-b215-9c9a3bdcf9d6","resolution":{"observed_at":"2026-08-07T14:25:22.415198Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:23.834025Z","title":"Came: Confidence- guided adaptive memory efficient optimization","venue":null,"work_id":"4521edc9-0cef-4d06-b639-9fa6d39db56a","year":2023},"citing_paper":{"arxiv_id":"2505.19084","last_updated":"2025-05-25T10:40:52Z","snapshot_observed_at":"2026-08-07T22:19:20.729696Z","submitted_at":"2025-05-25T10:40:52Z","title":"Jodi: Unification of Visual Generation and Understanding via Joint Modeling","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:22.419555Z"},"links":{"citing_paper":"/paper/2505.19084"},"observation_digest":"sha256:8bb94e8381ec71a4afba2c7e585f99a0d7a16a94bdac07da78340d3c168a1c25","observation_id":"91527882-fa98-463f-aa4b-9ab807cdd40c","resolution":{"observed_at":"2026-08-07T14:25:23.839289Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:23.817833Z","title":"T2i- adapter: Learning adapters to dig out more controllable ability for text-to-image diffusion models","venue":null,"work_id":"c6a35b4f-96f5-44ad-8367-78a4f2cb1fdb","year":2024},"citing_paper":{"arxiv_id":"2505.19084","last_updated":"2025-05-25T10:40:52Z","snapshot_observed_at":"2026-08-07T22:19:20.729696Z","submitted_at":"2025-05-25T10:40:52Z","title":"Jodi: Unification of Visual Generation and Understanding via Joint Modeling","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:22.424091Z"},"links":{"citing_paper":"/paper/2505.19084"},"observation_digest":"sha256:f46dd838ef422fafc897b73861311f9f64144ed7bd3d00253fdfcbf37ebea7d2","observation_id":"6950d879-870c-4d4c-88fe-fa61443f0703","resolution":{"observed_at":"2026-08-07T14:25:23.823402Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:23.802214Z","title":"Novelai improvements on stable diffusion, 2022","venue":null,"work_id":"5212aa3b-8472-4bf8-88ad-8b3f6feb842d","year":2022},"citing_paper":{"arxiv_id":"2505.19084","last_updated":"2025-05-25T10:40:52Z","snapshot_observed_at":"2026-08-07T22:19:20.729696Z","submitted_at":"2025-05-25T10:40:52Z","title":"Jodi: Unification of Visual Generation and Understanding via Joint Modeling","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:22.428891Z"},"links":{"citing_paper":"/paper/2505.19084"},"observation_digest":"sha256:443d4cac462e0e31e302ac50407a4f06fc631f6aeaa14b1668b926036e4b7b46","observation_id":"1aec3c3b-0be3-4a5a-8f91-3c1392630109","resolution":{"observed_at":"2026-08-07T14:25:23.806790Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:23.786052Z","title":"pexels-photos-janpf","venue":null,"work_id":"e53d9f87-2bed-43b4-9c15-b82968e98ee9","year":null},"citing_paper":{"arxiv_id":"2505.19084","last_updated":"2025-05-25T10:40:52Z","snapshot_observed_at":"2026-08-07T22:19:20.729696Z","submitted_at":"2025-05-25T10:40:52Z","title":"Jodi: Unification of Visual Generation and Understanding via Joint Modeling","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:22.433006Z"},"links":{"citing_paper":"/paper/2505.19084"},"observation_digest":"sha256:5b16fb193cc28164da6fc4227eb8212e11e2b06139e4bd40b2e8058607daf676","observation_id":"8253015f-aebc-4a08-ab85-6d855b7596ed","resolution":{"observed_at":"2026-08-07T14:25:23.790583Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:22.437358Z","title":"Scalable diffusion models with transformers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19084","last_updated":"2025-05-25T10:40:52Z","snapshot_observed_at":"2026-08-07T22:19:20.729696Z","submitted_at":"2025-05-25T10:40:52Z","title":"Jodi: Unification of Visual Generation and Understanding via Joint Modeling","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:22.437358Z"},"links":{"citing_paper":"/paper/2505.19084"},"observation_digest":"sha256:695f9be6900a4a9ceff1e2cbda085ef40f03f00d97666aa8162decf265908184","observation_id":"56a94a99-f0eb-4314-905d-95b0d1394218","resolution":{"observed_at":"2026-08-07T14:25:22.437358Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:23.759665Z","title":"Ld-znet: A latent diffusion approach for text-based image segmentation","venue":null,"work_id":"9df3b67f-d261-4ca6-80d4-1073db1b2b97","year":2023},"citing_paper":{"arxiv_id":"2505.19084","last_updated":"2025-05-25T10:40:52Z","snapshot_observed_at":"2026-08-07T22:19:20.729696Z","submitted_at":"2025-05-25T10:40:52Z","title":"Jodi: Unification of Visual Generation and Understanding via Joint Modeling","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:22.441752Z"},"links":{"citing_paper":"/paper/2505.19084"},"observation_digest":"sha256:cc25da79dd50681091b1f18fdd42fa13ab78ea8f27fa8839d503875c25d10ae1","observation_id":"6a4b3458-4594-4c27-9982-d82d246bb741","resolution":{"observed_at":"2026-08-07T14:25:23.764838Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:23.744699Z","title":"Unicontrol: A unified diffusion model for controllable visual generation in the wild","venue":null,"work_id":"9e7a543c-1a85-457c-8c87-fb3d541c46cb","year":2024},"citing_paper":{"arxiv_id":"2505.19084","last_updated":"2025-05-25T10:40:52Z","snapshot_observed_at":"2026-08-07T22:19:20.729696Z","submitted_at":"2025-05-25T10:40:52Z","title":"Jodi: Unification of Visual Generation and Understanding via Joint Modeling","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:22.445661Z"},"links":{"citing_paper":"/paper/2505.19084"},"observation_digest":"sha256:59fecfbdfd86df5c1713dfb810b012bc6a94cd7551bf4f99f004829924cf897d","observation_id":"536825bf-274c-4163-9677-33421549d7ab","resolution":{"observed_at":"2026-08-07T14:25:23.749161Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:22.450236Z","title":"Hypersim: A photorealistic synthetic dataset for holistic indoor scene understanding","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.19084","last_updated":"2025-05-25T10:40:52Z","snapshot_observed_at":"2026-08-07T22:19:20.729696Z","submitted_at":"2025-05-25T10:40:52Z","title":"Jodi: Unification of Visual Generation and Understanding via Joint Modeling","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:22.450236Z"},"links":{"citing_paper":"/paper/2505.19084"},"observation_digest":"sha256:0f11bd7d65e60d1a550a24d0f5088314ba053db1738fdd892314d33c829ced23","observation_id":"d51d9076-fb7b-4258-ab6c-d6be16c01cc8","resolution":{"observed_at":"2026-08-07T14:25:22.450236Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:23.720447Z","title":"High-resolution image synthesis with latent diffusion models","venue":null,"work_id":"6d55dcdd-863d-43b9-9022-6ae90d119b9c","year":2022},"citing_paper":{"arxiv_id":"2505.19084","last_updated":"2025-05-25T10:40:52Z","snapshot_observed_at":"2026-08-07T22:19:20.729696Z","submitted_at":"2025-05-25T10:40:52Z","title":"Jodi: Unification of Visual Generation and Understanding via Joint Modeling","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:22.454569Z"},"links":{"citing_paper":"/paper/2505.19084"},"observation_digest":"sha256:3a0834cd8c47a1f62f6e851ebc465a1a17c70ba08dcb661da8c784a377876980","observation_id":"705116ba-f314-4f5a-ad56-5f5e5e3dcaae","resolution":{"observed_at":"2026-08-07T14:25:23.725331Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:22.459677Z","title":"U-net: Convolutional networks for biomedical image segmentation","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.19084","last_updated":"2025-05-25T10:40:52Z","snapshot_observed_at":"2026-08-07T22:19:20.729696Z","submitted_at":"2025-05-25T10:40:52Z","title":"Jodi: Unification of Visual Generation and Understanding via Joint Modeling","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:22.459677Z"},"links":{"citing_paper":"/paper/2505.19084"},"observation_digest":"sha256:d679939fec9aad359c51395de4f62d0a1bc6699c88abdade94fb6aff159d2035","observation_id":"ad4a8edb-860c-40a0-8a2e-2add47940beb","resolution":{"observed_at":"2026-08-07T14:25:22.459677Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:22.464421Z","title":"Dream- booth: Fine tuning text-to-image diffusion models for subject-driven generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19084","last_updated":"2025-05-25T10:40:52Z","snapshot_observed_at":"2026-08-07T22:19:20.729696Z","submitted_at":"2025-05-25T10:40:52Z","title":"Jodi: Unification of Visual Generation and Understanding via Joint Modeling","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:22.464421Z"},"links":{"citing_paper":"/paper/2505.19084"},"observation_digest":"sha256:74a1f5cc3ba860b37dd705ea30612bc555a7b1a09c2d30ae55dccdfe27a6fee6","observation_id":"24b5f3a9-af8b-492a-9e43-d8bbef430a82","resolution":{"observed_at":"2026-08-07T14:25:22.464421Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:22.469175Z","title":"Photorealistic text-to- image diffusion models with deep language understanding","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.19084","last_updated":"2025-05-25T10:40:52Z","snapshot_observed_at":"2026-08-07T22:19:20.729696Z","submitted_at":"2025-05-25T10:40:52Z","title":"Jodi: Unification of Visual Generation and Understanding via Joint Modeling","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:22.469175Z"},"links":{"citing_paper":"/paper/2505.19084"},"observation_digest":"sha256:67234bab6f72ef33627db0c4ee1cb5dbbf4a33c5c7642216d6dec2cadf28ba25","observation_id":"a3a4b2a4-2ab8-4b2d-b88c-b7220352a623","resolution":{"observed_at":"2026-08-07T14:25:22.469175Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:22.474251Z","title":"Ziplora: Any subject in any style by effectively merging loras","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19084","last_updated":"2025-05-25T10:40:52Z","snapshot_observed_at":"2026-08-07T22:19:20.729696Z","submitted_at":"2025-05-25T10:40:52Z","title":"Jodi: Unification of Visual Generation and Understanding via Joint Modeling","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:22.474251Z"},"links":{"citing_paper":"/paper/2505.19084"},"observation_digest":"sha256:2f10e988a72ca2e9587e35393c89e4924ca2d380c6a802f0a28e7c4e512b0fe9","observation_id":"2a99b0ee-69d2-4ef3-a72d-e31ed09614f8","resolution":{"observed_at":"2026-08-07T14:25:22.474251Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:22.478989Z","title":"Indoor segmentation and support inference from rgbd images","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2505.19084","last_updated":"2025-05-25T10:40:52Z","snapshot_observed_at":"2026-08-07T22:19:20.729696Z","submitted_at":"2025-05-25T10:40:52Z","title":"Jodi: Unification of Visual Generation and Understanding via Joint Modeling","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:22.478989Z"},"links":{"citing_paper":"/paper/2505.19084"},"observation_digest":"sha256:aff0aa98ce6f0ed83641bc53e2156aa4a18d80f2e6097bc8c88e2390e2a214de","observation_id":"1337a926-c7a1-421f-9c38-17ae3e0d4cbb","resolution":{"observed_at":"2026-08-07T14:25:22.478989Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1409.1556","last_updated":"2015-04-10T16:25:04Z","snapshot_observed_at":"2026-07-06T03:53:32.549552Z","submitted_at":"2014-09-04T19:48:04Z","title":"Very Deep Convolutional Networks for Large-Scale Image Recognition","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1409.1556","snapshot_observed_at":"2026-08-07T14:25:22.483167Z","title":"Very deep convolutional networks for large-scale image recognition","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2505.19084","last_updated":"2025-05-25T10:40:52Z","snapshot_observed_at":"2026-08-07T22:19:20.729696Z","submitted_at":"2025-05-25T10:40:52Z","title":"Jodi: Unification of Visual Generation and Understanding via Joint Modeling","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:22.483167Z"},"links":{"cited_paper":"/paper/1409.1556","citing_paper":"/paper/2505.19084"},"observation_digest":"sha256:f3e0b6d88cbc18dfd45c80c343cd9c5e9ca447f2a3ebbaa5db9aa6f26053cea0","observation_id":"33529430-2f5e-499e-9e35-4a05e2ef5d84","resolution":{"observed_at":"2026-08-07T14:25:22.483167Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:22.487987Z","title":"Deep unsupervised learning using nonequilibrium thermodynamics","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.19084","last_updated":"2025-05-25T10:40:52Z","snapshot_observed_at":"2026-08-07T22:19:20.729696Z","submitted_at":"2025-05-25T10:40:52Z","title":"Jodi: Unification of Visual Generation and Understanding via Joint Modeling","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:22.487987Z"},"links":{"citing_paper":"/paper/2505.19084"},"observation_digest":"sha256:17484e7cd11b9644cb685318961d271fc8f26c628ec5c41b588d10ab862b31d3","observation_id":"309b4ac6-122a-4401-8f2d-fbbc8b0a387f","resolution":{"observed_at":"2026-08-07T14:25:22.487987Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:22.492170Z","title":"Generative modeling by estimating gradients of the data distribution","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.19084","last_updated":"2025-05-25T10:40:52Z","snapshot_observed_at":"2026-08-07T22:19:20.729696Z","submitted_at":"2025-05-25T10:40:52Z","title":"Jodi: Unification of Visual Generation and Understanding via Joint Modeling","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:22.492170Z"},"links":{"citing_paper":"/paper/2505.19084"},"observation_digest":"sha256:8cb07be90d5388dcdc25cdc708bc0885cd8bf85f80304597b2900ce52b876faf","observation_id":"9223c140-660f-4f3c-bcc3-1aefd4a45fff","resolution":{"observed_at":"2026-08-07T14:25:22.492170Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:22.497026Z","title":"Score-based generative modeling through stochastic differential equations","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.19084","last_updated":"2025-05-25T10:40:52Z","snapshot_observed_at":"2026-08-07T22:19:20.729696Z","submitted_at":"2025-05-25T10:40:52Z","title":"Jodi: Unification of Visual Generation and Understanding via Joint Modeling","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:22.497026Z"},"links":{"citing_paper":"/paper/2505.19084"},"observation_digest":"sha256:1097bf8b69e6869722e7a8357b8aebfd5d851a8fe7a7073dcd44d71e55dde4fb","observation_id":"4fe99b11-47c5-45fe-b27f-3e25421545bc","resolution":{"observed_at":"2026-08-07T14:25:22.497026Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:23.620415Z","title":"Pixel difference networks for efficient edge detection","venue":null,"work_id":"6c7255df-28e7-4428-8ec0-83ca1b9a2b8b","year":2021},"citing_paper":{"arxiv_id":"2505.19084","last_updated":"2025-05-25T10:40:52Z","snapshot_observed_at":"2026-08-07T22:19:20.729696Z","submitted_at":"2025-05-25T10:40:52Z","title":"Jodi: Unification of Visual Generation and Understanding via Joint Modeling","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:22.501389Z"},"links":{"citing_paper":"/paper/2505.19084"},"observation_digest":"sha256:47b58c5fbbfbd67408f85b72ba311f349d8623ef169e8ee61746dbed2c563ec2","observation_id":"d110e3d8-a2b7-49a3-93a2-764e51034878","resolution":{"observed_at":"2026-08-07T14:25:23.625294Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:22.506402Z","title":"Going deeper with convolutions","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.19084","last_updated":"2025-05-25T10:40:52Z","snapshot_observed_at":"2026-08-07T22:19:20.729696Z","submitted_at":"2025-05-25T10:40:52Z","title":"Jodi: Unification of Visual Generation and Understanding via Joint Modeling","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:22.506402Z"},"links":{"citing_paper":"/paper/2505.19084"},"observation_digest":"sha256:cae161fd0b6dcaa5067ae9c931a71f39f230c632d9546717eb3ccb56fc79c0eb","observation_id":"9ad2a344-228e-47eb-8db8-265851a07630","resolution":{"observed_at":"2026-08-07T14:25:22.506402Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15098","last_updated":"2025-07-07T17:33:23Z","snapshot_observed_at":"2026-07-06T19:55:37.400185Z","submitted_at":"2024-11-22T17:55:15Z","title":"OminiControl: Minimal and Universal Control for Diffusion Transformer","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.15098","snapshot_observed_at":"2026-08-07T14:25:22.511560Z","title":"Ominicontrol: Minimal and universal control for diffusion transformer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19084","last_updated":"2025-05-25T10:40:52Z","snapshot_observed_at":"2026-08-07T22:19:20.729696Z","submitted_at":"2025-05-25T10:40:52Z","title":"Jodi: Unification of Visual Generation and Understanding via Joint Modeling","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:22.511560Z"},"links":{"cited_paper":"/paper/2411.15098","citing_paper":"/paper/2505.19084"},"observation_digest":"sha256:3e79dce71af395cd1fb03640d999b2ac81472ded1c547e21677f6e9f21a92276","observation_id":"4d27d7ac-3902-4056-abd8-684fa6c21255","resolution":{"observed_at":"2026-08-07T14:25:22.511560Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09818","last_updated":"2025-03-21T05:54:00Z","snapshot_observed_at":"2026-08-07T22:11:30.869700Z","submitted_at":"2024-05-16T05:23:41Z","title":"Chameleon: Mixed-Modal Early-Fusion Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.09818","snapshot_observed_at":"2026-08-07T14:25:22.516710Z","title":"Chameleon: Mixed-modal early-fusion foundation models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19084","last_updated":"2025-05-25T10:40:52Z","snapshot_observed_at":"2026-08-07T22:19:20.729696Z","submitted_at":"2025-05-25T10:40:52Z","title":"Jodi: Unification of Visual Generation and Understanding via Joint Modeling","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:22.516710Z"},"links":{"cited_paper":"/paper/2405.09818","citing_paper":"/paper/2505.19084"},"observation_digest":"sha256:e75f534f395c7dc5956c6b7e38bfe4be468525711fd84268fe6663ce86f3bf45","observation_id":"579ed44c-06ed-4cfa-8bf3-9eb1ed1e39e9","resolution":{"observed_at":"2026-08-07T14:25:22.516710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:22.521960Z","title":"Pixel recurrent neural networks","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.19084","last_updated":"2025-05-25T10:40:52Z","snapshot_observed_at":"2026-08-07T22:19:20.729696Z","submitted_at":"2025-05-25T10:40:52Z","title":"Jodi: Unification of Visual Generation and Understanding via Joint Modeling","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:22.521960Z"},"links":{"citing_paper":"/paper/2505.19084"},"observation_digest":"sha256:44756753ba44edc92f31b3a2ef8d05d0d6573c0898981b9a852ec9a6c0bc184c","observation_id":"308e4df1-654c-4046-91a0-dc895d6fc5e7","resolution":{"observed_at":"2026-08-07T14:25:22.521960Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1908.00463","last_updated":"2019-08-29T04:17:49Z","snapshot_observed_at":"2026-08-03T12:37:47.747612Z","submitted_at":"2019-08-01T15:39:54Z","title":"DIODE: A Dense Indoor and Outdoor DEpth Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.00463","snapshot_observed_at":"2026-08-07T14:25:22.528715Z","title":"Diode: A dense indoor and outdoor depth dataset","venue":null,"work_id":null,"year":1908},"citing_paper":{"arxiv_id":"2505.19084","last_updated":"2025-05-25T10:40:52Z","snapshot_observed_at":"2026-08-07T22:19:20.729696Z","submitted_at":"2025-05-25T10:40:52Z","title":"Jodi: Unification of Visual Generation and Understanding via Joint Modeling","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:22.528715Z"},"links":{"cited_paper":"/paper/1908.00463","citing_paper":"/paper/2505.19084"},"observation_digest":"sha256:6317738658fca1be557f6c53d49cf24654f1c9b3eeea18f629d831a959a8ca35","observation_id":"704e821b-f21d-4751-ac9a-61d05220b4e9","resolution":{"observed_at":"2026-08-07T14:25:22.528715Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:22.534394Z","title":"Attention is all you need","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.19084","last_updated":"2025-05-25T10:40:52Z","snapshot_observed_at":"2026-08-07T22:19:20.729696Z","submitted_at":"2025-05-25T10:40:52Z","title":"Jodi: Unification of Visual Generation and Understanding via Joint Modeling","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:22.534394Z"},"links":{"citing_paper":"/paper/2505.19084"},"observation_digest":"sha256:a358d49fe9f953a0a9bde74839896213ee70bea8ca89f2d91d51112b86a0d319","observation_id":"b2f1a476-2042-4334-832d-01582ae434cc","resolution":{"observed_at":"2026-08-07T14:25:22.534394Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20644","last_updated":"2025-03-26T15:37:17Z","snapshot_observed_at":"2026-08-07T16:35:15.459792Z","submitted_at":"2025-03-26T15:37:17Z","title":"MMGen: Unified Multi-modal Image Generation and Understanding in One Go","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20644","snapshot_observed_at":"2026-08-07T14:25:22.539339Z","title":"Mmgen: Unified multi-modal image generation and understanding in one go","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19084","last_updated":"2025-05-25T10:40:52Z","snapshot_observed_at":"2026-08-07T22:19:20.729696Z","submitted_at":"2025-05-25T10:40:52Z","title":"Jodi: Unification of Visual Generation and Understanding via Joint Modeling","version":1},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:22.539339Z"},"links":{"cited_paper":"/paper/2503.20644","citing_paper":"/paper/2505.19084"},"observation_digest":"sha256:d4403eab366cb354e455e33e4294c551042113911c392aac85a76e3b750faad3","observation_id":"a9fa7bfd-06dc-4760-afd8-4232533b08e8","resolution":{"observed_at":"2026-08-07T14:25:22.539339Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-07T14:25:22.545579Z","title":"Qwen2-vl: Enhancing vision-language model’s perception of the world at any resolution","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19084","last_updated":"2025-05-25T10:40:52Z","snapshot_observed_at":"2026-08-07T22:19:20.729696Z","submitted_at":"2025-05-25T10:40:52Z","title":"Jodi: Unification of Visual Generation and Understanding via Joint Modeling","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:22.545579Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2505.19084"},"observation_digest":"sha256:6bdbc51013f13d63773a03b6e536679d53c2b3fc8e752a2f8743b148711bc026","observation_id":"8b67ff78-b67f-4e1f-b116-53a3f2a43fe5","resolution":{"observed_at":"2026-08-07T14:25:22.545579Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.07519","last_updated":"2024-02-02T16:15:22Z","snapshot_observed_at":"2026-08-06T23:08:20.817133Z","submitted_at":"2024-01-15T07:50:18Z","title":"InstantID: Zero-shot Identity-Preserving Generation in Seconds","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.07519","snapshot_observed_at":"2026-08-07T14:25:22.551869Z","title":"Instantid: Zero-shot identity- preserving generation in seconds","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19084","last_updated":"2025-05-25T10:40:52Z","snapshot_observed_at":"2026-08-07T22:19:20.729696Z","submitted_at":"2025-05-25T10:40:52Z","title":"Jodi: Unification of Visual Generation and Understanding via Joint Modeling","version":1},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:22.551869Z"},"links":{"cited_paper":"/paper/2401.07519","citing_paper":"/paper/2505.19084"},"observation_digest":"sha256:dacbebcedea01a4c4cbaef52fce6d38f4426c309d30a5961a374eac8309f07d2","observation_id":"6dabafcd-fe87-4a07-88d0-f7ce63c883d1","resolution":{"observed_at":"2026-08-07T14:25:22.551869Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.18869","last_updated":"2024-09-27T16:06:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-27T16:06:11Z","title":"Emu3: Next-Token Prediction is All You Need","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.18869","snapshot_observed_at":"2026-08-07T14:25:22.556883Z","title":"Emu3: Next-token prediction is all you need","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19084","last_updated":"2025-05-25T10:40:52Z","snapshot_observed_at":"2026-08-07T22:19:20.729696Z","submitted_at":"2025-05-25T10:40:52Z","title":"Jodi: Unification of Visual Generation and Understanding via Joint Modeling","version":1},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:22.556883Z"},"links":{"cited_paper":"/paper/2409.18869","citing_paper":"/paper/2505.19084"},"observation_digest":"sha256:101a351928f2c19e0530646e1f0f651de9f0cdd741b631408260be88a4663271","observation_id":"28729510-947b-4d84-9e2f-ba67af8485af","resolution":{"observed_at":"2026-08-07T14:25:22.556883Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:23.570621Z","title":"VILA-u: a unified foundation model integrating visual understanding and generation","venue":null,"work_id":"8b9f2022-b027-41c2-8890-74301bfdba0a","year":2025},"citing_paper":{"arxiv_id":"2505.19084","last_updated":"2025-05-25T10:40:52Z","snapshot_observed_at":"2026-08-07T22:19:20.729696Z","submitted_at":"2025-05-25T10:40:52Z","title":"Jodi: Unification of Visual Generation and Understanding via Joint Modeling","version":1},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:22.562233Z"},"links":{"citing_paper":"/paper/2505.19084"},"observation_digest":"sha256:97ea94e55b55b21fdddf4aa8f23d29a47f7366d45b27303cf42def41a49c8b85","observation_id":"eed5e9f7-4f3d-49e0-890f-3445f1aa2a37","resolution":{"observed_at":"2026-08-07T14:25:23.577141Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:23.554083Z","title":"Infinite-id: Identity-preserved person- alization via id-semantics decoupling paradigm","venue":null,"work_id":"6da3ecf3-af22-4838-810c-70d6c258b6e6","year":2024},"citing_paper":{"arxiv_id":"2505.19084","last_updated":"2025-05-25T10:40:52Z","snapshot_observed_at":"2026-08-07T22:19:20.729696Z","submitted_at":"2025-05-25T10:40:52Z","title":"Jodi: Unification of Visual Generation and Understanding via Joint Modeling","version":1},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:22.568323Z"},"links":{"citing_paper":"/paper/2505.19084"},"observation_digest":"sha256:ed24676f20b0e3724de815865d5057f8bb657b260f61cef16c03e6d57eb75c4b","observation_id":"2ef3d780-38c4-4624-995f-ee8b35e92789","resolution":{"observed_at":"2026-08-07T14:25:23.559406Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.11340","last_updated":"2024-11-21T14:09:12Z","snapshot_observed_at":"2026-07-06T19:16:51.512681Z","submitted_at":"2024-09-17T16:42:46Z","title":"OmniGen: Unified Image Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.11340","snapshot_observed_at":"2026-08-07T14:25:22.573243Z","title":"Omnigen: Unified image generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19084","last_updated":"2025-05-25T10:40:52Z","snapshot_observed_at":"2026-08-07T22:19:20.729696Z","submitted_at":"2025-05-25T10:40:52Z","title":"Jodi: Unification of Visual Generation and Understanding via Joint Modeling","version":1},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:22.573243Z"},"links":{"cited_paper":"/paper/2409.11340","citing_paper":"/paper/2505.19084"},"observation_digest":"sha256:0840968869e1bc985d92f7790a126a7b08a241b17fa1effe14bf9282a9d092d1","observation_id":"69893bf6-8d16-49ce-b7c5-8e94aad087d7","resolution":{"observed_at":"2026-08-07T14:25:22.573243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:22.579652Z","title":"SANA: Efficient high-resolution text-to-image synthesis with linear diffusion transformers","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19084","last_updated":"2025-05-25T10:40:52Z","snapshot_observed_at":"2026-08-07T22:19:20.729696Z","submitted_at":"2025-05-25T10:40:52Z","title":"Jodi: Unification of Visual Generation and Understanding via Joint Modeling","version":1},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:22.579652Z"},"links":{"citing_paper":"/paper/2505.19084"},"observation_digest":"sha256:7e97cd433124d35f0c421208729e1797675788411f433c026622f6c33b0da2e4","observation_id":"2978706d-23ba-4e0d-b4dd-3c23fee37374","resolution":{"observed_at":"2026-08-07T14:25:22.579652Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:23.529025Z","title":"Show-o: One single transformer to unify multimodal understanding and generation","venue":null,"work_id":"80086c18-8368-42ac-8031-25bab3854f7e","year":2025},"citing_paper":{"arxiv_id":"2505.19084","last_updated":"2025-05-25T10:40:52Z","snapshot_observed_at":"2026-08-07T22:19:20.729696Z","submitted_at":"2025-05-25T10:40:52Z","title":"Jodi: Unification of Visual Generation and Understanding via Joint Modeling","version":1},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:22.585226Z"},"links":{"citing_paper":"/paper/2505.19084"},"observation_digest":"sha256:9d219bf889d4bf27ad2d8aa77967b6b68affead6d3f905d3b02dd9957851c150","observation_id":"d8910e70-353f-4bd1-b693-250a93b310ce","resolution":{"observed_at":"2026-08-07T14:25:23.533825Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.19084","last_updated":"2025-05-25T10:40:52Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T22:19:20.729696Z","submitted_at":"2025-05-25T10:40:52Z","title":"Jodi: Unification of Visual Generation and Understanding via Joint Modeling"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":82,"verified_exact":2,"verified_fuzzy":16},"total_outbound_references":121},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 100 of 121 outbound references and 3 inbound Pith citation observations for arXiv:2505.19084."}