{"as_of":"2026-08-18T13:27:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a3da77a12c3b08d886d30974c50fc5fa34cdfd9f68b17e791b8859d9df0eee16","coverage":[{"denominator":70,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":70,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T18:52:37.501612Z","state":"measured"},{"denominator":71,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":71,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T19:30:30.517564Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.07106","last_updated":"2025-07-09T17:59:47Z","snapshot_observed_at":"2026-08-10T20:06:39.029785Z","submitted_at":"2025-07-09T17:59:47Z","title":"Towards Multimodal Understanding via Stable Diffusion as a Task-Aware Feature Extractor","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.07106","snapshot_observed_at":"2026-08-03T19:30:30.517564Z","title":"arXiv preprint arXiv:2507.07106 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.00470","last_updated":"2026-06-01T03:04:59Z","snapshot_observed_at":"2026-08-13T03:42:58.372453Z","submitted_at":"2025-11-29T12:45:05Z","title":"LAP: Fast LAtent Diffusion Planner for Autonomous Driving","version":4},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-03T19:30:30.517564Z"},"links":{"cited_paper":"/paper/2507.07106","citing_paper":"/paper/2512.00470"},"observation_digest":"sha256:a46d8f81d5bba7472c0da0a3311514babe17755632a855acf833e1d5e1b24f15","observation_id":"92a96c14-d83f-43c4-b8d8-62cbd1f2168b","resolution":{"observed_at":"2026-08-03T19:30:30.517564Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2507.07106/citation-record","integrity":"/paper/2507.07106/integrity","json":"/paper/2507.07106/citation-record.json","paper":"/paper/2507.07106"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:52:39.204146Z","title":"Eyes wide shut? exploring the visual shortcomings of multimodal llms,","venue":null,"work_id":"dd938538-1890-4e21-973c-af8b0d6b5e16","year":2024},"citing_paper":{"arxiv_id":"2507.07106","last_updated":"2025-07-09T17:59:47Z","snapshot_observed_at":"2026-08-10T20:06:39.029785Z","submitted_at":"2025-07-09T17:59:47Z","title":"Towards Multimodal Understanding via Stable Diffusion as a Task-Aware Feature Extractor","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T18:52:31.474283Z"},"links":{"citing_paper":"/paper/2507.07106"},"observation_digest":"sha256:8dd5444f094190994667c4ce9484cc3049405c78c3a364dfbcebd4e3c7ff86ae","observation_id":"e8b87fd0-240e-418d-b6cf-8ec87ed4eb41","resolution":{"observed_at":"2026-08-06T18:52:39.207480Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:52:39.194077Z","title":"Learning transferable visual models from natural language supervision,","venue":null,"work_id":"23db079d-b713-4c49-9837-cbea41e496e9","year":2021},"citing_paper":{"arxiv_id":"2507.07106","last_updated":"2025-07-09T17:59:47Z","snapshot_observed_at":"2026-08-10T20:06:39.029785Z","submitted_at":"2025-07-09T17:59:47Z","title":"Towards Multimodal Understanding via Stable Diffusion as a Task-Aware Feature Extractor","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T18:52:31.523702Z"},"links":{"citing_paper":"/paper/2507.07106"},"observation_digest":"sha256:6c483399efea1b3e1e1f02b370bed729dd1f2676682219e51d972b1175f81803","observation_id":"a12d77e5-20f2-4573-90e9-81ca44e1ab33","resolution":{"observed_at":"2026-08-06T18:52:39.197431Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.06809","last_updated":"2025-03-31T21:53:36Z","snapshot_observed_at":"2026-08-16T13:19:39.103134Z","submitted_at":"2024-09-10T18:27:36Z","title":"DetailCLIP: Detail-Oriented CLIP for Fine-Grained Tasks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.06809","snapshot_observed_at":"2026-08-06T18:52:31.581690Z","title":"Detailclip: Detail-oriented clip for fine-grained tasks,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.07106","last_updated":"2025-07-09T17:59:47Z","snapshot_observed_at":"2026-08-10T20:06:39.029785Z","submitted_at":"2025-07-09T17:59:47Z","title":"Towards Multimodal Understanding via Stable Diffusion as a Task-Aware Feature Extractor","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T18:52:31.581690Z"},"links":{"cited_paper":"/paper/2409.06809","citing_paper":"/paper/2507.07106"},"observation_digest":"sha256:c8dcd993b3cfdc986fd59662ad7f363e0744932babdd2705ddc0e96d1ddc944b","observation_id":"b602ef68-7beb-436a-b7af-92b84f6a69a2","resolution":{"observed_at":"2026-08-06T18:52:31.581690Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:52:39.184072Z","title":"Is clip the main roadblock for fine-grained open-world perception?,","venue":null,"work_id":"56f4c8b1-9f41-4c63-8b89-9729cb19b6bd","year":2024},"citing_paper":{"arxiv_id":"2507.07106","last_updated":"2025-07-09T17:59:47Z","snapshot_observed_at":"2026-08-10T20:06:39.029785Z","submitted_at":"2025-07-09T17:59:47Z","title":"Towards Multimodal Understanding via Stable Diffusion as a Task-Aware Feature Extractor","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T18:52:31.646858Z"},"links":{"citing_paper":"/paper/2507.07106"},"observation_digest":"sha256:d5be037931a878df226d86836c6f542da8583fdcd149b785e2027f360e1e55d2","observation_id":"b3734393-a69e-4769-a1e9-4e7e7c1d021c","resolution":{"observed_at":"2026-08-06T18:52:39.187174Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10722","last_updated":"2024-04-24T23:10:17Z","snapshot_observed_at":"2026-08-18T00:47:52.125799Z","submitted_at":"2023-05-18T05:41:36Z","title":"Discffusion: Discriminative Diffusion Models as Few-shot Vision and Language Learners","version":3},"cited_work":{"arxiv_id":"2305.10722","doi":null,"metadata_source":"pith","pith_arxiv_id":"2305.10722","snapshot_observed_at":"2026-08-06T18:52:38.138566Z","title":"Discffusion: Discriminative Diffusion Models as Few-shot Vision and Language Learners","venue":"cs.CV","work_id":"8ba75875-2d50-4808-9ee6-29a17ad7620b","year":2023},"citing_paper":{"arxiv_id":"2507.07106","last_updated":"2025-07-09T17:59:47Z","snapshot_observed_at":"2026-08-10T20:06:39.029785Z","submitted_at":"2025-07-09T17:59:47Z","title":"Towards Multimodal Understanding via Stable Diffusion as a Task-Aware Feature Extractor","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T18:52:31.697090Z"},"links":{"cited_paper":"/paper/2305.10722","citing_paper":"/paper/2507.07106"},"observation_digest":"sha256:c83b27009f41829961dab5c250e6508ffa140281027dc0b55e5d5f9325066f03","observation_id":"625bdc2b-6844-4ae1-ac8f-0e68ed309af3","resolution":{"observed_at":"2026-08-06T18:52:38.207894Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07204","last_updated":"2024-04-10T17:59:45Z","snapshot_observed_at":"2026-08-16T14:01:58.751018Z","submitted_at":"2024-04-10T17:59:45Z","title":"BRAVE: Broadening the visual encoding of vision-language models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.07204","snapshot_observed_at":"2026-08-06T18:52:31.767820Z","title":"Brave: Broadening the visual encoding of vision-language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.07106","last_updated":"2025-07-09T17:59:47Z","snapshot_observed_at":"2026-08-10T20:06:39.029785Z","submitted_at":"2025-07-09T17:59:47Z","title":"Towards Multimodal Understanding via Stable Diffusion as a Task-Aware Feature Extractor","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T18:52:31.767820Z"},"links":{"cited_paper":"/paper/2404.07204","citing_paper":"/paper/2507.07106"},"observation_digest":"sha256:ea4e10abd1463760db49089e0a6608b2686109baae424269e89286a0b8b5dc22","observation_id":"bf309773-992a-4ce3-a6c3-4332c53bc974","resolution":{"observed_at":"2026-08-06T18:52:31.767820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16860","last_updated":"2024-12-04T17:57:32Z","snapshot_observed_at":"2026-08-15T07:01:36.213052Z","submitted_at":"2024-06-24T17:59:42Z","title":"Cambrian-1: A Fully Open, Vision-Centric Exploration of Multimodal LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16860","snapshot_observed_at":"2026-08-06T18:52:31.825326Z","title":"Cambrian-1: A fully open, vision-centric exploration of multimodal llms,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.07106","last_updated":"2025-07-09T17:59:47Z","snapshot_observed_at":"2026-08-10T20:06:39.029785Z","submitted_at":"2025-07-09T17:59:47Z","title":"Towards Multimodal Understanding via Stable Diffusion as a Task-Aware Feature Extractor","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T18:52:31.825326Z"},"links":{"cited_paper":"/paper/2406.16860","citing_paper":"/paper/2507.07106"},"observation_digest":"sha256:bbab568955665b45de73ba29ab6ca07b1a1d3d2cfb96de92502a0d5912776b73","observation_id":"67cf8678-d817-4b9f-bb5c-00e6edf6170c","resolution":{"observed_at":"2026-08-06T18:52:31.825326Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.08825","last_updated":"2024-03-08T02:49:12Z","snapshot_observed_at":"2026-08-16T14:52:29.090076Z","submitted_at":"2023-10-13T02:41:55Z","title":"From CLIP to DINO: Visual Encoders Shout in Multi-modal Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.08825","snapshot_observed_at":"2026-08-06T18:52:31.897432Z","title":"From clip to dino: Visual encoders shout in multi-modal large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.07106","last_updated":"2025-07-09T17:59:47Z","snapshot_observed_at":"2026-08-10T20:06:39.029785Z","submitted_at":"2025-07-09T17:59:47Z","title":"Towards Multimodal Understanding via Stable Diffusion as a Task-Aware Feature Extractor","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T18:52:31.897432Z"},"links":{"cited_paper":"/paper/2310.08825","citing_paper":"/paper/2507.07106"},"observation_digest":"sha256:15b5f54e760195d15e56964730a20f17dfe0d856e00066311c14b4f23e2a0a61","observation_id":"ea4cd2ef-2034-4a1b-8b7a-f9b908f0b8ea","resolution":{"observed_at":"2026-08-06T18:52:31.897432Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:52:39.173034Z","title":"Mini-gemini: Mining the potential of multi-modality vision language models,","venue":null,"work_id":"262bd918-21d8-4389-9fcd-91c16a03d312","year":2024},"citing_paper":{"arxiv_id":"2507.07106","last_updated":"2025-07-09T17:59:47Z","snapshot_observed_at":"2026-08-10T20:06:39.029785Z","submitted_at":"2025-07-09T17:59:47Z","title":"Towards Multimodal Understanding via Stable Diffusion as a Task-Aware Feature Extractor","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T18:52:31.974928Z"},"links":{"citing_paper":"/paper/2507.07106"},"observation_digest":"sha256:64fe98cb7831e161aec0e94749635eea344c2a8b59c2a66adbd22e06e2e6f70d","observation_id":"a6fd8af5-b0b1-4324-8852-e6e4af2443fc","resolution":{"observed_at":"2026-08-06T18:52:39.176426Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.02506","last_updated":"2024-01-18T22:09:40Z","snapshot_observed_at":"2026-08-16T15:50:47.043477Z","submitted_at":"2023-03-04T21:22:47Z","title":"Prismer: A Vision-Language Model with Multi-Task Experts","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.02506","snapshot_observed_at":"2026-08-06T18:52:32.060515Z","title":"Prismer: A vision-language model with multi-task experts,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.07106","last_updated":"2025-07-09T17:59:47Z","snapshot_observed_at":"2026-08-10T20:06:39.029785Z","submitted_at":"2025-07-09T17:59:47Z","title":"Towards Multimodal Understanding via Stable Diffusion as a Task-Aware Feature Extractor","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T18:52:32.060515Z"},"links":{"cited_paper":"/paper/2303.02506","citing_paper":"/paper/2507.07106"},"observation_digest":"sha256:2430d9c0443e02da8a5bb018aae8c9a5936adcf38803ced8743dacf40498d088","observation_id":"e9b9b89d-4508-462d-80ed-2c3b2ab5c80e","resolution":{"observed_at":"2026-08-06T18:52:32.060515Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:52:39.163255Z","title":"Vcoder: Versatile vision encoders for multimodal large language models,","venue":null,"work_id":"48234a14-a049-4848-86d0-ba655a6b8e90","year":2024},"citing_paper":{"arxiv_id":"2507.07106","last_updated":"2025-07-09T17:59:47Z","snapshot_observed_at":"2026-08-10T20:06:39.029785Z","submitted_at":"2025-07-09T17:59:47Z","title":"Towards Multimodal Understanding via Stable Diffusion as a Task-Aware Feature Extractor","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T18:52:32.175329Z"},"links":{"citing_paper":"/paper/2507.07106"},"observation_digest":"sha256:4d2adb1232ea8e6769e63e702f4d158d255cc09cf3864d6e967d2ed6878c1bc9","observation_id":"7cb52f24-dbbb-4ab1-81ec-a3d5c5cbafc0","resolution":{"observed_at":"2026-08-06T18:52:39.166549Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:52:39.153345Z","title":"Question aware vision transformer for multimodal reasoning,","venue":null,"work_id":"c469e94e-4b7c-4a25-9b56-4ddd401f6c93","year":2024},"citing_paper":{"arxiv_id":"2507.07106","last_updated":"2025-07-09T17:59:47Z","snapshot_observed_at":"2026-08-10T20:06:39.029785Z","submitted_at":"2025-07-09T17:59:47Z","title":"Towards Multimodal Understanding via Stable Diffusion as a Task-Aware Feature Extractor","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T18:52:32.267593Z"},"links":{"citing_paper":"/paper/2507.07106"},"observation_digest":"sha256:62294358286a305a5b9ef41ce3c49d5a5723be99fd8cc927839e351e295e0545","observation_id":"b7103154-94f7-4435-bfa8-ac2c332fb38a","resolution":{"observed_at":"2026-08-06T18:52:39.156651Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:52:39.142335Z","title":"Api: Attention prompting on image for large vision-language models,","venue":null,"work_id":"27b957c5-6e68-4d94-ac5b-8d2fc92a64c8","year":2024},"citing_paper":{"arxiv_id":"2507.07106","last_updated":"2025-07-09T17:59:47Z","snapshot_observed_at":"2026-08-10T20:06:39.029785Z","submitted_at":"2025-07-09T17:59:47Z","title":"Towards Multimodal Understanding via Stable Diffusion as a Task-Aware Feature Extractor","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T18:52:32.368424Z"},"links":{"citing_paper":"/paper/2507.07106"},"observation_digest":"sha256:10579a2dfd1446de1d9745cd30db59840c6811c2f59d1fdfcd75436d408f29bf","observation_id":"7283de56-cd47-43d2-a110-a861513486d7","resolution":{"observed_at":"2026-08-06T18:52:39.146498Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:52:32.475667Z","title":"Instructblip: Towards general-purpose vision-language models with instruction tuning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.07106","last_updated":"2025-07-09T17:59:47Z","snapshot_observed_at":"2026-08-10T20:06:39.029785Z","submitted_at":"2025-07-09T17:59:47Z","title":"Towards Multimodal Understanding via Stable Diffusion as a Task-Aware Feature Extractor","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T18:52:32.475667Z"},"links":{"citing_paper":"/paper/2507.07106"},"observation_digest":"sha256:3084cf266a29a82855f48107a2019c62b501ef9cda2204bf93519c8e323ad80f","observation_id":"cefb533f-5313-443f-b4f5-cca3a74cf1db","resolution":{"observed_at":"2026-08-06T18:52:32.475667Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:52:32.491396Z","title":"Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.07106","last_updated":"2025-07-09T17:59:47Z","snapshot_observed_at":"2026-08-10T20:06:39.029785Z","submitted_at":"2025-07-09T17:59:47Z","title":"Towards Multimodal Understanding via Stable Diffusion as a Task-Aware Feature Extractor","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T18:52:32.491396Z"},"links":{"citing_paper":"/paper/2507.07106"},"observation_digest":"sha256:3aa5527474c7f05d1293053cad75a68c771d9895b741feb0f919a5d6ac86a583","observation_id":"51279896-4373-4237-84bd-1fdf372892e6","resolution":{"observed_at":"2026-08-06T18:52:32.491396Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:52:32.533667Z","title":"High-resolution image synthesis with latent diffusion models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.07106","last_updated":"2025-07-09T17:59:47Z","snapshot_observed_at":"2026-08-10T20:06:39.029785Z","submitted_at":"2025-07-09T17:59:47Z","title":"Towards Multimodal Understanding via Stable Diffusion as a Task-Aware Feature Extractor","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T18:52:32.533667Z"},"links":{"citing_paper":"/paper/2507.07106"},"observation_digest":"sha256:44b9899ebc1adde02e86ff4f795965c5461224b80b3d6e1168319656225c6b02","observation_id":"df85e6de-4f47-4c97-afdc-2213358707fb","resolution":{"observed_at":"2026-08-06T18:52:32.533667Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:52:39.112261Z","title":"Photorealistic text-to-image diffusion models with deep language understanding,","venue":null,"work_id":"cc9e66d5-aa2b-4d48-9cd8-ebfb5272a1af","year":2022},"citing_paper":{"arxiv_id":"2507.07106","last_updated":"2025-07-09T17:59:47Z","snapshot_observed_at":"2026-08-10T20:06:39.029785Z","submitted_at":"2025-07-09T17:59:47Z","title":"Towards Multimodal Understanding via Stable Diffusion as a Task-Aware Feature Extractor","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T18:52:32.611237Z"},"links":{"citing_paper":"/paper/2507.07106"},"observation_digest":"sha256:bf23f00a7d8f07b809735f068a027108e20168bce324965fef8ba7b553b8f93b","observation_id":"bbcd5294-5e78-4b1c-bd97-3c5db57e9a4a","resolution":{"observed_at":"2026-08-06T18:52:39.116420Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:52:32.727639Z","title":"Hierarchical text-conditional image generation with clip latents,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.07106","last_updated":"2025-07-09T17:59:47Z","snapshot_observed_at":"2026-08-10T20:06:39.029785Z","submitted_at":"2025-07-09T17:59:47Z","title":"Towards Multimodal Understanding via Stable Diffusion as a Task-Aware Feature Extractor","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T18:52:32.727639Z"},"links":{"citing_paper":"/paper/2507.07106"},"observation_digest":"sha256:831f7f2d87d15545c2eba3bc4dea183a9b8874aec72847b435fdb99d0e866986","observation_id":"296a3972-4983-498b-ad94-39a6c8bc9d1a","resolution":{"observed_at":"2026-08-06T18:52:32.727639Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:52:39.093276Z","title":"Sdxl: Improving latent diffusion models for high-resolution image synthesis,","venue":null,"work_id":"677af1e4-e940-425a-b12a-ec80c817f587","year":2023},"citing_paper":{"arxiv_id":"2507.07106","last_updated":"2025-07-09T17:59:47Z","snapshot_observed_at":"2026-08-10T20:06:39.029785Z","submitted_at":"2025-07-09T17:59:47Z","title":"Towards Multimodal Understanding via Stable Diffusion as a Task-Aware Feature Extractor","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T18:52:32.845664Z"},"links":{"citing_paper":"/paper/2507.07106"},"observation_digest":"sha256:b661d818ac1120cf47fde195b20a7c43e026837c7ccbedfb3768177245c18214","observation_id":"c0901327-ae10-4002-9c21-bba7c7ce2154","resolution":{"observed_at":"2026-08-06T18:52:39.097243Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:52:39.083024Z","title":"Prompt-to-prompt image editing with cross attention control,","venue":null,"work_id":"d6740902-a9e6-4076-a5cf-e8d4a5c28b21","year":2022},"citing_paper":{"arxiv_id":"2507.07106","last_updated":"2025-07-09T17:59:47Z","snapshot_observed_at":"2026-08-10T20:06:39.029785Z","submitted_at":"2025-07-09T17:59:47Z","title":"Towards Multimodal Understanding via Stable Diffusion as a Task-Aware Feature Extractor","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T18:52:32.958030Z"},"links":{"citing_paper":"/paper/2507.07106"},"observation_digest":"sha256:5cff27d2b27ff398d25c57203f23b8613194181bd19ec8b8f832166d282cd1b2","observation_id":"55412a86-d16b-48bd-a6f9-528b92f8f1d8","resolution":{"observed_at":"2026-08-06T18:52:39.086788Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:52:39.073739Z","title":"What the daam: Interpreting stable diffusion using cross attention,","venue":null,"work_id":"a256543a-b9c2-420d-9250-9cb12fc0ee4f","year":2022},"citing_paper":{"arxiv_id":"2507.07106","last_updated":"2025-07-09T17:59:47Z","snapshot_observed_at":"2026-08-10T20:06:39.029785Z","submitted_at":"2025-07-09T17:59:47Z","title":"Towards Multimodal Understanding via Stable Diffusion as a Task-Aware Feature Extractor","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T18:52:33.072184Z"},"links":{"citing_paper":"/paper/2507.07106"},"observation_digest":"sha256:534ed8531964d57c05413aa1ece1786ff55975f6f9f5f411f86c9ab7cf063bf3","observation_id":"b99865be-9966-49d5-ae52-cd4fc760b7dc","resolution":{"observed_at":"2026-08-06T18:52:39.077053Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:52:39.064357Z","title":"Towards understanding cross and self-attention in stable diffusion for text-guided image editing,","venue":null,"work_id":"1e71818c-bee6-4183-b526-6c02ad423466","year":2024},"citing_paper":{"arxiv_id":"2507.07106","last_updated":"2025-07-09T17:59:47Z","snapshot_observed_at":"2026-08-10T20:06:39.029785Z","submitted_at":"2025-07-09T17:59:47Z","title":"Towards Multimodal Understanding via Stable Diffusion as a Task-Aware Feature Extractor","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T18:52:33.171759Z"},"links":{"citing_paper":"/paper/2507.07106"},"observation_digest":"sha256:becaba2dbe5496b53baf0413d115aa79b9e41b1d2cb82a72558880efa24d041a","observation_id":"5715627b-f108-4911-a7ea-6493cff780c5","resolution":{"observed_at":"2026-08-06T18:52:39.067728Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:52:39.054419Z","title":"Plug-and-play diffusion features for text-driven image- to-image translation,","venue":null,"work_id":"fd1f4650-781f-4e5a-9a9f-dcfd253067d2","year":1921},"citing_paper":{"arxiv_id":"2507.07106","last_updated":"2025-07-09T17:59:47Z","snapshot_observed_at":"2026-08-10T20:06:39.029785Z","submitted_at":"2025-07-09T17:59:47Z","title":"Towards Multimodal Understanding via Stable Diffusion as a Task-Aware Feature Extractor","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T18:52:33.269016Z"},"links":{"citing_paper":"/paper/2507.07106"},"observation_digest":"sha256:a8ef2b5287fa48150a49a13403990789372768091f3608f066bd478f1cb7e51e","observation_id":"f68a552d-440a-4c04-83f3-8c6fe427aa1e","resolution":{"observed_at":"2026-08-06T18:52:39.058139Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.02773","last_updated":"2024-01-22T07:18:55Z","snapshot_observed_at":"2026-08-16T15:02:56.591450Z","submitted_at":"2023-09-06T06:31:08Z","title":"Diffusion Model is Secretly a Training-free Open Vocabulary Semantic Segmenter","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.02773","snapshot_observed_at":"2026-08-06T18:52:33.421637Z","title":"Diffusion model is secretly a training-free open vocabulary semantic segmenter,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.07106","last_updated":"2025-07-09T17:59:47Z","snapshot_observed_at":"2026-08-10T20:06:39.029785Z","submitted_at":"2025-07-09T17:59:47Z","title":"Towards Multimodal Understanding via Stable Diffusion as a Task-Aware Feature Extractor","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T18:52:33.421637Z"},"links":{"cited_paper":"/paper/2309.02773","citing_paper":"/paper/2507.07106"},"observation_digest":"sha256:6a4b6e070ea01669af3c1a43c18b9f064923af3ebee5b7563eb62b83aa810d2a","observation_id":"3de6ec26-b7fb-41ef-9c92-b1afb1298272","resolution":{"observed_at":"2026-08-06T18:52:33.421637Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:52:39.044837Z","title":"Repurposing diffusion-based image generators for monocular depth estimation,","venue":null,"work_id":"4c20c52e-54ed-4ad7-853c-7866d8f1d129","year":2024},"citing_paper":{"arxiv_id":"2507.07106","last_updated":"2025-07-09T17:59:47Z","snapshot_observed_at":"2026-08-10T20:06:39.029785Z","submitted_at":"2025-07-09T17:59:47Z","title":"Towards Multimodal Understanding via Stable Diffusion as a Task-Aware Feature Extractor","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T18:52:33.537106Z"},"links":{"citing_paper":"/paper/2507.07106"},"observation_digest":"sha256:f6ec621bbb0fb47b74bdd6ffb6ec6f6ee3873411b31f4f12541803629557f807","observation_id":"8e32935a-f2fa-4f14-879f-b4239b68da79","resolution":{"observed_at":"2026-08-06T18:52:39.048007Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.17921","last_updated":"2024-09-24T17:59:50Z","snapshot_observed_at":"2026-08-16T14:39:07.080855Z","submitted_at":"2023-11-29T18:59:59Z","title":"Do text-free diffusion models learn discriminative visual representations?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.17921","snapshot_observed_at":"2026-08-06T18:52:33.646987Z","title":"Do text-free diffusion models learn discriminative visual representations?,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.07106","last_updated":"2025-07-09T17:59:47Z","snapshot_observed_at":"2026-08-10T20:06:39.029785Z","submitted_at":"2025-07-09T17:59:47Z","title":"Towards Multimodal Understanding via Stable Diffusion as a Task-Aware Feature Extractor","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T18:52:33.646987Z"},"links":{"cited_paper":"/paper/2311.17921","citing_paper":"/paper/2507.07106"},"observation_digest":"sha256:f5b78ffe11d71b4fe1deb1e0392c49e735a850f2b8853b0b6e1eeff3a8cace60","observation_id":"4c4dce4f-505e-4580-bd26-cbd6e386ba1f","resolution":{"observed_at":"2026-08-06T18:52:33.646987Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:52:39.035268Z","title":"Deconstructing denoising diffusion models for self-supervised learning,","venue":null,"work_id":"13b75ba3-96eb-4420-bab2-f2b6c5f612c5","year":2024},"citing_paper":{"arxiv_id":"2507.07106","last_updated":"2025-07-09T17:59:47Z","snapshot_observed_at":"2026-08-10T20:06:39.029785Z","submitted_at":"2025-07-09T17:59:47Z","title":"Towards Multimodal Understanding via Stable Diffusion as a Task-Aware Feature Extractor","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T18:52:33.726982Z"},"links":{"citing_paper":"/paper/2507.07106"},"observation_digest":"sha256:4ef6793c6ff2267965bf6865bfc2564d8ddc998ee43358a68b1e66fdfe64a9f0","observation_id":"44a895a7-2e78-42cf-bce6-5f52c4eb49a3","resolution":{"observed_at":"2026-08-06T18:52:39.038820Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:52:39.024503Z","title":"Coca: Contrastive captioners are image-text foundation models,","venue":null,"work_id":"4df33bce-f5fc-43bc-a697-9774477976ad","year":2022},"citing_paper":{"arxiv_id":"2507.07106","last_updated":"2025-07-09T17:59:47Z","snapshot_observed_at":"2026-08-10T20:06:39.029785Z","submitted_at":"2025-07-09T17:59:47Z","title":"Towards Multimodal Understanding via Stable Diffusion as a Task-Aware Feature Extractor","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T18:52:33.824328Z"},"links":{"citing_paper":"/paper/2507.07106"},"observation_digest":"sha256:2f3e55b549decc32aaf65072c1d5d60631e22221528f7027900d95a59988ce86","observation_id":"98a009da-c65d-4f22-9c99-2857b6e2c9a8","resolution":{"observed_at":"2026-08-06T18:52:39.028681Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:52:39.014213Z","title":"Multimodal few-shot learning with frozen language models,","venue":null,"work_id":"9bf96f03-0eee-4003-b9a6-257ec67a5881","year":2021},"citing_paper":{"arxiv_id":"2507.07106","last_updated":"2025-07-09T17:59:47Z","snapshot_observed_at":"2026-08-10T20:06:39.029785Z","submitted_at":"2025-07-09T17:59:47Z","title":"Towards Multimodal Understanding via Stable Diffusion as a Task-Aware Feature Extractor","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T18:52:33.897344Z"},"links":{"citing_paper":"/paper/2507.07106"},"observation_digest":"sha256:3b96ec8966f01348df4b8987352076928bc14f1ea7812d59d5775b413a60983d","observation_id":"790d6f1e-5c0d-4a5c-9047-606095c7cbd9","resolution":{"observed_at":"2026-08-06T18:52:39.017462Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:52:39.003859Z","title":"Flamingo: a visual language model for few-shot learning,","venue":null,"work_id":"546ff14b-e2f5-4746-aca7-34b916773209","year":2022},"citing_paper":{"arxiv_id":"2507.07106","last_updated":"2025-07-09T17:59:47Z","snapshot_observed_at":"2026-08-10T20:06:39.029785Z","submitted_at":"2025-07-09T17:59:47Z","title":"Towards Multimodal Understanding via Stable Diffusion as a Task-Aware Feature Extractor","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T18:52:33.976289Z"},"links":{"citing_paper":"/paper/2507.07106"},"observation_digest":"sha256:fd2650da451e7f82910007616ccabeaaadf950f60cecd447f0cbf3eef9f08f7b","observation_id":"e5a0be6c-107b-4935-9338-c4a9398dd94c","resolution":{"observed_at":"2026-08-06T18:52:39.007156Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:52:38.992950Z","title":"Visual instruction tuning,","venue":null,"work_id":"129d63f5-0f3d-4d03-8b59-a0b2c28ab1b3","year":2023},"citing_paper":{"arxiv_id":"2507.07106","last_updated":"2025-07-09T17:59:47Z","snapshot_observed_at":"2026-08-10T20:06:39.029785Z","submitted_at":"2025-07-09T17:59:47Z","title":"Towards Multimodal Understanding via Stable Diffusion as a Task-Aware Feature Extractor","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T18:52:34.146798Z"},"links":{"citing_paper":"/paper/2507.07106"},"observation_digest":"sha256:df132282eafc0e9d32b9aa2f28aff8a591eaa6de67a5b8b0a124e9ec1d7388f3","observation_id":"f20a7514-0702-4d53-ad7d-f58aaafc9dfa","resolution":{"observed_at":"2026-08-06T18:52:38.996235Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10592","last_updated":"2023-10-02T16:38:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-20T18:25:35Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.10592","snapshot_observed_at":"2026-08-06T18:52:34.227206Z","title":"Minigpt-4: Enhancing vision-language understanding with advanced large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.07106","last_updated":"2025-07-09T17:59:47Z","snapshot_observed_at":"2026-08-10T20:06:39.029785Z","submitted_at":"2025-07-09T17:59:47Z","title":"Towards Multimodal Understanding via Stable Diffusion as a Task-Aware Feature Extractor","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T18:52:34.227206Z"},"links":{"cited_paper":"/paper/2304.10592","citing_paper":"/paper/2507.07106"},"observation_digest":"sha256:72de06713301b83bd30e4aaab4352e70a464ec9f8073aa80832cb52da611f72c","observation_id":"d0517812-1c5b-4029-9d48-4d901626aca3","resolution":{"observed_at":"2026-08-06T18:52:34.227206Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.09478","last_updated":"2023-11-07T18:25:48Z","snapshot_observed_at":"2026-08-17T13:04:04.064087Z","submitted_at":"2023-10-14T03:22:07Z","title":"MiniGPT-v2: large language model as a unified interface for vision-language multi-task learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.09478","snapshot_observed_at":"2026-08-06T18:52:34.315551Z","title":"Minigpt-v2: large language model as a unified interface for vision-language multi-task learning,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.07106","last_updated":"2025-07-09T17:59:47Z","snapshot_observed_at":"2026-08-10T20:06:39.029785Z","submitted_at":"2025-07-09T17:59:47Z","title":"Towards Multimodal Understanding via Stable Diffusion as a Task-Aware Feature Extractor","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T18:52:34.315551Z"},"links":{"cited_paper":"/paper/2310.09478","citing_paper":"/paper/2507.07106"},"observation_digest":"sha256:31e547a1e180843ae836006eedfba8c15697669e69d92fed6ed77db8090133c8","observation_id":"5cc71a27-f8e9-43c7-b0f5-e29d26238011","resolution":{"observed_at":"2026-08-06T18:52:34.315551Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.01390","last_updated":"2023-08-07T17:53:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-02T19:10:23Z","title":"OpenFlamingo: An Open-Source Framework for Training Large Autoregressive Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.01390","snapshot_observed_at":"2026-08-06T18:52:34.409335Z","title":"Openflamingo: An open-source framework for training large autoregressive vision-language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.07106","last_updated":"2025-07-09T17:59:47Z","snapshot_observed_at":"2026-08-10T20:06:39.029785Z","submitted_at":"2025-07-09T17:59:47Z","title":"Towards Multimodal Understanding via Stable Diffusion as a Task-Aware Feature Extractor","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T18:52:34.409335Z"},"links":{"cited_paper":"/paper/2308.01390","citing_paper":"/paper/2507.07106"},"observation_digest":"sha256:857b36b68bf4ff3d1612094da58bc2018160d1680df046ae712e6d74c0a14042","observation_id":"556d3ef5-1f4b-4c51-aee0-77d103f946d8","resolution":{"observed_at":"2026-08-06T18:52:34.409335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10355","last_updated":"2023-10-26T02:52:40Z","snapshot_observed_at":"2026-08-12T18:48:30.326248Z","submitted_at":"2023-05-17T16:34:01Z","title":"Evaluating Object Hallucination in Large Vision-Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10355","snapshot_observed_at":"2026-08-06T18:52:34.500395Z","title":"Evaluating object hallucination in large vision-language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.07106","last_updated":"2025-07-09T17:59:47Z","snapshot_observed_at":"2026-08-10T20:06:39.029785Z","submitted_at":"2025-07-09T17:59:47Z","title":"Towards Multimodal Understanding via Stable Diffusion as a Task-Aware Feature Extractor","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T18:52:34.500395Z"},"links":{"cited_paper":"/paper/2305.10355","citing_paper":"/paper/2507.07106"},"observation_digest":"sha256:e6ebb44ee5449f616befd3a4dec59d309ef9b2f8fc3076376f22e606b4b343f1","observation_id":"848a5aaa-b4e9-4115-82e6-decb4d529af6","resolution":{"observed_at":"2026-08-06T18:52:34.500395Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:52:38.982781Z","title":"Multi-modal hallucination control by visual information grounding,","venue":null,"work_id":"585233db-3144-40f4-a06a-6fec6924cd00","year":2024},"citing_paper":{"arxiv_id":"2507.07106","last_updated":"2025-07-09T17:59:47Z","snapshot_observed_at":"2026-08-10T20:06:39.029785Z","submitted_at":"2025-07-09T17:59:47Z","title":"Towards Multimodal Understanding via Stable Diffusion as a Task-Aware Feature Extractor","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T18:52:34.591011Z"},"links":{"citing_paper":"/paper/2507.07106"},"observation_digest":"sha256:f4520a550bf7377c3dc53e3d154711b14d9ada034e5b79bb34e916158b83e903","observation_id":"54725c8f-4675-4ac8-abfb-c2e9f1e25b01","resolution":{"observed_at":"2026-08-06T18:52:38.986332Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:52:38.972714Z","title":"Detecting and preventing hallucinations in large vision language models,","venue":null,"work_id":"0655b186-ffb6-40e9-b983-14560d943484","year":2024},"citing_paper":{"arxiv_id":"2507.07106","last_updated":"2025-07-09T17:59:47Z","snapshot_observed_at":"2026-08-10T20:06:39.029785Z","submitted_at":"2025-07-09T17:59:47Z","title":"Towards Multimodal Understanding via Stable Diffusion as a Task-Aware Feature Extractor","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T18:52:34.723073Z"},"links":{"citing_paper":"/paper/2507.07106"},"observation_digest":"sha256:cd4a2b6ea17e82c2110afa3aff1b60781093fe598a9810d20fe679cb8a255d15","observation_id":"5f489965-c74f-4fb8-aa60-306084b23fae","resolution":{"observed_at":"2026-08-06T18:52:38.976233Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.05232","last_updated":"2024-11-19T12:42:45Z","snapshot_observed_at":"2026-07-06T16:45:07.733095Z","submitted_at":"2023-11-09T09:25:37Z","title":"A Survey on Hallucination in Large Language Models: Principles, Taxonomy, Challenges, and Open Questions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.05232","snapshot_observed_at":"2026-08-06T18:52:34.830166Z","title":"A survey on hallucination in large language models: Principles, taxonomy, challenges, and open questions,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.07106","last_updated":"2025-07-09T17:59:47Z","snapshot_observed_at":"2026-08-10T20:06:39.029785Z","submitted_at":"2025-07-09T17:59:47Z","title":"Towards Multimodal Understanding via Stable Diffusion as a Task-Aware Feature Extractor","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T18:52:34.830166Z"},"links":{"cited_paper":"/paper/2311.05232","citing_paper":"/paper/2507.07106"},"observation_digest":"sha256:0a1aa248b32ad60688e3596a7aa9b0390088185ba9d52b05a2623d3a31d8ab75","observation_id":"5b55157d-f698-4213-833c-1e1eefac95f1","resolution":{"observed_at":"2026-08-06T18:52:34.830166Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01779","last_updated":"2024-03-28T22:27:12Z","snapshot_observed_at":"2026-08-16T14:55:36.979384Z","submitted_at":"2023-10-03T04:01:27Z","title":"HallE-Control: Controlling Object Hallucination in Large Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01779","snapshot_observed_at":"2026-08-06T18:52:34.896934Z","title":"Halle-switch: Rethinking and controlling object existence hallucinations in large vision language models for detailed caption,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.07106","last_updated":"2025-07-09T17:59:47Z","snapshot_observed_at":"2026-08-10T20:06:39.029785Z","submitted_at":"2025-07-09T17:59:47Z","title":"Towards Multimodal Understanding via Stable Diffusion as a Task-Aware Feature Extractor","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T18:52:34.896934Z"},"links":{"cited_paper":"/paper/2310.01779","citing_paper":"/paper/2507.07106"},"observation_digest":"sha256:e8843efa54ae753204cea6d1fe5d46ae433ee5b4e12fb329ae57a4a502f97144","observation_id":"36fe1c95-1620-4561-a3cd-5e6037917e1a","resolution":{"observed_at":"2026-08-06T18:52:34.896934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.14525","last_updated":"2023-09-25T20:59:33Z","snapshot_observed_at":"2026-08-15T23:42:34.277075Z","submitted_at":"2023-09-25T20:59:33Z","title":"Aligning Large Multimodal Models with Factually Augmented RLHF","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.14525","snapshot_observed_at":"2026-08-06T18:52:34.983806Z","title":"Aligning large multimodal models with factually augmented rlhf,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.07106","last_updated":"2025-07-09T17:59:47Z","snapshot_observed_at":"2026-08-10T20:06:39.029785Z","submitted_at":"2025-07-09T17:59:47Z","title":"Towards Multimodal Understanding via Stable Diffusion as a Task-Aware Feature Extractor","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T18:52:34.983806Z"},"links":{"cited_paper":"/paper/2309.14525","citing_paper":"/paper/2507.07106"},"observation_digest":"sha256:b96e5ab1f353d3250881b84f01cbd91907d3d74a6edd376d5ec16922dc18d148","observation_id":"f9bcfcae-e0d3-4335-bc9a-5553952852ae","resolution":{"observed_at":"2026-08-06T18:52:34.983806Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-08-14T00:50:08.075021Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.12390","snapshot_observed_at":"2026-08-06T18:52:35.095890Z","title":"Blink: Multimodal large language models can see but not perceive,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.07106","last_updated":"2025-07-09T17:59:47Z","snapshot_observed_at":"2026-08-10T20:06:39.029785Z","submitted_at":"2025-07-09T17:59:47Z","title":"Towards Multimodal Understanding via Stable Diffusion as a Task-Aware Feature Extractor","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T18:52:35.095890Z"},"links":{"cited_paper":"/paper/2404.12390","citing_paper":"/paper/2507.07106"},"observation_digest":"sha256:aa321d80a803faf0797d15b78ea6000ae4c1df0afa09189e0dedad1ca52db793","observation_id":"ab5b5abd-9b09-4f0f-bccc-629838e11b29","resolution":{"observed_at":"2026-08-06T18:52:35.095890Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:52:35.206253Z","title":"Llava-next: Improved reasoning, ocr, and world knowledge,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.07106","last_updated":"2025-07-09T17:59:47Z","snapshot_observed_at":"2026-08-10T20:06:39.029785Z","submitted_at":"2025-07-09T17:59:47Z","title":"Towards Multimodal Understanding via Stable Diffusion as a Task-Aware Feature Extractor","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T18:52:35.206253Z"},"links":{"citing_paper":"/paper/2507.07106"},"observation_digest":"sha256:989663edaf3434c5c166652f3d7d84fd1be086df602b9377952ac1b0be30ff01","observation_id":"201ad2db-d2af-4eb2-b99f-c19dc5e6cf4f","resolution":{"observed_at":"2026-08-06T18:52:35.206253Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09611","last_updated":"2024-04-18T18:51:04Z","snapshot_observed_at":"2026-08-16T18:14:04.403890Z","submitted_at":"2024-03-14T17:51:32Z","title":"MM1: Methods, Analysis & Insights from Multimodal LLM Pre-training","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.09611","snapshot_observed_at":"2026-08-06T18:52:35.255074Z","title":"Mm1: Methods, analysis & insights from multimodal llm pre-training,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.07106","last_updated":"2025-07-09T17:59:47Z","snapshot_observed_at":"2026-08-10T20:06:39.029785Z","submitted_at":"2025-07-09T17:59:47Z","title":"Towards Multimodal Understanding via Stable Diffusion as a Task-Aware Feature Extractor","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T18:52:35.255074Z"},"links":{"cited_paper":"/paper/2403.09611","citing_paper":"/paper/2507.07106"},"observation_digest":"sha256:612426451c1247ec0f28adcfb9884c430a755089f95898b458d24bbf0df210c6","observation_id":"26b9cebe-850f-4bff-b75f-82e4460c81a5","resolution":{"observed_at":"2026-08-06T18:52:35.255074Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:52:35.415756Z","title":"Improved baselines with visual instruction tuning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.07106","last_updated":"2025-07-09T17:59:47Z","snapshot_observed_at":"2026-08-10T20:06:39.029785Z","submitted_at":"2025-07-09T17:59:47Z","title":"Towards Multimodal Understanding via Stable Diffusion as a Task-Aware Feature Extractor","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T18:52:35.415756Z"},"links":{"citing_paper":"/paper/2507.07106"},"observation_digest":"sha256:2d249803800480b81d81cd804e0a985013b9bf6bdfccde35cd6ddc27de2eea58","observation_id":"1a775c40-908f-4be4-97fc-d183c552ff0e","resolution":{"observed_at":"2026-08-06T18:52:35.415756Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:52:38.948392Z","title":"4m: Massively multimodal masked modeling,","venue":null,"work_id":"cf39b15c-fac8-47c7-af94-117a3c81c574","year":2024},"citing_paper":{"arxiv_id":"2507.07106","last_updated":"2025-07-09T17:59:47Z","snapshot_observed_at":"2026-08-10T20:06:39.029785Z","submitted_at":"2025-07-09T17:59:47Z","title":"Towards Multimodal Understanding via Stable Diffusion as a Task-Aware Feature Extractor","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T18:52:35.541595Z"},"links":{"citing_paper":"/paper/2507.07106"},"observation_digest":"sha256:00555eb66955c6c3a59a923941d13f1815fbc82597c5cfbec917539fb3241d4f","observation_id":"4aa7ebc1-2d2f-4923-9cc2-1c696551b0bf","resolution":{"observed_at":"2026-08-06T18:52:38.952048Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09406","last_updated":"2024-06-14T14:43:26Z","snapshot_observed_at":"2026-08-16T13:43:13.417685Z","submitted_at":"2024-06-13T17:59:42Z","title":"4M-21: An Any-to-Any Vision Model for Tens of Tasks and Modalities","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09406","snapshot_observed_at":"2026-08-06T18:52:35.658391Z","title":"4m-21: An any-to-any vision model for tens of tasks and modalities,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.07106","last_updated":"2025-07-09T17:59:47Z","snapshot_observed_at":"2026-08-10T20:06:39.029785Z","submitted_at":"2025-07-09T17:59:47Z","title":"Towards Multimodal Understanding via Stable Diffusion as a Task-Aware Feature Extractor","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T18:52:35.658391Z"},"links":{"cited_paper":"/paper/2406.09406","citing_paper":"/paper/2507.07106"},"observation_digest":"sha256:becc6fdefcc17217b9831ee8a101ca144aa366f35d9af72700e713e10b41af74","observation_id":"e08a5649-69ea-45a7-8806-6160ae111cfd","resolution":{"observed_at":"2026-08-06T18:52:35.658391Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:52:38.938161Z","title":"Llava-plus: Learning to use tools for creating multimodal agents,","venue":null,"work_id":"84bd0605-1c6b-4e56-bc5f-4b8bcb57da9e","year":2023},"citing_paper":{"arxiv_id":"2507.07106","last_updated":"2025-07-09T17:59:47Z","snapshot_observed_at":"2026-08-10T20:06:39.029785Z","submitted_at":"2025-07-09T17:59:47Z","title":"Towards Multimodal Understanding via Stable Diffusion as a Task-Aware Feature Extractor","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T18:52:35.742782Z"},"links":{"citing_paper":"/paper/2507.07106"},"observation_digest":"sha256:fbbff83f075db2a8e677bfa355e578168510154c036f13f97df52239efac425a","observation_id":"958be85f-58a5-495e-b952-93836b10ad0a","resolution":{"observed_at":"2026-08-06T18:52:38.941704Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:52:38.928290Z","title":"Visual programming: Compositional visual reasoning without training,","venue":null,"work_id":"585b9a4d-ed8c-495f-aa99-4b3d0843ee1b","year":2023},"citing_paper":{"arxiv_id":"2507.07106","last_updated":"2025-07-09T17:59:47Z","snapshot_observed_at":"2026-08-10T20:06:39.029785Z","submitted_at":"2025-07-09T17:59:47Z","title":"Towards Multimodal Understanding via Stable Diffusion as a Task-Aware Feature Extractor","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T18:52:35.829893Z"},"links":{"citing_paper":"/paper/2507.07106"},"observation_digest":"sha256:1a8cfc035466cce0b67b4788e254803035b3ec35b8ceb1ea2b5e4b719c03061f","observation_id":"524a1413-4b8c-4d16-94c5-8e3364a96190","resolution":{"observed_at":"2026-08-06T18:52:38.931881Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:52:38.917811Z","title":"Spatialbot: Precise spatial understanding with vision language models,","venue":null,"work_id":"351cb5e7-1011-4853-b4b1-883991fbaa48","year":2024},"citing_paper":{"arxiv_id":"2507.07106","last_updated":"2025-07-09T17:59:47Z","snapshot_observed_at":"2026-08-10T20:06:39.029785Z","submitted_at":"2025-07-09T17:59:47Z","title":"Towards Multimodal Understanding via Stable Diffusion as a Task-Aware Feature Extractor","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T18:52:35.917707Z"},"links":{"citing_paper":"/paper/2507.07106"},"observation_digest":"sha256:3b7be19da82dc52d10d503083d42728a9a315331d1358d7aa83b30435f156343","observation_id":"cd605569-c973-412d-a5ba-9693f9cea517","resolution":{"observed_at":"2026-08-06T18:52:38.921200Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:52:38.907906Z","title":"Your diffusion model is secretly a zero- shot classifier,","venue":null,"work_id":"c4671d48-694d-49e1-a01d-43e581178c07","year":2023},"citing_paper":{"arxiv_id":"2507.07106","last_updated":"2025-07-09T17:59:47Z","snapshot_observed_at":"2026-08-10T20:06:39.029785Z","submitted_at":"2025-07-09T17:59:47Z","title":"Towards Multimodal Understanding via Stable Diffusion as a Task-Aware Feature Extractor","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T18:52:35.983026Z"},"links":{"citing_paper":"/paper/2507.07106"},"observation_digest":"sha256:dcfad336d082ea2fa39d76deb224cb16103cfea14982c7d69fd5436e6bf17121","observation_id":"adba8552-2fb7-450e-9f5f-74e68331758f","resolution":{"observed_at":"2026-08-06T18:52:38.911539Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.08702","last_updated":"2023-07-17T17:59:40Z","snapshot_observed_at":"2026-08-16T15:15:35.902342Z","submitted_at":"2023-07-17T17:59:40Z","title":"Diffusion Models Beat GANs on Image Classification","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.08702","snapshot_observed_at":"2026-08-06T18:52:36.050247Z","title":"Diffusion models beat gans on image classification,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.07106","last_updated":"2025-07-09T17:59:47Z","snapshot_observed_at":"2026-08-10T20:06:39.029785Z","submitted_at":"2025-07-09T17:59:47Z","title":"Towards Multimodal Understanding via Stable Diffusion as a Task-Aware Feature Extractor","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T18:52:36.050247Z"},"links":{"cited_paper":"/paper/2307.08702","citing_paper":"/paper/2507.07106"},"observation_digest":"sha256:471d43ceaf769238ebaf72e89560ba3931c2d1acfe5399b17a7a1bb8fc44ff4a","observation_id":"6958a577-10b3-40c1-bfe4-a581be05c5bb","resolution":{"observed_at":"2026-08-06T18:52:36.050247Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.04803","last_updated":"2023-04-05T17:40:38Z","snapshot_observed_at":"2026-08-16T15:49:44.197642Z","submitted_at":"2023-03-08T18:58:26Z","title":"Open-Vocabulary Panoptic Segmentation with Text-to-Image Diffusion Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.04803","snapshot_observed_at":"2026-08-06T18:52:36.136857Z","title":"Open-V ocabulary Panoptic Segmentation with Text-to-Image Diffusion Models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.07106","last_updated":"2025-07-09T17:59:47Z","snapshot_observed_at":"2026-08-10T20:06:39.029785Z","submitted_at":"2025-07-09T17:59:47Z","title":"Towards Multimodal Understanding via Stable Diffusion as a Task-Aware Feature Extractor","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T18:52:36.136857Z"},"links":{"cited_paper":"/paper/2303.04803","citing_paper":"/paper/2507.07106"},"observation_digest":"sha256:73e3d17201bfc20a66a1785c310ac89f8d053dd04cfde5ebbbed7d6ab185cbff","observation_id":"396ca2fd-a5fa-4ad7-9dc9-4f33babf60e7","resolution":{"observed_at":"2026-08-06T18:52:36.136857Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.09316","last_updated":"2024-09-30T03:17:39Z","snapshot_observed_at":"2026-08-16T15:23:34.442171Z","submitted_at":"2023-06-15T17:51:28Z","title":"Diffusion Models for Open-Vocabulary Segmentation","version":2},"cited_work":{"arxiv_id":"2306.09316","doi":null,"metadata_source":"pith","pith_arxiv_id":"2306.09316","snapshot_observed_at":"2026-08-06T18:52:37.851206Z","title":"Diffusion Models for Open-Vocabulary Segmentation","venue":"cs.CV","work_id":"f31444fd-6bd3-42c8-971c-0081ae932bc6","year":2023},"citing_paper":{"arxiv_id":"2507.07106","last_updated":"2025-07-09T17:59:47Z","snapshot_observed_at":"2026-08-10T20:06:39.029785Z","submitted_at":"2025-07-09T17:59:47Z","title":"Towards Multimodal Understanding via Stable Diffusion as a Task-Aware Feature Extractor","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T18:52:36.201294Z"},"links":{"cited_paper":"/paper/2306.09316","citing_paper":"/paper/2507.07106"},"observation_digest":"sha256:ad4e7e35194e4c03134d0d188651f0a90058d82c9300f0f0402a09881ff12b1a","observation_id":"57b935b2-94bf-41df-af2b-48c18dd48d23","resolution":{"observed_at":"2026-08-06T18:52:37.892673Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:52:38.897317Z","title":"Not all diffusion model activations have been evaluated as discriminative features,","venue":null,"work_id":"0bb9e5ee-41c8-430f-b63f-0d2c2a8b09f5","year":2024},"citing_paper":{"arxiv_id":"2507.07106","last_updated":"2025-07-09T17:59:47Z","snapshot_observed_at":"2026-08-10T20:06:39.029785Z","submitted_at":"2025-07-09T17:59:47Z","title":"Towards Multimodal Understanding via Stable Diffusion as a Task-Aware Feature Extractor","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T18:52:36.301593Z"},"links":{"citing_paper":"/paper/2507.07106"},"observation_digest":"sha256:41bc0861dcfd93ae17e946c72069cb8610763e826bdac6c433b5e77ac00f6a6f","observation_id":"2801e47e-4379-472f-b257-71088ab13e4b","resolution":{"observed_at":"2026-08-06T18:52:38.901068Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:52:36.377242Z","title":"Dinov2: Learning robust visual features without supervision,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.07106","last_updated":"2025-07-09T17:59:47Z","snapshot_observed_at":"2026-08-10T20:06:39.029785Z","submitted_at":"2025-07-09T17:59:47Z","title":"Towards Multimodal Understanding via Stable Diffusion as a Task-Aware Feature Extractor","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T18:52:36.377242Z"},"links":{"citing_paper":"/paper/2507.07106"},"observation_digest":"sha256:0f57e72c38bbdf39074826208469a4a42274234a9fdced90039efc6cbed84cc9","observation_id":"7d74e8ff-50e6-4bf4-b698-08dacdd59fbb","resolution":{"observed_at":"2026-08-06T18:52:36.377242Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:52:38.880345Z","title":"Vicuna: An open-source chatbot impressing gpt-4 with 90%* chatgpt quality,","venue":null,"work_id":"caa70816-66eb-44ea-a92f-9122f86a5a19","year":2023},"citing_paper":{"arxiv_id":"2507.07106","last_updated":"2025-07-09T17:59:47Z","snapshot_observed_at":"2026-08-10T20:06:39.029785Z","submitted_at":"2025-07-09T17:59:47Z","title":"Towards Multimodal Understanding via Stable Diffusion as a Task-Aware Feature Extractor","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T18:52:36.434918Z"},"links":{"citing_paper":"/paper/2507.07106"},"observation_digest":"sha256:6794893c4d617c2431684ab07755e0c40f194af159d4430d474c88ec6358ed06","observation_id":"00a9423d-718c-4cc2-8596-7644d85d2322","resolution":{"observed_at":"2026-08-06T18:52:38.883626Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:52:38.870351Z","title":"Naturalbench: Evaluating vision-language models on natural adversarial samples,","venue":null,"work_id":"8f8572d8-5448-490a-adfa-94d0ec768c86","year":2024},"citing_paper":{"arxiv_id":"2507.07106","last_updated":"2025-07-09T17:59:47Z","snapshot_observed_at":"2026-08-10T20:06:39.029785Z","submitted_at":"2025-07-09T17:59:47Z","title":"Towards Multimodal Understanding via Stable Diffusion as a Task-Aware Feature Extractor","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T18:52:36.531122Z"},"links":{"citing_paper":"/paper/2507.07106"},"observation_digest":"sha256:3e2a806ea5ca8a123a3a7b302c27c953be78bd904fe09491a9c3ae493fbfac22","observation_id":"3ea49173-02b8-4e6d-9f24-224ee2b21304","resolution":{"observed_at":"2026-08-06T18:52:38.873717Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:52:38.860058Z","title":"Openclip,","venue":null,"work_id":"fd3347f2-3af8-4b72-b742-8344c5bbc0c5","year":2021},"citing_paper":{"arxiv_id":"2507.07106","last_updated":"2025-07-09T17:59:47Z","snapshot_observed_at":"2026-08-10T20:06:39.029785Z","submitted_at":"2025-07-09T17:59:47Z","title":"Towards Multimodal Understanding via Stable Diffusion as a Task-Aware Feature Extractor","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-06T18:52:36.592231Z"},"links":{"citing_paper":"/paper/2507.07106"},"observation_digest":"sha256:1982b3ec66e950b533121654c916ce247d23ab1a51fa47b2faede52e1df7b8f8","observation_id":"2f3f7607-0885-427b-932b-be059f4fe581","resolution":{"observed_at":"2026-08-06T18:52:38.863477Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:52:38.849831Z","title":"Sigmoid loss for language image pre-training,","venue":null,"work_id":"d6678f3c-87de-4b12-bbdc-1c7dc9c21312","year":2023},"citing_paper":{"arxiv_id":"2507.07106","last_updated":"2025-07-09T17:59:47Z","snapshot_observed_at":"2026-08-10T20:06:39.029785Z","submitted_at":"2025-07-09T17:59:47Z","title":"Towards Multimodal Understanding via Stable Diffusion as a Task-Aware Feature Extractor","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-06T18:52:36.661149Z"},"links":{"citing_paper":"/paper/2507.07106"},"observation_digest":"sha256:ebe1b080dec16c0565f3c41faa1438afa5a5be1119cd645240785733c8dcedff","observation_id":"6ffaac83-c65c-4172-b043-419a46750ca0","resolution":{"observed_at":"2026-08-06T18:52:38.853467Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:52:38.839862Z","title":"Data filtering networks,","venue":null,"work_id":"4c46ab39-5fd4-4f64-bf9c-e4e78255a5af","year":2023},"citing_paper":{"arxiv_id":"2507.07106","last_updated":"2025-07-09T17:59:47Z","snapshot_observed_at":"2026-08-10T20:06:39.029785Z","submitted_at":"2025-07-09T17:59:47Z","title":"Towards Multimodal Understanding via Stable Diffusion as a Task-Aware Feature Extractor","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-06T18:52:36.753898Z"},"links":{"citing_paper":"/paper/2507.07106"},"observation_digest":"sha256:fd4288345ac8d04dc422e893e027e3d876734e10ab8e1be0ee8837d890457cca","observation_id":"7e2d64dd-5c70-499f-b96d-4a57f5104283","resolution":{"observed_at":"2026-08-06T18:52:38.843141Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:52:38.830780Z","title":"Demystifying clip data,","venue":null,"work_id":"1de764f2-0c2c-4453-b238-14842303e23f","year":2024},"citing_paper":{"arxiv_id":"2507.07106","last_updated":"2025-07-09T17:59:47Z","snapshot_observed_at":"2026-08-10T20:06:39.029785Z","submitted_at":"2025-07-09T17:59:47Z","title":"Towards Multimodal Understanding via Stable Diffusion as a Task-Aware Feature Extractor","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-06T18:52:36.822538Z"},"links":{"citing_paper":"/paper/2507.07106"},"observation_digest":"sha256:fa87c022d4968ee9ea5f34397ec883e425bed7bfe567fddf42395e96c21a5098","observation_id":"298bcc47-91a2-48c3-a73b-f196b9054cd7","resolution":{"observed_at":"2026-08-06T18:52:38.833840Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:52:36.885560Z","title":"Eva-clip: Improved training techniques for clip at scale,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.07106","last_updated":"2025-07-09T17:59:47Z","snapshot_observed_at":"2026-08-10T20:06:39.029785Z","submitted_at":"2025-07-09T17:59:47Z","title":"Towards Multimodal Understanding via Stable Diffusion as a Task-Aware Feature Extractor","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-06T18:52:36.885560Z"},"links":{"citing_paper":"/paper/2507.07106"},"observation_digest":"sha256:a7afe21475d7fc7a9657340d9c1508af8b2f0c3ce311e67bd65c4e923c550d54","observation_id":"f2e55f68-91ff-47ae-b704-e53d070df640","resolution":{"observed_at":"2026-08-06T18:52:36.885560Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1504.00325","last_updated":"2015-04-03T20:21:16Z","snapshot_observed_at":"2026-08-16T01:18:27.067382Z","submitted_at":"2015-04-01T18:13:43Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1504.00325","snapshot_observed_at":"2026-08-06T18:52:36.954496Z","title":"Microsoft COCO captions: Data collection and evaluation server,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2507.07106","last_updated":"2025-07-09T17:59:47Z","snapshot_observed_at":"2026-08-10T20:06:39.029785Z","submitted_at":"2025-07-09T17:59:47Z","title":"Towards Multimodal Understanding via Stable Diffusion as a Task-Aware Feature Extractor","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-06T18:52:36.954496Z"},"links":{"cited_paper":"/paper/1504.00325","citing_paper":"/paper/2507.07106"},"observation_digest":"sha256:08dc2ab5b8a4be23f7e7b8f71c2899becb4784c20c2e8018934f2c2cae611fdc","observation_id":"e10e12ee-90e0-4599-8d23-15f3ac9f1acf","resolution":{"observed_at":"2026-08-06T18:52:36.954496Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:52:38.813429Z","title":"Accurate computation of the log-sum-exp and softmax functions,","venue":null,"work_id":"9be1fc6c-7640-4842-be7f-fb947a62ad0e","year":2019},"citing_paper":{"arxiv_id":"2507.07106","last_updated":"2025-07-09T17:59:47Z","snapshot_observed_at":"2026-08-10T20:06:39.029785Z","submitted_at":"2025-07-09T17:59:47Z","title":"Towards Multimodal Understanding via Stable Diffusion as a Task-Aware Feature Extractor","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-06T18:52:37.033529Z"},"links":{"citing_paper":"/paper/2507.07106"},"observation_digest":"sha256:517326498e7ae97fe51b8af25c61aa75761c985dac7714a781861ba497b21900","observation_id":"7d47a46a-4416-4d94-b899-9dc929b9eccc","resolution":{"observed_at":"2026-08-06T18:52:38.817386Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:52:38.803002Z","title":"Winoground: Probing vision and language models for visio-linguistic compositionality,","venue":null,"work_id":"c41c8708-0137-429b-9098-854de9e8db05","year":2022},"citing_paper":{"arxiv_id":"2507.07106","last_updated":"2025-07-09T17:59:47Z","snapshot_observed_at":"2026-08-10T20:06:39.029785Z","submitted_at":"2025-07-09T17:59:47Z","title":"Towards Multimodal Understanding via Stable Diffusion as a Task-Aware Feature Extractor","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-06T18:52:37.111149Z"},"links":{"citing_paper":"/paper/2507.07106"},"observation_digest":"sha256:59f0f237a2c05a6afdece2ad1128dbe5408d93dbec44ee9dce9bebc7b9fde437","observation_id":"f2f69d76-9387-498b-b3cd-f189c898635f","resolution":{"observed_at":"2026-08-06T18:52:38.806943Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:52:38.791337Z","title":"Similarity of neural network representations revisited,","venue":null,"work_id":"64eb0eb7-4d6c-4c2f-808a-a23c5e37172d","year":2019},"citing_paper":{"arxiv_id":"2507.07106","last_updated":"2025-07-09T17:59:47Z","snapshot_observed_at":"2026-08-10T20:06:39.029785Z","submitted_at":"2025-07-09T17:59:47Z","title":"Towards Multimodal Understanding via Stable Diffusion as a Task-Aware Feature Extractor","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-06T18:52:37.189998Z"},"links":{"citing_paper":"/paper/2507.07106"},"observation_digest":"sha256:c8607b18a40ba36e43f9611bc0deeb7ffb1de52b0efc3d83ff5bb29b6bf77300","observation_id":"e1eba4e4-6e52-40d7-b4ef-7a107f9ca734","resolution":{"observed_at":"2026-08-06T18:52:38.796071Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:52:37.250094Z","title":"Cider: Consensus-based image description evaluation,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2507.07106","last_updated":"2025-07-09T17:59:47Z","snapshot_observed_at":"2026-08-10T20:06:39.029785Z","submitted_at":"2025-07-09T17:59:47Z","title":"Towards Multimodal Understanding via Stable Diffusion as a Task-Aware Feature Extractor","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-06T18:52:37.250094Z"},"links":{"citing_paper":"/paper/2507.07106"},"observation_digest":"sha256:43ebe84644dc9b2b633456c7f0d3079d457449185509e5c3293d086fdee933ba","observation_id":"a693805c-afd9-4fbe-825d-cd9103233a47","resolution":{"observed_at":"2026-08-06T18:52:37.250094Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:52:38.627274Z","title":"Spice: Semantic propositional image caption evaluation,","venue":null,"work_id":"6b6941e9-5992-428f-ac5c-d4d5d4b7a41b","year":2016},"citing_paper":{"arxiv_id":"2507.07106","last_updated":"2025-07-09T17:59:47Z","snapshot_observed_at":"2026-08-10T20:06:39.029785Z","submitted_at":"2025-07-09T17:59:47Z","title":"Towards Multimodal Understanding via Stable Diffusion as a Task-Aware Feature Extractor","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-06T18:52:37.333853Z"},"links":{"citing_paper":"/paper/2507.07106"},"observation_digest":"sha256:0ee295da5e551ab6e60e64b56c4cb7f60cda6987b34a980d53afc8409e48a709","observation_id":"9c03cdc7-06dd-4d99-8b0c-27ce0bf0c6ab","resolution":{"observed_at":"2026-08-06T18:52:38.741941Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"6740.0020","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:52:37.691072Z","title":"Decoupled weight decay regularization,","venue":null,"work_id":"7d5847f3-688d-4cf4-89f4-804ba06849b4","year":2019},"citing_paper":{"arxiv_id":"2507.07106","last_updated":"2025-07-09T17:59:47Z","snapshot_observed_at":"2026-08-10T20:06:39.029785Z","submitted_at":"2025-07-09T17:59:47Z","title":"Towards Multimodal Understanding via Stable Diffusion as a Task-Aware Feature Extractor","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-06T18:52:37.421346Z"},"links":{"citing_paper":"/paper/2507.07106"},"observation_digest":"sha256:f3f4f590ce9a210233883bd0732cfc8e5f430d3cfe71b39dbb9eb4b2a3969bca","observation_id":"95b8348a-10c1-416b-a666-9ee0fe2a9ff0","resolution":{"observed_at":"2026-08-06T18:52:37.725447Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:52:38.347335Z","title":"Frisbees","venue":null,"work_id":"75b81217-2f88-45b0-9522-cf6445b97860","year":null},"citing_paper":{"arxiv_id":"2507.07106","last_updated":"2025-07-09T17:59:47Z","snapshot_observed_at":"2026-08-10T20:06:39.029785Z","submitted_at":"2025-07-09T17:59:47Z","title":"Towards Multimodal Understanding via Stable Diffusion as a Task-Aware Feature Extractor","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-06T18:52:37.501612Z"},"links":{"citing_paper":"/paper/2507.07106"},"observation_digest":"sha256:f9970f224a242164e5d1f33ac071b873a209d13e7366960ed7fbc0873917d801","observation_id":"fdb9678a-2a92-4434-9134-38e0b3a60d74","resolution":{"observed_at":"2026-08-06T18:52:38.503754Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.07106","last_updated":"2025-07-09T17:59:47Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-10T20:06:39.029785Z","submitted_at":"2025-07-09T17:59:47Z","title":"Towards Multimodal Understanding via Stable Diffusion as a Task-Aware Feature Extractor"},"reference_resolution":{"displayed":70,"state_counts":{"malformed_identifier":2,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":29,"verified_exact":2,"verified_fuzzy":37},"total_outbound_references":70},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 70 of 70 outbound references and 1 inbound Pith citation observation for arXiv:2507.07106."}