{"as_of":"2026-08-09T20:15:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:1660cc899a1800f0f1a96ea4263950621c14fdb7b2d8174459f8788b47a8fb2d","coverage":[{"denominator":45,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":45,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T15:02:08.473719Z","state":"measured"},{"denominator":45,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":45,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.17080/citation-record","integrity":"/paper/2507.17080/integrity","json":"/paper/2507.17080/citation-record.json","paper":"/paper/2507.17080"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:02:08.355576Z","title":"Henning, Karun Singh, Omkar Parkhi, and Fedor Borisyuk","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.17080","last_updated":"2025-07-22T23:45:43Z","snapshot_observed_at":"2026-08-06T14:54:51.848171Z","submitted_at":"2025-07-22T23:45:43Z","title":"VL-CLIP: Enhancing Multimodal Recommendations via Visual Grounding and LLM-Augmented CLIP Embeddings","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T15:02:08.355576Z"},"links":{"citing_paper":"/paper/2507.17080"},"observation_digest":"sha256:78c62b855032d9c0e37b7d4c264fa67b8750c3c857d26fefea1c88e5f135af79","observation_id":"2e587879-ef23-4ec9-8f4a-c8eb9b7fd05e","resolution":{"observed_at":"2026-08-06T15:02:08.355576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:02:08.359638Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.17080","last_updated":"2025-07-22T23:45:43Z","snapshot_observed_at":"2026-08-06T14:54:51.848171Z","submitted_at":"2025-07-22T23:45:43Z","title":"VL-CLIP: Enhancing Multimodal Recommendations via Visual Grounding and LLM-Augmented CLIP Embeddings","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T15:02:08.359638Z"},"links":{"citing_paper":"/paper/2507.17080"},"observation_digest":"sha256:d87c8ddf1cb4e7cf1b8459e2fa049671d9331422cd1c181cf3d82319f9f1a137","observation_id":"844a9230-2331-4399-9665-0d3e25fdbdbc","resolution":{"observed_at":"2026-08-06T15:02:08.359638Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:02:09.267895Z","title":null,"venue":null,"work_id":"e2f7e9dc-f006-482d-9b4a-400953168604","year":2020},"citing_paper":{"arxiv_id":"2507.17080","last_updated":"2025-07-22T23:45:43Z","snapshot_observed_at":"2026-08-06T14:54:51.848171Z","submitted_at":"2025-07-22T23:45:43Z","title":"VL-CLIP: Enhancing Multimodal Recommendations via Visual Grounding and LLM-Augmented CLIP Embeddings","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T15:02:08.362782Z"},"links":{"citing_paper":"/paper/2507.17080"},"observation_digest":"sha256:c473feac6f5706e873f38a26edb485c272be07eff9d9661bce6ddedeaeb7e54f","observation_id":"b64296a2-9663-44ac-b72f-94da67100eeb","resolution":{"observed_at":"2026-08-06T15:02:09.270659Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:02:08.365468Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.17080","last_updated":"2025-07-22T23:45:43Z","snapshot_observed_at":"2026-08-06T14:54:51.848171Z","submitted_at":"2025-07-22T23:45:43Z","title":"VL-CLIP: Enhancing Multimodal Recommendations via Visual Grounding and LLM-Augmented CLIP Embeddings","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T15:02:08.365468Z"},"links":{"citing_paper":"/paper/2507.17080"},"observation_digest":"sha256:17ffb7e0b1eac6de9f03221afc15d23663dee84f94b81564631a959f0e01c9c5","observation_id":"765a8da2-d7fe-4482-8385-60761a367c32","resolution":{"observed_at":"2026-08-06T15:02:08.365468Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1038/s41598-022-23052-9","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:02:08.530462Z","title":null,"venue":null,"work_id":"af56fa07-dcb9-4b40-8ea6-8ef73107a232","year":2022},"citing_paper":{"arxiv_id":"2507.17080","last_updated":"2025-07-22T23:45:43Z","snapshot_observed_at":"2026-08-06T14:54:51.848171Z","submitted_at":"2025-07-22T23:45:43Z","title":"VL-CLIP: Enhancing Multimodal Recommendations via Visual Grounding and LLM-Augmented CLIP Embeddings","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T15:02:08.370948Z"},"links":{"citing_paper":"/paper/2507.17080"},"observation_digest":"sha256:fda65ff42d398ecbbf0ee075dfbaf28cf8a2c3bfab43a93c6e1cc78f64467b21","observation_id":"1ee02fa7-f74e-4583-9dc4-81bf246a1003","resolution":{"observed_at":"2026-08-06T15:02:08.533236Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[{"edge_observation":{"observed_at":"2026-08-06T18:20:19.888698+00:00","source":"paper_reference_links","state":"open"},"event_date":"2023-01-23","event_type":"correction","notice_doi":"10.1038/s41598-022-26364-y","provenance":{"observed_at":"2026-07-11T02:56:50.008426+00:00","source":"crossref","source_record_id":"10.1038/s41598-022-26364-y->10.1038/s41598-022-23052-9:correction"}}],"reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:02:09.255178Z","title":null,"venue":null,"work_id":"6662049e-d321-4935-af45-4a06e1f7656c","year":2025},"citing_paper":{"arxiv_id":"2507.17080","last_updated":"2025-07-22T23:45:43Z","snapshot_observed_at":"2026-08-06T14:54:51.848171Z","submitted_at":"2025-07-22T23:45:43Z","title":"VL-CLIP: Enhancing Multimodal Recommendations via Visual Grounding and LLM-Augmented CLIP Embeddings","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T15:02:08.373920Z"},"links":{"citing_paper":"/paper/2507.17080"},"observation_digest":"sha256:e2bed1dccad58504e1c747ab56863df2477443726142e021dc0fde2c067514a3","observation_id":"341e46de-466d-49aa-9570-6f8171eb28c6","resolution":{"observed_at":"2026-08-06T15:02:09.257971Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:02:09.247338Z","title":null,"venue":null,"work_id":"5759821e-c853-4ef2-9c46-55b72e6df026","year":2023},"citing_paper":{"arxiv_id":"2507.17080","last_updated":"2025-07-22T23:45:43Z","snapshot_observed_at":"2026-08-06T14:54:51.848171Z","submitted_at":"2025-07-22T23:45:43Z","title":"VL-CLIP: Enhancing Multimodal Recommendations via Visual Grounding and LLM-Augmented CLIP Embeddings","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T15:02:08.376798Z"},"links":{"citing_paper":"/paper/2507.17080"},"observation_digest":"sha256:1f398173e23e4a250b26f7eb94a40d9c546b05dda465514268ad829a3cbb5cda","observation_id":"4175c460-0d17-4b84-8575-ef52509497aa","resolution":{"observed_at":"2026-08-06T15:02:09.250094Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:02:08.379262Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.17080","last_updated":"2025-07-22T23:45:43Z","snapshot_observed_at":"2026-08-06T14:54:51.848171Z","submitted_at":"2025-07-22T23:45:43Z","title":"VL-CLIP: Enhancing Multimodal Recommendations via Visual Grounding and LLM-Augmented CLIP Embeddings","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T15:02:08.379262Z"},"links":{"citing_paper":"/paper/2507.17080"},"observation_digest":"sha256:759b6a39f32ac659da4a798ac29ffd2559ce374a20f1c016c85f6e1376262743","observation_id":"4e72cf30-9b17-4545-9688-aa8411e055e6","resolution":{"observed_at":"2026-08-06T15:02:08.379262Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:02:08.382220Z","title":"Huang, O","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.17080","last_updated":"2025-07-22T23:45:43Z","snapshot_observed_at":"2026-08-06T14:54:51.848171Z","submitted_at":"2025-07-22T23:45:43Z","title":"VL-CLIP: Enhancing Multimodal Recommendations via Visual Grounding and LLM-Augmented CLIP Embeddings","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T15:02:08.382220Z"},"links":{"citing_paper":"/paper/2507.17080"},"observation_digest":"sha256:a62313bc5741a66e0529d7200a892a4bba6b343f01401ff20f99c4b7ec759385","observation_id":"cfb65044-be84-4fd5-b734-8c814278eb4f","resolution":{"observed_at":"2026-08-06T15:02:08.382220Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:02:09.239222Z","title":null,"venue":null,"work_id":"018f46c0-d111-4841-a147-d5568a67543e","year":2023},"citing_paper":{"arxiv_id":"2507.17080","last_updated":"2025-07-22T23:45:43Z","snapshot_observed_at":"2026-08-06T14:54:51.848171Z","submitted_at":"2025-07-22T23:45:43Z","title":"VL-CLIP: Enhancing Multimodal Recommendations via Visual Grounding and LLM-Augmented CLIP Embeddings","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T15:02:08.385017Z"},"links":{"citing_paper":"/paper/2507.17080"},"observation_digest":"sha256:448dda8dd5513b4bc1dcf549184dbb8a43879a174f0cb5bc0afd9835d69b216a","observation_id":"1af7e53b-4716-4a9a-9792-d2c52d23a835","resolution":{"observed_at":"2026-08-06T15:02:09.242063Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2020.acl-main.469","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:02:08.517760Z","title":null,"venue":null,"work_id":"6afc90c7-faea-4871-81ef-c2d6b7f544d4","year":2020},"citing_paper":{"arxiv_id":"2507.17080","last_updated":"2025-07-22T23:45:43Z","snapshot_observed_at":"2026-08-06T14:54:51.848171Z","submitted_at":"2025-07-22T23:45:43Z","title":"VL-CLIP: Enhancing Multimodal Recommendations via Visual Grounding and LLM-Augmented CLIP Embeddings","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T15:02:08.387425Z"},"links":{"citing_paper":"/paper/2507.17080"},"observation_digest":"sha256:473167b340fe74af7b8c669269b59c0987ba5b0e210eea7b0bd7c16f79a6e3f5","observation_id":"d9f035e0-1131-4977-b355-036e288f4267","resolution":{"observed_at":"2026-08-06T15:02:08.520558Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:02:08.390026Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.17080","last_updated":"2025-07-22T23:45:43Z","snapshot_observed_at":"2026-08-06T14:54:51.848171Z","submitted_at":"2025-07-22T23:45:43Z","title":"VL-CLIP: Enhancing Multimodal Recommendations via Visual Grounding and LLM-Augmented CLIP Embeddings","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T15:02:08.390026Z"},"links":{"citing_paper":"/paper/2507.17080"},"observation_digest":"sha256:ca4a3d9a0ec11a71d9af89f1ea7c0a5501a06c6f794d93f3221cbbe0f716c90f","observation_id":"b4de798c-beb0-442a-9c44-1641e34bf37c","resolution":{"observed_at":"2026-08-06T15:02:08.390026Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:02:08.392478Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.17080","last_updated":"2025-07-22T23:45:43Z","snapshot_observed_at":"2026-08-06T14:54:51.848171Z","submitted_at":"2025-07-22T23:45:43Z","title":"VL-CLIP: Enhancing Multimodal Recommendations via Visual Grounding and LLM-Augmented CLIP Embeddings","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T15:02:08.392478Z"},"links":{"citing_paper":"/paper/2507.17080"},"observation_digest":"sha256:f6ec42fe8a9c0eb74fe9f18fe6b745601f20ce313d6914c32aecee296fa0598f","observation_id":"70bd7a1a-276a-4ecb-8c2e-a43001c407c1","resolution":{"observed_at":"2026-08-06T15:02:08.392478Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:02:08.397586Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.17080","last_updated":"2025-07-22T23:45:43Z","snapshot_observed_at":"2026-08-06T14:54:51.848171Z","submitted_at":"2025-07-22T23:45:43Z","title":"VL-CLIP: Enhancing Multimodal Recommendations via Visual Grounding and LLM-Augmented CLIP Embeddings","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T15:02:08.397586Z"},"links":{"citing_paper":"/paper/2507.17080"},"observation_digest":"sha256:d586ec6c3e58b0f4dabf2b52d85b74ff572e4e74fe99d6e725db9c8c8a715e66","observation_id":"49576e56-9fbd-43d9-bbda-b0a145568ab5","resolution":{"observed_at":"2026-08-06T15:02:08.397586Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:02:08.399985Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.17080","last_updated":"2025-07-22T23:45:43Z","snapshot_observed_at":"2026-08-06T14:54:51.848171Z","submitted_at":"2025-07-22T23:45:43Z","title":"VL-CLIP: Enhancing Multimodal Recommendations via Visual Grounding and LLM-Augmented CLIP Embeddings","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T15:02:08.399985Z"},"links":{"citing_paper":"/paper/2507.17080"},"observation_digest":"sha256:f874ba7ea7484494d45d264f302961e25843024c7c1da0a43563577c30ada434","observation_id":"4fbaae12-5680-4736-944d-c35b78eba9a0","resolution":{"observed_at":"2026-08-06T15:02:08.399985Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:02:09.226041Z","title":null,"venue":null,"work_id":"857bee87-6ddb-404d-97b5-51a857696b23","year":2019},"citing_paper":{"arxiv_id":"2507.17080","last_updated":"2025-07-22T23:45:43Z","snapshot_observed_at":"2026-08-06T14:54:51.848171Z","submitted_at":"2025-07-22T23:45:43Z","title":"VL-CLIP: Enhancing Multimodal Recommendations via Visual Grounding and LLM-Augmented CLIP Embeddings","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T15:02:08.402508Z"},"links":{"citing_paper":"/paper/2507.17080"},"observation_digest":"sha256:0520c42fda0d1d1d81b1588bb1aeedb7aec6a1818d05468761e310c7b92ac92a","observation_id":"82a568d5-e24d-470e-b562-a08f7a9e6716","resolution":{"observed_at":"2026-08-06T15:02:09.228856Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.12228","last_updated":"2025-02-16T09:41:32Z","snapshot_observed_at":"2026-08-07T23:46:27.609660Z","submitted_at":"2024-10-16T04:44:15Z","title":"Triple Modality Fusion: Aligning Visual, Textual, and Graph Data with Large Language Models for Multi-Behavior Recommendations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.12228","snapshot_observed_at":"2026-08-06T15:02:08.404945Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.17080","last_updated":"2025-07-22T23:45:43Z","snapshot_observed_at":"2026-08-06T14:54:51.848171Z","submitted_at":"2025-07-22T23:45:43Z","title":"VL-CLIP: Enhancing Multimodal Recommendations via Visual Grounding and LLM-Augmented CLIP Embeddings","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T15:02:08.404945Z"},"links":{"cited_paper":"/paper/2410.12228","citing_paper":"/paper/2507.17080"},"observation_digest":"sha256:3375b9449a384177207d5da99e8f3aab07d35481b6207576d29cb762ffec53b1","observation_id":"8e825e7e-e9be-487c-92f5-f6d93eb75f15","resolution":{"observed_at":"2026-08-06T15:02:08.404945Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:02:08.407832Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.17080","last_updated":"2025-07-22T23:45:43Z","snapshot_observed_at":"2026-08-06T14:54:51.848171Z","submitted_at":"2025-07-22T23:45:43Z","title":"VL-CLIP: Enhancing Multimodal Recommendations via Visual Grounding and LLM-Augmented CLIP Embeddings","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T15:02:08.407832Z"},"links":{"citing_paper":"/paper/2507.17080"},"observation_digest":"sha256:237f418f9f4fe767b41aadfe7c42a3e9e1d1118977f6322d1ab35ce01cc53346","observation_id":"5a95845c-8c68-49ca-a391-8a7b8dd4a6de","resolution":{"observed_at":"2026-08-06T15:02:08.407832Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:02:09.217669Z","title":null,"venue":null,"work_id":"1eb0b3c4-268d-46ff-91b6-e20ab3ed45b0","year":2018},"citing_paper":{"arxiv_id":"2507.17080","last_updated":"2025-07-22T23:45:43Z","snapshot_observed_at":"2026-08-06T14:54:51.848171Z","submitted_at":"2025-07-22T23:45:43Z","title":"VL-CLIP: Enhancing Multimodal Recommendations via Visual Grounding and LLM-Augmented CLIP Embeddings","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T15:02:08.410338Z"},"links":{"citing_paper":"/paper/2507.17080"},"observation_digest":"sha256:7da37bab071969a2fa79c701e68a32ac9d3c0c77c0c35abb3f3a22444e677a47","observation_id":"7adb5744-9b3f-41e3-a39b-a56e4afdee7a","resolution":{"observed_at":"2026-08-06T15:02:09.220388Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.2196/52865","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:02:08.498999Z","title":null,"venue":null,"work_id":"fd0c1cbe-324c-4ed8-808f-99c39b50196f","year":2023},"citing_paper":{"arxiv_id":"2507.17080","last_updated":"2025-07-22T23:45:43Z","snapshot_observed_at":"2026-08-06T14:54:51.848171Z","submitted_at":"2025-07-22T23:45:43Z","title":"VL-CLIP: Enhancing Multimodal Recommendations via Visual Grounding and LLM-Augmented CLIP Embeddings","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T15:02:08.413385Z"},"links":{"citing_paper":"/paper/2507.17080"},"observation_digest":"sha256:54a092846af1c94f9837a1b989a0c311490bf4bbffc83560407944db6601b383","observation_id":"a2297b6e-6811-4110-abb9-1e3cbb392dbe","resolution":{"observed_at":"2026-08-06T15:02:08.503053Z","resolver_source":"doi_truncated","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.09734","last_updated":"2021-11-18T14:49:15Z","snapshot_observed_at":"2026-07-06T12:09:52.161425Z","submitted_at":"2021-11-18T14:49:15Z","title":"ClipCap: CLIP Prefix for Image Captioning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.09734","snapshot_observed_at":"2026-08-06T15:02:08.416252Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.17080","last_updated":"2025-07-22T23:45:43Z","snapshot_observed_at":"2026-08-06T14:54:51.848171Z","submitted_at":"2025-07-22T23:45:43Z","title":"VL-CLIP: Enhancing Multimodal Recommendations via Visual Grounding and LLM-Augmented CLIP Embeddings","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T15:02:08.416252Z"},"links":{"cited_paper":"/paper/2111.09734","citing_paper":"/paper/2507.17080"},"observation_digest":"sha256:12a94da8d2e95d704036c7cc7dac0d0fa5bda84ec3c19238b83ddedd6957813f","observation_id":"31ab0b8a-1df3-43a3-a031-d3671c0d56f2","resolution":{"observed_at":"2026-08-06T15:02:08.416252Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:02:09.209813Z","title":null,"venue":null,"work_id":"34704c0c-7802-40d5-9480-a839c7e12aeb","year":2020},"citing_paper":{"arxiv_id":"2507.17080","last_updated":"2025-07-22T23:45:43Z","snapshot_observed_at":"2026-08-06T14:54:51.848171Z","submitted_at":"2025-07-22T23:45:43Z","title":"VL-CLIP: Enhancing Multimodal Recommendations via Visual Grounding and LLM-Augmented CLIP Embeddings","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T15:02:08.418876Z"},"links":{"citing_paper":"/paper/2507.17080"},"observation_digest":"sha256:78ebe0639b2c440bb31841cd003c743a07b34f418ec89ec1aefb17b171c04d14","observation_id":"cd3a511c-8b4b-47d9-928a-3b31db4b6010","resolution":{"observed_at":"2026-08-06T15:02:09.212382Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:02:09.201663Z","title":null,"venue":null,"work_id":"c4c4153f-6754-4647-9b89-e8b90aed79f0","year":null},"citing_paper":{"arxiv_id":"2507.17080","last_updated":"2025-07-22T23:45:43Z","snapshot_observed_at":"2026-08-06T14:54:51.848171Z","submitted_at":"2025-07-22T23:45:43Z","title":"VL-CLIP: Enhancing Multimodal Recommendations via Visual Grounding and LLM-Augmented CLIP Embeddings","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T15:02:08.421246Z"},"links":{"citing_paper":"/paper/2507.17080"},"observation_digest":"sha256:51239a9f6bf09d58433b44cf527ed9a05cf28f3c271b17acb57bf3635a0607d9","observation_id":"8e350083-1d36-423e-8eb6-1849e69de9ba","resolution":{"observed_at":"2026-08-06T15:02:09.204366Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:02:09.185182Z","title":null,"venue":null,"work_id":"15016441-b90e-4249-9dc5-3fd95a709385","year":2022},"citing_paper":{"arxiv_id":"2507.17080","last_updated":"2025-07-22T23:45:43Z","snapshot_observed_at":"2026-08-06T14:54:51.848171Z","submitted_at":"2025-07-22T23:45:43Z","title":"VL-CLIP: Enhancing Multimodal Recommendations via Visual Grounding and LLM-Augmented CLIP Embeddings","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T15:02:08.426399Z"},"links":{"citing_paper":"/paper/2507.17080"},"observation_digest":"sha256:04a83e713ccd1bba5fc32168691fc2f86fe35489b91b110f1a525f54dc7082ab","observation_id":"ca3c161f-50b8-44e6-994b-182804d4f47f","resolution":{"observed_at":"2026-08-06T15:02:09.188234Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:02:08.428768Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.17080","last_updated":"2025-07-22T23:45:43Z","snapshot_observed_at":"2026-08-06T14:54:51.848171Z","submitted_at":"2025-07-22T23:45:43Z","title":"VL-CLIP: Enhancing Multimodal Recommendations via Visual Grounding and LLM-Augmented CLIP Embeddings","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T15:02:08.428768Z"},"links":{"citing_paper":"/paper/2507.17080"},"observation_digest":"sha256:fd423cc6b13e2db526ac02e98388ac35a821a96d94302a90cd74061471788fe2","observation_id":"5760ac08-3b64-4215-9748-1f32df6eacae","resolution":{"observed_at":"2026-08-06T15:02:08.428768Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:02:09.172584Z","title":null,"venue":null,"work_id":"6d15b4d7-9f1a-4e27-a0b9-b64480aafc94","year":null},"citing_paper":{"arxiv_id":"2507.17080","last_updated":"2025-07-22T23:45:43Z","snapshot_observed_at":"2026-08-06T14:54:51.848171Z","submitted_at":"2025-07-22T23:45:43Z","title":"VL-CLIP: Enhancing Multimodal Recommendations via Visual Grounding and LLM-Augmented CLIP Embeddings","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T15:02:08.434446Z"},"links":{"citing_paper":"/paper/2507.17080"},"observation_digest":"sha256:76e036c7b498a0aad3a96d305a11fc6750f00e2262b031e1e371f4c630af9ee0","observation_id":"ea5801f0-b793-425e-969d-ea6e774de381","resolution":{"observed_at":"2026-08-06T15:02:09.175328Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:02:08.439848Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.17080","last_updated":"2025-07-22T23:45:43Z","snapshot_observed_at":"2026-08-06T14:54:51.848171Z","submitted_at":"2025-07-22T23:45:43Z","title":"VL-CLIP: Enhancing Multimodal Recommendations via Visual Grounding and LLM-Augmented CLIP Embeddings","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T15:02:08.439848Z"},"links":{"citing_paper":"/paper/2507.17080"},"observation_digest":"sha256:91a83b4883ca5dc19707ec4822e55e92c67685a12a1277b7304a9b5fe74b17da","observation_id":"ba62af85-ecad-41aa-bcef-c6615d55a0c3","resolution":{"observed_at":"2026-08-06T15:02:08.439848Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:02:08.442379Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.17080","last_updated":"2025-07-22T23:45:43Z","snapshot_observed_at":"2026-08-06T14:54:51.848171Z","submitted_at":"2025-07-22T23:45:43Z","title":"VL-CLIP: Enhancing Multimodal Recommendations via Visual Grounding and LLM-Augmented CLIP Embeddings","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T15:02:08.442379Z"},"links":{"citing_paper":"/paper/2507.17080"},"observation_digest":"sha256:86a678762b228ed0f13f2b2a0fc06e1cde8917df0eb933dd48001ead6eed1d9c","observation_id":"e8d1cd1c-7c72-4d48-84e8-2597df66a409","resolution":{"observed_at":"2026-08-06T15:02:08.442379Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.02114","last_updated":"2021-11-03T10:16:39Z","snapshot_observed_at":"2026-08-02T08:12:49.547570Z","submitted_at":"2021-11-03T10:16:39Z","title":"LAION-400M: Open Dataset of CLIP-Filtered 400 Million Image-Text Pairs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.02114","snapshot_observed_at":"2026-08-06T15:02:08.431508Z","title":"arXiv preprint arXiv:2111.02114 (2021)","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.17080","last_updated":"2025-07-22T23:45:43Z","snapshot_observed_at":"2026-08-06T14:54:51.848171Z","submitted_at":"2025-07-22T23:45:43Z","title":"VL-CLIP: Enhancing Multimodal Recommendations via Visual Grounding and LLM-Augmented CLIP Embeddings","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T15:02:08.431508Z"},"links":{"cited_paper":"/paper/2111.02114","citing_paper":"/paper/2507.17080"},"observation_digest":"sha256:aef26bebbf37fde9fb1dd826cb89a020d4a962e6f8ee2bf4e3fccf469a1290e1","observation_id":"6b1aadf8-f6dd-4c60-8df0-cd4e244780d1","resolution":{"observed_at":"2026-08-06T15:02:08.431508Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:02:09.143122Z","title":null,"venue":null,"work_id":"3a1ce95d-0281-4827-afd6-9a98eeb07e7c","year":2010},"citing_paper":{"arxiv_id":"2507.17080","last_updated":"2025-07-22T23:45:43Z","snapshot_observed_at":"2026-08-06T14:54:51.848171Z","submitted_at":"2025-07-22T23:45:43Z","title":"VL-CLIP: Enhancing Multimodal Recommendations via Visual Grounding and LLM-Augmented CLIP Embeddings","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T15:02:08.447332Z"},"links":{"citing_paper":"/paper/2507.17080"},"observation_digest":"sha256:f3d011bffc7fde8fd87af4b108801c8c7a6fe49566f8d5bf6384f36b63f8c5db","observation_id":"9be1fbc0-3c67-4fb0-8c39-4cc115fd06f4","resolution":{"observed_at":"2026-08-06T15:02:09.146325Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:02:09.164430Z","title":"In International Conference on Learning Representations (ICLR)","venue":null,"work_id":"fa4484b7-f42c-4d1b-ac90-1e98d3c70c0b","year":null},"citing_paper":{"arxiv_id":"2507.17080","last_updated":"2025-07-22T23:45:43Z","snapshot_observed_at":"2026-08-06T14:54:51.848171Z","submitted_at":"2025-07-22T23:45:43Z","title":"VL-CLIP: Enhancing Multimodal Recommendations via Visual Grounding and LLM-Augmented CLIP Embeddings","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T15:02:08.437303Z"},"links":{"citing_paper":"/paper/2507.17080"},"observation_digest":"sha256:7c01265e2ea605303c40f51af6e9e9bc6b8859a4c5b8531f5585c2d5c32d3434","observation_id":"370b74f3-5ec6-4060-b0d2-3e56cbd5c5f5","resolution":{"observed_at":"2026-08-06T15:02:09.167393Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:02:09.117354Z","title":null,"venue":null,"work_id":"532e69f4-2b4b-428d-a288-4cc54ed82ddd","year":null},"citing_paper":{"arxiv_id":"2507.17080","last_updated":"2025-07-22T23:45:43Z","snapshot_observed_at":"2026-08-06T14:54:51.848171Z","submitted_at":"2025-07-22T23:45:43Z","title":"VL-CLIP: Enhancing Multimodal Recommendations via Visual Grounding and LLM-Augmented CLIP Embeddings","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T15:02:08.455153Z"},"links":{"citing_paper":"/paper/2507.17080"},"observation_digest":"sha256:4ad5f05049d0dd767b00bbd6a82f313ca182f7f7c5fbd67ad015caa4a4fda5bc","observation_id":"a4c89211-4d1f-4078-bad7-72f1e5f6ec08","resolution":{"observed_at":"2026-08-06T15:02:09.120199Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:02:08.460518Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.17080","last_updated":"2025-07-22T23:45:43Z","snapshot_observed_at":"2026-08-06T14:54:51.848171Z","submitted_at":"2025-07-22T23:45:43Z","title":"VL-CLIP: Enhancing Multimodal Recommendations via Visual Grounding and LLM-Augmented CLIP Embeddings","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T15:02:08.460518Z"},"links":{"citing_paper":"/paper/2507.17080"},"observation_digest":"sha256:ae22ff8d465621bf582758b6922203bb6afed052be07649de5da338058c3bfa4","observation_id":"41811caa-1aeb-4ed8-8b28-cb1af4b46947","resolution":{"observed_at":"2026-08-06T15:02:08.460518Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:02:09.151485Z","title":null,"venue":null,"work_id":"9f19d4ac-ae49-4ae2-be9d-914d6acd73b4","year":2022},"citing_paper":{"arxiv_id":"2507.17080","last_updated":"2025-07-22T23:45:43Z","snapshot_observed_at":"2026-08-06T14:54:51.848171Z","submitted_at":"2025-07-22T23:45:43Z","title":"VL-CLIP: Enhancing Multimodal Recommendations via Visual Grounding and LLM-Augmented CLIP Embeddings","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T15:02:08.444911Z"},"links":{"citing_paper":"/paper/2507.17080"},"observation_digest":"sha256:c83ddb7516d0e8d32668374e5e3fc89f0476b06946375edb75bbc1460c816a5a","observation_id":"2534c8d2-e230-4d2b-9205-58838d3efa83","resolution":{"observed_at":"2026-08-06T15:02:09.154214Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:02:09.134643Z","title":null,"venue":null,"work_id":"3993b442-27b4-4a22-9ae9-4ebfab1620df","year":null},"citing_paper":{"arxiv_id":"2507.17080","last_updated":"2025-07-22T23:45:43Z","snapshot_observed_at":"2026-08-06T14:54:51.848171Z","submitted_at":"2025-07-22T23:45:43Z","title":"VL-CLIP: Enhancing Multimodal Recommendations via Visual Grounding and LLM-Augmented CLIP Embeddings","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T15:02:08.449944Z"},"links":{"citing_paper":"/paper/2507.17080"},"observation_digest":"sha256:e40f2117678baf0c1dc01a67c10844a5d7b6d14c415e184663eb6d8de7445c73","observation_id":"7e2841af-aa2e-4edd-88fb-cbf5fe245d5d","resolution":{"observed_at":"2026-08-06T15:02:09.137817Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:02:09.109222Z","title":"dress”, “rug","venue":null,"work_id":"edd62109-df46-46e6-80a3-4f7a9ebe1dd4","year":2024},"citing_paper":{"arxiv_id":"2507.17080","last_updated":"2025-07-22T23:45:43Z","snapshot_observed_at":"2026-08-06T14:54:51.848171Z","submitted_at":"2025-07-22T23:45:43Z","title":"VL-CLIP: Enhancing Multimodal Recommendations via Visual Grounding and LLM-Augmented CLIP Embeddings","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T15:02:08.463065Z"},"links":{"citing_paper":"/paper/2507.17080"},"observation_digest":"sha256:f191da6f87009d14e7920011be1177d8f4d85a1ac78951a908a055b59673b985","observation_id":"54d10b83-08ad-4ff7-956d-39b7ff5e0e32","resolution":{"observed_at":"2026-08-06T15:02:09.111978Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:02:09.101106Z","title":"productName","venue":null,"work_id":"9388f779-b678-4035-93dc-5f0d2431aa90","year":2025},"citing_paper":{"arxiv_id":"2507.17080","last_updated":"2025-07-22T23:45:43Z","snapshot_observed_at":"2026-08-06T14:54:51.848171Z","submitted_at":"2025-07-22T23:45:43Z","title":"VL-CLIP: Enhancing Multimodal Recommendations via Visual Grounding and LLM-Augmented CLIP Embeddings","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T15:02:08.465918Z"},"links":{"citing_paper":"/paper/2507.17080"},"observation_digest":"sha256:d99c45e067be9e0001e68f30b1aabe3b6ece3eaec1d00da74aaed437752a0818","observation_id":"f20a7962-97a1-4ced-b2de-5bf712666180","resolution":{"observed_at":"2026-08-06T15:02:09.103924Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:02:09.093008Z","title":null,"venue":null,"work_id":"0ad282ab-141c-4fbb-9519-43bffac519e0","year":null},"citing_paper":{"arxiv_id":"2507.17080","last_updated":"2025-07-22T23:45:43Z","snapshot_observed_at":"2026-08-06T14:54:51.848171Z","submitted_at":"2025-07-22T23:45:43Z","title":"VL-CLIP: Enhancing Multimodal Recommendations via Visual Grounding and LLM-Augmented CLIP Embeddings","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T15:02:08.468567Z"},"links":{"citing_paper":"/paper/2507.17080"},"observation_digest":"sha256:e00c9cb69d3668ba091c17f4f4d8657728f22e196c0f8e415053d18db28c6413","observation_id":"64f47fb2-427a-4ace-ba29-acfca3407879","resolution":{"observed_at":"2026-08-06T15:02:09.095624Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:02:09.084473Z","title":null,"venue":null,"work_id":"9c65910c-c625-445f-a6dc-c42beabdab74","year":null},"citing_paper":{"arxiv_id":"2507.17080","last_updated":"2025-07-22T23:45:43Z","snapshot_observed_at":"2026-08-06T14:54:51.848171Z","submitted_at":"2025-07-22T23:45:43Z","title":"VL-CLIP: Enhancing Multimodal Recommendations via Visual Grounding and LLM-Augmented CLIP Embeddings","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T15:02:08.471120Z"},"links":{"citing_paper":"/paper/2507.17080"},"observation_digest":"sha256:70c000a50af7aa44d538a6ddd1fd053673e50ab8040d4b1d733f2b817619a09a","observation_id":"643ea409-02d1-4c2e-9ab1-c1961ef3f94b","resolution":{"observed_at":"2026-08-06T15:02:09.087403Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:02:09.075782Z","title":"color”) and𝑣𝑖 is its value (e.g., “ blue","venue":null,"work_id":"90015598-673a-4f83-a810-ad13d6bd2aa3","year":2025},"citing_paper":{"arxiv_id":"2507.17080","last_updated":"2025-07-22T23:45:43Z","snapshot_observed_at":"2026-08-06T14:54:51.848171Z","submitted_at":"2025-07-22T23:45:43Z","title":"VL-CLIP: Enhancing Multimodal Recommendations via Visual Grounding and LLM-Augmented CLIP Embeddings","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T15:02:08.473719Z"},"links":{"citing_paper":"/paper/2507.17080"},"observation_digest":"sha256:7a912ec4096d29b04626444ef8bfd18838c106a3365a9025f61d1abf555f9dfc","observation_id":"89797b0e-cd56-42ec-9c02-a4aa148e0361","resolution":{"observed_at":"2026-08-06T15:02:09.078869Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:02:09.125829Z","title":"InProceedings of the 25th ACM SIGKDD International Conference on Knowledge Discovery & Data Mining","venue":null,"work_id":"207a2ea4-03cb-46ac-aefa-6bb499d35c20","year":null},"citing_paper":{"arxiv_id":"2507.17080","last_updated":"2025-07-22T23:45:43Z","snapshot_observed_at":"2026-08-06T14:54:51.848171Z","submitted_at":"2025-07-22T23:45:43Z","title":"VL-CLIP: Enhancing Multimodal Recommendations via Visual Grounding and LLM-Augmented CLIP Embeddings","version":1},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-06T15:02:08.452541Z"},"links":{"citing_paper":"/paper/2507.17080"},"observation_digest":"sha256:63730fe5a509ca1057537a313d45252d824690231cb5187bcaf831f814e7387e","observation_id":"67156b5c-067f-4e09-ac3d-33812b283b3b","resolution":{"observed_at":"2026-08-06T15:02:09.129394Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:02:08.395019Z","title":"In Computer Vision – ECCV 2020: 16th European Conference, Glasgow, UK, August 23–28, 2020, Proceedings, Part XXX (Glasgow, United Kingdom)","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.17080","last_updated":"2025-07-22T23:45:43Z","snapshot_observed_at":"2026-08-06T14:54:51.848171Z","submitted_at":"2025-07-22T23:45:43Z","title":"VL-CLIP: Enhancing Multimodal Recommendations via Visual Grounding and LLM-Augmented CLIP Embeddings","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-06T15:02:08.395019Z"},"links":{"citing_paper":"/paper/2507.17080"},"observation_digest":"sha256:b0cd3ff114c98bcc21830d5758e9cd2174a56e1beac9cba3200d40c57a1db49d","observation_id":"96eca364-7576-4559-95fa-b653762da436","resolution":{"observed_at":"2026-08-06T15:02:08.395019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:02:09.193427Z","title":"In Proceedings of the International Conference on Machine Learning","venue":null,"work_id":"c5b86116-be21-41bc-b7a2-07fb46677106","year":null},"citing_paper":{"arxiv_id":"2507.17080","last_updated":"2025-07-22T23:45:43Z","snapshot_observed_at":"2026-08-06T14:54:51.848171Z","submitted_at":"2025-07-22T23:45:43Z","title":"VL-CLIP: Enhancing Multimodal Recommendations via Visual Grounding and LLM-Augmented CLIP Embeddings","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-06T15:02:08.423824Z"},"links":{"citing_paper":"/paper/2507.17080"},"observation_digest":"sha256:3918a782b6b5bc1fc451aacf247c27cb77af036853196219b2b5561bf3abc396","observation_id":"43983f7f-f4e4-418c-a760-9863f596fdc4","resolution":{"observed_at":"2026-08-06T15:02:09.196435Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:02:08.458000Z","title":"In 2022 IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR)","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.17080","last_updated":"2025-07-22T23:45:43Z","snapshot_observed_at":"2026-08-06T14:54:51.848171Z","submitted_at":"2025-07-22T23:45:43Z","title":"VL-CLIP: Enhancing Multimodal Recommendations via Visual Grounding and LLM-Augmented CLIP Embeddings","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-06T15:02:08.458000Z"},"links":{"citing_paper":"/paper/2507.17080"},"observation_digest":"sha256:1b848e076487516b2614cdd7da23859420c47502163a656c40276c394547edf7","observation_id":"707ce20f-18e7-4cd0-8081-ec627485e9b9","resolution":{"observed_at":"2026-08-06T15:02:08.458000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:02:08.368225Z","title":"In 2023 IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.17080","last_updated":"2025-07-22T23:45:43Z","snapshot_observed_at":"2026-08-06T14:54:51.848171Z","submitted_at":"2025-07-22T23:45:43Z","title":"VL-CLIP: Enhancing Multimodal Recommendations via Visual Grounding and LLM-Augmented CLIP Embeddings","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-06T15:02:08.368225Z"},"links":{"citing_paper":"/paper/2507.17080"},"observation_digest":"sha256:45a9d35140c92f86618069262c251ede48aeb7776ae845c75c1c68235bb320f9","observation_id":"98986562-b5ec-4066-a8e5-78309200ceca","resolution":{"observed_at":"2026-08-06T15:02:08.368225Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.17080","last_updated":"2025-07-22T23:45:43Z","latest_version":1,"primary_category":"cs.IR","snapshot_observed_at":"2026-08-06T14:54:51.848171Z","submitted_at":"2025-07-22T23:45:43Z","title":"VL-CLIP: Enhancing Multimodal Recommendations via Visual Grounding and LLM-Augmented CLIP Embeddings"},"reference_resolution":{"displayed":45,"state_counts":{"malformed_identifier":2,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":35,"verified_exact":2,"verified_fuzzy":6},"total_outbound_references":45},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 45 of 45 outbound references and 0 inbound Pith citation observations for arXiv:2507.17080."}