{"as_of":"2026-08-14T10:42:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a55591deb4ce35e7ca9162de57c7b15cd53c4e74a78c9dd767309ac8de9b9097","coverage":[{"denominator":42,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":42,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T20:52:15.689430Z","state":"measured"},{"denominator":42,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":42,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2508.09789/citation-record","integrity":"/paper/2508.09789/integrity","json":"/paper/2508.09789/citation-record.json","paper":"/paper/2508.09789"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"1609.08675","last_updated":"2016-09-27T21:21:49Z","snapshot_observed_at":"2026-08-13T15:03:48.028924Z","submitted_at":"2016-09-27T21:21:49Z","title":"YouTube-8M: A Large-Scale Video Classification Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.08675","snapshot_observed_at":"2026-08-05T20:52:11.898760Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2508.09789","last_updated":"2025-08-13T13:19:31Z","snapshot_observed_at":"2026-08-13T05:26:04.785274Z","submitted_at":"2025-08-13T13:19:31Z","title":"Describe What You See with Multimodal Large Language Models to Enhance Video Recommendations","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-05T20:52:11.898760Z"},"links":{"cited_paper":"/paper/1609.08675","citing_paper":"/paper/2508.09789"},"observation_digest":"sha256:3011038c12f98149526d25e4cf90c59307b1701b250a8b7675b3752d371d41c9","observation_id":"d055120f-4662-453a-a739-5b0970657c43","resolution":{"observed_at":"2026-08-05T20:52:11.898760Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.03413","last_updated":"2024-04-04T12:46:01Z","snapshot_observed_at":"2026-08-13T00:37:45.501808Z","submitted_at":"2024-04-04T12:46:01Z","title":"MiniGPT4-Video: Advancing Multimodal LLMs for Video Understanding with Interleaved Visual-Textual Tokens","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.03413","snapshot_observed_at":"2026-08-05T20:52:11.947587Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.09789","last_updated":"2025-08-13T13:19:31Z","snapshot_observed_at":"2026-08-13T05:26:04.785274Z","submitted_at":"2025-08-13T13:19:31Z","title":"Describe What You See with Multimodal Large Language Models to Enhance Video Recommendations","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-05T20:52:11.947587Z"},"links":{"cited_paper":"/paper/2404.03413","citing_paper":"/paper/2508.09789"},"observation_digest":"sha256:25180f51d61a8389a76c3031dd32ab90873f7cfef2be542a2bff48a0e033328d","observation_id":"53afb53d-4905-43c0-bc65-1518f0ee4249","resolution":{"observed_at":"2026-08-05T20:52:11.947587Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-08-07T10:17:55.688598Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-08-05T20:52:12.075305Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.09789","last_updated":"2025-08-13T13:19:31Z","snapshot_observed_at":"2026-08-13T05:26:04.785274Z","submitted_at":"2025-08-13T13:19:31Z","title":"Describe What You See with Multimodal Large Language Models to Enhance Video Recommendations","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-05T20:52:12.075305Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2508.09789"},"observation_digest":"sha256:3b565f0096cadf9bdf5eb565dc579679f5374ac0776940ea14ed3b312da7f9d9","observation_id":"3d50f3c6-2f7b-43f7-824d-93dd7f258105","resolution":{"observed_at":"2026-08-05T20:52:12.075305Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:52:12.159645Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2508.09789","last_updated":"2025-08-13T13:19:31Z","snapshot_observed_at":"2026-08-13T05:26:04.785274Z","submitted_at":"2025-08-13T13:19:31Z","title":"Describe What You See with Multimodal Large Language Models to Enhance Video Recommendations","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-05T20:52:12.159645Z"},"links":{"citing_paper":"/paper/2508.09789"},"observation_digest":"sha256:7653bd619b6a4a75427bf38ec13438261fb49bcf40acef3d5c757ca92c3d1850","observation_id":"4aea27eb-a000-40ae-97d5-04cafad7297d","resolution":{"observed_at":"2026-08-05T20:52:12.159645Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.01957","last_updated":"2025-10-24T02:32:10Z","snapshot_observed_at":"2026-08-12T20:39:04.708938Z","submitted_at":"2025-01-03T18:59:52Z","title":"VITA-1.5: Towards GPT-4o Level Real-Time Vision and Speech Interaction","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.01957","snapshot_observed_at":"2026-08-05T20:52:12.243640Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.09789","last_updated":"2025-08-13T13:19:31Z","snapshot_observed_at":"2026-08-13T05:26:04.785274Z","submitted_at":"2025-08-13T13:19:31Z","title":"Describe What You See with Multimodal Large Language Models to Enhance Video Recommendations","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-05T20:52:12.243640Z"},"links":{"cited_paper":"/paper/2501.01957","citing_paper":"/paper/2508.09789"},"observation_digest":"sha256:da3e2bedecf097245d554e756f891b845219a3243826af618d4c0bcf864f28dd","observation_id":"b29ad16e-a2c7-41a8-9d88-dc69fd749e74","resolution":{"observed_at":"2026-08-05T20:52:12.243640Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.02992","last_updated":"2025-09-12T10:13:54Z","snapshot_observed_at":"2026-08-12T22:07:25.625479Z","submitted_at":"2024-11-05T10:53:25Z","title":"Efficient and Effective Adaptation of Multimodal Foundation Models in Sequential Recommendation","version":2},"cited_work":{"arxiv_id":"2411.02992","doi":null,"metadata_source":"pith","pith_arxiv_id":"2411.02992","snapshot_observed_at":"2026-08-05T20:52:16.252010Z","title":"Efficient and Effective Adaptation of Multimodal Foundation Models in Sequential Recommendation","venue":"cs.IR","work_id":"327be09b-f3ce-41cf-a4be-ff71cbafa11a","year":2024},"citing_paper":{"arxiv_id":"2508.09789","last_updated":"2025-08-13T13:19:31Z","snapshot_observed_at":"2026-08-13T05:26:04.785274Z","submitted_at":"2025-08-13T13:19:31Z","title":"Describe What You See with Multimodal Large Language Models to Enhance Video Recommendations","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-05T20:52:12.334243Z"},"links":{"cited_paper":"/paper/2411.02992","citing_paper":"/paper/2508.09789"},"observation_digest":"sha256:c0f36f2217909a344eac7a465ade0ee5f92c1f04f1bfac71a85feaaae97e6b30","observation_id":"6575eda3-5343-4888-aed5-b0c5c45f7e7b","resolution":{"observed_at":"2026-08-05T20:52:16.342181Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:52:12.424673Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.09789","last_updated":"2025-08-13T13:19:31Z","snapshot_observed_at":"2026-08-13T05:26:04.785274Z","submitted_at":"2025-08-13T13:19:31Z","title":"Describe What You See with Multimodal Large Language Models to Enhance Video Recommendations","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-05T20:52:12.424673Z"},"links":{"citing_paper":"/paper/2508.09789"},"observation_digest":"sha256:9b6f71724f08e9eac7bb3d05485d44098c114893ea4c4ecff1403a75dda45a8d","observation_id":"79b52895-6a8c-4903-a674-86fdbc6965f4","resolution":{"observed_at":"2026-08-05T20:52:12.424673Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:52:18.080846Z","title":null,"venue":null,"work_id":"53398f1b-2e62-4791-9d20-85fea9abd30b","year":2024},"citing_paper":{"arxiv_id":"2508.09789","last_updated":"2025-08-13T13:19:31Z","snapshot_observed_at":"2026-08-13T05:26:04.785274Z","submitted_at":"2025-08-13T13:19:31Z","title":"Describe What You See with Multimodal Large Language Models to Enhance Video Recommendations","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-05T20:52:12.502619Z"},"links":{"citing_paper":"/paper/2508.09789"},"observation_digest":"sha256:8bffa24dfede25e438be9ba2bbd0efd29791283bc8d17713f80c6ffa4280b345","observation_id":"49c69ce7-a34f-4d91-bc08-3387ece6a749","resolution":{"observed_at":"2026-08-05T20:52:18.133375Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:52:12.593453Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.09789","last_updated":"2025-08-13T13:19:31Z","snapshot_observed_at":"2026-08-13T05:26:04.785274Z","submitted_at":"2025-08-13T13:19:31Z","title":"Describe What You See with Multimodal Large Language Models to Enhance Video Recommendations","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-05T20:52:12.593453Z"},"links":{"citing_paper":"/paper/2508.09789"},"observation_digest":"sha256:07515dd7eadaa5bcb5ff9969aebb865afca787f892b940f389ff8fd3a1558b6a","observation_id":"4aa7b084-5a4e-4ce3-95fa-6f81d215c617","resolution":{"observed_at":"2026-08-05T20:52:12.593453Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:52:12.694792Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2508.09789","last_updated":"2025-08-13T13:19:31Z","snapshot_observed_at":"2026-08-13T05:26:04.785274Z","submitted_at":"2025-08-13T13:19:31Z","title":"Describe What You See with Multimodal Large Language Models to Enhance Video Recommendations","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-05T20:52:12.694792Z"},"links":{"citing_paper":"/paper/2508.09789"},"observation_digest":"sha256:bd2207f6d9611e560389e1e6fe3830cb2680126eede72d68792df94fbd6ed2ef","observation_id":"d83c8282-6656-421f-8d58-e1728c634d8e","resolution":{"observed_at":"2026-08-05T20:52:12.694792Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:52:17.916128Z","title":null,"venue":null,"work_id":"6485c26b-3f1f-45ff-a59d-d8cf30787548","year":2017},"citing_paper":{"arxiv_id":"2508.09789","last_updated":"2025-08-13T13:19:31Z","snapshot_observed_at":"2026-08-13T05:26:04.785274Z","submitted_at":"2025-08-13T13:19:31Z","title":"Describe What You See with Multimodal Large Language Models to Enhance Video Recommendations","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-05T20:52:12.749307Z"},"links":{"citing_paper":"/paper/2508.09789"},"observation_digest":"sha256:e42f3b4317c97e4d1b2331162b6baa25b17d88a4e23773392fefe8d6744979df","observation_id":"daceec4b-7953-42e4-aafc-dbeb36d89a7a","resolution":{"observed_at":"2026-08-05T20:52:17.968385Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:52:17.755361Z","title":null,"venue":null,"work_id":"792b1d6a-6942-41e7-93c4-00b9c51b8788","year":2021},"citing_paper":{"arxiv_id":"2508.09789","last_updated":"2025-08-13T13:19:31Z","snapshot_observed_at":"2026-08-13T05:26:04.785274Z","submitted_at":"2025-08-13T13:19:31Z","title":"Describe What You See with Multimodal Large Language Models to Enhance Video Recommendations","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-05T20:52:12.799997Z"},"links":{"citing_paper":"/paper/2508.09789"},"observation_digest":"sha256:98c877a12719a5a32dfba19d44bd4e78e5a1cb65cbd36e64d1c0153987b396c1","observation_id":"06700e41-578c-4819-8852-7093726e7337","resolution":{"observed_at":"2026-08-05T20:52:17.807895Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:52:17.618933Z","title":null,"venue":null,"work_id":"e447ccf7-f127-480b-8096-151bc2579dda","year":2024},"citing_paper":{"arxiv_id":"2508.09789","last_updated":"2025-08-13T13:19:31Z","snapshot_observed_at":"2026-08-13T05:26:04.785274Z","submitted_at":"2025-08-13T13:19:31Z","title":"Describe What You See with Multimodal Large Language Models to Enhance Video Recommendations","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-05T20:52:12.872360Z"},"links":{"citing_paper":"/paper/2508.09789"},"observation_digest":"sha256:08b9e4220bba2654c0b017e7a081b08d5802311f4933f080003869e2d638f8a1","observation_id":"76eb33c5-c78b-439b-82b7-0bd79bf9d56e","resolution":{"observed_at":"2026-08-05T20:52:17.678604Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:52:12.924826Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.09789","last_updated":"2025-08-13T13:19:31Z","snapshot_observed_at":"2026-08-13T05:26:04.785274Z","submitted_at":"2025-08-13T13:19:31Z","title":"Describe What You See with Multimodal Large Language Models to Enhance Video Recommendations","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-05T20:52:12.924826Z"},"links":{"citing_paper":"/paper/2508.09789"},"observation_digest":"sha256:c26bc691ec6d7783745645249a7cdb76744f4672c51a08c0ccb7e43f3c7fe5cd","observation_id":"48250b28-9d41-47ee-8236-f27f6671d5d9","resolution":{"observed_at":"2026-08-05T20:52:12.924826Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:52:13.023547Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.09789","last_updated":"2025-08-13T13:19:31Z","snapshot_observed_at":"2026-08-13T05:26:04.785274Z","submitted_at":"2025-08-13T13:19:31Z","title":"Describe What You See with Multimodal Large Language Models to Enhance Video Recommendations","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-05T20:52:13.023547Z"},"links":{"citing_paper":"/paper/2508.09789"},"observation_digest":"sha256:672f66fe40d6058a3774a7dca06b0b816fbe7f9d579655f21cdf2b5075bce7de","observation_id":"0722b8c9-6e91-4875-9b84-370a8afe9d33","resolution":{"observed_at":"2026-08-05T20:52:13.023547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:52:13.052971Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2508.09789","last_updated":"2025-08-13T13:19:31Z","snapshot_observed_at":"2026-08-13T05:26:04.785274Z","submitted_at":"2025-08-13T13:19:31Z","title":"Describe What You See with Multimodal Large Language Models to Enhance Video Recommendations","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-05T20:52:13.052971Z"},"links":{"citing_paper":"/paper/2508.09789"},"observation_digest":"sha256:abba2a965d2616e0cbb155edbc524004ce5cb5e1686d4f1cbabd0d58d8e02eec","observation_id":"a24d9033-1080-4dbb-b9ae-991b08888aea","resolution":{"observed_at":"2026-08-05T20:52:13.052971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.15379","last_updated":"2023-09-27T03:15:52Z","snapshot_observed_at":"2026-08-13T14:52:48.702926Z","submitted_at":"2023-09-27T03:15:52Z","title":"A Content-Driven Micro-Video Recommendation Dataset at Scale","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.15379","snapshot_observed_at":"2026-08-05T20:52:13.166472Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.09789","last_updated":"2025-08-13T13:19:31Z","snapshot_observed_at":"2026-08-13T05:26:04.785274Z","submitted_at":"2025-08-13T13:19:31Z","title":"Describe What You See with Multimodal Large Language Models to Enhance Video Recommendations","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-05T20:52:13.166472Z"},"links":{"cited_paper":"/paper/2309.15379","citing_paper":"/paper/2508.09789"},"observation_digest":"sha256:037f57a09429d5998384a9a51619aad6aac6f21edbaa6249bfb22913f495cba1","observation_id":"bcbbc6c5-14c3-40dc-a0a5-f4e39207f35e","resolution":{"observed_at":"2026-08-05T20:52:13.166472Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:52:13.243785Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.09789","last_updated":"2025-08-13T13:19:31Z","snapshot_observed_at":"2026-08-13T05:26:04.785274Z","submitted_at":"2025-08-13T13:19:31Z","title":"Describe What You See with Multimodal Large Language Models to Enhance Video Recommendations","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-05T20:52:13.243785Z"},"links":{"citing_paper":"/paper/2508.09789"},"observation_digest":"sha256:ede4ac741cc576736bfda28bdf9dfb9870a1ea9cd1eaa417d5ad438b0dae7fb5","observation_id":"6e5ab421-3e45-40ec-be4f-91e26bdca6c6","resolution":{"observed_at":"2026-08-05T20:52:13.243785Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:52:17.417614Z","title":null,"venue":null,"work_id":"99760074-198e-4262-8afc-8cc60f649267","year":2024},"citing_paper":{"arxiv_id":"2508.09789","last_updated":"2025-08-13T13:19:31Z","snapshot_observed_at":"2026-08-13T05:26:04.785274Z","submitted_at":"2025-08-13T13:19:31Z","title":"Describe What You See with Multimodal Large Language Models to Enhance Video Recommendations","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-05T20:52:13.318919Z"},"links":{"citing_paper":"/paper/2508.09789"},"observation_digest":"sha256:bcf900bb524498cbb7820e933be840829d09a3404c4067f6099a1a325c69ede5","observation_id":"a42f05f0-5664-461f-a87a-80e70907432c","resolution":{"observed_at":"2026-08-05T20:52:17.489037Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:52:13.429880Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.09789","last_updated":"2025-08-13T13:19:31Z","snapshot_observed_at":"2026-08-13T05:26:04.785274Z","submitted_at":"2025-08-13T13:19:31Z","title":"Describe What You See with Multimodal Large Language Models to Enhance Video Recommendations","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-05T20:52:13.429880Z"},"links":{"citing_paper":"/paper/2508.09789"},"observation_digest":"sha256:a92de36c6077bc6b791beeda1acdecf5f1b46c20003104e1fc42bd9c05a9bc5f","observation_id":"aac5cf76-5701-4a05-a699-4286a25a570f","resolution":{"observed_at":"2026-08-05T20:52:13.429880Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:52:13.545944Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.09789","last_updated":"2025-08-13T13:19:31Z","snapshot_observed_at":"2026-08-13T05:26:04.785274Z","submitted_at":"2025-08-13T13:19:31Z","title":"Describe What You See with Multimodal Large Language Models to Enhance Video Recommendations","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-05T20:52:13.545944Z"},"links":{"citing_paper":"/paper/2508.09789"},"observation_digest":"sha256:62eb056b0b39fa22e60d78ae712d4f4e452751d0bb5eb738c4244c00d1bb5bb1","observation_id":"76c6d758-ba70-4ca7-aad7-346e57c4aae1","resolution":{"observed_at":"2026-08-05T20:52:13.545944Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:52:13.621368Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.09789","last_updated":"2025-08-13T13:19:31Z","snapshot_observed_at":"2026-08-13T05:26:04.785274Z","submitted_at":"2025-08-13T13:19:31Z","title":"Describe What You See with Multimodal Large Language Models to Enhance Video Recommendations","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-05T20:52:13.621368Z"},"links":{"citing_paper":"/paper/2508.09789"},"observation_digest":"sha256:fddd3fd484cd733c02c2d5bc1853b96c70097da70b31a880e2ceb03d9b959d8d","observation_id":"127ea34d-e05c-456e-a5a0-9b5b23904366","resolution":{"observed_at":"2026-08-05T20:52:13.621368Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:52:17.217165Z","title":null,"venue":null,"work_id":"d32651e0-f675-47c9-a5ba-2310c6bd80d4","year":2022},"citing_paper":{"arxiv_id":"2508.09789","last_updated":"2025-08-13T13:19:31Z","snapshot_observed_at":"2026-08-13T05:26:04.785274Z","submitted_at":"2025-08-13T13:19:31Z","title":"Describe What You See with Multimodal Large Language Models to Enhance Video Recommendations","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-05T20:52:13.698637Z"},"links":{"citing_paper":"/paper/2508.09789"},"observation_digest":"sha256:919ddb7a3f55c7a868d766f7a1f3945b56d536f80a62c7203e24f5c09ca06845","observation_id":"c1959898-0515-44cc-a1f7-c8d94f9be27c","resolution":{"observed_at":"2026-08-05T20:52:17.311605Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:52:17.044931Z","title":null,"venue":null,"work_id":"b48deb69-3206-4986-9344-e2b0e200d752","year":2024},"citing_paper":{"arxiv_id":"2508.09789","last_updated":"2025-08-13T13:19:31Z","snapshot_observed_at":"2026-08-13T05:26:04.785274Z","submitted_at":"2025-08-13T13:19:31Z","title":"Describe What You See with Multimodal Large Language Models to Enhance Video Recommendations","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-05T20:52:13.771710Z"},"links":{"citing_paper":"/paper/2508.09789"},"observation_digest":"sha256:122c6de23400619a97f43af472d0d83815e4affb398a4e865f147fa271420484","observation_id":"2594f7c6-066a-4613-b4fe-76768d84fb52","resolution":{"observed_at":"2026-08-05T20:52:17.121366Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-05T20:52:13.893223Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.09789","last_updated":"2025-08-13T13:19:31Z","snapshot_observed_at":"2026-08-13T05:26:04.785274Z","submitted_at":"2025-08-13T13:19:31Z","title":"Describe What You See with Multimodal Large Language Models to Enhance Video Recommendations","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-05T20:52:13.893223Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2508.09789"},"observation_digest":"sha256:bb5a117ab8f2ed60b95412813ffcbf5944b2d0d37758a8729b23fa536d3d43f5","observation_id":"97a12b12-cc48-407f-ac8f-54f3433ea9cc","resolution":{"observed_at":"2026-08-05T20:52:13.893223Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:52:13.977897Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2508.09789","last_updated":"2025-08-13T13:19:31Z","snapshot_observed_at":"2026-08-13T05:26:04.785274Z","submitted_at":"2025-08-13T13:19:31Z","title":"Describe What You See with Multimodal Large Language Models to Enhance Video Recommendations","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-05T20:52:13.977897Z"},"links":{"citing_paper":"/paper/2508.09789"},"observation_digest":"sha256:a6ba29fdadbfb019ebb8cc311c5a288832ce488696323b097daf30f22bbe7bea","observation_id":"ab16a572-6f9e-49a6-b90c-cb56da4db9b2","resolution":{"observed_at":"2026-08-05T20:52:13.977897Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:52:16.892640Z","title":null,"venue":null,"work_id":"046bbce5-54ba-40c9-b415-f34a3fc999ec","year":2022},"citing_paper":{"arxiv_id":"2508.09789","last_updated":"2025-08-13T13:19:31Z","snapshot_observed_at":"2026-08-13T05:26:04.785274Z","submitted_at":"2025-08-13T13:19:31Z","title":"Describe What You See with Multimodal Large Language Models to Enhance Video Recommendations","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-05T20:52:14.071955Z"},"links":{"citing_paper":"/paper/2508.09789"},"observation_digest":"sha256:aff236dc7d9af22d76e9bdb10e14f7f5606bbf7ed39e63ab165510efa8bb6241","observation_id":"1f32c961-9e88-48bf-8b6d-ee745e3bce15","resolution":{"observed_at":"2026-08-05T20:52:16.960276Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:52:14.202485Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.09789","last_updated":"2025-08-13T13:19:31Z","snapshot_observed_at":"2026-08-13T05:26:04.785274Z","submitted_at":"2025-08-13T13:19:31Z","title":"Describe What You See with Multimodal Large Language Models to Enhance Video Recommendations","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-05T20:52:14.202485Z"},"links":{"citing_paper":"/paper/2508.09789"},"observation_digest":"sha256:ae34f26786ef05007126f485b52c77ff449d6e7d5267ed4a29e6991249692856","observation_id":"88e5fd52-a81c-4a8f-87ed-baeef4e07f6c","resolution":{"observed_at":"2026-08-05T20:52:14.202485Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.07597","last_updated":"2024-09-24T03:01:25Z","snapshot_observed_at":"2026-08-14T00:16:39.034955Z","submitted_at":"2023-09-14T10:57:50Z","title":"C-Pack: Packed Resources For General Chinese Embeddings","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.07597","snapshot_observed_at":"2026-08-05T20:52:14.307646Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.09789","last_updated":"2025-08-13T13:19:31Z","snapshot_observed_at":"2026-08-13T05:26:04.785274Z","submitted_at":"2025-08-13T13:19:31Z","title":"Describe What You See with Multimodal Large Language Models to Enhance Video Recommendations","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-05T20:52:14.307646Z"},"links":{"cited_paper":"/paper/2309.07597","citing_paper":"/paper/2508.09789"},"observation_digest":"sha256:ca7bc28d8ea38f5f87c5d6fceeb3d6abd1049bf38f81d0c56d5af7edbf47c366","observation_id":"7ff7e7a7-7591-4063-abbe-a5a33a89ffb3","resolution":{"observed_at":"2026-08-05T20:52:14.307646Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20215","last_updated":"2025-03-26T04:17:55Z","snapshot_observed_at":"2026-08-06T08:46:20.194739Z","submitted_at":"2025-03-26T04:17:55Z","title":"Qwen2.5-Omni Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20215","snapshot_observed_at":"2026-08-05T20:52:14.402114Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.09789","last_updated":"2025-08-13T13:19:31Z","snapshot_observed_at":"2026-08-13T05:26:04.785274Z","submitted_at":"2025-08-13T13:19:31Z","title":"Describe What You See with Multimodal Large Language Models to Enhance Video Recommendations","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-05T20:52:14.402114Z"},"links":{"cited_paper":"/paper/2503.20215","citing_paper":"/paper/2508.09789"},"observation_digest":"sha256:2fea302696d0f039e7bd3e5a5d26704f06257afd44ca1fc680bf91fe9c0fb3be","observation_id":"8a67f889-752a-44de-a832-b79c6c5c6f1b","resolution":{"observed_at":"2026-08-05T20:52:14.402114Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:52:14.485175Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.09789","last_updated":"2025-08-13T13:19:31Z","snapshot_observed_at":"2026-08-13T05:26:04.785274Z","submitted_at":"2025-08-13T13:19:31Z","title":"Describe What You See with Multimodal Large Language Models to Enhance Video Recommendations","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-05T20:52:14.485175Z"},"links":{"citing_paper":"/paper/2508.09789"},"observation_digest":"sha256:2cf5327b875c709d9bc9357b08081a3442c81168be1bfc40b3724a6d800db404","observation_id":"5fb8cb3b-4fec-4145-b173-f02a7cad2cb9","resolution":{"observed_at":"2026-08-05T20:52:14.485175Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:52:14.732843Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.09789","last_updated":"2025-08-13T13:19:31Z","snapshot_observed_at":"2026-08-13T05:26:04.785274Z","submitted_at":"2025-08-13T13:19:31Z","title":"Describe What You See with Multimodal Large Language Models to Enhance Video Recommendations","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-05T20:52:14.732843Z"},"links":{"citing_paper":"/paper/2508.09789"},"observation_digest":"sha256:5d34df5bd4be9a0cd27dd079eadcb8cfd7c1240d5659c56e9bd76db1299a982e","observation_id":"915ea390-591b-407b-adfc-d31a928fd135","resolution":{"observed_at":"2026-08-05T20:52:14.732843Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.10629","last_updated":"2023-06-04T04:00:05Z","snapshot_observed_at":"2026-08-13T14:05:51.895490Z","submitted_at":"2022-10-13T15:57:40Z","title":"Tenrec: A Large-scale Multipurpose Benchmark Dataset for Recommender Systems","version":3},"cited_work":{"arxiv_id":"2210.10629","doi":null,"metadata_source":"pith","pith_arxiv_id":"2210.10629","snapshot_observed_at":"2026-08-05T20:52:16.043797Z","title":"Tenrec: A Large-scale Multipurpose Benchmark Dataset for Recommender Systems","venue":"cs.IR","work_id":"baed4fb8-0bbb-4be2-85a9-f4f3595644f4","year":2022},"citing_paper":{"arxiv_id":"2508.09789","last_updated":"2025-08-13T13:19:31Z","snapshot_observed_at":"2026-08-13T05:26:04.785274Z","submitted_at":"2025-08-13T13:19:31Z","title":"Describe What You See with Multimodal Large Language Models to Enhance Video Recommendations","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-05T20:52:14.872860Z"},"links":{"cited_paper":"/paper/2210.10629","citing_paper":"/paper/2508.09789"},"observation_digest":"sha256:3c3d2f31ca86fa9c6b1759642e19a57209f7354c50da7248a00d081eecff9156","observation_id":"36bc5dd1-7a63-4e1a-b7d2-e823b8e7094a","resolution":{"observed_at":"2026-08-05T20:52:16.114245Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.05176","last_updated":"2025-06-11T02:54:49Z","snapshot_observed_at":"2026-08-13T07:28:32.447439Z","submitted_at":"2025-06-05T15:49:48Z","title":"Qwen3 Embedding: Advancing Text Embedding and Reranking Through Foundation Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.05176","snapshot_observed_at":"2026-08-05T20:52:14.945706Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.09789","last_updated":"2025-08-13T13:19:31Z","snapshot_observed_at":"2026-08-13T05:26:04.785274Z","submitted_at":"2025-08-13T13:19:31Z","title":"Describe What You See with Multimodal Large Language Models to Enhance Video Recommendations","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-05T20:52:14.945706Z"},"links":{"cited_paper":"/paper/2506.05176","citing_paper":"/paper/2508.09789"},"observation_digest":"sha256:9fc3ed23ae22cf0d03f3253d774bf476323150d360c6578f8f62551aa9bb26e5","observation_id":"9ad5f067-a670-4a12-bca3-54a75516314e","resolution":{"observed_at":"2026-08-05T20:52:14.945706Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:52:16.607384Z","title":"Gundavarapu, Liangzhe Yuan, Hao Zhou, Shen Yan, Jen- nifer J","venue":null,"work_id":"a539bc8b-1c62-46df-819b-45cb0b84e8ec","year":2024},"citing_paper":{"arxiv_id":"2508.09789","last_updated":"2025-08-13T13:19:31Z","snapshot_observed_at":"2026-08-13T05:26:04.785274Z","submitted_at":"2025-08-13T13:19:31Z","title":"Describe What You See with Multimodal Large Language Models to Enhance Video Recommendations","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-05T20:52:15.070733Z"},"links":{"citing_paper":"/paper/2508.09789"},"observation_digest":"sha256:8037a87503aa0167bc6d828e79a8f1758c180a9177ae6ddfd91a6e1464066aa5","observation_id":"c3119bdb-4b74-4f4c-850b-44f8f265f529","resolution":{"observed_at":"2026-08-05T20:52:16.667824Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:52:15.235622Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.09789","last_updated":"2025-08-13T13:19:31Z","snapshot_observed_at":"2026-08-13T05:26:04.785274Z","submitted_at":"2025-08-13T13:19:31Z","title":"Describe What You See with Multimodal Large Language Models to Enhance Video Recommendations","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-05T20:52:15.235622Z"},"links":{"citing_paper":"/paper/2508.09789"},"observation_digest":"sha256:48a7dfbcbe575e031f4b9554880d813612dddd3a8a594625bfa5dea29164acc4","observation_id":"28361b96-a139-4637-afff-522bf6200c46","resolution":{"observed_at":"2026-08-05T20:52:15.235622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:52:16.490798Z","title":null,"venue":null,"work_id":"be6eeb43-ba24-439e-a862-a76d8bed6b94","year":2024},"citing_paper":{"arxiv_id":"2508.09789","last_updated":"2025-08-13T13:19:31Z","snapshot_observed_at":"2026-08-13T05:26:04.785274Z","submitted_at":"2025-08-13T13:19:31Z","title":"Describe What You See with Multimodal Large Language Models to Enhance Video Recommendations","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-05T20:52:15.360641Z"},"links":{"citing_paper":"/paper/2508.09789"},"observation_digest":"sha256:11d93522d9131fdad4150a44abaa18d80e0a0d85eeadfe2cc2a96e4eaecc1e04","observation_id":"bcebc30e-fec5-4ecb-b202-52b03f8cc715","resolution":{"observed_at":"2026-08-05T20:52:16.538053Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:52:15.523539Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.09789","last_updated":"2025-08-13T13:19:31Z","snapshot_observed_at":"2026-08-13T05:26:04.785274Z","submitted_at":"2025-08-13T13:19:31Z","title":"Describe What You See with Multimodal Large Language Models to Enhance Video Recommendations","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-05T20:52:15.523539Z"},"links":{"citing_paper":"/paper/2508.09789"},"observation_digest":"sha256:936d1be34d64b33ae9eacc425e76bce4a83be0090b7372c749cb7ab45de27884","observation_id":"b261718e-d345-4574-8354-0c6507ea43ee","resolution":{"observed_at":"2026-08-05T20:52:15.523539Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.01872","last_updated":"2025-06-02T17:01:40Z","snapshot_observed_at":"2026-08-13T14:54:55.221252Z","submitted_at":"2025-06-02T17:01:40Z","title":"Is Extending Modality The Right Path Towards Omni-Modality?","version":1},"cited_work":{"arxiv_id":"2506.01872","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.01872","snapshot_observed_at":"2026-08-05T20:52:15.794372Z","title":"Is Extending Modality The Right Path Towards Omni-Modality?","venue":"cs.CL","work_id":"3c6f3d45-67e2-4ac1-987b-3d08e95cd474","year":2025},"citing_paper":{"arxiv_id":"2508.09789","last_updated":"2025-08-13T13:19:31Z","snapshot_observed_at":"2026-08-13T05:26:04.785274Z","submitted_at":"2025-08-13T13:19:31Z","title":"Describe What You See with Multimodal Large Language Models to Enhance Video Recommendations","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-05T20:52:15.689430Z"},"links":{"cited_paper":"/paper/2506.01872","citing_paper":"/paper/2508.09789"},"observation_digest":"sha256:83f226a2b84a93aa7e54ef39ff6048b7336c3e439e30d0125f2ae244511d379d","observation_id":"90c7369b-9612-4c3c-97dc-37408295e3d3","resolution":{"observed_at":"2026-08-05T20:52:15.874065Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:52:12.646185Z","title":"InProceedings of the 28th ACM International conference on Multimedia","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.09789","last_updated":"2025-08-13T13:19:31Z","snapshot_observed_at":"2026-08-13T05:26:04.785274Z","submitted_at":"2025-08-13T13:19:31Z","title":"Describe What You See with Multimodal Large Language Models to Enhance Video Recommendations","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-05T20:52:12.646185Z"},"links":{"citing_paper":"/paper/2508.09789"},"observation_digest":"sha256:45f5867e12c4550fee2523b6ed9c4f4f9e1c4f822480293972f8f176d04c0535","observation_id":"d0348ab4-8f7e-4f04-9d18-a5074b52bb5e","resolution":{"observed_at":"2026-08-05T20:52:12.646185Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:52:14.686234Z","title":"In Joint European Conference on Machine Learning and Knowledge Discovery in Databases","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.09789","last_updated":"2025-08-13T13:19:31Z","snapshot_observed_at":"2026-08-13T05:26:04.785274Z","submitted_at":"2025-08-13T13:19:31Z","title":"Describe What You See with Multimodal Large Language Models to Enhance Video Recommendations","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-05T20:52:14.686234Z"},"links":{"citing_paper":"/paper/2508.09789"},"observation_digest":"sha256:cb70f0f8db462615b2145ed4c8adf8c2caef1faaf9b8dbcf36acca598db60b19","observation_id":"2470fc22-7c73-4485-93db-eaba583f1b46","resolution":{"observed_at":"2026-08-05T20:52:14.686234Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:52:16.746630Z","title":"In Machine Learning and Knowledge Discovery in Databases: European Conference, ECML PKDD 2022, Grenoble, France, September 19–23, 2022, Proceedings, Part I","venue":null,"work_id":"ec0192fe-7e10-4a72-84bf-5eea285da2e3","year":2022},"citing_paper":{"arxiv_id":"2508.09789","last_updated":"2025-08-13T13:19:31Z","snapshot_observed_at":"2026-08-13T05:26:04.785274Z","submitted_at":"2025-08-13T13:19:31Z","title":"Describe What You See with Multimodal Large Language Models to Enhance Video Recommendations","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-05T20:52:14.845228Z"},"links":{"citing_paper":"/paper/2508.09789"},"observation_digest":"sha256:0aa2fd99dd457baa87fbf989bb5291237e0e403b1a40e4d04db31a4c83bc39c6","observation_id":"e6791eb2-d322-4c60-8638-505775694151","resolution":{"observed_at":"2026-08-05T20:52:16.791348Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2508.09789","last_updated":"2025-08-13T13:19:31Z","latest_version":1,"primary_category":"cs.IR","snapshot_observed_at":"2026-08-13T05:26:04.785274Z","submitted_at":"2025-08-13T13:19:31Z","title":"Describe What You See with Multimodal Large Language Models to Enhance Video Recommendations"},"reference_resolution":{"displayed":42,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":37,"verified_exact":3,"verified_fuzzy":2},"total_outbound_references":42},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 42 of 42 outbound references and 0 inbound Pith citation observations for arXiv:2508.09789."}