{"as_of":"2026-08-10T04:58:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:6aeba176a40e202ab1be50e8f316554886ee48d20c7365e847bb0051c49e9f36","coverage":[{"denominator":60,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":60,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T15:17:58.243690Z","state":"measured"},{"denominator":61,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":61,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-20T00:55:59.857014Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-20T00:57:54.247973Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.16873","last_updated":"2025-07-22T08:24:33Z","snapshot_observed_at":"2026-08-07T23:46:03.737945Z","submitted_at":"2025-07-22T08:24:33Z","title":"HIPPO-Video: Simulating Watch Histories with Large Language Models for Personalized Video Highlighting","version":1},"cited_work":{"arxiv_id":"2507.16873","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.16873","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Hippo-video: Simulating watch histories with large language models for personalized video highlighting","venue":null,"work_id":"4dddbb22-4d9b-4bf7-9c37-d75eeeb7ef3d","year":2025},"citing_paper":{"arxiv_id":"2605.18653","last_updated":"2026-05-18T17:00:15Z","snapshot_observed_at":"2026-08-02T07:47:03.226350Z","submitted_at":"2026-05-18T17:00:15Z","title":"Will It Go Viral? Grounding Micro-Video Popularity Prediction on the Open Web","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-20T00:55:59.857014Z"},"links":{"cited_paper":"/paper/2507.16873","citing_paper":"/paper/2605.18653"},"observation_digest":"sha256:11fc809125a716f09a8a3ce01596bbe83a05cf2addd0fd6ce0f044c8acd95803","observation_id":"07909adf-c8b8-4550-8409-6fd6794033a1","resolution":{"observed_at":"2026-05-20T00:57:54.249989Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2507.16873/citation-record","integrity":"/paper/2507.16873/integrity","json":"/paper/2507.16873/citation-record.json","paper":"/paper/2507.16873"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-06T15:17:57.694812Z","title":"Gpt-4 technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.16873","last_updated":"2025-07-22T08:24:33Z","snapshot_observed_at":"2026-08-07T23:46:03.737945Z","submitted_at":"2025-07-22T08:24:33Z","title":"HIPPO-Video: Simulating Watch Histories with Large Language Models for Personalized Video Highlighting","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-06T15:17:57.694812Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2507.16873"},"observation_digest":"sha256:fdb7772d28649aef5a35b2ccec29a5b7b992a1553e31dd2308674fdbadf4a6f1","observation_id":"111e67ee-b96a-4a46-9964-b9ba7fe484d4","resolution":{"observed_at":"2026-08-06T15:17:57.694812Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:18:00.546558Z","title":"Video summarization using deep neural networks: A survey","venue":null,"work_id":"bdd46c24-ba30-4713-8577-f60b3c08bcdc","year":2021},"citing_paper":{"arxiv_id":"2507.16873","last_updated":"2025-07-22T08:24:33Z","snapshot_observed_at":"2026-08-07T23:46:03.737945Z","submitted_at":"2025-07-22T08:24:33Z","title":"HIPPO-Video: Simulating Watch Histories with Large Language Models for Personalized Video Highlighting","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-06T15:17:57.706308Z"},"links":{"citing_paper":"/paper/2507.16873"},"observation_digest":"sha256:a37ed860be3128d44f782256bd07c70cef0b3d9dfc58fae1d8c654536a6c1927","observation_id":"14b28a1e-c8e4-472a-b772-576670cb78ee","resolution":{"observed_at":"2026-08-06T15:18:00.559165Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:18:00.517172Z","title":"Towards automated movie trailer generation","venue":null,"work_id":"8420803c-bdb4-4cba-9891-9af967e0e3b0","year":2024},"citing_paper":{"arxiv_id":"2507.16873","last_updated":"2025-07-22T08:24:33Z","snapshot_observed_at":"2026-08-07T23:46:03.737945Z","submitted_at":"2025-07-22T08:24:33Z","title":"HIPPO-Video: Simulating Watch Histories with Large Language Models for Personalized Video Highlighting","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-06T15:17:57.715747Z"},"links":{"citing_paper":"/paper/2507.16873"},"observation_digest":"sha256:038315d18d8065550e5313a7a2d4d36705c21d4083cd661765b55b9220783661","observation_id":"4f93a273-ade6-4024-b885-94c9a4835eff","resolution":{"observed_at":"2026-08-06T15:18:00.526219Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:18:00.483686Z","title":"Scaling up video summarization pretraining with large language models","venue":null,"work_id":"d42c3b2d-fecc-4c22-94a2-e367e680f6ba","year":2024},"citing_paper":{"arxiv_id":"2507.16873","last_updated":"2025-07-22T08:24:33Z","snapshot_observed_at":"2026-08-07T23:46:03.737945Z","submitted_at":"2025-07-22T08:24:33Z","title":"HIPPO-Video: Simulating Watch Histories with Large Language Models for Personalized Video Highlighting","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-06T15:17:57.732501Z"},"links":{"citing_paper":"/paper/2507.16873"},"observation_digest":"sha256:33a67d8376038934a85bd1e1f10cdbd29cde595fded79465ef9fdbeb79e9788d","observation_id":"f06a89c7-b8a4-444d-a8e3-b2d4a61b9262","resolution":{"observed_at":"2026-08-06T15:18:00.494069Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05130","last_updated":"2024-12-16T02:20:31Z","snapshot_observed_at":"2026-08-03T21:21:39.149039Z","submitted_at":"2023-10-08T11:41:28Z","title":"Fast-DetectGPT: Efficient Zero-Shot Detection of Machine-Generated Text via Conditional Probability Curvature","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.05130","snapshot_observed_at":"2026-08-06T15:17:57.742908Z","title":"Fast-detectgpt: Efficient zero-shot detection of machine-generated text via conditional probability curvature","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.16873","last_updated":"2025-07-22T08:24:33Z","snapshot_observed_at":"2026-08-07T23:46:03.737945Z","submitted_at":"2025-07-22T08:24:33Z","title":"HIPPO-Video: Simulating Watch Histories with Large Language Models for Personalized Video Highlighting","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-06T15:17:57.742908Z"},"links":{"cited_paper":"/paper/2310.05130","citing_paper":"/paper/2507.16873"},"observation_digest":"sha256:70554f0a666931e2281371b80d6f0e57c7fbd2eb006d7bf5bc321af554f941fd","observation_id":"9d250bf7-c4b0-4f42-a71a-659e9ba1c1da","resolution":{"observed_at":"2026-08-06T15:17:57.742908Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:17:57.754625Z","title":"End-to-end object detection with transformers","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.16873","last_updated":"2025-07-22T08:24:33Z","snapshot_observed_at":"2026-08-07T23:46:03.737945Z","submitted_at":"2025-07-22T08:24:33Z","title":"HIPPO-Video: Simulating Watch Histories with Large Language Models for Personalized Video Highlighting","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-06T15:17:57.754625Z"},"links":{"citing_paper":"/paper/2507.16873"},"observation_digest":"sha256:3d5730f7310141407355be7d87238cda53e1fda68ab6df25927cb932b95b3d81","observation_id":"c5e70f11-e328-4a11-9644-a2a5d94b2764","resolution":{"observed_at":"2026-08-06T15:17:57.754625Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:18:00.437938Z","title":"Personalized video summarization by multimodal video understanding","venue":null,"work_id":"007c825c-77ed-493e-a28d-ee2c48ef31f2","year":2024},"citing_paper":{"arxiv_id":"2507.16873","last_updated":"2025-07-22T08:24:33Z","snapshot_observed_at":"2026-08-07T23:46:03.737945Z","submitted_at":"2025-07-22T08:24:33Z","title":"HIPPO-Video: Simulating Watch Histories with Large Language Models for Personalized Video Highlighting","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-06T15:17:57.772859Z"},"links":{"citing_paper":"/paper/2507.16873"},"observation_digest":"sha256:fc0512d456d94a7ec1be3a5ebb81e6159c8649c8b645851e29edea829ae2e0b2","observation_id":"971a1022-1cae-47db-bb32-8a8d388802f9","resolution":{"observed_at":"2026-08-06T15:18:00.446030Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:17:57.780042Z","title":"Chatbot arena: An open platform for evaluating llms by human preference","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.16873","last_updated":"2025-07-22T08:24:33Z","snapshot_observed_at":"2026-08-07T23:46:03.737945Z","submitted_at":"2025-07-22T08:24:33Z","title":"HIPPO-Video: Simulating Watch Histories with Large Language Models for Personalized Video Highlighting","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-06T15:17:57.780042Z"},"links":{"citing_paper":"/paper/2507.16873"},"observation_digest":"sha256:c1e98462bb4c3b5bc58890f4ec1123ca14a6595bed87848efacbbfc842caee73","observation_id":"2df36854-e189-4c3a-bb60-8d9fccec8895","resolution":{"observed_at":"2026-08-06T15:17:57.780042Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:18:00.384269Z","title":"Tall: Temporal activity localization via language query","venue":null,"work_id":"2600ac2d-9624-416a-a2cd-dca9a4cffe5f","year":2017},"citing_paper":{"arxiv_id":"2507.16873","last_updated":"2025-07-22T08:24:33Z","snapshot_observed_at":"2026-08-07T23:46:03.737945Z","submitted_at":"2025-07-22T08:24:33Z","title":"HIPPO-Video: Simulating Watch Histories with Large Language Models for Personalized Video Highlighting","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-06T15:17:57.794841Z"},"links":{"citing_paper":"/paper/2507.16873"},"observation_digest":"sha256:3a51ee7031696235fe80ad9dac47fdcf1ffdbf92ba874f7769116226547ada91","observation_id":"2f9c3627-2e56-4a5e-84c9-3cce8d9556ee","resolution":{"observed_at":"2026-08-06T15:18:00.397974Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:18:00.347399Z","title":"Creating summaries from user videos","venue":null,"work_id":"3360a8fb-8394-40f4-88de-cccd64778477","year":2014},"citing_paper":{"arxiv_id":"2507.16873","last_updated":"2025-07-22T08:24:33Z","snapshot_observed_at":"2026-08-07T23:46:03.737945Z","submitted_at":"2025-07-22T08:24:33Z","title":"HIPPO-Video: Simulating Watch Histories with Large Language Models for Personalized Video Highlighting","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-06T15:17:57.805901Z"},"links":{"citing_paper":"/paper/2507.16873"},"observation_digest":"sha256:80d6a3e6b6754e7a435d23a90c1dc07accd75e05b5a83de41b7c340064c1288a","observation_id":"6f3e2665-8d99-4161-b88d-a1bbf8e26051","resolution":{"observed_at":"2026-08-06T15:18:00.361373Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:18:00.301465Z","title":"Video2gif: Automatic generation of animated gifs from video","venue":null,"work_id":"9680f71e-f6e3-49fc-b887-f7efd7df0a89","year":2016},"citing_paper":{"arxiv_id":"2507.16873","last_updated":"2025-07-22T08:24:33Z","snapshot_observed_at":"2026-08-07T23:46:03.737945Z","submitted_at":"2025-07-22T08:24:33Z","title":"HIPPO-Video: Simulating Watch Histories with Large Language Models for Personalized Video Highlighting","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-06T15:17:57.813044Z"},"links":{"citing_paper":"/paper/2507.16873"},"observation_digest":"sha256:6ff45384543cb0ed4c92897533d4e1d5b94e9fd2ff697a3e81ecfff3537f9392","observation_id":"2e82b1b4-5224-40cd-9210-3ccff6cd019a","resolution":{"observed_at":"2026-08-06T15:18:00.314682Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.10300","last_updated":"2025-02-05T09:57:59Z","snapshot_observed_at":"2026-07-06T17:03:56.263404Z","submitted_at":"2023-12-16T03:17:30Z","title":"Shot2Story: A New Benchmark for Comprehensive Understanding of Multi-shot Videos","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.10300","snapshot_observed_at":"2026-08-06T15:17:57.824025Z","title":"Shot2story20k: A new benchmark for comprehensive understanding of multi-shot videos","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.16873","last_updated":"2025-07-22T08:24:33Z","snapshot_observed_at":"2026-08-07T23:46:03.737945Z","submitted_at":"2025-07-22T08:24:33Z","title":"HIPPO-Video: Simulating Watch Histories with Large Language Models for Personalized Video Highlighting","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-06T15:17:57.824025Z"},"links":{"cited_paper":"/paper/2312.10300","citing_paper":"/paper/2507.16873"},"observation_digest":"sha256:36f3b8d3e746cf88ff496da74a94c507be8eae09dc1bea232f304b4d02483f94","observation_id":"6b864fc9-9403-4a05-a35b-e0262781c528","resolution":{"observed_at":"2026-08-06T15:17:57.824025Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2404.12353","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:17:58.518311Z","title":"V2xum-llm: Cross-modal video summarization with temporal prompt instruction tuning","venue":null,"work_id":"da50309d-c6b8-4215-81de-3fe0825bf304","year":2024},"citing_paper":{"arxiv_id":"2507.16873","last_updated":"2025-07-22T08:24:33Z","snapshot_observed_at":"2026-08-07T23:46:03.737945Z","submitted_at":"2025-07-22T08:24:33Z","title":"HIPPO-Video: Simulating Watch Histories with Large Language Models for Personalized Video Highlighting","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-06T15:17:57.833243Z"},"links":{"citing_paper":"/paper/2507.16873"},"observation_digest":"sha256:259f7ea558fa833dffc791234d7aa109f7b4cfab08b61b0aa48663c5bbb2e23f","observation_id":"5b936faf-0f4c-404c-995e-7bdbeb775617","resolution":{"observed_at":"2026-08-06T15:17:58.535719Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:18:00.266092Z","title":"Movienet: A holistic dataset for movie understanding","venue":null,"work_id":"be4cab41-da3f-4ce2-986d-d42c8785faad","year":2020},"citing_paper":{"arxiv_id":"2507.16873","last_updated":"2025-07-22T08:24:33Z","snapshot_observed_at":"2026-08-07T23:46:03.737945Z","submitted_at":"2025-07-22T08:24:33Z","title":"HIPPO-Video: Simulating Watch Histories with Large Language Models for Personalized Video Highlighting","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-06T15:17:57.850713Z"},"links":{"citing_paper":"/paper/2507.16873"},"observation_digest":"sha256:16d7214c234e6bd1611289d48f7bbb1fd7dd3a85f5d773b8b9c92af4ac4bf9ab","observation_id":"178f61e5-5ca4-4ccb-bd6a-6b78c0c7cf7e","resolution":{"observed_at":"2026-08-06T15:18:00.274641Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:18:00.210560Z","title":"Video summarization with attention-based encoder--decoder networks","venue":null,"work_id":"7f847b56-d4b3-419d-8890-07bc972d4ab4","year":2019},"citing_paper":{"arxiv_id":"2507.16873","last_updated":"2025-07-22T08:24:33Z","snapshot_observed_at":"2026-08-07T23:46:03.737945Z","submitted_at":"2025-07-22T08:24:33Z","title":"HIPPO-Video: Simulating Watch Histories with Large Language Models for Personalized Video Highlighting","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-06T15:17:57.866956Z"},"links":{"citing_paper":"/paper/2507.16873"},"observation_digest":"sha256:884ac88315a2378482e07cd2bb0f8a74cfcc23ea1f3ddf401ae2c1891dd31678","observation_id":"100bc01e-0ebb-4d22-a71c-1079ae8835d8","resolution":{"observed_at":"2026-08-06T15:18:00.233683Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:17:57.878808Z","title":"Mdetr-modulated detection for end-to-end multi-modal understanding","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.16873","last_updated":"2025-07-22T08:24:33Z","snapshot_observed_at":"2026-08-07T23:46:03.737945Z","submitted_at":"2025-07-22T08:24:33Z","title":"HIPPO-Video: Simulating Watch Histories with Large Language Models for Personalized Video Highlighting","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-06T15:17:57.878808Z"},"links":{"citing_paper":"/paper/2507.16873"},"observation_digest":"sha256:5896399d3d5c1a00575decc8c1080cd4dff92b7066970ab82aba46c054814721","observation_id":"b5e92f8f-3ef2-4c14-a09d-c8b297af2f97","resolution":{"observed_at":"2026-08-06T15:17:57.878808Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:17:57.889332Z","title":"Self-attentive sequential recommendation","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.16873","last_updated":"2025-07-22T08:24:33Z","snapshot_observed_at":"2026-08-07T23:46:03.737945Z","submitted_at":"2025-07-22T08:24:33Z","title":"HIPPO-Video: Simulating Watch Histories with Large Language Models for Personalized Video Highlighting","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-06T15:17:57.889332Z"},"links":{"citing_paper":"/paper/2507.16873"},"observation_digest":"sha256:076c3a3bcf096e68046ab2a78daee0a0da60d4700920b8147161957570350db1","observation_id":"78658a8a-e7bf-41e2-9f1d-5f2293280a20","resolution":{"observed_at":"2026-08-06T15:17:57.889332Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:18:00.084093Z","title":"Tvr: A large-scale dataset for video-subtitle moment retrieval","venue":null,"work_id":"f2e25232-40d9-490d-88bd-79c167847ffc","year":2020},"citing_paper":{"arxiv_id":"2507.16873","last_updated":"2025-07-22T08:24:33Z","snapshot_observed_at":"2026-08-07T23:46:03.737945Z","submitted_at":"2025-07-22T08:24:33Z","title":"HIPPO-Video: Simulating Watch Histories with Large Language Models for Personalized Video Highlighting","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-06T15:17:57.894979Z"},"links":{"citing_paper":"/paper/2507.16873"},"observation_digest":"sha256:754678df5d2223169ed5cbdeb942259954a2d7aa580fc9dbf45993320b16c2a2","observation_id":"34c922f3-384c-43b9-822b-ac4b3f72e2e4","resolution":{"observed_at":"2026-08-06T15:18:00.099995Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:17:57.900813Z","title":"Detecting moments and highlights in videos via natural language queries","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.16873","last_updated":"2025-07-22T08:24:33Z","snapshot_observed_at":"2026-08-07T23:46:03.737945Z","submitted_at":"2025-07-22T08:24:33Z","title":"HIPPO-Video: Simulating Watch Histories with Large Language Models for Personalized Video Highlighting","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-06T15:17:57.900813Z"},"links":{"citing_paper":"/paper/2507.16873"},"observation_digest":"sha256:afb783769463fb454f36667602aa089109b26161de943a59b18ef801dd94e83e","observation_id":"92b3b6c7-adb3-4da3-8832-cbbe029447bf","resolution":{"observed_at":"2026-08-06T15:17:57.900813Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.00200","last_updated":"2020-09-29T20:37:17Z","snapshot_observed_at":"2026-08-07T23:43:49.317779Z","submitted_at":"2020-05-01T03:49:26Z","title":"HERO: Hierarchical Encoder for Video+Language Omni-representation Pre-training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.00200","snapshot_observed_at":"2026-08-06T15:17:57.908906Z","title":"Hero: Hierarchical encoder for video+ language omni-representation pre-training","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2507.16873","last_updated":"2025-07-22T08:24:33Z","snapshot_observed_at":"2026-08-07T23:46:03.737945Z","submitted_at":"2025-07-22T08:24:33Z","title":"HIPPO-Video: Simulating Watch Histories with Large Language Models for Personalized Video Highlighting","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-06T15:17:57.908906Z"},"links":{"cited_paper":"/paper/2005.00200","citing_paper":"/paper/2507.16873"},"observation_digest":"sha256:1505c822b0850b2ab31634718ed8880244f6093907cca151835096e60247fd3f","observation_id":"1186ada7-6db8-4df6-9898-174df4cae153","resolution":{"observed_at":"2026-08-06T15:17:57.908906Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:17:59.994136Z","title":"Univtg: Towards unified video-language temporal grounding","venue":null,"work_id":"8181aff0-4e7f-43f8-ac1a-f15ade09383b","year":2023},"citing_paper":{"arxiv_id":"2507.16873","last_updated":"2025-07-22T08:24:33Z","snapshot_observed_at":"2026-08-07T23:46:03.737945Z","submitted_at":"2025-07-22T08:24:33Z","title":"HIPPO-Video: Simulating Watch Histories with Large Language Models for Personalized Video Highlighting","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-06T15:17:57.915019Z"},"links":{"citing_paper":"/paper/2507.16873"},"observation_digest":"sha256:8d7cec96e293b7fc860448d71032e1da80935e8fe55736e264ee3a43705352d0","observation_id":"2fffdc20-b80c-4b42-ad59-a56ad77212c1","resolution":{"observed_at":"2026-08-06T15:18:00.005787Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:17:57.923338Z","title":"Visual instruction tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.16873","last_updated":"2025-07-22T08:24:33Z","snapshot_observed_at":"2026-08-07T23:46:03.737945Z","submitted_at":"2025-07-22T08:24:33Z","title":"HIPPO-Video: Simulating Watch Histories with Large Language Models for Personalized Video Highlighting","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-06T15:17:57.923338Z"},"links":{"citing_paper":"/paper/2507.16873"},"observation_digest":"sha256:b008faeb2b8f45c55148441106ecb964b7b31cf9749edc295685c9dadddee394","observation_id":"d74afcc3-c1aa-4ae7-93cd-14992b383a2f","resolution":{"observed_at":"2026-08-06T15:17:57.923338Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:17:59.934186Z","title":"Attentive moment retrieval in videos","venue":null,"work_id":"33294b9d-6018-41fd-b4e0-08cc518e857f","year":2018},"citing_paper":{"arxiv_id":"2507.16873","last_updated":"2025-07-22T08:24:33Z","snapshot_observed_at":"2026-08-07T23:46:03.737945Z","submitted_at":"2025-07-22T08:24:33Z","title":"HIPPO-Video: Simulating Watch Histories with Large Language Models for Personalized Video Highlighting","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-06T15:17:57.930475Z"},"links":{"citing_paper":"/paper/2507.16873"},"observation_digest":"sha256:3f06a40734c6cfd5445c0d7896b39bf39eb2b7bf83135320f6bf286cf2599277","observation_id":"fbe27845-2ba9-4e8f-afa8-131644f5e416","resolution":{"observed_at":"2026-08-06T15:17:59.942980Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:17:59.910238Z","title":"Multi-task deep visual-semantic embedding for video thumbnail selection","venue":null,"work_id":"89a549c9-d1fa-4795-88a8-f7f1bd0ad91a","year":2015},"citing_paper":{"arxiv_id":"2507.16873","last_updated":"2025-07-22T08:24:33Z","snapshot_observed_at":"2026-08-07T23:46:03.737945Z","submitted_at":"2025-07-22T08:24:33Z","title":"HIPPO-Video: Simulating Watch Histories with Large Language Models for Personalized Video Highlighting","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-06T15:17:57.938843Z"},"links":{"citing_paper":"/paper/2507.16873"},"observation_digest":"sha256:6deb16c2a400c5f47876a4c257579d8d0d81e313b33528e2b2ccf6aa8b2d92c7","observation_id":"cb57efb1-20af-4de0-9b32-4c036c771603","resolution":{"observed_at":"2026-08-06T15:17:59.916236Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:17:59.888577Z","title":"Umt: Unified multi-modal transformers for joint video moment retrieval and highlight detection","venue":null,"work_id":"a2dd4e55-e1c3-4b2f-a2a3-21210c40c87e","year":2022},"citing_paper":{"arxiv_id":"2507.16873","last_updated":"2025-07-22T08:24:33Z","snapshot_observed_at":"2026-08-07T23:46:03.737945Z","submitted_at":"2025-07-22T08:24:33Z","title":"HIPPO-Video: Simulating Watch Histories with Large Language Models for Personalized Video Highlighting","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-06T15:17:57.950702Z"},"links":{"citing_paper":"/paper/2507.16873"},"observation_digest":"sha256:29723de71302547df51fe71b98ebce77e037082d03647151f770237739be603b","observation_id":"200f224b-e477-4969-b44a-eda34a757df2","resolution":{"observed_at":"2026-08-06T15:17:59.894062Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:17:59.845217Z","title":"Debug: A dense bottom-up grounding approach for natural language video localization","venue":null,"work_id":"c0981c59-0585-4586-baa0-bb5c3f890e29","year":2019},"citing_paper":{"arxiv_id":"2507.16873","last_updated":"2025-07-22T08:24:33Z","snapshot_observed_at":"2026-08-07T23:46:03.737945Z","submitted_at":"2025-07-22T08:24:33Z","title":"HIPPO-Video: Simulating Watch Histories with Large Language Models for Personalized Video Highlighting","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-06T15:17:57.959213Z"},"links":{"citing_paper":"/paper/2507.16873"},"observation_digest":"sha256:466ea77645631914225be57486e34ad7ef4e3fbcff630ce2b95a18e721f49eab","observation_id":"67d4abdc-b013-481e-acd5-af011be4bf6e","resolution":{"observed_at":"2026-08-06T15:17:59.858277Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:17:59.805721Z","title":"Videoautoarena: An automated arena for evaluating large multimodal models in video analysis through user simulation","venue":null,"work_id":"7c40fc13-f379-44fd-a40e-0502722a161a","year":2025},"citing_paper":{"arxiv_id":"2507.16873","last_updated":"2025-07-22T08:24:33Z","snapshot_observed_at":"2026-08-07T23:46:03.737945Z","submitted_at":"2025-07-22T08:24:33Z","title":"HIPPO-Video: Simulating Watch Histories with Large Language Models for Personalized Video Highlighting","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-06T15:17:57.968763Z"},"links":{"citing_paper":"/paper/2507.16873"},"observation_digest":"sha256:db8718fc912afa657e38c6b444095bbfaec6899190f89d77341baa627e3af200","observation_id":"14265216-7375-4778-b9c6-da0ad1b99330","resolution":{"observed_at":"2026-08-06T15:17:59.813663Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:17:57.978108Z","title":"Howto100m: Learning a text-video embedding by watching hundred million narrated video clips","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.16873","last_updated":"2025-07-22T08:24:33Z","snapshot_observed_at":"2026-08-07T23:46:03.737945Z","submitted_at":"2025-07-22T08:24:33Z","title":"HIPPO-Video: Simulating Watch Histories with Large Language Models for Personalized Video Highlighting","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-06T15:17:57.978108Z"},"links":{"citing_paper":"/paper/2507.16873"},"observation_digest":"sha256:9accdc173369ada71cfc92da842de5135d3778053585d63d8eab95d11002a4a9","observation_id":"6370adc4-c383-4e9f-aa75-86741df5413c","resolution":{"observed_at":"2026-08-06T15:17:57.978108Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:17:59.736334Z","title":"Detectgpt: Zero-shot machine-generated text detection using probability curvature","venue":null,"work_id":"08e81607-690e-4e60-9d1f-f6df003360a2","year":2023},"citing_paper":{"arxiv_id":"2507.16873","last_updated":"2025-07-22T08:24:33Z","snapshot_observed_at":"2026-08-07T23:46:03.737945Z","submitted_at":"2025-07-22T08:24:33Z","title":"HIPPO-Video: Simulating Watch Histories with Large Language Models for Personalized Video Highlighting","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-06T15:17:57.986161Z"},"links":{"citing_paper":"/paper/2507.16873"},"observation_digest":"sha256:3668a94ced0186e471e20cd23c56efff35ef1414b7417ee125a9c5bb02c13da2","observation_id":"13ca2bd9-7318-45af-a15f-56f231f4b646","resolution":{"observed_at":"2026-08-06T15:17:59.747306Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:17:59.698303Z","title":"Query-dependent video representation for moment retrieval and highlight detection","venue":null,"work_id":"f7bd2afd-2c1c-48fb-a7c8-5825e1cd6381","year":2023},"citing_paper":{"arxiv_id":"2507.16873","last_updated":"2025-07-22T08:24:33Z","snapshot_observed_at":"2026-08-07T23:46:03.737945Z","submitted_at":"2025-07-22T08:24:33Z","title":"HIPPO-Video: Simulating Watch Histories with Large Language Models for Personalized Video Highlighting","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-06T15:17:57.997352Z"},"links":{"citing_paper":"/paper/2507.16873"},"observation_digest":"sha256:c8c9f76b87534123fcbd35f2a336f0213a8d4970cb1cceb8d730021596299088","observation_id":"12fcf8e1-6451-4820-ac18-dff6ed7fb08f","resolution":{"observed_at":"2026-08-06T15:17:59.706354Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:17:59.661409Z","title":"Clip-it! language-guided video summarization","venue":null,"work_id":"425c95a2-f725-4f1b-a0de-7ee3fbee8c0e","year":2021},"citing_paper":{"arxiv_id":"2507.16873","last_updated":"2025-07-22T08:24:33Z","snapshot_observed_at":"2026-08-07T23:46:03.737945Z","submitted_at":"2025-07-22T08:24:33Z","title":"HIPPO-Video: Simulating Watch Histories with Large Language Models for Personalized Video Highlighting","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-06T15:17:58.005873Z"},"links":{"citing_paper":"/paper/2507.16873"},"observation_digest":"sha256:a61422bd2027df081044fabd87f3ab53f05d2e51b8223918d40f7af5338ccbf3","observation_id":"cf66e6ea-cd8a-4ed0-b290-2fcea3507307","resolution":{"observed_at":"2026-08-06T15:17:59.673686Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:17:59.623245Z","title":"Sumgraph: Video summarization via recursive graph modeling","venue":null,"work_id":"081f6a54-b3e4-4731-8f74-1586a2ce43df","year":2020},"citing_paper":{"arxiv_id":"2507.16873","last_updated":"2025-07-22T08:24:33Z","snapshot_observed_at":"2026-08-07T23:46:03.737945Z","submitted_at":"2025-07-22T08:24:33Z","title":"HIPPO-Video: Simulating Watch Histories with Large Language Models for Personalized Video Highlighting","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-06T15:17:58.011349Z"},"links":{"citing_paper":"/paper/2507.16873"},"observation_digest":"sha256:45a2b566423d4b8fdea10e8e061ab3ec4d69bbdca5aee5ca8d9c7eb32c8fd8cd","observation_id":"69e54f2b-58c6-4089-b36f-483ebc85c181","resolution":{"observed_at":"2026-08-06T15:17:59.632181Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:17:59.576770Z","title":"Mmsum: A dataset for multimodal summarization and thumbnail generation of videos","venue":null,"work_id":"25948ad4-d892-4d03-858f-ec588e088706","year":2024},"citing_paper":{"arxiv_id":"2507.16873","last_updated":"2025-07-22T08:24:33Z","snapshot_observed_at":"2026-08-07T23:46:03.737945Z","submitted_at":"2025-07-22T08:24:33Z","title":"HIPPO-Video: Simulating Watch Histories with Large Language Models for Personalized Video Highlighting","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-06T15:17:58.017617Z"},"links":{"citing_paper":"/paper/2507.16873"},"observation_digest":"sha256:94c84fed72867adffddd8097b9f895e61dc4cc2e2cb80c8d79844a05edec1e87","observation_id":"0fe70fca-d3e8-468f-bda8-39f3cd0bbfde","resolution":{"observed_at":"2026-08-06T15:17:59.587725Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:17:58.026255Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.16873","last_updated":"2025-07-22T08:24:33Z","snapshot_observed_at":"2026-08-07T23:46:03.737945Z","submitted_at":"2025-07-22T08:24:33Z","title":"HIPPO-Video: Simulating Watch Histories with Large Language Models for Personalized Video Highlighting","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-06T15:17:58.026255Z"},"links":{"citing_paper":"/paper/2507.16873"},"observation_digest":"sha256:94e28481051634648e0fffb1771d29bc92ac9459178522268d35d6185cbd9838","observation_id":"612b5a05-1947-4417-b6d6-ed88046ad67c","resolution":{"observed_at":"2026-08-06T15:17:58.026255Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:17:59.495915Z","title":"Bpr: Bayesian personalized ranking from implicit feedback","venue":null,"work_id":"b530acce-f8b9-45aa-9d5e-41f265d4f880","year":2009},"citing_paper":{"arxiv_id":"2507.16873","last_updated":"2025-07-22T08:24:33Z","snapshot_observed_at":"2026-08-07T23:46:03.737945Z","submitted_at":"2025-07-22T08:24:33Z","title":"HIPPO-Video: Simulating Watch Histories with Large Language Models for Personalized Video Highlighting","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-06T15:17:58.034667Z"},"links":{"citing_paper":"/paper/2507.16873"},"observation_digest":"sha256:272563211ac1b7d0f5fda46c9910294bc108e938be538595e53f3137ee82f666","observation_id":"12a5c193-1394-4a55-9fd9-3744ba6d020d","resolution":{"observed_at":"2026-08-06T15:17:59.508037Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:17:59.453134Z","title":"Adaptive video highlight detection by learning from user history","venue":null,"work_id":"b661fc26-a494-466b-a09b-94d4ddaa45f8","year":2020},"citing_paper":{"arxiv_id":"2507.16873","last_updated":"2025-07-22T08:24:33Z","snapshot_observed_at":"2026-08-07T23:46:03.737945Z","submitted_at":"2025-07-22T08:24:33Z","title":"HIPPO-Video: Simulating Watch Histories with Large Language Models for Personalized Video Highlighting","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-06T15:17:58.042738Z"},"links":{"citing_paper":"/paper/2507.16873"},"observation_digest":"sha256:d1678aa1a71a37788f5e97ed1f73df9b238bb1dfdd76c85e2b03404e0abc45db","observation_id":"fbca70f4-3f80-48e4-90c8-484a13ac1b35","resolution":{"observed_at":"2026-08-06T15:17:59.462359Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:17:59.403444Z","title":"Query-focused extractive video summarization","venue":null,"work_id":"660f733f-4212-47b2-a31d-65a387c13116","year":2016},"citing_paper":{"arxiv_id":"2507.16873","last_updated":"2025-07-22T08:24:33Z","snapshot_observed_at":"2026-08-07T23:46:03.737945Z","submitted_at":"2025-07-22T08:24:33Z","title":"HIPPO-Video: Simulating Watch Histories with Large Language Models for Personalized Video Highlighting","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-06T15:17:58.048754Z"},"links":{"citing_paper":"/paper/2507.16873"},"observation_digest":"sha256:5420bedfeb846a5cecd9ba480d69cc73167346860dbd7acde763bea7f880d20c","observation_id":"778060dd-f944-4ab2-b973-c03a99ae4853","resolution":{"observed_at":"2026-08-06T15:17:59.415123Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:17:59.370307Z","title":"Query-focused video summarization: Dataset, evaluation, and a memory network based approach","venue":null,"work_id":"cf7e45c4-fdfb-41d1-b5dd-11f88e939679","year":2017},"citing_paper":{"arxiv_id":"2507.16873","last_updated":"2025-07-22T08:24:33Z","snapshot_observed_at":"2026-08-07T23:46:03.737945Z","submitted_at":"2025-07-22T08:24:33Z","title":"HIPPO-Video: Simulating Watch Histories with Large Language Models for Personalized Video Highlighting","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-06T15:17:58.054036Z"},"links":{"citing_paper":"/paper/2507.16873"},"observation_digest":"sha256:4d592cf3ca6e655aa3e12822a24d72a0b0bd8c1590f648a76b39baf6178e2a2f","observation_id":"068a8527-2123-4f8e-b6f3-a414943f5124","resolution":{"observed_at":"2026-08-06T15:17:59.379996Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:17:59.332821Z","title":"Tvsum: Summarizing web videos using titles","venue":null,"work_id":"f75d4fa4-0f21-4f17-8ae5-d93c04c15828","year":2015},"citing_paper":{"arxiv_id":"2507.16873","last_updated":"2025-07-22T08:24:33Z","snapshot_observed_at":"2026-08-07T23:46:03.737945Z","submitted_at":"2025-07-22T08:24:33Z","title":"HIPPO-Video: Simulating Watch Histories with Large Language Models for Personalized Video Highlighting","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-06T15:17:58.061056Z"},"links":{"citing_paper":"/paper/2507.16873"},"observation_digest":"sha256:1f82f5f69c2557f1af15e84d1b65809684d07fe68ddb512674b78be075dc38eb","observation_id":"15bbd598-720d-4cd9-87df-175cf218596e","resolution":{"observed_at":"2026-08-06T15:17:59.342002Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:17:59.303742Z","title":"To click or not to click: Automatic selection of beautiful thumbnails from videos","venue":null,"work_id":"55363aac-200d-4e74-9b15-b811e1ba5693","year":2016},"citing_paper":{"arxiv_id":"2507.16873","last_updated":"2025-07-22T08:24:33Z","snapshot_observed_at":"2026-08-07T23:46:03.737945Z","submitted_at":"2025-07-22T08:24:33Z","title":"HIPPO-Video: Simulating Watch Histories with Large Language Models for Personalized Video Highlighting","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-06T15:17:58.067085Z"},"links":{"citing_paper":"/paper/2507.16873"},"observation_digest":"sha256:e8155550e72186c4ce9d5b8de7d8093ce7959d897f3ddd7613270bdf2052a288","observation_id":"fcf77a06-11a7-4cb3-8e6f-e4e37d409487","resolution":{"observed_at":"2026-08-06T15:17:59.312544Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:17:59.274741Z","title":null,"venue":null,"work_id":"8cab676c-47ce-47b1-a32d-2e343513573f","year":2023},"citing_paper":{"arxiv_id":"2507.16873","last_updated":"2025-07-22T08:24:33Z","snapshot_observed_at":"2026-08-07T23:46:03.737945Z","submitted_at":"2025-07-22T08:24:33Z","title":"HIPPO-Video: Simulating Watch Histories with Large Language Models for Personalized Video Highlighting","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-06T15:17:58.076964Z"},"links":{"citing_paper":"/paper/2507.16873"},"observation_digest":"sha256:02c176c62539220aaac345483b7456c47ccf55546975ba51423cf405bbe455fe","observation_id":"a6087fab-8d80-46c5-90a8-546fbb73ef42","resolution":{"observed_at":"2026-08-06T15:17:59.284673Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:17:59.243433Z","title":"Tr-detr: Task-reciprocal transformer for joint moment retrieval and highlight detection","venue":null,"work_id":"9c976489-36ed-417c-9d92-84f36d2f5f10","year":2024},"citing_paper":{"arxiv_id":"2507.16873","last_updated":"2025-07-22T08:24:33Z","snapshot_observed_at":"2026-08-07T23:46:03.737945Z","submitted_at":"2025-07-22T08:24:33Z","title":"HIPPO-Video: Simulating Watch Histories with Large Language Models for Personalized Video Highlighting","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-06T15:17:58.087219Z"},"links":{"citing_paper":"/paper/2507.16873"},"observation_digest":"sha256:53ce290dec8aa16139c3ee417be0f8d816240e93e29255cf80a2a13e7a4f21ce","observation_id":"1600e304-033b-4d22-a5a0-ccfea5bc1e24","resolution":{"observed_at":"2026-08-06T15:17:59.250454Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:17:59.206681Z","title":"Ranking domain-specific highlights by analyzing edited videos","venue":null,"work_id":"cfdf59f3-992d-44c7-87d9-6b54d1b73639","year":2014},"citing_paper":{"arxiv_id":"2507.16873","last_updated":"2025-07-22T08:24:33Z","snapshot_observed_at":"2026-08-07T23:46:03.737945Z","submitted_at":"2025-07-22T08:24:33Z","title":"HIPPO-Video: Simulating Watch Histories with Large Language Models for Personalized Video Highlighting","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-06T15:17:58.099601Z"},"links":{"citing_paper":"/paper/2507.16873"},"observation_digest":"sha256:1144a3e3a2af148be5a5714b2369a8693ea1f12c3e52cc0d712d135fe783e45c","observation_id":"4fedb22b-42da-4fab-a4e1-2b9bc923309d","resolution":{"observed_at":"2026-08-06T15:17:59.215237Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:17:59.161316Z","title":"Query-adaptive video summarization via quality-aware relevance estimation","venue":null,"work_id":"41f3ba62-edd1-4705-a211-2e04216b8544","year":2017},"citing_paper":{"arxiv_id":"2507.16873","last_updated":"2025-07-22T08:24:33Z","snapshot_observed_at":"2026-08-07T23:46:03.737945Z","submitted_at":"2025-07-22T08:24:33Z","title":"HIPPO-Video: Simulating Watch Histories with Large Language Models for Personalized Video Highlighting","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-06T15:17:58.108373Z"},"links":{"citing_paper":"/paper/2507.16873"},"observation_digest":"sha256:8fa8b78ca6a7c1cba4857c74473998d4fa45851f6c9b35053a5303a01bfb180d","observation_id":"87556897-de50-49d6-ba8a-993fb85164d3","resolution":{"observed_at":"2026-08-06T15:17:59.175888Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:17:58.113681Z","title":"Videoagent: Long-form video understanding with large language model as agent","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.16873","last_updated":"2025-07-22T08:24:33Z","snapshot_observed_at":"2026-08-07T23:46:03.737945Z","submitted_at":"2025-07-22T08:24:33Z","title":"HIPPO-Video: Simulating Watch Histories with Large Language Models for Personalized Video Highlighting","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-06T15:17:58.113681Z"},"links":{"citing_paper":"/paper/2507.16873"},"observation_digest":"sha256:1ae2933c57d6f461731adf708d6cdc76772ffa3cda76e02266236fb98a0a73b6","observation_id":"11843b59-aebc-42d7-a3f9-d711aec94c8c","resolution":{"observed_at":"2026-08-06T15:17:58.113681Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:17:59.085480Z","title":"Query-biased self-attentive network for query-focused video summarization","venue":null,"work_id":"7399e7b3-a24e-4a2b-81c1-2fcc863c3b61","year":2020},"citing_paper":{"arxiv_id":"2507.16873","last_updated":"2025-07-22T08:24:33Z","snapshot_observed_at":"2026-08-07T23:46:03.737945Z","submitted_at":"2025-07-22T08:24:33Z","title":"HIPPO-Video: Simulating Watch Histories with Large Language Models for Personalized Video Highlighting","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-06T15:17:58.119440Z"},"links":{"citing_paper":"/paper/2507.16873"},"observation_digest":"sha256:0f4fe3bb4d87f4a8bb10efe81e54b5c6a65355aacb0ce386e06d61921694144f","observation_id":"5b6a1701-91b5-4a9e-a64b-4b4a2456f62c","resolution":{"observed_at":"2026-08-06T15:17:59.096946Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:17:59.044732Z","title":"Convolutional hierarchical attention network for query-focused video summarization","venue":null,"work_id":"9f0e88aa-8b93-4da1-92b7-708e5e7ddc43","year":2020},"citing_paper":{"arxiv_id":"2507.16873","last_updated":"2025-07-22T08:24:33Z","snapshot_observed_at":"2026-08-07T23:46:03.737945Z","submitted_at":"2025-07-22T08:24:33Z","title":"HIPPO-Video: Simulating Watch Histories with Large Language Models for Personalized Video Highlighting","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-06T15:17:58.126430Z"},"links":{"citing_paper":"/paper/2507.16873"},"observation_digest":"sha256:8dc312700ad1cc77aa300f479d8104f5e6d9526bbd3f787436a2030fb2c93d2c","observation_id":"4b5ea4cb-bc56-48d0-b451-09a8d639da2e","resolution":{"observed_at":"2026-08-06T15:17:59.053131Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:17:59.003981Z","title":"Bridging the gap: A unified video comprehension framework for moment retrieval and highlight detection","venue":null,"work_id":"ab3e304c-b4b7-42ec-b753-8594906797f2","year":2024},"citing_paper":{"arxiv_id":"2507.16873","last_updated":"2025-07-22T08:24:33Z","snapshot_observed_at":"2026-08-07T23:46:03.737945Z","submitted_at":"2025-07-22T08:24:33Z","title":"HIPPO-Video: Simulating Watch Histories with Large Language Models for Personalized Video Highlighting","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-06T15:17:58.135930Z"},"links":{"citing_paper":"/paper/2507.16873"},"observation_digest":"sha256:2b5f5aee45b4c0ebd9d88ce1073b4f7620e9be9550dc9a2600fa67422047bb3f","observation_id":"fdfec61e-997d-4624-8fe8-0aaf263c8ae3","resolution":{"observed_at":"2026-08-06T15:17:59.017479Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:17:58.964100Z","title":"Cross-category video highlight detection via set-based learning","venue":null,"work_id":"e4152821-3aa1-4e70-bbde-5f97f0dfd643","year":2021},"citing_paper":{"arxiv_id":"2507.16873","last_updated":"2025-07-22T08:24:33Z","snapshot_observed_at":"2026-08-07T23:46:03.737945Z","submitted_at":"2025-07-22T08:24:33Z","title":"HIPPO-Video: Simulating Watch Histories with Large Language Models for Personalized Video Highlighting","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-06T15:17:58.142535Z"},"links":{"citing_paper":"/paper/2507.16873"},"observation_digest":"sha256:1b3c3215a1b6f6468ab1ec5c31df20c50130574279823fce15bada94d1188e48","observation_id":"a63772b5-cfef-4cb1-8124-3312178cc852","resolution":{"observed_at":"2026-08-06T15:17:58.977655Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:17:58.929405Z","title":"Mh-detr: Video moment and highlight detection with cross-modal transformer","venue":null,"work_id":"41a8b21d-e8ac-4bfe-870c-840aae97ed77","year":2024},"citing_paper":{"arxiv_id":"2507.16873","last_updated":"2025-07-22T08:24:33Z","snapshot_observed_at":"2026-08-07T23:46:03.737945Z","submitted_at":"2025-07-22T08:24:33Z","title":"HIPPO-Video: Simulating Watch Histories with Large Language Models for Personalized Video Highlighting","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-06T15:17:58.147689Z"},"links":{"citing_paper":"/paper/2507.16873"},"observation_digest":"sha256:b1daf50f70c52cd21bd1cd9210841bd7e9514e4c2ecb1806781e93e62d0f8a7a","observation_id":"150ced57-45b7-4bec-a253-c45bab977bf5","resolution":{"observed_at":"2026-08-06T15:17:58.936518Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:17:58.892785Z","title":"Highlight detection with pairwise deep ranking for first-person video summarization","venue":null,"work_id":"ad3978f3-554c-4d44-b7b7-449a1b032f22","year":2016},"citing_paper":{"arxiv_id":"2507.16873","last_updated":"2025-07-22T08:24:33Z","snapshot_observed_at":"2026-08-07T23:46:03.737945Z","submitted_at":"2025-07-22T08:24:33Z","title":"HIPPO-Video: Simulating Watch Histories with Large Language Models for Personalized Video Highlighting","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-06T15:17:58.153170Z"},"links":{"citing_paper":"/paper/2507.16873"},"observation_digest":"sha256:2a1cfb53ea4bad5f9abfe54e256f3922fb6d31b2b5fda824542a799cb36d36af","observation_id":"ed1d3f71-31c3-44a2-8ad1-67beec4c60e7","resolution":{"observed_at":"2026-08-06T15:17:58.909446Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:17:58.861889Z","title":"Semantic conditioned dynamic modulation for temporal sentence grounding in videos","venue":null,"work_id":"579611e2-6f7e-43d3-9f7f-aacf8f084c10","year":2019},"citing_paper":{"arxiv_id":"2507.16873","last_updated":"2025-07-22T08:24:33Z","snapshot_observed_at":"2026-08-07T23:46:03.737945Z","submitted_at":"2025-07-22T08:24:33Z","title":"HIPPO-Video: Simulating Watch Histories with Large Language Models for Personalized Video Highlighting","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-06T15:17:58.158832Z"},"links":{"citing_paper":"/paper/2507.16873"},"observation_digest":"sha256:8528a9b3cd530dfa17e47fa695b84446ca8a6a1eb1fe645762d7f419798c928f","observation_id":"1326983a-f5e9-476d-af92-e90ef741f5d4","resolution":{"observed_at":"2026-08-06T15:17:58.872839Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:17:58.826389Z","title":"Hierarchical video-moment retrieval and step-captioning","venue":null,"work_id":"0fc05811-252f-434b-835c-79885fa1803e","year":2023},"citing_paper":{"arxiv_id":"2507.16873","last_updated":"2025-07-22T08:24:33Z","snapshot_observed_at":"2026-08-07T23:46:03.737945Z","submitted_at":"2025-07-22T08:24:33Z","title":"HIPPO-Video: Simulating Watch Histories with Large Language Models for Personalized Video Highlighting","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-06T15:17:58.165948Z"},"links":{"citing_paper":"/paper/2507.16873"},"observation_digest":"sha256:84de5e1bab76178aad72142d0236c69f52d319c62ff72f92957356a15fed34a7","observation_id":"bf2b387c-6436-4f76-a3e4-5da413d9b1f2","resolution":{"observed_at":"2026-08-06T15:17:58.836105Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:17:58.799377Z","title":"Moment is important: Language-based video moment retrieval via adversarial learning","venue":null,"work_id":"0797b6a1-08ea-4298-848e-dcdc50be119f","year":2022},"citing_paper":{"arxiv_id":"2507.16873","last_updated":"2025-07-22T08:24:33Z","snapshot_observed_at":"2026-08-07T23:46:03.737945Z","submitted_at":"2025-07-22T08:24:33Z","title":"HIPPO-Video: Simulating Watch Histories with Large Language Models for Personalized Video Highlighting","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-06T15:17:58.174479Z"},"links":{"citing_paper":"/paper/2507.16873"},"observation_digest":"sha256:bf43a8c48459bc122b08caf16fbc7ec3a891f5803b287b8132967cd77cb5e4be","observation_id":"04726dc6-2e68-4748-91af-cb19249712e3","resolution":{"observed_at":"2026-08-06T15:17:58.809922Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2004.13931","last_updated":"2020-06-14T08:49:07Z","snapshot_observed_at":"2026-08-09T22:51:36.749081Z","submitted_at":"2020-04-29T02:47:04Z","title":"Span-based Localizing Network for Natural Language Video Localization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.13931","snapshot_observed_at":"2026-08-06T15:17:58.184421Z","title":"Span-based localizing network for natural language video localization","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2507.16873","last_updated":"2025-07-22T08:24:33Z","snapshot_observed_at":"2026-08-07T23:46:03.737945Z","submitted_at":"2025-07-22T08:24:33Z","title":"HIPPO-Video: Simulating Watch Histories with Large Language Models for Personalized Video Highlighting","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-06T15:17:58.184421Z"},"links":{"cited_paper":"/paper/2004.13931","citing_paper":"/paper/2507.16873"},"observation_digest":"sha256:8535ae7d968f94fc4c1473a4c25c14cadf9b908ea41947eb4004e718cab9f1b4","observation_id":"8d2e8ea1-3eb3-4cce-b704-39e7b0c783fe","resolution":{"observed_at":"2026-08-06T15:17:58.184421Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:17:58.770013Z","title":"Towards automatic learning of procedures from web instructional videos","venue":null,"work_id":"0a4edb8b-e8d1-4dc3-8a53-781493697c2d","year":2018},"citing_paper":{"arxiv_id":"2507.16873","last_updated":"2025-07-22T08:24:33Z","snapshot_observed_at":"2026-08-07T23:46:03.737945Z","submitted_at":"2025-07-22T08:24:33Z","title":"HIPPO-Video: Simulating Watch Histories with Large Language Models for Personalized Video Highlighting","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-06T15:17:58.193137Z"},"links":{"citing_paper":"/paper/2507.16873"},"observation_digest":"sha256:0cc0787c62b3bf73c7db4b2cd99c38fd0b500182cb2bd7a9ebfd6d4b8008b14b","observation_id":"3a048f91-13ce-4e15-b481-71f3410b713f","resolution":{"observed_at":"2026-08-06T15:17:58.779679Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:17:58.209470Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.16873","last_updated":"2025-07-22T08:24:33Z","snapshot_observed_at":"2026-08-07T23:46:03.737945Z","submitted_at":"2025-07-22T08:24:33Z","title":"HIPPO-Video: Simulating Watch Histories with Large Language Models for Personalized Video Highlighting","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-06T15:17:58.209470Z"},"links":{"citing_paper":"/paper/2507.16873"},"observation_digest":"sha256:e4d0e0f97f31732b1592044859bea51482db53ffa05af06f56a621536c64eb98","observation_id":"8eb3311f-c2fb-43f5-899b-7f6807e76280","resolution":{"observed_at":"2026-08-06T15:17:58.209470Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:17:58.220624Z","title":"@esa (Ref","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.16873","last_updated":"2025-07-22T08:24:33Z","snapshot_observed_at":"2026-08-07T23:46:03.737945Z","submitted_at":"2025-07-22T08:24:33Z","title":"HIPPO-Video: Simulating Watch Histories with Large Language Models for Personalized Video Highlighting","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-06T15:17:58.220624Z"},"links":{"citing_paper":"/paper/2507.16873"},"observation_digest":"sha256:fc913ec22f29a9d62317d5eeeae7dbd3b14d709f9b0eb174dd3293dc0fa135ac","observation_id":"a8d73be5-de15-45fd-bba3-b628a287f923","resolution":{"observed_at":"2026-08-06T15:17:58.220624Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:17:58.235989Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.16873","last_updated":"2025-07-22T08:24:33Z","snapshot_observed_at":"2026-08-07T23:46:03.737945Z","submitted_at":"2025-07-22T08:24:33Z","title":"HIPPO-Video: Simulating Watch Histories with Large Language Models for Personalized Video Highlighting","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-06T15:17:58.235989Z"},"links":{"citing_paper":"/paper/2507.16873"},"observation_digest":"sha256:6c84d040a8ca137616a438a0f5b506079d8d55e865cc33b439ab9589d1539903","observation_id":"221f98c4-a519-4b45-af4a-53619fe51ada","resolution":{"observed_at":"2026-08-06T15:17:58.235989Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:17:58.243690Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.16873","last_updated":"2025-07-22T08:24:33Z","snapshot_observed_at":"2026-08-07T23:46:03.737945Z","submitted_at":"2025-07-22T08:24:33Z","title":"HIPPO-Video: Simulating Watch Histories with Large Language Models for Personalized Video Highlighting","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-06T15:17:58.243690Z"},"links":{"citing_paper":"/paper/2507.16873"},"observation_digest":"sha256:f4bc0af50568857d27057826656f79767a31eb6997cf379ebf5d85c81c827a2e","observation_id":"ffbfffb5-013f-445d-90c2-45a901683c77","resolution":{"observed_at":"2026-08-06T15:17:58.243690Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.16873","last_updated":"2025-07-22T08:24:33Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T23:46:03.737945Z","submitted_at":"2025-07-22T08:24:33Z","title":"HIPPO-Video: Simulating Watch Histories with Large Language Models for Personalized Video Highlighting"},"reference_resolution":{"displayed":60,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":19,"verified_exact":1,"verified_fuzzy":40},"total_outbound_references":60},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 60 of 60 outbound references and 1 inbound Pith citation observation for arXiv:2507.16873."}