{"as_of":"2026-08-12T08:51:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:33d4c0f085d001f70ead47d470800264828d7fbf12fca7019cc362413fdeac9c","coverage":[{"denominator":32,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":32,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T19:05:48.211356Z","state":"measured"},{"denominator":32,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":32,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-12T06:34:41.77262+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2501.10692/citation-record","integrity":"/paper/2501.10692/integrity","json":"/paper/2501.10692/citation-record.json","paper":"/paper/2501.10692"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:05:49.154783Z","title":null,"venue":null,"work_id":"97933fb5-bf58-4884-9383-bd4a21c1ed53","year":null},"citing_paper":{"arxiv_id":"2501.10692","last_updated":"2025-01-18T08:09:44Z","snapshot_observed_at":"2026-08-12T03:12:41.859367Z","submitted_at":"2025-01-18T08:09:44Z","title":"Multi-modal Fusion and Query Refinement Network for Video Moment Retrieval and Highlight Detection","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-10T19:05:47.988030Z"},"links":{"citing_paper":"/paper/2501.10692"},"observation_digest":"sha256:a9ab769b79b197c226f8a3cb3fda57e56945f39e96c474642283362cb28f408f","observation_id":"db8af9e1-8c39-4713-8d3c-e623fa29db71","resolution":{"observed_at":"2026-08-10T19:05:49.166365Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:05:49.130754Z","title":null,"venue":null,"work_id":"b52cbe9a-dae5-4c43-b7e0-aaae9e31fe73","year":null},"citing_paper":{"arxiv_id":"2501.10692","last_updated":"2025-01-18T08:09:44Z","snapshot_observed_at":"2026-08-12T03:12:41.859367Z","submitted_at":"2025-01-18T08:09:44Z","title":"Multi-modal Fusion and Query Refinement Network for Video Moment Retrieval and Highlight Detection","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-10T19:05:47.994781Z"},"links":{"citing_paper":"/paper/2501.10692"},"observation_digest":"sha256:4aab79696756a47f3582b0502ae9451585ce94c4cba2b3ec5816ad2d57c8639d","observation_id":"643381ef-c2b0-4fa5-9f2d-59eb4ecdd82c","resolution":{"observed_at":"2026-08-10T19:05:49.136619Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:05:49.106321Z","title":"2 Related work Most previous MR&HD approaches [5, 11, 12] only em- ploy image and text inputs","venue":null,"work_id":"f785ce9e-611f-460c-a418-ada629e7bdad","year":null},"citing_paper":{"arxiv_id":"2501.10692","last_updated":"2025-01-18T08:09:44Z","snapshot_observed_at":"2026-08-12T03:12:41.859367Z","submitted_at":"2025-01-18T08:09:44Z","title":"Multi-modal Fusion and Query Refinement Network for Video Moment Retrieval and Highlight Detection","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-10T19:05:48.001085Z"},"links":{"citing_paper":"/paper/2501.10692"},"observation_digest":"sha256:770d7b41f7425764007cce29312686ff11e8e8e604d9d3a3e8677d7a047525e7","observation_id":"c43ec5cb-6aac-43bb-ba86-362b02fd13de","resolution":{"observed_at":"2026-08-10T19:05:49.115294Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:05:49.077653Z","title":"Effectiveness of each module in MRNet on QVHigh- lights val split","venue":null,"work_id":"2ec650c0-37bb-465b-80ff-0b86ef0ac7e1","year":null},"citing_paper":{"arxiv_id":"2501.10692","last_updated":"2025-01-18T08:09:44Z","snapshot_observed_at":"2026-08-12T03:12:41.859367Z","submitted_at":"2025-01-18T08:09:44Z","title":"Multi-modal Fusion and Query Refinement Network for Video Moment Retrieval and Highlight Detection","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-10T19:05:48.008082Z"},"links":{"citing_paper":"/paper/2501.10692"},"observation_digest":"sha256:c10079e2bf28c2b9f2c4144110b4022b9168063562c8935aa7d3f51c43b0cb17","observation_id":"a2afd7b4-877e-4000-bd7f-f1507ba26e52","resolution":{"observed_at":"2026-08-10T19:05:49.087752Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:05:49.048305Z","title":"The main reason is that Moment-DETR only utilizes RGB, which fails to fully under- Table 5","venue":null,"work_id":"f346cbf5-0e73-4888-b1a5-f729e7ccf6de","year":null},"citing_paper":{"arxiv_id":"2501.10692","last_updated":"2025-01-18T08:09:44Z","snapshot_observed_at":"2026-08-12T03:12:41.859367Z","submitted_at":"2025-01-18T08:09:44Z","title":"Multi-modal Fusion and Query Refinement Network for Video Moment Retrieval and Highlight Detection","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-10T19:05:48.015150Z"},"links":{"citing_paper":"/paper/2501.10692"},"observation_digest":"sha256:2866ce7b83d5e955d5826b3370a2f7dbd7e38ded9c6de4a9887932519339e29b","observation_id":"a007fb0a-100a-4d32-971e-d10c7194861e","resolution":{"observed_at":"2026-08-10T19:05:49.054624Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:05:49.028289Z","title":"Localizing moments in video with natural lan- guage,","venue":null,"work_id":"4f6ebe79-41e5-4362-96e4-aed436d855da","year":2017},"citing_paper":{"arxiv_id":"2501.10692","last_updated":"2025-01-18T08:09:44Z","snapshot_observed_at":"2026-08-12T03:12:41.859367Z","submitted_at":"2025-01-18T08:09:44Z","title":"Multi-modal Fusion and Query Refinement Network for Video Moment Retrieval and Highlight Detection","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-10T19:05:48.020785Z"},"links":{"citing_paper":"/paper/2501.10692"},"observation_digest":"sha256:554127bc5479dd1cf3cd15bc39bd34371c673fef8e5f8198712ac84361afe748","observation_id":"2a1b707c-b3d1-49a0-b54c-cb00fc211b4e","resolution":{"observed_at":"2026-08-10T19:05:49.034835Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:05:49.008513Z","title":"Less is more: Learning highlight detection from video duration,","venue":null,"work_id":"e43d5b19-271d-4057-9469-94fd97eb94cf","year":2019},"citing_paper":{"arxiv_id":"2501.10692","last_updated":"2025-01-18T08:09:44Z","snapshot_observed_at":"2026-08-12T03:12:41.859367Z","submitted_at":"2025-01-18T08:09:44Z","title":"Multi-modal Fusion and Query Refinement Network for Video Moment Retrieval and Highlight Detection","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-10T19:05:48.026677Z"},"links":{"citing_paper":"/paper/2501.10692"},"observation_digest":"sha256:de7250dfe1d7def8d5e7b36377318b6c163b5d600b7bb97ea4377d1a1a512502","observation_id":"c00b4893-4ba6-4451-b5f7-87942f4596af","resolution":{"observed_at":"2026-08-10T19:05:49.013948Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:05:48.983657Z","title":"Detect- ing Moments and Highlights in Videos via Natural Lan- guage Queries,","venue":null,"work_id":"4e4019e7-e58c-434e-9259-6d0d7e26d7bd","year":2021},"citing_paper":{"arxiv_id":"2501.10692","last_updated":"2025-01-18T08:09:44Z","snapshot_observed_at":"2026-08-12T03:12:41.859367Z","submitted_at":"2025-01-18T08:09:44Z","title":"Multi-modal Fusion and Query Refinement Network for Video Moment Retrieval and Highlight Detection","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-10T19:05:48.033453Z"},"links":{"citing_paper":"/paper/2501.10692"},"observation_digest":"sha256:e855fc5cd1c5b39b70d63af21c906096ccefb7eb5d6dc648cabcba13c8382ea6","observation_id":"e4951687-383d-45cd-8e87-f5c8c75176d6","resolution":{"observed_at":"2026-08-10T19:05:48.990075Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:05:48.952483Z","title":"UMT: Unified Multi-modal Transformers for Joint Video Moment Re- trieval and Highlight Detection,","venue":null,"work_id":"9071ccb2-9240-4f0e-9ce9-ecc4f240ea3e","year":2022},"citing_paper":{"arxiv_id":"2501.10692","last_updated":"2025-01-18T08:09:44Z","snapshot_observed_at":"2026-08-12T03:12:41.859367Z","submitted_at":"2025-01-18T08:09:44Z","title":"Multi-modal Fusion and Query Refinement Network for Video Moment Retrieval and Highlight Detection","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-10T19:05:48.038646Z"},"links":{"citing_paper":"/paper/2501.10692"},"observation_digest":"sha256:338f603e7992c5bb910713ff5eec5ef9c863b7ad3308efffbe4f6352ae889562","observation_id":"5c3af061-9e22-46ab-bc1b-32290657fc3e","resolution":{"observed_at":"2026-08-10T19:05:48.959393Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.02869","last_updated":"2023-10-11T10:03:08Z","snapshot_observed_at":"2026-08-12T03:48:27.454428Z","submitted_at":"2023-07-06T09:12:13Z","title":"MomentDiff: Generative Video Moment Retrieval from Random to Real","version":2},"cited_work":{"arxiv_id":"2307.02869","doi":null,"metadata_source":"pith","pith_arxiv_id":"2307.02869","snapshot_observed_at":"2026-08-10T19:05:48.537693Z","title":"MomentDiff: Generative Video Moment Retrieval from Random to Real","venue":"cs.CV","work_id":"1cf9f5c2-7a50-4dd6-965f-8ce535d26fc9","year":2023},"citing_paper":{"arxiv_id":"2501.10692","last_updated":"2025-01-18T08:09:44Z","snapshot_observed_at":"2026-08-12T03:12:41.859367Z","submitted_at":"2025-01-18T08:09:44Z","title":"Multi-modal Fusion and Query Refinement Network for Video Moment Retrieval and Highlight Detection","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-10T19:05:48.046112Z"},"links":{"cited_paper":"/paper/2307.02869","citing_paper":"/paper/2501.10692"},"observation_digest":"sha256:97c1d48f967439f6d9eff3dccfe677328c654e76b9658c61b132543d85ea1620","observation_id":"9c8c0675-fbc7-4842-ab7a-46be91c2877a","resolution":{"observed_at":"2026-08-10T19:05:48.545907Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:05:48.927636Z","title":"Gmflow: Learning optical flow via global matching,","venue":null,"work_id":"e07f2b05-6a65-4738-9a99-0744a5a5507b","year":2022},"citing_paper":{"arxiv_id":"2501.10692","last_updated":"2025-01-18T08:09:44Z","snapshot_observed_at":"2026-08-12T03:12:41.859367Z","submitted_at":"2025-01-18T08:09:44Z","title":"Multi-modal Fusion and Query Refinement Network for Video Moment Retrieval and Highlight Detection","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-10T19:05:48.061247Z"},"links":{"citing_paper":"/paper/2501.10692"},"observation_digest":"sha256:0c7c7bc11638a1fa0005f7ddbef1ba22746494bc2ea95e37cc85f5f727108c00","observation_id":"8c05860d-5739-4c27-9f29-94bb911e5446","resolution":{"observed_at":"2026-08-10T19:05:48.934703Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:05:48.906033Z","title":"Depth- cooperated trimodal network for video salient object de- tection,","venue":null,"work_id":"527d4390-9f2d-498b-ad6c-99bd7ef76fd1","year":2022},"citing_paper":{"arxiv_id":"2501.10692","last_updated":"2025-01-18T08:09:44Z","snapshot_observed_at":"2026-08-12T03:12:41.859367Z","submitted_at":"2025-01-18T08:09:44Z","title":"Multi-modal Fusion and Query Refinement Network for Video Moment Retrieval and Highlight Detection","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-10T19:05:48.071804Z"},"links":{"citing_paper":"/paper/2501.10692"},"observation_digest":"sha256:4f790a427bf08cd7bfca0effa4912cf31ad08a744e864bf45db156d73e2562a9","observation_id":"0e1917f8-3afa-4cdc-8c29-bfc7eb45f657","resolution":{"observed_at":"2026-08-10T19:05:48.914079Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:05:48.878498Z","title":"Pyramid Feature Attention Network for Monocular Depth Pre- diction,","venue":null,"work_id":"691177f5-6ffc-44e1-a2d3-9d78cbb94a2b","year":2021},"citing_paper":{"arxiv_id":"2501.10692","last_updated":"2025-01-18T08:09:44Z","snapshot_observed_at":"2026-08-12T03:12:41.859367Z","submitted_at":"2025-01-18T08:09:44Z","title":"Multi-modal Fusion and Query Refinement Network for Video Moment Retrieval and Highlight Detection","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-10T19:05:48.084100Z"},"links":{"citing_paper":"/paper/2501.10692"},"observation_digest":"sha256:2b8f7fb0c796f97dc34a28df90235004c21565cbbfc4680ab78380cc3700075d","observation_id":"9fb4ab9b-c1aa-4395-a6fc-23887b50d271","resolution":{"observed_at":"2026-08-10T19:05:48.888167Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:05:48.858546Z","title":"How hierarchical is language use?,","venue":null,"work_id":"311325a1-7b98-4e17-a3e4-cf72829b3819","year":2012},"citing_paper":{"arxiv_id":"2501.10692","last_updated":"2025-01-18T08:09:44Z","snapshot_observed_at":"2026-08-12T03:12:41.859367Z","submitted_at":"2025-01-18T08:09:44Z","title":"Multi-modal Fusion and Query Refinement Network for Video Moment Retrieval and Highlight Detection","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-10T19:05:48.091445Z"},"links":{"citing_paper":"/paper/2501.10692"},"observation_digest":"sha256:048c4f46899c06e0bd25cb193847eee76be66e78a02408d075cef2499154bc94","observation_id":"29f57026-dfaf-4e31-9962-5bfcc611925f","resolution":{"observed_at":"2026-08-10T19:05:48.864654Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:05:48.833936Z","title":"The emergence of hierarchical structure in human language,","venue":null,"work_id":"68b0b818-23f3-415c-87ba-eb1671318f71","year":2013},"citing_paper":{"arxiv_id":"2501.10692","last_updated":"2025-01-18T08:09:44Z","snapshot_observed_at":"2026-08-12T03:12:41.859367Z","submitted_at":"2025-01-18T08:09:44Z","title":"Multi-modal Fusion and Query Refinement Network for Video Moment Retrieval and Highlight Detection","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-10T19:05:48.097892Z"},"links":{"citing_paper":"/paper/2501.10692"},"observation_digest":"sha256:e09d9fb7d28970be2c5a68592a357f94855ae8f0075efa16fecedc4dd6ff24e4","observation_id":"1abb676d-9dce-4296-bce8-ef2645e45d9b","resolution":{"observed_at":"2026-08-10T19:05:48.843168Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:05:48.803222Z","title":"GPTSee: Enhancing moment retrieval and highlight detection via description-based similarity features,","venue":null,"work_id":"ac70d87c-5299-45f8-bce1-b83156cbe0f8","year":2023},"citing_paper":{"arxiv_id":"2501.10692","last_updated":"2025-01-18T08:09:44Z","snapshot_observed_at":"2026-08-12T03:12:41.859367Z","submitted_at":"2025-01-18T08:09:44Z","title":"Multi-modal Fusion and Query Refinement Network for Video Moment Retrieval and Highlight Detection","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-10T19:05:48.106113Z"},"links":{"citing_paper":"/paper/2501.10692"},"observation_digest":"sha256:0852966a7e746c6cbc812e6d65b2496bdef29fcad143fef032126b3c6b937e29","observation_id":"eb7e6f6a-cb38-494f-8377-fc6072587a61","resolution":{"observed_at":"2026-08-10T19:05:48.812275Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.00355","last_updated":"2023-04-29T22:50:53Z","snapshot_observed_at":"2026-08-10T13:50:46.721409Z","submitted_at":"2023-04-29T22:50:53Z","title":"MH-DETR: Video Moment and Highlight Detection with Cross-modal Transformer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.00355","snapshot_observed_at":"2026-08-10T19:05:48.113507Z","title":"MH-DETR: Video Moment and Highlight Detection with Cross- modal Transformer,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.10692","last_updated":"2025-01-18T08:09:44Z","snapshot_observed_at":"2026-08-12T03:12:41.859367Z","submitted_at":"2025-01-18T08:09:44Z","title":"Multi-modal Fusion and Query Refinement Network for Video Moment Retrieval and Highlight Detection","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-10T19:05:48.113507Z"},"links":{"cited_paper":"/paper/2305.00355","citing_paper":"/paper/2501.10692"},"observation_digest":"sha256:f1d462cc4ae5306e3a69128683f310bad923c5e9bae69b6532ca7d40e57e9c61","observation_id":"7f5b4600-e35f-4a04-85b9-265ac4897fc6","resolution":{"observed_at":"2026-08-10T19:05:48.113507Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:05:48.772941Z","title":"An empirical study of end-to-end video-language transformers with masked visual modeling,","venue":null,"work_id":"135ea006-97d4-4a28-b810-717d53b38c71","year":2023},"citing_paper":{"arxiv_id":"2501.10692","last_updated":"2025-01-18T08:09:44Z","snapshot_observed_at":"2026-08-12T03:12:41.859367Z","submitted_at":"2025-01-18T08:09:44Z","title":"Multi-modal Fusion and Query Refinement Network for Video Moment Retrieval and Highlight Detection","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-10T19:05:48.119107Z"},"links":{"citing_paper":"/paper/2501.10692"},"observation_digest":"sha256:0a6b36cca21b5b6fdcaf6c4540c83a79ddcfc185b7dbb9b0bc382e39cb158878","observation_id":"008f428b-8dcf-4a60-9f1b-351eb1da1fa2","resolution":{"observed_at":"2026-08-10T19:05:48.781442Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:05:48.750622Z","title":"End-to-end object detection with transformers,","venue":null,"work_id":"d3f36c77-1f2b-479a-b101-132989edd7bb","year":2020},"citing_paper":{"arxiv_id":"2501.10692","last_updated":"2025-01-18T08:09:44Z","snapshot_observed_at":"2026-08-12T03:12:41.859367Z","submitted_at":"2025-01-18T08:09:44Z","title":"Multi-modal Fusion and Query Refinement Network for Video Moment Retrieval and Highlight Detection","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-10T19:05:48.124164Z"},"links":{"citing_paper":"/paper/2501.10692"},"observation_digest":"sha256:bfd43d04753188cd3b040f8b48dd40890c3820ac68290b1287c239cd8f1b376d","observation_id":"db86f254-899d-4769-902c-65d7b044870c","resolution":{"observed_at":"2026-08-10T19:05:48.758557Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:05:48.726100Z","title":"Shifting more attention to visual backbone: Query-modulated re- finement networks for end-to-end visual grounding,","venue":null,"work_id":"bba5fd91-a821-4119-aaf2-44e23f556b64","year":2022},"citing_paper":{"arxiv_id":"2501.10692","last_updated":"2025-01-18T08:09:44Z","snapshot_observed_at":"2026-08-12T03:12:41.859367Z","submitted_at":"2025-01-18T08:09:44Z","title":"Multi-modal Fusion and Query Refinement Network for Video Moment Retrieval and Highlight Detection","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-10T19:05:48.131702Z"},"links":{"citing_paper":"/paper/2501.10692"},"observation_digest":"sha256:82ad0b61d7e731b53aea1ac23c6a74ea71a7e2e128b3317313891f42a9529015","observation_id":"d51e2849-68c4-4d12-b15e-08fc9156fa70","resolution":{"observed_at":"2026-08-10T19:05:48.732109Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:05:48.703762Z","title":"Re- thinking transformer-based set prediction for object de- tection,","venue":null,"work_id":"6eb99f0c-3d18-4026-bf16-4498370bf6a7","year":2021},"citing_paper":{"arxiv_id":"2501.10692","last_updated":"2025-01-18T08:09:44Z","snapshot_observed_at":"2026-08-12T03:12:41.859367Z","submitted_at":"2025-01-18T08:09:44Z","title":"Multi-modal Fusion and Query Refinement Network for Video Moment Retrieval and Highlight Detection","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-10T19:05:48.138847Z"},"links":{"citing_paper":"/paper/2501.10692"},"observation_digest":"sha256:9daffc5f7bd584af2bfb23e612b22d39586370391c3fdbc11540d6875f8844cd","observation_id":"e3fd3cd1-dd33-4563-a411-8c65390926cd","resolution":{"observed_at":"2026-08-10T19:05:48.710933Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.12288","last_updated":"2023-02-23T19:13:10Z","snapshot_observed_at":"2026-07-06T14:55:15.719380Z","submitted_at":"2023-02-23T19:13:10Z","title":"ZoeDepth: Zero-shot Transfer by Combining Relative and Metric Depth","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.12288","snapshot_observed_at":"2026-08-10T19:05:48.144753Z","title":"ZoeDepth: Zero-shot Transfer by Combining Relative and Metric Depth,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.10692","last_updated":"2025-01-18T08:09:44Z","snapshot_observed_at":"2026-08-12T03:12:41.859367Z","submitted_at":"2025-01-18T08:09:44Z","title":"Multi-modal Fusion and Query Refinement Network for Video Moment Retrieval and Highlight Detection","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-10T19:05:48.144753Z"},"links":{"cited_paper":"/paper/2302.12288","citing_paper":"/paper/2501.10692"},"observation_digest":"sha256:3ed39cb692b14cd11fcfba7589ce8758857e87f18856ac39d9eb21471dc30bd1","observation_id":"539371cd-619f-48a9-86e5-08a1ae89813d","resolution":{"observed_at":"2026-08-10T19:05:48.144753Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:05:48.676501Z","title":"Learning transferable visual models from natural lan- guage supervision,","venue":null,"work_id":"f844147a-1431-4647-850c-6ba9caf3f643","year":2021},"citing_paper":{"arxiv_id":"2501.10692","last_updated":"2025-01-18T08:09:44Z","snapshot_observed_at":"2026-08-12T03:12:41.859367Z","submitted_at":"2025-01-18T08:09:44Z","title":"Multi-modal Fusion and Query Refinement Network for Video Moment Retrieval and Highlight Detection","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-10T19:05:48.150146Z"},"links":{"citing_paper":"/paper/2501.10692"},"observation_digest":"sha256:ec786b909ddddff1f70da4454bf77ddadf1771760c6e3c1736cb9a9626cc997c","observation_id":"85873ffe-579d-4028-88f7-4c0ea041b52d","resolution":{"observed_at":"2026-08-10T19:05:48.685286Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1906.02851","last_updated":"2019-06-07T00:56:11Z","snapshot_observed_at":"2026-08-09T15:37:02.858684Z","submitted_at":"2019-06-07T00:56:11Z","title":"Recognizing American Sign Language Manual Signs from RGB-D Videos","version":1},"cited_work":{"arxiv_id":"1906.02851","doi":null,"metadata_source":"pith","pith_arxiv_id":"1906.02851","snapshot_observed_at":"2026-08-10T19:05:48.427417Z","title":"Recognizing American Sign Language Manual Signs from RGB-D Videos","venue":"cs.CV","work_id":"58cbaf0c-f6cb-42e6-a544-f354bf6ad040","year":2019},"citing_paper":{"arxiv_id":"2501.10692","last_updated":"2025-01-18T08:09:44Z","snapshot_observed_at":"2026-08-12T03:12:41.859367Z","submitted_at":"2025-01-18T08:09:44Z","title":"Multi-modal Fusion and Query Refinement Network for Video Moment Retrieval and Highlight Detection","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-10T19:05:48.157147Z"},"links":{"cited_paper":"/paper/1906.02851","citing_paper":"/paper/2501.10692"},"observation_digest":"sha256:b66777158152da4494d0aab5d7585b74386cf619161b9a972e4c661c8c74c09f","observation_id":"ef50378e-ec48-4585-a08d-3416706516b6","resolution":{"observed_at":"2026-08-10T19:05:48.435257Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1607.06450","last_updated":"2016-07-21T19:57:52Z","snapshot_observed_at":"2026-08-12T04:19:02.139595Z","submitted_at":"2016-07-21T19:57:52Z","title":"Layer Normalization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1607.06450","snapshot_observed_at":"2026-08-10T19:05:48.162480Z","title":"Layer normalization,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2501.10692","last_updated":"2025-01-18T08:09:44Z","snapshot_observed_at":"2026-08-12T03:12:41.859367Z","submitted_at":"2025-01-18T08:09:44Z","title":"Multi-modal Fusion and Query Refinement Network for Video Moment Retrieval and Highlight Detection","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-10T19:05:48.162480Z"},"links":{"cited_paper":"/paper/1607.06450","citing_paper":"/paper/2501.10692"},"observation_digest":"sha256:900a54db1b6daf9289e198d1bbeb353bd4b2a5aaf5ad25838e820ebcfdbaadad","observation_id":"fe17b1a6-13ed-47b1-8643-697bde5ccf45","resolution":{"observed_at":"2026-08-10T19:05:48.162480Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2201.08071","last_updated":"2023-03-13T13:55:30Z","snapshot_observed_at":"2026-07-06T12:29:13.421747Z","submitted_at":"2022-01-20T09:10:20Z","title":"Temporal Sentence Grounding in Videos: A Survey and Future Directions","version":3},"cited_work":{"arxiv_id":"2201.08071","doi":null,"metadata_source":"pith","pith_arxiv_id":"2201.08071","snapshot_observed_at":"2026-08-10T19:05:48.353679Z","title":"Temporal Sentence Grounding in Videos: A Survey and Future Directions","venue":"cs.CV","work_id":"2ee6f3f9-78cd-4af0-971c-4959c0b64ffb","year":2022},"citing_paper":{"arxiv_id":"2501.10692","last_updated":"2025-01-18T08:09:44Z","snapshot_observed_at":"2026-08-12T03:12:41.859367Z","submitted_at":"2025-01-18T08:09:44Z","title":"Multi-modal Fusion and Query Refinement Network for Video Moment Retrieval and Highlight Detection","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-10T19:05:48.169189Z"},"links":{"cited_paper":"/paper/2201.08071","citing_paper":"/paper/2501.10692"},"observation_digest":"sha256:71dc737519d3fc08695898c7ccb8510624de59a2a8faf0fa91003e02a3411f5e","observation_id":"978ceb9b-bade-4c84-8886-774fdcd1944e","resolution":{"observed_at":"2026-08-10T19:05:48.364200Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:05:48.648628Z","title":"Attention is all you need,","venue":null,"work_id":"b1b077fd-e618-490d-8047-e64400b820f3","year":2017},"citing_paper":{"arxiv_id":"2501.10692","last_updated":"2025-01-18T08:09:44Z","snapshot_observed_at":"2026-08-12T03:12:41.859367Z","submitted_at":"2025-01-18T08:09:44Z","title":"Multi-modal Fusion and Query Refinement Network for Video Moment Retrieval and Highlight Detection","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-10T19:05:48.179780Z"},"links":{"citing_paper":"/paper/2501.10692"},"observation_digest":"sha256:7bbfaa3df51437cf09ecf7de4086df96967215c01e5114ba36d1ecf6266c3c8f","observation_id":"e48aeb59-c1af-459e-8ac0-3ffd49040fc8","resolution":{"observed_at":"2026-08-10T19:05:48.654863Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:05:48.627303Z","title":"RSVG: Exploring Data and Models for Visual Grounding on Remote Sensing Data,","venue":null,"work_id":"18c73056-d16a-4304-a2a4-0c2ccfef8557","year":2023},"citing_paper":{"arxiv_id":"2501.10692","last_updated":"2025-01-18T08:09:44Z","snapshot_observed_at":"2026-08-12T03:12:41.859367Z","submitted_at":"2025-01-18T08:09:44Z","title":"Multi-modal Fusion and Query Refinement Network for Video Moment Retrieval and Highlight Detection","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-10T19:05:48.186680Z"},"links":{"citing_paper":"/paper/2501.10692"},"observation_digest":"sha256:7b3ab1f9dc53a37b7bd24873bcfc74dfbda8f77215353d910648ab8153f234bb","observation_id":"c1646409-cf5d-4aca-9303-6a1b637f9e74","resolution":{"observed_at":"2026-08-10T19:05:48.635334Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:05:48.595760Z","title":"Tall: Temporal activity localization via language query,","venue":null,"work_id":"26b5970f-cda5-4a94-8211-29abc291d8c4","year":2017},"citing_paper":{"arxiv_id":"2501.10692","last_updated":"2025-01-18T08:09:44Z","snapshot_observed_at":"2026-08-12T03:12:41.859367Z","submitted_at":"2025-01-18T08:09:44Z","title":"Multi-modal Fusion and Query Refinement Network for Video Moment Retrieval and Highlight Detection","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-10T19:05:48.192444Z"},"links":{"citing_paper":"/paper/2501.10692"},"observation_digest":"sha256:e64f82ffd708354fb9e9385a78db0b13be1bdc3c1edc7d4bc93643c830e532a8","observation_id":"b48827d7-79ec-4974-b1be-47e0abd404e2","resolution":{"observed_at":"2026-08-10T19:05:48.604469Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-08-09T20:34:52.923500Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-10T19:05:48.198444Z","title":"Decoupled weight decay regularization,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2501.10692","last_updated":"2025-01-18T08:09:44Z","snapshot_observed_at":"2026-08-12T03:12:41.859367Z","submitted_at":"2025-01-18T08:09:44Z","title":"Multi-modal Fusion and Query Refinement Network for Video Moment Retrieval and Highlight Detection","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-10T19:05:48.198444Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2501.10692"},"observation_digest":"sha256:e9f54da975b07ab4759ba25a7d17fa071d9ca0388775e7fe7a295708ddcadfee","observation_id":"324d2ccf-197e-459a-be21-cfa0132c1e6e","resolution":{"observed_at":"2026-08-10T19:05:48.198444Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06988","last_updated":"2023-11-29T21:24:35Z","snapshot_observed_at":"2026-08-12T05:00:44.572885Z","submitted_at":"2023-05-11T17:23:00Z","title":"Self-Chained Image-Language Model for Video Localization and Question Answering","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.06988","snapshot_observed_at":"2026-08-10T19:05:48.204282Z","title":"Self-Chained Image-Language Model for Video Localization and Question Answering,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.10692","last_updated":"2025-01-18T08:09:44Z","snapshot_observed_at":"2026-08-12T03:12:41.859367Z","submitted_at":"2025-01-18T08:09:44Z","title":"Multi-modal Fusion and Query Refinement Network for Video Moment Retrieval and Highlight Detection","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-10T19:05:48.204282Z"},"links":{"cited_paper":"/paper/2305.06988","citing_paper":"/paper/2501.10692"},"observation_digest":"sha256:d9411409cda36485523d3f3c53b688570f680659e41ace9f76d2f145282777ce","observation_id":"03d7fa82-70c5-4433-a111-b76be3f778ac","resolution":{"observed_at":"2026-08-10T19:05:48.204282Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:05:48.565988Z","title":"Learning 2d temporal adjacent networks for moment localization with natural language,","venue":null,"work_id":"dbee122c-72e2-466d-98b2-89ccfe52b9d4","year":2020},"citing_paper":{"arxiv_id":"2501.10692","last_updated":"2025-01-18T08:09:44Z","snapshot_observed_at":"2026-08-12T03:12:41.859367Z","submitted_at":"2025-01-18T08:09:44Z","title":"Multi-modal Fusion and Query Refinement Network for Video Moment Retrieval and Highlight Detection","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-10T19:05:48.211356Z"},"links":{"citing_paper":"/paper/2501.10692"},"observation_digest":"sha256:8cb0eb832e8b7e5cf452c7e3cf6ab7a7739538c58974fa5dc04452f7cd08b6da","observation_id":"8d26cd0a-6015-493c-a3e8-088fb680396d","resolution":{"observed_at":"2026-08-10T19:05:48.577349Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2501.10692","last_updated":"2025-01-18T08:09:44Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-12T03:12:41.859367Z","submitted_at":"2025-01-18T08:09:44Z","title":"Multi-modal Fusion and Query Refinement Network for Video Moment Retrieval and Highlight Detection"},"reference_resolution":{"displayed":32,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":7,"verified_exact":3,"verified_fuzzy":22},"total_outbound_references":32},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"thesis":"As of 12 August 2026, this Paper Citation Record lists 32 of 32 outbound references and 0 inbound Pith citation observations for arXiv:2501.10692."}