{"as_of":"2026-08-16T01:21:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:6dda1c2a0b0c2b1223183c12b6867069b01f72c241094c3207c669b9708971e9","coverage":[{"denominator":51,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":51,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T18:40:05.200664Z","state":"measured"},{"denominator":51,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":51,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.07744/citation-record","integrity":"/paper/2507.07744/integrity","json":"/paper/2507.07744/citation-record.json","paper":"/paper/2507.07744"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:40:12.296303Z","title":"Joint visual and audio learning for video highlight detection","venue":null,"work_id":"5412b76f-94e2-4680-9ee8-b309af022de7","year":2021},"citing_paper":{"arxiv_id":"2507.07744","last_updated":"2025-07-10T13:23:41Z","snapshot_observed_at":"2026-08-15T08:49:35.647249Z","submitted_at":"2025-07-10T13:23:41Z","title":"Sparse-Dense Side-Tuner for efficient Video Temporal Grounding","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T18:40:00.652223Z"},"links":{"citing_paper":"/paper/2507.07744"},"observation_digest":"sha256:ecee242da09edd4262b16b6a19de94b59600f58ef776f3e6a0c5bc9f42834a2f","observation_id":"c171e9f0-1219-48da-b4e1-b594575d6f54","resolution":{"observed_at":"2026-08-06T18:40:12.354245Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.13441","last_updated":"2024-12-18T02:23:33Z","snapshot_observed_at":"2026-08-11T14:35:15.381001Z","submitted_at":"2024-12-18T02:23:33Z","title":"FlashVTG: Feature Layering and Adaptive Score Handling Network for Video Temporal Grounding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.13441","snapshot_observed_at":"2026-08-06T18:40:00.715128Z","title":"Flashvtg: Feature layering and adaptive score handling network for video temporal grounding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.07744","last_updated":"2025-07-10T13:23:41Z","snapshot_observed_at":"2026-08-15T08:49:35.647249Z","submitted_at":"2025-07-10T13:23:41Z","title":"Sparse-Dense Side-Tuner for efficient Video Temporal Grounding","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T18:40:00.715128Z"},"links":{"cited_paper":"/paper/2412.13441","citing_paper":"/paper/2507.07744"},"observation_digest":"sha256:60cb8ecdd41ab5d4baa60a15d55c1faa58fde60fb052523496de9049ba9a1e5a","observation_id":"9dcd0f8f-f622-4c8e-b43a-e26cea825954","resolution":{"observed_at":"2026-08-06T18:40:00.715128Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:40:12.141032Z","title":"End-to- end object detection with transformers","venue":null,"work_id":"fb0ab3e2-27a4-432c-8a16-050f3d8a363f","year":2020},"citing_paper":{"arxiv_id":"2507.07744","last_updated":"2025-07-10T13:23:41Z","snapshot_observed_at":"2026-08-15T08:49:35.647249Z","submitted_at":"2025-07-10T13:23:41Z","title":"Sparse-Dense Side-Tuner for efficient Video Temporal Grounding","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T18:40:00.779071Z"},"links":{"citing_paper":"/paper/2507.07744"},"observation_digest":"sha256:03c2e1adb0aaf412f215e13cf5b3b71a1a2db91a38d020c776c5b4d15beea582","observation_id":"8c7eba0d-06a4-4bbc-842e-ddab6282ee95","resolution":{"observed_at":"2026-08-06T18:40:12.193724Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:40:00.848713Z","title":"Slowfast networks for video recognition","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.07744","last_updated":"2025-07-10T13:23:41Z","snapshot_observed_at":"2026-08-15T08:49:35.647249Z","submitted_at":"2025-07-10T13:23:41Z","title":"Sparse-Dense Side-Tuner for efficient Video Temporal Grounding","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T18:40:00.848713Z"},"links":{"citing_paper":"/paper/2507.07744"},"observation_digest":"sha256:aa2bbc3c1ce6b650951dc644e3913fe98085eb29e5abc6059f2b93ca4af36f46","observation_id":"654734bc-97cd-4a42-8fa6-90ae36976868","resolution":{"observed_at":"2026-08-06T18:40:00.848713Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:40:11.942244Z","title":"The use of ranks to avoid the assumption of normality implicit in the analysis of variance","venue":null,"work_id":"bf88692e-05cc-492a-b918-3fe1602ef3ae","year":1937},"citing_paper":{"arxiv_id":"2507.07744","last_updated":"2025-07-10T13:23:41Z","snapshot_observed_at":"2026-08-15T08:49:35.647249Z","submitted_at":"2025-07-10T13:23:41Z","title":"Sparse-Dense Side-Tuner for efficient Video Temporal Grounding","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T18:40:00.913841Z"},"links":{"citing_paper":"/paper/2507.07744"},"observation_digest":"sha256:153daae129fa8d1514d984d8d51336613592bc573b129c0d976202399b8304bb","observation_id":"75d26b24-e8b2-4486-8b32-79c9a7cc3419","resolution":{"observed_at":"2026-08-06T18:40:12.007086Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:40:11.777432Z","title":"Tall: Temporal activity localization via language query","venue":null,"work_id":"d1b325dc-a356-4846-8bd4-faa0fcb1114e","year":2017},"citing_paper":{"arxiv_id":"2507.07744","last_updated":"2025-07-10T13:23:41Z","snapshot_observed_at":"2026-08-15T08:49:35.647249Z","submitted_at":"2025-07-10T13:23:41Z","title":"Sparse-Dense Side-Tuner for efficient Video Temporal Grounding","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T18:40:00.995731Z"},"links":{"citing_paper":"/paper/2507.07744"},"observation_digest":"sha256:0da0822de6766b34b8f24fcf443174952473c5e51ee3cbff1dbf295e94f385ff","observation_id":"cdf82518-2ae2-4220-849a-0bf54a004368","resolution":{"observed_at":"2026-08-06T18:40:11.839389Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:40:11.573949Z","title":"Clip-adapter: Better vision-language models with fea- ture adapters","venue":null,"work_id":"986bbdff-ae91-4d18-8293-f2c4d14191e3","year":2024},"citing_paper":{"arxiv_id":"2507.07744","last_updated":"2025-07-10T13:23:41Z","snapshot_observed_at":"2026-08-15T08:49:35.647249Z","submitted_at":"2025-07-10T13:23:41Z","title":"Sparse-Dense Side-Tuner for efficient Video Temporal Grounding","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T18:40:01.076972Z"},"links":{"citing_paper":"/paper/2507.07744"},"observation_digest":"sha256:9b75b6423a7c5d4193bd96356a7bb21a4b2eb61bb603cff665358b5fd3b6017d","observation_id":"9e3b8fdc-7227-40c6-b3f7-6591f537a59f","resolution":{"observed_at":"2026-08-06T18:40:11.672575Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:40:01.160740Z","title":"Saliency-guided detr for mo- ment retrieval and highlight detection","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.07744","last_updated":"2025-07-10T13:23:41Z","snapshot_observed_at":"2026-08-15T08:49:35.647249Z","submitted_at":"2025-07-10T13:23:41Z","title":"Sparse-Dense Side-Tuner for efficient Video Temporal Grounding","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T18:40:01.160740Z"},"links":{"citing_paper":"/paper/2507.07744"},"observation_digest":"sha256:fc3a7dd4ff414d3a2e03a06dfe4239371397af07b82f19e3471e7a7e33b1f293","observation_id":"7058ff4b-37a9-4dfe-a399-c044ba2fbe00","resolution":{"observed_at":"2026-08-06T18:40:01.160740Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01282","last_updated":"2024-12-05T17:07:57Z","snapshot_observed_at":"2026-08-13T16:28:20.000738Z","submitted_at":"2024-04-01T17:54:34Z","title":"LoSA: Long-Short-range Adapter for Scaling End-to-End Temporal Action Localization","version":3},"cited_work":{"arxiv_id":"2404.01282","doi":null,"metadata_source":"pith","pith_arxiv_id":"2404.01282","snapshot_observed_at":"2026-08-06T18:40:05.880614Z","title":"LoSA: Long-Short-range Adapter for Scaling End-to-End Temporal Action Localization","venue":"cs.CV","work_id":"607c1e63-6753-4e8e-8cd0-179d4da2b247","year":2024},"citing_paper":{"arxiv_id":"2507.07744","last_updated":"2025-07-10T13:23:41Z","snapshot_observed_at":"2026-08-15T08:49:35.647249Z","submitted_at":"2025-07-10T13:23:41Z","title":"Sparse-Dense Side-Tuner for efficient Video Temporal Grounding","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T18:40:01.243689Z"},"links":{"cited_paper":"/paper/2404.01282","citing_paper":"/paper/2507.07744"},"observation_digest":"sha256:c9905b6abd08276aee41dbbb3d8cb8c1fe0ce2f760b61b1218f6c1b73ce45caf","observation_id":"a7a763af-351e-423e-b119-84f00fc9f336","resolution":{"observed_at":"2026-08-06T18:40:06.018099Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01745","last_updated":"2024-04-02T09:01:58Z","snapshot_observed_at":"2026-08-14T14:20:06.828645Z","submitted_at":"2024-04-02T09:01:58Z","title":"Unleash the Potential of CLIP for Video Highlight Detection","version":1},"cited_work":{"arxiv_id":"2404.01745","doi":null,"metadata_source":"pith","pith_arxiv_id":"2404.01745","snapshot_observed_at":"2026-08-06T18:40:05.709830Z","title":"Unleash the Potential of CLIP for Video Highlight Detection","venue":"cs.CV","work_id":"638570e5-894f-4927-bcab-550184a1809c","year":2024},"citing_paper":{"arxiv_id":"2507.07744","last_updated":"2025-07-10T13:23:41Z","snapshot_observed_at":"2026-08-15T08:49:35.647249Z","submitted_at":"2025-07-10T13:23:41Z","title":"Sparse-Dense Side-Tuner for efficient Video Temporal Grounding","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T18:40:01.315277Z"},"links":{"cited_paper":"/paper/2404.01745","citing_paper":"/paper/2507.07744"},"observation_digest":"sha256:fbeb28d564fcd12ac959327f89fbd0c6dfcf5436cb394b656fbf458799d6b838","observation_id":"be569355-1b5e-4e5e-9ee8-d15ddfbaf142","resolution":{"observed_at":"2026-08-06T18:40:05.757945Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.14608","last_updated":"2024-09-16T02:54:50Z","snapshot_observed_at":"2026-08-04T09:07:42.158421Z","submitted_at":"2024-03-21T17:55:50Z","title":"Parameter-Efficient Fine-Tuning for Large Models: A Comprehensive Survey","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.14608","snapshot_observed_at":"2026-08-06T18:40:01.379564Z","title":"Parameter-efficient fine-tuning for large models: A comprehensive survey","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.07744","last_updated":"2025-07-10T13:23:41Z","snapshot_observed_at":"2026-08-15T08:49:35.647249Z","submitted_at":"2025-07-10T13:23:41Z","title":"Sparse-Dense Side-Tuner for efficient Video Temporal Grounding","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T18:40:01.379564Z"},"links":{"cited_paper":"/paper/2403.14608","citing_paper":"/paper/2507.07744"},"observation_digest":"sha256:9ae7517abc839f594fc33845e1c51998c862d5b450d0eae0aa42d92805661179","observation_id":"c87d8e20-ff76-4ffa-8e6b-08460fe55dd3","resolution":{"observed_at":"2026-08-06T18:40:01.379564Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:40:11.384770Z","title":"Mini-net: Multiple instance ranking network for video highlight detection","venue":null,"work_id":"a4690fcf-72a7-458e-b989-b156bbf3fc92","year":2020},"citing_paper":{"arxiv_id":"2507.07744","last_updated":"2025-07-10T13:23:41Z","snapshot_observed_at":"2026-08-15T08:49:35.647249Z","submitted_at":"2025-07-10T13:23:41Z","title":"Sparse-Dense Side-Tuner for efficient Video Temporal Grounding","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T18:40:01.461875Z"},"links":{"citing_paper":"/paper/2507.07744"},"observation_digest":"sha256:2e0df25f34af33316403b0b5564c11ba26503d8f65aedfc49bc2d6832aa8f229","observation_id":"a5466ecd-48ef-446e-a5ba-6f557beac4a3","resolution":{"observed_at":"2026-08-06T18:40:11.490094Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:40:10.987435Z","title":"Fifth berkeley symposium on mathematical statistics and probability","venue":null,"work_id":"dedf910e-d964-4c79-9dc6-b7bfb7ffdb01","year":1967},"citing_paper":{"arxiv_id":"2507.07744","last_updated":"2025-07-10T13:23:41Z","snapshot_observed_at":"2026-08-15T08:49:35.647249Z","submitted_at":"2025-07-10T13:23:41Z","title":"Sparse-Dense Side-Tuner for efficient Video Temporal Grounding","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T18:40:01.530384Z"},"links":{"citing_paper":"/paper/2507.07744"},"observation_digest":"sha256:33c21bda2f1238628997e422ead6957b8f0c8e51a0480b682b1417bc67af40de","observation_id":"c99d1de7-495b-47b5-9e05-6b70969c5966","resolution":{"observed_at":"2026-08-06T18:40:11.152005Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:40:10.618574Z","title":"Knowing where to focus: Event-aware transformer for video grounding","venue":null,"work_id":"cb497fcb-71b0-45ab-8f01-b12c53eb3099","year":2023},"citing_paper":{"arxiv_id":"2507.07744","last_updated":"2025-07-10T13:23:41Z","snapshot_observed_at":"2026-08-15T08:49:35.647249Z","submitted_at":"2025-07-10T13:23:41Z","title":"Sparse-Dense Side-Tuner for efficient Video Temporal Grounding","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T18:40:01.644826Z"},"links":{"citing_paper":"/paper/2507.07744"},"observation_digest":"sha256:3f217421069b6d4fde519708c8f857761e9605eda39df1a920e07f7beee29da3","observation_id":"4bb2cb10-9f50-4a4e-b88b-35c86fc67807","resolution":{"observed_at":"2026-08-06T18:40:10.779308Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:40:10.247667Z","title":"Vi- sual prompt tuning","venue":null,"work_id":"61a6037f-6989-4da3-a834-a35e7b1cadc7","year":2022},"citing_paper":{"arxiv_id":"2507.07744","last_updated":"2025-07-10T13:23:41Z","snapshot_observed_at":"2026-08-15T08:49:35.647249Z","submitted_at":"2025-07-10T13:23:41Z","title":"Sparse-Dense Side-Tuner for efficient Video Temporal Grounding","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T18:40:01.720406Z"},"links":{"citing_paper":"/paper/2507.07744"},"observation_digest":"sha256:4286718bf575e6f6bf8795a52e6882a1ad49211a6df0e8eaf6c82dd1ae96ffea","observation_id":"d6455af2-90d2-4edc-8066-b87cf2bbe5d1","resolution":{"observed_at":"2026-08-06T18:40:10.378488Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1605.07648","last_updated":"2017-05-26T18:53:56Z","snapshot_observed_at":"2026-08-14T21:55:53.547322Z","submitted_at":"2016-05-24T20:28:53Z","title":"FractalNet: Ultra-Deep Neural Networks without Residuals","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1605.07648","snapshot_observed_at":"2026-08-06T18:40:01.791278Z","title":"Fractalnet: Ultra-deep neural networks without residuals","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2507.07744","last_updated":"2025-07-10T13:23:41Z","snapshot_observed_at":"2026-08-15T08:49:35.647249Z","submitted_at":"2025-07-10T13:23:41Z","title":"Sparse-Dense Side-Tuner for efficient Video Temporal Grounding","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T18:40:01.791278Z"},"links":{"cited_paper":"/paper/1605.07648","citing_paper":"/paper/2507.07744"},"observation_digest":"sha256:1575b279af61fc86eb0c1ce85b1c6240f1503065bb5e8e0aeb2945457eabda13","observation_id":"027ddf54-2842-4fb2-af89-78088e6f6da9","resolution":{"observed_at":"2026-08-06T18:40:01.791278Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:40:10.135500Z","title":"Bam-detr: Boundary- aligned moment detection transformer for temporal sentence grounding in videos","venue":null,"work_id":"a2346503-f59b-44d7-9d2f-e497e202feb9","year":2025},"citing_paper":{"arxiv_id":"2507.07744","last_updated":"2025-07-10T13:23:41Z","snapshot_observed_at":"2026-08-15T08:49:35.647249Z","submitted_at":"2025-07-10T13:23:41Z","title":"Sparse-Dense Side-Tuner for efficient Video Temporal Grounding","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T18:40:01.879168Z"},"links":{"citing_paper":"/paper/2507.07744"},"observation_digest":"sha256:eeffa8727924f94c7bc2ca9dde016f57b2c69318aa1dbd787f44a94b45b13065","observation_id":"1ade79a0-108e-4edd-aaba-28d11e4eb1c9","resolution":{"observed_at":"2026-08-06T18:40:10.187552Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:40:10.025842Z","title":"Detecting moments and highlights in videos via natural language queries","venue":null,"work_id":"fa13720e-2fd1-4ce8-a835-46f01bb8acf8","year":2021},"citing_paper":{"arxiv_id":"2507.07744","last_updated":"2025-07-10T13:23:41Z","snapshot_observed_at":"2026-08-15T08:49:35.647249Z","submitted_at":"2025-07-10T13:23:41Z","title":"Sparse-Dense Side-Tuner for efficient Video Temporal Grounding","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T18:40:02.017528Z"},"links":{"citing_paper":"/paper/2507.07744"},"observation_digest":"sha256:4bb56e84593bf5f81030ceaded415432e59a4557935e8e9d2903cdb4e909f979","observation_id":"26a573f4-6ffc-41d4-82b9-e287e889ca43","resolution":{"observed_at":"2026-08-06T18:40:10.085279Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:40:09.912017Z","title":"Dn-detr: Accelerate detr training by intro- ducing query denoising","venue":null,"work_id":"a185fa00-6880-4676-bb85-7b48ff30aed0","year":2022},"citing_paper":{"arxiv_id":"2507.07744","last_updated":"2025-07-10T13:23:41Z","snapshot_observed_at":"2026-08-15T08:49:35.647249Z","submitted_at":"2025-07-10T13:23:41Z","title":"Sparse-Dense Side-Tuner for efficient Video Temporal Grounding","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T18:40:02.079804Z"},"links":{"citing_paper":"/paper/2507.07744"},"observation_digest":"sha256:6087fbf9fc359f8561b77cb7188148d331ce25b9c77809db0d8926be07dbd369","observation_id":"ac65712d-020c-41bf-9d4c-13f2eb98229f","resolution":{"observed_at":"2026-08-06T18:40:09.967704Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:40:09.800527Z","title":"Univtg: Towards unified video- language temporal grounding","venue":null,"work_id":"b1a5c214-e622-4d1c-ba2c-8e02d0c43c93","year":2023},"citing_paper":{"arxiv_id":"2507.07744","last_updated":"2025-07-10T13:23:41Z","snapshot_observed_at":"2026-08-15T08:49:35.647249Z","submitted_at":"2025-07-10T13:23:41Z","title":"Sparse-Dense Side-Tuner for efficient Video Temporal Grounding","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T18:40:02.199351Z"},"links":{"citing_paper":"/paper/2507.07744"},"observation_digest":"sha256:21bbbc8f93e34848df2c8b5d6dd4e4a7fcc386dbf932e755861bc32cffe00916","observation_id":"b3a7ea83-9220-4053-984c-0aa808346661","resolution":{"observed_at":"2026-08-06T18:40:09.857558Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:40:02.316676Z","title":"Focal loss for dense object detection","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.07744","last_updated":"2025-07-10T13:23:41Z","snapshot_observed_at":"2026-08-15T08:49:35.647249Z","submitted_at":"2025-07-10T13:23:41Z","title":"Sparse-Dense Side-Tuner for efficient Video Temporal Grounding","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T18:40:02.316676Z"},"links":{"citing_paper":"/paper/2507.07744"},"observation_digest":"sha256:9fda5cc468f736317b6fd56b7c8ba3704a6d8000c61506b6adec50e2dd789514","observation_id":"beb6e54a-05e5-4ed0-927f-41a94c3afc0e","resolution":{"observed_at":"2026-08-06T18:40:02.316676Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:40:09.667596Z","title":"Frozen clip models are efficient video learners","venue":null,"work_id":"fef81fb3-632f-47f9-80da-a1ce3047c6cc","year":2022},"citing_paper":{"arxiv_id":"2507.07744","last_updated":"2025-07-10T13:23:41Z","snapshot_observed_at":"2026-08-15T08:49:35.647249Z","submitted_at":"2025-07-10T13:23:41Z","title":"Sparse-Dense Side-Tuner for efficient Video Temporal Grounding","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T18:40:02.409539Z"},"links":{"citing_paper":"/paper/2507.07744"},"observation_digest":"sha256:def5de3316b98215fa4896ee71ea140d4ecb211dc092d73e9678558c1e074d08","observation_id":"9d306071-2c72-4600-a409-34c126147cb0","resolution":{"observed_at":"2026-08-06T18:40:09.737363Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2201.12329","last_updated":"2022-03-30T16:04:38Z","snapshot_observed_at":"2026-08-15T19:00:22.576928Z","submitted_at":"2022-01-28T18:51:09Z","title":"DAB-DETR: Dynamic Anchor Boxes are Better Queries for DETR","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.12329","snapshot_observed_at":"2026-08-06T18:40:02.500974Z","title":"Dab-detr: Dynamic anchor boxes are better queries for detr","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.07744","last_updated":"2025-07-10T13:23:41Z","snapshot_observed_at":"2026-08-15T08:49:35.647249Z","submitted_at":"2025-07-10T13:23:41Z","title":"Sparse-Dense Side-Tuner for efficient Video Temporal Grounding","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T18:40:02.500974Z"},"links":{"cited_paper":"/paper/2201.12329","citing_paper":"/paper/2507.07744"},"observation_digest":"sha256:03e5cda3e9a1b4db6c12866510e158103332054971f0fc6974c2828e77daa461","observation_id":"f82a852d-52f8-4d0b-b24c-e873451843be","resolution":{"observed_at":"2026-08-06T18:40:02.500974Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:40:09.521738Z","title":"End-to-end temporal ac- tion detection with transformer.IEEE Transactions on Image Processing, 31:5427–5441, 2022","venue":null,"work_id":"bde2ac80-7ec5-42dd-b25b-735a831f1f5b","year":2022},"citing_paper":{"arxiv_id":"2507.07744","last_updated":"2025-07-10T13:23:41Z","snapshot_observed_at":"2026-08-15T08:49:35.647249Z","submitted_at":"2025-07-10T13:23:41Z","title":"Sparse-Dense Side-Tuner for efficient Video Temporal Grounding","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T18:40:02.567378Z"},"links":{"citing_paper":"/paper/2507.07744"},"observation_digest":"sha256:0e7b005805e22540868d4240c4ff23af79548c6298cd8cdce12c2cf60c64a8af","observation_id":"a4d84933-1429-4601-952d-6e011314d4f8","resolution":{"observed_at":"2026-08-06T18:40:09.576985Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.00801","last_updated":"2024-07-21T16:17:07Z","snapshot_observed_at":"2026-08-13T00:40:28.454615Z","submitted_at":"2024-03-31T21:17:48Z","title":"$R^2$-Tuning: Efficient Image-to-Video Transfer Learning for Video Temporal Grounding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.00801","snapshot_observed_at":"2026-08-06T18:40:02.643521Z","title":"arXiv preprint arXiv:2404.00801, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.07744","last_updated":"2025-07-10T13:23:41Z","snapshot_observed_at":"2026-08-15T08:49:35.647249Z","submitted_at":"2025-07-10T13:23:41Z","title":"Sparse-Dense Side-Tuner for efficient Video Temporal Grounding","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T18:40:02.643521Z"},"links":{"cited_paper":"/paper/2404.00801","citing_paper":"/paper/2507.07744"},"observation_digest":"sha256:039922655ab62419cffdb5b1c1beef11f72fcbd8ce5ae4b20e16d7a9a5898e32","observation_id":"962d6db7-09bb-4a60-9218-3d4e5fe0ff3f","resolution":{"observed_at":"2026-08-06T18:40:02.643521Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:40:09.424672Z","title":"Umt: Unified multi-modal transformers for joint video moment retrieval and highlight detection","venue":null,"work_id":"36c2820d-9309-4095-8bea-d2da77d17bf3","year":2022},"citing_paper":{"arxiv_id":"2507.07744","last_updated":"2025-07-10T13:23:41Z","snapshot_observed_at":"2026-08-15T08:49:35.647249Z","submitted_at":"2025-07-10T13:23:41Z","title":"Sparse-Dense Side-Tuner for efficient Video Temporal Grounding","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T18:40:02.714083Z"},"links":{"citing_paper":"/paper/2507.07744"},"observation_digest":"sha256:2b76e5a8ccd9bc02e7232f6e882a857b131059f853266dbbab6e6457da63a2cb","observation_id":"4bb7e029-ef6d-4f59-977d-318d65752d03","resolution":{"observed_at":"2026-08-06T18:40:09.450671Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.14505","last_updated":"2024-11-21T09:34:23Z","snapshot_observed_at":"2026-08-14T07:55:35.415892Z","submitted_at":"2024-11-21T09:34:23Z","title":"LLaVA-MR: Large Language-and-Vision Assistant for Video Moment Retrieval","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.14505","snapshot_observed_at":"2026-08-06T18:40:02.771931Z","title":"Llava-mr: Large language-and- vision assistant for video moment retrieval","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.07744","last_updated":"2025-07-10T13:23:41Z","snapshot_observed_at":"2026-08-15T08:49:35.647249Z","submitted_at":"2025-07-10T13:23:41Z","title":"Sparse-Dense Side-Tuner for efficient Video Temporal Grounding","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T18:40:02.771931Z"},"links":{"cited_paper":"/paper/2411.14505","citing_paper":"/paper/2507.07744"},"observation_digest":"sha256:121a18032b847b888222e5baa5818be4375cd77141ef7e17776c638924699cf0","observation_id":"34b3b1a3-7981-425a-a102-7663f633fb81","resolution":{"observed_at":"2026-08-06T18:40:02.771931Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:40:02.837075Z","title":"The surprising effectiveness of multimodal large language models for video moment retrieval","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.07744","last_updated":"2025-07-10T13:23:41Z","snapshot_observed_at":"2026-08-15T08:49:35.647249Z","submitted_at":"2025-07-10T13:23:41Z","title":"Sparse-Dense Side-Tuner for efficient Video Temporal Grounding","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T18:40:02.837075Z"},"links":{"citing_paper":"/paper/2507.07744"},"observation_digest":"sha256:c941a4176b20e9fda6a86d764f0c6188a23d91f08682303254bb1501673ef4aa","observation_id":"d8b4e273-c1b5-45ef-b906-8cbe788b8875","resolution":{"observed_at":"2026-08-06T18:40:02.837075Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:40:09.286289Z","title":"Correlation-guided query-dependency calibration in video representation learning for temporal grounding.CoRR, 2023","venue":null,"work_id":"9e659a63-7f48-4f02-ae20-5516df10e471","year":2023},"citing_paper":{"arxiv_id":"2507.07744","last_updated":"2025-07-10T13:23:41Z","snapshot_observed_at":"2026-08-15T08:49:35.647249Z","submitted_at":"2025-07-10T13:23:41Z","title":"Sparse-Dense Side-Tuner for efficient Video Temporal Grounding","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T18:40:02.921358Z"},"links":{"citing_paper":"/paper/2507.07744"},"observation_digest":"sha256:53405ac1789a42d8012be126099a843c9c57c9ee4a703904a16f53def87c371e","observation_id":"f40d9eda-caae-4d09-a7d6-9c140d7b66e5","resolution":{"observed_at":"2026-08-06T18:40:09.354168Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:40:09.153141Z","title":"Query-dependent video representa- tion for moment retrieval and highlight detection","venue":null,"work_id":"67addb96-0a87-42d5-8904-453932bd8835","year":2023},"citing_paper":{"arxiv_id":"2507.07744","last_updated":"2025-07-10T13:23:41Z","snapshot_observed_at":"2026-08-15T08:49:35.647249Z","submitted_at":"2025-07-10T13:23:41Z","title":"Sparse-Dense Side-Tuner for efficient Video Temporal Grounding","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T18:40:03.042994Z"},"links":{"citing_paper":"/paper/2507.07744"},"observation_digest":"sha256:598c6265aeadc7087fb06110d23b68b98a89610101e4a8682bc44581bb8493a0","observation_id":"96ce5b25-054a-4166-a25e-886ed9a96a9b","resolution":{"observed_at":"2026-08-06T18:40:09.205916Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1807.03748","last_updated":"2019-01-22T18:47:12Z","snapshot_observed_at":"2026-08-14T18:53:38.574749Z","submitted_at":"2018-07-10T16:52:11Z","title":"Representation Learning with Contrastive Predictive Coding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1807.03748","snapshot_observed_at":"2026-08-06T18:40:03.121427Z","title":"Repre- sentation learning with contrastive predictive coding","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.07744","last_updated":"2025-07-10T13:23:41Z","snapshot_observed_at":"2026-08-15T08:49:35.647249Z","submitted_at":"2025-07-10T13:23:41Z","title":"Sparse-Dense Side-Tuner for efficient Video Temporal Grounding","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T18:40:03.121427Z"},"links":{"cited_paper":"/paper/1807.03748","citing_paper":"/paper/2507.07744"},"observation_digest":"sha256:de712305ca7ac7832c1b1487f1028fecf2ed4c953be96fcc89c0efb1e92f85a5","observation_id":"dd6a6245-faf9-4110-ad95-d857ae3466e3","resolution":{"observed_at":"2026-08-06T18:40:03.121427Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:40:08.972633Z","title":"St-adapter: Parameter-efficient image-to-video transfer learning","venue":null,"work_id":"0216f0e6-428b-477f-b995-f270f5f1bd42","year":2022},"citing_paper":{"arxiv_id":"2507.07744","last_updated":"2025-07-10T13:23:41Z","snapshot_observed_at":"2026-08-15T08:49:35.647249Z","submitted_at":"2025-07-10T13:23:41Z","title":"Sparse-Dense Side-Tuner for efficient Video Temporal Grounding","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T18:40:03.202428Z"},"links":{"citing_paper":"/paper/2507.07744"},"observation_digest":"sha256:b5fba72b5e0c7337ada97ec6b252a83d20cfd37609f6aaaf0795e113d031ac9f","observation_id":"da0e6ad1-6cb4-4050-8c67-39d70e34a7a4","resolution":{"observed_at":"2026-08-06T18:40:09.051372Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:40:08.772159Z","title":"Sada: Semantic adversarial unsupervised domain adaptation for temporal action localization","venue":null,"work_id":"5a5b2b29-b4f6-4b42-80d4-3421e29fa896","year":2025},"citing_paper":{"arxiv_id":"2507.07744","last_updated":"2025-07-10T13:23:41Z","snapshot_observed_at":"2026-08-15T08:49:35.647249Z","submitted_at":"2025-07-10T13:23:41Z","title":"Sparse-Dense Side-Tuner for efficient Video Temporal Grounding","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T18:40:03.289501Z"},"links":{"citing_paper":"/paper/2507.07744"},"observation_digest":"sha256:fbef8affa97563b045e7c4768212c5177ecaaf745e03f495914e83bd32f5cbae","observation_id":"0019f4b3-10f4-4eb8-81ba-ed5f4fb2d95c","resolution":{"observed_at":"2026-08-06T18:40:08.867577Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:40:08.558928Z","title":"Disentangling spatial and temporal learning for efficient image-to-video transfer learning","venue":null,"work_id":"f701f999-a236-42a3-859e-7044e8087e39","year":2023},"citing_paper":{"arxiv_id":"2507.07744","last_updated":"2025-07-10T13:23:41Z","snapshot_observed_at":"2026-08-15T08:49:35.647249Z","submitted_at":"2025-07-10T13:23:41Z","title":"Sparse-Dense Side-Tuner for efficient Video Temporal Grounding","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T18:40:03.370771Z"},"links":{"citing_paper":"/paper/2507.07744"},"observation_digest":"sha256:12dbd7b381882f9cb1d937fc69535f2f902a94cda51c3021277a4711a5386495","observation_id":"d16eecaf-28d0-4610-b94b-afdcbbaf92c1","resolution":{"observed_at":"2026-08-06T18:40:08.643095Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:40:03.510044Z","title":"Learning transferable visual models from natural language supervi- sion","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.07744","last_updated":"2025-07-10T13:23:41Z","snapshot_observed_at":"2026-08-15T08:49:35.647249Z","submitted_at":"2025-07-10T13:23:41Z","title":"Sparse-Dense Side-Tuner for efficient Video Temporal Grounding","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T18:40:03.510044Z"},"links":{"citing_paper":"/paper/2507.07744"},"observation_digest":"sha256:873b95696c49ec8db690d8c18f86165c65829620d28c597672007ca206a958e8","observation_id":"ed20371f-0403-4410-b007-1bdccf5441a7","resolution":{"observed_at":"2026-08-06T18:40:03.510044Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:40:08.357804Z","title":"Coherent multi-sentence video description with variable level of detail","venue":null,"work_id":"b2bb8ee4-c422-49eb-bef0-756a2072d0f7","year":2014},"citing_paper":{"arxiv_id":"2507.07744","last_updated":"2025-07-10T13:23:41Z","snapshot_observed_at":"2026-08-15T08:49:35.647249Z","submitted_at":"2025-07-10T13:23:41Z","title":"Sparse-Dense Side-Tuner for efficient Video Temporal Grounding","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T18:40:03.632073Z"},"links":{"citing_paper":"/paper/2507.07744"},"observation_digest":"sha256:b24db49526861d6b260312a0c9807c77e46716eff4f6159619e85417db234916","observation_id":"cc3e3217-270b-42e1-b80f-c8f76e0fb56f","resolution":{"observed_at":"2026-08-06T18:40:08.444433Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:40:08.202270Z","title":"Ranking domain- specific highlights by analyzing edited videos","venue":null,"work_id":"8f3b0e4d-106e-4818-a527-1b8560303a8b","year":2014},"citing_paper":{"arxiv_id":"2507.07744","last_updated":"2025-07-10T13:23:41Z","snapshot_observed_at":"2026-08-15T08:49:35.647249Z","submitted_at":"2025-07-10T13:23:41Z","title":"Sparse-Dense Side-Tuner for efficient Video Temporal Grounding","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T18:40:03.734332Z"},"links":{"citing_paper":"/paper/2507.07744"},"observation_digest":"sha256:250a96e4c7b6720c516ab45f8713013a6718339419fd06d626ed5e939717bbdc","observation_id":"22c1ed98-f3ce-4cd9-ae74-f64b4bd54f25","resolution":{"observed_at":"2026-08-06T18:40:08.271012Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:40:08.052256Z","title":"Lst: Lad- der side-tuning for parameter and memory efficient transfer learning","venue":null,"work_id":"797a76cf-2290-4132-aa84-592c1941f70d","year":2022},"citing_paper":{"arxiv_id":"2507.07744","last_updated":"2025-07-10T13:23:41Z","snapshot_observed_at":"2026-08-15T08:49:35.647249Z","submitted_at":"2025-07-10T13:23:41Z","title":"Sparse-Dense Side-Tuner for efficient Video Temporal Grounding","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T18:40:03.833480Z"},"links":{"citing_paper":"/paper/2507.07744"},"observation_digest":"sha256:581d2e29aa0fb8032fd8b7a777b09d364adb8afdc4dd496804def55521a5ddfa","observation_id":"55b6973d-c485-45ac-9314-207f4d83df5b","resolution":{"observed_at":"2026-08-06T18:40:08.112200Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:40:03.914238Z","title":"Attention is all you need","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.07744","last_updated":"2025-07-10T13:23:41Z","snapshot_observed_at":"2026-08-15T08:49:35.647249Z","submitted_at":"2025-07-10T13:23:41Z","title":"Sparse-Dense Side-Tuner for efficient Video Temporal Grounding","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T18:40:03.914238Z"},"links":{"citing_paper":"/paper/2507.07744"},"observation_digest":"sha256:84bf63aaae192a585fc00608e9b6d9e4a81879e973d8fbe58a18773e554e8f47","observation_id":"0afbd36f-a5ef-489d-9838-1bf659250beb","resolution":{"observed_at":"2026-08-06T18:40:03.914238Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:40:07.846964Z","title":"Internvideo2: Scaling foundation models for mul- timodal video understanding","venue":null,"work_id":"130ebf44-392f-465d-adf2-2e03c3ce223a","year":2025},"citing_paper":{"arxiv_id":"2507.07744","last_updated":"2025-07-10T13:23:41Z","snapshot_observed_at":"2026-08-15T08:49:35.647249Z","submitted_at":"2025-07-10T13:23:41Z","title":"Sparse-Dense Side-Tuner for efficient Video Temporal Grounding","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T18:40:04.067540Z"},"links":{"citing_paper":"/paper/2507.07744"},"observation_digest":"sha256:6c9cc9a8945dc742cbf63c31d6c65fd31c8a9a924c18bd07e8189e2acf2872dd","observation_id":"dc814c50-2861-428e-a020-1ced0515292a","resolution":{"observed_at":"2026-08-06T18:40:07.944574Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.03191","last_updated":"2022-12-07T12:20:55Z","snapshot_observed_at":"2026-07-06T14:27:34.639236Z","submitted_at":"2022-12-06T18:09:49Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.03191","snapshot_observed_at":"2026-08-06T18:40:04.192757Z","title":"Internvideo: General video foundation models via generative and discriminative learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.07744","last_updated":"2025-07-10T13:23:41Z","snapshot_observed_at":"2026-08-15T08:49:35.647249Z","submitted_at":"2025-07-10T13:23:41Z","title":"Sparse-Dense Side-Tuner for efficient Video Temporal Grounding","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T18:40:04.192757Z"},"links":{"cited_paper":"/paper/2212.03191","citing_paper":"/paper/2507.07744"},"observation_digest":"sha256:a2e6bf38b09e247054eb18a1a90f2b5fd1325b530987b7f22b5efeeef70f60c6","observation_id":"dae05960-f941-4840-985e-c37e44273954","resolution":{"observed_at":"2026-08-06T18:40:04.192757Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:40:07.592539Z","title":"Vision transformer with deformable attention","venue":null,"work_id":"697bcbe4-3f46-4e72-9760-d8a7c454d2a0","year":2022},"citing_paper":{"arxiv_id":"2507.07744","last_updated":"2025-07-10T13:23:41Z","snapshot_observed_at":"2026-08-15T08:49:35.647249Z","submitted_at":"2025-07-10T13:23:41Z","title":"Sparse-Dense Side-Tuner for efficient Video Temporal Grounding","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T18:40:04.293577Z"},"links":{"citing_paper":"/paper/2507.07744"},"observation_digest":"sha256:c7f601fec6e76dedd57b4375142d344cf64b7e00d8244e4fe2ee5f3b5355b253","observation_id":"fcaac928-c242-44ff-ba16-b035f1054970","resolution":{"observed_at":"2026-08-06T18:40:07.710516Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:40:07.422099Z","title":"Bridging the gap: A unified video comprehension framework for mo- ment retrieval and highlight detection","venue":null,"work_id":"59477921-f354-4b1f-a719-6aed9e3d6899","year":2024},"citing_paper":{"arxiv_id":"2507.07744","last_updated":"2025-07-10T13:23:41Z","snapshot_observed_at":"2026-08-15T08:49:35.647249Z","submitted_at":"2025-07-10T13:23:41Z","title":"Sparse-Dense Side-Tuner for efficient Video Temporal Grounding","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T18:40:04.371035Z"},"links":{"citing_paper":"/paper/2507.07744"},"observation_digest":"sha256:abb8b13ae28577a0bba277fee04867ad254d5493ace37fbe5cb8e8176f5ad18f","observation_id":"6e3c69d9-d6f6-42f5-b21b-21bce7ccd6d1","resolution":{"observed_at":"2026-08-06T18:40:07.511209Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:40:07.220937Z","title":"Cross-category video high- light detection via set-based learning","venue":null,"work_id":"3dc7c427-be46-41d2-968e-4e3ccf24132d","year":2021},"citing_paper":{"arxiv_id":"2507.07744","last_updated":"2025-07-10T13:23:41Z","snapshot_observed_at":"2026-08-15T08:49:35.647249Z","submitted_at":"2025-07-10T13:23:41Z","title":"Sparse-Dense Side-Tuner for efficient Video Temporal Grounding","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T18:40:04.445706Z"},"links":{"citing_paper":"/paper/2507.07744"},"observation_digest":"sha256:d5165cd6d4dab419b56f221372424d1c89e51f06fa19c738c4ba786f6d1fccb5","observation_id":"542b7c04-9546-4022-bcc1-47839712a2bf","resolution":{"observed_at":"2026-08-06T18:40:07.318203Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:40:07.007740Z","title":"Unloc: A unified framework for video localiza- tion tasks","venue":null,"work_id":"55bd189c-3add-4e60-bc57-42001fc66b46","year":2023},"citing_paper":{"arxiv_id":"2507.07744","last_updated":"2025-07-10T13:23:41Z","snapshot_observed_at":"2026-08-15T08:49:35.647249Z","submitted_at":"2025-07-10T13:23:41Z","title":"Sparse-Dense Side-Tuner for efficient Video Temporal Grounding","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T18:40:04.563858Z"},"links":{"citing_paper":"/paper/2507.07744"},"observation_digest":"sha256:ad28387b60c4c11391136c0d92958e3b5bf59c848a41f1f28446811b5f577bf9","observation_id":"f6177304-f351-4ff1-9927-97870806d7c9","resolution":{"observed_at":"2026-08-06T18:40:07.110265Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:40:06.819867Z","title":"Understanding negative sampling in graph representation learning","venue":null,"work_id":"2249baf2-0715-4564-8a00-8435b21c5ccf","year":2020},"citing_paper":{"arxiv_id":"2507.07744","last_updated":"2025-07-10T13:23:41Z","snapshot_observed_at":"2026-08-15T08:49:35.647249Z","submitted_at":"2025-07-10T13:23:41Z","title":"Sparse-Dense Side-Tuner for efficient Video Temporal Grounding","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T18:40:04.698446Z"},"links":{"citing_paper":"/paper/2507.07744"},"observation_digest":"sha256:f9296412bb64a346a47f895140653a7e42159d164dcf4a0b7fefb863b4ca6119","observation_id":"15576df0-3d5b-4402-aa8c-5705814ab4a4","resolution":{"observed_at":"2026-08-06T18:40:06.893073Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:40:06.658393Z","title":"Parameter-efficient is not sufficient: Exploring parame- ter, memory, and time efficient adapter tuning for dense pre- dictions","venue":null,"work_id":"8c75f669-f5e0-4bbb-9642-6186e975c31c","year":2024},"citing_paper":{"arxiv_id":"2507.07744","last_updated":"2025-07-10T13:23:41Z","snapshot_observed_at":"2026-08-15T08:49:35.647249Z","submitted_at":"2025-07-10T13:23:41Z","title":"Sparse-Dense Side-Tuner for efficient Video Temporal Grounding","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T18:40:04.818146Z"},"links":{"citing_paper":"/paper/2507.07744"},"observation_digest":"sha256:00258cf457f46c921a0cb125674783e5905aeee99a65ac2c4cb2390fa4a20f2d","observation_id":"a89e8865-aa01-4c01-bda5-86a15edc9dd0","resolution":{"observed_at":"2026-08-06T18:40:06.739159Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.03605","last_updated":"2022-07-11T10:30:29Z","snapshot_observed_at":"2026-08-07T03:38:32.486362Z","submitted_at":"2022-03-07T18:55:26Z","title":"DINO: DETR with Improved DeNoising Anchor Boxes for End-to-End Object Detection","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.03605","snapshot_observed_at":"2026-08-06T18:40:04.919669Z","title":"Dino: Detr with improved denoising anchor boxes for end-to-end object detection","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.07744","last_updated":"2025-07-10T13:23:41Z","snapshot_observed_at":"2026-08-15T08:49:35.647249Z","submitted_at":"2025-07-10T13:23:41Z","title":"Sparse-Dense Side-Tuner for efficient Video Temporal Grounding","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T18:40:04.919669Z"},"links":{"cited_paper":"/paper/2203.03605","citing_paper":"/paper/2507.07744"},"observation_digest":"sha256:1a8452f0e2e72f41aa4de8ea2e4545d174f23662cce1d16458a2be2e4f4613fb","observation_id":"d05ac6e5-583e-49f8-a42f-a901e059b357","resolution":{"observed_at":"2026-08-06T18:40:04.919669Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:40:06.449038Z","title":"Conditional prompt learning for vision-language mod- els","venue":null,"work_id":"7cebce8a-87f6-475d-8fce-bf1ed70ac200","year":2022},"citing_paper":{"arxiv_id":"2507.07744","last_updated":"2025-07-10T13:23:41Z","snapshot_observed_at":"2026-08-15T08:49:35.647249Z","submitted_at":"2025-07-10T13:23:41Z","title":"Sparse-Dense Side-Tuner for efficient Video Temporal Grounding","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T18:40:05.020736Z"},"links":{"citing_paper":"/paper/2507.07744"},"observation_digest":"sha256:048244948068d9793521375788e8724e8d66a797bd9cc95b147b05c4628c372b","observation_id":"f196f109-36e6-44b2-a4b1-68282aa34209","resolution":{"observed_at":"2026-08-06T18:40:06.521597Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.04159","last_updated":"2021-03-18T03:14:26Z","snapshot_observed_at":"2026-08-13T17:54:01.724774Z","submitted_at":"2020-10-08T17:59:21Z","title":"Deformable DETR: Deformable Transformers for End-to-End Object Detection","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.04159","snapshot_observed_at":"2026-08-06T18:40:05.125881Z","title":"Deformable detr: Deformable trans- formers for end-to-end object detection","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2507.07744","last_updated":"2025-07-10T13:23:41Z","snapshot_observed_at":"2026-08-15T08:49:35.647249Z","submitted_at":"2025-07-10T13:23:41Z","title":"Sparse-Dense Side-Tuner for efficient Video Temporal Grounding","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T18:40:05.125881Z"},"links":{"cited_paper":"/paper/2010.04159","citing_paper":"/paper/2507.07744"},"observation_digest":"sha256:7315160dc8178f60306db76ee3aaa04829914789a910221e961bd87a853e7707","observation_id":"93b92d5b-bd99-4e09-8c12-71c2c64db6fa","resolution":{"observed_at":"2026-08-06T18:40:05.125881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:40:06.260039Z","title":"Notably, these losses are applied to all the intermediate layers inde- pendently","venue":null,"work_id":"d733a1dd-713e-42d7-ad42-dceec31795ba","year":null},"citing_paper":{"arxiv_id":"2507.07744","last_updated":"2025-07-10T13:23:41Z","snapshot_observed_at":"2026-08-15T08:49:35.647249Z","submitted_at":"2025-07-10T13:23:41Z","title":"Sparse-Dense Side-Tuner for efficient Video Temporal Grounding","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T18:40:05.200664Z"},"links":{"citing_paper":"/paper/2507.07744"},"observation_digest":"sha256:4a6570de3e540b4f6dd0bc0f7a018ce55ec245ad342c25a7806a7251fa7a66c5","observation_id":"60b4fea0-4029-4292-816c-9e4963f77bea","resolution":{"observed_at":"2026-08-06T18:40:06.366128Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.07744","last_updated":"2025-07-10T13:23:41Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-15T08:49:35.647249Z","submitted_at":"2025-07-10T13:23:41Z","title":"Sparse-Dense Side-Tuner for efficient Video Temporal Grounding"},"reference_resolution":{"displayed":51,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":16,"verified_exact":2,"verified_fuzzy":32},"total_outbound_references":51},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 16 August 2026, this Paper Citation Record lists 51 of 51 outbound references and 0 inbound Pith citation observations for arXiv:2507.07744."}