{"as_of":"2026-08-09T22:54:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:eb82e6fbd078526ed4f7ce55d22f6ca3aa191acfdde7a19fec5951d3cc7f59cd","coverage":[{"denominator":45,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":45,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T19:16:28.215749Z","state":"measured"},{"denominator":45,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":45,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.04676/citation-record","integrity":"/paper/2608.04676/integrity","json":"/paper/2608.04676/citation-record.json","paper":"/paper/2608.04676"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:16:28.752889Z","title":"Surgical data science for next-generation interventions,","venue":null,"work_id":"7bb50265-faac-4014-be67-d52e26d462e5","year":null},"citing_paper":{"arxiv_id":"2608.04676","last_updated":"2026-08-05T10:39:19Z","snapshot_observed_at":"2026-08-09T21:48:13.774740Z","submitted_at":"2026-08-05T10:39:19Z","title":"SurgNarrator: A Generative Retrieval Framework for Surgical Video Understanding","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T19:16:25.213092Z"},"links":{"citing_paper":"/paper/2608.04676"},"observation_digest":"sha256:b3c3d300ef596c2ca55b82be36ce4ece542dfea75d39224d0a9b1acf7d85c4a7","observation_id":"e2be2d6c-d7d2-404d-9540-e7edff2f0449","resolution":{"observed_at":"2026-08-06T19:16:28.755157Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:16:28.745828Z","title":"Endonet: a deep architecture for recognition tasks on laparoscopic videos,","venue":null,"work_id":"e1dc66f0-869c-45ad-a818-cdbdfe1cb056","year":2016},"citing_paper":{"arxiv_id":"2608.04676","last_updated":"2026-08-05T10:39:19Z","snapshot_observed_at":"2026-08-09T21:48:13.774740Z","submitted_at":"2026-08-05T10:39:19Z","title":"SurgNarrator: A Generative Retrieval Framework for Surgical Video Understanding","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T19:16:25.340012Z"},"links":{"citing_paper":"/paper/2608.04676"},"observation_digest":"sha256:086fc0c6d3e05ecf2baf395ec43c44e928be8795bb436862cfcd91d05a89f349","observation_id":"7545cd78-8138-4c02-bcdd-4d06f27ac506","resolution":{"observed_at":"2026-08-06T19:16:28.748142Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:16:28.738238Z","title":"Tecno: Surgical phase recognition with multi-stage temporal convolutional networks,","venue":null,"work_id":"ccbc766f-fecc-4b0d-9248-9717cb1eee33","year":2020},"citing_paper":{"arxiv_id":"2608.04676","last_updated":"2026-08-05T10:39:19Z","snapshot_observed_at":"2026-08-09T21:48:13.774740Z","submitted_at":"2026-08-05T10:39:19Z","title":"SurgNarrator: A Generative Retrieval Framework for Surgical Video Understanding","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T19:16:25.413795Z"},"links":{"citing_paper":"/paper/2608.04676"},"observation_digest":"sha256:4834371c25877ddba44ca10c05f580d0b847295f98bfc9a6d0bff91a91c768ef","observation_id":"34d8358b-ff26-48b5-99a3-0b761d0e8e69","resolution":{"observed_at":"2026-08-06T19:16:28.740863Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:16:28.731812Z","title":"Video-based surgical skill assessment using 3d convolutional neural networks,","venue":null,"work_id":"7acb4476-6c8e-4981-bc50-4f01f4fabc30","year":2019},"citing_paper":{"arxiv_id":"2608.04676","last_updated":"2026-08-05T10:39:19Z","snapshot_observed_at":"2026-08-09T21:48:13.774740Z","submitted_at":"2026-08-05T10:39:19Z","title":"SurgNarrator: A Generative Retrieval Framework for Surgical Video Understanding","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T19:16:25.500056Z"},"links":{"citing_paper":"/paper/2608.04676"},"observation_digest":"sha256:adc579b3e545ebdd4beba9bc4c18a8a2d652ba9cea3b3f6a90eec8c08747fd67","observation_id":"4bcd1036-cd5b-4497-90c0-de491d1f4751","resolution":{"observed_at":"2026-08-06T19:16:28.734102Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:16:28.724850Z","title":"CholecTriplet2021: A benchmark challenge for surgical action triplet recognition,","venue":null,"work_id":"69827740-15e8-424a-985b-daa259105711","year":2023},"citing_paper":{"arxiv_id":"2608.04676","last_updated":"2026-08-05T10:39:19Z","snapshot_observed_at":"2026-08-09T21:48:13.774740Z","submitted_at":"2026-08-05T10:39:19Z","title":"SurgNarrator: A Generative Retrieval Framework for Surgical Video Understanding","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T19:16:25.596898Z"},"links":{"citing_paper":"/paper/2608.04676"},"observation_digest":"sha256:22adbe3c25731adea1b10288b327dfb7684731f21513f995e64f0f1951d4dd4e","observation_id":"e9b20194-0d7c-422f-bfa3-ffda191bbed4","resolution":{"observed_at":"2026-08-06T19:16:28.727323Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:16:25.673883Z","title":"Video-chatgpt: Towards detailed video understanding via large vision and language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.04676","last_updated":"2026-08-05T10:39:19Z","snapshot_observed_at":"2026-08-09T21:48:13.774740Z","submitted_at":"2026-08-05T10:39:19Z","title":"SurgNarrator: A Generative Retrieval Framework for Surgical Video Understanding","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T19:16:25.673883Z"},"links":{"citing_paper":"/paper/2608.04676"},"observation_digest":"sha256:e07adab0c0ab2d37c7a75d2fead455ff05396a5d932265b895c972221ccb7016","observation_id":"e38d567c-3cda-48ff-ad78-710b39afe4f8","resolution":{"observed_at":"2026-08-06T19:16:25.673883Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:16:28.714438Z","title":"Video-llama: An instruction-tuned audio- visual language model for video understanding,","venue":null,"work_id":"6fd730c4-1e1a-481b-89e3-40ce33b2e2e3","year":2023},"citing_paper":{"arxiv_id":"2608.04676","last_updated":"2026-08-05T10:39:19Z","snapshot_observed_at":"2026-08-09T21:48:13.774740Z","submitted_at":"2026-08-05T10:39:19Z","title":"SurgNarrator: A Generative Retrieval Framework for Surgical Video Understanding","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T19:16:25.735796Z"},"links":{"citing_paper":"/paper/2608.04676"},"observation_digest":"sha256:5286f065d7079368c2f298eb7e5bf2c26060963f2c72edbc4f625fc44c962996","observation_id":"dccb5b83-a69b-4fd6-9169-ba64bda48ed0","resolution":{"observed_at":"2026-08-06T19:16:28.716805Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.07981","last_updated":"2024-08-15T07:00:20Z","snapshot_observed_at":"2026-07-06T19:00:57.743738Z","submitted_at":"2024-08-15T07:00:20Z","title":"LLaVA-Surg: Towards Multimodal Surgical Assistant via Structured Surgical Video Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.07981","snapshot_observed_at":"2026-08-06T19:16:25.817758Z","title":"Llava-surg: towards multimodal surgical assistant via structured surgical video learning,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.04676","last_updated":"2026-08-05T10:39:19Z","snapshot_observed_at":"2026-08-09T21:48:13.774740Z","submitted_at":"2026-08-05T10:39:19Z","title":"SurgNarrator: A Generative Retrieval Framework for Surgical Video Understanding","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T19:16:25.817758Z"},"links":{"cited_paper":"/paper/2408.07981","citing_paper":"/paper/2608.04676"},"observation_digest":"sha256:883ee800c81a5debcbe4d048ee5c911c9f0ced88d2e892fe704d205adc1ffd27","observation_id":"52df1f1f-d3bb-4de4-a904-d81aeb361ad1","resolution":{"observed_at":"2026-08-06T19:16:25.817758Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-06T19:16:25.906461Z","title":"The llama 3 herd of models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.04676","last_updated":"2026-08-05T10:39:19Z","snapshot_observed_at":"2026-08-09T21:48:13.774740Z","submitted_at":"2026-08-05T10:39:19Z","title":"SurgNarrator: A Generative Retrieval Framework for Surgical Video Understanding","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T19:16:25.906461Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2608.04676"},"observation_digest":"sha256:1594ae5ba786775c51a2126d8aa965208a54fedc3301a4c41eed7609bec64b28","observation_id":"ce833c7e-a201-4594-9eb8-9a9393cc7180","resolution":{"observed_at":"2026-08-06T19:16:25.906461Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-06T19:16:25.987066Z","title":"Qwen3 technical report,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.04676","last_updated":"2026-08-05T10:39:19Z","snapshot_observed_at":"2026-08-09T21:48:13.774740Z","submitted_at":"2026-08-05T10:39:19Z","title":"SurgNarrator: A Generative Retrieval Framework for Surgical Video Understanding","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T19:16:25.987066Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2608.04676"},"observation_digest":"sha256:b48f4f77f3801def6a529e26f26b71a468be5527d02bcc55235d0a42dd46a2f1","observation_id":"86ace567-1834-4723-bbac-37c8e287b10a","resolution":{"observed_at":"2026-08-06T19:16:25.987066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:16:28.707718Z","title":"CLIP4Clip: An empirical study of clip for end to end video clip retrieval and captioning,","venue":null,"work_id":"5a48590d-8800-45f2-a075-3bfc66a7715d","year":2022},"citing_paper":{"arxiv_id":"2608.04676","last_updated":"2026-08-05T10:39:19Z","snapshot_observed_at":"2026-08-09T21:48:13.774740Z","submitted_at":"2026-08-05T10:39:19Z","title":"SurgNarrator: A Generative Retrieval Framework for Surgical Video Understanding","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T19:16:26.082165Z"},"links":{"citing_paper":"/paper/2608.04676"},"observation_digest":"sha256:6e5a41965ed82b642c9e80968d73421473ec587ec58796477042f6052b201dfa","observation_id":"55965cee-6a75-4819-8797-15e394289e62","resolution":{"observed_at":"2026-08-06T19:16:28.710596Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:16:28.701784Z","title":"Videoclip: Contrastive pre-training for zero-shot video- text understanding,","venue":null,"work_id":"944b3bce-6b75-48b0-9be3-01af2666b8cc","year":2021},"citing_paper":{"arxiv_id":"2608.04676","last_updated":"2026-08-05T10:39:19Z","snapshot_observed_at":"2026-08-09T21:48:13.774740Z","submitted_at":"2026-08-05T10:39:19Z","title":"SurgNarrator: A Generative Retrieval Framework for Surgical Video Understanding","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T19:16:26.174873Z"},"links":{"citing_paper":"/paper/2608.04676"},"observation_digest":"sha256:fd0d03fb4b1a5c54cc899dbdfd9f59871c72277e7d271163c3ad8a07abe49a3e","observation_id":"f364efd4-dcda-48d1-8052-9d3a7cf9da90","resolution":{"observed_at":"2026-08-06T19:16:28.703886Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:16:28.695398Z","title":"Learning multi-modal representations by watching hundreds of surgical video lectures,","venue":null,"work_id":"541a25a3-2746-4b91-b512-23524535673c","year":2025},"citing_paper":{"arxiv_id":"2608.04676","last_updated":"2026-08-05T10:39:19Z","snapshot_observed_at":"2026-08-09T21:48:13.774740Z","submitted_at":"2026-08-05T10:39:19Z","title":"SurgNarrator: A Generative Retrieval Framework for Surgical Video Understanding","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T19:16:26.263924Z"},"links":{"citing_paper":"/paper/2608.04676"},"observation_digest":"sha256:af8e95d96c9b642d73f6b0b691856933be116fe241f736a3cd69f79f53c62ba8","observation_id":"678e7b22-dbdc-460f-8151-0502bae81eb3","resolution":{"observed_at":"2026-08-06T19:16:28.697979Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:16:28.689598Z","title":"Vlog: Video-language models by generative retrieval of narration vocabulary,","venue":null,"work_id":"569e5faa-6834-447f-969b-57672b1dcf45","year":2025},"citing_paper":{"arxiv_id":"2608.04676","last_updated":"2026-08-05T10:39:19Z","snapshot_observed_at":"2026-08-09T21:48:13.774740Z","submitted_at":"2026-08-05T10:39:19Z","title":"SurgNarrator: A Generative Retrieval Framework for Surgical Video Understanding","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T19:16:26.354455Z"},"links":{"citing_paper":"/paper/2608.04676"},"observation_digest":"sha256:7ae1de96060849fb56296b6ed7542263dcb53d1eb04c8d72633b3d0ea0301ec2","observation_id":"a5add67c-aa92-4f90-b6b1-92399f7b439c","resolution":{"observed_at":"2026-08-06T19:16:28.691703Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.04720","last_updated":"2026-01-19T09:03:26Z","snapshot_observed_at":"2026-07-06T22:41:05.793337Z","submitted_at":"2026-01-08T08:36:06Z","title":"Qwen3-VL-Embedding and Qwen3-VL-Reranker: A Unified Framework for State-of-the-Art Multimodal Retrieval and Ranking","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.04720","snapshot_observed_at":"2026-08-06T19:16:26.440798Z","title":"Qwen3-vl-embedding and qwen3-vl-reranker: A unified framework for state-of-the-art multimodal retrieval and ranking,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.04676","last_updated":"2026-08-05T10:39:19Z","snapshot_observed_at":"2026-08-09T21:48:13.774740Z","submitted_at":"2026-08-05T10:39:19Z","title":"SurgNarrator: A Generative Retrieval Framework for Surgical Video Understanding","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T19:16:26.440798Z"},"links":{"cited_paper":"/paper/2601.04720","citing_paper":"/paper/2608.04676"},"observation_digest":"sha256:0a9379d2892193d377c15afedfde6256a69eb42d5aa5d84e1aafa9111a31ad88","observation_id":"83c22e0a-81b8-4341-9a7e-9e8bcc2eafb4","resolution":{"observed_at":"2026-08-06T19:16:26.440798Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:16:28.683304Z","title":"Hecvl: Hierarchical video-language pretraining for zero-shot surgical phase recognition,","venue":null,"work_id":"ad4b1f8d-3eec-4fe0-847b-3517dd0fe6aa","year":2024},"citing_paper":{"arxiv_id":"2608.04676","last_updated":"2026-08-05T10:39:19Z","snapshot_observed_at":"2026-08-09T21:48:13.774740Z","submitted_at":"2026-08-05T10:39:19Z","title":"SurgNarrator: A Generative Retrieval Framework for Surgical Video Understanding","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T19:16:26.504571Z"},"links":{"citing_paper":"/paper/2608.04676"},"observation_digest":"sha256:a2c39a4caaeb1b65a588c8ebf518072cbe34203754daf84614079e4fe766d408","observation_id":"e6c5cad7-8718-40ae-b23f-c71074574ddf","resolution":{"observed_at":"2026-08-06T19:16:28.685821Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:16:28.676772Z","title":"VidLPRO: A video- language pre-training framework for robotic and laparoscopic surgery,","venue":null,"work_id":"bbb78d77-9d44-4cdd-b6b5-4aa90975c5fb","year":2024},"citing_paper":{"arxiv_id":"2608.04676","last_updated":"2026-08-05T10:39:19Z","snapshot_observed_at":"2026-08-09T21:48:13.774740Z","submitted_at":"2026-08-05T10:39:19Z","title":"SurgNarrator: A Generative Retrieval Framework for Surgical Video Understanding","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T19:16:26.506875Z"},"links":{"citing_paper":"/paper/2608.04676"},"observation_digest":"sha256:906cae7e9cbea70a4484c6be4c89a6b2e2ded7360c179aa195f1616ae7cdff4c","observation_id":"30338680-b9a3-40d9-afa3-4e1b04ab7f25","resolution":{"observed_at":"2026-08-06T19:16:28.679173Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:16:28.670480Z","title":"Ophclip: Hierarchical retrieval-augmented learning for ophthalmic surgical video-language pretraining,","venue":null,"work_id":"f6e92549-ef81-4d6c-ba9a-6f102650f345","year":2025},"citing_paper":{"arxiv_id":"2608.04676","last_updated":"2026-08-05T10:39:19Z","snapshot_observed_at":"2026-08-09T21:48:13.774740Z","submitted_at":"2026-08-05T10:39:19Z","title":"SurgNarrator: A Generative Retrieval Framework for Surgical Video Understanding","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T19:16:26.591016Z"},"links":{"citing_paper":"/paper/2608.04676"},"observation_digest":"sha256:3ce600368f8e058500f2dcd686c0c28e2c29c87242e91087226cf12adaa11f8b","observation_id":"f241a707-0f1d-4b9d-9872-464bee5cd332","resolution":{"observed_at":"2026-08-06T19:16:28.672963Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:16:28.664235Z","title":"Procedure-aware surgical video-language pretraining with hierarchical knowledge aug- mentation,","venue":null,"work_id":"254a6761-e222-470c-aedc-76879bfbf912","year":2024},"citing_paper":{"arxiv_id":"2608.04676","last_updated":"2026-08-05T10:39:19Z","snapshot_observed_at":"2026-08-09T21:48:13.774740Z","submitted_at":"2026-08-05T10:39:19Z","title":"SurgNarrator: A Generative Retrieval Framework for Surgical Video Understanding","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T19:16:26.797955Z"},"links":{"citing_paper":"/paper/2608.04676"},"observation_digest":"sha256:4d637d893cf49a3df833747da75b29549bbd6cc7eae440f308fdd8898811dc6a","observation_id":"b0841ad2-a419-4b53-b770-5e06c230fb1f","resolution":{"observed_at":"2026-08-06T19:16:28.666604Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2603.24539","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:16:28.551418Z","title":"CliPPER: Contextual video-language pretraining on long-form intraoperative surgical proce- dures for event recognition,","venue":null,"work_id":"dee75a7a-29ce-4a29-bf1b-de17ab411b5d","year":2026},"citing_paper":{"arxiv_id":"2608.04676","last_updated":"2026-08-05T10:39:19Z","snapshot_observed_at":"2026-08-09T21:48:13.774740Z","submitted_at":"2026-08-05T10:39:19Z","title":"SurgNarrator: A Generative Retrieval Framework for Surgical Video Understanding","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T19:16:26.937748Z"},"links":{"citing_paper":"/paper/2608.04676"},"observation_digest":"sha256:2978e11ca1491d563aaecd86669014715e8e6546c4df61de23ec4012b540153e","observation_id":"cc429aa6-3d98-4253-925e-74242c1fe57c","resolution":{"observed_at":"2026-08-06T19:16:28.556184Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:16:28.658001Z","title":"SurgicalGPT: end- to-end language-vision gpt for visual question answering in surgery,","venue":null,"work_id":"b1200e6b-eac6-4dce-88f6-3d806063b761","year":2023},"citing_paper":{"arxiv_id":"2608.04676","last_updated":"2026-08-05T10:39:19Z","snapshot_observed_at":"2026-08-09T21:48:13.774740Z","submitted_at":"2026-08-05T10:39:19Z","title":"SurgNarrator: A Generative Retrieval Framework for Surgical Video Understanding","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T19:16:27.038306Z"},"links":{"citing_paper":"/paper/2608.04676"},"observation_digest":"sha256:f3214a4cdfc99dcc2f3a8a5b19ecd800909b6bc60224575e1d0e09c54c4c236e","observation_id":"b8139039-f99a-4380-bff2-cec957b4f141","resolution":{"observed_at":"2026-08-06T19:16:28.660351Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.19305","last_updated":"2024-08-06T21:07:17Z","snapshot_observed_at":"2026-07-06T18:52:51.827101Z","submitted_at":"2024-07-27T17:27:05Z","title":"GP-VLS: A general-purpose vision language model for surgery","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.19305","snapshot_observed_at":"2026-08-06T19:16:27.129903Z","title":"Gp-vls: A general-purpose vision language model for surgery,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.04676","last_updated":"2026-08-05T10:39:19Z","snapshot_observed_at":"2026-08-09T21:48:13.774740Z","submitted_at":"2026-08-05T10:39:19Z","title":"SurgNarrator: A Generative Retrieval Framework for Surgical Video Understanding","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T19:16:27.129903Z"},"links":{"cited_paper":"/paper/2407.19305","citing_paper":"/paper/2608.04676"},"observation_digest":"sha256:bcdc36cd318ef9d8d5d544456e3c0346696b6f2e99ad5ab4153a1356c26a1ba0","observation_id":"e4fb52d0-fdf1-4ebc-a638-fdb81087c740","resolution":{"observed_at":"2026-08-06T19:16:27.129903Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.10937","last_updated":"2024-11-17T02:23:45Z","snapshot_observed_at":"2026-07-06T19:51:28.494860Z","submitted_at":"2024-11-17T02:23:45Z","title":"Memory-Augmented Multimodal LLMs for Surgical VQA via Self-Contained Inquiry","version":1},"cited_work":{"arxiv_id":"2411.10937","doi":null,"metadata_source":"pith","pith_arxiv_id":"2411.10937","snapshot_observed_at":"2026-08-06T19:16:28.472795Z","title":"Memory-Augmented Multimodal LLMs for Surgical VQA via Self-Contained Inquiry","venue":"cs.CV","work_id":"3676b2f2-3b59-450e-b730-c8e0531d68e0","year":2024},"citing_paper":{"arxiv_id":"2608.04676","last_updated":"2026-08-05T10:39:19Z","snapshot_observed_at":"2026-08-09T21:48:13.774740Z","submitted_at":"2026-08-05T10:39:19Z","title":"SurgNarrator: A Generative Retrieval Framework for Surgical Video Understanding","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T19:16:27.265067Z"},"links":{"cited_paper":"/paper/2411.10937","citing_paper":"/paper/2608.04676"},"observation_digest":"sha256:2c268598017cf81f99239818dd86a96894a3f449c631175daad3edbd4aac87ef","observation_id":"bd189acf-cf1d-4fdb-ab37-cc9b89e35f58","resolution":{"observed_at":"2026-08-06T19:16:28.475802Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:16:28.651271Z","title":"EndoChat: Grounded multimodal large language model for endoscopic surgery,","venue":null,"work_id":"862a08b9-2b11-4f29-978e-89590bfb434d","year":2026},"citing_paper":{"arxiv_id":"2608.04676","last_updated":"2026-08-05T10:39:19Z","snapshot_observed_at":"2026-08-09T21:48:13.774740Z","submitted_at":"2026-08-05T10:39:19Z","title":"SurgNarrator: A Generative Retrieval Framework for Surgical Video Understanding","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T19:16:27.337137Z"},"links":{"citing_paper":"/paper/2608.04676"},"observation_digest":"sha256:0250153dd3c0ad62bf43d00cf8b4203d99cade0c104215f047b1eb7cd48a9ff8","observation_id":"25cad293-13f7-4f4a-929a-d4e4fedb56c3","resolution":{"observed_at":"2026-08-06T19:16:28.653506Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.10948","last_updated":"2025-03-16T02:23:30Z","snapshot_observed_at":"2026-08-09T09:12:41.622780Z","submitted_at":"2024-03-22T08:38:27Z","title":"Surgical-LVLM: Learning to Adapt Large Vision-Language Model for Grounded Visual Question Answering in Robotic Surgery","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.10948","snapshot_observed_at":"2026-08-06T19:16:27.414832Z","title":"Surgical-lvlm: Learning to adapt large vision-language model for grounded visual question answering in robotic surgery,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.04676","last_updated":"2026-08-05T10:39:19Z","snapshot_observed_at":"2026-08-09T21:48:13.774740Z","submitted_at":"2026-08-05T10:39:19Z","title":"SurgNarrator: A Generative Retrieval Framework for Surgical Video Understanding","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T19:16:27.414832Z"},"links":{"cited_paper":"/paper/2405.10948","citing_paper":"/paper/2608.04676"},"observation_digest":"sha256:f475bea6a4caaa3a581e7e62dab4fae74e1b144226dc97b56490724d51c7db12","observation_id":"97e91f6d-a28e-40df-940a-9e7de7b00205","resolution":{"observed_at":"2026-08-06T19:16:27.414832Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:16:27.535919Z","title":"Surgvidlm: Towards multi-grained surgical video under- standing with large language model,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.04676","last_updated":"2026-08-05T10:39:19Z","snapshot_observed_at":"2026-08-09T21:48:13.774740Z","submitted_at":"2026-08-05T10:39:19Z","title":"SurgNarrator: A Generative Retrieval Framework for Surgical Video Understanding","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T19:16:27.535919Z"},"links":{"citing_paper":"/paper/2608.04676"},"observation_digest":"sha256:d3a310e7856cb9f181bd05db85c886f04e250d152802efb47cafa522fb57a0b3","observation_id":"68526609-2a4f-4096-95e0-a7b957c3d626","resolution":{"observed_at":"2026-08-06T19:16:27.535919Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.02555","last_updated":"2025-06-03T07:44:41Z","snapshot_observed_at":"2026-08-07T11:19:24.597547Z","submitted_at":"2025-06-03T07:44:41Z","title":"SurgVLM: A Large Vision-Language Model and Systematic Evaluation Benchmark for Surgical Intelligence","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.02555","snapshot_observed_at":"2026-08-06T19:16:27.620334Z","title":"SurgVLM: A large vision-language model and sys- tematic evaluation benchmark for surgical intelligence,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.04676","last_updated":"2026-08-05T10:39:19Z","snapshot_observed_at":"2026-08-09T21:48:13.774740Z","submitted_at":"2026-08-05T10:39:19Z","title":"SurgNarrator: A Generative Retrieval Framework for Surgical Video Understanding","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T19:16:27.620334Z"},"links":{"cited_paper":"/paper/2506.02555","citing_paper":"/paper/2608.04676"},"observation_digest":"sha256:617fe8f29d09d308ec6444b88b537ec99960f2338f13c46296fd31f2a30b8149","observation_id":"4b4d878f-5b6e-40f6-9069-78358e2fbd1e","resolution":{"observed_at":"2026-08-06T19:16:27.620334Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1609/aaai.v40i8.37593","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:16:28.234732Z","title":"Surgpub-video: A comprehensive surgical video framework for enhanced surgical intelligence in vision-language model,","venue":null,"work_id":"50ba88ae-91b5-491e-bdbc-e5e685973f2c","year":2026},"citing_paper":{"arxiv_id":"2608.04676","last_updated":"2026-08-05T10:39:19Z","snapshot_observed_at":"2026-08-09T21:48:13.774740Z","submitted_at":"2026-08-05T10:39:19Z","title":"SurgNarrator: A Generative Retrieval Framework for Surgical Video Understanding","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T19:16:27.723320Z"},"links":{"citing_paper":"/paper/2608.04676"},"observation_digest":"sha256:670b577600f06fe14abe8ac54e734f715e8863cfcd8f34b6476bebad12b70cd6","observation_id":"f7204c1d-c779-4cc2-ba9c-a5cf20e0314b","resolution":{"observed_at":"2026-08-06T19:16:28.239550Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:16:27.831023Z","title":"Sureon: A benchmark and vision-language-model for surgical reasoning,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.04676","last_updated":"2026-08-05T10:39:19Z","snapshot_observed_at":"2026-08-09T21:48:13.774740Z","submitted_at":"2026-08-05T10:39:19Z","title":"SurgNarrator: A Generative Retrieval Framework for Surgical Video Understanding","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T19:16:27.831023Z"},"links":{"citing_paper":"/paper/2608.04676"},"observation_digest":"sha256:398fc9d7cdba776954552867cab52e29c9eb59805768129dd5911fc895c15185","observation_id":"cd8fd1d4-7706-4e4f-a773-c260d65f8dee","resolution":{"observed_at":"2026-08-06T19:16:27.831023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2603.12430","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:16:28.343808Z","title":"Surg-r1: A hierarchical reasoning foundation model for scalable and interpretable surgical decision support with multi-center clinical validation,","venue":null,"work_id":"01cea894-8a78-48cc-83cc-1e60df1ac093","year":2026},"citing_paper":{"arxiv_id":"2608.04676","last_updated":"2026-08-05T10:39:19Z","snapshot_observed_at":"2026-08-09T21:48:13.774740Z","submitted_at":"2026-08-05T10:39:19Z","title":"SurgNarrator: A Generative Retrieval Framework for Surgical Video Understanding","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T19:16:27.941624Z"},"links":{"citing_paper":"/paper/2608.04676"},"observation_digest":"sha256:0305ebd558a59de22496450184cb28b372acb732ba12b07a89e320a615d1e6ba","observation_id":"136d9212-341b-42ae-b7e9-e6d1426ddd5f","resolution":{"observed_at":"2026-08-06T19:16:28.347473Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:16:28.644724Z","title":"SurgLaVi: Large-scale hierarchical dataset for surgical vision- language representation learning,","venue":null,"work_id":"669f9a7d-e0af-407f-957c-eb52a5ba390d","year":2026},"citing_paper":{"arxiv_id":"2608.04676","last_updated":"2026-08-05T10:39:19Z","snapshot_observed_at":"2026-08-09T21:48:13.774740Z","submitted_at":"2026-08-05T10:39:19Z","title":"SurgNarrator: A Generative Retrieval Framework for Surgical Video Understanding","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T19:16:28.056780Z"},"links":{"citing_paper":"/paper/2608.04676"},"observation_digest":"sha256:d4f9f443d52fea9021f6b30f70941b03a3d932240e025902f40c6adb4e19a185","observation_id":"717923d7-f2fd-49db-bd05-ee8ae58b03c5","resolution":{"observed_at":"2026-08-06T19:16:28.646970Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1807.03748","last_updated":"2019-01-22T18:47:12Z","snapshot_observed_at":"2026-07-06T06:49:24.960992Z","submitted_at":"2018-07-10T16:52:11Z","title":"Representation Learning with Contrastive Predictive Coding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1807.03748","snapshot_observed_at":"2026-08-06T19:16:28.136172Z","title":"Representation learning with contrastive predictive coding,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2608.04676","last_updated":"2026-08-05T10:39:19Z","snapshot_observed_at":"2026-08-09T21:48:13.774740Z","submitted_at":"2026-08-05T10:39:19Z","title":"SurgNarrator: A Generative Retrieval Framework for Surgical Video Understanding","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T19:16:28.136172Z"},"links":{"cited_paper":"/paper/1807.03748","citing_paper":"/paper/2608.04676"},"observation_digest":"sha256:1233adfdc7813597d3cce7eae9a549475b0103dc4d435be9b8b589bab72bee06","observation_id":"64f43822-adb9-414e-b736-cf31fc894656","resolution":{"observed_at":"2026-08-06T19:16:28.136172Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-07-06T22:37:03.716474Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-08-06T19:16:28.181923Z","title":"Qwen3-vl technical report,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.04676","last_updated":"2026-08-05T10:39:19Z","snapshot_observed_at":"2026-08-09T21:48:13.774740Z","submitted_at":"2026-08-05T10:39:19Z","title":"SurgNarrator: A Generative Retrieval Framework for Surgical Video Understanding","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T19:16:28.181923Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2608.04676"},"observation_digest":"sha256:f2103c8cb58237ab474da64fe93a7a66bdad86d64f09a876019119ea3a1a2a06","observation_id":"67698e45-8dc5-44e4-973a-7a4c64569730","resolution":{"observed_at":"2026-08-06T19:16:28.181923Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:16:28.637105Z","title":"Autolaparo: A new dataset of integrated multi-tasks for image-guided surgical automation in laparoscopic hysterectomy,","venue":null,"work_id":"643e4498-73f3-4027-abfb-cbe70a9f80b0","year":2022},"citing_paper":{"arxiv_id":"2608.04676","last_updated":"2026-08-05T10:39:19Z","snapshot_observed_at":"2026-08-09T21:48:13.774740Z","submitted_at":"2026-08-05T10:39:19Z","title":"SurgNarrator: A Generative Retrieval Framework for Surgical Video Understanding","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T19:16:28.185229Z"},"links":{"citing_paper":"/paper/2608.04676"},"observation_digest":"sha256:d6e223013cc80e4f6ca36fffb48c5d409de2708b5b2d064a61535f1f21845bf4","observation_id":"93967ebe-14a0-4614-8b5a-0ed0f80be464","resolution":{"observed_at":"2026-08-06T19:16:28.639969Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:16:28.630219Z","title":"Challenges in multi-centric generalization: phase and step recognition in roux-en-y gastric bypass surgery,","venue":null,"work_id":"9d38f1e1-a1ec-49f9-b296-17527464cb52","year":2024},"citing_paper":{"arxiv_id":"2608.04676","last_updated":"2026-08-05T10:39:19Z","snapshot_observed_at":"2026-08-09T21:48:13.774740Z","submitted_at":"2026-08-05T10:39:19Z","title":"SurgNarrator: A Generative Retrieval Framework for Surgical Video Understanding","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T19:16:28.191132Z"},"links":{"citing_paper":"/paper/2608.04676"},"observation_digest":"sha256:e43b0e46814b6fef8e5fe2c75db16a96c0d37ceaa6c090a9ece339e212ff5143","observation_id":"b1e46ec6-ce0e-4deb-8194-09af8456b6d3","resolution":{"observed_at":"2026-08-06T19:16:28.632595Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:16:28.623736Z","title":"Comparative validation of machine learning al- gorithms for surgical workflow and skill analysis with the heichole benchmark,","venue":null,"work_id":"f68b04b1-a7ed-4b47-a68f-1cab7cfd2d35","year":2023},"citing_paper":{"arxiv_id":"2608.04676","last_updated":"2026-08-05T10:39:19Z","snapshot_observed_at":"2026-08-09T21:48:13.774740Z","submitted_at":"2026-08-05T10:39:19Z","title":"SurgNarrator: A Generative Retrieval Framework for Surgical Video Understanding","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T19:16:28.193433Z"},"links":{"citing_paper":"/paper/2608.04676"},"observation_digest":"sha256:10f1dc8422d2558910bd20562ed4a07d09d7ef3ecc9cfeec4f8fdf6b694dc743","observation_id":"b79c36b0-48c3-4a08-9932-71a9f342d03b","resolution":{"observed_at":"2026-08-06T19:16:28.626158Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:16:28.616664Z","title":"Pixel-wise recognition for holistic surgical scene understanding,","venue":null,"work_id":"59cfa2e8-bda9-4ef1-bbbf-bb8d6424d44d","year":2025},"citing_paper":{"arxiv_id":"2608.04676","last_updated":"2026-08-05T10:39:19Z","snapshot_observed_at":"2026-08-09T21:48:13.774740Z","submitted_at":"2026-08-05T10:39:19Z","title":"SurgNarrator: A Generative Retrieval Framework for Surgical Video Understanding","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T19:16:28.196016Z"},"links":{"citing_paper":"/paper/2608.04676"},"observation_digest":"sha256:72d9e1e37ede1ed13a40659972a04cac308f92c898870ab972e3de2b0745a2d8","observation_id":"ff984555-5f78-400d-a0d0-7e9e5c778893","resolution":{"observed_at":"2026-08-06T19:16:28.619111Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.00496","last_updated":"2024-01-23T23:30:57Z","snapshot_observed_at":"2026-08-02T18:08:38.646548Z","submitted_at":"2023-12-31T13:32:18Z","title":"SAR-RARP50: Segmentation of surgical instrumentation and Action Recognition on Robot-Assisted Radical Prostatectomy Challenge","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.00496","snapshot_observed_at":"2026-08-06T19:16:28.199513Z","title":"Sar-rarp50: Segmentation of surgical instrumen- tation and action recognition on robot-assisted radical prostatectomy challenge,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.04676","last_updated":"2026-08-05T10:39:19Z","snapshot_observed_at":"2026-08-09T21:48:13.774740Z","submitted_at":"2026-08-05T10:39:19Z","title":"SurgNarrator: A Generative Retrieval Framework for Surgical Video Understanding","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T19:16:28.199513Z"},"links":{"cited_paper":"/paper/2401.00496","citing_paper":"/paper/2608.04676"},"observation_digest":"sha256:9146d5fcc434d92a13dbba774c0ba2db0f8550e0bc69c4d3385d93a9dde8d6e5","observation_id":"6ca237a7-78f1-44cf-87e6-c3b3f1f344f6","resolution":{"observed_at":"2026-08-06T19:16:28.199513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:16:28.609876Z","title":"Rendezvous: Attention mechanisms for the recogni- tion of surgical action triplets in endoscopic videos,","venue":null,"work_id":"7682e325-7fd6-4a55-b96a-35e0019e718f","year":2022},"citing_paper":{"arxiv_id":"2608.04676","last_updated":"2026-08-05T10:39:19Z","snapshot_observed_at":"2026-08-09T21:48:13.774740Z","submitted_at":"2026-08-05T10:39:19Z","title":"SurgNarrator: A Generative Retrieval Framework for Surgical Video Understanding","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T19:16:28.202488Z"},"links":{"citing_paper":"/paper/2608.04676"},"observation_digest":"sha256:e3ed63c8821f1818cb93ad665cde3b02689e8da27baa1a10622bb0d161a669d5","observation_id":"27cdd0c9-01f6-4873-9ec9-7783751a0f4c","resolution":{"observed_at":"2026-08-06T19:16:28.612150Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:16:28.603248Z","title":"CIDEr: Consensus-based image description evaluation,","venue":null,"work_id":"ff115048-0a96-451a-aabe-48d8eaf5df52","year":2015},"citing_paper":{"arxiv_id":"2608.04676","last_updated":"2026-08-05T10:39:19Z","snapshot_observed_at":"2026-08-09T21:48:13.774740Z","submitted_at":"2026-08-05T10:39:19Z","title":"SurgNarrator: A Generative Retrieval Framework for Surgical Video Understanding","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T19:16:28.205281Z"},"links":{"citing_paper":"/paper/2608.04676"},"observation_digest":"sha256:b70d9888e409542d712e832d3b2cedb431d0dc46d5733136981cdd4976f8d11a","observation_id":"46544c62-d490-4df8-884a-4f613dd23d3b","resolution":{"observed_at":"2026-08-06T19:16:28.605647Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:16:28.207980Z","title":"Sentence-bert: Sentence embeddings using siamese bert-networks,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2608.04676","last_updated":"2026-08-05T10:39:19Z","snapshot_observed_at":"2026-08-09T21:48:13.774740Z","submitted_at":"2026-08-05T10:39:19Z","title":"SurgNarrator: A Generative Retrieval Framework for Surgical Video Understanding","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T19:16:28.207980Z"},"links":{"citing_paper":"/paper/2608.04676"},"observation_digest":"sha256:c85c05e0c36684478cda68717c2af7d60bd3d9fb6ca8cdf76d6a9584f36b4d46","observation_id":"d4c3ef60-b9a1-4573-9b85-b53e87324f25","resolution":{"observed_at":"2026-08-06T19:16:28.207980Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:16:28.592150Z","title":"LoRA: Low-rank adaptation of large language models,","venue":null,"work_id":"e36b7180-1207-4485-ac4d-44734162b38a","year":2022},"citing_paper":{"arxiv_id":"2608.04676","last_updated":"2026-08-05T10:39:19Z","snapshot_observed_at":"2026-08-09T21:48:13.774740Z","submitted_at":"2026-08-05T10:39:19Z","title":"SurgNarrator: A Generative Retrieval Framework for Surgical Video Understanding","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T19:16:28.210797Z"},"links":{"citing_paper":"/paper/2608.04676"},"observation_digest":"sha256:0c874807d823d0d435f5380e28c8677a338744d6ea27e30971eb892834a09859","observation_id":"937cf28d-4ff9-4f05-b553-b478803defb8","resolution":{"observed_at":"2026-08-06T19:16:28.594685Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:16:28.585128Z","title":"Learning transferable visual models from natural language supervision,","venue":null,"work_id":"5570765f-a304-49d4-9a1c-8a2c6a603992","year":2021},"citing_paper":{"arxiv_id":"2608.04676","last_updated":"2026-08-05T10:39:19Z","snapshot_observed_at":"2026-08-09T21:48:13.774740Z","submitted_at":"2026-08-05T10:39:19Z","title":"SurgNarrator: A Generative Retrieval Framework for Surgical Video Understanding","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T19:16:28.213522Z"},"links":{"citing_paper":"/paper/2608.04676"},"observation_digest":"sha256:8bef21df6675e3758610b0ae3f203d01bb34680ec2dd5d1ba97175e0e0a1212e","observation_id":"44fe6688-14bf-4106-b5b3-fb87ab1e301e","resolution":{"observed_at":"2026-08-06T19:16:28.587582Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.05201","last_updated":"2026-04-06T19:50:20Z","snapshot_observed_at":"2026-08-07T23:53:34.814339Z","submitted_at":"2025-07-07T17:01:44Z","title":"MedGemma Technical Report","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.05201","snapshot_observed_at":"2026-08-06T19:16:28.215749Z","title":"Medgemma technical report,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.04676","last_updated":"2026-08-05T10:39:19Z","snapshot_observed_at":"2026-08-09T21:48:13.774740Z","submitted_at":"2026-08-05T10:39:19Z","title":"SurgNarrator: A Generative Retrieval Framework for Surgical Video Understanding","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T19:16:28.215749Z"},"links":{"cited_paper":"/paper/2507.05201","citing_paper":"/paper/2608.04676"},"observation_digest":"sha256:ad95a088af4b7dd2f006434acc43d249df971f6dd334c84ea4089f83ce61fc58","observation_id":"23f2984b-7346-4bdc-92e2-3373a7839a26","resolution":{"observed_at":"2026-08-06T19:16:28.215749Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:16:25.272918Z","title":"Available: http://dx.doi.org/10.1038/s41551-017-0132-7","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.04676","last_updated":"2026-08-05T10:39:19Z","snapshot_observed_at":"2026-08-09T21:48:13.774740Z","submitted_at":"2026-08-05T10:39:19Z","title":"SurgNarrator: A Generative Retrieval Framework for Surgical Video Understanding","version":1},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-06T19:16:25.272918Z"},"links":{"citing_paper":"/paper/2608.04676"},"observation_digest":"sha256:c333b2db6bafceb5b64b52fcf95b559cd57aa7ceeac02445dd957597557a4791","observation_id":"c93ee9ae-d304-4127-81a1-1d8aa01e140e","resolution":{"observed_at":"2026-08-06T19:16:25.272918Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.04676","last_updated":"2026-08-05T10:39:19Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-09T21:48:13.774740Z","submitted_at":"2026-08-05T10:39:19Z","title":"SurgNarrator: A Generative Retrieval Framework for Surgical Video Understanding"},"reference_resolution":{"displayed":45,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":16,"verified_exact":4,"verified_fuzzy":25},"total_outbound_references":45},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 45 of 45 outbound references and 0 inbound Pith citation observations for arXiv:2608.04676."}